{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T02:45:32Z","timestamp":1782355532500,"version":"3.54.5"},"reference-count":78,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"4","license":[{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Program of China under STI 2030\u2014Major Projects","award":["2021ZD0200300"],"award-info":[{"award-number":["2021ZD0200300"]}]},{"name":"National Key Research and Development Program of China","award":["2024YDLN0006"],"award-info":[{"award-number":["2024YDLN0006"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["62176133"],"award-info":[{"award-number":["62176133"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Tsinghua-Meituan Joint Institute for Digital Life","award":["C0210322000380"],"award-info":[{"award-number":["C0210322000380"]}]},{"name":"Tsinghua-Fuzhou Data Technology Joint Research Institute","award":["JIDT2024013"],"award-info":[{"award-number":["JIDT2024013"]}]},{"DOI":"10.13039\/100005144","name":"Qualcomm Technologies, Inc.","doi-asserted-by":"crossref","award":["TSI-617560"],"award-info":[{"award-number":["TSI-617560"]}],"id":[{"id":"10.13039\/100005144","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Zhongguancun Academy, Beijing, China"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Neural Netw. Learning Syst."],"published-print":{"date-parts":[[2026,4]]},"DOI":"10.1109\/tnnls.2025.3626567","type":"journal-article","created":{"date-parts":[[2025,12,4]],"date-time":"2025-12-04T18:38:05Z","timestamp":1764873485000},"page":"1919-1933","source":"Crossref","is-referenced-by-count":2,"title":["Chain-of-Detection: Enhancing Cross-Granularity Robotic Perception for Object Manipulation"],"prefix":"10.1109","volume":"37","author":[{"given":"Tianrun","family":"Xu","sequence":"first","affiliation":[{"name":"Department of Automation, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haichuan","family":"Gao","sequence":"additional","affiliation":[{"name":"Beijing QianJue Technology Company Ltd., Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Changlin","family":"Chen","sequence":"additional","affiliation":[{"name":"Department of Precision Machinery and Precision Instrumentation, Institute of Humanoid Robots, University of Science and Technology of China, Hefei, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuxuan","family":"Li","sequence":"additional","affiliation":[{"name":"Department of Automation, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9076-1695","authenticated-orcid":false,"given":"Shiyuan","family":"Xu","sequence":"additional","affiliation":[{"name":"School of Computing and Data Science, The University of Hong Kong, Pokfulam, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3181-6881","authenticated-orcid":false,"given":"Shangqi","family":"Guo","sequence":"additional","affiliation":[{"name":"Department of Precision Instruments, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4813-2494","authenticated-orcid":false,"given":"Feng","family":"Chen","sequence":"additional","affiliation":[{"name":"Department of Automation, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.2000.844081"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2023.110491"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2023.3243474"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1126\/science.aat8414"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1016\/j.arcontrol.2020.02.002"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1146\/annurev-control-060117-104848"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/s00138-024-01651-y"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.6028\/nist.ir.8022"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1016\/j.rcim.2015.04.002"},{"key":"ref10","first-page":"12888","article-title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref11","first-page":"19730","article-title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref12","first-page":"1","article-title":"Scaling open-vocabulary object detection","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Minderer"},{"key":"ref13","article-title":"F-VLM: Open-vocabulary object detection upon frozen vision and language models","author":"Kuo","year":"2022","journal-title":"arXiv:2209.15639"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1723"},{"key":"ref15","article-title":"RT-2: Vision-language-action models transfer Web knowledge to robotic control","author":"Brohan","year":"2023","journal-title":"arXiv:2307.15818"},{"key":"ref16","article-title":"VoxPoser: Composable 3D value maps for robotic manipulation with language models","author":"Huang","year":"2023","journal-title":"arXiv:2307.05973"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01146"},{"key":"ref18","article-title":"OK-robot: What really matters in integrating open-knowledge models for robotics","author":"Liu","year":"2024","journal-title":"arXiv:2401.12202"},{"key":"ref19","article-title":"MOKA: Open-world robotic manipulation through mark-based visual prompting","author":"Liu","year":"2024","journal-title":"arXiv:2403.03174"},{"key":"ref20","article-title":"RoboMamba: Efficient vision-language-action model for robotic reasoning and manipulation","author":"Liu","year":"2024","journal-title":"arXiv:2406.04339"},{"key":"ref21","article-title":"Vision-language foundation models as effective robot imitators","author":"Li","year":"2023","journal-title":"arXiv:2311.01378"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1007\/BF01664755"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-10-8597-0_25"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.3389\/frobt.2021.696587"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3511936"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/IRDS.2002.1041405"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1016\/j.robot.2018.04.003"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.3390\/robotics8030079"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/s43154-020-00021-6"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48506.2021.9560901"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1108\/AA-11-2020-0170"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1177\/0278364917735594"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487342"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2019.8794435"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2018.XIV.021"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2023.3281153"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48506.2021.9561877"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00459"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1177\/0278364918815757"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1002\/rob.22468"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10610211"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3330011"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2024.3419180"},{"key":"ref44","article-title":"Lan-grasp: Using large language models for semantic object grasping","author":"Mirjalili","year":"2023","journal-title":"arXiv:2310.05239"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/IROS55552.2023.10342268"},{"key":"ref46","article-title":"HomeRobot: Open-vocabulary mobile manipulation","author":"Yenamandra","year":"2023","journal-title":"arXiv:2306.11565"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2024.3477095"},{"key":"ref48","article-title":"RDT-1B: A diffusion foundation model for bimanual manipulation","author":"Liu","year":"2024","journal-title":"arXiv:2410.07864"},{"key":"ref49","article-title":"OpenVLA: An open-source vision-language-action model","author":"Jin Kim","year":"2024","journal-title":"arXiv:2406.09246"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01710"},{"key":"ref51","article-title":"GR00T n1: An open foundation model for generalist humanoid robots","author":"Bjorck","year":"2025","journal-title":"arXiv:2503.14734"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01629"},{"key":"ref53","article-title":"Open-vocabulary object detection via vision and language knowledge distillation","author":"Gu","year":"2021","journal-title":"arXiv:2104.13921"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01069"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01464"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i6.28428"},{"key":"ref57","article-title":"DST-Det: Simple dynamic self-training for open-vocabulary object detection","author":"Xu","year":"2023","journal-title":"arXiv:2310.01393"},{"key":"ref58","article-title":"LLMs meet VLMs: Boost open vocabulary object detection with fine-grained descriptors","author":"Jin","year":"2024","journal-title":"arXiv:2402.04630"},{"key":"ref59","first-page":"1","article-title":"CoDet: Co-occurrence guided region-word alignment for open-vocabulary object detection","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ma"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02250"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01586"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3293484"},{"key":"ref63","article-title":"Diffusion models for open-vocabulary segmentation","author":"Karazija","year":"2023","journal-title":"arXiv:2306.09316"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01816"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00692"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01339"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01324"},{"key":"ref68","article-title":"Deformable DETR: Deformable transformers for end-to-end object detection","author":"Zhu","year":"2020","journal-title":"arXiv:2010.04159"},{"key":"ref69","article-title":"Three ways to improve feature alignment for open vocabulary detection","author":"Arandjelovi\u0107","year":"2023","journal-title":"arXiv:2303.13518"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01574"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02586"},{"key":"ref72","article-title":"Qwen-VL: A frontier large vision-language model with versatile abilities","author":"Bai","year":"2023","journal-title":"arXiv:2308.12966"},{"key":"ref73","article-title":"Qwen2-VL: Enhancing vision-language model\u2019s perception of the world at any resolution","author":"Wang","year":"2024","journal-title":"arXiv:2409.12191"},{"key":"ref74","article-title":"Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond","author":"Bai","year":"2023","journal-title":"arXiv:2308.12966"},{"key":"ref75","article-title":"NVIDIA ISAAC and robot operating system 2: Integrating ros2 with ISAAC sim for robot navigation","author":"Katainen","year":"2023"},{"key":"ref76","article-title":"OV-DINO: Unified open-vocabulary detection with language-aware selective fusion","author":"Wang","year":"2024","journal-title":"arXiv:2407.07844"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1007\/BF00991005"}],"container-title":["IEEE Transactions on Neural Networks and Learning Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/5962385\/11475606\/11277333.pdf?arnumber=11277333","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,7]],"date-time":"2026-04-07T20:00:53Z","timestamp":1775592053000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11277333\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4]]},"references-count":78,"journal-issue":{"issue":"4"},"URL":"https:\/\/doi.org\/10.1109\/tnnls.2025.3626567","relation":{},"ISSN":["2162-237X","2162-2388"],"issn-type":[{"value":"2162-237X","type":"print"},{"value":"2162-2388","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,4]]}}}