{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,4]],"date-time":"2026-05-04T03:31:34Z","timestamp":1777865494498,"version":"3.51.4"},"reference-count":90,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001666","name":"The National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U21B2042,62320106010"],"award-info":[{"award-number":["U21B2042,62320106010"]}],"id":[{"id":"10.13039\/501100001666","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.00866","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"9275-9286","source":"Crossref","is-referenced-by-count":0,"title":["Ross3d: Reconstructive Visual Instruction Tuning With 3D-Awareness"],"prefix":"10.1109","author":[{"given":"Haochen","family":"Wang","sequence":"first","affiliation":[{"name":"NLPR, MAIS, CASIA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yucheng","family":"Zhao","sequence":"additional","affiliation":[{"name":"Dexmal"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tiancai","family":"Wang","sequence":"additional","affiliation":[{"name":"Dexmal"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haoqiang","family":"Fan","sequence":"additional","affiliation":[{"name":"Dexmal"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiangyu","family":"Zhang","sequence":"additional","affiliation":[{"name":"MEGVII Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhaoxiang","family":"Zhang","sequence":"additional","affiliation":[{"name":"NLPR, MAIS, CASIA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","first-page":"40","article-title":"Learning representations and generative models for 3d point clouds","volume-title":"In International Conference on Machine Learning (ICML)","author":"Achlioptas"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58452-8_25"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.00375"},{"key":"ref4","year":"2024","journal-title":"Claude 3.5 sonnet"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01854"},{"key":"ref6","first-page":"65","article-title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","volume-title":"In Proceedings of the ACL workshop on intrinsic and extrinsic evaluation measures for machine translation and\/or summarization","author":"Banerjee"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2025.xxi.010"},{"key":"ref8","article-title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","author":"Brohan","year":"2023","journal-title":"arXiv preprint"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01597"},{"key":"ref10","first-page":"202","article-title":"Scanrefer: 3d object localization in rgb-d scans using natural language","volume-title":"In European Conference on Computer Vision (ECCV)","author":"Zhenyu Chen"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1492"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01070"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.02496"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3387838"},{"key":"ref15","first-page":"1597","article-title":"A simple framework for contrastive learning of visual representations","volume-title":"In International Conference on Machine Learning (ICML)","author":"Chen"},{"key":"ref16","article-title":"Grounded 3d-llm with referent tokens","author":"Chen","year":"2024","journal-title":"arXiv preprint"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00321"},{"key":"ref18","article-title":"Expanding performance boundaries of open-source multimodal models with model, data, and testtime scaling","author":"Chen","year":"2024","journal-title":"arXiv preprint"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00135"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.261"},{"key":"ref21","article-title":"Agent ai: Surveying the horizons of multimodal interaction","author":"Durante","year":"2024","journal-title":"arXiv preprint"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.52202\/068431-2605"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19824-3_14"},{"key":"ref24","article-title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","author":"Fu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01234-2_7"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1145\/3597613"},{"key":"ref27","year":"2024","journal-title":"Our next-generation model: Gemini 1.5"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01410"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"ref31","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume":"33","author":"Ho","year":"2020","journal-title":"Advances in Neural Information Processing Systems (NeurIPS)"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0900"},{"key":"ref33","article-title":"An embodied generalist agent in 3d world","author":"Huang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00647"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01508"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_24"},{"key":"ref37","article-title":"gradslam: Automagically differentiable slam","author":"Murthy Jatavallabhula","year":"2019","journal-title":"arXiv preprint"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.066"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01057"},{"key":"ref40","article-title":"Self-supervised modal and view invariant feature learning","author":"Jing","year":"2020","journal-title":"arXiv preprint"},{"key":"ref41","article-title":"Auto-encoding variational bayes","author":"Kingma","year":"2013","journal-title":"arXiv preprint"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref43","volume-title":"Labs. Flux","author":"Forest","year":"2024"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01930"},{"key":"ref45","article-title":"Llava-onevision: Easy visual task transfer","author":"Li","year":"2024","journal-title":"arXiv preprint"},{"key":"ref46","first-page":"19730","article-title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","volume-title":"In International Conference on Machine Learning (ICML)","author":"Li"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48891.2023.10160591"},{"key":"ref48","first-page":"74","article-title":"Rouge: A package for automatic evaluation of summaries","author":"Lin","year":"2004","journal-title":"In Text summarization branches out"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1516"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01596"},{"key":"ref51","article-title":"Sqa3d: Situated question answering in 3d scenes","volume-title":"In International Conference on Learning Representations (ICLR)","author":"Ma"},{"key":"ref52","article-title":"Perla: Perceptive 3d language assistant","author":"Mei","year":"2024","journal-title":"arXiv preprint"},{"key":"ref53","year":"2023","journal-title":"GPT-4V(ision) System Card"},{"key":"ref54","year":"2024","journal-title":"Hello GPT-4o"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20086-1_35"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"ref58","article-title":"Gpt4scene: Understand 3d scenes from videos with vision-language models","author":"Qi","year":"2025","journal-title":"arXiv preprint"},{"key":"ref59","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"In International Conference on Machine Learning (ICML)","author":"Radford"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58526-6_37"},{"key":"ref61","article-title":"Self-supervised deep learning on point clouds by reconstructing space","volume":"32","author":"Sauder","year":"2019","journal-title":"Advances in Neural Information Processing Systems (NeurIPS)"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48891.2023.10161317"},{"key":"ref63","year":"2024","journal-title":"InternVL2: Better than the Best-Expanding Performance Boundaries of Open-Source Multimodal Models with the Progressive Scaling Strategy"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.52202\/068431-0732"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"ref66","article-title":"Bootstrap masked visual modeling via hard patches mining","author":"Wang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2001"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01000"},{"key":"ref69","article-title":"Traceable evidence enhanced visual grounded reasoning: Evaluation and methodology","author":"Wang","year":"2025","journal-title":"arXiv preprint"},{"key":"ref70","article-title":"Reconstructive visual instruction tuning","volume-title":"In International Conference on Learning Representations (ICLR)","author":"Wang"},{"key":"ref71","article-title":"Vgr: Visual grounded reasoning","author":"Wang","year":"2025","journal-title":"arXiv preprint"},{"key":"ref72","article-title":"Qwen2-vl: Enhancing vision-language model\u2019s perception of the world at any resolution","author":"Wang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref73","article-title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes","author":"Wang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01426"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01843"},{"key":"ref76","article-title":"Deepseek-vl2: Mixture-ofexperts vision-language models for advanced multimodal understanding","author":"Wu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58580-8_34"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72698-9_8"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52734.2025.00994"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00029"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00187"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00837"},{"key":"ref83","article-title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","author":"Zhang","year":"2025","journal-title":"arXiv preprint"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01464"},{"key":"ref85","first-page":"15225","article-title":"Chang","volume-title":"Multi3drefer: Grounding text description to multiple 3d objects. In Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"Zhang"},{"key":"ref86","article-title":"Video instruction tuning with synthetic data","author":"Zhang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref87","first-page":"2928","article-title":"3dvgtransformer: Relation modeling for visual grounding on point clouds","volume-title":"In Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"Zhao"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52734.2025.00841"},{"key":"ref89","article-title":"Llava-3d: A simple yet effective pathway to empowering 1 mms with 3d-awareness","author":"Zhu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00272"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11446143.pdf?arnumber=11446143","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T06:42:07Z","timestamp":1777531327000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11446143\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":90,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.00866","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}