{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T03:25:33Z","timestamp":1783740333517,"version":"3.55.0"},"reference-count":105,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100004052","name":"King Abdullah University of Science and Technology (KAUST)","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004052","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.01963","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"21129-21143","source":"Crossref","is-referenced-by-count":1,"title":["4D-Bench: Benchmarking Multi-Modal Large Language Models for 4D Object Understanding"],"prefix":"10.1109","author":[{"given":"Wenxuan","family":"Zhu","sequence":"first","affiliation":[{"name":"King Abdullah University of Science and Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bing","family":"Li","sequence":"additional","affiliation":[{"name":"King Abdullah University of Science and Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Cheng","family":"Zheng","sequence":"additional","affiliation":[{"name":"King Abdullah University of Science and Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jinjie","family":"Mai","sequence":"additional","affiliation":[{"name":"King Abdullah University of Science and Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jun","family":"Chen","sequence":"additional","affiliation":[{"name":"King Abdullah University of Science and Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Letian","family":"Jiang","sequence":"additional","affiliation":[{"name":"King Abdullah University of Science and Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Abdullah","family":"Hamdi","sequence":"additional","affiliation":[{"name":"University of Oxford"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sara Rojas","family":"Martinez","sequence":"additional","affiliation":[{"name":"King Abdullah University of Science and Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chia-Wen","family":"Lin","sequence":"additional","affiliation":[{"name":"National Tsing Hua University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mohamed","family":"Elhoseiny","sequence":"additional","affiliation":[{"name":"King Abdullah University of Science and Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bernard","family":"Ghanem","sequence":"additional","affiliation":[{"name":"King Abdullah University of Science and Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","volume-title":"4d technology market size, share, growth report","year":"2025"},{"key":"ref2","volume-title":"3d digital asset market share, forecast","year":"2025"},{"key":"ref3","article-title":"Gpt-4 technical report","author":"Achiam","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00904"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1723"},{"key":"ref6","article-title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens","author":"Ataallah","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01854"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00764"},{"key":"ref9","first-page":"65","article-title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","volume-title":"Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and\/or summarization","author":"Banerjee","year":"2005"},{"key":"ref10","volume-title":"Autobench-v: Can large vision-language models benchmark themselves?","author":"Bao","year":"2024"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01937"},{"key":"ref12","article-title":"Llavidal: Benchmarking large language vision models for daily activities of living","author":"Chakraborty","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.52202\/079017-1684"},{"key":"ref14","article-title":"Collecting highly parallel data for paraphrase evaluation","volume-title":"Proceedings of the 49th Annual Meeting of the Association for Computational Linguistics (ACL-2011)","author":"Chen"},{"key":"ref15","article-title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","author":"Chen","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72643-9_22"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0614"},{"key":"ref18","article-title":"Microsoft coco captions: Data collection and evaluation server","author":"Chen","year":"2015","journal-title":"arxiv preprint arxiv"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73113-6_11"},{"key":"ref20","article-title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","author":"Chen","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2142"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1554"},{"key":"ref23","article-title":"Benchmarking and improving detail image caption","author":"Dong","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref24","article-title":"Towards event-oriented long video understanding","author":"Du","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref25","article-title":"The llama 3 herd of models","author":"Dubey","year":"2024","journal-title":"ArXiv"},{"key":"ref26","article-title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","author":"Fang","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref27","article-title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal 11 ms in video analysis","author":"Fu","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01842"},{"key":"ref29","article-title":"Imagebind-llm: Multi-modality instruction tuning","author":"Han","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref30","article-title":"T 3 bench: Benchmarking current progress in text-to-3d generation","author":"He","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref31","article-title":"3d-llm: Injecting the 3d world into large language models","author":"Hong","year":"2023","journal-title":"arXiv"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72673-6_16"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612551"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2501"},{"key":"ref35","article-title":"Vilma: A zero-shot benchmark for linguistic and temporal grounding in video-language models","author":"Kesen","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref36","article-title":"Compbench: A comparative reasoning benchmark for multimodal 11 ms","author":"Kil","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.83"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00227"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i2.20012"},{"key":"ref40","article-title":"Otterhd: A high-resolution multimodality model","author":"Li","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01263"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01263"},{"key":"ref43","article-title":"Llava-onevision: Easy visual task transfer","author":"Li","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref44","volume-title":"Vivid-zoo: Multi-view video generation with diffusion model","author":"Li","year":"2024"},{"key":"ref45","article-title":"A survey on benchmarks of multimodal large language models","author":"Li","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref46","first-page":"19730","article-title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","volume-title":"International conference on machine learning","author":"Li","year":"2023"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1007\/s11432-024-4321-9"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02095"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01247"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.20"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.52202\/079017-3519"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.00037"},{"key":"ref53","first-page":"74","article-title":"Rouge: A package for automatic evaluation of summaries","author":"Lin","year":"2004","journal-title":"Text summarization branches out"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02484"},{"key":"ref55","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2024","journal-title":"Advances in neural information processing systems"},{"key":"ref56","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2024","journal-title":"Advances in neural information processing systems"},{"key":"ref57","article-title":"Mmbench: Is your multimodal model an all-around player?","author":"Liu","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref58","article-title":"On the hidden mystery of ocr in large multimodal models","author":"Liu","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref59","article-title":"Tempcompass: Do video 11 ms really understand videos?","author":"Liu","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.679"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00011"},{"key":"ref62","article-title":"Egoschema: A diagnostic benchmark for very longform video language understanding","volume":"36","author":"Mangalam","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref63","article-title":"GoogleResearch. Neptune: The long orbit to benchmarking long video understanding","author":"Nagrani","year":"2024","journal-title":"ArXiv"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-naacl.226"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.26599\/cvm.2025.9450516"},{"key":"ref66","volume-title":"Gpt-4 ,technical report","author":"Achiam","year":"2024"},{"key":"ref67","article-title":"Llm evaluators recognize and favor their own generations","volume":"abs\/2404.13076","author":"Panickssery","year":"2024","journal-title":"ArXiv"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.567"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72775-7_13"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02495"},{"key":"ref72","article-title":"Magic123: One image to high-quality 3d object generation using both 2d and 3d diffusion priors","volume-title":"The Twelfth International Conference on Learning Representations (ICLR)","author":"Qian","year":"2024"},{"key":"ref73","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"International conference on machine learning","author":"Radford","year":"2021"},{"key":"ref74","article-title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","author":"Reid","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1410"},{"key":"ref76","article-title":"Dreamgaussian4d: Generative 4d gaussian splatting","author":"Ren","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01357"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.01725"},{"key":"ref79","article-title":"Gemini: a family of highly capable multimodal models","author":"Team","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00517"},{"key":"ref81","article-title":"Cambrian1: A fully open, vision-centric exploration of multimodal llms","author":"Tong","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00914"},{"key":"ref83","article-title":"Llama: open and efficient foundation language models","author":"Touvron","year":"2023","journal-title":"arxiv. arxiv preprint arxiv"},{"key":"ref84","article-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"ref86","article-title":"What makes for good visual tokenizers for large language models?","author":"Wang","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i2.25353"},{"key":"ref88","article-title":"Qwen2-vl: Enhancing vision-language model\u2019s perception of the world at any resolution","author":"Wang","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i8.32852"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01920"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01028"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.571"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2024.3507000"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00994"},{"key":"ref95","article-title":"Qwen2.5 technical report","author":"Yang","year":"2024","journal-title":"ArXiv"},{"key":"ref96","article-title":"mplug-owl: Modularization empowers large language models with multimodality","author":"Ye","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref97","article-title":"Mm -vet: Evaluating large multimodal models for integrated capabilities","volume-title":"International conference on machine learning","author":"Yu","year":"2024"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00913"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-demo.49"},{"key":"ref100","article-title":"4diffusion: Multi-view video diffusion model for 4 d generation","author":"Zhang","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref101","article-title":"Bertscore: Evaluating text generation with bert","author":"Zhang","year":"2019","journal-title":"arxiv preprint arxiv"},{"key":"ref102","article-title":"Video instruction tuning with synthetic data","author":"Zhang","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref103","article-title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","author":"Zhou","year":"2024","journal-title":"arxiv preprint arxiv"},{"key":"ref104","article-title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","author":"Zhu","year":"2023","journal-title":"arxiv preprint arxiv"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00272"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11445003.pdf?arnumber=11445003","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T05:30:53Z","timestamp":1777613453000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11445003\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":105,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.01963","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}