{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,8]],"date-time":"2026-07-08T06:09:06Z","timestamp":1783490946019,"version":"3.55.0"},"reference-count":98,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.02126","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"22899-22910","source":"Crossref","is-referenced-by-count":1,"title":["Aurelia: Test-Time Reasoning Distillation in Audio-Visual LLMs"],"prefix":"10.1109","author":[{"given":"Sanjoy","family":"Chowdhury","sequence":"first","affiliation":[{"name":"University of Maryland, College Park"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hanan","family":"Gani","sequence":"additional","affiliation":[{"name":"MBZUAI"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Nishit","family":"Anand","sequence":"additional","affiliation":[{"name":"University of Maryland, College Park"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sayan","family":"Nag","sequence":"additional","affiliation":[{"name":"University of Toronto"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ruohan","family":"Gao","sequence":"additional","affiliation":[{"name":"University of Maryland, College Park"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mohamed","family":"Elhoseiny","sequence":"additional","affiliation":[{"name":"KAUST"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Salman","family":"Khan","sequence":"additional","affiliation":[{"name":"MBZUAI"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dinesh","family":"Manocha","sequence":"additional","affiliation":[{"name":"University of Maryland, College Park"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00774"},{"key":"ref2","first-page":"65","article-title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","volume-title":"Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and\/or summarization","author":"Banerjee","year":"2005"},{"key":"ref3","article-title":"Forest-of-thought: Scaling test-time compute for enhancing 11 m reasoning","author":"Bi","year":"2024","journal-title":"arXiv preprint"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1145\/3442381.3449973"},{"key":"ref5","article-title":"Valor: Vision-audiolanguage omni-perception pretraining model and dataset","author":"Chen","year":"2023","journal-title":"arXiv preprint"},{"key":"ref6","article-title":"Valor: Vision-audiolanguage omni-perception pretraining model and dataset","author":"Chen","year":"2023","journal-title":"arXiv preprint"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.52202\/075280-3185"},{"key":"ref8","article-title":"Steering large language models between code execution and textual reasoning","author":"Chen","year":"2024","journal-title":"arXiv preprint"},{"key":"ref9","article-title":"Videollama 2: Advancing spatialtemporal modeling and audio understanding in video-llms","author":"Cheng","year":"2024","journal-title":"arXiv preprint"},{"key":"ref10","article-title":"Videollama 2: Advancing spatialtemporal modeling and audio understanding in video-llms","author":"Cheng","year":"2024","journal-title":"arXiv preprint"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73039-9_4"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02533"},{"key":"ref13","article-title":"Avtrustbench: Assessing and enhancing relia-bility and robustness in audio-visual 11 ms","author":"Chowdhury","year":"2025","journal-title":"arXiv preprint"},{"key":"ref14","article-title":"Training verifiers to solve math word problems","author":"Cobbe","year":"2021","journal-title":"arXiv preprint"},{"key":"ref15","article-title":"Tables as texts or images: Evaluating the table reasoning ability of 11 ms and mllms","author":"Deng","year":"2024","journal-title":"arXiv preprint"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52734.2025.00847"},{"key":"ref17","article-title":"Virgo: A preliminary exploration on reproducing o1-like mllm","author":"Du","year":"2025","journal-title":"arXiv preprint"},{"key":"ref18","first-page":"89098","article-title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","volume":"37","author":"Fang","year":"2025","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref19","article-title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal 11 ms in video analysis","author":"Fu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref20","article-title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal 11 ms in video analysis","author":"Fu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref21","article-title":"Vita: Towards open-source interactive omni multimodal 1lm","author":"Fu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v40i36.40332"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00370"},{"key":"ref24","article-title":"Av-odyssey bench: Can your multimodal 11 ms really understand audio-visual information","author":"Gong","year":"2024","journal-title":"arXiv preprint"},{"key":"ref25","article-title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","author":"Guo","year":"2024","journal-title":"arXiv preprint"},{"key":"ref26","author":"Guo","year":"2024","journal-title":"Large language model based multi-agents: A survey of progress and challenges"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.02510"},{"key":"ref28","article-title":"Imagebind-llm: Multi-modality instruction tuning","author":"Han","year":"2023","journal-title":"arXiv preprint"},{"key":"ref29","article-title":"Llm multi-agent systems: Challenges and open problems","author":"Han","year":"2024","journal-title":"arXiv preprint"},{"key":"ref30","article-title":"Distill visual chart reasoning ability from 11 ms to mllms","author":"He","year":"2024","journal-title":"arXiv preprint"},{"key":"ref31","author":"Hendrycks","year":"2021","journal-title":"Measuring massive multitask language understanding"},{"key":"ref32","article-title":"Mllm-compbench: A comparative reasoning benchmark for multimodal 11 ms","volume-title":"The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track","author":"Kil"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1613"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01852"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01852"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-026-02734-1"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.02095"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72897-6_19"},{"key":"ref39","article-title":"Let\u2019s verify step by step","volume-title":"The Twelfth International Conference on Learning Representations","author":"Lightman","year":"2023"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.342"},{"key":"ref41","first-page":"74","article-title":"Rouge: A package for automatic evaluation of summaries","author":"Lin","year":"2004","journal-title":"Text summarization branches out"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.52202\/079017"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.517"},{"key":"ref44","article-title":"Unified-io: A unified model for vision, language, and multi-modal tasks","author":"Lu","year":"2022","journal-title":"arXiv preprint"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.52202\/068431-0182"},{"key":"ref46","article-title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","author":"Lu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref47","article-title":"Improve mathematical reasoning in language models by automated process supervision","author":"Luo","year":"2024","journal-title":"arXiv preprint"},{"key":"ref48","article-title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration","author":"Lyu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2004"},{"key":"ref50","author":"Miyai","year":"2024","journal-title":"Unsolvable problem detection: Evaluating trustworthiness of vision language models"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/ACSOS-C58168.2023.00048"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.26599\/cvm.2025.9450516"},{"key":"ref53","article-title":"X-instructblip: A framework for aligning x -modal instruction-aware representations to 11 ms and emergent cross-modal reasoning","author":"Panagopoulou","year":"2023","journal-title":"arXiv preprint"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.01335"},{"key":"ref56","article-title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","author":"Reid","year":"2024","journal-title":"arXiv preprint"},{"key":"ref57","article-title":"Audio-visual 11 m for video understanding","author":"Shu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref58","article-title":"Pandagpt: One model to instruction-follow them all","author":"Su","year":"2023","journal-title":"arXiv preprint"},{"key":"ref59","article-title":"Crosscheckgpt: Universal hallucination ranking for multimodal foundation models","author":"Sun","year":"2024","journal-title":"arXiv preprint"},{"key":"ref60","article-title":"video-salmonn: Speech-enhanced audio-visual large language models","author":"Sun","year":"2024","journal-title":"arXiv preprint"},{"key":"ref61","article-title":"video-salmonn: Speech-enhanced audio-visual large language models","author":"Sun","year":"2024","journal-title":"arXiv preprint"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1145\/3627673.3679558"},{"key":"ref63","article-title":"Easy-to-hard generalization: Scalable alignment beyond human supervision","author":"Sun","year":"2024","journal-title":"arXiv preprint"},{"key":"ref64","first-page":"2024","article-title":"The virtual lab: Ai agents design new sars-cov2 nanobodies with experimental validation","author":"Swanson","year":"2024","journal-title":"bioRxiv"},{"key":"ref65","article-title":"Enhancing multimodal 11 m for detailed and accurate video captioning using multi-round preference optimization","author":"Tang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10446343"},{"key":"ref67","article-title":"Avicuna: Audio-visual 11 m with interleaver and contextboundary alignment for temporal referential dialogue","author":"Tang","year":"2024","journal-title":"arXiv e-prints"},{"key":"ref68","article-title":"Gemini: a family of highly capable multimodal models","author":"Team","year":"2023","journal-title":"arXiv preprint"},{"key":"ref69","article-title":"Reka core, flash, and edge: A series of powerful multimodal language models","author":"Team","year":"2024","journal-title":"arXiv preprint"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.1247"},{"key":"ref71","article-title":"Llamavo1: Rethinking step-by-step visual reasoning in 11 ms","author":"Thawakar","year":"2025","journal-title":"arXiv preprint"},{"key":"ref72","article-title":"Multiagent collaboration mechanisms: A survey of 11 ms","author":"Tran","year":"2025","journal-title":"arXiv preprint"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.510"},{"key":"ref75","article-title":"Qwen2-vl: Enhancing vision-language model\u2019s perception of the world at any resolution","author":"Wang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.25"},{"key":"ref77","article-title":"Videocot: A video chain-ofthought dataset with active annotation tool","author":"Wang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1800"},{"key":"ref79","article-title":"Next-gpt: Any-to-any multimodal llm","volume-title":"Forty-first International Conference on Machine Learning","author":"Wu","year":"2024"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00965"},{"key":"ref81","article-title":"Logicvista: Multimodal 11 m logical reasoning benchmark in visual contexts","author":"Xiao","year":"2024","journal-title":"arXiv preprint"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73232-4_3"},{"key":"ref83","article-title":"Llava-o1: Let vision language models reason step-by-step","author":"Xu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref84","article-title":"Qwen2. 5-math technical report: Toward mathematical expert model via self-improvement","author":"Yang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref85","article-title":"Cat: enhancing multimodal large language model to answer questions in dynamic audio-visual scenarios","author":"Ye","year":"2024","journal-title":"arXiv preprint"},{"key":"ref86","article-title":"Internlm-math: Open math large language models toward verifiable reasoning","author":"Ying","year":"2024","journal-title":"arXiv preprint"},{"key":"ref87","article-title":"Ovm, outcomesupervised value models for planning in mathematical reasoning","author":"Yu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref88","article-title":"Crema: Generalizable and efficient video-language reasoning via multimodal modular fusion","author":"Yu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref89","first-page":"137010","article-title":"Fincon: A synthesized llm multi-agent system with conceptual verbal reinforcement for enhanced financial decision making","volume":"37","author":"Yu","year":"2025","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.521"},{"key":"ref91","article-title":"Llama-berry: Pairwise optimization for o1like olympiad-level mathematical reasoning","author":"Zhang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-demo.49"},{"key":"ref93","article-title":"Generative verifiers: Reward modeling as next-token prediction","author":"Zhang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref94","article-title":"Video instruction tuning with synthetic data","author":"Zhang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref95","article-title":"o1-coder: an o1 replication for coding","author":"Zhang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref96","article-title":"Thinking before looking: Improving multimodal 11 m reasoning via mitigating visual hallucination","author":"Zheng","year":"2024","journal-title":"arXiv preprint"},{"key":"ref97","article-title":"Evaluation of openai o1: Opportunities and challenges of agi","author":"Zhong","year":"2024","journal-title":"arXiv preprint"},{"key":"ref98","article-title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","author":"Zhu","year":"2023","journal-title":"arXiv preprint"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11446266.pdf?arnumber=11446266","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T05:33:43Z","timestamp":1777613623000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11446266\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":98,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.02126","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}