{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,8]],"date-time":"2026-03-08T01:58:34Z","timestamp":1772935114184,"version":"3.50.1"},"reference-count":21,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,12,8]],"date-time":"2025-12-08T00:00:00Z","timestamp":1765152000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,12,8]],"date-time":"2025-12-08T00:00:00Z","timestamp":1765152000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,12,8]]},"DOI":"10.1109\/bigdata66926.2025.11402578","type":"proceedings-article","created":{"date-parts":[[2026,3,6]],"date-time":"2026-03-06T20:57:57Z","timestamp":1772830677000},"page":"1867-1872","source":"Crossref","is-referenced-by-count":0,"title":["Do Multimodal Large Language Models Compete with Specialized Object Detection Models? A Quantitative Benchmark"],"prefix":"10.1109","author":[{"given":"Andrew","family":"Dunton","sequence":"first","affiliation":[{"name":"San Jose State University,Department of Applied Data Science,San Jose,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Priya","family":"Govindarajulu","sequence":"additional","affiliation":[{"name":"San Jose State University,Department of Applied Data Science,San Jose,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mohammad","family":"Masum","sequence":"additional","affiliation":[{"name":"San Jose State University,Department of Applied Data Science,San Jose,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","journal-title":"\u00a0"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-022-13801-3"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-023-10595-0"},{"key":"ref4","article-title":"Rethinking Annotation for Object Detection: Is Annotating Small-size Instances Worth Its Cost?","author":"Zhang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2015.7298824"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1093\/nsr\/nwae403"},{"key":"ref7","article-title":"To See is to Believe: Prompting GPT-4V for better visual instruction tuning","author":"Wang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1516"},{"key":"ref9","article-title":"YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detection","author":"Wang","year":"2022","journal-title":"arXiv preprint"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72751-1_1"},{"key":"ref11","article-title":"Deformable DETR: Deformable transformers for end-to-end object detection","author":"Zhu","year":"2021","journal-title":"Proc. ICLR"},{"key":"ref12","article-title":"DINO: DETR with improved de-noising anchor boxes for end-to-end object detection","author":"Zhang","year":"2022","journal-title":"Proc. ECCV"},{"key":"ref13","article-title":"Rethinking Annotation for Object Detection: Is Annotating Small-size Instances Worth Its Cost?","author":"Hosoya","year":"2024","journal-title":"arXiv preprint"},{"key":"ref14","article-title":"Gemini: A family of highly capable multimodal models","author":"Team","year":"2024","journal-title":"Google Research Report"},{"key":"ref15","year":"2023","journal-title":"GPT-4V(ision) System Card"},{"key":"ref16","article-title":"GPT4RoI: Instruction tuning large language models on region-of-interest inputs","author":"Shen","year":"2023","journal-title":"arXiv preprint"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01069"},{"key":"ref18","article-title":"Learning to localize objects improves spatial reasoning in visual-LLMs","author":"Chen","year":"2024","journal-title":"arXiv preprint"},{"key":"ref19","article-title":"The Llama 3 herd of models","author":"Team","year":"2024","journal-title":"arXiv preprint"},{"key":"ref20","year":"2023","journal-title":"Databricks, Databricks-Dolly-15k: Instruction-tuning dataset for large language models"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-020-01316-z"}],"event":{"name":"2025 IEEE International Conference on Big Data (BigData)","location":"Macau, China","start":{"date-parts":[[2025,12,8]]},"end":{"date-parts":[[2025,12,11]]}},"container-title":["2025 IEEE International Conference on Big Data (BigData)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11400704\/11400712\/11402578.pdf?arnumber=11402578","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,7]],"date-time":"2026-03-07T07:21:59Z","timestamp":1772868119000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11402578\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12,8]]},"references-count":21,"URL":"https:\/\/doi.org\/10.1109\/bigdata66926.2025.11402578","relation":{},"subject":[],"published":{"date-parts":[[2025,12,8]]}}}