{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T05:31:58Z","timestamp":1740115918477,"version":"3.37.3"},"reference-count":8,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,11,24]],"date-time":"2024-11-24T00:00:00Z","timestamp":1732406400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,11,24]],"date-time":"2024-11-24T00:00:00Z","timestamp":1732406400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,11,24]]},"DOI":"10.1109\/iccvit63928.2024.10872416","type":"proceedings-article","created":{"date-parts":[[2025,2,13]],"date-time":"2025-02-13T18:33:35Z","timestamp":1739471615000},"page":"1-5","source":"Crossref","is-referenced-by-count":0,"title":["Image Recognition Method Based on the Fusion of Multimodal Large Models"],"prefix":"10.1109","author":[{"given":"Aiwei","family":"Zang","sequence":"first","affiliation":[{"name":"Nanjing Research Institute of Electronic Engineering,Nanjing,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Renzheng","family":"Cao","sequence":"additional","affiliation":[{"name":"Nanjing Research Institute of Electronic Engineering,Nanjing,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1038\/nature14539"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref3","first-page":"1361","article-title":"Discriminative untrained feature extractors for tracking","volume-title":"Proceedings of the IEEE International Conference on Computer Vision","author":"Dosovitskiy"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2798607"},{"issue":"3","key":"ref5","first-page":"619","article-title":"Multimodal deep learning for image captioning","volume":"21","author":"Tsai","year":"2019","journal-title":"IEEE Transactions on Multimedia"},{"issue":"1","key":"ref6","first-page":"2045","article-title":"Deep multimodal learning: A survey on recent advances","volume":"19","author":"Zhang","year":"2018","journal-title":"Journal of Machine Learning Research"},{"issue":"6","key":"ref7","first-page":"2135","article-title":"AF: An association-based fusion method for multi-modal classification","volume":"32","author":"Zhang","year":"2021","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"ref8","first-page":"1","article-title":"Weighted-average fusion method for multiband images","volume":"90","author":"Wang","year":"2020","journal-title":"Journal of Image and Vision Computing"}],"event":{"name":"2024 2nd International Conference on Computer, Vision and Intelligent Technology (ICCVIT)","start":{"date-parts":[[2024,11,24]]},"location":"Huaibei, China","end":{"date-parts":[[2024,11,27]]}},"container-title":["2024 2nd International Conference on Computer, Vision and Intelligent Technology (ICCVIT)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10871946\/10872409\/10872416.pdf?arnumber=10872416","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,20]],"date-time":"2025-02-20T19:51:40Z","timestamp":1740081100000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10872416\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,24]]},"references-count":8,"URL":"https:\/\/doi.org\/10.1109\/iccvit63928.2024.10872416","relation":{},"subject":[],"published":{"date-parts":[[2024,11,24]]}}}