{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,22]],"date-time":"2026-01-22T07:31:54Z","timestamp":1769067114853,"version":"3.49.0"},"publisher-location":"New York, NY, USA","reference-count":39,"publisher":"ACM","license":[{"start":{"date-parts":[[2023,10,9]],"date-time":"2023-10-09T00:00:00Z","timestamp":1696809600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2023,10,9]]},"DOI":"10.1145\/3577190.3614225","type":"proceedings-article","created":{"date-parts":[[2023,10,7]],"date-time":"2023-10-07T18:30:48Z","timestamp":1696703448000},"page":"695-699","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":11,"title":["Bridging Multimedia Modalities: Enhanced Multimodal AI Understanding and Intelligent Agents"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-9232-2661","authenticated-orcid":false,"given":"Sushant","family":"Gautam","sequence":"first","affiliation":[{"name":"Department of Holistic Systems (HOST), Simula Metropolitan Center for Digital Engineering (SimulaMet), Norway"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2023,10,9]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2798607"},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.1007\/s00371-021-02166-7"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2004.05150"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00694"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-demo.10"},{"key":"e_1_3_2_1_6_1","volume-title":"Towards Bridged Vision and Language: Learning Cross-modal Knowledge Representation for Relation Extraction","author":"Feng Junhao","year":"2023","unstructured":"Junhao Feng, Guohua Wang, Changmeng Zheng, Yi Cai, Ze Fu, Yaowei Wang, Xiao-Yong Wei, and Qing Li. 2023. Towards Bridged Vision and Language: Learning Cross-modal Knowledge Representation for Relation Extraction. IEEE Transactions on Circuits and Systems for Video Technology (2023)."},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1162\/neco_a_01273"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1155\/2021\/7963616"},{"key":"e_1_3_2_1_9_1","volume-title":"AI-based Soccer Game Summarization: From Video Highlights to Dynamic Text Summaries. Master\u2019s Thesis","author":"Gautam Sushant","unstructured":"Sushant Gautam. 2022. AI-based Soccer Game Summarization: From Video Highlights to Dynamic Text Summaries. Master\u2019s Thesis, Tribhuvan University. https:\/\/www.researchgate.net\/publication\/363857936_AI-based_Soccer_Game_Summarization_From_Video_Highlights_to_Dynamic_Text_Summaries"},{"key":"e_1_3_2_1_10_1","volume-title":"Proceedings of 12th IOE Graduate Conference, Vol.\u00a012","author":"Gautam Sushant","year":"2022","unstructured":"Sushant Gautam, Cise Midoglu, Saeed Shafiee\u00a0Sabet, Dinesh\u00a0Baniya Kshatri, and P\u00e5l Halvorsen. 2022. Assisting Soccer Game Summarization via Audio Intensity Analysis of Game Highlights. In Proceedings of 12th IOE Graduate Conference, Vol.\u00a012. Institute of Engineering, Tribhuvan University, Nepal, 25 \u2013 32. https:\/\/conference.ioe.edu.np\/publications\/ioegc12\/IOEGC-12-004-12009.pdf"},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1145\/3552463.3557019"},{"key":"e_1_3_2_1_12_1","unstructured":"Significant Gravitas. 2023. Auto-GPT. https:\/\/github.com\/Significant-Gravitas\/Auto-GPT."},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2304.00116"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.jag.2022.102926"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2021.3065823"},{"key":"e_1_3_2_1_16_1","volume-title":"MultiBench: Multiscale Benchmarks for Multimodal Representation Learning. In Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track (Round 1).","author":"Liang Paul\u00a0Pu","year":"2021","unstructured":"Paul\u00a0Pu Liang, Yiwei Lyu, Xiang Fan, Zetian Wu, Yun Cheng, Jason Wu, Leslie\u00a0Yufan Chen, Peter Wu, Michelle\u00a0A Lee, Yuke Zhu, 2021. MultiBench: Multiscale Benchmarks for Multimodal Representation Learning. In Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track (Round 1)."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2209.03430"},{"key":"e_1_3_2_1_18_1","volume-title":"Advances in Neural Information Processing Systems, S.\u00a0Koyejo, S.\u00a0Mohamed, A.\u00a0Agarwal, D.\u00a0Belgrave, K.\u00a0Cho, and A.\u00a0Oh (Eds.). Vol.\u00a035. Curran Associates","author":"Liu Haokun","year":"1950","unstructured":"Haokun Liu, Derek Tam, Mohammed Muqeeth, Jay Mohta, Tenghao Huang, Mohit Bansal, and Colin\u00a0A Raffel. 2022. Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context Learning. In Advances in Neural Information Processing Systems, S.\u00a0Koyejo, S.\u00a0Mohamed, A.\u00a0Agarwal, D.\u00a0Belgrave, K.\u00a0Cho, and A.\u00a0Oh (Eds.). Vol.\u00a035. Curran Associates, Inc., 1950\u20131965. https:\/\/proceedings.neurips.cc\/paper_files\/paper\/2022\/file\/0cde695b83bd186c1fd456302888454c-Paper-Conference.pdf"},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.1145\/3560815"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2002.06353"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2304.04565"},{"key":"e_1_3_2_1_22_1","volume-title":"Hanoona\u00a0Rasheed and Fahad Khan","author":"Muhammad\u00a0Maaz Salman\u00a0Khan","year":"2023","unstructured":"Salman\u00a0Khan Muhammad\u00a0Maaz, Hanoona\u00a0Rasheed and Fahad Khan. 2023. Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models. ArXiv 2306.05424 (2023)."},{"key":"e_1_3_2_1_23_1","unstructured":"Jiquan Ngiam Aditya Khosla Mingyu Kim Juhan Nam Honglak Lee and Andrew\u00a0Y Ng. 2011. Multimodal deep learning. In ICML."},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1250"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"publisher","DOI":"10.1145\/3577925"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2303.17580"},{"key":"e_1_3_2_1_27_1","volume-title":"Proceedings of The 6th Conference on Robot Learning(Proceedings of Machine Learning Research, Vol.\u00a0205)","author":"Shridhar Mohit","year":"2023","unstructured":"Mohit Shridhar, Lucas Manuelli, and Dieter Fox. 2023. Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation. In Proceedings of The 6th Conference on Robot Learning(Proceedings of Machine Learning Research, Vol.\u00a0205), Karen Liu, Dana Kulic, and Jeff Ichnowski (Eds.). PMLR, 785\u2013799. https:\/\/proceedings.mlr.press\/v205\/shridhar23a.html"},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.1093\/bib\/bbab569"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2305.11846"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1038\/s41597-023-02173-4"},{"key":"e_1_3_2_1_31_1","volume-title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training. Advances in neural information processing systems 35","author":"Tong Zhan","year":"2022","unstructured":"Zhan Tong, Yibing Song, Jue Wang, and Limin Wang. 2022. Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training. Advances in neural information processing systems 35 (2022), 10078\u201310093."},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2302.13971"},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01398"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/tcsvt.2021.3077512"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01031"},{"key":"e_1_3_2_1_36_1","volume-title":"Multimodal learning with transformers: A survey","author":"Xu Peng","year":"2023","unstructured":"Peng Xu, Xiatian Zhu, and David\u00a0A Clifton. 2023. Multimodal learning with transformers: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence (2023)."},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-16-8531-6_8"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2306.02858"},{"key":"e_1_3_2_1_39_1","volume-title":"Meta-Transformer: A Unified Framework for Multimodal Learning. arXiv preprint arXiv:2307.10802","author":"Zhang Yiyuan","year":"2023","unstructured":"Yiyuan Zhang, Kaixiong Gong, Kaipeng Zhang, Hongsheng Li, Yu Qiao, Wanli Ouyang, and Xiangyu Yue. 2023. Meta-Transformer: A Unified Framework for Multimodal Learning. arXiv preprint arXiv:2307.10802 (2023)."}],"event":{"name":"ICMI '23: INTERNATIONAL CONFERENCE ON MULTIMODAL INTERACTION","location":"Paris France","acronym":"ICMI '23","sponsor":["SIGCHI ACM Special Interest Group on Computer-Human Interaction"]},"container-title":["INTERNATIONAL CONFERENCE ON MULTIMODAL INTERACTION"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3577190.3614225","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3577190.3614225","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,2]],"date-time":"2025-09-02T16:59:57Z","timestamp":1756832397000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3577190.3614225"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,9]]},"references-count":39,"alternative-id":["10.1145\/3577190.3614225","10.1145\/3577190"],"URL":"https:\/\/doi.org\/10.1145\/3577190.3614225","relation":{},"subject":[],"published":{"date-parts":[[2023,10,9]]},"assertion":[{"value":"2023-10-09","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}