{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T22:52:11Z","timestamp":1780613531292,"version":"3.54.1"},"publisher-location":"New York, NY, USA","reference-count":102,"publisher":"ACM","funder":[{"name":"Bavarian State Ministry for Digital Affairs","award":["A5-3822-2-16"],"award-info":[{"award-number":["A5-3822-2-16"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,13]]},"DOI":"10.1145\/3716553.3750790","type":"proceedings-article","created":{"date-parts":[[2025,10,11]],"date-time":"2025-10-11T13:13:16Z","timestamp":1760188396000},"page":"485-495","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["A Systematic Review of Fusion Methods for the User-Centered Design of Multimodal Interfaces"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-7813-1823","authenticated-orcid":false,"given":"Ronja","family":"Heinrich","sequence":"first","affiliation":[{"name":"Human-Computer Interaction Group, University of W\u00fcrzburg, W\u00fcrzburg, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-7362-4555","authenticated-orcid":false,"given":"Chris","family":"Zimmerer","sequence":"additional","affiliation":[{"name":"Human-Computer Interaction Group, University of W\u00fcrzburg, W\u00fcrzburg, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-4778-3826","authenticated-orcid":false,"given":"Martin","family":"Fischbach","sequence":"additional","affiliation":[{"name":"Human-Computer Interaction Group, University of W\u00fcrzburg, W\u00fcrzburg, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9340-9600","authenticated-orcid":false,"given":"Marc","family":"Erich Latoschik","sequence":"additional","affiliation":[{"name":"Human-Computer Interaction Group, University of W\u00fcrzburg, W\u00fcrzburg, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,10,12]]},"reference":[{"key":"e_1_3_3_1_2_2","doi-asserted-by":"publisher","DOI":"10.1145\/3328756.3328758"},{"key":"e_1_3_3_1_3_2","doi-asserted-by":"publisher","unstructured":"Fernando Alonso-Martin Javier\u00a0F. Gorostiza Maria Malfaz and Miguel\u00a0A. Salichs. 2013. Multimodal Fusion as Communicative Acts during Human-Robot Interaction. CYBERNETICS AND SYSTEMS 44 8 (Nov. 2013) 681\u2013703. 10.1080\/01969722.2013.832096Num Pages: 23 Place: Philadelphia Publisher: Taylor & Francis Inc Web of Science ID: WOS:000324904000004.","DOI":"10.1080\/01969722.2013.832096"},{"key":"e_1_3_3_1_4_2","doi-asserted-by":"publisher","unstructured":"Fiolisya\u00a0Faustine Ambadar and Jude Joseph\u00a0Lamug Martinez. 2023. Improving the performance of speech-gesture multimodal interface in non-ideal environments. Procedia Computer Science 216 C (Jan. 2023) 587\u2013596. 10.1016\/j.procs.2022.12.173","DOI":"10.1016\/j.procs.2022.12.173"},{"key":"e_1_3_3_1_5_2","doi-asserted-by":"publisher","DOI":"10.1145\/2070481.2070521"},{"key":"e_1_3_3_1_6_2","doi-asserted-by":"publisher","unstructured":"Pradeep\u00a0K. Atrey M.\u00a0Anwar Hossain Abdulmotaleb El\u00a0Saddik and Mohan\u00a0S. Kankanhalli. 2010. Multimodal fusion for multimedia analysis: a survey. Multimedia Systems 16 6 (2010) 345\u2013379. 10.1007\/s00530-010-0182-0","DOI":"10.1007\/s00530-010-0182-0"},{"key":"e_1_3_3_1_7_2","doi-asserted-by":"publisher","unstructured":"Tadas Baltrusaitis Chaitanya Ahuja and Louis-Philippe Morency. 2019. Multimodal Machine Learning: A Survey and Taxonomy. IEEE Trans. Pattern Anal. Mach. Intell. 41 2 (Feb. 2019) 423\u2013443. 10.1109\/TPAMI.2018.2798607","DOI":"10.1109\/TPAMI.2018.2798607"},{"key":"e_1_3_3_1_8_2","doi-asserted-by":"publisher","unstructured":"Srinivas Bangalore and Michael Johnston. 2009. Robust Understanding in Multimodal Interfaces. COMPUTATIONAL LINGUISTICS 35 3 (Sept. 2009) 345\u2013397. 10.1162\/coli.08-022-R2-06-26Num Pages: 53 Place: Cambridge Publisher: Mit Press Web of Science ID: WOS:000272350900002.","DOI":"10.1162\/coli.08-022-R2-06-26"},{"key":"e_1_3_3_1_9_2","doi-asserted-by":"publisher","unstructured":"Richard\u00a0A. Bolt. 1980. \u201cPut-That-There\u201d: Voice and Gesture at the Graphics Interface. SIGGRAPH Comput. Graph. 14 3 (July 1980) 262\u2013270. 10.1145\/965105.807503","DOI":"10.1145\/965105.807503"},{"key":"e_1_3_3_1_10_2","doi-asserted-by":"publisher","unstructured":"P. Bourdot T. Convard F. Picon M. Ammi D. Touraine and J.-M. Vezien. 2010. VR-CAD integration: Multimodal immersive interaction and advanced haptic paradigms for implicit edition of CAD models. COMPUTER-AIDED DESIGN 42 5 (May 2010) 445\u2013461. 10.1016\/j.cad.2008.10.014Num Pages: 17 Place: Oxford Publisher: Elsevier Sci Ltd Web of Science ID: WOS:000277747800009.","DOI":"10.1016\/j.cad.2008.10.014"},{"key":"e_1_3_3_1_11_2","doi-asserted-by":"publisher","unstructured":"B. Burger I. Ferran\u00e9 F. Lerasle and G. Infantes. 2012. Two-handed gesture recognition and fusion with speech to command a robot. Autonomous Robots 32 2 (Feb. 2012) 129\u2013147. 10.1007\/s10514-011-9263-y","DOI":"10.1007\/s10514-011-9263-y"},{"key":"e_1_3_3_1_12_2","doi-asserted-by":"publisher","DOI":"10.1109\/ROMAN.2009.5326298"},{"key":"e_1_3_3_1_13_2","unstructured":"Hendrik Buschmeier Zofia Malisz Joanna Skubisz Marcin W\u0142odarczak Ipke Wachsmuth Stefan Kopp and Petra Wagner. 2014. ALICO: A multimodal corpus for the study of active listening."},{"key":"e_1_3_3_1_14_2","doi-asserted-by":"publisher","DOI":"10.1109\/IHMSC.2016.245"},{"key":"e_1_3_3_1_15_2","doi-asserted-by":"publisher","DOI":"10.1109\/IV51561.2020.00124"},{"key":"e_1_3_3_1_16_2","doi-asserted-by":"publisher","unstructured":"Imran Chowdhury Abdul Moeid Enamul Hoque Muhammad\u00a0Ashad Kabir Md.\u00a0Sabir Hossain and Mohammad\u00a0Mainul Islam. 2021. Designing and Evaluating Multimodal Interactions for Facilitating Visual Analysis With Dashboards. IEEE Access 9 (2021) 60\u201371. 10.1109\/ACCESS.2020.3046623Conference Name: IEEE Access.","DOI":"10.1109\/ACCESS.2020.3046623"},{"key":"e_1_3_3_1_17_2","doi-asserted-by":"publisher","DOI":"10.1145\/142621.142641"},{"key":"e_1_3_3_1_18_2","doi-asserted-by":"publisher","DOI":"10.1145\/266180.266328"},{"key":"e_1_3_3_1_19_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-25075-0_43"},{"key":"e_1_3_3_1_20_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-5041-2896-419"},{"key":"e_1_3_3_1_21_2","doi-asserted-by":"publisher","DOI":"10.1145\/2254556.2254592"},{"key":"e_1_3_3_1_22_2","doi-asserted-by":"publisher","DOI":"10.1145\/1111449.1111481"},{"key":"e_1_3_3_1_23_2","doi-asserted-by":"publisher","DOI":"10.1145\/1647314.1647360"},{"key":"e_1_3_3_1_24_2","doi-asserted-by":"publisher","unstructured":"Bruno Dumas Denis Lalanne and Rolf Ingold. 2010. Description languages for multimodal interaction: a set of\u00a0guidelines and its illustration with SMUIML. Journal on Multimodal User Interfaces 3 3 (01 Apr 2010) 237\u2013247. 10.1007\/s12193-010-0043-3","DOI":"10.1007\/s12193-010-0043-3"},{"key":"e_1_3_3_1_25_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-00437-71"},{"key":"e_1_3_3_1_26_2","doi-asserted-by":"publisher","DOI":"10.1145\/3136755.3136768"},{"key":"e_1_3_3_1_27_2","unstructured":"Martin Fischbach. 2017. Enhancing Software Quality of Multimodal Interactive Systems. Publication. https:\/\/doi.org\/urn:nbn:de:bvb:20-opus-152723"},{"key":"e_1_3_3_1_28_2","doi-asserted-by":"publisher","unstructured":"Brian\u00a0R. Gaines. 1991. Modeling and forecasting the information sciences. Information Sciences 57-58 (1991) 3\u201322. 10.1016\/0020-0255(91)90066-4Information Sciences- Past Present and Future.","DOI":"10.1016\/0020-0255(91)90066-4"},{"key":"e_1_3_3_1_29_2","doi-asserted-by":"publisher","unstructured":"Chenfeng Gao Wanli Qian Richard Liu Rana Hanocka and Ken Nakagaki. 2024. Towards Multimodal Interaction with AI-Infused Shape-Changing Interfaces. Adjunct Proceedings of the 37th Annual ACM Symposium on User Interface Software and Technology (Oct. 2024) 1\u20133. 10.1145\/3672539.3686315","DOI":"10.1145\/3672539.3686315"},{"key":"e_1_3_3_1_30_2","unstructured":"Yunfan Gao Yun Xiong Xinyu Gao Kangxiang Jia Jinliu Pan Yuxi Bi Yi Dai Jiawei Sun Meng Wang and Haofen Wang. 2024. Retrieval-Augmented Generation for Large Language Models: A Survey. arxiv:https:\/\/arXiv.org\/abs\/2312.10997\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2312.10997"},{"key":"e_1_3_3_1_31_2","volume-title":"Speech-to-Text","author":"LLC Google","year":"2023","unstructured":"Google LLC. 2023. Speech-to-Text. https:\/\/cloud.google.com\/speech-to-text"},{"key":"e_1_3_3_1_32_2","doi-asserted-by":"publisher","unstructured":"\u00c1lan L\u00edvio\u00a0Vasconcelos Guedes Roberto Gerson de\u00a0Albuquerque Azevedo and Simone Diniz\u00a0Junqueira Barbosa. 2017. Extending multimedia languages to support multimodal user interactions. Multimedia Tools and Applications 76 4 (Feb. 2017) 5691\u20135720. 10.1007\/s11042-016-3846-8","DOI":"10.1007\/s11042-016-3846-8"},{"key":"e_1_3_3_1_33_2","doi-asserted-by":"publisher","unstructured":"Roman Hak and Tomas Zeman. 2017. Consistent categorization of multimodal integration patterns during human-computer interaction. JOURNAL ON MULTIMODAL USER INTERFACES 11 3 (Sept. 2017) 251\u2013265. 10.1007\/s12193-017-0243-1Num Pages: 15 Place: New York Publisher: Springer Web of Science ID: WOS:000408247600002.","DOI":"10.1007\/s12193-017-0243-1"},{"key":"e_1_3_3_1_34_2","doi-asserted-by":"publisher","unstructured":"Ting Han Casey Kennington and David Schlangen. 2018. Placing Objects in Gesture Space: Toward Incremental Interpretation of Multimodal Spatial Descriptions. Proceedings of the AAAI Conference on Artificial Intelligence 32 1 (Apr. 2018). 10.1609\/aaai.v32i1.11974","DOI":"10.1609\/aaai.v32i1.11974"},{"key":"e_1_3_3_1_35_2","unstructured":"Jim Highsmith and Martin Fowler. 2001. The Agile Manifesto. Software Development Magazine 9 8 (2001) 29\u201330."},{"key":"e_1_3_3_1_36_2","doi-asserted-by":"publisher","DOI":"10.1145\/2070481.2070500"},{"key":"e_1_3_3_1_37_2","doi-asserted-by":"publisher","unstructured":"Ya Hou Zhiquan Feng Xiaohui Yang Tao Xu Xiaoyu Qiu and Xin Zhang. 2022. STMMI: A Self-Tuning Multi-Modal Fusion Algorithm Applied in Assist Robot Interaction. SCIENTIFIC PROGRAMMING 2022 (Aug. 2022) 3952758. 10.1155\/2022\/3952758Num Pages: 10 Place: London Publisher: Hindawi Ltd Web of Science ID: WOS:000880061200004.","DOI":"10.1155\/2022\/3952758"},{"key":"e_1_3_3_1_38_2","doi-asserted-by":"publisher","unstructured":"Pui-Yu Hui and Helen Meng. 2014. Latent Semantic Analysis for Multimodal User Input With Speech and Gestures. IEEE-ACM TRANSACTIONS ON AUDIO SPEECH AND LANGUAGE PROCESSING 22 2 (Feb. 2014) 417\u2013429. 10.1109\/TASLP.2013.2294586Num Pages: 13 Place: Piscataway Publisher: Ieee-Inst Electrical Electronics Engineers Inc Web of Science ID: WOS:000332614900012.","DOI":"10.1109\/TASLP.2013.2294586"},{"key":"e_1_3_3_1_39_2","volume-title":"Systems and software engineering - Systems and software Quality Requirements and Evaluation (SQuaRE) - Product quality model","year":"2023","unstructured":"ISO\/IEC 25010:2023 2023. Systems and software engineering - Systems and software Quality Requirements and Evaluation (SQuaRE) - Product quality model. Standard. International Organization for Standardization, Geneva, CH."},{"key":"e_1_3_3_1_40_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICSP54964.2022.9778516"},{"key":"e_1_3_3_1_41_2","doi-asserted-by":"publisher","DOI":"10.3115\/990820.990874"},{"key":"e_1_3_3_1_42_2","doi-asserted-by":"publisher","unstructured":"Michael Johnston and Srinivas Bangalore. 2005. Finite-state Multimodal Integration and Understanding. Nat. Lang. Eng. 11 2 (June 2005) 159\u2013187. 10.1017\/S1351324904003572","DOI":"10.1017\/S1351324904003572"},{"key":"e_1_3_3_1_43_2","doi-asserted-by":"publisher","DOI":"10.3115\/976909.979653"},{"key":"e_1_3_3_1_44_2","doi-asserted-by":"publisher","DOI":"10.1002\/9781118976005.ch6"},{"key":"e_1_3_3_1_45_2","doi-asserted-by":"publisher","DOI":"10.5555\/2022466.2022520"},{"key":"e_1_3_3_1_46_2","doi-asserted-by":"publisher","DOI":"10.1145\/259963.260487"},{"key":"e_1_3_3_1_47_2","volume-title":"Embodied Conversational Agents \u2013 Let\u2019s Specify and Evaluate Them, AAMAS Workshop","author":"Kranstedt Alfred","year":"2002","unstructured":"Alfred Kranstedt, Stefan Kopp, and Ipke Wachsmuth. 2002. MURML: A Multimodal Utterance Representation Markup Language for Conversational Agents. In Embodied Conversational Agents \u2013 Let\u2019s Specify and Evaluate Them, AAMAS Workshop. Bologna, Italy."},{"key":"e_1_3_3_1_48_2","doi-asserted-by":"publisher","DOI":"10.1145\/1647314.1647343"},{"key":"e_1_3_3_1_49_2","doi-asserted-by":"publisher","unstructured":"Xujie Lang Zhiquan Feng Xiaohui Yang and Tao Xu. 2022. MES: A Helping Elderly Escort Interactive System Based on Reverse Active Integration of Multimodal Intentions. SCIENTIFIC PROGRAMMING 2022 (Sept. 2022) 5460766. 10.1155\/2022\/5460766Num Pages: 18 Place: London Publisher: Hindawi Ltd Web of Science ID: WOS:000892081400004.","DOI":"10.1155\/2022\/5460766"},{"key":"e_1_3_3_1_50_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICMI.2002.1167030"},{"key":"e_1_3_3_1_51_2","doi-asserted-by":"publisher","unstructured":"Minkyung Lee Mark Billinghurst Woonhyuk Baek Richard Green and Woontack Woo. 2013. A usability study of multimodal input in an augmented reality environment. VIRTUAL REALITY 17 4 (Nov. 2013) 293\u2013305. 10.1007\/s10055-013-0230-0Num Pages: 13 Place: London Publisher: Springer London Ltd Web of Science ID: WOS:000325997200004.","DOI":"10.1007\/s10055-013-0230-0"},{"key":"e_1_3_3_1_52_2","doi-asserted-by":"publisher","unstructured":"Peng Liu and Frank\u00a0K. Soong. 2009. Graph-Based Partial Hypothesis Fusion for Pen-Aided Speech Input. IEEE TRANSACTIONS ON AUDIO SPEECH AND LANGUAGE PROCESSING 17 3 (March 2009) 478\u2013485. 10.1109\/TASL.2009.2013409Num Pages: 8 Place: Piscataway Publisher: Ieee-Inst Electrical Electronics Engineers Inc Web of Science ID: WOS:000263639400008.","DOI":"10.1109\/TASL.2009.2013409"},{"key":"e_1_3_3_1_53_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-97-5609-419"},{"key":"e_1_3_3_1_54_2","doi-asserted-by":"publisher","DOI":"10.1145\/2663204.2663236"},{"key":"e_1_3_3_1_55_2","doi-asserted-by":"publisher","unstructured":"Inaki Maurtua Izaskun Fernandez Alberto Tellaeche Johan Kildal Loreto Susperregi Aitor Ibarguren and Basilio Sierra. 2017. Natural multimodal communication for human-robot collaboration. INTERNATIONAL JOURNAL OF ADVANCED ROBOTIC SYSTEMS 14 4 (July 2017). 10.1177\/1729881417716043Num Pages: 12 Place: Thousand Oaks Publisher: SAGE Publications Inc Web of Science ID: WOS:000405031000001.","DOI":"10.1177\/1729881417716043"},{"key":"e_1_3_3_1_56_2","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511620850.010"},{"key":"e_1_3_3_1_57_2","doi-asserted-by":"publisher","unstructured":"Ambuj Mehrish Navonil Majumder Rishabh Bharadwaj Rada Mihalcea and Soujanya Poria. 2023. A review of deep learning techniques for speech processing. Information Fusion 99 (2023) 101869. 10.1016\/j.inffus.2023.101869","DOI":"10.1016\/j.inffus.2023.101869"},{"key":"e_1_3_3_1_58_2","unstructured":"Lingrui Mei Jiayu Yao Yuyao Ge Yiwei Wang Baolong Bi Yujun Cai Jiazhi Liu Mingyu Li Zhong-Zhi Li Duzhen Zhang Chenlin Zhou Jiayi Mao Tianze Xia Jiafeng Guo and Shenghua Liu. 2025. A Survey of Context Engineering for Large Language Models. https:\/\/arxiv.org\/abs\/2507.13334"},{"key":"e_1_3_3_1_59_2","doi-asserted-by":"publisher","DOI":"10.1145\/3379247.3379261"},{"key":"e_1_3_3_1_60_2","doi-asserted-by":"publisher","DOI":"10.3115\/1075434.1075499"},{"key":"e_1_3_3_1_61_2","doi-asserted-by":"publisher","DOI":"10.1109\/IE.2016.42"},{"key":"e_1_3_3_1_62_2","doi-asserted-by":"publisher","DOI":"10.1145\/169059.169143"},{"key":"e_1_3_3_1_63_2","doi-asserted-by":"publisher","DOI":"10.1201\/b15703"},{"key":"e_1_3_3_1_64_2","volume-title":"Dragon Speech Recognition","author":"Inc Nuance Communications,","year":"2023","unstructured":"Nuance Communications, Inc. 2023. Dragon Speech Recognition. https:\/\/www.nuance.com\/dragon.html"},{"key":"e_1_3_3_1_65_2","doi-asserted-by":"publisher","unstructured":"Sharon Oviatt. 1999. Ten myths of multimodal interaction. Commun. ACM 42 11 (Nov. 1999) 74\u201381. 10.1145\/319382.319398","DOI":"10.1145\/319382.319398"},{"key":"e_1_3_3_1_66_2","doi-asserted-by":"publisher","unstructured":"Sharon Oviatt and Philip Cohen. 2000. Perceptual User Interfaces: Multimodal Interfaces That Process What Comes Naturally. Commun. ACM 43 3 (March 2000) 45\u201353. 10.1145\/330534.330538","DOI":"10.1145\/330534.330538"},{"key":"e_1_3_3_1_67_2","doi-asserted-by":"crossref","unstructured":"Sharon Oviatt and Philip\u00a0R Cohen. 2015. The paradigm shift to multimodality in contemporary computer interfaces. Synthesis lectures on human-centered informatics 8 3 (2015) 1\u2013243.","DOI":"10.1007\/978-3-031-02213-5_1"},{"key":"e_1_3_3_1_68_2","doi-asserted-by":"publisher","DOI":"10.1145\/3015783"},{"key":"e_1_3_3_1_69_2","volume-title":"The Handbook of Multimodal-Multisensor Interfaces: Signal Processing, Architectures, and Detection of Emotion and Cognition - Volume 2","author":"Oviatt Sharon","year":"2018","unstructured":"Sharon Oviatt, Bj\u00f6rn Schuller, Philip\u00a0R. Cohen, Daniel Sonntag, Gerasimos Potamianos, and Antonio Kr\u00fcger (Eds.). 2018. The Handbook of Multimodal-Multisensor Interfaces: Signal Processing, Architectures, and Detection of Emotion and Cognition - Volume 2. Vol.\u00a021. Association for Computing Machinery and Morgan & Claypool."},{"key":"e_1_3_3_1_70_2","doi-asserted-by":"publisher","DOI":"10.1145\/3233795"},{"key":"e_1_3_3_1_71_2","doi-asserted-by":"publisher","unstructured":"Matthew\u00a0J. Page Joanne\u00a0E. McKenzie Patrick\u00a0M. Bossuyt Isabelle Boutron Tammy\u00a0C. Hoffmann Cynthia\u00a0D. Mulrow Larissa Shamseer Jennifer\u00a0M. Tetzlaff Elie\u00a0A. Akl Sue\u00a0E. Brennan Roger Chou Julie Glanville Jeremy\u00a0M. Grimshaw Asbj\u00f8rn Hr\u00f3bjartsson Manoj\u00a0M. Lalu Tianjing Li Elizabeth\u00a0W. Loder Evan Mayo-Wilson Steve McDonald Luke\u00a0A. McGuinness Lesley\u00a0A. Stewart James Thomas Andrea\u00a0C. Tricco Vivian\u00a0A. Welch Penny Whiting and David Moher. 2021. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ 372 (March 2021) n71. 10.1136\/bmj.n71Publisher: British Medical Journal Publishing Group Section: Research Methods & Reporting.","DOI":"10.1136\/bmj.n71"},{"key":"e_1_3_3_1_72_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICMLA55696.2022.00127"},{"key":"e_1_3_3_1_73_2","unstructured":"Alec Radford Jong\u00a0Wook Kim Chris Hallacy Aditya Ramesh Gabriel Goh Sandhini Agarwal Girish Sastry Amanda Askell Pamela Mishkin Jack Clark Gretchen Krueger and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. arxiv:https:\/\/arXiv.org\/abs\/2103.00020"},{"key":"e_1_3_3_1_74_2","volume-title":"W3C Multimodal Interaction Framework","author":"Raggett Dave","year":"2003","unstructured":"Dave Raggett and T.V. Raman. 2003. W3C Multimodal Interaction Framework. W3C Note. W3C. https:\/\/www.w3.org\/TR\/2003\/NOTE-mmi-framework-20030506\/."},{"key":"e_1_3_3_1_75_2","doi-asserted-by":"publisher","DOI":"10.1109\/Telepresence63209.2024.10841737"},{"key":"e_1_3_3_1_76_2","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2013.6696665"},{"key":"e_1_3_3_1_77_2","doi-asserted-by":"publisher","unstructured":"Ayshwarya Saktheeswaran Arjun Srinivasan and John Stasko. 2020. Touch? Speech? or Touch and Speech? Investigating Multimodal Interaction for Visual Network Exploration and Analysis. IEEE Transactions on Visualization and Computer Graphics 26 6 (2020) 2168\u20132179. 10.1109\/TVCG.2020.2970512","DOI":"10.1109\/TVCG.2020.2970512"},{"key":"e_1_3_3_1_78_2","unstructured":"J Schulman B Zoph C Kim J Hilton J Menick J Weng JFC Uribe L Fedus L Metz M Pokorny et\u00a0al. 2022. ChatGPT: Optimizing language models for dialogue."},{"key":"e_1_3_3_1_79_2","doi-asserted-by":"publisher","DOI":"10.1145\/3011263.3011273"},{"key":"e_1_3_3_1_80_2","doi-asserted-by":"publisher","unstructured":"R. Sharma V.\u00a0I. Pavlovic and T.\u00a0S. Huang. 1998. Toward multimodal human-computer interface. Proc. IEEE 86 5 (May 1998) 853\u2013869. 10.1109\/5.664275","DOI":"10.1109\/5.664275"},{"key":"e_1_3_3_1_81_2","doi-asserted-by":"publisher","DOI":"10.1145\/2388676.2388793"},{"key":"e_1_3_3_1_82_2","doi-asserted-by":"publisher","DOI":"10.1145\/3313831.3376782"},{"key":"e_1_3_3_1_83_2","doi-asserted-by":"publisher","DOI":"10.1145\/2818346.2823304"},{"key":"e_1_3_3_1_84_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-02577-8_11"},{"key":"e_1_3_3_1_85_2","doi-asserted-by":"publisher","DOI":"10.1145\/1979742.1979703"},{"key":"e_1_3_3_1_86_2","unstructured":"Unity Technologies. 2024. XR Interaction Toolkit. https:\/\/docs.unity3d.com\/Packages\/com.unity.xr.interaction.toolkit. Version 3.x."},{"key":"e_1_3_3_1_87_2","doi-asserted-by":"publisher","unstructured":"Susanne Trick Franziska Herbert Constantin\u00a0A. Rothkopf and Dorothea Koert. 2022. Interactive Reinforcement Learning With Bayesian Fusion of Multimodal Advice. IEEE ROBOTICS AND AUTOMATION LETTERS 7 3 (July 2022) 7558\u20137565. 10.1109\/LRA.2022.3182100Num Pages: 8 Place: Piscataway Publisher: Ieee-Inst Electrical Electronics Engineers Inc Web of Science ID: WOS:000818872000012.","DOI":"10.1109\/LRA.2022.3182100"},{"key":"e_1_3_3_1_88_2","doi-asserted-by":"publisher","DOI":"10.1109\/IROS40897.2019.8968171"},{"key":"e_1_3_3_1_89_2","unstructured":"Maria Tsfasman Bernd Dudzik Kristian Fenech Andras Lorincz Catholijn\u00a0M. Jonker and Catharine Oertel. 2024. Introducing MeMo: A Multimodal Dataset for Memory Modelling in Multiparty Conversations. arxiv:https:\/\/arXiv.org\/abs\/2409.13715\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2409.13715"},{"key":"e_1_3_3_1_90_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8461210"},{"key":"e_1_3_3_1_91_2","first-page":"1","volume-title":"2009 International Conference on Advanced Robotics","author":"Vallee Mathieu","year":"2009","unstructured":"Mathieu Vallee, Brice Burger, Dominik Ertl, Frederic Lerasle, and Jurgen Falb. 2009. Improving user interfaces of interactive robots with multimodality. In 2009 International Conference on Advanced Robotics. 1\u20136. https:\/\/ieeexplore.ieee.org\/document\/5174686\/"},{"key":"e_1_3_3_1_92_2","doi-asserted-by":"publisher","DOI":"10.1109\/IAEAC50856.2021.9391068"},{"key":"e_1_3_3_1_93_2","doi-asserted-by":"publisher","unstructured":"Zeyu Wang Yuanchun Shi Yuntao Wang Yuchen Yao Kun Yan Yuhan Wang Lei Ji Xuhai Xu and Chun Yu. 2024. G-VOILA: Gaze-Facilitated Information Querying in Daily Scenarios. Proceedings of the ACM on Interactive Mobile Wearable and Ubiquitous Technologies 8 2 (May 2024) 1\u201333. 10.1145\/3659623Publisher: Association for Computing Machinery.","DOI":"10.1145\/3659623"},{"key":"e_1_3_3_1_94_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487507"},{"key":"e_1_3_3_1_95_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-24667-823"},{"key":"e_1_3_3_1_96_2","volume-title":"Multimodal Architecture and Interfaces","author":"Consortium World Wide Web","year":"2012","unstructured":"World Wide Web Consortium. 2012. Multimodal Architecture and Interfaces. W3C Recommendation. W3C. https:\/\/www.w3.org\/TR\/2012\/REC-mmi-arch-20121025\/ Accessed: 2025-04-02."},{"key":"e_1_3_3_1_97_2","doi-asserted-by":"publisher","DOI":"10.1109\/BSN.2018.8329675"},{"key":"e_1_3_3_1_98_2","doi-asserted-by":"publisher","unstructured":"Zishuo Xia Zhiquan Feng Xiaohui Yang Dehui Kong and Hong Cui. 2023. MFIRA: Multimodal Fusion Intent Recognition Algorithm for AR Chemistry Experiments. APPLIED SCIENCES-BASEL 13 14 (July 2023) 8200. 10.3390\/app13148200","DOI":"10.3390\/app13148200"},{"key":"e_1_3_3_1_99_2","doi-asserted-by":"publisher","unstructured":"Xiaojia Xiang Qin Tan Han Zhou Dengqing Tang and Jun Lai. 2022. Multimodal Fusion of Voice and Gesture Data for UAV Control. Drones 6 8 (2022). 10.3390\/drones6080201","DOI":"10.3390\/drones6080201"},{"key":"e_1_3_3_1_100_2","doi-asserted-by":"publisher","DOI":"10.1109\/CCDC55256.2022.10033568"},{"key":"e_1_3_3_1_101_2","doi-asserted-by":"publisher","unstructured":"Ce Zhou Qian Li Chen Li Jun Yu Yixin Liu Guangjing Wang Kai Zhang Cheng Ji Qiben Yan Lifang He Hao Peng Jianxin Li Jia Wu Ziwei Liu Pengtao Xie Caiming Xiong Jian Pei Philip\u00a0S. Yu and Lichao Sun. 2024. A comprehensive survey on pretrained foundation models: a history from BERT to ChatGPT. International Journal of Machine Learning and Cybernetics (24 Nov 2024). 10.1007\/s13042-024-02443-6","DOI":"10.1007\/s13042-024-02443-6"},{"key":"e_1_3_3_1_102_2","doi-asserted-by":"publisher","DOI":"10.1145\/3491101.3503552"},{"key":"e_1_3_3_1_103_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461568"}],"event":{"name":"ICMI '25: International Conference on Multimodal Interaction","location":"Canberra Australia","acronym":"ICMI '25","sponsor":["SIGCHI ACM Special Interest Group on Computer-Human Interaction"]},"container-title":["Proceedings of the 27th International Conference on Multimodal Interaction"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3716553.3750790","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,1,26]],"date-time":"2026-01-26T22:26:10Z","timestamp":1769466370000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3716553.3750790"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,12]]},"references-count":102,"alternative-id":["10.1145\/3716553.3750790","10.1145\/3716553"],"URL":"https:\/\/doi.org\/10.1145\/3716553.3750790","relation":{},"subject":[],"published":{"date-parts":[[2025,10,12]]},"assertion":[{"value":"2025-10-12","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}