{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,24]],"date-time":"2026-06-24T16:24:27Z","timestamp":1782318267759,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":28,"publisher":"ACM","funder":[{"name":"JST Moonshot R&D Grant","award":["JPMJMS2012"],"award-info":[{"award-number":["JPMJMS2012"]}]},{"name":"New Energy and Industrial Technology Development Organization","award":["JPNP23025"],"award-info":[{"award-number":["JPNP23025"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,3,16]]},"DOI":"10.1145\/3745900.3746075","type":"proceedings-article","created":{"date-parts":[[2025,10,9]],"date-time":"2025-10-09T11:36:08Z","timestamp":1760009768000},"page":"302-311","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":4,"title":["GazeLLM: Multimodal LLMs incorporating Human Visual Attention"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3629-2514","authenticated-orcid":false,"given":"Jun","family":"Rekimoto","sequence":"first","affiliation":[{"name":"The University of Tokyo, Tokyo, Japan and Sony Computer Science Laboratories, Inc., Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,10,9]]},"reference":[{"key":"e_1_3_3_2_2_2","doi-asserted-by":"publisher","unstructured":"Kenan Bekta\u015f Jannis Strecker Simon Mayer and Kimberly Garcia. 2024. Gaze-enabled activity recognition for augmented reality feedback. Comput. Graph. 119 C (July 2024) 12\u00a0pages. 10.1016\/j.cag.2024.103909","DOI":"10.1016\/j.cag.2024.103909"},{"key":"e_1_3_3_2_3_2","doi-asserted-by":"publisher","DOI":"10.1145\/800049.801811"},{"key":"e_1_3_3_2_4_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N19-1423"},{"key":"e_1_3_3_2_5_2","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly Jakob Uszkoreit and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. arxiv:https:\/\/arXiv.org\/abs\/2010.11929\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2010.11929"},{"key":"e_1_3_3_2_6_2","unstructured":"Jakob Engel Kiran Somasundaram Michael Goesele Albert Sun Alexander Gamino Andrew Turner Arjang Talattof Arnie Yuan Bilal Souti Brighid Meredith Cheng Peng Chris Sweeney Cole Wilson Dan Barnes Daniel DeTone David Caruso Derek Valleroy Dinesh Ginjupalli Duncan Frost Edward Miller Elias Mueggler Evgeniy Oleinik Fan Zhang Guruprasad Somasundaram Gustavo Solaira Harry Lanaras Henry Howard-Jenkins Huixuan Tang Hyo\u00a0Jin Kim Jaime Rivera Ji Luo Jing Dong Julian Straub Kevin Bailey Kevin Eckenhoff Lingni Ma Luis Pesqueira Mark Schwesinger Maurizio Monge Nan Yang Nick Charron Nikhil Raina Omkar Parkhi Peter Borschowa Pierre Moulon Prince Gupta Raul Mur-Artal Robbie Pennington Sachin Kulkarni Sagar Miglani Santosh Gondi Saransh Solanki Sean Diener Shangyi Cheng Simon Green Steve Saarinen Suvam Patra Tassos Mourikis Thomas Whelan Tripti Singh Vasileios Balntas Vijay Baiyya Wilson Dreewes Xiaqing Pan Yang Lou Yipu Zhao Yusuf Mansour Yuyang Zou Zhaoyang Lv Zijian Wang Mingfei Yan Carl Ren Renzo\u00a0De Nardi and Richard Newcombe. 2023. Project Aria: A New Tool for Egocentric Multi-Modal AI Research. arxiv:https:\/\/arXiv.org\/abs\/2308.13561\u00a0[cs.HC] https:\/\/arxiv.org\/abs\/2308.13561"},{"key":"e_1_3_3_2_7_2","unstructured":"Chaoyou Fu Yuhan Dai Yondong Luo Lei Li Shuhuai Ren Renrui Zhang Zihan Wang Chenyu Zhou Yunhang Shen Mengdan Zhang et\u00a0al. 2024. Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2405.21075 (2024)."},{"key":"e_1_3_3_2_8_2","unstructured":"Chaoyou Fu Haojia Lin Zuwei Long Yunhang Shen Meng Zhao Yifan Zhang Xiong Wang Di Yin Long Ma Xiawu Zheng Ran He Rongrong Ji Yunsheng Wu Caifeng Shan and Xing Sun. 2024. VITA: Towards Open-Source Interactive Omni Multimodal LLM. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2408.05211 (2024)."},{"key":"e_1_3_3_2_9_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01834"},{"key":"e_1_3_3_2_10_2","doi-asserted-by":"publisher","DOI":"10.1145\/3025453.3025821"},{"key":"e_1_3_3_2_11_2","unstructured":"Prolific inc.2014. Prolific. https:\/\/www.prolific.co"},{"key":"e_1_3_3_2_12_2","unstructured":"Robert Konrad Nitish Padmanaban J.\u00a0Gabriel Buckmaster Kevin\u00a0C. Boyle and Gordon Wetzstein. 2024. GazeGPT: Augmenting Human Capabilities using Gaze-contingent Contextual AI for Smart Eyewear. arxiv:https:\/\/arXiv.org\/abs\/2401.17217\u00a0[cs.HC] https:\/\/arxiv.org\/abs\/2401.17217"},{"key":"e_1_3_3_2_13_2","first-page":"74","volume-title":"Text Summarization Branches Out","author":"Lin Chin-Yew","year":"2004","unstructured":"Chin-Yew Lin. 2004. ROUGE: A Package for Automatic Evaluation of Summaries. In Text Summarization Branches Out. Association for Computational Linguistics, Barcelona, Spain, 74\u201381. https:\/\/aclanthology.org\/W04-1013"},{"key":"e_1_3_3_2_14_2","unstructured":"Jiaying Lin Shuquan Ye and Rynson W.\u00a0H. Lau. 2024. Do Multimodal Large Language Models See Like Humans? arxiv:https:\/\/arXiv.org\/abs\/2412.09603\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2412.09603"},{"key":"e_1_3_3_2_15_2","unstructured":"Michele Mazzamuto Antonino Furnari Yoichi Sato and Giovanni\u00a0Maria Farinella. 2024. Gazing Into Missteps: Leveraging Eye-Gaze for Unsupervised Mistake Detection in Egocentric Videos of Skilled Human Activities. arxiv:https:\/\/arXiv.org\/abs\/2406.08379\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2406.08379"},{"key":"e_1_3_3_2_16_2","doi-asserted-by":"publisher","unstructured":"Zhifan Ni Esteve Valls\u00a0Mascar\u00f3 Hyemin Ahn and Dongheui Lee. 2023. Human\u2013object interaction prediction in videos through gaze following. Computer Vision and Image Understanding 233 (Aug. 2023) 103741. 10.1016\/j.cviu.2023.103741","DOI":"10.1016\/j.cviu.2023.103741"},{"key":"e_1_3_3_2_17_2","unstructured":"OpenAI. 2023. GPT-4 Technical Report. https:\/\/openai.com\/research\/gpt-4"},{"key":"e_1_3_3_2_18_2","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"e_1_3_3_2_19_2","unstructured":"pupil labs. [n. d.]. NEON: Eye tracking for research and beyond. https:\/\/pupil-labs.com\/products\/neon"},{"key":"e_1_3_3_2_20_2","doi-asserted-by":"crossref","unstructured":"Nils Reimers and Iryna Gurevych. 2019. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. arxiv:https:\/\/arXiv.org\/abs\/1908.10084\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/1908.10084","DOI":"10.18653\/v1\/D19-1410"},{"key":"e_1_3_3_2_21_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.conll-1.3"},{"key":"e_1_3_3_2_22_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW59228.2023.00265"},{"key":"e_1_3_3_2_23_2","volume-title":"Seeing with Humans: Gaze-Assisted Neural Image Captioning","author":"Sugano Yusuke","year":"2016","unstructured":"Yusuke Sugano and Andreas Bulling. 2016. Seeing with Humans: Gaze-Assisted Neural Image Captioning. Technical Report. arxiv:https:\/\/arXiv.org\/abs\/1608.05203http:\/\/arxiv.org\/abs\/1608.05203"},{"key":"e_1_3_3_2_24_2","unstructured":"Gemini Team. 2024. Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arxiv:https:\/\/arXiv.org\/abs\/2403.05530\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2403.05530"},{"key":"e_1_3_3_2_25_2","unstructured":"Peng Wang Shuai Bai Sinan Tan Shijie Wang Zhihao Fan Jinze Bai Keqin Chen Xuejing Liu Jialin Wang Wenbin Ge Yang Fan Kai Dang Mengfei Du Xuancheng Ren Rui Men Dayiheng Liu Chang Zhou Jingren Zhou and Junyang Lin. 2024. Qwen2-VL: Enhancing Vision-Language Model\u2019s Perception of the World at Any Resolution. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2409.12191 (2024)."},{"key":"e_1_3_3_2_26_2","unstructured":"Xintong Wang Xiaoyu Li Xingshan Li and Chris Biemann. 2024. Probing Large Language Models from A Human Behavioral Perspective. arxiv:https:\/\/arXiv.org\/abs\/2310.05216\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2310.05216"},{"key":"e_1_3_3_2_27_2","doi-asserted-by":"publisher","unstructured":"Zeyu Wang Yuanchun Shi Yuntao Wang Yuchen Yao Kun Yan Yuhan Wang Lei Ji Xuhai Xu and Chun Yu. 2024. G-VOILA: Gaze-Facilitated Information Querying in Daily Scenarios. Proc. ACM Interact. Mob. Wearable Ubiquitous Technol. 8 2 Article 78 (May 2024) 33\u00a0pages. 10.1145\/3659623","DOI":"10.1145\/3659623"},{"key":"e_1_3_3_2_28_2","unstructured":"Shukang Yin Chaoyou Fu Sirui Zhao Ke Li Xing Sun Tong Xu and Enhong Chen. 2023. A survey on multimodal large language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2306.13549 (2023)."},{"key":"e_1_3_3_2_29_2","unstructured":"Shukang Yin Chaoyou Fu Sirui Zhao Ke Li Xing Sun Tong Xu and Enhong Chen. 2024. A Survey on Multimodal Large Language Models. arxiv:https:\/\/arXiv.org\/abs\/2306.13549\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2306.13549"}],"event":{"name":"AHs 2025: The Augmented Humans International Conference","location":"Masdar City, Abu Dhabi United Arab Emirates","acronym":"AHs '25","sponsor":["SIGCHI ACM Special Interest Group on Computer-Human Interaction"]},"container-title":["Proceedings of the Augmented Humans International Conference 2025"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3745900.3746075","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,9]],"date-time":"2025-10-09T12:00:15Z","timestamp":1760011215000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3745900.3746075"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,3,16]]},"references-count":28,"alternative-id":["10.1145\/3745900.3746075","10.1145\/3745900"],"URL":"https:\/\/doi.org\/10.1145\/3745900.3746075","relation":{},"subject":[],"published":{"date-parts":[[2025,3,16]]},"assertion":[{"value":"2025-10-09","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}