{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T01:54:39Z","timestamp":1785894879541,"version":"3.56.0"},"reference-count":54,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100018542","name":"Natural Science Foundation of Sichuan Province","doi-asserted-by":"publisher","award":["2025ZNSFSC0480"],"award-info":[{"award-number":["2025ZNSFSC0480"]}],"id":[{"id":"10.13039\/501100018542","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["22494712"],"award-info":[{"award-number":["22494712"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62376175"],"award-info":[{"award-number":["62376175"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U2333211"],"award-info":[{"award-number":["U2333211"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.patcog.2026.114171","type":"journal-article","created":{"date-parts":[[2026,6,22]],"date-time":"2026-06-22T16:22:50Z","timestamp":1782145370000},"page":"114171","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PC","title":["Ego-LM: Prompting frozen language models for multi-modal egocentric action recognition"],"prefix":"10.1016","volume":"180","author":[{"given":"Deng","family":"Xiong","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5159-5954","authenticated-orcid":false,"given":"Yang","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yalan","family":"Ye","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shu-Dong","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.114171_b1","doi-asserted-by":"crossref","unstructured":"J. Carreira, A. Zisserman, Quo vadis, action recognition? a new model and the kinetics dataset, in: CVPR, 2017, pp. 6299\u20136308.","DOI":"10.1109\/CVPR.2017.502"},{"key":"10.1016\/j.patcog.2026.114171_b2","doi-asserted-by":"crossref","first-page":"346","DOI":"10.1016\/j.patcog.2017.02.030","article-title":"Enhanced skeleton visualization for view invariant human action recognition","volume":"68","author":"Liu","year":"2017","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114171_b3","doi-asserted-by":"crossref","unstructured":"D. Damen, H. Doughty, G.M. Farinella, S. Fidler, A. Furnari, E. Kazakos, D. Moltisanti, J. Munro, T. Perrett, W. Price, et al., Scaling egocentric vision: The epic-kitchens dataset, in: ECCV, 2018, pp. 720\u2013736.","DOI":"10.1007\/978-3-030-01225-0_44"},{"key":"10.1016\/j.patcog.2026.114171_b4","doi-asserted-by":"crossref","unstructured":"S. Sudhakaran, S. Escalera, O. Lanz, Lsta: Long short-term attention for egocentric action recognition, in: CVPR, 2019, pp. 9954\u20139963.","DOI":"10.1109\/CVPR.2019.01019"},{"key":"10.1016\/j.patcog.2026.114171_b5","doi-asserted-by":"crossref","unstructured":"F. Baradel, N. Neverova, C. Wolf, J. Mille, G. Mori, Object level visual reasoning in videos, in: ECCV, 2018, pp. 105\u2013121.","DOI":"10.1007\/978-3-030-01261-8_7"},{"key":"10.1016\/j.patcog.2026.114171_b6","doi-asserted-by":"crossref","unstructured":"Y. Li, T. Nagarajan, B. Xiong, K. Grauman, Ego-exo: Transferring visual representations from third-person to first-person videos, in: CVPR, 2021, pp. 6943\u20136953.","DOI":"10.1109\/CVPR46437.2021.00687"},{"key":"10.1016\/j.patcog.2026.114171_b7","doi-asserted-by":"crossref","unstructured":"E. Kazakos, A. Nagrani, A. Zisserman, D. Damen, Epic-fusion: Audio-visual temporal binding for egocentric action recognition, in: ICCV, 2019, pp. 5492\u20135501.","DOI":"10.1109\/ICCV.2019.00559"},{"key":"10.1016\/j.patcog.2026.114171_b8","doi-asserted-by":"crossref","unstructured":"J. Munro, D. Damen, Multi-modal domain adaptation for fine-grained action recognition, in: CVPR, 2020, pp. 122\u2013132.","DOI":"10.1109\/CVPR42600.2020.00020"},{"issue":"11","key":"10.1016\/j.patcog.2026.114171_b9","doi-asserted-by":"crossref","first-page":"4125","DOI":"10.1109\/TPAMI.2020.2991965","article-title":"The epic-kitchens dataset: Collection, challenges and baselines","volume":"43","author":"Damen","year":"2020","journal-title":"IEEE T-PAMI"},{"key":"10.1016\/j.patcog.2026.114171_b10","doi-asserted-by":"crossref","unstructured":"K. Grauman, A. Westbury, E. Byrne, Z. Chavis, A. Furnari, R. Girdhar, J. Hamburger, H. Jiang, M. Liu, X. Liu, et al., Ego4d: Around the world in 3,000 hours of egocentric video, in: CVPR, 2022, pp. 18995\u201319012.","DOI":"10.1109\/CVPR52688.2022.01842"},{"key":"10.1016\/j.patcog.2026.114171_b11","doi-asserted-by":"crossref","unstructured":"R. Herzig, E. Ben-Avraham, K. Mangalam, A. Bar, G. Chechik, A. Rohrbach, T. Darrell, A. Globerson, Object-region video transformers, in: CVPR, 2022, pp. 3148\u20133159.","DOI":"10.1109\/CVPR52688.2022.00315"},{"key":"10.1016\/j.patcog.2026.114171_b12","first-page":"12249","article-title":"Symbiotic attention with privileged information for egocentric action recognition","volume":"vol. 34","author":"Wang","year":"2020"},{"key":"10.1016\/j.patcog.2026.114171_b13","series-title":"Towards training stronger video vision transformers for epic-kitchens-100 action recognition","author":"Huang","year":"2021"},{"key":"10.1016\/j.patcog.2026.114171_b14","doi-asserted-by":"crossref","first-page":"1332","DOI":"10.1109\/LSP.2022.3178899","article-title":"Regularizing visual semantic embedding with contrastive learning for image-text matching","volume":"29","author":"Liu","year":"2022","journal-title":"IEEE Signal Process. Lett."},{"key":"10.1016\/j.patcog.2026.114171_b15","series-title":"Aligning information capacity between vision and language via dense-to-sparse feature distillation for image-text matching","author":"Liu","year":"2025"},{"key":"10.1016\/j.patcog.2026.114171_b16","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.114171_b17","series-title":"Gpt-4 technical report","author":"Achiam","year":"2023"},{"key":"10.1016\/j.patcog.2026.114171_b18","series-title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"key":"10.1016\/j.patcog.2026.114171_b19","series-title":"NeurIPS","article-title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","author":"Dai","year":"2023"},{"key":"10.1016\/j.patcog.2026.114171_b20","series-title":"Video-LLaMA: An instruction-tuned audio-visual language model for video understanding","author":"Zhang","year":"2023"},{"key":"10.1016\/j.patcog.2026.114171_b21","series-title":"VideoChat: Chat-centric video understanding","author":"Li","year":"2024"},{"key":"10.1016\/j.patcog.2026.114171_b22","series-title":"ICLR","article-title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","author":"Zhu","year":"2024"},{"key":"10.1016\/j.patcog.2026.114171_b23","series-title":"Llava-OneVision: Easy visual task transfer","author":"Li","year":"2024"},{"key":"10.1016\/j.patcog.2026.114171_b24","doi-asserted-by":"crossref","first-page":"423","DOI":"10.1162\/tacl_a_00324","article-title":"How can we know what language models know?","volume":"8","author":"Jiang","year":"2020","journal-title":"TACL"},{"issue":"9","key":"10.1016\/j.patcog.2026.114171_b25","doi-asserted-by":"crossref","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","article-title":"Learning to prompt for vision-language models","volume":"130","author":"Zhou","year":"2022","journal-title":"IJCV"},{"key":"10.1016\/j.patcog.2026.114171_b26","doi-asserted-by":"crossref","unstructured":"K. Zhou, J. Yang, C.C. Loy, Z. Liu, Conditional prompt learning for vision-language models, in: CVPR, 2022, pp. 16816\u201316825.","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"10.1016\/j.patcog.2026.114171_b27","series-title":"ECCV","first-page":"709","article-title":"Visual prompt tuning","author":"Jia","year":"2022"},{"key":"10.1016\/j.patcog.2026.114171_b28","series-title":"With a little help from my temporal context: Multimodal egocentric action recognition","author":"Kazakos","year":"2021"},{"key":"10.1016\/j.patcog.2026.114171_b29","doi-asserted-by":"crossref","unstructured":"Y. Zhao, I. Misra, P. Kr\u00e4henb\u00fchl, R. Girdhar, Learning Video Representations from Large Language Models, in: CVPR, 2023.","DOI":"10.1109\/CVPR52729.2023.00637"},{"key":"10.1016\/j.patcog.2026.114171_b30","doi-asserted-by":"crossref","unstructured":"J. Chalk, J. Huh, E. Kazakos, A. Zisserman, D. Damen, TIM: A Time Interval Machine for Audio-Visual Action Recognition, in: CVPR, 2024.","DOI":"10.1109\/CVPR52733.2024.01719"},{"key":"10.1016\/j.patcog.2026.114171_b31","series-title":"LLaVAction: Evaluating and training multi-modal large language models for action recognition","author":"Ye","year":"2025"},{"key":"10.1016\/j.patcog.2026.114171_b32","series-title":"ECCV","first-page":"20","article-title":"Temporal segment networks: Towards good practices for deep action recognition","author":"Wang","year":"2016"},{"key":"10.1016\/j.patcog.2026.114171_b33","doi-asserted-by":"crossref","unstructured":"J. Lin, C. Gan, S. Han, Tsm: Temporal shift module for efficient video understanding, in: ICCV, 2019, pp. 7083\u20137093.","DOI":"10.1109\/ICCV.2019.00718"},{"key":"10.1016\/j.patcog.2026.114171_b34","doi-asserted-by":"crossref","unstructured":"C. Feichtenhofer, H. Fan, J. Malik, K. He, Slowfast networks for video recognition, in: ICCV, 2019, pp. 6202\u20136211.","DOI":"10.1109\/ICCV.2019.00630"},{"key":"10.1016\/j.patcog.2026.114171_b35","doi-asserted-by":"crossref","unstructured":"A. Arnab, M. Dehghani, G. Heigold, C. Sun, M. Lu\u010di\u0107, C. Schmid, Vivit: A video vision transformer, in: ICCV, 2021, pp. 6836\u20136846.","DOI":"10.1109\/ICCV48922.2021.00676"},{"key":"10.1016\/j.patcog.2026.114171_b36","first-page":"19594","article-title":"Space-time mixing attention for video transformer","volume":"34","author":"Bulat","year":"2021","journal-title":"NeurIPS"},{"key":"10.1016\/j.patcog.2026.114171_b37","first-page":"12493","article-title":"Keeping your eye on the ball: Trajectory attention in video transformers","volume":"34","author":"Patrick","year":"2021","journal-title":"NeurIPS"},{"key":"10.1016\/j.patcog.2026.114171_b38","series-title":"AVT: Audio-video transformer for multimodal action recognition","author":"Zhu","year":"2022"},{"key":"10.1016\/j.patcog.2026.114171_b39","doi-asserted-by":"crossref","unstructured":"S. Yan, X. Xiong, A. Arnab, Z. Lu, M. Zhang, C. Sun, C. Schmid, Multiview transformers for video recognition, in: CVPR, 2022, pp. 3333\u20133343.","DOI":"10.1109\/CVPR52688.2022.00333"},{"key":"10.1016\/j.patcog.2026.114171_b40","series-title":"Temporally-adaptive models for efficient video understanding","author":"Huang","year":"2023"},{"key":"10.1016\/j.patcog.2026.114171_b41","doi-asserted-by":"crossref","unstructured":"J. Huh, J. Chalk, E. Kazakos, D. Damen, A. Zisserman, EPIC-SOUNDS: A Large-Scale Dataset of Actions that Sound, in: ICASSP, 2023.","DOI":"10.1109\/ICASSP49357.2023.10096198"},{"key":"10.1016\/j.patcog.2026.114171_b42","series-title":"ICASSP","first-page":"855","article-title":"Slow-fast auditory streams for audio recognition","author":"Kazakos","year":"2021"},{"key":"10.1016\/j.patcog.2026.114171_b43","series-title":"Bert: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018"},{"key":"10.1016\/j.patcog.2026.114171_b44","article-title":"Distilling interaction knowledge for semi-supervised egocentric action recognition","volume":"157","author":"Wang","year":"2025","journal-title":"PR"},{"key":"10.1016\/j.patcog.2026.114171_b45","article-title":"Auxiliary audio\u2013textual modalities for better action recognition on vision-specific annotated videos","volume":"156","author":"Alfasly","year":"2024","journal-title":"PR"},{"key":"10.1016\/j.patcog.2026.114171_b46","doi-asserted-by":"crossref","unstructured":"S. Pramanick, Y. Song, S. Nag, K.Q. Lin, H. Shah, M.Z. Shou, R. Chellappa, P. Zhang, EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the Backbone, in: ICCV, 2024.","DOI":"10.1109\/ICCV51070.2023.00487"},{"key":"10.1016\/j.patcog.2026.114171_b47","series-title":"EgoVideo: Exploring egocentric foundation model and downstream adaptation","author":"Pei","year":"2024"},{"key":"10.1016\/j.patcog.2026.114171_b48","series-title":"PLLaVA: Parameter-free LLaVA extension from images to videos for video dense captioning","author":"Yang","year":"2024"},{"key":"10.1016\/j.patcog.2026.114171_b49","doi-asserted-by":"crossref","unstructured":"Y. Li, M. Liu, J.M. Rehg, In the eye of beholder: Joint learning of gaze and actions in first person video, in: ECCV, 2018, pp. 619\u2013635.","DOI":"10.1007\/978-3-030-01228-1_38"},{"key":"10.1016\/j.patcog.2026.114171_b50","series-title":"Attention is all we need: Nailing down object-centric attention for egocentric activity recognition","author":"Sudhakaran","year":"2018"},{"key":"10.1016\/j.patcog.2026.114171_b51","doi-asserted-by":"crossref","unstructured":"G. Kapidis, R. Poppe, E. van Dam, L. Noldus, R. Veltkamp, Multitask learning to improve egocentric action recognition, in: ICCVW, 2019.","DOI":"10.1109\/ICCVW.2019.00540"},{"key":"10.1016\/j.patcog.2026.114171_b52","doi-asserted-by":"crossref","unstructured":"M. Lu, D. Liao, Z.-N. Li, Learning spatiotemporal attention for egocentric action recognition, in: ICCVW, 2019.","DOI":"10.1109\/ICCVW.2019.00543"},{"key":"10.1016\/j.patcog.2026.114171_b53","doi-asserted-by":"crossref","first-page":"7795","DOI":"10.1109\/TIP.2020.3007841","article-title":"Mutual context network for jointly estimating egocentric gaze and action","volume":"29","author":"Huang","year":"2020","journal-title":"IEEE T-IP"},{"key":"10.1016\/j.patcog.2026.114171_b54","doi-asserted-by":"crossref","unstructured":"K. Min, J.J. Corso, Integrating human gaze into attention for egocentric activity recognition, in: WACV, 2021, pp. 1069\u20131078.","DOI":"10.1109\/WACV48630.2021.00111"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326011362?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326011362?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T01:42:31Z","timestamp":1785894151000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326011362"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":54,"alternative-id":["S0031320326011362"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.114171","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Ego-LM: Prompting frozen language models for multi-modal egocentric action recognition","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.114171","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"114171"}}