{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T20:18:19Z","timestamp":1783109899501,"version":"3.54.6"},"reference-count":50,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100018588","name":"Yibin Science and Technology Planning Program","doi-asserted-by":"publisher","award":["24KJJH0070"],"award-info":[{"award-number":["24KJJH0070"]}],"id":[{"id":"10.13039\/501100018588","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004829","name":"Science and Technology Department of Sichuan Province","doi-asserted-by":"publisher","award":["2024YFCY0003"],"award-info":[{"award-number":["2024YFCY0003"]}],"id":[{"id":"10.13039\/501100004829","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Fusion"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.inffus.2026.104392","type":"journal-article","created":{"date-parts":[[2026,4,24]],"date-time":"2026-04-24T06:17:32Z","timestamp":1777011452000},"page":"104392","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["EMNet: Efficient Multimodal Network for Action Recognition"],"prefix":"10.1016","volume":"135","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6462-5320","authenticated-orcid":false,"given":"Sophyani Banaamwini","family":"Yussif","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1509-464X","authenticated-orcid":false,"given":"Ning","family":"Xie","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5070-4511","authenticated-orcid":false,"given":"Yang","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0929-9067","authenticated-orcid":false,"given":"Sheng","family":"Cao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"3","key":"10.1016\/j.inffus.2026.104392_bib0001","first-page":"3522","article-title":"MMNet: A model-based multimodal network for human action recognition in rgb-d videos","volume":"45","author":"Bruce","year":"2022","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"10.1016\/j.inffus.2026.104392_bib0002","doi-asserted-by":"crossref","DOI":"10.1109\/TCSVT.2025.3529989","article-title":"Asymmetric context-guided adaptive alignment network for Skeleton-based action recognition","author":"Cao","year":"2025","journal-title":"IEEE Trans. Circuits Syst. Video Technol. (TCSVT)"},{"key":"10.1016\/j.inffus.2026.104392_bib0003","series-title":"Proc. 31st ACM Int. Conf. Multimedia (MM)","first-page":"27","article-title":"Self-relational graph convolution network for skeleton-based action recognition","author":"Yussif","year":"2023"},{"key":"10.1016\/j.inffus.2026.104392_bib0004","article-title":"DSDC-GCN: Decoupled static-dynamic co-occurrence graph convolutional networks for skeleton-based action recognition","author":"Zhuang","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol. (TCSVT)"},{"key":"10.1016\/j.inffus.2026.104392_bib0005","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR)","first-page":"4724","article-title":"Quo vadis, action recognition? A new model and the kinetics dataset","author":"Carreira","year":"2017"},{"key":"10.1016\/j.inffus.2026.104392_bib0006","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR)","first-page":"203","article-title":"X3d: Expanding architectures for efficient video recognition","author":"Feichtenhofer","year":"2020"},{"key":"10.1016\/j.inffus.2026.104392_bib0007","article-title":"Human-centric transformer for domain adaptive action recognition","author":"Lin","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"10.1016\/j.inffus.2026.104392_bib0008","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2024.127882","article-title":"Temporal cues enhanced multimodal learning for action recognition in RGB-D videos","volume":"594","author":"Liu","year":"2024","journal-title":"Neurocomputing"},{"issue":"12","key":"10.1016\/j.inffus.2026.104392_bib0009","doi-asserted-by":"crossref","first-page":"9703","DOI":"10.1109\/TPAMI.2021.3127885","article-title":"VPN++: Rethinking video-pose embeddings for understanding activities of daily living","volume":"44","author":"Das","year":"2021","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"10.1016\/j.inffus.2026.104392_bib0010","article-title":"Enhancing skeleton-based action recognition with language descriptions from pre-trained large multimodal models","author":"He","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol. (TCSVT)"},{"key":"10.1016\/j.inffus.2026.104392_bib0011","article-title":"Semantic information guided multimodal skeleton-based action recognition","author":"Li","year":"2025","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104392_bib0012","series-title":"Proc. IEEE\/CVF Int. Conf. Comput. Vis. (ICCV)","first-page":"13359","article-title":"Channel-wise topology refinement graph convolution for skeleton-based action recognition","author":"Chen","year":"2021"},{"key":"10.1016\/j.inffus.2026.104392_bib0013","series-title":"Proc. 32nd AAAI Conf. Artif. Intell. (AAAI)","article-title":"Spatial temporal graph convolutional networks for skeleton-based action recognition","volume":"32","author":"Yan","year":"2018"},{"issue":"19","key":"10.1016\/j.inffus.2026.104392_bib0014","doi-asserted-by":"crossref","first-page":"56489","DOI":"10.1007\/s11042-023-17697-5","article-title":"An approach combining convolutional layers and gated recurrent unit to recognize human activities","volume":"83","author":"Ullah","year":"2024","journal-title":"Multimedia Tools and Applications"},{"issue":"9","key":"10.1016\/j.inffus.2026.104392_bib0015","doi-asserted-by":"crossref","first-page":"5174","DOI":"10.1109\/TCSVT.2023.3250646","article-title":"Spatio-temporal adaptive network with bidirectional temporal difference for action recognition","volume":"33","author":"Li","year":"2023","journal-title":"IEEE Trans. Circuits Syst. Video Technol. (TCSVT)"},{"key":"10.1016\/j.inffus.2026.104392_bib0016","series-title":"Proc. Eur. Conf. Comput. Vis. (ECCV)","first-page":"396","article-title":"Internvideo2: Scaling foundation models for multimodal video understanding","author":"Wang","year":"2024"},{"key":"10.1016\/j.inffus.2026.104392_bib0017","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2024.102731","article-title":"Human activity recognition using binary sensors: A systematic review","volume":"115","author":"Khan","year":"2025","journal-title":"Inf. Fusion"},{"issue":"1","key":"10.1016\/j.inffus.2026.104392_bib0018","doi-asserted-by":"crossref","first-page":"581","DOI":"10.1109\/JSEN.2020.3015521","article-title":"Layer-wise training convolutional neural networks with smaller filters for human activity recognition using wearable sensors","volume":"21","author":"Tang","year":"2020","journal-title":"IEEE Sens. J."},{"key":"10.1016\/j.inffus.2026.104392_bib0019","doi-asserted-by":"crossref","DOI":"10.1109\/JSEN.2024.3446290","article-title":"EGTCN: An efficient graph and temporal convolution network for sensor-based human activity recognition in federated learning","author":"Yussif","year":"2024","journal-title":"IEEE Sens. J."},{"key":"10.1016\/j.inffus.2026.104392_bib0020","doi-asserted-by":"crossref","first-page":"47","DOI":"10.1016\/j.inffus.2022.10.015","article-title":"Human activity recognition based on multienvironment sensor data","volume":"91","author":"Li","year":"2023","journal-title":"Inf. Fusion"},{"issue":"1","key":"10.1016\/j.inffus.2026.104392_bib0021","doi-asserted-by":"crossref","first-page":"34","DOI":"10.1109\/TCSVT.2023.3236430","article-title":"Motion complement and temporal multifocusing for skeleton-based action recognition","volume":"34","author":"Wu","year":"2023","journal-title":"IEEE Trans. Circuits Syst. Video Technol. (TCSVT)"},{"key":"10.1016\/j.inffus.2026.104392_bib0022","article-title":"Asynchronous joint-based temporal pooling for skeleton-based action recognition","author":"Gunasekara","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol. (TCSVT)"},{"key":"10.1016\/j.inffus.2026.104392_bib0023","article-title":"Two-stream convolutional networks for action recognition in videos","volume":"27","author":"Simonyan","year":"2014","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.inffus.2026.104392_bib0024","series-title":"Proc. IEEE Int. Conf. Comput. Vis. (ICCV)","first-page":"6202","article-title":"Slowfast networks for video recognition","author":"Feichtenhofer","year":"2019"},{"key":"10.1016\/j.inffus.2026.104392_bib0025","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2025.129781","article-title":"EPAM-Net: An efficient pose-driven attention-guided multimodal network for video action recognition","volume":"633","author":"Abdelkawy","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.inffus.2026.104392_bib0026","article-title":"Vision-semantics-label: A new two-step paradigm for action recognition with large language model","author":"Chen","year":"2025","journal-title":"IEEE Trans. Circuits Syst. Video Technol. (TCSVT)"},{"key":"10.1016\/j.inffus.2026.104392_bib0027","series-title":"Proc. IEEE Int. Conf. Comput. Vis. (ICCV)","first-page":"10444","article-title":"Hierarchically decomposed graph convolutional networks for skeleton-based action recognition","author":"Lee","year":"2023"},{"key":"10.1016\/j.inffus.2026.104392_bib0028","series-title":"Proc. Eur. Conf. Comput. Vis. (ECCV)","first-page":"19","article-title":"Hunting group clues with transformers for social group activity recognition","author":"Tamura","year":"2022"},{"key":"10.1016\/j.inffus.2026.104392_bib0029","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR)","first-page":"2596","article-title":"Visual recognition by counting instances: A multi-instance cardinality potential kernel","author":"Hajimirsadeghi","year":"2015"},{"key":"10.1016\/j.inffus.2026.104392_bib0030","doi-asserted-by":"crossref","first-page":"1633","DOI":"10.1109\/LSP.2019.2942739","article-title":"Action machine: Toward person-centric action recognition in videos","volume":"26","author":"Zhu","year":"2019","journal-title":"IEEE Signal Process. Lett."},{"key":"10.1016\/j.inffus.2026.104392_bib0031","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR)","first-page":"18340","article-title":"Just add \u03c0! pose induced video transformers for understanding activities of daily living","author":"Reilly","year":"2024"},{"key":"10.1016\/j.inffus.2026.104392_bib0032","series-title":"Int. Conf. Mach. Learn. (ICML)","first-page":"6105","article-title":"Efficientnet: Rethinking model scaling for convolutional neural networks","author":"Tan","year":"2019"},{"key":"10.1016\/j.inffus.2026.104392_bib0033","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR)","first-page":"1010","article-title":"NTU RGB+ D: A large scale dataset for 3D human activity analysis","author":"Shahroudy","year":"2016"},{"issue":"10","key":"10.1016\/j.inffus.2026.104392_bib0034","doi-asserted-by":"crossref","first-page":"2684","DOI":"10.1109\/TPAMI.2019.2916873","article-title":"NTU RGB+ D 120: A large-scale benchmark for 3D human activity understanding","volume":"42","author":"Liu","year":"2019","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"10.1016\/j.inffus.2026.104392_bib0035","series-title":"Proc. IEEE\/CVF Int. Conf. Comput. Vis. (ICCV)","first-page":"833","article-title":"Toyota smarthome: Real-world activities of daily living","author":"Das","year":"2019"},{"key":"10.1016\/j.inffus.2026.104392_bib0036","series-title":"Proc. Workshop Vis. Anal. Smart Connected Communities","first-page":"1","article-title":"PKU-MMD: A large scale benchmark for skeleton-based human action understanding","author":"Liu","year":"2017"},{"key":"10.1016\/j.inffus.2026.104392_bib0037","article-title":"UCF101: A dataset of 101 human actions classes from videos in the wild","author":"Soomro","year":"2012","journal-title":"CoRR"},{"key":"10.1016\/j.inffus.2026.104392_bib0038","series-title":"Int. Conf. Comput. Vis. (ICCV)","first-page":"2556","article-title":"HMDB: A large video database for human motion recognition","author":"Kuehne","year":"2011"},{"issue":"8","key":"10.1016\/j.inffus.2026.104392_bib0039","doi-asserted-by":"crossref","first-page":"7244","DOI":"10.1109\/TCSVT.2024.3375512","article-title":"Multi-scale structural graph convolutional network for skeleton-based action recognition","volume":"34","author":"Jang","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol. (TCSVT)"},{"key":"10.1016\/j.inffus.2026.104392_bib0040","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR)","first-page":"2969","article-title":"Revisiting skeleton-based action recognition","author":"Duan","year":"2022"},{"key":"10.1016\/j.inffus.2026.104392_bib0041","series-title":"Proc. AAAI Conf. Artif. Intell. (AAAI)","first-page":"3199","article-title":"Multimodal fusion via teacher-student network for indoor action recognition","volume":"35","author":"Bruce","year":"2021"},{"key":"10.1016\/j.inffus.2026.104392_bib0042","series-title":"Proc. IEEE\/CVF Winter Conf. Appl. Comput. Vis. (WACV)","first-page":"2363","article-title":"Selective spatio-temporal aggregation based pose refinement system: Towards understanding human activities in real-world videos","author":"Yang","year":"2021"},{"key":"10.1016\/j.inffus.2026.104392_bib0043","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR)","first-page":"1362","article-title":"Cross-view activity recognition using hankelets","author":"Li","year":"2012"},{"key":"10.1016\/j.inffus.2026.104392_bib0044","first-page":"12493","article-title":"Keeping your eye on the ball: Trajectory attention in video transformers","volume":"34","author":"Patrick","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.inffus.2026.104392_bib0045","doi-asserted-by":"crossref","first-page":"132161","DOI":"10.1109\/ACCESS.2019.2940281","article-title":"SRNet: Structured relevance feature learning network from skeleton data for human action recognition","volume":"7","author":"Nie","year":"2019","journal-title":"IEEE Access"},{"issue":"2","key":"10.1016\/j.inffus.2026.104392_bib0046","doi-asserted-by":"crossref","first-page":"388","DOI":"10.1049\/ipr2.12640","article-title":"Multi-modal fusion method for human action recognition based on IALC","volume":"17","author":"Zhang","year":"2023","journal-title":"IET Image Process."},{"key":"10.1016\/j.inffus.2026.104392_bib0047","series-title":"Proc. IEEE Int. Conf. Comput. Vis. (ICCV)","first-page":"6321","article-title":"Temporal attentive alignment for large-scale video domain adaptation","author":"Chen","year":"2019"},{"key":"10.1016\/j.inffus.2026.104392_bib0048","doi-asserted-by":"crossref","first-page":"6593","DOI":"10.1109\/TMM.2025.3586118","article-title":"MVP-shot: Multi-velocity progressive-alignment framework for few-shot action recognition","volume":"27","author":"Qu","year":"2025","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/j.inffus.2026.104392_bib0049","article-title":"Spatio-temporal decoupled knowledge compensator for few-shot action recognition","volume":"PP","author":"Hongyu","year":"2026","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"10.1016\/j.inffus.2026.104392_bib0050","first-page":"1","article-title":"Locality-aware cross-modal correspondence learning for dense audio-visual events detection","author":"Xing","year":"2025","journal-title":"IEEE Trans. Circuits Syst. Video Technol. (TCSVT)"}],"container-title":["Information Fusion"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S156625352600271X?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S156625352600271X?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T19:40:01Z","timestamp":1783107601000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S156625352600271X"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":50,"alternative-id":["S156625352600271X"],"URL":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104392","relation":{},"ISSN":["1566-2535"],"issn-type":[{"value":"1566-2535","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"EMNet: Efficient Multimodal Network for Action Recognition","name":"articletitle","label":"Article Title"},{"value":"Information Fusion","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104392","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"104392"}}