{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,4]],"date-time":"2026-05-04T11:28:51Z","timestamp":1777894131553,"version":"3.51.4"},"reference-count":100,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2027,2,19]],"date-time":"2027-02-19T00:00:00Z","timestamp":1802995200000},"content-version":"am","delay-in-days":202,"URL":"http:\/\/www.elsevier.com\/open-access\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/100000015","name":"US Department of Energy","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100000015","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["2222881"],"award-info":[{"award-number":["2222881"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Fusion"],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1016\/j.inffus.2026.104225","type":"journal-article","created":{"date-parts":[[2026,2,13]],"date-time":"2026-02-13T00:47:50Z","timestamp":1770943670000},"page":"104225","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Multimodal action recognition for manufacturing assembly task through spatio-temporal knowledge fusion"],"prefix":"10.1016","volume":"132","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0922-9656","authenticated-orcid":false,"given":"Mahdi","family":"Bonyani","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3796-3137","authenticated-orcid":false,"given":"Maryam","family":"Soleymani","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9322-7778","authenticated-orcid":false,"given":"Chao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"key":"10.1016\/j.inffus.2026.104225_sbref0001","series-title":"2023 IEEE\/CVF Winter Conference on Applications of Computer Vision Workshops (WACVW)","first-page":"1","article-title":"Hand guided high resolution feature enhancement for fine-grained atomic action segmentation within complex human assemblies","author":"Myers","year":"2022"},{"key":"10.1016\/j.inffus.2026.104225_bib0002","series-title":"2013 IEEE International Conference on Computer Vision","first-page":"1809","article-title":"Group sparsity and geometry constrained dictionary learning for action recognition from depth maps","author":"Luo","year":"2013"},{"key":"10.1016\/j.inffus.2026.104225_bib0003","series-title":"2016 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","first-page":"2293","article-title":"Intuitive instruction of industrial robots: semantic process descriptions for small lot production","author":"Perzylo","year":"2016"},{"key":"10.1016\/j.inffus.2026.104225_bib0004","doi-asserted-by":"crossref","DOI":"10.1016\/j.autcon.2024.105701","article-title":"Lightweight detection of small tools for safer construction","volume":"167","author":"Soleymani","year":"2024","journal-title":"Autom. Constr."},{"key":"10.1016\/j.inffus.2026.104225_sbref0005","series-title":"2023 International Joint Conference on Neural Networks (IJCNN)","first-page":"01","article-title":"How object information improves skeleton-based human action recognition in assembly tasks","author":"Aganian","year":"2023"},{"key":"10.1016\/j.inffus.2026.104225_bib0006","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.112016","article-title":"User-agnostic adaptation of human locomotion intent: leveraging teacher-student-learning and ensemble modeling","volume":"299","author":"Bonyani","year":"2024","journal-title":"Knowledge-Based Syst."},{"key":"10.1016\/j.inffus.2026.104225_bib0007","doi-asserted-by":"crossref","first-page":"12","DOI":"10.1016\/j.jmsy.2023.03.001","article-title":"Classification of primitive manufacturing tasks from filtered event data","volume":"68","author":"Duarte","year":"2023","journal-title":"J. Manuf. Syst."},{"issue":"1","key":"10.1016\/j.inffus.2026.104225_bib0008","doi-asserted-by":"crossref","first-page":"4","DOI":"10.1007\/s11263-009-0273-6","article-title":"Humaneva: synchronized video and motion capture dataset and baseline algorithm for evaluation of articulated human motion","volume":"87","author":"Sigal","year":"2010","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.inffus.2026.104225_bib0009","series-title":"2017 International Conference on Innovations in Information, Embedded and Communication Systems (ICIIECS)","first-page":"1","article-title":"A survey on vision-based human action recognition","author":"Arora","year":"2017"},{"issue":"3","key":"10.1016\/j.inffus.2026.104225_bib0010","doi-asserted-by":"crossref","first-page":"4405","DOI":"10.1007\/s11042-015-3177-1","article-title":"A survey of depth and inertial sensor fusion for human action recognition","volume":"76","author":"Chen","year":"2017","journal-title":"Multimed. Tools Appl."},{"key":"10.1016\/j.inffus.2026.104225_sbref0011","doi-asserted-by":"crossref","first-page":"3728","DOI":"10.1109\/LRA.2021.3064149","article-title":"Fine-grained activity recognition for assembly videos","volume":"6","author":"Jones","year":"2020","journal-title":"IEEE Robot. Autom. Lett."},{"key":"10.1016\/j.inffus.2026.104225_bib0012","unstructured":"S. Profanter, Implementation and Evaluation of multimodal input\/output channels for task-based industrial robot programming, (2015). https:\/\/api.semanticscholar.org\/CorpusID:6738296. arXiv: 1503.04967."},{"key":"10.1016\/j.inffus.2026.104225_bib0013","series-title":"2015 3rd IAPR Asian Conference on Pattern Recognition (ACPR)","first-page":"579","article-title":"Skeleton based action recognition with convolutional neural network","author":"Du","year":"2015"},{"key":"10.1016\/j.inffus.2026.104225_bib0014","series-title":"CVPR 2011","first-page":"3169","article-title":"Action recognition by dense trajectories","author":"Wang","year":"2011"},{"key":"10.1016\/j.inffus.2026.104225_bib0015","series-title":"European Conference on Computer Vision","first-page":"20","article-title":"Temporal segment networks: towards good practices for deep action recognition","author":"Wang","year":"2016"},{"key":"10.1016\/j.inffus.2026.104225_bib0016","series-title":"Thirty-First AAAI Conference on Artificial Intelligence","article-title":"An end-to-end spatio-temporal attention model for human action recognition from skeleton data","author":"Song","year":"2017"},{"key":"10.1016\/j.inffus.2026.104225_bib0017","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"1159","article-title":"Recognizing human actions as the evolution of pose estimation maps","author":"Liu","year":"2018"},{"key":"10.1016\/j.inffus.2026.104225_bib0018","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"3199","article-title":"Multimodal fusion via teacher-student network for indoor action recognition","volume":"35","author":"Bruce","year":"2021"},{"issue":"3","key":"10.1016\/j.inffus.2026.104225_bib0019","doi-asserted-by":"crossref","first-page":"1250","DOI":"10.1109\/TCSVT.2021.3077512","article-title":"Spatiotemporal multimodal learning with 3D CNNs for video action recognition","volume":"32","author":"Wu","year":"2021","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.inffus.2026.104225_bib0020","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"20186","article-title":"Infogcn: representation learning for human skeleton-based action recognition","author":"Chi","year":"2022"},{"key":"10.1016\/j.inffus.2026.104225_bib0021","series-title":"Proceedings of the Asian Conference on Computer Vision","article-title":"Decoupled spatial-temporal attention network for skeleton-based action-gesture recognition","author":"Shi","year":"2020"},{"key":"10.1016\/j.inffus.2026.104225_bib0022","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"2049","article-title":"Blockgcn: redefine topology awareness for skeleton-based action recognition","author":"Zhou","year":"2024"},{"key":"10.1016\/j.inffus.2026.104225_bib0023","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2025.130015","article-title":"PRG-Net: point relationship-guided network for 3D human action recognition","volume":"635","author":"Du","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.inffus.2026.104225_bib0024","series-title":"Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"2755","article-title":"Distillation multiple choice learning for multimodal action recognition","author":"Garcia","year":"2021"},{"key":"10.1016\/j.inffus.2026.104225_bib0025","doi-asserted-by":"crossref","first-page":"1159","DOI":"10.1016\/j.promfg.2018.07.152","article-title":"Worker activity recognition in smart manufacturing using imu and semg signals with convolutional neural networks","volume":"26","author":"Tao","year":"2018","journal-title":"Procedia Manuf."},{"key":"10.1016\/j.inffus.2026.104225_sbref0027","series-title":"2021 IEEE 19th International Conference on Industrial Informatics (INDIN)","first-page":"1","article-title":"Monitoring of human-intensive assembly processes based on incomplete and indirect shopfloor observations","author":"Guiza","year":"2021"},{"key":"10.1016\/j.inffus.2026.104225_sbref0028","series-title":"2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"21064","article-title":"Assembly101: a large-scale multi-view video dataset for understanding procedural activities","author":"Sener","year":"2022"},{"key":"10.1016\/j.inffus.2026.104225_sbref0029","series-title":"Proceedings of the 11th International Conference on the Internet of Things","article-title":"Micro activities recognition and macro worksteps classification for industrial IoT processes","author":"Sopidis","year":"2021"},{"key":"10.1016\/j.inffus.2026.104225_sbref0030","article-title":"Multi-modal recognition of worker activity for human-centered intelligent manufacturing","volume":"95","author":"Tao","year":"2019","journal-title":"Eng. Appl. Artif. Intell."},{"key":"10.1016\/j.inffus.2026.104225_sbref0031","doi-asserted-by":"crossref","first-page":"11554","DOI":"10.1109\/JIOT.2023.3330372","article-title":"Worker activity recognition in manufacturing line using near-body electric field","volume":"11","author":"Suh","year":"2023","journal-title":"IEEE Internet Things J."},{"key":"10.1016\/j.inffus.2026.104225_sbref0032","series-title":"Proceedings of the 15th International Conference on PErvasive Technologies Related to Assistive Environments","article-title":"Micro-activity recognition in industrial assembly process with IMU data and deep learning","author":"Sopidis","year":"2022"},{"key":"10.1016\/j.inffus.2026.104225_bib0032","series-title":"2005 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR\u201905)","first-page":"886","article-title":"Histograms of oriented gradients for human detection","volume":"1","author":"Dalal","year":"2005"},{"issue":"2","key":"10.1016\/j.inffus.2026.104225_bib0033","doi-asserted-by":"crossref","first-page":"107","DOI":"10.1007\/s11263-005-1838-7","article-title":"On space-time interest points","volume":"64","author":"Laptev","year":"2005","journal-title":"Int. J. Comput. Vis."},{"issue":"1","key":"10.1016\/j.inffus.2026.104225_bib0034","doi-asserted-by":"crossref","first-page":"60","DOI":"10.1007\/s11263-012-0594-8","article-title":"Dense trajectories and motion boundary descriptors for action recognition","volume":"103","author":"Wang","year":"2013","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.inffus.2026.104225_bib0035","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"2625","article-title":"Long-term recurrent convolutional networks for visual recognition and description","author":"Donahue","year":"2015"},{"key":"10.1016\/j.inffus.2026.104225_bib0036","unstructured":"K. Soomro, A.R. Zamir, M. Shah, UCF101: a dataset of 101 human actions classes from videos in the wild, arXiv: 1212.0402(2012)."},{"key":"10.1016\/j.inffus.2026.104225_bib0037","series-title":"2011 International Conference on Computer Vision","first-page":"2556","article-title":"HMDB: a large video database for human motion recognition","author":"Kuehne","year":"2011"},{"key":"10.1016\/j.inffus.2026.104225_bib0038","series-title":"2012 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"1290","article-title":"Mining actionlet ensemble for action recognition with depth cameras","author":"Wang","year":"2012"},{"key":"10.1016\/j.inffus.2026.104225_bib0039","series-title":"2012 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops","first-page":"20","article-title":"View invariant human action recognition using histograms of 3D joints","author":"Xia","year":"2012"},{"key":"10.1016\/j.inffus.2026.104225_bib0040","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"804","article-title":"Super normal vector for activity recognition using depth sequences","author":"Yang","year":"2014"},{"key":"10.1016\/j.inffus.2026.104225_bib0041","series-title":"CVPR 2011","first-page":"1297","article-title":"Real-time human pose recognition in parts from single depth images","author":"Shotton","year":"2011"},{"key":"10.1016\/j.inffus.2026.104225_bib0042","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"2752","article-title":"The moving pose: an efficient 3D kinematics descriptor for low-latency action recognition and detection","author":"Zanfir","year":"2013"},{"key":"10.1016\/j.inffus.2026.104225_bib0043","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"1110","article-title":"Hierarchical recurrent neural network for skeleton based action recognition","author":"Du","year":"2015"},{"key":"10.1016\/j.inffus.2026.104225_bib0044","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"1010","article-title":"NTU RGB+ D: a large scale dataset for 3d human activity analysis","author":"Shahroudy","year":"2016"},{"key":"10.1016\/j.inffus.2026.104225_bib0045","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"588","article-title":"Human action recognition by representing 3d skeletons as points in a lie group","author":"Vemulapalli","year":"2014"},{"key":"10.1016\/j.inffus.2026.104225_bib0046","series-title":"Proceedings of the 2016 ACM on Multimedia Conference","first-page":"102","article-title":"Action recognition based on joint trajectory maps using convolutional neural networks","author":"Wang","year":"2016"},{"key":"10.1016\/j.inffus.2026.104225_bib0047","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"233","article-title":"Tracking revisited using RGBD camera: unified benchmark and baselines","author":"Song","year":"2013"},{"key":"10.1016\/j.inffus.2026.104225_bib0048","series-title":"European Conference on Computer Vision","first-page":"203","article-title":"Online human action detection using joint classification-regression recurrent neural networks","author":"Li","year":"2016"},{"issue":"11","key":"10.1016\/j.inffus.2026.104225_bib0049","doi-asserted-by":"crossref","first-page":"2740","DOI":"10.1109\/TPAMI.2018.2868668","article-title":"Temporal segment networks for action recognition in videos","volume":"41","author":"Wang","year":"2018","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"6","key":"10.1016\/j.inffus.2026.104225_bib0050","doi-asserted-by":"crossref","first-page":"369","DOI":"10.1007\/s00530-024-01566-8","article-title":"Mgsan: multimodal graph self-attention network for skeleton-based action recognition","volume":"30","author":"Wang","year":"2024","journal-title":"Multimed. Syst."},{"key":"10.1016\/j.inffus.2026.104225_bib0051","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"8150","article-title":"Mambapro: multi-modal object re-identification with mamba aggregation and synergistic prompt","volume":"39","author":"Wang","year":"2025"},{"key":"10.1016\/j.inffus.2026.104225_bib0052","unstructured":"C. Chen, S. Liang, R. Guan, X. Sun, H. Zhao, H. Jiang, T. Huang, H. Ding, Q.-L. Han, AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios, arXiv: 2511.21053(2025)."},{"key":"10.1016\/j.inffus.2026.104225_bib0053","article-title":"Cross-modal guiding attention for RGBT tracking","author":"Xiao","year":"2025","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104225_bib0054","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103349","article-title":"Cognitive disentanglement for referring multi-object tracking","volume":"124","author":"Liang","year":"2025","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104225_bib0055","doi-asserted-by":"crossref","first-page":"362","DOI":"10.1016\/j.jmsy.2025.06.019","article-title":"Skeleton-based action recognition for manufacturing assembly task through graph convolution network","volume":"82","author":"Soleymani","year":"2025","journal-title":"J. Manuf. Syst."},{"key":"10.1016\/j.inffus.2026.104225_bib0056","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"6299","article-title":"Quo vadis, action recognition? A new model and the kinetics dataset","author":"Carreira","year":"2017"},{"key":"10.1016\/j.inffus.2026.104225_bib0057","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","article-title":"Inception-v4, inception-resnet and the impact of residual connections on learning","volume":"31","author":"Szegedy","year":"2017"},{"key":"10.1016\/j.inffus.2026.104225_bib0058","unstructured":"A. Dosovitskiy, An image is worth 16\u202f\u00d7\u202f16 words: transformers for image recognition at scale, arXiv: 2010.11929(2020)."},{"key":"10.1016\/j.inffus.2026.104225_bib0059","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"6202","article-title":"Slowfast networks for video recognition","author":"Feichtenhofer","year":"2019"},{"key":"10.1016\/j.inffus.2026.104225_bib0060","doi-asserted-by":"crossref","first-page":"5626","DOI":"10.1109\/TIP.2021.3087348","article-title":"Searching multi-rate and multi-modal temporal enhanced networks for gesture recognition","volume":"30","author":"Yu","year":"2021","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.inffus.2026.104225_bib0061","first-page":"30392","article-title":"Early convolutions help transformers see better","volume":"34","author":"Xiao","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.inffus.2026.104225_bib0062","series-title":"European Conference on Computer Vision","first-page":"285","article-title":"Kvt: k-nn attention for boosting vision transformers","author":"Wang","year":"2022"},{"key":"10.1016\/j.inffus.2026.104225_bib0063","unstructured":"G. Hinton, Distilling the Knowledge in a Neural Network, arXiv: 1503.02531(2015)."},{"key":"10.1016\/j.inffus.2026.104225_bib0064","doi-asserted-by":"crossref","unstructured":"H. Zhang, mixup: Beyond empirical risk minimization, arXiv: 1710.09412(2017).","DOI":"10.1007\/978-1-4899-7687-1_79"},{"issue":"325","key":"10.1016\/j.inffus.2026.104225_bib0065","first-page":"1","article-title":"On mixup regularization","volume":"23","author":"Carratino","year":"2022","journal-title":"J. Mach. Learn. Res."},{"key":"10.1016\/j.inffus.2026.104225_bib0066","unstructured":"L. Zhang, Z. Deng, K. Kawaguchi, A. Ghorbani, J. Zou, How does mixup help with robustness and generalization?, arXiv: 2010.04819(2020)."},{"key":"10.1016\/j.inffus.2026.104225_bib0067","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","article-title":"Learning adaptive hidden layers for mobile gesture recognition","volume":"32","author":"Hu","year":"2018"},{"issue":"10","key":"10.1016\/j.inffus.2026.104225_bib0068","doi-asserted-by":"crossref","first-page":"2956","DOI":"10.1109\/TCSVT.2017.2749509","article-title":"Large-scale gesture recognition with a fusion of RGB-D data based on saliency theory and C3D model","volume":"28","author":"Li","year":"2017","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.inffus.2026.104225_bib0069","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"3563","article-title":"Regional attention with architecture-rebuilt 3d network for RGB-D gesture recognition","volume":"35","author":"Zhou","year":"2021"},{"key":"10.1016\/j.inffus.2026.104225_bib0070","series-title":"Proceedings of the 28th ACM International Conference on Multimedia","first-page":"1122","article-title":"Misa: modality-invariant and-specific representations for multimodal sentiment analysis","author":"Hazarika","year":"2020"},{"key":"10.1016\/j.inffus.2026.104225_bib0071","series-title":"European Conference on Computer Vision","first-page":"561","article-title":"Bi-directional cross-modality feature propagation with separation-and-aggregation gate for RGB-D semantic segmentation","author":"Chen","year":"2020"},{"issue":"1","key":"10.1016\/j.inffus.2026.104225_bib0072","doi-asserted-by":"crossref","first-page":"246","DOI":"10.1109\/TCDS.2020.3048883","article-title":"Trear: transformer-based RGB-D egocentric action recognition","volume":"14","author":"Li","year":"2021","journal-title":"IEEE Trans. Cogn. Dev. Syst."},{"key":"10.1016\/j.inffus.2026.104225_bib0073","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"1010","article-title":"NTU RGB+ D: a large scale dataset for 3d human activity analysis","author":"Shahroudy","year":"2016"},{"issue":"10","key":"10.1016\/j.inffus.2026.104225_bib0074","doi-asserted-by":"crossref","first-page":"2684","DOI":"10.1109\/TPAMI.2019.2916873","article-title":"NTU RGB+ D 120: a large-scale benchmark for 3d human activity understanding","volume":"42","author":"Liu","year":"2019","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"1","key":"10.1016\/j.inffus.2026.104225_bib0075","doi-asserted-by":"crossref","first-page":"745","DOI":"10.1038\/s41597-022-01843-z","article-title":"The HA4M dataset: multi-modal monitoring of an assembly task for human action recognition in manufacturing","volume":"9","author":"Cicirelli","year":"2022","journal-title":"Sci. Data"},{"key":"10.1016\/j.inffus.2026.104225_bib0076","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"2649","article-title":"Cross-view action modeling, learning and recognition","author":"Wang","year":"2014"},{"key":"10.1016\/j.inffus.2026.104225_bib0077","doi-asserted-by":"crossref","DOI":"10.1109\/TCSVT.2024.3375512","article-title":"Multi-scale structural graph convolutional network for skeleton-based action recognition","author":"Jang","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.inffus.2026.104225_bib0078","doi-asserted-by":"crossref","first-page":"10410","DOI":"10.1109\/TCSVT.2025.3562877","article-title":"Robust 2D skeleton action recognition via decoupling and distilling 3D latent features","volume":"35","author":"Zhang","year":"2025","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.inffus.2026.104225_bib0079","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","article-title":"Cooperative training of deep aggregation networks for RGB-D action recognition","volume":"32","author":"Wang","year":"2018"},{"key":"10.1016\/j.inffus.2026.104225_bib0080","series-title":"Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part IX 16","first-page":"72","article-title":"Vpn: learning video-pose embedding for activities of daily living","author":"Das","year":"2020"},{"key":"10.1016\/j.inffus.2026.104225_bib0081","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2023.122314","article-title":"Human-centric multimodal fusion network for robust action recognition","volume":"239","author":"Hu","year":"2024","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.inffus.2026.104225_bib0082","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"3202","article-title":"Video swin transformer","author":"Liu","year":"2022"},{"key":"10.1016\/j.inffus.2026.104225_bib0083","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"6824","article-title":"Multiscale vision transformers","author":"Fan","year":"2021"},{"key":"10.1016\/j.inffus.2026.104225_bib0084","unstructured":"K. Li, Y. Wang, P. Gao, G. Song, Y. Liu, H. Li, Y. Qiao, Uniformer: unified transformer for efficient spatiotemporal representation learning, arXiv: 2201.04676(2022)."},{"key":"10.1016\/j.inffus.2026.104225_bib0085","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"14549","article-title":"Videomae v2: scaling video masked autoencoders with dual masking","author":"Wang","year":"2023"},{"key":"10.1016\/j.inffus.2026.104225_bib0086","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111521","article-title":"A generically contrastive spatiotemporal representation enhancement for 3D skeleton action recognition","volume":"164","author":"Zhang","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.inffus.2026.104225_bib0087","article-title":"DSDC-GCN: decoupled static-dynamic co-occurrence graph convolutional networks for skeleton-based action recognition","author":"Zhuang","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.inffus.2026.104225_bib0088","series-title":"European Conference on Computer Vision","first-page":"211","article-title":"Psumnet: unified modality part streams are all you need for efficient pose-based action recognition","author":"Trivedi","year":"2022"},{"key":"10.1016\/j.inffus.2026.104225_bib0089","article-title":"Skeleton-based action recognition via spatial and temporal transformer networks","volume":"208","author":"Plizzari","year":"2021","journal-title":"Comput. Vis. Image Underst."},{"key":"10.1016\/j.inffus.2026.104225_bib0090","doi-asserted-by":"crossref","DOI":"10.1016\/j.imavis.2025.105426","article-title":"Skeleton action recognition via group sparsity constrained variant graph auto-encoder","author":"Pei","year":"2025","journal-title":"Image Vis. Comput."},{"key":"10.1016\/j.inffus.2026.104225_bib0091","doi-asserted-by":"crossref","DOI":"10.1016\/j.jvcir.2025.104389","article-title":"Skeleton-guided and supervised learning of hybrid network for multi-modal action recognition","volume":"107","author":"Ren","year":"2025","journal-title":"J. Vis. Commun. Image Represent."},{"key":"10.1016\/j.inffus.2026.104225_bib0092","first-page":"103031","article-title":"Vmamba: visual state space model","volume":"37","author":"Liu","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.inffus.2026.104225_bib0093","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"13359","article-title":"Channel-wise topology refinement graph convolution for skeleton-based action recognition","author":"Chen","year":"2021"},{"key":"10.1016\/j.inffus.2026.104225_bib0094","series-title":"Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XXIV 16","first-page":"536","article-title":"Decoupling gcn with dropgraph module for skeleton-based action recognition","author":"Cheng","year":"2020"},{"key":"10.1016\/j.inffus.2026.104225_bib0095","doi-asserted-by":"crossref","first-page":"2477","DOI":"10.1109\/TIP.2024.3378886","article-title":"Degcn: deformable graph convolutional networks for skeleton-based action recognition","volume":"33","author":"Myung","year":"2024","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.inffus.2026.104225_bib0096","article-title":"SelfGCN: graph convolution network with self-attention for skeleton-based action recognition","author":"Wu","year":"2024","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.inffus.2026.104225_bib0097","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"10444","article-title":"Hierarchically decomposed graph convolutional networks for skeleton-based action recognition","author":"Lee","year":"2023"},{"issue":"Nov","key":"10.1016\/j.inffus.2026.104225_bib0098","first-page":"2579","article-title":"Visualizing data using t-SNE","volume":"9","author":"van der Maaten","year":"2008","journal-title":"J. Mach. Learn. Res."},{"key":"10.1016\/j.inffus.2026.104225_bib0099","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"3253","article-title":"Gated fusion network for single image dehazing","author":"Ren","year":"2018"},{"key":"10.1016\/j.inffus.2026.104225_bib0100","first-page":"13","article-title":"Vilbert: pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","volume":"32","author":"Lu","year":"2019","journal-title":"Adv. Neural Inf. Process. Syst."}],"container-title":["Information Fusion"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526001041?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526001041?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T07:11:40Z","timestamp":1777619500000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1566253526001041"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8]]},"references-count":100,"alternative-id":["S1566253526001041"],"URL":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104225","relation":{},"ISSN":["1566-2535"],"issn-type":[{"value":"1566-2535","type":"print"}],"subject":[],"published":{"date-parts":[[2026,8]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Multimodal action recognition for manufacturing assembly task through spatio-temporal knowledge fusion","name":"articletitle","label":"Article Title"},{"value":"Information Fusion","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104225","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"104225"}}