{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T09:07:09Z","timestamp":1784279229408,"version":"3.55.0"},"reference-count":44,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T00:00:00Z","timestamp":1776729600000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100004823","name":"Nagoya University","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004823","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001691","name":"Japan Society for the Promotion of Science","doi-asserted-by":"publisher","award":["JP21H03519"],"award-info":[{"award-number":["JP21H03519"]}],"id":[{"id":"10.13039\/501100001691","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001691","name":"Japan Society for the Promotion of Science","doi-asserted-by":"publisher","award":["JP24H00733"],"award-info":[{"award-number":["JP24H00733"]}],"id":[{"id":"10.13039\/501100001691","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.patcog.2026.113810","type":"journal-article","created":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T14:51:56Z","timestamp":1776783116000},"page":"113810","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PC","title":["MultiSensor-Home: Multi-modal multi-view dataset and benchmarks for action recognition in home environments"],"prefix":"10.1016","volume":"179","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8976-2922","authenticated-orcid":false,"given":"Trung Thanh","family":"Nguyen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3799-4550","authenticated-orcid":false,"given":"Yasutomo","family":"Kawanishi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9553-0906","authenticated-orcid":false,"given":"Vijay","family":"John","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3041-4330","authenticated-orcid":false,"given":"Takahiro","family":"Komamizu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3942-9296","authenticated-orcid":false,"given":"Ichiro","family":"Ide","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113810_b1","doi-asserted-by":"crossref","unstructured":"M. Yasuda, Y. Ohishi, S. Saito, N. Harada, Multi-view and multi-modal event detection utilizing Transformer-based multi-sensor fusion, in: Proc. 47th IEEE Int. Conf. Acoust. Speech Signal Process., 2022, pp. 4638\u20134642.","DOI":"10.1109\/ICASSP43922.2022.9746006"},{"issue":"109348","key":"10.1016\/j.patcog.2026.113810_b2","first-page":"1","article-title":"Attention-based anomaly detection in multi-view surveillance videos","volume":"252","author":"Li","year":"2022","journal-title":"Knowl.-Based Syst."},{"issue":"8","key":"10.1016\/j.patcog.2026.113810_b3","doi-asserted-by":"crossref","first-page":"1369","DOI":"10.1007\/s11548-020-02176-1","article-title":"A multi-camera, multi-view system for training and skill assessment for robot-assisted surgery","volume":"15","author":"Abdelaal","year":"2020","journal-title":"Int. J. Comput. Assist. Radiol. Surg."},{"issue":"3","key":"10.1016\/j.patcog.2026.113810_b4","first-page":"3200","article-title":"Human action recognition from various data modalities: A review","volume":"45","author":"Sun","year":"2022","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"10","key":"10.1016\/j.patcog.2026.113810_b5","doi-asserted-by":"crossref","first-page":"6411","DOI":"10.1109\/LRA.2023.3307285","article-title":"FluxFormer: Flow-guided duplex attention Transformer via spatio-temporal clustering for action recognition","volume":"8","author":"Hong","year":"2023","journal-title":"IEEE Robot. Autom. Lett."},{"key":"10.1016\/j.patcog.2026.113810_b6","doi-asserted-by":"crossref","unstructured":"K. Doshi, Y. Yilmaz, Semantic video Transformer for robust action recognition, in: Proc. 2023 IEEE Conf. Depend. Secure Comput., 2023, pp. 152\u2013156.","DOI":"10.1109\/DSC61021.2023.10354225"},{"key":"10.1016\/j.patcog.2026.113810_b7","doi-asserted-by":"crossref","unstructured":"A. Arnab, M. Dehghani, G. Heigold, C. Sun, M. Lu\u010di\u0107, C. Schmid, ViViT: A Video Vision Transformer, in: Proc. 18th IEEE\/CVF Int. Conf. Comput. Vis., 2021, pp. 6836\u20136846.","DOI":"10.1109\/ICCV48922.2021.00676"},{"key":"10.1016\/j.patcog.2026.113810_b8","doi-asserted-by":"crossref","unstructured":"J. Wang, X. Nie, Y. Xia, Y. Wu, S.-C. Zhu, Cross-view action modeling, learning and recognition, in: Proc. 2014 IEEE Conf. Comput. Vis. Pattern Recognit., 2014, pp. 2649\u20132656.","DOI":"10.1109\/CVPR.2014.339"},{"key":"10.1016\/j.patcog.2026.113810_b9","doi-asserted-by":"crossref","unstructured":"A. Shahroudy, J. Liu, T.-T. Ng, G. Wang, NTU RGB+D: A large scale dataset for 3D human activity analysis, in: Proc. 2016 IEEE Conf. Comput. Vis. Pattern Recognit., 2016, pp. 1010\u20131019.","DOI":"10.1109\/CVPR.2016.115"},{"issue":"10","key":"10.1016\/j.patcog.2026.113810_b10","doi-asserted-by":"crossref","first-page":"2684","DOI":"10.1109\/TPAMI.2019.2916873","article-title":"NTU RGB+D 120: A large-scale benchmark for 3D human activity understanding","volume":"42","author":"Liu","year":"2019","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113810_b11","doi-asserted-by":"crossref","first-page":"172892","DOI":"10.1109\/ACCESS.2020.3024568","article-title":"Literature survey on multi-camera system and its application","volume":"8","author":"Olagoke","year":"2020","journal-title":"IEEE Access"},{"key":"10.1016\/j.patcog.2026.113810_b12","first-page":"14200","article-title":"Attention bottlenecks for multimodal fusion","volume":"34","author":"Nagrani","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113810_b13","doi-asserted-by":"crossref","unstructured":"R. Gao, T.-H. Oh, K. Grauman, L. Torresani, Listen to look: Action recognition by previewing audio, in: Proc. 2020 IEEE\/CVF Conf. Comput. Vis. Pattern Recognit., 2020, pp. 10457\u201310467.","DOI":"10.1109\/CVPR42600.2020.01047"},{"issue":"6","key":"10.1016\/j.patcog.2026.113810_b14","doi-asserted-by":"crossref","first-page":"3603","DOI":"10.1109\/TCSVT.2021.3112214","article-title":"Continuous multi-view human action recognition","volume":"32","author":"Wang","year":"2021","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.patcog.2026.113810_b15","doi-asserted-by":"crossref","unstructured":"K. Shah, A. Shah, C.P. Lau, C.M. de Melo, R. Chellappa, Multi-view action recognition using contrastive learning, in: Proc. 2023 IEEE\/CVF Winter Conf. Appl. Comput. Vis., 2023, pp. 3381\u20133391.","DOI":"10.1109\/WACV56688.2023.00338"},{"key":"10.1016\/j.patcog.2026.113810_b16","first-page":"427","article-title":"Multi-view action recognition using cross-view video prediction","volume":"vol. 27","author":"Vyas","year":"2020"},{"key":"10.1016\/j.patcog.2026.113810_b17","first-page":"1","article-title":"Guided masked self-distillation modeling for distributed multimedia sensor event analysis","author":"Yasuda","year":"2025","journal-title":"ACM Trans. Multimed. Comput. Commun. Appl."},{"key":"10.1016\/j.patcog.2026.113810_b18","doi-asserted-by":"crossref","unstructured":"H. Joo, H. Liu, L. Tan, L. Gui, B. Nabbe, I. Matthews, T. Kanade, S. Nobuhara, Y. Sheikh, Panoptic Studio: A massively multiview system for social motion capture, in: Proc. 15th IEEE Int. Conf. Comput. Vis., 2015, pp. 3334\u20133342.","DOI":"10.1109\/ICCV.2015.381"},{"key":"10.1016\/j.patcog.2026.113810_b19","doi-asserted-by":"crossref","unstructured":"T.T. Nguyen, Y. Kawanishi, J. Vijay, T. Komamizu, I. Ide, MultiSensor-Home: A Wide-area Multi-modal Multi-view Dataset for Action Recognition and Transformer-based Sensor Fusion, in: Proc. 19th IEEE Int. Conf. Autom. Face Gesture Recognit., 2025, pp. 1\u201310.","DOI":"10.1109\/FG61629.2025.11099071"},{"key":"10.1016\/j.patcog.2026.113810_b20","doi-asserted-by":"crossref","unstructured":"T.T. Nguyen, Y. Kawanishi, T. Komamizu, I. Ide, Action Selection Learning for Multilabel Multiview Action Recognition, in: Proc. 6th ACM Multimed. Asia Conf., 2024, pp. 1\u20137.","DOI":"10.1145\/3696409.3700211"},{"key":"10.1016\/j.patcog.2026.113810_b21","doi-asserted-by":"crossref","unstructured":"S. Das, R. Dai, M. Koperski, L. Minciullo, L. Garattoni, F. Bremond, G. Francesca, Toyota Smarthome: Real-world activities of daily living, in: Proc. 17th IEEE\/CVF Int. Conf. Comput. Vis., 2019, pp. 833\u2013842.","DOI":"10.1109\/ICCV.2019.00092"},{"key":"10.1016\/j.patcog.2026.113810_b22","doi-asserted-by":"crossref","unstructured":"C.M. De Melo, B. Rothrock, P. Gurram, O. Ulutan, B. Manjunath, Vision-Based Gesture Recognition in Human\u2013Robot Teams Using Synthetic Data, in: Proc. 2020 IEEE\/RSJ Int. Conf. Intell. Robots Syst., 2020, pp. 10278\u201310284.","DOI":"10.1109\/IROS45743.2020.9340728"},{"key":"10.1016\/j.patcog.2026.113810_b23","doi-asserted-by":"crossref","unstructured":"A.V. Reddy, K. Shah, W. Paul, R. Mocharla, J. Hoffman, K.D. Katyal, D. Manocha, C.M. de Melo, R. Chellappa, Synthetic-to-Real Domain Adaptation for Action Recognition: A Dataset and Baseline Performances, in: Proc. 2023 IEEE Int. Conf. Robot. Autom., 2023, pp. 11374\u201311381.","DOI":"10.1109\/ICRA48891.2023.10160416"},{"key":"10.1016\/j.patcog.2026.113810_b24","first-page":"38","article-title":"Decoupled spatial-temporal attention network for skeleton-based action-gesture recognition","volume":"vol. 5","author":"Shi","year":"2020"},{"key":"10.1016\/j.patcog.2026.113810_b25","doi-asserted-by":"crossref","unstructured":"L. Shi, Y. Zhang, J. Cheng, H. Lu, AdaSGN: Adapting Joint Number and Model Size for Efficient Skeleton-Based Action Recognition, in: Proc. 18th IEEE\/CVF Int. Conf. Comput. Vis., 2021, pp. 13413\u201313422.","DOI":"10.1109\/ICCV48922.2021.01316"},{"key":"10.1016\/j.patcog.2026.113810_b26","doi-asserted-by":"crossref","unstructured":"Y. Zhou, X. Yan, Z.-Q. Cheng, Y. Yan, Q. Dai, X.-S. Hua, BlockGCN: Redefine topology awareness for skeleton-based action recognition, in: Proc. 2024 IEEE\/CVF Conf. Comput. Vis. Pattern Recognit., 2024, pp. 2049\u20132058.","DOI":"10.1109\/CVPR52733.2024.00200"},{"key":"10.1016\/j.patcog.2026.113810_b27","doi-asserted-by":"crossref","unstructured":"T. Yamane, S. Suzuki, R. Masumura, S. Tora, MVAFormer: RGB-Based Multi-View Spatio-Temporal Action Recognition with Transformer, in: Proc. 2024 IEEE Int. Conf. Image Process., 2024, pp. 332\u2013338.","DOI":"10.1109\/ICIP51287.2024.10648200"},{"issue":"102659","key":"10.1016\/j.patcog.2026.113810_b28","first-page":"1","article-title":"Skeleton-RGB integrated highly similar human action prediction in human\u2013robot collaborative assembly","volume":"86","author":"Zhang","year":"2024","journal-title":"Robot. Comput.-Integr. Manuf."},{"issue":"123061","key":"10.1016\/j.patcog.2026.113810_b29","first-page":"1","article-title":"A dense\u2013sparse complementary network for human action recognition based on RGB and skeleton modalities","volume":"244","author":"Cheng","year":"2024","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.patcog.2026.113810_b30","doi-asserted-by":"crossref","first-page":"2719","DOI":"10.1109\/TIP.2023.3273459","article-title":"Dual-recommendation disentanglement network for view fuzz in action recognition","volume":"32","author":"Liu","year":"2023","journal-title":"IEEE Trans. Image Process."},{"issue":"111923","key":"10.1016\/j.patcog.2026.113810_b31","first-page":"1","article-title":"Trunk-branch contrastive network with multi-view deformable aggregation for multi-view action recognition","volume":"169","author":"Yang","year":"2026","journal-title":"Pattern Recognit.","ISSN":"https:\/\/id.crossref.org\/issn\/0031-3203","issn-type":"print"},{"key":"10.1016\/j.patcog.2026.113810_b32","doi-asserted-by":"crossref","unstructured":"V. John, Y. Kawanishi, Frame-Level Latent Embedding Using Weak Labels for Multi-View Action Recognition, in: Proc. 7th IEEE Int. Conf. Multimed. Inf. Process. Retrieval, 2024, pp. 235\u2013238.","DOI":"10.1109\/MIPR62202.2024.00044"},{"key":"10.1016\/j.patcog.2026.113810_b33","first-page":"1","article-title":"Action selection learning for weakly labeled multi-modal multi-view action recognition","author":"Nguyen","year":"2025","journal-title":"ACM Trans. Multimed. Comput. Commun. Appl."},{"key":"10.1016\/j.patcog.2026.113810_b34","doi-asserted-by":"crossref","unstructured":"Y. Gong, Y.-A. Chung, J. Glass, AST: Audio Spectrogram Transformer, in: Proc. 22nd Annu. Conf. Int. Speech Commun. Assoc., 2021, pp. 571\u2013575.","DOI":"10.21437\/Interspeech.2021-698"},{"key":"10.1016\/j.patcog.2026.113810_b35","unstructured":"A. Dosovitskiy, L. Beyer, A. Kolesnikov, D. Weissenborn, X. Zhai, T. Unterthiner, M. Dehghani, M. Minderer, G. Heigold, S. Gelly, J. Uszkoreit, N. Houlsby, An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale, in: Proc. 2021 Int. Conf. Learn. Represent., 2021, pp. 1\u201322."},{"key":"10.1016\/j.patcog.2026.113810_b36","doi-asserted-by":"crossref","first-page":"107984","DOI":"10.52202\/079017-3429","article-title":"YOLOv10: Real-time end-to-end object detection","volume":"37","author":"Wang","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113810_b37","first-page":"6000","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113810_b38","doi-asserted-by":"crossref","unstructured":"T. Kobayashi, Two-way multi-label loss, in: Proc. 2023 IEEE\/CVF Conf. Comput. Vis. Pattern Recognit., 2023, pp. 7476\u20137485.","DOI":"10.1109\/CVPR52729.2023.00722"},{"key":"10.1016\/j.patcog.2026.113810_b39","first-page":"8792","article-title":"Generalized cross entropy loss for training deep neural networks with noisy labels","volume":"31","author":"Zhang","year":"2018","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113810_b40","first-page":"145","article-title":"On the stratification of multi-label data","volume":"vol. 3","author":"Sechidis","year":"2011"},{"key":"10.1016\/j.patcog.2026.113810_b41","unstructured":"G. Bertasius, H. Wang, L. Torresani, Is space\u2013time attention all you need for video understanding?, in: Proc. 38th Int. Conf. Mach. Learn., 2021, pp. 813\u2013824."},{"key":"10.1016\/j.patcog.2026.113810_b42","doi-asserted-by":"crossref","unstructured":"Y. Ma, G. Xu, X. Sun, M. Yan, J. Zhang, R. Ji, X-CLIP: End-to-end multi-grained contrastive learning for video\u2013text retrieval, in: Proc. 30th ACM Int. Conf. Multimed., 2022, pp. 638\u2013647.","DOI":"10.1145\/3503161.3547910"},{"key":"10.1016\/j.patcog.2026.113810_b43","unstructured":"D.P. Kingma, J. Ba, Adam: A Method for Stochastic Optimization, in: Proc. 2015 Int. Conf. Learn. Represent., 2015, pp. 1\u201315."},{"key":"10.1016\/j.patcog.2026.113810_b44","unstructured":"I. Loshchilov, F. Hutter, SGDR: Stochastic Gradient Descent with warm Restarts, in: Proc. 2016 Int. Conf. Learn. Represent., 2016, pp. 1\u201316."}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326007752?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326007752?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T08:33:39Z","timestamp":1784277219000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326007752"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":44,"alternative-id":["S0031320326007752"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113810","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"MultiSensor-Home: Multi-modal multi-view dataset and benchmarks for action recognition in home environments","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113810","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier Ltd.","name":"copyright","label":"Copyright"}],"article-number":"113810"}}