{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,13]],"date-time":"2026-04-13T20:43:22Z","timestamp":1776113002915,"version":"3.50.1"},"reference-count":25,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100002855","name":"Ministry of Science and Technology of the People&apos;s Republic of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100002855","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003410","name":"Fujian Provincial Department of Education","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100003410","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100010166","name":"Xiamen City Department of Science and Technology","doi-asserted-by":"publisher","award":["3502220241019"],"award-info":[{"award-number":["3502220241019"]}],"id":[{"id":"10.13039\/100010166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100008865","name":"Xiamen University","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100008865","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100005270","name":"Fujian Provincial Department of Science and Technology","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100005270","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition Letters"],"published-print":{"date-parts":[[2026,5]]},"DOI":"10.1016\/j.patrec.2026.03.008","type":"journal-article","created":{"date-parts":[[2026,3,10]],"date-time":"2026-03-10T16:44:54Z","timestamp":1773161094000},"page":"139-145","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Phase-aware vision-language fusion for action recognition"],"prefix":"10.1016","volume":"203","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4479-6616","authenticated-orcid":false,"given":"Man","family":"Yang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4119-4185","authenticated-orcid":false,"given":"Zenan","family":"Huang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-8893-8375","authenticated-orcid":false,"given":"Wei","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2515-5108","authenticated-orcid":false,"given":"Weidong","family":"Xiao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7469-7064","authenticated-orcid":false,"given":"Xiaochao","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"key":"10.1016\/j.patrec.2026.03.008_bib0001","doi-asserted-by":"crossref","first-page":"133","DOI":"10.1016\/j.patrec.2025.02.014","article-title":"VHOIP: video-based human\u2013object interaction recognition with CLIP prior knowledge","volume":"190","author":"Baek","year":"2025","journal-title":"Pattern Recognit. Lett."},{"key":"10.1016\/j.patrec.2026.03.008_bib0002","doi-asserted-by":"crossref","first-page":"213","DOI":"10.1016\/j.patrec.2024.10.003","article-title":"Visual-guided hierarchical iterative fusion for multi-modal video action recognition","volume":"186","author":"Zhang","year":"2024","journal-title":"Pattern Recognit. Lett."},{"key":"10.1016\/j.patrec.2026.03.008_bib0003","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.patrec.2026.03.008_bib0004","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","article-title":"Bidirectional cross-modal knowledge exploration for video recognition with pre-trained vision-language models","author":"Wu","year":"2023"},{"key":"10.1016\/j.patrec.2026.03.008_bib0005","doi-asserted-by":"crossref","first-page":"4372","DOI":"10.1109\/TMM.2025.3535393","article-title":"Contrastive feedback vision-language for 3D skeleton-based action recognition","volume":"27","author":"Zeng","year":"2025","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patrec.2026.03.008_bib0006","doi-asserted-by":"crossref","first-page":"3027","DOI":"10.1109\/TIP.2023.3275538","article-title":"WaveNet: wavelet network with knowledge distillation for RGB-T salient object detection","volume":"32","author":"Zhou","year":"2023","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patrec.2026.03.008_bib0007","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"22076","article-title":"Dynamic aggregated network for gait recognition","author":"Ma","year":"2023"},{"key":"10.1016\/j.patrec.2026.03.008_bib0008","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"10935","article-title":"An image patch is a wave: phase-aware vision MLP","author":"Tang","year":"2022"},{"key":"10.1016\/j.patrec.2026.03.008_bib0009","series-title":"European Conference on Computer Vision","first-page":"1","article-title":"Expanding language-image pretrained models for general video recognition","author":"Ni","year":"2022"},{"key":"10.1016\/j.patrec.2026.03.008_bib0010","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"2847","article-title":"Revisiting classifier: transferring vision-language models for video recognition","volume":"37","author":"Wu","year":"2023"},{"key":"10.1016\/j.patrec.2026.03.008_bib0011","doi-asserted-by":"crossref","first-page":"9385","DOI":"10.1109\/TMM.2025.3613125","article-title":"Tensor completion framework by graph refinement for incomplete multi-view clustering","volume":"27","author":"Wang","year":"2025","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patrec.2026.03.008_bib0012","doi-asserted-by":"crossref","first-page":"1538","DOI":"10.1109\/TMM.2024.3521771","article-title":"Between\/within view information completing for tensorial incomplete multi-view clustering","volume":"27","author":"Yao","year":"2025","journal-title":"IEEE Trans. Multimed."},{"issue":"7","key":"10.1016\/j.patrec.2026.03.008_bib0013","doi-asserted-by":"crossref","first-page":"7266","DOI":"10.1109\/TCSVT.2025.3540089","article-title":"Focus more on what? guiding multi-task training for end-to-end person search","volume":"35","author":"Cai","year":"2025","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.patrec.2026.03.008_bib0014","first-page":"10078","article-title":"Videomae: masked autoencoders are data-efficient learners for self-supervised video pre-training","volume":"35","author":"Tong","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patrec.2026.03.008_bib0015","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"2943","article-title":"Mvfnet: multi-view fusion network for efficient video recognition","volume":"35","author":"Wu","year":"2021"},{"key":"10.1016\/j.patrec.2026.03.008_bib0016","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"6312","article-title":"Masked video distillation: rethinking masked feature modeling for self-supervised video representation learning","author":"Wang","year":"2023"},{"issue":"3","key":"10.1016\/j.patrec.2026.03.008_bib0017","doi-asserted-by":"crossref","first-page":"3522","DOI":"10.1109\/TPAMI.2022.3177813","article-title":"MMNet: a model-based multimodal network for human action recognition in RGB-D videos","volume":"45","author":"Yu","year":"2023","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"22","key":"10.1016\/j.patrec.2026.03.008_bib0018","doi-asserted-by":"crossref","first-page":"27517","DOI":"10.1109\/JSEN.2023.3316137","article-title":"A two-stage modality fusion approach for recognizing human actions","volume":"23","author":"Zheng","year":"2023","journal-title":"IEEE Sens. J."},{"key":"10.1016\/j.patrec.2026.03.008_bib0019","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"10181","article-title":"Masked motion predictors are strong 3d action representation learners","author":"Mao","year":"2023"},{"key":"10.1016\/j.patrec.2026.03.008_bib0020","series-title":"Proceedings of the 32nd ACM International Conference on Multimedia","first-page":"4909","article-title":"Multi-modality co-learning for efficient skeleton-based action recognition","author":"Liu","year":"2024"},{"key":"10.1016\/j.patrec.2026.03.008_bib0021","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"18678","article-title":"Maskclr: attention-guided contrastive learning for robust action representation learning","author":"Abdelfattah","year":"2024"},{"issue":"17","key":"10.1016\/j.patrec.2026.03.008_bib0022","doi-asserted-by":"crossref","first-page":"4673","DOI":"10.3390\/s20174673","article-title":"Energy-guided temporal segmentation network for multimodal human action recognition","volume":"20","author":"Liu","year":"2020","journal-title":"Sensors"},{"key":"10.1016\/j.patrec.2026.03.008_bib0023","doi-asserted-by":"crossref","first-page":"120","DOI":"10.1109\/LSP.2021.3128379","article-title":"A deep reinforcement learning method for multimodal data fusion in action recognition","volume":"29","author":"Guo","year":"2022","journal-title":"IEEE Signal Process. Lett."},{"key":"10.1016\/j.patrec.2026.03.008_bib0024","series-title":"2011 International Conference on Computer Vision","first-page":"2556","article-title":"HMDB: a large video database for human motion recognition","author":"Kuehne","year":"2011"},{"key":"10.1016\/j.patrec.2026.03.008_bib0025","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"1010","article-title":"Ntu rgb+ d: a large scale dataset for 3d human activity analysis","author":"Shahroudy","year":"2016"}],"container-title":["Pattern Recognition Letters"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0167865526000954?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0167865526000954?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,4,13]],"date-time":"2026-04-13T19:25:56Z","timestamp":1776108356000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0167865526000954"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5]]},"references-count":25,"alternative-id":["S0167865526000954"],"URL":"https:\/\/doi.org\/10.1016\/j.patrec.2026.03.008","relation":{},"ISSN":["0167-8655"],"issn-type":[{"value":"0167-8655","type":"print"}],"subject":[],"published":{"date-parts":[[2026,5]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Phase-aware vision-language fusion for action recognition","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition Letters","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patrec.2026.03.008","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}]}}