{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T07:04:06Z","timestamp":1784531046214,"version":"3.55.0"},"reference-count":77,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Image and Vision Computing"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.imavis.2026.106093","type":"journal-article","created":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T15:20:08Z","timestamp":1782919208000},"page":"106093","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Explicitly modeling trajectories and correlations for video analysis"],"prefix":"10.1016","volume":"173","author":[{"given":"Hui","family":"Lu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Albert Ali","family":"Salah","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0843-7878","authenticated-orcid":false,"given":"Ronald","family":"Poppe","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.imavis.2026.106093_b1","doi-asserted-by":"crossref","unstructured":"R. Girdhar, J. Carreira, C. Doersch, A. Zisserman, Video action transformer network, in: IEEE Conf. Comput. Vis. Pattern Recog., 2019, pp. 244\u2013253.","DOI":"10.1109\/CVPR.2019.00033"},{"key":"10.1016\/j.imavis.2026.106093_b2","unstructured":"A. Kolesnikov, A. Dosovitskiy, D. Weissenborn, G. Heigold, J. Uszkoreit, L. Beyer, M. Minderer, M. Dehghani, N. Houlsby, S. Gelly, T. Unterthiner, X. Zhai, An image is worth 16x16 words, in: Int. Conf. Learn. Represent., 2021."},{"key":"10.1016\/j.imavis.2026.106093_b3","doi-asserted-by":"crossref","unstructured":"K. Li, Y. Wang, Y. He, Y. Li, Y. Wang, L. Wang, Y. Qiao, UniformerV2: Spatiotemporal learning by arming image ViTs with video UniFormer, in: Int. Conf. Comput. Vis., 2023, pp. 1632\u20131643.","DOI":"10.1109\/ICCV51070.2023.00157"},{"key":"10.1016\/j.imavis.2026.106093_b4","doi-asserted-by":"crossref","unstructured":"J. Yang, X. Dong, L. Liu, C. Zhang, J. Shen, D. Yu, Recurring the transformer for video action recognition, in: IEEE Conf. Comput. Vis. Pattern Recog., 2022, pp. 14063\u201314073.","DOI":"10.1109\/CVPR52688.2022.01367"},{"key":"10.1016\/j.imavis.2026.106093_b5","doi-asserted-by":"crossref","unstructured":"A. Piergiovanni, W. Kuo, A. Angelova, Rethinking video ViTs: Sparse video tubes for joint image and video learning, in: IEEE Conf. Comput. Vis. Pattern Recog., 2023, pp. 2214\u20132224.","DOI":"10.1109\/CVPR52729.2023.00220"},{"issue":"3","key":"10.1016\/j.imavis.2026.106093_b6","first-page":"3200","article-title":"Human action recognition from various data modalities: A review","volume":"45","author":"Sun","year":"2022","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.imavis.2026.106093_b7","series-title":"AAAI","first-page":"3891","article-title":"TCNet: Continuous sign language recognition from trajectories and correlated regions","author":"Lu","year":"2024"},{"key":"10.1016\/j.imavis.2026.106093_b8","doi-asserted-by":"crossref","unstructured":"C. Feichtenhofer, A. Pinz, A. Zisserman, Convolutional two-stream network fusion for video action recognition, in: IEEE Conf. Comput. Vis. Pattern Recog., 2016, pp. 1933\u20131941.","DOI":"10.1109\/CVPR.2016.213"},{"key":"10.1016\/j.imavis.2026.106093_b9","doi-asserted-by":"crossref","first-page":"6251","DOI":"10.1007\/s11263-025-02478-4","article-title":"About time: Advances, challenges, and outlooks of action understanding","volume":"133","author":"Stergiou","year":"2025","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.imavis.2026.106093_b10","doi-asserted-by":"crossref","unstructured":"Z. Wu, Y. Fu, Y.-G. Jiang, L. Sigal, Harnessing object and scene semantics for large-scale video understanding, in: IEEE Conf. Comput. Vis. Pattern Recog., 2016, pp. 3112\u20133121.","DOI":"10.1109\/CVPR.2016.339"},{"key":"10.1016\/j.imavis.2026.106093_b11","doi-asserted-by":"crossref","unstructured":"J. Pu, W. Zhou, H. Li, Iterative alignment network for continuous sign language recognition, in: IEEE Conf. Comput. Vis. Pattern Recog., 2019, pp. 4165\u20134174.","DOI":"10.1109\/CVPR.2019.00429"},{"key":"10.1016\/j.imavis.2026.106093_b12","doi-asserted-by":"crossref","unstructured":"D. Tran, H. Wang, L. Torresani, J. Ray, Y. LeCun, M. Paluri, A closer look at spatiotemporal convolutions for action recognition, in: IEEE Conf. Comput. Vis. Pattern Recog., 2018, pp. 6450\u20136459.","DOI":"10.1109\/CVPR.2018.00675"},{"key":"10.1016\/j.imavis.2026.106093_b13","doi-asserted-by":"crossref","unstructured":"J. Lin, C. Gan, S. Han, TSM: Temporal shift module for efficient video understanding, in: Int. Conf. Comput. Vis., 2019, pp. 7083\u20137093.","DOI":"10.1109\/ICCV.2019.00718"},{"key":"10.1016\/j.imavis.2026.106093_b14","series-title":"AAAI","first-page":"11669","article-title":"TEINet: Towards an efficient architecture for video recognition","author":"Liu","year":"2020"},{"key":"10.1016\/j.imavis.2026.106093_b15","series-title":"ICML","first-page":"29441","article-title":"Hiera: A hierarchical vision transformer without the bells-and-whistles","author":"Ryali","year":"2023"},{"key":"10.1016\/j.imavis.2026.106093_b16","unstructured":"N.C. Camgoz, O. Koller, S. Hadfield, R. Bowden, Sign language transformers: Joint end-to-end sign language recognition and translation, in: IEEE Conf. Comput. Vis. Pattern Recog., 2020, pp. 10023\u201310033."},{"key":"10.1016\/j.imavis.2026.106093_b17","series-title":"AAAI","first-page":"854","article-title":"Self-emphasizing network for continuous sign language recognition","author":"Hu","year":"2023"},{"key":"10.1016\/j.imavis.2026.106093_b18","doi-asserted-by":"crossref","unstructured":"S. Yan, X. Xiong, A. Arnab, Z. Lu, M. Zhang, C. Sun, C. Schmid, Multiview transformers for video recognition, in: IEEE Conf. Comput. Vis. Pattern Recog., 2022, pp. 3333\u20133343.","DOI":"10.1109\/CVPR52688.2022.00333"},{"key":"10.1016\/j.imavis.2026.106093_b19","series-title":"Adv. Neural Inform. Process. Syst.","first-page":"10078","article-title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training","author":"Tong","year":"2022"},{"key":"10.1016\/j.imavis.2026.106093_b20","doi-asserted-by":"crossref","unstructured":"S. Gan, Y. Yin, Z. Jiang, H. Wen, L. Xie, S. Lu, SignGraph: A Sign Sequence is Worth Graphs of Nodes, in: IEEE Conf. Comput. Vis. Pattern Recog., 2024, pp. 13470\u201313479.","DOI":"10.1109\/CVPR52733.2024.01279"},{"key":"10.1016\/j.imavis.2026.106093_b21","series-title":"AAAI","first-page":"3891","article-title":"OLMD: Orientation-aware long-term motion decoupling for continuous sign language recognition","author":"Yu","year":"2025"},{"key":"10.1016\/j.imavis.2026.106093_b22","doi-asserted-by":"crossref","unstructured":"S. Sun, Z. Kuang, L. Sheng, W. Ouyang, W. Zhang, Optical flow guided feature: A fast and robust motion representation for video action recognition, in: IEEE Conf. Comput. Vis. Pattern Recog., 2018, pp. 1390\u20131399.","DOI":"10.1109\/CVPR.2018.00151"},{"key":"10.1016\/j.imavis.2026.106093_b23","doi-asserted-by":"crossref","unstructured":"L. Sevilla-Lara, Y. Liao, F. G\u00fcney, V. Jampani, A. Geiger, M.J. Black, On the integration of optical flow and action recognition, in: Proceedings of the German Conference on Pattern Recognition, GCPR, 2019, pp. 281\u2013297.","DOI":"10.1007\/978-3-030-12939-2_20"},{"key":"10.1016\/j.imavis.2026.106093_b24","doi-asserted-by":"crossref","first-page":"350","DOI":"10.1016\/j.neucom.2020.04.150","article-title":"A fast human action recognition network based on spatio-temporal features","volume":"441","author":"Xu","year":"2021","journal-title":"Neurocomputing"},{"key":"10.1016\/j.imavis.2026.106093_b25","doi-asserted-by":"crossref","unstructured":"L. Guo, W. Xue, Q. Guo, B. Liu, K. Zhang, T. Yuan, S. Chen, Distilling Cross-Temporal Contexts for Continuous Sign Language Recognition, in: IEEE Conf. Comput. Vis. Pattern Recog., 2023, pp. 10771\u201310780.","DOI":"10.1109\/CVPR52729.2023.01037"},{"key":"10.1016\/j.imavis.2026.106093_b26","series-title":"Adv. Neural Inform. Process. Syst.","first-page":"568","article-title":"Two-stream convolutional networks for action recognition in videos","author":"Simonyan","year":"2014"},{"key":"10.1016\/j.imavis.2026.106093_b27","doi-asserted-by":"crossref","unstructured":"A. Ranjan, M.J. Black, Optical flow estimation using a spatial pyramid network, in: IEEE Conf. Comput. Vis. Pattern Recog., 2017, pp. 4161\u20134170.","DOI":"10.1109\/CVPR.2017.291"},{"key":"10.1016\/j.imavis.2026.106093_b28","first-page":"12493","article-title":"Keeping your eye on the ball: Trajectory attention in video transformers","author":"Patrick","year":"2021","journal-title":"Adv. Neural Inform. Process. Syst."},{"key":"10.1016\/j.imavis.2026.106093_b29","doi-asserted-by":"crossref","unstructured":"L. Hu, L. Gao, Z. Liu, W. Feng, Continuous Sign Language Recognition with Correlation Network, in: IEEE Conf. Comput. Vis. Pattern Recog., 2023, pp. 2529\u20132539.","DOI":"10.1109\/CVPR52729.2023.00249"},{"key":"10.1016\/j.imavis.2026.106093_b30","doi-asserted-by":"crossref","unstructured":"X. Dong, J. Bao, D. Chen, W. Zhang, N. Yu, L. Yuan, D. Chen, B. Guo, CSWin Transformer: A general vision transformer backbone with cross-shaped windows, in: IEEE Conf. Comput. Vis. Pattern Recog., 2022, pp. 12124\u201312134.","DOI":"10.1109\/CVPR52688.2022.01181"},{"key":"10.1016\/j.imavis.2026.106093_b31","doi-asserted-by":"crossref","unstructured":"Z. Xia, X. Pan, S. Song, L.E. Li, G. Huang, Vision transformer with deformable attention, in: IEEE Conf. Comput. Vis. Pattern Recog., 2022, pp. 4794\u20134803.","DOI":"10.1109\/CVPR52688.2022.00475"},{"key":"10.1016\/j.imavis.2026.106093_b32","doi-asserted-by":"crossref","unstructured":"L. Zhu, X. Wang, Z. Ke, W. Zhang, R. Lau, BiFormer: Vision Transformer with Bi-Level Routing Attention, in: IEEE Conf. Comput. Vis. Pattern Recog., 2023, pp. 10323\u201310333.","DOI":"10.1109\/CVPR52729.2023.00995"},{"key":"10.1016\/j.imavis.2026.106093_b33","series-title":"Discrete autoencoders for sequence models","author":"Kaiser","year":"2018"},{"key":"10.1016\/j.imavis.2026.106093_b34","unstructured":"\u0141. Kaiser, I. Sutskever, Neural GPUs learn algorithms, in: Int. Conf. Learn. Represent., 2016."},{"key":"10.1016\/j.imavis.2026.106093_b35","doi-asserted-by":"crossref","first-page":"108","DOI":"10.1016\/j.cviu.2015.09.013","article-title":"Continuous sign language recognition: Towards large vocabulary statistical recognition systems handling multiple signers","volume":"141","author":"Koller","year":"2015","journal-title":"Comput. Vis. Image Underst."},{"key":"10.1016\/j.imavis.2026.106093_b36","doi-asserted-by":"crossref","unstructured":"N.C. Camgoz, S. Hadfield, O. Koller, H. Ney, R. Bowden, Neural sign language translation, in: IEEE Conf. Comput. Vis. Pattern Recog., 2018, pp. 7784\u20137793.","DOI":"10.1109\/CVPR.2018.00812"},{"key":"10.1016\/j.imavis.2026.106093_b37","series-title":"AAAI","first-page":"2257","article-title":"Video-based sign language recognition without temporal segmentation","author":"Huang","year":"2018"},{"key":"10.1016\/j.imavis.2026.106093_b38","doi-asserted-by":"crossref","unstructured":"H. Zhou, W. Zhou, W. Qi, J. Pu, H. Li, Improving sign language translation with monolingual data by sign back-translation, in: IEEE Conf. Comput. Vis. Pattern Recog., 2021, pp. 1316\u20131325.","DOI":"10.1109\/CVPR46437.2021.00137"},{"key":"10.1016\/j.imavis.2026.106093_b39","doi-asserted-by":"crossref","unstructured":"J. Carreira, A. Zisserman, Quo vadis, action recognition? A new model and the Kinetics dataset, in: IEEE Conf. Comput. Vis. Pattern Recog., 2017, pp. 6299\u20136308.","DOI":"10.1109\/CVPR.2017.502"},{"key":"10.1016\/j.imavis.2026.106093_b40","doi-asserted-by":"crossref","unstructured":"R. Goyal, S. Ebrahimi Kahou, V. Michalski, J. Materzynska, S. Westphal, H. Kim, V. Haenel, I. Fruend, P. Yianilos, M. Mueller-Freitag, et al., The \u201cSomething Something\u201d video database for learning and evaluating visual common sense, in: Int. Conf. Comput. Vis., 2017, pp. 5842\u20135850.","DOI":"10.1109\/ICCV.2017.622"},{"key":"10.1016\/j.imavis.2026.106093_b41","series-title":"ICML","first-page":"369","article-title":"Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural networks","author":"Graves","year":"2006"},{"key":"10.1016\/j.imavis.2026.106093_b42","doi-asserted-by":"crossref","unstructured":"Y. Min, A. Hao, X. Chai, X. Chen, Visual alignment constraint for continuous sign language recognition, in: Int. Conf. Comput. Vis., 2021, pp. 11542\u201311551.","DOI":"10.1109\/ICCV48922.2021.01134"},{"key":"10.1016\/j.imavis.2026.106093_b43","doi-asserted-by":"crossref","unstructured":"B. Ni, H. Peng, M. Chen, S. Zhang, G. Meng, J. Fu, S. Xiang, H. Ling, Expanding language-image pretrained models for general video recognition, in: Eur. Conf. Comput. Vis., 2022, pp. 1\u201318.","DOI":"10.1007\/978-3-031-19772-7_1"},{"issue":"10","key":"10.1016\/j.imavis.2026.106093_b44","doi-asserted-by":"crossref","first-page":"12581","DOI":"10.1109\/TPAMI.2023.3282631","article-title":"UniFormer: Unifying convolution and self-attention for visual recognition","volume":"45","author":"Li","year":"2023","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.imavis.2026.106093_b45","doi-asserted-by":"crossref","unstructured":"H. Fan, B. Xiong, K. Mangalam, Y. Li, Z. Yan, J. Malik, C. Feichtenhofer, Multiscale vision transformers, in: Int. Conf. Comput. Vis., 2021, pp. 6824\u20136835.","DOI":"10.1109\/ICCV48922.2021.00675"},{"key":"10.1016\/j.imavis.2026.106093_b46","doi-asserted-by":"crossref","unstructured":"L. Wang, Y. Xiong, Z. Wang, Y. Qiao, D. Lin, X. Tang, L. Van Gool, Temporal segment networks: Towards good practices for deep action recognition, in: Eur. Conf. Comput. Vis., 2016, pp. 20\u201336.","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"10.1016\/j.imavis.2026.106093_b47","doi-asserted-by":"crossref","unstructured":"Z. Niu, B. Mak, Stochastic fine-grained labeling of multi-state sign glosses for continuous sign language recognition, in: Eur. Conf. Comput. Vis., 2020, pp. 172\u2013186.","DOI":"10.1007\/978-3-030-58517-4_11"},{"key":"10.1016\/j.imavis.2026.106093_b48","doi-asserted-by":"crossref","unstructured":"K.L. Cheng, Z. Yang, Q. Chen, Y.-W. Tai, Fully convolutional networks for continuous sign language recognition, in: Eur. Conf. Comput. Vis., 2020, pp. 697\u2013714.","DOI":"10.1007\/978-3-030-58586-0_41"},{"key":"10.1016\/j.imavis.2026.106093_b49","doi-asserted-by":"crossref","unstructured":"J. Pu, W. Zhou, H. Hu, H. Li, Boosting continuous sign language recognition via cross modality augmentation, in: ACM Int. Conf. Multimedia, 2020, pp. 1497\u20131505.","DOI":"10.1145\/3394171.3413931"},{"key":"10.1016\/j.imavis.2026.106093_b50","doi-asserted-by":"crossref","unstructured":"A. Hao, Y. Min, X. Chen, Self-mutual distillation learning for continuous sign language recognition, in: Int. Conf. Comput. Vis., 2021, pp. 11303\u201311312.","DOI":"10.1109\/ICCV48922.2021.01111"},{"key":"10.1016\/j.imavis.2026.106093_b51","doi-asserted-by":"crossref","unstructured":"L. Hu, L. Gao, Z. Liu, W. Feng, Temporal lift pooling for continuous sign language recognition, in: Eur. Conf. Comput. Vis., 2022, pp. 511\u2013527.","DOI":"10.1007\/978-3-031-19833-5_30"},{"issue":"9","key":"10.1016\/j.imavis.2026.106093_b52","doi-asserted-by":"crossref","first-page":"2306","DOI":"10.1109\/TPAMI.2019.2911077","article-title":"Weakly supervised learning with multi-stream CNN-LSTM-HMMs to discover sequential parallelism in sign language videos","volume":"42","author":"Koller","year":"2019","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"7","key":"10.1016\/j.imavis.2026.106093_b53","doi-asserted-by":"crossref","first-page":"1880","DOI":"10.1109\/TMM.2018.2889563","article-title":"A deep neural framework for continuous sign language recognition by iterative training","volume":"21","author":"Cui","year":"2019","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/j.imavis.2026.106093_b54","series-title":"AAAI","first-page":"13009","article-title":"Spatial-temporal multi-cue network for continuous sign language recognition","author":"Zhou","year":"2020"},{"key":"10.1016\/j.imavis.2026.106093_b55","doi-asserted-by":"crossref","unstructured":"R. Zuo, B. Mak, C2SLR: Consistency-enhanced continuous sign language recognition, in: IEEE Conf. Comput. Vis. Pattern Recog., 2022, pp. 5131\u20135140.","DOI":"10.1109\/CVPR52688.2022.00507"},{"key":"10.1016\/j.imavis.2026.106093_b56","series-title":"SF-Net: Structured feature network for continuous sign language recognition","author":"Yang","year":"2019"},{"key":"10.1016\/j.imavis.2026.106093_b57","series-title":"ICML","first-page":"813","article-title":"Is space-time attention all you need for video understanding?","author":"Bertasius","year":"2021"},{"key":"10.1016\/j.imavis.2026.106093_b58","doi-asserted-by":"crossref","unstructured":"Z. Liu, J. Ning, Y. Cao, Y. Wei, Z. Zhang, S. Lin, H. Hu, Video swin transformer, in: IEEE Conf. Comput. Vis. Pattern Recog., 2022, pp. 3202\u20133211.","DOI":"10.1109\/CVPR52688.2022.00320"},{"key":"10.1016\/j.imavis.2026.106093_b59","doi-asserted-by":"crossref","unstructured":"A. Arnab, M. Dehghani, G. Heigold, C. Sun, M. Lu\u010di\u0107, C. Schmid, ViViT: A video vision transformer, in: Int. Conf. Comput. Vis., 2021, pp. 6836\u20136846.","DOI":"10.1109\/ICCV48922.2021.00676"},{"key":"10.1016\/j.imavis.2026.106093_b60","first-page":"12786","article-title":"TokenLearner: Adaptive space-time tokenization for videos","author":"Ryoo","year":"2021","journal-title":"Adv. Neural Inform. Process. Syst."},{"key":"10.1016\/j.imavis.2026.106093_b61","doi-asserted-by":"crossref","unstructured":"Y. Li, C.-Y. Wu, H. Fan, K. Mangalam, B. Xiong, J. Malik, C. Feichtenhofer, MViTv2: Improved multiscale vision transformers for classification and detection, in: IEEE Conf. Comput. Vis. Pattern Recog., 2022, pp. 4804\u20134814.","DOI":"10.1109\/CVPR52688.2022.00476"},{"key":"10.1016\/j.imavis.2026.106093_b62","doi-asserted-by":"crossref","first-page":"35946","DOI":"10.52202\/068431-2605","article-title":"Masked autoencoders as spatiotemporal learners","author":"Feichtenhofer","year":"2022","journal-title":"Adv. Neural Inform. Process. Syst."},{"key":"10.1016\/j.imavis.2026.106093_b63","doi-asserted-by":"crossref","unstructured":"C. Wei, H. Fan, S. Xie, C.-Y. Wu, A. Yuille, C. Feichtenhofer, Masked feature prediction for self-supervised visual pre-training, in: IEEE Conf. Comput. Vis. Pattern Recog., 2022, pp. 14668\u201314678.","DOI":"10.1109\/CVPR52688.2022.01426"},{"key":"10.1016\/j.imavis.2026.106093_b64","doi-asserted-by":"crossref","unstructured":"Z. Lin, S. Geng, R. Zhang, P. Gao, G. de Melo, X. Wang, J. Dai, Y. Qiao, H. Li, Frozen CLIP models are efficient video learners, in: Eur. Conf. Comput. Vis., 2022, pp. 388\u2013404.","DOI":"10.1007\/978-3-031-19833-5_23"},{"key":"10.1016\/j.imavis.2026.106093_b65","doi-asserted-by":"crossref","unstructured":"L. Wang, B. Huang, Z. Zhao, Z. Tong, Y. He, Y. Wang, Y. Wang, Y. Qiao, VideoMAE V2: Scaling video masked autoencoders with dual masking, in: IEEE Conf. Comput. Vis. Pattern Recog., 2023, pp. 14549\u201314560.","DOI":"10.1109\/CVPR52729.2023.01398"},{"key":"10.1016\/j.imavis.2026.106093_b66","series-title":"InternVideo: General video foundation models via generative and discriminative learning","author":"Wang","year":"2022"},{"key":"10.1016\/j.imavis.2026.106093_b67","series-title":"InternVideo2: Scaling video foundation models for multimodal video understanding","author":"Wang","year":"2024"},{"key":"10.1016\/j.imavis.2026.106093_b68","doi-asserted-by":"crossref","unstructured":"C. Feichtenhofer, H. Fan, J. Malik, K. He, SlowFast networks for video recognition, in: Int. Conf. Comput. Vis., 2019, pp. 6202\u20136211.","DOI":"10.1109\/ICCV.2019.00630"},{"key":"10.1016\/j.imavis.2026.106093_b69","series-title":"VIMPAC: Video pre-training via masked token prediction and contrastive learning","author":"Tan","year":"2021"},{"key":"10.1016\/j.imavis.2026.106093_b70","doi-asserted-by":"crossref","unstructured":"L. Wang, Z. Tong, B. Ji, G. Wu, TDN: Temporal difference networks for efficient action recognition, in: IEEE Conf. Comput. Vis. Pattern Recog., 2021, pp. 1895\u20131904.","DOI":"10.1109\/CVPR46437.2021.00193"},{"key":"10.1016\/j.imavis.2026.106093_b71","doi-asserted-by":"crossref","unstructured":"R. Wang, D. Chen, Z. Wu, Y. Chen, X. Dai, M. Liu, Y.-G. Jiang, L. Zhou, L. Yuan, BEVT: Bert pretraining of video transformers, in: IEEE Conf. Comput. Vis. Pattern Recog., 2022, pp. 14733\u201314743.","DOI":"10.1109\/CVPR52688.2022.01432"},{"key":"10.1016\/j.imavis.2026.106093_b72","doi-asserted-by":"crossref","unstructured":"R. Wang, D. Chen, Z. Wu, Y. Chen, X. Dai, M. Liu, L. Yuan, Y.-G. Jiang, Masked video distillation: Rethinking masked feature modeling for self-supervised video representation learning, in: IEEE Conf. Comput. Vis. Pattern Recog., 2023, pp. 6312\u20136322.","DOI":"10.1109\/CVPR52729.2023.00611"},{"key":"10.1016\/j.imavis.2026.106093_b73","doi-asserted-by":"crossref","unstructured":"C. Szegedy, W. Liu, Y. Jia, P. Sermanet, S. Reed, D. Anguelov, D. Erhan, V. Vanhoucke, A. Rabinovich, Going deeper with convolutions, in: IEEE Conf. Comput. Vis. Pattern Recog., 2015, pp. 1\u20139.","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"10.1016\/j.imavis.2026.106093_b74","unstructured":"K. Simonyan, A. Zisserman, Very deep convolutional networks for large-scale image recognition, in: Int. Conf. Learn. Represent., 2015."},{"key":"10.1016\/j.imavis.2026.106093_b75","doi-asserted-by":"crossref","unstructured":"J. Hu, L. Shen, G. Sun, Squeeze-and-excitation networks, in: IEEE Conf. Comput. Vis. Pattern Recog., 2018, pp. 7132\u20137141.","DOI":"10.1109\/CVPR.2018.00745"},{"key":"10.1016\/j.imavis.2026.106093_b76","doi-asserted-by":"crossref","unstructured":"N. Ma, X. Zhang, H.-T. Zheng, J. Sun, ShuffleNet V2: Practical guidelines for efficient cnn architecture design, in: Eur. Conf. Comput. Vis., 2018, pp. 116\u2013131.","DOI":"10.1007\/978-3-030-01264-9_8"},{"key":"10.1016\/j.imavis.2026.106093_b77","doi-asserted-by":"crossref","unstructured":"R.R. Selvaraju, M. Cogswell, A. Das, R. Vedantam, D. Parikh, D. Batra, Grad-CAM: Visual explanations from deep networks via gradient-based localization, in: Int. Conf. Comput. Vis., 2017, pp. 618\u2013626.","DOI":"10.1109\/ICCV.2017.74"}],"container-title":["Image and Vision Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0262885626002003?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0262885626002003?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T06:25:20Z","timestamp":1784528720000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0262885626002003"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":77,"alternative-id":["S0262885626002003"],"URL":"https:\/\/doi.org\/10.1016\/j.imavis.2026.106093","relation":{},"ISSN":["0262-8856"],"issn-type":[{"value":"0262-8856","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Explicitly modeling trajectories and correlations for video analysis","name":"articletitle","label":"Article Title"},{"value":"Image and Vision Computing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.imavis.2026.106093","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"106093"}}