{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T07:03:19Z","timestamp":1784530999618,"version":"3.55.0"},"reference-count":68,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62225112"],"award-info":[{"award-number":["62225112"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Image and Vision Computing"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.imavis.2026.106025","type":"journal-article","created":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T06:49:16Z","timestamp":1779173356000},"page":"106025","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Linking-free online spatio temporal action detection"],"prefix":"10.1016","volume":"173","author":[{"given":"Ningyu","family":"Sun","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6204-1313","authenticated-orcid":false,"given":"Ning","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yichao","family":"Yan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guangtao","family":"Zhai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaokang","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"1","key":"10.1016\/j.imavis.2026.106025_b1","doi-asserted-by":"crossref","first-page":"24772","DOI":"10.1038\/s41598-024-73622-2","article-title":"Real-time spatiotemporal action localization algorithm using improved cnns architecture","volume":"14","author":"Liu","year":"2024","journal-title":"Sci. Rep."},{"key":"10.1016\/j.imavis.2026.106025_b2","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2023.110087","article-title":"Spatio-temporal human action localization in indoor surveillances","volume":"147","author":"Liu","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.imavis.2026.106025_b3","series-title":"CVPR","article-title":"Finding action tubes","author":"Gkioxari","year":"2015"},{"key":"10.1016\/j.imavis.2026.106025_b4","series-title":"CVPR","article-title":"Actionness estimation using hybrid fully convolutional networks","author":"Wang","year":"2016"},{"key":"10.1016\/j.imavis.2026.106025_b5","series-title":"ICCV","article-title":"Online real-time multiple spatiotemporal action localisation and prediction","author":"Singh","year":"2017"},{"key":"10.1016\/j.imavis.2026.106025_b6","series-title":"CVPR","article-title":"Improving action localization by progressive cross-stream cooperation","author":"Su","year":"2019"},{"key":"10.1016\/j.imavis.2026.106025_b7","doi-asserted-by":"crossref","first-page":"54661","DOI":"10.1109\/ACCESS.2024.3388532","article-title":"Online hierarchical linking of action tubes for spatio-temporal action detection based on multiple clues","volume":"12","author":"Su","year":"2024","journal-title":"IEEE Access"},{"key":"10.1016\/j.imavis.2026.106025_b8","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110704","article-title":"Discriminative action tubelet detector for weakly-supervised action detection","volume":"155","author":"Lee","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.imavis.2026.106025_b9","series-title":"BMVC","article-title":"Deep learning for detecting multiple space\u2013time action tubes in videos","author":"Saha","year":"2016"},{"key":"10.1016\/j.imavis.2026.106025_b10","doi-asserted-by":"crossref","unstructured":"A.A. Gritsenko, X. Xiong, J. Djolonga, M. Dehghani, C. Sun, M. Lucic, C. Schmid, A. Arnab, End-to-end spatio-temporal action localisation with video transformers, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 18373\u201318383.","DOI":"10.1109\/CVPR52733.2024.01739"},{"key":"10.1016\/j.imavis.2026.106025_b11","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2025.131307","article-title":"Vstrd: An end-to-end video spatio-temporal relation detection transformer","author":"Chang","year":"2025","journal-title":"Neurocomputing"},{"issue":"10","key":"10.1016\/j.imavis.2026.106025_b12","doi-asserted-by":"crossref","first-page":"3013","DOI":"10.3390\/s25103013","article-title":"Yolo-act: Unified spatiotemporal detection of human actions across multi-frame sequences","volume":"25","author":"Alzahrani","year":"2025","journal-title":"Sensors"},{"key":"10.1016\/j.imavis.2026.106025_b13","doi-asserted-by":"crossref","unstructured":"M. Kim, F. Spinola, P. Benz, T.-H. Kim, A*: Atrous spatial temporal action recognition for real time applications, in: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, 2024, pp. 7014\u20137024.","DOI":"10.1109\/WACV57701.2024.00686"},{"issue":"3","key":"10.1016\/j.imavis.2026.106025_b14","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/s00530-025-01796-4","article-title":"Mlstif: multi-level spatio-temporal and human-object interaction feature fusion network for spatio-temporal action detection","volume":"31","author":"Yang","year":"2025","journal-title":"Multimedia Syst."},{"key":"10.1016\/j.imavis.2026.106025_b15","doi-asserted-by":"crossref","first-page":"107984","DOI":"10.52202\/079017-3429","article-title":"Yolov10: Real-time end-to-end object detection","volume":"37","author":"Wang","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.imavis.2026.106025_b16","doi-asserted-by":"crossref","unstructured":"Y. Zhao, W. Lv, S. Xu, J. Wei, G. Wang, Q. Dang, Y. Liu, J. Chen, Detrs beat yolos on real-time object detection, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 16965\u201316974.","DOI":"10.1109\/CVPR52733.2024.01605"},{"key":"10.1016\/j.imavis.2026.106025_b17","series-title":"Rt-detrv2: Improved baseline with bag-of-freebies for real-time detection transformer","author":"Lv","year":"2024"},{"key":"10.1016\/j.imavis.2026.106025_b18","series-title":"2025 IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"1628","article-title":"Rt-detrv3: Real-time end-to-end object detection with hierarchical dense positive supervision","author":"Wang","year":"2025"},{"key":"10.1016\/j.imavis.2026.106025_b19","series-title":"ECCV","article-title":"SSD: single shot multibox detector","author":"Liu","year":"2016"},{"key":"10.1016\/j.imavis.2026.106025_b20","series-title":"CVPR","article-title":"You only look once: Unified, real-time object detection","author":"Redmon","year":"2016"},{"key":"10.1016\/j.imavis.2026.106025_b21","series-title":"Yolov3: An incremental improvement","author":"Redmon","year":"2018"},{"key":"10.1016\/j.imavis.2026.106025_b22","series-title":"ICCV","article-title":"Fast R-CNN","author":"Girshick","year":"2015"},{"key":"10.1016\/j.imavis.2026.106025_b23","series-title":"NeurIPS","article-title":"Faster R-CNN: towards real-time object detection with region proposal networks","author":"Ren","year":"2015"},{"key":"10.1016\/j.imavis.2026.106025_b24","series-title":"ICCV","article-title":"Hierarchical convolutional features for visual tracking","author":"Ma","year":"2015"},{"key":"10.1016\/j.imavis.2026.106025_b25","series-title":"CVPR","article-title":"Context-aware correlation filter tracking","author":"Mueller","year":"2017"},{"key":"10.1016\/j.imavis.2026.106025_b26","series-title":"Multiple object tracking: A review","author":"Luo","year":"2014"},{"key":"10.1016\/j.imavis.2026.106025_b27","series-title":"Trackformer: Multi-object tracking with transformers","author":"Meinhardt","year":"2021"},{"key":"10.1016\/j.imavis.2026.106025_b28","series-title":"CVPR","first-page":"19113","article-title":"Diffusiontrack: Point set diffusion model for visual object tracking","author":"Xie","year":"2024"},{"issue":"5","key":"10.1016\/j.imavis.2026.106025_b29","first-page":"2386","article-title":"Deep object tracking with shrinkage loss","volume":"44","author":"Lu","year":"2022","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.imavis.2026.106025_b30","series-title":"ICCV","article-title":"Robust tracking-by-detection using a detector confidence particle filter","author":"Breitenstein","year":"2009"},{"key":"10.1016\/j.imavis.2026.106025_b31","series-title":"CVPR","article-title":"Center-based 3d object detection and tracking","author":"Yin","year":"2021"},{"key":"10.1016\/j.imavis.2026.106025_b32","series-title":"ICCV","article-title":"Tracking without bells and whistles","author":"Bergmann","year":"2019"},{"key":"10.1016\/j.imavis.2026.106025_b33","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111169","article-title":"Learning data association for multi-object tracking using only coordinates","volume":"160","author":"Miah","year":"2025","journal-title":"Pattern Recognit."},{"issue":"1","key":"10.1016\/j.imavis.2026.106025_b34","doi-asserted-by":"crossref","first-page":"31414","DOI":"10.1038\/s41598-025-16389-4","article-title":"A two stage multi object tracking algorithm with transformer and attention mechanism","volume":"15","author":"Hou","year":"2025","journal-title":"Sci. Rep."},{"issue":"3","key":"10.1016\/j.imavis.2026.106025_b35","doi-asserted-by":"crossref","first-page":"590","DOI":"10.3390\/electronics13030590","article-title":"Detection-free object tracking for multiple occluded targets in plenoptic video","volume":"13","author":"Yong","year":"2024","journal-title":"Electronics"},{"issue":"10","key":"10.1016\/j.imavis.2026.106025_b36","doi-asserted-by":"crossref","first-page":"2453","DOI":"10.1007\/s11263-022-01661-1","article-title":"EAN: event adaptive network for enhanced action recognition","volume":"130","author":"Tian","year":"2022","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.imavis.2026.106025_b37","series-title":"CVPR","first-page":"18816","article-title":"Svformer: Semi-supervised video transformer for action recognition","author":"Xing","year":"2023"},{"key":"10.1016\/j.imavis.2026.106025_b38","series-title":"NeurIPS","article-title":"Two-stream convolutional networks for action recognition in videos","author":"Simonyan","year":"2014"},{"key":"10.1016\/j.imavis.2026.106025_b39","series-title":"ICCV","article-title":"Learning spatiotemporal features with 3d convolutional networks","author":"Tran","year":"2015"},{"key":"10.1016\/j.imavis.2026.106025_b40","series-title":"CVPR","article-title":"Quo vadis, action recognition? A new model and the kinetics dataset","author":"Carreira","year":"2017"},{"issue":"4","key":"10.1016\/j.imavis.2026.106025_b41","doi-asserted-by":"crossref","first-page":"677","DOI":"10.1109\/TPAMI.2016.2599174","article-title":"Long-term recurrent convolutional networks for visual recognition and description","volume":"39","author":"Donahue","year":"2017","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.imavis.2026.106025_b42","series-title":"ICCV","article-title":"Vivit: A video vision transformer","author":"Arnab","year":"2021"},{"key":"10.1016\/j.imavis.2026.106025_b43","series-title":"ICCV","author":"Neimark","year":"2021"},{"key":"10.1016\/j.imavis.2026.106025_b44","series-title":"Internvideo2: Scaling video foundation models for multimodal video understanding","author":"Wang","year":"2024"},{"key":"10.1016\/j.imavis.2026.106025_b45","doi-asserted-by":"crossref","DOI":"10.3389\/fnbot.2024.1457843","article-title":"Ls-vit: Vision transformer for action recognition based on long and short-term temporal difference","volume":"18","author":"Chen","year":"2024","journal-title":"Front. Neurorobotics"},{"key":"10.1016\/j.imavis.2026.106025_b46","series-title":"Dinov3","author":"Sim\u00e9oni","year":"2025"},{"key":"10.1016\/j.imavis.2026.106025_b47","series-title":"CVPR","first-page":"3320","article-title":"Learning salient boundary feature for anchor-free temporal action localization","author":"Lin","year":"2021"},{"key":"10.1016\/j.imavis.2026.106025_b48","series-title":"ICCV","first-page":"13577","article-title":"Unloc: A unified framework for video localization tasks","author":"Yan","year":"2023"},{"issue":"9","key":"10.1016\/j.imavis.2026.106025_b49","doi-asserted-by":"crossref","first-page":"188:1","DOI":"10.1145\/3556537","article-title":"A survey on video moment localization","volume":"55","author":"Liu","year":"2023","journal-title":"ACM Comput. Surv."},{"key":"10.1016\/j.imavis.2026.106025_b50","series-title":"CVPR","first-page":"18373","article-title":"End-to-end spatio-temporal action localisation with video transformers","author":"Gritsenko","year":"2024"},{"key":"10.1016\/j.imavis.2026.106025_b51","doi-asserted-by":"crossref","DOI":"10.1016\/j.imavis.2024.105059","article-title":"Tqrformer: Tubelet query recollection transformer for action detection","volume":"147","author":"Wang","year":"2024","journal-title":"Image Vis. Comput."},{"key":"10.1016\/j.imavis.2026.106025_b52","series-title":"ECCV","article-title":"Actions as moving points","author":"Li","year":"2020"},{"key":"10.1016\/j.imavis.2026.106025_b53","first-page":"47908","article-title":"Does video-text pretraining help open-vocabulary online action detection?","volume":"37","author":"Wang","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.imavis.2026.106025_b54","series-title":"ICCV","article-title":"Tube convolutional neural network (T-CNN) for action detection in videos","author":"Hou","year":"2017"},{"key":"10.1016\/j.imavis.2026.106025_b55","series-title":"ECCV","article-title":"Recurrent tubelet proposal and recognition networks for action detection","author":"Li","year":"2018"},{"key":"10.1016\/j.imavis.2026.106025_b56","series-title":"You only watch once: A unified cnn architecture for real-time spatiotemporal action localization","author":"O. K\u00f6p\u00fckl\u00fc","year":"2019"},{"key":"10.1016\/j.imavis.2026.106025_b57","series-title":"International Conference on Intelligent Robotics and Applications","first-page":"33","article-title":"Yowov2: A stronger yet efficient multi-level detection framework for real-time spatio-temporal action detection","author":"Jiang","year":"2024"},{"key":"10.1016\/j.imavis.2026.106025_b58","series-title":"CVPR","article-title":"Feature pyramid networks for object detection","author":"Lin","year":"2017"},{"key":"10.1016\/j.imavis.2026.106025_b59","series-title":"UCF101: a dataset of 101 human actions classes from videos in the wild","author":"Soomro","year":"2012"},{"key":"10.1016\/j.imavis.2026.106025_b60","series-title":"ICCV","article-title":"Action tubelet detector for spatio-temporal action localization","author":"Kalogeiton","year":"2017"},{"key":"10.1016\/j.imavis.2026.106025_b61","series-title":"ICCV","article-title":"Towards understanding action recognition","author":"Jhuang","year":"2013"},{"key":"10.1016\/j.imavis.2026.106025_b62","series-title":"ECCV","article-title":"Multi-region two-stream R-CNN for action detection","author":"Peng","year":"2016"},{"key":"10.1016\/j.imavis.2026.106025_b63","series-title":"CVPR","article-title":"STEP: spatio-temporal progressive learning for video action detection","author":"Yang","year":"2019"},{"key":"10.1016\/j.imavis.2026.106025_b64","series-title":"CVPR","article-title":"Tacnet: Transition-aware context network for spatio-temporal action detection","author":"Song","year":"2019"},{"key":"10.1016\/j.imavis.2026.106025_b65","series-title":"CVPR","article-title":"Dance with flow: Two-in-one stream action detection","author":"Zhao","year":"2019"},{"key":"10.1016\/j.imavis.2026.106025_b66","series-title":"CVPR","first-page":"14680","article-title":"End-to-end semi-supervised learning for video action detection","author":"Kumar","year":"2022"},{"key":"10.1016\/j.imavis.2026.106025_b67","series-title":"ICCV","first-page":"8097","article-title":"Unified graph structured models for video understanding","author":"Arnab","year":"2021"},{"key":"10.1016\/j.imavis.2026.106025_b68","series-title":"CVPR","first-page":"13588","article-title":"Tuber: Tubelet transformer for video action detection","author":"Zhao","year":"2022"}],"container-title":["Image and Vision Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0262885626001320?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0262885626001320?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T06:21:50Z","timestamp":1784528510000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0262885626001320"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":68,"alternative-id":["S0262885626001320"],"URL":"https:\/\/doi.org\/10.1016\/j.imavis.2026.106025","relation":{},"ISSN":["0262-8856"],"issn-type":[{"value":"0262-8856","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Linking-free online spatio temporal action detection","name":"articletitle","label":"Article Title"},{"value":"Image and Vision Computing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.imavis.2026.106025","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"106025"}}