{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,2]],"date-time":"2026-08-02T06:46:01Z","timestamp":1785653161495,"version":"3.56.0"},"publisher-location":"Cham","reference-count":41,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783032316622","type":"print"},{"value":"9783032316639","type":"electronic"}],"license":[{"start":{"date-parts":[[2026,8,3]],"date-time":"2026-08-03T00:00:00Z","timestamp":1785715200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,8,3]],"date-time":"2026-08-03T00:00:00Z","timestamp":1785715200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2027]]},"DOI":"10.1007\/978-3-032-31663-9_46","type":"book-chapter","created":{"date-parts":[[2026,8,2]],"date-time":"2026-08-02T05:50:00Z","timestamp":1785649800000},"page":"696-712","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["TubeLite: Lightweight Multi-actor Spatio-Temporal Action Detection"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-1160-4112","authenticated-orcid":false,"given":"Ali","family":"Soltaninezhad","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5594-977X","authenticated-orcid":false,"given":"Melissa","family":"Cote","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4691-011X","authenticated-orcid":false,"given":"Alejandro","family":"Rico Espinosa","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0850-9912","authenticated-orcid":false,"given":"Tunai","family":"Porto Marques","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8991-0999","authenticated-orcid":false,"given":"Alexandra","family":"Branzan Albu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,8,3]]},"reference":[{"key":"46_CR1","doi-asserted-by":"crossref","unstructured":"Alwassel, H., Giancola, S., et\u00a0al.: TSP: temporally-sensitive pretraining of video encoders for localization tasks. In: ICCV, pp. 3173\u20133183 (2021)","DOI":"10.1109\/ICCVW54120.2021.00356"},{"key":"46_CR2","unstructured":"Bertasius, G., Wang, H., et al.: Is space-time attention all you need for video understanding? In: ICLM (2021)"},{"key":"46_CR3","doi-asserted-by":"crossref","unstructured":"Bewley, A., Ge, Z., Ott, L., Ramos, F., Upcroft, B.: Simple online and realtime tracking. In: ICIP (2016)","DOI":"10.1109\/ICIP.2016.7533003"},{"key":"46_CR4","doi-asserted-by":"crossref","unstructured":"Carion, N., Massa, F., et\u00a0al.: End-to-end object detection with transformers. In: ECCV, pp. 213\u2013229 (2020)","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"46_CR5","doi-asserted-by":"crossref","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition? A new model and the kinetics dataset. In: CVPR, pp. 6299\u20136308 (2017)","DOI":"10.1109\/CVPR.2017.502"},{"key":"46_CR6","unstructured":"Chen, Y., Kalantidis, Y., et al.: A$$^2$$-nets: double attention networks. In: NeurIPS (2018)"},{"key":"46_CR7","doi-asserted-by":"crossref","unstructured":"Cho, K., Van Merri\u00ebnboer, B., et al.: Learning phrase representations using RNN encoder-decoder for statistical machine translation. In: EMNLP (2014)","DOI":"10.3115\/v1\/D14-1179"},{"key":"46_CR8","unstructured":"Cuturi, M.: Sinkhorn distances: lightspeed computation of optimal transport. In: NeurIPS (2013)"},{"key":"46_CR9","unstructured":"Dosovitskiy, A., Beyer, L., et al.: An image is worth 16x16 words: transformers for image recognition at scale. In: ICLR (2020)"},{"key":"46_CR10","doi-asserted-by":"crossref","unstructured":"Duan, K., Bai, S., et\u00a0al.: CenterNet: keypoint triplets for object detection. In: ICCV, pp. 6569\u20136578 (2019)","DOI":"10.1109\/ICCV.2019.00667"},{"key":"46_CR11","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C.: X3D: expanding architectures for efficient video recognition. In: CVPR, pp. 203\u2013213 (2020)","DOI":"10.1109\/CVPR42600.2020.00028"},{"key":"46_CR12","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Fan, H., et\u00a0al.: SlowFast networks for video recognition. In: ICCV, pp. 6202\u20136211 (2019)","DOI":"10.1109\/ICCV.2019.00630"},{"key":"46_CR13","doi-asserted-by":"crossref","unstructured":"Gkioxari, G., Girshick, R., et\u00a0al.: Contextual action recognition with R* CNN. In: ICCV, pp. 1080\u20131088 (2015)","DOI":"10.1109\/ICCV.2015.129"},{"key":"46_CR14","doi-asserted-by":"crossref","unstructured":"Gu, C., Sun, C., et al.: AVA: a video dataset of spatio-temporally localized atomic visual actions. In: CVPR, pp. 6047\u20136056 (2018)","DOI":"10.1109\/CVPR.2018.00633"},{"key":"46_CR15","doi-asserted-by":"crossref","unstructured":"He, K., Gkioxari, G., et\u00a0al.: Mask R-CNN. In: ICCV, pp. 2961\u20132969 (2017)","DOI":"10.1109\/ICCV.2017.322"},{"key":"46_CR16","doi-asserted-by":"crossref","unstructured":"Hou, R., Chen, C., et\u00a0al.: Tube convolutional neural network (T-CNN) for action detection in videos. In: ICCV, pp. 5822\u20135831 (2017)","DOI":"10.1109\/ICCV.2017.620"},{"key":"46_CR17","unstructured":"Jaegle, A., Gimeno, F., et\u00a0al.: Perceiver: General perception with iterative attention. In: ICML, pp. 4651\u20134664. PMLR (2021)"},{"key":"46_CR18","doi-asserted-by":"crossref","unstructured":"Kalogeiton, V., Weinzaepfel, P., et\u00a0al.: Action Tubelet detector for spatio-temporal action localization. In: ICCV, pp. 4405\u20134413 (2017)","DOI":"10.1109\/ICCV.2017.472"},{"key":"46_CR19","unstructured":"K\u00f6p\u00fckl\u00fc, O., Wei, X., et al.: You only watch once: a unified CNN architecture for real-time spatiotemporal action localization (2019). arXiv preprint arXiv:1911.06644"},{"key":"46_CR20","doi-asserted-by":"crossref","unstructured":"Li, Y., Chen, L., et al.: MultiSports: a multi-person video dataset of spatio-temporally localized sports actions. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.01328"},{"key":"46_CR21","doi-asserted-by":"crossref","unstructured":"Li, Y., Lin, W., et\u00a0al.: CFAD: coarse-to-fine action detector for spatiotemporal action localization. In: ECCV, pp. 510\u2013527 (2020)","DOI":"10.1007\/978-3-030-58517-4_30"},{"key":"46_CR22","doi-asserted-by":"crossref","unstructured":"Li, Y., Wang, Z., et\u00a0al.: Actions as moving points. In: ECCV, pp. 68\u201384 (2020)","DOI":"10.1007\/978-3-030-58517-4_5"},{"key":"46_CR23","doi-asserted-by":"crossref","unstructured":"Lin, J., Gan, C., et al.: TSM: temporal shift module for efficient video understanding. In: CVPR, pp. 7083\u20137093 (2019)","DOI":"10.1109\/ICCV.2019.00718"},{"key":"46_CR24","doi-asserted-by":"crossref","unstructured":"Lin, T., Liu, X., et\u00a0al.: BMN: boundary-matching network for temporal action proposal generation. In: ICCV, pp. 3889\u20133898 (2019)","DOI":"10.1109\/ICCV.2019.00399"},{"key":"46_CR25","doi-asserted-by":"crossref","unstructured":"Lin, T., Zhao, X., et\u00a0al.: BSN: boundary sensitive network for temporal action proposal generation. In: ECCV, pp. 3\u201319 (2018)","DOI":"10.1007\/978-3-030-01225-0_1"},{"key":"46_CR26","doi-asserted-by":"crossref","unstructured":"Lin, T.Y., Goyal, P., et\u00a0al.: Focal loss for dense object detection. In: ICCV, pp. 2980\u20132988 (2017)","DOI":"10.1109\/ICCV.2017.324"},{"key":"46_CR27","doi-asserted-by":"crossref","unstructured":"Liu, Z., Mao, H., et al.: A ConvNet for the 2020s. In: CVPR, pp. 11976\u201311986 (2022)","DOI":"10.1109\/CVPR52688.2022.01167"},{"key":"46_CR28","unstructured":"Loshchilov, I., Hutter, F.: Decoupled weight decay regularization. In: ICLR (2019)"},{"key":"46_CR29","doi-asserted-by":"crossref","unstructured":"Rezatofighi, H., Tsoi, N., et al.: Generalized intersection over union: a metric and a loss for bounding box regression. In: CVPR, pp. 658\u2013666 (2019)","DOI":"10.1109\/CVPR.2019.00075"},{"key":"46_CR30","doi-asserted-by":"crossref","unstructured":"Singh, G., Saha, S., et\u00a0al.: Online real-time multiple spatiotemporal action localisation and prediction. In: ICCV, pp. 3637\u20133646 (2017)","DOI":"10.1109\/ICCV.2017.393"},{"key":"46_CR31","doi-asserted-by":"crossref","unstructured":"Song, L., Zhang, S., et al.: TACNet: transition-aware context network for spatio-temporal action detection. In: CVPR, pp. 11987\u201311995 (2019)","DOI":"10.1109\/CVPR.2019.01226"},{"key":"46_CR32","unstructured":"Soomro, K., Zamir, A.R., et al.: UCF101: a dataset of 101 human actions classes from videos in the wild (2012). arXiv preprint arXiv:1212.0402"},{"key":"46_CR33","doi-asserted-by":"crossref","unstructured":"Tan, M., Pang, R.: EfficientDet: scalable and efficient object detection. In: CVPR, pp. 10781\u201310790 (2020)","DOI":"10.1109\/CVPR42600.2020.01079"},{"issue":"1","key":"46_CR34","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s13735-024-00350-8","volume":"14","author":"Q Tian","year":"2025","unstructured":"Tian, Q., Miao, W., et al.: STCA: an action recognition network with spatio-temporal convolution and attention. Int. J. Multimed. Inf. Retr. 14(1), 1 (2025)","journal-title":"Int. J. Multimed. Inf. Retr."},{"key":"46_CR35","doi-asserted-by":"crossref","unstructured":"Tran, D., Wang, H., et\u00a0al.: A closer look at spatiotemporal convolutions for action recognition. In: CVPR, pp. 6450\u20136459 (2018)","DOI":"10.1109\/CVPR.2018.00675"},{"key":"46_CR36","doi-asserted-by":"crossref","unstructured":"Wu, C.Y., Li, Y., et al.: MeMViT: memory-augmented multiscale vision transformer for efficient long-term video recognition. In: CVPR, pp. 13587\u201313597 (2022)","DOI":"10.1109\/CVPR52688.2022.01322"},{"key":"46_CR37","doi-asserted-by":"crossref","unstructured":"Xu, M., Zhao, C., et al.: G-TAD: sub-graph localization for temporal action detection. In: CVPR, pp. 10156\u201310165 (2020)","DOI":"10.1109\/CVPR42600.2020.01017"},{"key":"46_CR38","doi-asserted-by":"crossref","unstructured":"Yang, X., Yang, X., et\u00a0al.: STEP: spatio-temporal progressive learning for video action detection. In: CVPR, pp. 264\u2013272 (2019)","DOI":"10.1109\/CVPR.2019.00035"},{"key":"46_CR39","doi-asserted-by":"crossref","unstructured":"Zhang, C.L., Wu, J., et\u00a0al.: ActionFormer: localizing moments of actions with transformers. In: ECCV, pp. 492\u2013510. Springer (2022)","DOI":"10.1007\/978-3-031-19772-7_29"},{"key":"46_CR40","doi-asserted-by":"crossref","unstructured":"Zhao, J., Snoek, C.G.: Dance with flow: two-in-one stream action detection. In: CVPR, pp. 9935\u20139944 (2019)","DOI":"10.1109\/CVPR.2019.01017"},{"key":"46_CR41","doi-asserted-by":"crossref","unstructured":"Zhao, J., Zhang, Y., et al.: TubeR: Tubelet transformer for video action detection. In: CVPR, pp. 13598\u201313607 (2022)","DOI":"10.1109\/CVPR52688.2022.01323"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-032-31663-9_46","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,8,2]],"date-time":"2026-08-02T05:50:05Z","timestamp":1785649805000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-032-31663-9_46"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8,3]]},"ISBN":["9783032316622","9783032316639"],"references-count":41,"URL":"https:\/\/doi.org\/10.1007\/978-3-032-31663-9_46","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,8,3]]},"assertion":[{"value":"3 August 2026","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICPR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Pattern Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Lyon","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"France","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2026","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17 August 2026","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"22 August 2026","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"28","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icpr2026","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/icpr2026.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}