{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,2]],"date-time":"2026-08-02T06:45:57Z","timestamp":1785653157719,"version":"3.56.0"},"publisher-location":"Cham","reference-count":39,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783032316653","type":"print"},{"value":"9783032316660","type":"electronic"}],"license":[{"start":{"date-parts":[[2026,8,3]],"date-time":"2026-08-03T00:00:00Z","timestamp":1785715200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,8,3]],"date-time":"2026-08-03T00:00:00Z","timestamp":1785715200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2027]]},"DOI":"10.1007\/978-3-032-31666-0_37","type":"book-chapter","created":{"date-parts":[[2026,8,2]],"date-time":"2026-08-02T05:46:21Z","timestamp":1785649581000},"page":"560-575","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["TAG-Head: Time-Aligned Graph Head for\u00a0Plug-and-Play Fine-Grained Action Recognition"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-3568-3825","authenticated-orcid":false,"given":"Imtiaz","family":"Ul Hassan","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6013-3935","authenticated-orcid":false,"given":"Nik","family":"Bessis","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0276-9000","authenticated-orcid":false,"given":"Ardhendu","family":"Behera","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,8,3]]},"reference":[{"key":"37_CR1","doi-asserted-by":"crossref","unstructured":"Alqarafi, A., Almogadwy, B.: Strike-net: an explainable dynamic spatiotemporal graph-transformer network for fine-grained soccer action recognition. applied Soft Comput., 114224 (2025)","DOI":"10.1016\/j.asoc.2025.114224"},{"key":"37_CR2","doi-asserted-by":"crossref","unstructured":"Arnab, A., Dehghani, M., Heigold, G., Sun, C., Lu\u010di\u0107, M., Schmid, C.: Vivit: a video vision transformer. In: ICCV, pp. 6836\u20136846 (2021)","DOI":"10.1109\/ICCV48922.2021.00676"},{"key":"37_CR3","doi-asserted-by":"crossref","unstructured":"Ben-Shabat, Y., Shrout, O., Gould, S.: 3dinaction: understanding human actions in 3d point clouds. In: CVPR, pp. 19978\u201319987 (2024)","DOI":"10.1109\/CVPR52733.2024.01888"},{"key":"37_CR4","doi-asserted-by":"crossref","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition? a new model and the kinetics dataset. In: Proc. CVPR (2017)","DOI":"10.1109\/CVPR.2017.502"},{"key":"37_CR5","doi-asserted-by":"crossref","unstructured":"Chaudhuri, S., Bhattacharya, S.: Vilp: knowledge exploration using vision, language, and pose embeddings for video action recognition. In: Proc. ICVGIP (2023)","DOI":"10.1145\/3627631.3627637"},{"key":"37_CR6","doi-asserted-by":"crossref","unstructured":"Chen, J., et al.: Videollm-online: online video large language model for streaming video. In: CVPR, pp. 18407\u201318418 (2024)","DOI":"10.1109\/CVPR52733.2024.01742"},{"key":"37_CR7","doi-asserted-by":"crossref","unstructured":"Chung, J., Shin, H., Kim, J.: Haa500: human-centric atomic action dataset with curated videos. In: Proc. ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.01321"},{"key":"37_CR8","doi-asserted-by":"crossref","unstructured":"Duan, H., Chen, X., Li, Z.: Revisiting skeleton-based action recognition. In: Proc. CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00298"},{"key":"37_CR9","doi-asserted-by":"crossref","unstructured":"Fan, H., Feichtenhofer, C., Malik, J.: Multiscale vision transformers. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00675"},{"key":"37_CR10","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C.: X3d: expanding architectures for efficient video recognition. In: Proc. CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00028"},{"key":"37_CR11","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Fan, H., Malik, J.: Slowfast networks for video recognition. In: Proc. ICCV (2019)","DOI":"10.1109\/ICCV.2019.00630"},{"key":"37_CR12","doi-asserted-by":"crossref","unstructured":"Gasteiger, J., Bojchevski, A., G\u00fcnnemann, S.: Predict then propagate: graph neural networks meet personalized pagerank. In: Proc. ICLR (2019)","DOI":"10.1145\/3394486.3403296"},{"key":"37_CR13","doi-asserted-by":"crossref","unstructured":"Geng, P., Lu, X., Hu, C.: Focusing fine-grained action by self-attention-enhanced graph neural networks with contrastive learning. In: TCSVT (2023)","DOI":"10.1109\/TCSVT.2023.3248782"},{"key":"37_CR14","doi-asserted-by":"crossref","unstructured":"Ghadiyaram, D., Tran, D., Mahajan, D.: Large-scale weakly-supervised pretraining for video action recognition. In: Proc. CVPR (2019)","DOI":"10.1109\/CVPR.2019.01232"},{"key":"37_CR15","doi-asserted-by":"crossref","unstructured":"Humnabadkar, A., Sikdar, A., Zhang, H., Hussain, T., Behera, A.: Driving through graphs: a bipartite graph for traffic scene analysis. In: (ICIP), pp. 908\u2013914. IEEE (2024)","DOI":"10.1109\/ICIP51287.2024.10647492"},{"key":"37_CR16","unstructured":"Jia, C., et al.: Scaling up visual and vision-language representation learning with noisy text supervision. In: Proc. ICML. PMLR (2021)"},{"key":"37_CR17","unstructured":"Kipf, T.N., Welling, M.: Semi-supervised classification with graph convolutional networks. In: Proc. ICLR (2017)"},{"key":"37_CR18","unstructured":"Leong, M.C.: Combined cnn transformer encoder for enhanced fine-grained human action recognition, arXiv:2208.01897 (2022)"},{"key":"37_CR19","doi-asserted-by":"crossref","unstructured":"Li, M., Chen, S., Chen, X., Zhang, Y., Wang, Y., Tian, Q.: Actional-structural graph convolutional networks for skeleton-based action recognition. In: Proc. CVPR (2019)","DOI":"10.1109\/CVPR.2019.00371"},{"key":"37_CR20","doi-asserted-by":"crossref","unstructured":"Li, Y.L., Liu, Y., Zhang, Q., Lu, C.: From isolated islands to pangea: unifying semantic space for human action understanding. In: Proc. CVPR (2024)","DOI":"10.1109\/CVPR52733.2024.01569"},{"key":"37_CR21","doi-asserted-by":"crossref","unstructured":"Lin, J., Gan, C., Han, S.: Tsm: temporal shift module for efficient video understanding. In: Proc. ICCV (2019)","DOI":"10.1109\/ICCV.2019.00718"},{"key":"37_CR22","doi-asserted-by":"crossref","unstructured":"Lin, Z.: Frozen clip models are efficient video learners. In: Proc. ECCV (2022)","DOI":"10.1007\/978-3-031-19833-5_23"},{"key":"37_CR23","doi-asserted-by":"crossref","unstructured":"Ni, B., Li, J., Wang, S.: Expanding language-image pretrained models for general video recognition. In: Proc. ECCV (2022)","DOI":"10.1007\/978-3-031-19772-7_1"},{"key":"37_CR24","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S.: Learning transferable visual models from natural language supervision. In: Proc. ICML. PMLR (2021)"},{"key":"37_CR25","doi-asserted-by":"crossref","unstructured":"Shao, D., Zhao, Y., Dai, B., Lin, D.: Finegym: a hierarchical video dataset for fine-grained action understanding. In: Proc. CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00269"},{"key":"37_CR26","doi-asserted-by":"crossref","unstructured":"Shi, L., Zhang, Y., Cheng, J., Lu, H.: Skeleton-based action recognition with directed graph neural networks. In: Proc. CVPR (2019)","DOI":"10.1109\/CVPR.2019.00810"},{"key":"37_CR27","doi-asserted-by":"crossref","unstructured":"Shi, L., Zhang, Y., Cheng, J., Lu, H.: Two-stream adaptive graph convolutional networks for skeleton-based action recognition. In: Proc. CVPR (2019)","DOI":"10.1109\/CVPR.2019.01230"},{"key":"37_CR28","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., Paluri, M.: A closer look at spatiotemporal convolutions for action recognition. In: Proc. CVPR (2018)","DOI":"10.1109\/CVPR.2018.00675"},{"issue":"11","key":"37_CR29","doi-asserted-by":"publisher","first-page":"2740","DOI":"10.1109\/TPAMI.2018.2868668","volume":"41","author":"L Wang","year":"2018","unstructured":"Wang, L., Xiong, Y., Wang, Z., et al.: Temporal segment networks for action recognition in videos. TPAMI 41(11), 2740\u20132755 (2018)","journal-title":"TPAMI"},{"key":"37_CR30","unstructured":"Wang, M., Xing, J., Liu, Y.: Actionclip: a new paradigm for video action recognition, arXiv:2109.08472 (2021)"},{"key":"37_CR31","doi-asserted-by":"crossref","unstructured":"Yadav, S.K.: Tbac: transformers based attention consensus for human activity recognition. In: Proc. IJCNN (2022)","DOI":"10.1109\/IJCNN55064.2022.9892906"},{"key":"37_CR32","doi-asserted-by":"crossref","unstructured":"Yan, S., Xiong, Y., Lin, D.: Spatial temporal graph convolutional networks for skeleton-based action recognition. In: Proc. AAAI (2018)","DOI":"10.1609\/aaai.v32i1.12328"},{"key":"37_CR33","doi-asserted-by":"crossref","unstructured":"Yang, C., Chen, Y., Zhang, L.: Temporal pyramid network for action recognition. In: Proc. CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00067"},{"key":"37_CR34","doi-asserted-by":"crossref","unstructured":"Yang, M., Gao, H., Guo, P., Wang, L.: Adapting short-term transformers for action detection in untrimmed videos. In: CVPR, pp. 18570\u201318579 (2024)","DOI":"10.1109\/CVPR52733.2024.01757"},{"key":"37_CR35","doi-asserted-by":"crossref","unstructured":"Zhang, C., Gupta, A., Zisserman, A.: Temporal query networks for fine-grained video understanding. In: Proc. CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00446"},{"key":"37_CR36","doi-asserted-by":"crossref","unstructured":"Zhang, H., Li, Y.L., Xu, R., Liu, Y., Lu, C.: Pevl: pose-enhanced vision-language model for fine-grained human action recognition. In: Proc. CVPR (2024)","DOI":"10.1109\/CVPR52733.2024.01784"},{"key":"37_CR37","doi-asserted-by":"crossref","unstructured":"Zhang, H.: Pgvt: pose-guided video transformer for fine-grained action recognition. In: Proc. WACV (2024)","DOI":"10.1109\/WACV57701.2024.00651"},{"key":"37_CR38","unstructured":"Zhang, R., Lu, Y., Ji, P., Xue, J., Yan, X.: Fine-grained knowledge graph-driven video-language learning for action recognition, arXiv preprint arXiv:2407.14146 (2024)"},{"key":"37_CR39","doi-asserted-by":"crossref","unstructured":"Zhou, B.: Temporal relational reasoning in videos. In: Proc. ECCV (2018)","DOI":"10.1007\/978-3-030-01246-5_49"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-032-31666-0_37","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,8,2]],"date-time":"2026-08-02T05:46:24Z","timestamp":1785649584000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-032-31666-0_37"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8,3]]},"ISBN":["9783032316653","9783032316660"],"references-count":39,"URL":"https:\/\/doi.org\/10.1007\/978-3-032-31666-0_37","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,8,3]]},"assertion":[{"value":"3 August 2026","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICPR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Pattern Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Lyon","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"France","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2026","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17 August 2026","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"22 August 2026","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"28","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icpr2026","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/icpr2026.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}