{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,25]],"date-time":"2025-03-25T22:34:14Z","timestamp":1742942054230,"version":"3.40.3"},"publisher-location":"Singapore","reference-count":36,"publisher":"Springer Nature Singapore","isbn-type":[{"type":"print","value":"9789819787043"},{"type":"electronic","value":"9789819787050"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-97-8705-0_20","type":"book-chapter","created":{"date-parts":[[2025,2,7]],"date-time":"2025-02-07T14:37:20Z","timestamp":1738939040000},"page":"296-309","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Description Attribute-Enhanced Spatio-Temporal Zero-Shot Action Recognition"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-5925-9842","authenticated-orcid":false,"given":"Yehna","family":"Kim","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4200-5136","authenticated-orcid":false,"given":"Ho-Joong","family":"Kim","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6249-4996","authenticated-orcid":false,"given":"Seong-Whan","family":"Lee","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,2,8]]},"reference":[{"doi-asserted-by":"crossref","unstructured":"Ahmad, M., Lee, S.-W.: Human action recognition using multi-view image sequences. In: International Conference on Automatic Face and Gesture Recognition (FGR06), pp. 523\u2013528 (2006)","key":"20_CR1","DOI":"10.1109\/FGR.2006.65"},{"doi-asserted-by":"crossref","unstructured":"Arnab, A., et\u00a0al.: ViViT: a video vision transformer. In: IEEE International Conference on Computer Vision (ICCV), pp. 6816\u20136826 (2021)","key":"20_CR2","DOI":"10.1109\/ICCV48922.2021.00676"},{"unstructured":"Brown, T.-B., et\u00a0al.: Language models are few-shot learners. In: Advances in Neural Information Processing Systems (NeurIPS), pp. 1877\u20131901 (2020)","key":"20_CR3"},{"unstructured":"Carreira, J., Noland, E., Banki-Horvath, A., Hillier, C., Zisserman, A.: A short note about kinetics-600. In: arXiv preprint arXiv:1808.01340 (2018)","key":"20_CR4"},{"doi-asserted-by":"crossref","unstructured":"Chen, S., Huang, D.: Elaborative rehearsal or zero-shot action recognition. In: IEEE International Conference on Computer Vision (ICCV), pp. 13638\u201313647 (2021)","key":"20_CR5","DOI":"10.1109\/ICCV48922.2021.01338"},{"doi-asserted-by":"crossref","unstructured":"Chen, Y., Chen, D., Liu, R., Li, H., Peng, W.: Video action recognition with attentive semantic units. In: IEEE International Conference on Computer Vision (ICCV), pp. 10170\u201310180 (2023)","key":"20_CR6","DOI":"10.1109\/ICCV51070.2023.00933"},{"unstructured":"Hwang, B.-W., Kim, S., Lee, S.-W.: A full-body gesture database for automatic gesture recognition. In: International Conference on Automatic Face and Gesture Recognition (FGR06), pp. 243\u2013248 (2006)","key":"20_CR7"},{"key":"20_CR8","doi-asserted-by":"publisher","first-page":"203","DOI":"10.1016\/j.neucom.2022.12.026","volume":"522","author":"W Hyun","year":"2023","unstructured":"Hyun, W., Nam, W.-J., Lee, S.-W.: Dissimilate-and-assimilate strategy for video anomaly detection and localization. Neurocomputing 522, 203\u2013213 (2023)","journal-title":"Neurocomputing"},{"doi-asserted-by":"crossref","unstructured":"Jain, A., Mildenhall, B., Barron, J.-T., Abbeel, P., Poole, B.: Zero-shot text-guided object generation with dream fields. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 867\u2013876 (2022)","key":"20_CR9","DOI":"10.1109\/CVPR52688.2022.00094"},{"unstructured":"Jia, C., et\u00a0al.: Scaling up visual and vision-language representation learning with noisy text supervision. In: International Conference on Machine Learning (ICML), pp. 4904\u20134916 (2021)","key":"20_CR10"},{"key":"20_CR11","doi-asserted-by":"publisher","first-page":"282","DOI":"10.1016\/j.neunet.2023.10.038","volume":"169","author":"K-M Jin","year":"2023","unstructured":"Jin, K.-M., et al.: Masked kinematic continuity-aware hierarchical attention network for pose estimation in videos. Neural Netw. 169, 282\u2013292 (2023)","journal-title":"Neural Netw."},{"doi-asserted-by":"crossref","unstructured":"Kahatapitiya, K., Arnab, A., Nagrani, A., Ryoo, M.-S.: VicTR: video-conditioned text representations for activity recognition. In: arXiv preprint arXiv:2304.02560 (2023)","key":"20_CR12","DOI":"10.1109\/CVPR52733.2024.01755"},{"doi-asserted-by":"crossref","unstructured":"Kang, T.-K., Lee, G.-H., Jin, K.-M., Lee, S.-W.: Action-aware masking network with group-based attention for temporal action localization. In: Proceedings of IEEE\/CVF Winter Conference on Applications of Computer Vision (WACV), pp. 6047\u20136056 (2023)","key":"20_CR13","DOI":"10.1109\/WACV56688.2023.00600"},{"unstructured":"Kay, W., et\u00a0al.: The kinetics human action video dataset. In: arXiv preprint arXiv:1705.06950 (2017)","key":"20_CR14"},{"key":"20_CR15","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2023.110201","volume":"148","author":"Y-E Kim","year":"2023","unstructured":"Kim, Y.-E., Lee, Y.-W., Lee, S.-W.: LC-MSM: language-conditioned masked segmentation model for unsupervised domain adaptation. Pattern Recogn. 148, 110201 (2023)","journal-title":"Pattern Recogn."},{"unstructured":"Kolesnikov, A., et\u00a0al.: Big Transfer (BiT): general visual representation learning. In: arXiv preprint arXiv:1912.11370 (2019)","key":"20_CR16"},{"doi-asserted-by":"crossref","unstructured":"Kuehne, H., Jhuang, H., Garrote, E., Poggio, T.-A., Serre, T.: HMDB: a large video database for human motion recognition. In: IEEE International Conference on Computer Vision (ICCV), pp. 2556\u20132563 (2011)","key":"20_CR17","DOI":"10.1109\/ICCV.2011.6126543"},{"issue":"3","key":"20_CR18","doi-asserted-by":"publisher","first-page":"711","DOI":"10.1016\/S0031-3203(00)00007-8","volume":"34","author":"M-S Lee","year":"2001","unstructured":"Lee, M.-S., Yang, Y.-M., Lee, S.-W.: Automatic video parsing using shot boundary detection and camera operation analysis. Pattern Recogn. 34(3), 711\u2013719 (2001)","journal-title":"Pattern Recogn."},{"doi-asserted-by":"crossref","unstructured":"Lee, Y.-W., Oh, M.-S., Kim, H.-J., Lee, S.-W.: Enhancing discriminative ability among similar classes with guidance of text-image correlation for unsupervised domain adaptation. In: International Joint Conference on Neural Networks (IJCNN), pp. 01\u201308 (2023)","key":"20_CR19","DOI":"10.1109\/IJCNN54540.2023.10191689"},{"unstructured":"Li, J., Li, D., Xiong, C., Hoi, S.: BLIP: bootstrapping language-image pre-training for unified vision-language understanding and generation. In: International Conference on Machine Learning (ICML), pp. 12888\u201312900 (2022)","key":"20_CR20"},{"doi-asserted-by":"crossref","unstructured":"Lin, W., et\u00a0al.: MAtch, eXpand and improve: unsupervised finetuning for zero-shot action recognition with language knowledge. In: IEEE International Conference on Computer Vision (ICCV), pp. 2851\u20132862 (2023)","key":"20_CR21","DOI":"10.1109\/ICCV51070.2023.00267"},{"unstructured":"Mokady, R., Hertz, A., Bermano, A.-H.: ClipCap: CLIP prefix for image captioning. In: arXiv preprint arXiv:2111.09734 (2021)","key":"20_CR22"},{"doi-asserted-by":"crossref","unstructured":"Ni, B., et\u00a0al.: Expanding language-image pretrained models for general video recognition. In: European Conference on Computer Vision (ECCV), pp. 1\u201318 (2022)","key":"20_CR23","DOI":"10.1007\/978-3-031-19772-7_1"},{"doi-asserted-by":"crossref","unstructured":"Qian, Y., Yu, L., Liu, W., Hauptmann, A.-G.: Rethinking zero-shot action recognition: learning from latent atomic actions. In: European Conference on Computer Vision (ECCV), pp. 104\u2013120 (2022)","key":"20_CR24","DOI":"10.1007\/978-3-031-19772-7_7"},{"unstructured":"Radford, A., et\u00a0al.: Learning transferable visual models from natural language supervision. In: International Conference on Machine Learning (ICML), pp. 8748\u20138763 (2021)","key":"20_CR25"},{"unstructured":"Ryoo, M., Piergiovanni, A., Arnab, A., Dehghani, M., Angelova, A.: TokenLearner: adaptive space-time tokenization for videos. In: Advances in Neural Information Processing Systems (NeurIPS), pp. 12786\u201312797 (2021)","key":"20_CR26"},{"unstructured":"Soomro, K., Zamir, A.-R., Shah, M.: UCF101: a dataset of 101 human actions classes from videos in the wild. In: arXiv preprint arXiv:1212.0402 (2012)","key":"20_CR27"},{"unstructured":"Wang, M., Xing, J., Liu, Y.: ActionCLIP: a new paradigm for video action recognition. In: arXiv preprint arXiv:2109.08472 (2021)","key":"20_CR28"},{"doi-asserted-by":"crossref","unstructured":"Wang, Z., et\u00a0al.: CRIS: clip-driven referring image segmentation. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 11676\u201311685 (2022)","key":"20_CR29","DOI":"10.1109\/CVPR52688.2022.01139"},{"doi-asserted-by":"crossref","unstructured":"Won, D.-O., M\u00fcller, K.-R., Lee, S.-W.: An adaptive deep reinforcement learning framework enables curling robots with human-like performance in real-world conditions. Sci. Robot. 5(46), eabb9764 (2020)","key":"20_CR30","DOI":"10.1126\/scirobotics.abb9764"},{"doi-asserted-by":"crossref","unstructured":"Wu, W., Sun, Z., Ouyang, W.: Revisiting classifier: transferring vision-language models for video recognition. In: Proceedings of the AAAI Conference on Artificial Intelligence (AAAI), pp. 2847\u20132855 (2023)","key":"20_CR31","DOI":"10.1609\/aaai.v37i3.25386"},{"doi-asserted-by":"crossref","unstructured":"Wu, W., et\u00a0al.: Bidirectional cross-modal knowledge exploration for video recognition with pre-trained vision-language models. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6620\u20136630 (2023)","key":"20_CR32","DOI":"10.1109\/CVPR52729.2023.00640"},{"doi-asserted-by":"crossref","unstructured":"Yan, S., et\u00a0al.: Multiview transformers for video recognition. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3333\u20133343 (2022)","key":"20_CR33","DOI":"10.1109\/CVPR52688.2022.00333"},{"issue":"11","key":"20_CR34","doi-asserted-by":"publisher","first-page":"3120","DOI":"10.1016\/j.patcog.2007.01.033","volume":"40","author":"H-D Yang","year":"2007","unstructured":"Yang, H.-D., Lee, S.-W.: Reconstruction of 3D human body pose from stereo image sequences based on top-down learning. Pattern Recognit. 40(11), 3120\u20133131 (2007)","journal-title":"Pattern Recognit."},{"unstructured":"Yuan, L., et\u00a0al.: Florence: a new foundation model for computer vision. In: arXiv preprint arXiv:2111.11432 (2021)","key":"20_CR35"},{"unstructured":"Zhang, B., et\u00a0al.: Co-training transformer with videos and images improves action recognition. In: arXiv preprint arXiv:2112.07175 (2021)","key":"20_CR36"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition and Artificial Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-97-8705-0_20","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,7]],"date-time":"2025-02-07T14:37:48Z","timestamp":1738939068000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-97-8705-0_20"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9789819787043","9789819787050"],"references-count":36,"URL":"https:\/\/doi.org\/10.1007\/978-981-97-8705-0_20","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"8 February 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICPRAI","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Pattern Recognition and Artificial Intelligence","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Jeju Island","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Korea (Republic of)","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18 June 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"21 June 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icprai2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/brain.korea.ac.kr\/icprai2024\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}