{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T15:45:32Z","timestamp":1778859932140,"version":"3.51.4"},"publisher-location":"Cham","reference-count":58,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031732461","type":"print"},{"value":"9783031732478","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,1]],"date-time":"2024-11-01T00:00:00Z","timestamp":1730419200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,1]],"date-time":"2024-11-01T00:00:00Z","timestamp":1730419200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-73247-8_9","type":"book-chapter","created":{"date-parts":[[2024,10,31]],"date-time":"2024-10-31T12:02:20Z","timestamp":1730376140000},"page":"144-160","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":8,"title":["Synergy of\u00a0Sight and\u00a0Semantics: Visual Intention Understanding with\u00a0CLIP"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-5397-0209","authenticated-orcid":false,"given":"Qu","family":"Yang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3989-7655","authenticated-orcid":false,"given":"Mang","family":"Ye","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7225-5449","authenticated-orcid":false,"given":"Dacheng","family":"Tao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,11,1]]},"reference":[{"key":"9_CR1","unstructured":"Brown, T., et\u00a0al.: Language models are few-shot learners. In: NIPS (2020)"},{"key":"9_CR2","doi-asserted-by":"crossref","unstructured":"Chen, S., Ye, M., Du, B.: Rotation invariant transformer for recognizing object in uavs. In: ACM MM (2022)","DOI":"10.1145\/3503161.3547799"},{"key":"9_CR3","doi-asserted-by":"crossref","unstructured":"Chen, T., Pu, T., Wu, H., Xie, Y., Lin, L.: Structured semantic transfer for multi-label recognition with partial labels. In: AAAI (2022)","DOI":"10.1609\/aaai.v36i1.19910"},{"key":"9_CR4","unstructured":"Chenyue\u00a0Li, S.C., Ye, M.: Adaptive high-frequency transformer for diverse wildlife re-identification. In: ECCV (2024)"},{"key":"9_CR5","doi-asserted-by":"crossref","unstructured":"Deng, S., Wu, L., Shi, G., Zhang, H., Hu, W., Dong, R.: Emotion class-wise aware loss for image emotion classification. In: Artificial Intelligence: First CAAI International Conference (2021)","DOI":"10.1007\/978-3-030-93046-2_47"},{"key":"9_CR6","unstructured":"Dong, L., et al.: Unified language model pre-training for natural language understanding and generation. In: NIPS (2019)"},{"key":"9_CR7","unstructured":"Dosovitskiy, A., et\u00a0al.: An image is worth 16x16 words: transformers for image recognition at scale. In: ICLR (2020)"},{"key":"9_CR8","doi-asserted-by":"publisher","first-page":"581","DOI":"10.1007\/s11263-023-01891-x","volume":"132","author":"P Gao","year":"2023","unstructured":"Gao, P., et al.: Clip-adapter: better vision-language models with feature adapters. Int. J. Comput. Vision 132, 581\u2013595 (2023)","journal-title":"Int. J. Comput. Vision"},{"key":"9_CR9","doi-asserted-by":"publisher","first-page":"530","DOI":"10.1016\/j.procs.2017.12.186","volume":"124","author":"AP Ghaisani","year":"2017","unstructured":"Ghaisani, A.P., Handayani, P.W., Munajat, Q.: Users\u2019 motivation in sharing information social media. Procedia Comput. Sci. 124, 530\u2013535 (2017)","journal-title":"Procedia Comput. Sci."},{"key":"9_CR10","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"9_CR11","unstructured":"Huang, T., Chu, J., Wei, F.: Unsupervised prompt learning for vision-language models. arXiv:2204.03649 (2022)"},{"key":"9_CR12","doi-asserted-by":"crossref","unstructured":"Huang, W., Ye, M., Shi, Z., Du, B.: Generalizable heterogeneous federated cross-correlation and instance similarity learning. IEEE Trans. Pattern Anal. Mach. Intell. (2023)","DOI":"10.1109\/TPAMI.2023.3327373"},{"key":"9_CR13","doi-asserted-by":"crossref","unstructured":"Huang, W., Ye, M., Shi, Z., Li, H., Du, B.: Rethinking federated learning with domain shift: a prototype view. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01565"},{"key":"9_CR14","doi-asserted-by":"crossref","unstructured":"Huang, W., et al.: A federated learning for generalization, robustness, fairness: a survey and benchmark. IEEE Trans. Pattern Anal. Mach. Intell. (2024)","DOI":"10.1109\/TPAMI.2024.3418862"},{"key":"9_CR15","unstructured":"Jia, C., et al.: Scaling up visual and vision-language representation learning with noisy text supervision. In: ICML (2021)"},{"key":"9_CR16","unstructured":"Jia, J., Qu, W., Gong, N.: Multiguard: provably robust multi-label classification against adversarial examples. In: NIPS (2022)"},{"key":"9_CR17","doi-asserted-by":"crossref","unstructured":"Jia, M., Wu, Z., Reiter, A., Cardie, C., Belongie, S., Lim, S.N.: Intentonomy: a dataset and study towards human intent understanding. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.01279"},{"key":"9_CR18","doi-asserted-by":"crossref","unstructured":"Joo, J., Li, W., Steen, F.F., Zhu, S.C.: Visual persuasion: inferring communicative intents of images. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.35"},{"key":"9_CR19","doi-asserted-by":"crossref","unstructured":"Joo, J., Steen, F.F., Zhu, S.C.: Automated facial trait judgment and election outcome prediction: social dimensions of face. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.423"},{"key":"9_CR20","doi-asserted-by":"publisher","first-page":"2891","DOI":"10.1109\/TPAMI.2012.162","volume":"35","author":"G Kulkarni","year":"2013","unstructured":"Kulkarni, G., et al.: Babytalk: understanding and generating simple image descriptions. IEEE Trans. Pattern Anal. Mach. Intell. 35, 2891\u20132903 (2013)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"9_CR21","doi-asserted-by":"crossref","unstructured":"Lester, B., Al-Rfou, R., Constant, N.: The power of scale for parameter-efficient prompt tuning. In: EMNLP (2021)","DOI":"10.18653\/v1\/2021.emnlp-main.243"},{"key":"9_CR22","doi-asserted-by":"crossref","unstructured":"Li, X.L., Liang, P.: Prefix-tuning: optimizing continuous prompts for generation. In: IJCNLP (2021)","DOI":"10.18653\/v1\/2021.acl-long.353"},{"key":"9_CR23","doi-asserted-by":"publisher","first-page":"3485","DOI":"10.1109\/LRA.2020.2976305","volume":"5","author":"B Liu","year":"2020","unstructured":"Liu, B., et al.: Spatiotemporal relationship reasoning for pedestrian intent prediction. IEEE Rob. Autom. Lett. 5, 3485\u20133492 (2020)","journal-title":"IEEE Rob. Autom. Lett."},{"key":"9_CR24","unstructured":"Liu, S., Zhang, L., Yang, X., Su, H., Zhu, J.: Query2label: a simple transformer way to multi-label classification. arXiv:2107.10834 (2021)"},{"key":"9_CR25","doi-asserted-by":"publisher","first-page":"1894","DOI":"10.1109\/TMM.2023.3289762","volume":"26","author":"Y Luo","year":"2023","unstructured":"Luo, Y., Zhong, X., Zeng, M., Xie, J., Wang, S., Liu, G.: Cglf-net: image emotion recognition network by combining global self-attention features and local multiscale features. IEEE Trans. Multimedia 26, 1894\u20131908 (2023)","journal-title":"IEEE Trans. Multimedia"},{"key":"9_CR26","doi-asserted-by":"crossref","unstructured":"Newall, N., et\u00a0al.: Improving neurosurgery education using social media case-based discussions: a pilot study. World Neurosurg. X (2021)","DOI":"10.2196\/preprints.21114"},{"key":"9_CR27","doi-asserted-by":"crossref","unstructured":"Peng, K.C., Sadovnik, A., Gallagher, A., Chen, T.: Where do emotions come from? predicting the emotion stimuli map. In: ICIP (2016)","DOI":"10.1109\/ICIP.2016.7532430"},{"key":"9_CR28","unstructured":"Radford, A., et\u00a0al.: Learning transferable visual models from natural language supervision. In: ICML (2021)"},{"key":"9_CR29","unstructured":"Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I., et\u00a0al.: Language models are unsupervised multitask learners. OpenAI blog (2019)"},{"key":"9_CR30","doi-asserted-by":"crossref","unstructured":"Ridnik, T., et al.: Asymmetric loss for multi-label classification. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00015"},{"key":"9_CR31","unstructured":"Selvaraju, R.R., Das, A., Vedantam, R., Cogswell, M., Parikh, D., Batra, D.: Grad-cam: why did you say that? arXiv:1611.07450 (2016)"},{"key":"9_CR32","doi-asserted-by":"crossref","unstructured":"Shi, Q., Ye, M., Huang, W., Ruan, W., Du, B.: Label-aware calibration and relation-preserving in visual intention understanding. IEEE Trans. Image Process. (2024)","DOI":"10.1109\/TIP.2024.3380250"},{"key":"9_CR33","first-page":"8309","volume":"25","author":"Q Shi","year":"2023","unstructured":"Shi, Q., Ye, M., Zhang, Z., Du, B.: Learnable hierarchical label embedding and grouping for visual intention understanding. IEEE Trans. Affect. Comput. 25, 8309\u20138319 (2023)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"9_CR34","doi-asserted-by":"crossref","unstructured":"Shi, W., Ye, M.: Prototype reminiscence and augmented asymmetric knowledge aggregation for non-exemplar class-incremental learning. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00170"},{"key":"9_CR35","doi-asserted-by":"crossref","unstructured":"Shin, T., Razeghi, Y., Logan\u00a0IV, R.L., Wallace, E., Singh, S.: Autoprompt: eliciting knowledge from language models with automatically generated prompts. In: EMNLP (2020)","DOI":"10.18653\/v1\/2020.emnlp-main.346"},{"key":"9_CR36","doi-asserted-by":"publisher","first-page":"455","DOI":"10.1016\/j.smr.2013.11.004","volume":"17","author":"C Stavros","year":"2014","unstructured":"Stavros, C., Meng, M.D., Westberg, K., Farrelly, F.: Understanding fan motivation for interacting on social media. Sport Manag. Rev. 17, 455\u2013469 (2014)","journal-title":"Sport Manag. Rev."},{"key":"9_CR37","doi-asserted-by":"publisher","DOI":"10.2196\/17187","volume":"23","author":"V Suarez-Lledo","year":"2021","unstructured":"Suarez-Lledo, V., Alvarez-Galvez, J.: Prevalence of health misinformation on social media: systematic review. J. Med. Internet Res. 23, e17187 (2021)","journal-title":"J. Med. Internet Res."},{"key":"9_CR38","unstructured":"Sun, X., Hu, P., Saenko, K.: Dualcoop: fast adaptation to multi-label recognition with limited annotations. In: NIPS (2022)"},{"key":"9_CR39","unstructured":"Vaswani, A., et al.: Attention is all you need. In: NIPS (2017)"},{"key":"9_CR40","doi-asserted-by":"crossref","unstructured":"Vondrick, C., Oktay, D., Pirsiavash, H., Torralba, A.: Predicting motivations of actions by leveraging text. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.327"},{"key":"9_CR41","doi-asserted-by":"publisher","first-page":"8308","DOI":"10.1109\/TMM.2023.3234817","volume":"25","author":"B Wang","year":"2023","unstructured":"Wang, B., Yang, K., Zhao, Y., Long, T., Li, X.: Prototype-based intent perception. IEEE Trans. Multimedia 25, 8308\u20138319 (2023)","journal-title":"IEEE Trans. Multimedia"},{"key":"9_CR42","unstructured":"Wang, S., Liu, F., Yu, M.: Persuasion knowledge and consumers\u2019 attitudes towards benefit-based advertising. In: Australia and New Zealand Marketing Academy Conference Proceedings (2012)"},{"key":"9_CR43","doi-asserted-by":"crossref","unstructured":"Wang, X., et al.: Persuasion for good: towards a personalized persuasive dialogue system for social good. In: ACL (2019)","DOI":"10.18653\/v1\/P19-1566"},{"key":"9_CR44","doi-asserted-by":"crossref","unstructured":"Wortsman, M., et\u00a0al.: Robust fine-tuning of zero-shot models. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00780"},{"key":"9_CR45","doi-asserted-by":"crossref","unstructured":"Wu, J., et al.: A lightweight small object detection method based on multilayer coordination federated intelligence for coal mine iovt. IEEE Internet Things J. (2024)","DOI":"10.1109\/JIOT.2024.3373028"},{"key":"9_CR46","doi-asserted-by":"crossref","unstructured":"Yang, Q., Ye, M., Cai, Z., Su, K., Du, B.: Composed image retrieval via cross relation network with hierarchical aggregation transformer. IEEE Trans. Image Process. (2023)","DOI":"10.1109\/TIP.2023.3299791"},{"key":"9_CR47","unstructured":"Yang, Q., Ye, M., Du, B.: Emollm: multimodal emotional understanding meets large language models (2024)"},{"key":"9_CR48","doi-asserted-by":"crossref","unstructured":"Yao, Y., Zhang, A., Zhang, Z., Liu, Z., Chua, T.S., Sun, M.: Cpt: colorful prompt tuning for pre-trained vision-language models. arXiv:2109.11797 (2021)","DOI":"10.18653\/v1\/2022.findings-acl.273"},{"key":"9_CR49","doi-asserted-by":"crossref","unstructured":"Ye, M., Chen, S., Li, C., Zheng, W.S., Crandall, D., Du, B.: Transformer for object re-identification: a survey. arXiv:2401.06960 (2024)","DOI":"10.1007\/s11263-024-02284-4"},{"key":"9_CR50","doi-asserted-by":"publisher","first-page":"2190","DOI":"10.1109\/TIP.2023.3261743","volume":"32","author":"M Ye","year":"2023","unstructured":"Ye, M., Shi, Q., Su, K., Du, B.: Cross-modality pyramid alignment for visual intention understanding. IEEE Trans. Image Process. 32, 2190\u20132201 (2023)","journal-title":"IEEE Trans. Image Process."},{"key":"9_CR51","doi-asserted-by":"crossref","unstructured":"Ye, M., Wu, Z., Chen, C., Du, B.: Channel augmentation for visible-infrared re-identification. IEEE Trans. Pattern Anal. Mach. Intell. (2023)","DOI":"10.1109\/TPAMI.2023.3332875"},{"key":"9_CR52","doi-asserted-by":"crossref","unstructured":"You, Q., Luo, J., Jin, H., Yang, J.: Building a large scale dataset for image emotion recognition: the fine print and the benchmark. In: AAAI (2016)","DOI":"10.1609\/aaai.v30i1.9987"},{"key":"9_CR53","doi-asserted-by":"publisher","first-page":"2033","DOI":"10.1109\/TMM.2020.3007352","volume":"23","author":"H Zhang","year":"2020","unstructured":"Zhang, H., Xu, M.: Weakly supervised emotion intensity prediction for recognition of emotions in images. IEEE Trans. Multimedia 23, 2033\u20132044 (2020)","journal-title":"IEEE Trans. Multimedia"},{"key":"9_CR54","doi-asserted-by":"publisher","first-page":"221","DOI":"10.1016\/j.neucom.2021.10.062","volume":"469","author":"J Zhang","year":"2022","unstructured":"Zhang, J., Liu, X., Chen, M., Ye, Q., Wang, Z.: Image sentiment classification via multi-level sentiment region correlation analysis. Neurocomputing 469, 221\u2013233 (2022)","journal-title":"Neurocomputing"},{"key":"9_CR55","unstructured":"Zhang, R., et al.: Tip-adapter: training-free clip-adapter for better vision-language modeling. arXiv:2111.03930 (2021)"},{"key":"9_CR56","doi-asserted-by":"crossref","unstructured":"Zhou, K., Yang, J., Loy, C.C., Liu, Z.: Conditional prompt learning for vision-language models. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"9_CR57","doi-asserted-by":"publisher","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","volume":"130","author":"K Zhou","year":"2022","unstructured":"Zhou, K., Yang, J., Loy, C.C., Liu, Z.: Learning to prompt for vision-language models. Int. J. Comput. Vision 130, 2337\u20132348 (2022)","journal-title":"Int. J. Comput. Vision"},{"key":"9_CR58","doi-asserted-by":"crossref","unstructured":"Zyner, A., Worrall, S., Ward, J., Nebot, E.: Long short term memory for driver intent prediction. In: 2017 IEEE Intelligent Vehicles Symposium (2017)","DOI":"10.1109\/IVS.2017.7995919"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-73247-8_9","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,30]],"date-time":"2024-11-30T15:37:27Z","timestamp":1732981047000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-73247-8_9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,1]]},"ISBN":["9783031732461","9783031732478"],"references-count":58,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-73247-8_9","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,1]]},"assertion":[{"value":"1 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}