{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,7,2]],"date-time":"2025-07-02T04:24:38Z","timestamp":1751430278926,"version":"3.41.0"},"publisher-location":"Singapore","reference-count":25,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819666010","type":"print"},{"value":"9789819665990","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-96-6599-0_20","type":"book-chapter","created":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T22:20:18Z","timestamp":1751408418000},"page":"289-303","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Asymmetric Language-Aware Feature Learning for\u00a0Low-Resource Cross-Lingual Image Caption"],"prefix":"10.1007","author":[{"given":"Miaomiao","family":"Lyu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junjie","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Meishan","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,7,2]]},"reference":[{"key":"20_CR1","doi-asserted-by":"crossref","unstructured":"Wang, Y., Wang, F., Dong, J., Luo, H.: Cl2cm: improving cross-lingual cross-modal retrieval via cross-lingual knowledge transfer. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.\u00a038, pp. 5651\u20135659 (2024)","DOI":"10.1609\/aaai.v38i6.28376"},{"key":"20_CR2","doi-asserted-by":"crossref","unstructured":"Song, Z., Hu, Z., Zhou, Y., Zhao, Y., Hong, R., Wang, M.: Embedded heterogeneous attention transformer for cross-lingual image captioning. IEEE Trans. Multimedia (2024)","DOI":"10.1109\/TMM.2024.3384678"},{"key":"20_CR3","doi-asserted-by":"publisher","first-page":"1522","DOI":"10.1109\/TIP.2024.3365248","volume":"33","author":"Y Wang","year":"2024","unstructured":"Wang, Y., et al.: Dual-view curricular optimal transport for cross-lingual cross-modal retrieval. IEEE Trans. Image Process. 33, 1522\u20131533 (2024)","journal-title":"IEEE Trans. Image Process."},{"key":"20_CR4","doi-asserted-by":"crossref","unstructured":"Cai, R., et al.: Cross-lingual cross-modal retrieval with noise-robust fine-tuning. IEEE Trans. Knowl. Data Eng. (2024)","DOI":"10.1109\/TKDE.2024.3400060"},{"key":"20_CR5","doi-asserted-by":"crossref","unstructured":"Li, Z., Fan, Z., Chen, J., Zhang, Q., Huang, X.J., Wei, Z.: Unifying cross-lingual and cross-modal modeling towards weakly supervised multilingual vision-language pre-training. In: Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 5939\u20135958 (2023)","DOI":"10.18653\/v1\/2023.acl-long.327"},{"key":"20_CR6","unstructured":"Jin, W., et al.: Grill: grounded vision-language pre-training via aligning text and image regions. arXiv preprint arXiv:2305.14676 (2023)"},{"key":"20_CR7","unstructured":"Mo, S., Kim, M., Lee, K., Shin, J.: S-clip: semi-supervised vision-language learning using few specialist captions. In: Advances in Neural Information Processing Systems, vol. 36 (2024)"},{"key":"20_CR8","doi-asserted-by":"crossref","unstructured":"Sun, R., et al.: Fusion or defusion? flexible vision-and-language pre-training. In: Findings of the Association for Computational Linguistics: ACL 2023, pp. 5105\u20135119 (2023)","DOI":"10.18653\/v1\/2023.findings-acl.316"},{"key":"20_CR9","doi-asserted-by":"crossref","unstructured":"Huang, L., Niu, G., Liu, J., Xiao, X., Wu, H.: Du-vlg: unifying vision-and-language generation via dual sequence-to-sequence pre-training. arXiv preprint arXiv:2203.09052 (2022)","DOI":"10.18653\/v1\/2022.findings-acl.201"},{"key":"20_CR10","unstructured":"Fini, E., Astolfi, P., Romero-Soriano, A., Verbeek, J., Drozdzal, M.: Improved baselines for vision-language pre-training. arXiv preprint arXiv:2305.08675 (2023)"},{"key":"20_CR11","doi-asserted-by":"crossref","unstructured":"Jiang, C., et al.: Bus: efficient and effective vision-language pre-training with bottom-up patch summarization. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 2900\u20132910 (2023)","DOI":"10.1109\/ICCV51070.2023.00271"},{"key":"20_CR12","doi-asserted-by":"crossref","unstructured":"Lu, H., Fei, N., Huo, Y., Gao, Y., Lu, Z., Wen, J.R.: Cots: collaborative two-stream vision-language pre-training model for cross-modal retrieval. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 15692\u201315701 (2022)","DOI":"10.1109\/CVPR52688.2022.01524"},{"key":"20_CR13","doi-asserted-by":"crossref","unstructured":"Yang, J., et al.: Vision-language pre-training with triple contrastive learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 15671\u201315680 (2022)","DOI":"10.1109\/CVPR52688.2022.01522"},{"issue":"9","key":"20_CR14","doi-asserted-by":"publisher","first-page":"2347","DOI":"10.1109\/TMM.2019.2896494","volume":"21","author":"X Li","year":"2019","unstructured":"Li, X., et al.: Coco-cn for cross-lingual image tagging, captioning, and retrieval. IEEE Trans. Multimedia 21(9), 2347\u20132360 (2019)","journal-title":"IEEE Trans. Multimedia"},{"key":"20_CR15","unstructured":"Choudhury, P., Guha, P., Nandi, S.: Image caption synthesis for low resource assamese language using bi-lstm with bilinear attention. In: Proceedings of the 37th Pacific Asia Conference on Language, Information and Computation, pp. 743\u2013752 (2023)"},{"key":"20_CR16","doi-asserted-by":"crossref","unstructured":"Xiao, Y., Lu, T.: An improved method of cross-lingual image captioning based on fluency-guided. In: 2020 5th International Conference on Control, Robotics and Cybernetics (CRC), pp. 165\u2013170. IEEE (2020)","DOI":"10.1109\/CRC51253.2020.9253446"},{"key":"20_CR17","doi-asserted-by":"crossref","unstructured":"Lan, W., Li, X., Dong, J.: Fluency-guided cross-lingual image captioning. In: Proceedings of the 25th ACM International Conference on Multimedia, pp. 1549\u20131557 (2017)","DOI":"10.1145\/3123266.3123366"},{"key":"20_CR18","doi-asserted-by":"crossref","unstructured":"Zhang, Z., Lu, P., Jiang, D., Chen, G.: Travl: transferring pre-trained visual-linguistic models for cross-lingual image captioning. In: Asia-Pacific Web (APWeb) and Web-Age Information Management (WAIM) Joint International Conference on Web and Big Data, pp. 341\u2013355. Springer (2022)","DOI":"10.1007\/978-3-031-25198-6_26"},{"key":"20_CR19","doi-asserted-by":"crossref","unstructured":"Gao, J., Zhou, Y., Philip, L., Joty, S., Gu, J.: Unison: Unpaired cross-lingual image captioning. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.\u00a036, pp. 10654\u201310662 (2022)","DOI":"10.1609\/aaai.v36i10.21310"},{"issue":"4","key":"20_CR20","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3634917","volume":"20","author":"J Zhang","year":"2024","unstructured":"Zhang, J., Guo, D., Yang, X., Song, P., Wang, M.: Visual-linguistic-stylistic triple reward for cross-lingual image captioning. ACM Trans. Multimed. Comput. Commun. Appl. 20(4), 1\u201323 (2024)","journal-title":"ACM Trans. Multimed. Comput. Commun. Appl."},{"key":"20_CR21","doi-asserted-by":"crossref","unstructured":"Zeng, Y., Zhang, X., Li, H., Wang, J., Zhang, J., Zhou, W.: X2-vlm: all-in-one pre-trained model for vision-language tasks. IEEE Trans. Pattern Anal. Mach. Intell. (2023)","DOI":"10.1109\/TPAMI.2023.3339661"},{"key":"20_CR22","doi-asserted-by":"crossref","unstructured":"Zeng, Y., Zhou, W., Luo, A., Cheng, Z., Zhang, X.: Cross-view language modeling: towards unified cross-lingual cross-modal pre-training. arXiv preprint arXiv:2206.00621 (2022)","DOI":"10.18653\/v1\/2023.acl-long.315"},{"key":"20_CR23","doi-asserted-by":"crossref","unstructured":"Ni, M., et al.: M3p: learning universal representations via multitask multilingual multimodal pre-training. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 3977\u20133986 (2021)","DOI":"10.1109\/CVPR46437.2021.00397"},{"key":"20_CR24","doi-asserted-by":"crossref","unstructured":"Zhou, M., et al.: Uc2: universal cross-lingual cross-modal vision-and-language pre-training. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 4155\u20134165 (2021)","DOI":"10.1109\/CVPR46437.2021.00414"},{"key":"20_CR25","doi-asserted-by":"crossref","unstructured":"Wang, Y., Dong, J., Liang, T., Zhang, M., Cai, R., Wang, X.: Cross-lingual cross-modal retrieval with noise-robust learning. In: Proceedings of the 30th ACM International Conference on Multimedia, pp. 422\u2013433 (2022)","DOI":"10.1145\/3503161.3548003"}],"container-title":["Lecture Notes in Computer Science","Neural Information Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-96-6599-0_20","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T22:20:23Z","timestamp":1751408423000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-96-6599-0_20"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9789819666010","9789819665990"],"references-count":25,"URL":"https:\/\/doi.org\/10.1007\/978-981-96-6599-0_20","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"2 July 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICONIP","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Neural Information Processing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Auckland","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"New Zealand","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"6 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"31","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"iconip2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/iconip2024.org","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}