{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T23:35:20Z","timestamp":1784158520254,"version":"3.55.0"},"publisher-location":"Singapore","reference-count":55,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819620708","type":"print"},{"value":"9789819620715","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-96-2071-5_30","type":"book-chapter","created":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T15:33:57Z","timestamp":1735745637000},"page":"413-427","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":10,"title":["Image2Text2Image: A Novel Framework for\u00a0Label-Free Evaluation of\u00a0Image-to-Text Generation with\u00a0Text-to-Image Diffusion Models"],"prefix":"10.1007","author":[{"given":"Jia-Hong","family":"Huang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongyi","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yixian","family":"Shen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Stevan","family":"Rudinac","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Evangelos","family":"Kanoulas","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,1,2]]},"reference":[{"key":"30_CR1","doi-asserted-by":"crossref","unstructured":"Anderson, P., Fernando, B., Johnson, M., Gould, S.: Spice: semantic propositional image caption evaluation. In: ECCV. Springer (2016)","DOI":"10.1007\/978-3-319-46454-1_24"},{"key":"30_CR2","unstructured":"Banerjee, S., Lavie, A.: Meteor: an automatic metric for mt evaluation with improved correlation with human judgments. In: ACL Workshop (2005)"},{"key":"30_CR3","unstructured":"Brown, T., Mann, B., Ryder, N., et\u00a0al.: Language models are few-shot learners. Advances in neural information processing systems (2020)"},{"key":"30_CR4","doi-asserted-by":"crossref","unstructured":"Chan, D., Petryk, S., Gonzalez, J.E., Darrell, T., Canny, J.: Clair: evaluating image captions with large language models. arXiv preprint arXiv:2310.12971 (2023)","DOI":"10.18653\/v1\/2023.emnlp-main.841"},{"key":"30_CR5","doi-asserted-by":"crossref","unstructured":"Changpinyo, S., Sharma, P., et\u00a0al.: Conceptual 12m: pushing web-scale image-text pre-training to recognize long-tail visual concepts. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00356"},{"key":"30_CR6","doi-asserted-by":"crossref","unstructured":"Chen, J., He, Y., Frey, E.C., Li, Y., Du, Y.: Vit-v-net: vision transformer for unsupervised volumetric medical image registration. arXiv:2104.06468 (2021)","DOI":"10.1016\/j.media.2022.102615"},{"key":"30_CR7","doi-asserted-by":"crossref","unstructured":"Cherti, M., Beaumont, R., Wightman, R., Wortsman, M., et\u00a0al.: Reproducible scaling laws for contrastive language-image learning. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00276"},{"key":"30_CR8","doi-asserted-by":"crossref","unstructured":"Cui, Y., Yang, G., Veit, A., Huang, X., Belongie, S.: Learning to evaluate image captioning. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00608"},{"key":"30_CR9","unstructured":"Dai, W., Li, J., Li, D., et\u00a0al.: Instructblip: towards general-purpose vision-language models with instruction tuning. arxiv 2023. arXiv preprint arXiv:2305.06500"},{"key":"30_CR10","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., et\u00a0al.: An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:2010.11929 (2020)"},{"key":"30_CR11","doi-asserted-by":"crossref","unstructured":"Elliott, D., Keller, F.: Image description using visual dependency representations. In: EMNLP (2013)","DOI":"10.18653\/v1\/D13-1128"},{"key":"30_CR12","unstructured":"Esser, P., Kulal, S., Blattmann, A., et\u00a0al.: Scaling rectified flow transformers for high-resolution image synthesis. In: ICML (2024)"},{"key":"30_CR13","doi-asserted-by":"crossref","unstructured":"Gunjal, A., Yin, J., Bas, E.: Detecting and preventing hallucinations in large vision language models. In: AAAI (2024)","DOI":"10.1609\/aaai.v38i16.29771"},{"key":"30_CR14","doi-asserted-by":"crossref","unstructured":"He, K., et\u00a0al.: Deep residual learning for image recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"30_CR15","doi-asserted-by":"crossref","unstructured":"Hessel, J., Holtzman, A., Forbes, M., Bras, R.L., Choi, Y.: Clipscore: a reference-free evaluation metric for image captioning. arXiv preprint arXiv:2104.08718 (2021)","DOI":"10.18653\/v1\/2021.emnlp-main.595"},{"key":"30_CR16","doi-asserted-by":"crossref","unstructured":"Hodosh, M., Young, P., Hockenmaier, J.: Framing image description as a ranking task: Data, models and evaluation metrics. JAIR (2013)","DOI":"10.1613\/jair.3994"},{"key":"30_CR17","unstructured":"Huang, J.H., Alfadly, M., Ghanem, B.: Vqabq: Visual question answering by basic questions. arXiv preprint arXiv:1703.06492 (2017)"},{"key":"30_CR18","doi-asserted-by":"crossref","unstructured":"Huang, J.H., Wu, T.W., Yang, Lin, I., Tegner, J., Worring, M., et\u00a0al.: Non-local attention improves description generation for retinal images. In: WACV (2022)","DOI":"10.1109\/WACV51458.2022.00331"},{"key":"30_CR19","doi-asserted-by":"crossref","unstructured":"Huang, J.H., Yang, C.H.H., Liu, F., et\u00a0al.: Deepopht: medical report generation for retinal images via deep models and visual explanation. In: WACV (2021)","DOI":"10.1109\/WACV48630.2021.00249"},{"key":"30_CR20","unstructured":"Huang, J.H., Zhu, H., et\u00a0al.: A novel evaluation framework for image2text generation. In: ACM SIGIR workshop (2024)"},{"key":"30_CR21","doi-asserted-by":"crossref","unstructured":"Jiang, M., Huang, Q., Zhang, L., Wang, X., Zhang, P., et\u00a0al.: Tiger: text-to-image grounding for image caption evaluation. arXiv preprint arXiv:1909.02050 (2019)","DOI":"10.18653\/v1\/D19-1220"},{"key":"30_CR22","unstructured":"Jing, B., Xie, P., Xing, E.: On the automatic generation of medical imaging reports. arXiv preprint arXiv:1711.08195 (2017)"},{"key":"30_CR23","unstructured":"Kane, H., Kocyigit, M.Y., Abdalla, A., et\u00a0al.: Nubia: neural based interchangeability assessor for text generation. arXiv preprint arXiv:2004.14667 (2020)"},{"key":"30_CR24","doi-asserted-by":"crossref","unstructured":"Kendall, M.G.: A new measure of rank correlation. Biometrika (1938)","DOI":"10.2307\/2332226"},{"key":"30_CR25","doi-asserted-by":"crossref","unstructured":"Khan, O.S., Sharma, U., Zhu, H., et\u00a0al.: Exquisitor at the lifelog search challenge 2024: Blending conversational search with user relevance feedback. In: ICMR Lifelog Search Challenge (2024)","DOI":"10.1145\/3643489.3661132"},{"key":"30_CR26","doi-asserted-by":"crossref","unstructured":"Laserson, J., Lantsman, C.D., Cohen-Sfady, M., et\u00a0al.: Textray: mining clinical reports to gain a broad understanding of chest x-rays. In: MICCAI. Springer (2018)","DOI":"10.1007\/978-3-030-00934-2_62"},{"key":"30_CR27","doi-asserted-by":"crossref","unstructured":"Lee, H., Yoon, S., Dernoncourt, F., Kim, D.S., Bui, T., Jung, K.: Vilbertscore: evaluating image caption using vision-and-language bert. In: Eval4NLP (2020)","DOI":"10.18653\/v1\/2020.eval4nlp-1.4"},{"key":"30_CR28","doi-asserted-by":"crossref","unstructured":"Li, Y., Du, Y., Zhou, K., Wang, J., Zhao, W.X., Wen, J.R.: Evaluating object hallucination in large vision-language models. arXiv preprint arXiv:2305.10355 (2023)","DOI":"10.18653\/v1\/2023.emnlp-main.20"},{"key":"30_CR29","unstructured":"Li, Y., Liang, X., et\u00a0al.: Hybrid retrieval-generation reinforced agent for medical image report generation. Advances in neural information processing systems (2018)"},{"key":"30_CR30","unstructured":"Lin, C.Y.: Rouge: a package for automatic evaluation of summaries. In: Text Summarization Branches Out (2004)"},{"key":"30_CR31","unstructured":"Lu, J., Batra, D., Parikh, D., Lee, S.: Vilbert: pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. NeurIPS (2019)"},{"key":"30_CR32","doi-asserted-by":"crossref","unstructured":"Mao, J., Huang, J., Toshev, A., Camburu, O., Yuille, A.L., Murphy, K.: Generation and comprehension of unambiguous object descriptions. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.9"},{"key":"30_CR33","unstructured":"Mitchell, M., et\u00a0al.: Midge: generating descriptions of images. In: INLG (2012)"},{"key":"30_CR34","unstructured":"Oquab, M., Darcet, T., Moutakanni, T., Vo, H., et\u00a0al.: Dinov2: learning robust visual features without supervision. arXiv preprint arXiv:2304.07193 (2023)"},{"key":"30_CR35","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., Zhu, W.J.: Bleu: a method for automatic evaluation of machine translation. In: ACL (2002)","DOI":"10.3115\/1073083.1073135"},{"key":"30_CR36","doi-asserted-by":"crossref","unstructured":"Pedersoli, M., et\u00a0al.: Areas of attention for image captioning. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.140"},{"key":"30_CR37","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., et\u00a0al.: Learning transferable visual models from natural language supervision. In: ICML (2021)"},{"key":"30_CR38","unstructured":"Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., et\u00a0al.: Exploring the limits of transfer learning with a unified text-to-text transformer. JMLR (2020)"},{"key":"30_CR39","doi-asserted-by":"crossref","unstructured":"Rohrbach, M., Qiu, W., Titov, I., Thater, S., Pinkal, M., Schiele, B.: Translating video content to natural language descriptions. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.61"},{"key":"30_CR40","doi-asserted-by":"crossref","unstructured":"Rudinac, S., Larson, M., et\u00a0al.: Learning crowdsourced user preferences for visual summarization of image collections. IEEE Trans. Multimed. (2013)","DOI":"10.1109\/TMM.2013.2261481"},{"key":"30_CR41","unstructured":"by\u00a0Saheel, S.: Baby talk: understanding and generating image descriptions"},{"key":"30_CR42","unstructured":"Sharma, S., et\u00a0al.: Relevance of unsupervised metrics in task-oriented dialogue for evaluating natural language generation. arXiv preprint arXiv:1706.09799 (2017)"},{"key":"30_CR43","doi-asserted-by":"crossref","unstructured":"Shekhar, R., Pezzelle, S., Klimovich, Y., Herbelot, A., Nabi, E., et\u00a0al.: FOIL it! find one mismatch between image and language caption. In: ACL (2017)","DOI":"10.18653\/v1\/P17-1024"},{"key":"30_CR44","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556 (2014)"},{"key":"30_CR45","unstructured":"Team, G., Anil, R., Borgeaud, S., Wu, Y., Alayrac, J.B., Yu, J., et\u00a0al.: Gemini: a family of highly capable multimodal models. arXiv:2312.11805 (2023)"},{"key":"30_CR46","doi-asserted-by":"crossref","unstructured":"Vedantam, R., Lawrence\u00a0Zitnick, C., Parikh, D.: Cider: consensus-based image description evaluation. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"30_CR47","doi-asserted-by":"crossref","unstructured":"Vinyals, O., Toshev, A., Bengio, S., Erhan, D.: Show and tell: a neural image caption generator. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"30_CR48","doi-asserted-by":"crossref","unstructured":"Wang, C., Yang, H., et\u00a0al.: Image captioning with deep bidirectional lstms. In: ACMMM (2016)","DOI":"10.1145\/2964284.2964299"},{"key":"30_CR49","doi-asserted-by":"crossref","unstructured":"Xiao, X., Wang, L., Ding, K., Xiang, S., Pan, C.: Deep hierarchical encoder\u2013decoder network for image captioning. IEEE Transactions on Multimedia (2019)","DOI":"10.1109\/TMM.2019.2915033"},{"key":"30_CR50","doi-asserted-by":"crossref","unstructured":"Yi, Y., Deng, H., Hu, J.: Improving image captioning evaluation by considering inter references variance. In: ACL (2020)","DOI":"10.18653\/v1\/2020.acl-main.93"},{"key":"30_CR51","unstructured":"Yu, J., Wang, Z., Vasudevan, V., et\u00a0al.: Coca: Contrastive captioners are image-text foundation models. arXiv preprint arXiv:2205.01917 (2022)"},{"key":"30_CR52","unstructured":"Zhang, T., Kishore, V., Wu, F., Weinberger, K.Q., Artzi, Y.: Bertscore: evaluating text generation with bert. arXiv preprint arXiv:1904.09675 (2019)"},{"key":"30_CR53","unstructured":"Zheng, L., Chiang, W.L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., et\u00a0al.: Judging llm-as-a-judge with mt-bench and chatbot arena. ArXiv abs\/2306.05685 (2023)"},{"key":"30_CR54","doi-asserted-by":"crossref","unstructured":"Zhu, H., Huang, J.H., et\u00a0al.: Enhancing interactive image retrieval with query rewriting using large language models and vision language models. In: ICMR (2024)","DOI":"10.1145\/3652583.3658032"},{"key":"30_CR55","doi-asserted-by":"crossref","unstructured":"Zhu, H., Salah, A.A., et\u00a0al.: Video-based estimation of pain indicators in dogs. In: ACII (2023)","DOI":"10.1109\/ACII59096.2023.10388142"}],"container-title":["Lecture Notes in Computer Science","MultiMedia Modeling"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-96-2071-5_30","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T16:04:06Z","timestamp":1735747446000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-96-2071-5_30"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9789819620708","9789819620715"],"references-count":55,"URL":"https:\/\/doi.org\/10.1007\/978-981-96-2071-5_30","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"2 January 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"MMM","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Multimedia Modeling","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Nara","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Japan","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"9 January 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"11 January 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"31","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"mmm2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/mmm2025.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}