{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,29]],"date-time":"2026-05-29T17:33:52Z","timestamp":1780076032299,"version":"3.54.0"},"reference-count":37,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,10,27]],"date-time":"2024-10-27T00:00:00Z","timestamp":1729987200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,10,27]],"date-time":"2024-10-27T00:00:00Z","timestamp":1729987200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,10,27]]},"DOI":"10.1109\/icip51287.2024.10647426","type":"proceedings-article","created":{"date-parts":[[2024,9,27]],"date-time":"2024-09-27T18:34:45Z","timestamp":1727462085000},"page":"2550-2556","source":"Crossref","is-referenced-by-count":3,"title":["Distinctive Image Captioning: Leveraging Ground Truth Captions in Clip Guided Reinforcement Learning"],"prefix":"10.1109","author":[{"given":"Antoine","family":"Chaffin","sequence":"first","affiliation":[{"name":"Univ Rennes,IRISA,Inria,France"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ewa","family":"Kijak","sequence":"additional","affiliation":[{"name":"Univ Rennes,IRISA,Inria,France"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Vincent","family":"Claveau","sequence":"additional","affiliation":[{"name":"CNRS IRISA,France"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1238"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"ref4","article-title":"LAION-5B: an open largescale dataset for training next generation image-text models","volume":"abs\/2210.08402","author":"Schuhmann","year":"2022","journal-title":"CoRR"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.323"},{"key":"ref6","article-title":"Contrastive learning for image captioning","author":"Dai","year":"2017","journal-title":"NIPS"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00432"},{"key":"ref8","article-title":"Diverse image captioning via grouptalk","author":"Wang","year":"2016","journal-title":"IJCAI"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-naacl.39"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/WACV56688.2023.00118"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00728"},{"key":"ref12","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021","journal-title":"ICML"},{"key":"ref13","article-title":"Multimodal knowledge alignment with reinforcement learning","volume":"abs\/2205.12630","author":"Yu","year":"2022","journal-title":"CoRR"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-25069-9_15"},{"key":"ref15","article-title":"Generative adversarial nets","author":"Goodfellow","year":"2014","journal-title":"NIPS"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1989.1.2.270"},{"key":"ref17","article-title":"Sequence level training with recurrent neural networks","author":"Aurelio Ranzato","year":"2016","journal-title":"ICLR"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v31i1.10804"},{"key":"ref19","article-title":"Google\u2019s neural machine translation system: Bridging the gap between human and machine translation","volume":"abs\/1609.08144","author":"Wu","year":"2016","journal-title":"CoRR"},{"key":"ref20","article-title":"A deep reinforced model for abstractive summarization","author":"Paulus","year":"2018","journal-title":"ICLR"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.131"},{"key":"ref22","article-title":"OFA: unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","author":"Wang","year":"2022","journal-title":"ICML"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58577-8_8"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00553"},{"key":"ref25","article-title":"Scaling up vision-language pre-training for image captioning","author":"Hu","year":"2022","journal-title":"CVPR"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992696"},{"key":"ref28","volume-title":"Reinforcement learning-an introduction, Adaptive computation and machine learning","author":"Sutton","year":"1998"},{"key":"ref29","article-title":"Asynchronous methods for deep reinforcement learning","author":"Mnih","year":"2016","journal-title":"ICML"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D17-1238"},{"key":"ref31","article-title":"On the weaknesses of reinforcement learning for neural machine translation","author":"Choshen","year":"2020","journal-title":"ICLR"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_38"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2598339"},{"key":"ref34","article-title":"METEOR: an automatic metric for MT evaluation with improved correlation with human judgments","volume-title":"Proceedings of the Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and\/or Summarization@ACL","author":"Banerjee"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46454-1_24"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1145\/3209978.3210080"},{"key":"ref37","article-title":"Bleu: a method for automatic evaluation of machine translation","author":"Papineni","year":"2002","journal-title":"ACL"}],"event":{"name":"2024 IEEE International Conference on Image Processing (ICIP)","location":"Abu Dhabi, United Arab Emirates","start":{"date-parts":[[2024,10,27]]},"end":{"date-parts":[[2024,10,30]]}},"container-title":["2024 IEEE International Conference on Image Processing (ICIP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10647221\/10647122\/10647426.pdf?arnumber=10647426","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,28]],"date-time":"2024-09-28T05:36:12Z","timestamp":1727501772000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10647426\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,27]]},"references-count":37,"URL":"https:\/\/doi.org\/10.1109\/icip51287.2024.10647426","relation":{},"subject":[],"published":{"date-parts":[[2024,10,27]]}}}