{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T17:27:46Z","timestamp":1783099666777,"version":"3.54.6"},"reference-count":80,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"8","license":[{"start":{"date-parts":[[2019,8,1]],"date-time":"2019-08-01T00:00:00Z","timestamp":1564617600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2019,8,1]],"date-time":"2019-08-01T00:00:00Z","timestamp":1564617600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2019,8,1]],"date-time":"2019-08-01T00:00:00Z","timestamp":1564617600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61532018"],"award-info":[{"award-number":["61532018"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004826","name":"Beijing Natural Science Foundation","doi-asserted-by":"crossref","award":["L182054"],"award-info":[{"award-number":["L182054"]}],"id":[{"id":"10.13039\/501100004826","id-type":"DOI","asserted-by":"crossref"}]},{"name":"National Program for Special Support of Eminent Professionals"},{"name":"National Program for Support of Top-notch Young Professionals"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Multimedia"],"published-print":{"date-parts":[[2019,8]]},"DOI":"10.1109\/tmm.2019.2896516","type":"journal-article","created":{"date-parts":[[2019,1,30]],"date-time":"2019-01-30T20:31:26Z","timestamp":1548880286000},"page":"2117-2130","source":"Crossref","is-referenced-by-count":157,"title":["Know More Say Less: Image Captioning Based on Scene Graphs"],"prefix":"10.1109","volume":"21","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3944-4704","authenticated-orcid":false,"given":"Xiangyang","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1596-4326","authenticated-orcid":false,"given":"Shuqiang","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref73","article-title":"Adam: A method for stochastic optimization","author":"kingma","year":"0","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref72","first-page":"740","article-title":"Microsoft COCO: Common object in context","author":"lin","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref71","first-page":"3111","article-title":"Distributed representations of words and phrases and their compositionality","author":"mikolov","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.541"},{"key":"ref76","first-page":"74","article-title":"ROUGE: A package for automatic evaluation of summaries","author":"lin","year":"0","journal-title":"Proc Workshop Text Summarization Branches Out"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.323"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.3115\/1626355.1626389"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.21236\/ADA623249"},{"key":"ref78","first-page":"382","article-title":"SPICE: Semantic propositional image caption evaluation","author":"anderson","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/E17-1019"},{"key":"ref33","first-page":"790","article-title":"Generalizing image captions for image-text parallel corpus","author":"kuznetsova","year":"0","journal-title":"Proc Annual Meeting of the Assoc Computational Linguistics"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298990"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.142"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.330"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.345"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2012.162"},{"key":"ref35","first-page":"15","article-title":"Every picture tells a story: Generating sentences from images","author":"farhadi","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0840-y"},{"key":"ref60","first-page":"6992","article-title":"Generating triples with adversarial networks for scene graph construction","author":"klawonn","year":"0","journal-title":"Proc 32nd AAAI Conf Artif Intell"},{"key":"ref62","first-page":"1219","article-title":"Image generation from scene graphs","author":"johnson","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.344"},{"key":"ref63","article-title":"Neural machine translation by jointly learning to align and translate","author":"bahdanau","year":"0","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.524"},{"key":"ref64","first-page":"4176","article-title":"Attention correctness in neural image captioning","author":"liu","year":"0","journal-title":"Proc 31st AAAI Conf Artif Intell"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.29"},{"key":"ref65","first-page":"2361","article-title":"Review networks for caption generation","author":"yang","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123448"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.277"},{"key":"ref67","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-642-24797-2","volume":"385","author":"graves","year":"2012","journal-title":"Supervised Sequence Labelling with Recurrent Neural Networks"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/W14-4012"},{"key":"ref69","first-page":"2787","article-title":"Translating embeddings for modeling multi-relational data","author":"bordes","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2017.2751140"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2015.2477044"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"ref22","article-title":"Aligning where to see and what to tell: Image caption with region-based attention and scene factorization","author":"jin","year":"2015"},{"key":"ref21","first-page":"2048","article-title":"Show, attend and tell: Neural image caption generation with visual attention","author":"xu","year":"0","journal-title":"Proceedings of the 32nd Intl Conf on Machine Learning"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.127"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.503"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/D14-1179"},{"key":"ref25","first-page":"6077","article-title":"Bottom-up and top-down attention for image captioning and visual question answering","author":"anderson","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref50","first-page":"852","article-title":"Visual relationship detection with language priors","author":"lu","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.469"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N18-1037"},{"key":"ref57","first-page":"5831","article-title":"Neural motifs: Scene graph parsing with global context","author":"zellers","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.331"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.352"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.766"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.213"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.121"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2016.2558463"},{"key":"ref11","first-page":"3674","article-title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","author":"anderson","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"ref12","first-page":"3318","article-title":"Speaker-follower models for vision-and-language navigation","author":"fried","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref13","first-page":"37","article-title":"Look before you leap: Bridging model-free and model-based reinforcement learning for planned-ahead vision-and-language navigation","author":"wang","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"ref15","article-title":"Very deep convolutional networks for large-scale image recognition","author":"simonyan","year":"0","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.169"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2577031"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.91"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.667"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123366"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123391"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1145\/2964284.2964299"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123275"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2015.2390499"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2018.2811621"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.12"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2016.2535864"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.100"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.131"},{"key":"ref48","first-page":"158","article-title":"Detecting actions, poses, and objects with relational phraselets","author":"desai","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref47","first-page":"3155","article-title":"Adversarial ranking for language generation","author":"lin","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref42","first-page":"1107","article-title":"Image captioning with both object and scene information","author":"li","year":"0","journal-title":"Proc ACM Int Conf Multimedia"},{"key":"ref41","article-title":"Deep captioning with multimodal recurrent neural networks M-RNN","author":"mao","year":"2015","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref44","first-page":"7219","article-title":"Neural baby talk","author":"lu","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref43","first-page":"5561","article-title":"Convolutional image captioning","author":"aneja","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"}],"container-title":["IEEE Transactions on Multimedia"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6046\/8766921\/08630068.pdf?arnumber=8630068","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,7,13]],"date-time":"2022-07-13T20:47:05Z","timestamp":1657745225000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8630068\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,8]]},"references-count":80,"journal-issue":{"issue":"8"},"URL":"https:\/\/doi.org\/10.1109\/tmm.2019.2896516","relation":{},"ISSN":["1520-9210","1941-0077"],"issn-type":[{"value":"1520-9210","type":"print"},{"value":"1941-0077","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019,8]]}}}