{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,23]],"date-time":"2025-08-23T05:16:23Z","timestamp":1755926183270,"version":"3.37.3"},"reference-count":63,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"10","license":[{"start":{"date-parts":[[2018,10,1]],"date-time":"2018-10-01T00:00:00Z","timestamp":1538352000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61532018"],"award-info":[{"award-number":["61532018"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Beijing Municipal Commission of Science and Technology","award":["D161100001816001"],"award-info":[{"award-number":["D161100001816001"]}]},{"name":"Lenovo Outstanding Young Scientists Program"},{"name":"National Program for Special Support of Eminent Professionals and National Program for Support of Top-notch Young Professionals"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Multimedia"],"published-print":{"date-parts":[[2018,10]]},"DOI":"10.1109\/tmm.2018.2811621","type":"journal-article","created":{"date-parts":[[2018,3,7]],"date-time":"2018-03-07T20:09:06Z","timestamp":1520453346000},"page":"2749-2760","source":"Crossref","is-referenced-by-count":22,"title":["Bundled Object Context for Referring Expressions"],"prefix":"10.1109","volume":"20","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3944-4704","authenticated-orcid":false,"given":"Xiangyang","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1596-4326","authenticated-orcid":false,"given":"Shuqiang","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/72.279181"},{"key":"ref33","first-page":"1946","article-title":"Phrase localization and visual relationship detection with comprehensive image-language cues","author":"plummer","year":"0","journal-title":"Proc IEEE Int Conf Comput Vis"},{"key":"ref32","first-page":"5005","article-title":"Learning deep structure-preserving image-text embeddings","author":"wang","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref31","first-page":"4555","article-title":"Natural language object retrieval","author":"hu","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref30","first-page":"4176","article-title":"Attention correctness in neural image captioning","author":"liu","year":"0","journal-title":"Proc Assoc Advance Artif Intell"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-24797-2"},{"key":"ref36","first-page":"4418","article-title":"Modeling relationships in referential expressions with compositional modular networks","author":"hu","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref35","first-page":"3125","article-title":"Comprehension-guided referring expressions","author":"luo","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1016\/0010-0285(72)90002-3"},{"key":"ref60","first-page":"675","article-title":"Caffe: Convolutional architecture for fast feature embedding","author":"jia","year":"0","journal-title":"Proc ACM Int Conf Multimedia"},{"key":"ref62","first-page":"228","article-title":"METEOR: An automatic metric for MT evaluation with high levels of correlation with human judgments","author":"lavie","year":"0","journal-title":"Proc 2th Workshop Statist Mach Transl ACL"},{"key":"ref61","first-page":"311","article-title":"BLEU: A method for automatic evaluation of machine translation","author":"papineni","year":"0","journal-title":"Proc Annual Meeting of the Assoc Computational Linguistics"},{"key":"ref63","first-page":"74","article-title":"ROUGE: A package for automatic evaluation of summaries","volume":"8","author":"lin","year":"0","journal-title":"Proceedings of the ACL-04 Workshop"},{"key":"ref28","first-page":"203","article-title":"What value do explicit high level concepts have in vision to language problems","author":"wu","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"article-title":"Deep captioning with multimodal recurrent neural networks (MRNN)","year":"2014","author":"mao","key":"ref27"},{"key":"ref29","first-page":"4651","article-title":"Image captioning with semantic attention","author":"you","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2016.2558463"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2015.2477044"},{"key":"ref20","first-page":"1914","article-title":"Learning distributions over logical forms for referring expression generation","author":"fitzgerald","year":"0","journal-title":"Proc EMNLP"},{"key":"ref22","first-page":"11","article-title":"Generation and comprehension of unambiguous object descriptions","author":"mao","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref21","first-page":"3521","article-title":"A joint speaker-listener-reinforcer model for referring expressions","author":"yu","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref24","first-page":"1174","article-title":"Generating expressions that refer to visible objects","author":"mitchell","year":"0","journal-title":"Proc 13th Conf North Amer Ch Assoc Comput Linguistics Human Lang Technol"},{"key":"ref23","first-page":"792","article-title":"Modeling context between objects for referring expressing understanding","author":"nagaraja","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref26","first-page":"15","article-title":"Every picture tells a story: Generating sentences from images","author":"farhadi","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref25","first-page":"69","article-title":"Modeling context in referring expressions","author":"yu","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref50","first-page":"2285","article-title":"CNN-RNN: A unified framework for multi-label image classification","author":"wang","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref51","first-page":"728","article-title":"Chained predictions using convolutional neural networks","author":"gkioxari","year":"0","journal-title":"Proc Eur Conf Comput Vision"},{"key":"ref59","first-page":"740","article-title":"Microsoft COCO: Common object in context","author":"lin","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref58","first-page":"91","article-title":"Faster R-CNN: Towards real-time object detection with region proposal networks","author":"ren","year":"0","journal-title":"Proc NIPS"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"article-title":"Very deep convolutional networks for large-scale image recognition","year":"2014","author":"simonyan","key":"ref56"},{"key":"ref55","first-page":"451","article-title":"Ask, attend and answer: Exploring question-guided spatial attention for visual question answering","author":"xu","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref54","first-page":"220","article-title":"An application of recurrent neural networks to discriminative keyword spotting","author":"fern\u00e1ndez","year":"2007","journal-title":"Proc 17th Int Conf Artif Neural Netw"},{"key":"ref53","first-page":"4033","article-title":"MAT: A multimodal attentive translator for image captioning","author":"liu","year":"0","journal-title":"Proc Assoc Adv Artif Intell"},{"key":"ref52","first-page":"4106","article-title":"Spatial memory for context reasoning in object detection","author":"chen","year":"0","journal-title":"Proc IEEE Int Conf Comput Vis"},{"key":"ref10","doi-asserted-by":"crossref","first-page":"193","DOI":"10.1162\/tacl_a_00220","article-title":"Jointly learning to parse and perceive: Connecting natural language to the physical world","volume":"1","author":"krishnamurthy","year":"2013","journal-title":"Transactions of the Association for Computational Linguistics"},{"key":"ref11","first-page":"1671","article-title":"A joint model of language and perception for grounded attribute learning","author":"matuszek","year":"0","journal-title":"Proc 19th Int Conf Mach Learn"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2016.2548241"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2642953"},{"key":"ref13","first-page":"2048","article-title":"Show, attend and tell: Neural image caption generation with visual attention","author":"xu","year":"0","journal-title":"Proc 32th Int Conf Mach Learn"},{"key":"ref14","first-page":"2085","article-title":"Pharse-based image captioning","author":"lebret","year":"0","journal-title":"Proc 32th Int Conf Mach Learn"},{"key":"ref15","first-page":"2407","article-title":"Guiding long-short term memory for image caption generation","author":"jia","year":"0","journal-title":"Proc IEEE Int Conf Comput Vis"},{"key":"ref16","first-page":"4565","article-title":"DenseCap: Fully convolutional localization networks for dense captioning","author":"johnson","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref17","first-page":"817","article-title":"Grounding of textual phrases in images by reconstruction","author":"rohrbach","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref18","first-page":"787","article-title":"ReferitGame: Referring to objects in photographs of natural scenes","author":"kazemzadeh","year":"0","journal-title":"Proc EMNLP"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1162\/COLI_a_00088"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2015.2390499"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2016.2535864"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2012.162"},{"key":"ref5","first-page":"69","article-title":"Deep compositional cross-modal learning to rank via local-global alignment","author":"jiang","year":"0","journal-title":"Proc ACM Int Conf Multimedia"},{"key":"ref8","first-page":"988","article-title":"Image captioning with deep bidirectional LSTMs","author":"wang","year":"0","journal-title":"Proc ACM Int Conf Multimedia"},{"key":"ref7","first-page":"3128","article-title":"Deep visual-semantic alignments for generating image descriptions","author":"karpathy","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"article-title":"Order matters: Sequence to sequence for sets","year":"0","author":"vinyals","key":"ref49"},{"key":"ref9","first-page":"1107","article-title":"Image captioning with both object and scene information","author":"li","year":"0","journal-title":"Proc ACM Int Conf Multimedia"},{"key":"ref46","first-page":"3547","article-title":"Scene labeling with LSTM recurrent neural networks","author":"byeon","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref45","first-page":"3620","article-title":"DAG-Recurrent neural networks for scene labeling","author":"shuai","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2520371"},{"key":"ref47","first-page":"135","article-title":"A siamses long short-term memory architecture for human re-identification","author":"varior","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2016.2642789"},{"key":"ref41","first-page":"2874","article-title":"Inside-outside net: Detecting objects in context with skip pooling","author":"bell","year":"0","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref44","first-page":"125","article-title":"Semantic object parsing with graph LSTM","author":"liang","year":"0","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref43","first-page":"108","article-title":"Segmentation from natural language expressions","author":"hu","year":"0","journal-title":"Proc Eur Conf Comput Vis"}],"container-title":["IEEE Transactions on Multimedia"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6046\/8466674\/08307406.pdf?arnumber=8307406","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,1,12]],"date-time":"2022-01-12T16:17:13Z","timestamp":1642004233000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8307406\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,10]]},"references-count":63,"journal-issue":{"issue":"10"},"URL":"https:\/\/doi.org\/10.1109\/tmm.2018.2811621","relation":{},"ISSN":["1520-9210","1941-0077"],"issn-type":[{"type":"print","value":"1520-9210"},{"type":"electronic","value":"1941-0077"}],"subject":[],"published":{"date-parts":[[2018,10]]}}}