{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,4,4]],"date-time":"2025-04-04T13:44:25Z","timestamp":1743774265437,"version":"3.37.3"},"reference-count":48,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2022,6,1]],"date-time":"2022-06-01T00:00:00Z","timestamp":1654041600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,6,1]],"date-time":"2022-06-01T00:00:00Z","timestamp":1654041600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"name":"State Key Laboratory of Communication Content Cognition","award":["Grant No. A02106"],"award-info":[{"award-number":["Grant No. A02106"]}]},{"name":"Open Funding Project of the State Key Laboratory of Communication Content Cognition","award":["Grant No. 20K04"],"award-info":[{"award-number":["Grant No. 20K04"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U21B2024","62002257"],"award-info":[{"award-number":["U21B2024","62002257"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Grant of Tianjin New Generation Artificial Intelligence Major Program","award":["19ZXZNGX00110","18ZXZNGX00150"],"award-info":[{"award-number":["19ZXZNGX00110","18ZXZNGX00150"]}]},{"DOI":"10.13039\/501100002858","name":"China Postdoctoral Science Foundation","doi-asserted-by":"publisher","award":["2021M692395"],"award-info":[{"award-number":["2021M692395"]}],"id":[{"id":"10.13039\/501100002858","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2022,10]]},"DOI":"10.1007\/s00530-022-00947-1","type":"journal-article","created":{"date-parts":[[2022,6,1]],"date-time":"2022-06-01T02:02:45Z","timestamp":1654048965000},"page":"1823-1832","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Closed-loop reasoning with graph-aware dense interaction for visual dialog"],"prefix":"10.1007","volume":"28","author":[{"given":"An-An","family":"Liu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Guokai","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7526-4356","authenticated-orcid":false,"given":"Ning","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junbo","family":"Guo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Guoqing","family":"Jin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xuanya","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,6,1]]},"reference":[{"key":"947_CR1","doi-asserted-by":"publisher","first-page":"43","DOI":"10.1016\/j.patrec.2020.12.020","volume":"143","author":"Y Zhang","year":"2021","unstructured":"Zhang, Y., Shi, X., Mi, S., Yang, X.: Image captioning with transformer and knowledge graph. Pattern Recognit. Lett. 143, 43\u201349 (2021)","journal-title":"Pattern Recognit. Lett."},{"key":"947_CR2","doi-asserted-by":"crossref","unstructured":"Shao, Z., Han, J., Marnerides, D., Debattista, K.: Region-object relation-aware dense captioning via transformer. IEEE Trans. Neural Netw. Learning Syst., 1\u201312 (2022)","DOI":"10.1109\/TNNLS.2022.3152990"},{"issue":"11","key":"947_CR3","doi-asserted-by":"publisher","first-page":"4368","DOI":"10.1109\/TCSVT.2019.2953692","volume":"30","author":"Y Peng","year":"2020","unstructured":"Peng, Y., Chi, J.: Unsupervised cross-media retrieval using domain adaptation with scene graph. IEEE Trans. Circuits Syst. Video Technol. 30(11), 4368\u20134379 (2020)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"947_CR4","doi-asserted-by":"crossref","unstructured":"Chen, X., Jiang, M., Zhao, Q.: Predicting human scanpaths in visual question answering. In: CVPR, pp. 10876\u201310885 (2021)","DOI":"10.1109\/CVPR46437.2021.01073"},{"issue":"12","key":"947_CR5","doi-asserted-by":"publisher","first-page":"9868","DOI":"10.1109\/TIE.2018.2873547","volume":"66","author":"G Wu","year":"2019","unstructured":"Wu, G., Han, J., Lin, Z., Ding, G., Zhang, B., Ni, Q.: Joint image-text hashing for fast large-scale cross-media retrieval using self-supervised deep learning. IEEE Trans. Ind. Electron. 66(12), 9868\u20139877 (2019)","journal-title":"IEEE Trans. Ind. Electron."},{"issue":"2","key":"947_CR6","doi-asserted-by":"publisher","first-page":"1086","DOI":"10.1109\/TCYB.2020.2985716","volume":"52","author":"Z Ji","year":"2022","unstructured":"Ji, Z., Wang, H., Han, J., Pang, Y.: SMAN: stacked multimodal attention network for cross-modal image-text retrieval. IEEE Trans. Cybern. 52(2), 1086\u20131097 (2022)","journal-title":"IEEE Trans. Cybern."},{"key":"947_CR7","doi-asserted-by":"crossref","unstructured":"Das, A., Kottur, S., Gupta, K., Singh, A., Yadav, D.: Visual dialog. In: CVPR, pp. 1080\u20131089 (2017)","DOI":"10.1109\/CVPR.2017.121"},{"issue":"6","key":"947_CR8","doi-asserted-by":"publisher","first-page":"1092","DOI":"10.1109\/TKDE.2019.2897932","volume":"32","author":"W Zhao","year":"2020","unstructured":"Zhao, W., Guan, Z., Huang, Y., Xi, T., Sun, H., Wang, Z., He, X.: Discerning influence patterns with beta-poisson factorization in microblogging environments. IEEE Trans. Knowl. Data Eng. 32(6), 1092\u20131103 (2020)","journal-title":"IEEE Trans. Knowl. Data Eng."},{"issue":"5","key":"947_CR9","doi-asserted-by":"publisher","first-page":"2413","DOI":"10.1007\/s11042-016-3286-5","volume":"75","author":"B Bao","year":"2016","unstructured":"Bao, B., Lang, C., Mei, T., Bimbo, A.D.: Guest editorial: Learning multimedia for real world applications. Multim. Tools Appl. 75(5), 2413\u20132417 (2016)","journal-title":"Multim. Tools Appl."},{"key":"947_CR10","doi-asserted-by":"crossref","unstructured":"Kottur, S., Moura, J.M.F., Parikh, D., Batra, D., Rohrbach, M.: Visual coreference resolution in visual dialog using neural module networks. In: ECCV, vol. 11219, pp. 160\u2013178 (2018)","DOI":"10.1007\/978-3-030-01267-0_10"},{"key":"947_CR11","doi-asserted-by":"crossref","unstructured":"Niu, Y., Zhang, H., Zhang, M., Zhang, J., Lu, Z., Wen, J.: Recursive visual attention in visual dialog. In: CVPR, pp. 6679\u20136688 (2019)","DOI":"10.1109\/CVPR.2019.00684"},{"key":"947_CR12","doi-asserted-by":"crossref","unstructured":"Wu, Q., Wang, P., Shen, C., Reid, I.D., van\u00a0den Hengel, A.: Are you talking to me? reasoned visual dialog generation through adversarial learning. In: CVPR, pp. 6106\u20136115 (2018)","DOI":"10.1109\/CVPR.2018.00639"},{"key":"947_CR13","doi-asserted-by":"crossref","unstructured":"Chen, F., Meng, F., Xu, J., Li, P., Xu, B., Zhou, J.: DMRM: A dual-channel multi-hop reasoning model for visual dialog. In: AAAI, pp. 7504\u20137511 (2020)","DOI":"10.1609\/aaai.v34i05.6248"},{"key":"947_CR14","doi-asserted-by":"publisher","first-page":"220","DOI":"10.1109\/TIP.2020.3034494","volume":"30","author":"J Yu","year":"2021","unstructured":"Yu, J., Jiang, X., Qin, Z., Zhang, W., Hu, Y., Wu, Q.: Learning dual encoding model for adaptive visual understanding in visual dialogue. IEEE Trans. Image Process. 30, 220\u2013233 (2021)","journal-title":"IEEE Trans. Image Process."},{"key":"947_CR15","doi-asserted-by":"crossref","unstructured":"Mazuecos, M., Luque, F.M., S\u00e1nchez, J., Maina, H., Vadora, T., Benotti, L.: Region under discussion for visual dialog. In: EMNLP, pp. 4745\u20134759. Association for Computational Linguistics, ??? (2021)","DOI":"10.18653\/v1\/2021.emnlp-main.390"},{"key":"947_CR16","doi-asserted-by":"crossref","unstructured":"Shi, Y., Tan, Y., Feng, F., Zheng, C., Wang, X.: Category-based strategy-driven question generator for visual dialogue. In: CCL, vol. 12869, pp. 177\u2013192 (2021)","DOI":"10.1007\/978-3-030-84186-7_12"},{"issue":"11","key":"947_CR17","doi-asserted-by":"publisher","first-page":"5264","DOI":"10.1109\/TNNLS.2018.2797248","volume":"29","author":"L Zhu","year":"2018","unstructured":"Zhu, L., Huang, Z., Li, Z., Xie, L., Shen, H.T.: Exploring auxiliary context: Discrete semantic transfer hashing for scalable image retrieval. IEEE Trans. Neural Netw. Learning Syst. 29(11), 5264\u20135276 (2018)","journal-title":"IEEE Trans. Neural Netw. Learning Syst."},{"key":"947_CR18","doi-asserted-by":"crossref","unstructured":"Antol, S., Agrawal, A., Lu, J., Mitchell, M., Batra, D., Zitnick, C.L., Parikh, D.: VQA: visual question answering. In: ICCV, pp. 2425\u20132433 (2015)","DOI":"10.1109\/ICCV.2015.279"},{"key":"947_CR19","doi-asserted-by":"crossref","unstructured":"Malinowski, M., Rohrbach, M., Fritz, M.: Ask your neurons: A neural-based approach to answering questions about images. In: ICCV, pp. 1\u20139 (2015)","DOI":"10.1109\/ICCV.2015.9"},{"key":"947_CR20","doi-asserted-by":"crossref","unstructured":"Niu, Y., Huang, F., Liang, J., Chen, W., Zhu, X., Huang, M.: A semantic-based method for unsupervised commonsense question answering. In: ACL\/IJCNLP, pp. 3037\u20133049 (2021)","DOI":"10.18653\/v1\/2021.acl-long.237"},{"key":"947_CR21","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2020.101167","volume":"66","author":"L Zhang","year":"2021","unstructured":"Zhang, L., Lin, C., Zhou, D., He, Y., Zhang, M.: A bayesian end-to-end model with estimated uncertainties for simple question answering over knowledge bases. Comput. Speech Lang. 66, 101167 (2021)","journal-title":"Comput. Speech Lang."},{"key":"947_CR22","doi-asserted-by":"crossref","unstructured":"Kapanipathi, P., Abdelaziz, I., Ravishankar, S., Roukos, S., Gray, A.G., Astudillo, R.F.: Leveraging abstract meaning representation for knowledge base question answering. Findings of ACL, vol. ACL\/IJCNLP 2021, pp. 3884\u20133894 (2021)","DOI":"10.18653\/v1\/2021.findings-acl.339"},{"key":"947_CR23","doi-asserted-by":"crossref","unstructured":"Li, X., Sun, Y., Cheng, G.: TSQA: tabular scenario based question answering. In: AAAI, pp. 13297\u201313305 (2021)","DOI":"10.1609\/aaai.v35i15.17570"},{"key":"947_CR24","doi-asserted-by":"crossref","unstructured":"Huang, Z., Shen, Y., Li, X., Wei, Y., Cheng, G.: Geosqa: A benchmark for scenario-based question answering in the geography domain at high school level. In: EMNLP-IJCNLP, pp. 5865\u20135870 (2019)","DOI":"10.18653\/v1\/D19-1597"},{"key":"947_CR25","unstructured":"Gao, H., Mao, J., Zhou, J., Huang, Z., Wang, L., Xu, W.: Are you talking to a machine? dataset and methods for multilingual image question. In: NIPS, pp. 2296\u20132304 (2015)"},{"key":"947_CR26","doi-asserted-by":"crossref","unstructured":"Yu, Z., Yu, J., Cui, Y., Tao, D., Tian, Q.: Deep modular co-attention networks for visual question answering. In: CVPR, pp. 6281\u20136290 (2019)","DOI":"10.1109\/CVPR.2019.00644"},{"key":"947_CR27","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J.: Attention is all you need. In: NIPS, pp. 5998\u20136008 (2017)"},{"key":"947_CR28","doi-asserted-by":"crossref","unstructured":"Agarwal, S., Bui, T., Lee, J., Konstas, I., Rieser, V.: History for visual dialog: Do we really need it? In: ACL, pp. 8182\u20138197 (2020)","DOI":"10.18653\/v1\/2020.acl-main.728"},{"key":"947_CR29","doi-asserted-by":"crossref","unstructured":"Das, A., Kottur, S., Moura, J.M.F., Lee, S., Batra, D.: Learning cooperative visual dialog agents with deep reinforcement learning. In: ICCV, pp. 2970\u20132979 (2017)","DOI":"10.1109\/ICCV.2017.321"},{"key":"947_CR30","doi-asserted-by":"crossref","unstructured":"Murahari, V., Chattopadhyay, P., Batra, D., Parikh, D., Das, A.: Improving generative visual dialog by answering diverse questions. In: EMNLP-IJCNLP, pp. 1449\u20131454 (2019)","DOI":"10.18653\/v1\/D19-1152"},{"issue":"3","key":"947_CR31","doi-asserted-by":"publisher","first-page":"931","DOI":"10.3390\/s21030931","volume":"21","author":"Y Cho","year":"2021","unstructured":"Cho, Y., Kim, I.: NMN-VD: A neural module network for visual dialog. Sensors 21(3), 931 (2021)","journal-title":"Sensors"},{"key":"947_CR32","doi-asserted-by":"crossref","unstructured":"Yang, T., Zha, Z., Zhang, H.: Making history matter: History-advantage sequence training for visual dialog. In: ICCV, pp. 2561\u20132569 (2019)","DOI":"10.1109\/ICCV.2019.00265"},{"key":"947_CR33","doi-asserted-by":"crossref","unstructured":"Kang, G., Lim, J., Zhang, B.: Dual attention networks for visual reference resolution in visual dialog. In: EMNLP-IJCNLP, pp. 2024\u20132033 (2019)","DOI":"10.18653\/v1\/D19-1209"},{"key":"947_CR34","unstructured":"Cogswell, M., Lu, J., Jain, R., Lee, S., Parikh, D.: Dialog without dialog data: Learning visual dialog agents from VQA data. In: NIPS (2020)"},{"key":"947_CR35","doi-asserted-by":"crossref","unstructured":"Zheng, Z., Wang, W., Qi, S., Zhu, S.: Reasoning visual dialogs with structural and partial observations. In: CVPR, pp. 6669\u20136678 (2019)","DOI":"10.1109\/CVPR.2019.00683"},{"key":"947_CR36","doi-asserted-by":"crossref","unstructured":"Schwartz, I., Yu, S., Hazan, T., Schwing, A.G.: Factor graph attention. In: CVPR, pp. 2039\u20132048 (2019)","DOI":"10.1109\/CVPR.2019.00214"},{"key":"947_CR37","doi-asserted-by":"crossref","unstructured":"Lu, C., Krishna, R., Bernstein, M.S., Fei-Fei, L.: Visual relationship detection with language priors. In: ECCV, vol. 9905, pp. 852\u2013869 (2016)","DOI":"10.1007\/978-3-319-46448-0_51"},{"key":"947_CR38","doi-asserted-by":"crossref","unstructured":"Jain, U., Lazebnik, S., Schwing, A.G.: Two can play this game: Visual dialog with discriminative question generation and answering. In: CVPR, pp. 5754\u20135763 (2018)","DOI":"10.1109\/CVPR.2018.00603"},{"key":"947_CR39","unstructured":"Lee, S., Gao, T., Yang, S., Yoo, J., Ha, J.: Large-scale answerer in questioner\u2019s mind for visual dialog question generation. In: ICLR (2019)"},{"key":"947_CR40","doi-asserted-by":"crossref","unstructured":"Pang, W., Wang, X.: Visual dialogue state tracking for question generation. In: AAAI, pp. 11831\u201311838 (2020)","DOI":"10.1609\/aaai.v34i07.6856"},{"key":"947_CR41","doi-asserted-by":"crossref","unstructured":"Zheng, D., Xu, Z., Meng, F., Wang, X., Wang, J., Zhou, J.: Enhancing visual dialog questioner with entity-based strategy learning and augmented guesser. In: EMNLP, pp. 1839\u20131851 (2021)","DOI":"10.18653\/v1\/2021.findings-emnlp.158"},{"key":"947_CR42","doi-asserted-by":"crossref","unstructured":"Pennington, J., Socher, R., Manning, C.D.: Glove: Global vectors for word representation. In: EMNLP, pp. 1532\u20131543 (2014)","DOI":"10.3115\/v1\/D14-1162"},{"key":"947_CR43","doi-asserted-by":"crossref","unstructured":"Peters, M.E., Neumann, M., Iyyer, M., Gardner, M., Clark, C., Lee, K., Zettlemoyer, L.: Deep contextualized word representations. In: NAACL-HLT, pp. 2227\u20132237 (2018)","DOI":"10.18653\/v1\/N18-1202"},{"key":"947_CR44","doi-asserted-by":"crossref","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. In: Neural Computation, pp. 1735\u20131780 (1997)","DOI":"10.1162\/neco.1997.9.8.1735"},{"issue":"6","key":"947_CR45","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","volume":"39","author":"S Ren","year":"2017","unstructured":"Ren, S., He, K., Girshick, R.B., Sun, J.: Faster R-CNN: towards real-time object detection with region proposal networks. IEEE Trans. Pattern Anal. Mach. Intell. 39(6), 1137\u20131149 (2017)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"4","key":"947_CR46","doi-asserted-by":"publisher","DOI":"10.1016\/j.ipm.2019.102152","volume":"57","author":"J Zhang","year":"2020","unstructured":"Zhang, J., Wang, Q., Han, Y.: Multi-modal fusion with multi-level attention for visual dialog. Inf. Process. Manag. 57(4), 102152 (2020)","journal-title":"Inf. Process. Manag."},{"key":"947_CR47","unstructured":"Paddlepaddle, An Easy-to-use, Easy-to-learn Deep Learning Platform. http:\/\/www.paddlepaddle.org\/"},{"issue":"4","key":"947_CR48","doi-asserted-by":"publisher","first-page":"1845","DOI":"10.1109\/TIP.2017.2656628","volume":"26","author":"J Gao","year":"2017","unstructured":"Gao, J., Zhang, T., Yang, X., Xu, C.: Deep relative tracking. IEEE Trans. Image Process. 26(4), 1845\u20131858 (2017)","journal-title":"IEEE Trans. Image Process."}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-022-00947-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-022-00947-1\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-022-00947-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,9,25]],"date-time":"2022-09-25T12:29:13Z","timestamp":1664108953000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-022-00947-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,6,1]]},"references-count":48,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2022,10]]}},"alternative-id":["947"],"URL":"https:\/\/doi.org\/10.1007\/s00530-022-00947-1","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"type":"print","value":"0942-4962"},{"type":"electronic","value":"1432-1882"}],"subject":[],"published":{"date-parts":[[2022,6,1]]},"assertion":[{"value":"13 March 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 April 2022","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 June 2022","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}