{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:25:28Z","timestamp":1740122728880,"version":"3.37.3"},"reference-count":37,"publisher":"Springer Science and Business Media LLC","license":[{"start":{"date-parts":[[2022,6,16]],"date-time":"2022-06-16T00:00:00Z","timestamp":1655337600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,6,16]],"date-time":"2022-06-16T00:00:00Z","timestamp":1655337600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62076032"],"award-info":[{"award-number":["62076032"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"DOI":"10.1007\/s10489-022-03795-8","type":"journal-article","created":{"date-parts":[[2022,6,16]],"date-time":"2022-06-16T14:03:06Z","timestamp":1655388186000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Reciprocal question representation learning network for visual dialog"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8497-8182","authenticated-orcid":false,"given":"Hongwei","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaojie","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Si","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,6,16]]},"reference":[{"issue":"5","key":"3795_CR1","doi-asserted-by":"publisher","first-page":"1242","DOI":"10.1109\/TPAMI.2018.2828437","volume":"41","author":"A Das","year":"2019","unstructured":"Das A, Kottur S, Gupta K, et al. (2019) Visual dialog. IEEE Trans Pattern Anal Mach Intell 41(5):1242\u20131256. https:\/\/doi.org\/10.1109\/TPAMI.2018.2828437","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"3795_CR2","doi-asserted-by":"publisher","unstructured":"Nguyen D, Okatani T (2018) Improved fusion of visual and language representations by dense symmetric co-attention for visual question answering. In: 2018 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2018, Salt Lake City, UT, USA, June 18-22, 2018, Computer Vision Foundation \/ IEEE Computer Society. https:\/\/doi.org\/10.1109\/CVPR.2018.00637https:\/\/doi.org\/10.1109\/CVPR.2018.00637, pp 6087\u20136096","DOI":"10.1109\/CVPR.2018.00637 10.1109\/CVPR.2018.00637"},{"key":"3795_CR3","doi-asserted-by":"publisher","first-page":"104,165","DOI":"10.1016\/j.imavis.2021.104165","volume":"110","author":"H Sharma","year":"2021","unstructured":"Sharma H, Jalal A S (2021) Visual question answering model based on graph neural network and contextual attention. Image Vis Comput 110:104,165. https:\/\/doi.org\/10.1016\/j.imavis.2021.104165https:\/\/doi.org\/10.1016\/j.imavis.2021.104165","journal-title":"Image Vis Comput"},{"key":"3795_CR4","doi-asserted-by":"publisher","first-page":"323","DOI":"10.1016\/j.neucom.2021.10.016","volume":"467","author":"H Zhan","year":"2022","unstructured":"Zhan H, Xiong P, Wang X et al (2022) Visual question answering by pattern matching and reasoning. Neurocomputing 467:323\u2013336. https:\/\/doi.org\/10.1016\/j.neucom.2021.10.016","journal-title":"Neurocomputing"},{"key":"3795_CR5","doi-asserted-by":"publisher","unstructured":"Gan Z, Cheng Y, Kholy AE et al (2019) Multi-step reasoning via recurrent dual attention for visual dialog. In: Proceedings of the 57th conference of the association for computational linguistics, ACL 2019, Florence, Italy, July 28- August 2, 2019, Volume 1: Long Papers. Association for Computational Linguistics. https:\/\/doi.org\/10.18653\/v1\/p19-1648, pp 6463\u20136474","DOI":"10.18653\/v1\/p19-1648"},{"key":"3795_CR6","doi-asserted-by":"publisher","unstructured":"Kang G, Lim J, Zhang B (2019) Dual attention networks for visual reference resolution in visual dialog. In: Inui K, Jiang J, Ng V et al (eds) Proceedings of the 2019 conference on empirical methods in natural language processing and the 9th international joint conference on natural language processing, EMNLP-IJCNLP 2019, Hong Kong, China, November 3-7, 2019. Association for Computational Linguistics. https:\/\/doi.org\/10.18653\/v1\/D19-1209, pp 2024\u20132033","DOI":"10.18653\/v1\/D19-1209"},{"key":"3795_CR7","doi-asserted-by":"publisher","unstructured":"Wu Q, Wang P, Shen C et al (2018) Are you talking to me? reasoned visual dialog generation through adversarial learning. In: 2018 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2018, Salt Lake City, UT, USA, June 18-22, 2018. Computer Vision Foundation \/ IEEE Computer Society. https:\/\/doi.org\/10.1109\/CVPR.2018.00639, pp 6106\u20136115","DOI":"10.1109\/CVPR.2018.00639"},{"issue":"4","key":"3795_CR8","doi-asserted-by":"publisher","first-page":"102","DOI":"10.1016\/j.ipm.2019.102152","volume":"57","author":"J Zhang","year":"2020","unstructured":"Zhang J, Wang Q, Han Y (2020) Multi-modal fusion with multi-level attention for visual dialog. Inf Process Manag 57(4):102\u2013152. https:\/\/doi.org\/10.1016\/j.ipm.2019.102152","journal-title":"Inf Process Manag"},{"key":"3795_CR9","doi-asserted-by":"publisher","first-page":"6655","DOI":"10.1109\/TIP.2020.2992888","volume":"29","author":"D Guo","year":"2020","unstructured":"Guo D, Wang H, Wang S et al (2020) Textual-visual reference-aware attention network for visual dialog. IEEE Trans Image Process 29:6655\u20136666. https:\/\/doi.org\/10.1109\/TIP.2020.2992888","journal-title":"IEEE Trans Image Process"},{"issue":"99","key":"3795_CR10","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TPAMI.2021.3085755 10.1109\/TPAMI.2021.3085755","volume":"PP","author":"D Guo","year":"2021","unstructured":"Guo D, Wang H, Wang M (2021) Context-aware graph inference with knowledge distillation for visual dialog. IEEE Trans Pattern Anal Mach Intell PP(99):1\u20131. https:\/\/doi.org\/10.1109\/TPAMI.2021.3085755https:\/\/doi.org\/10.1109\/TPAMI.2021.3085755","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"3795_CR11","doi-asserted-by":"publisher","first-page":"104,316","DOI":"10.1016\/j.imavis.2021.104316","volume":"116","author":"T Jiang","year":"2021","unstructured":"Jiang T, Shao H, Tian X, et al. (2021) Aligning vision-language for graph inference in visual dialog. Image Vis Comput 116:104,316. https:\/\/doi.org\/10.1016\/j.imavis.2021.104316","journal-title":"Image Vis Comput"},{"key":"3795_CR12","doi-asserted-by":"publisher","unstructured":"Schwartz I, Yu S, Hazan T et al (2019) Factor graph attention. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019, Long Beach, CA, USA, June 16-20, 2019. Computer Vision Foundation \/ IEEE. https:\/\/doi.org\/10.1109\/CVPR.2019.00214, pp 2039\u20132048","DOI":"10.1109\/CVPR.2019.00214"},{"key":"3795_CR13","doi-asserted-by":"publisher","unstructured":"Zheng Z, Wang W, Qi S et al (2019) Reasoning visual dialogs with structural and partial observations. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019, Long Beach, CA, USA, June 16-20, 2019. Computer Vision Foundation \/ IEEE. https:\/\/doi.org\/10.1109\/CVPR.2019.00683, pp 6669\u20136678","DOI":"10.1109\/CVPR.2019.00683"},{"key":"3795_CR14","doi-asserted-by":"publisher","unstructured":"Murahari V, Batra D, Parikh D et al (2020) Large-scale pretraining for visual dialog: A simple state-of-the-art baseline. In: Vedaldi A, Bischof H, Brox T, et al. (eds) Computer Vision - ECCV 2020, - 16th European Conference, Glasgow, UK, August 23-28, 2020, Proceedings, Part XVIII, Lecture Notes in Computer Science, vol 12363. Springer. https:\/\/doi.org\/10.1007\/978-3-030-58523-5_20, pp 336\u2013352","DOI":"10.1007\/978-3-030-58523-5_20"},{"key":"3795_CR15","doi-asserted-by":"publisher","unstructured":"Wang Y, Joty S R, Lyu M R et al (2020) VD-BERT: A unified vision and dialog transformer with BERT. In: Webber B, Cohn T, He Y, et al. (eds) Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing, EMNLP 2020, Online, November 16-20, 2020. Association for Computational Linguistics. https:\/\/doi.org\/10.18653\/v1\/2020.emnlp-main.269https:\/\/doi.org\/10.18653\/v1\/2020.emnlp-main.269, pp 3325\u20133338","DOI":"10.18653\/v1\/2020.emnlp-main.269 10.18653\/v1\/2020.emnlp-main.269"},{"key":"3795_CR16","unstructured":"Kang G, Park J, Lee H et al (2020) Dialgraph: Sparse graph learning networks for visual dialog. arXiv:2004.06698"},{"key":"3795_CR17","doi-asserted-by":"crossref","unstructured":"Kim H, Tan H, Bansal M (2020) Modality-balanced models for visual dialogue. In: The Thirty-Fourth AAAI Conference on Artificial Intelligence, AAAI 2020, The Thirty-Second Innovative Applications of Artificial Intelligence Conference, IAAI 2020, The Tenth AAAI Symposium on Educational Advances in Artificial Intelligence, EAAI 2020, New York, NY, USA, February 7-12, 2020. AAAI Press. https:\/\/aaai.org\/ojs\/index.php\/AAAI\/article\/view\/6320, pp 8091\u20138098","DOI":"10.1609\/aaai.v34i05.6320"},{"key":"3795_CR18","doi-asserted-by":"publisher","unstructured":"Qi J, Niu Y, Huang J et al (2020) Two causal principles for improving visual dialog. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2020, Seattle, WA, USA, June 13-19, 2020. Computer Vision Foundation \/ IEEE. https:\/\/doi.org\/10.1109\/CVPR42600.2020.01087, pp 10,857\u201310,866","DOI":"10.1109\/CVPR42600.2020.01087"},{"key":"3795_CR19","doi-asserted-by":"publisher","unstructured":"de Vries H, Strub F, Chandar S et al (2017) Guesswhat?! visual object discovery through multi-modal dialogue. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2017, Honolulu, HI, USA, July 21-26, 2017. IEEE Computer Society. https:\/\/doi.org\/10.1109\/CVPR.2017.475, pp 4466\u20134475","DOI":"10.1109\/CVPR.2017.475"},{"key":"3795_CR20","unstructured":"Lu J, Kannan A, Yang J, et al. (2017) Best of both worlds: Transferring knowledge from discriminative learning to a generative visual dialog model. In: Guyon I, von Luxburg U, Bengio S et al (eds) Advances in Neural Information Processing Systems 30: Annual Conference on Neural Information Processing Systems 2017, December 4-9, 2017, Long Beach, CA, USA. https:\/\/proceedings.neurips.cc\/paper\/2017\/hash\/077e29b11be80ab57e1a2ecabb7da330-Abstract.html, pp 314\u2013324"},{"key":"3795_CR21","doi-asserted-by":"publisher","unstructured":"Guo D, Xu C, Tao D (2019) Image-question-answer synergistic network for visual dialog. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019, Long Beach, CA, USA, June 16-20, 2019. Computer Vision Foundation \/ IEEE. https:\/\/doi.org\/10.1109\/CVPR.2019.01068https:\/\/doi.org\/10.1109\/CVPR.2019.01068, pp 10,434\u201310,443","DOI":"10.1109\/CVPR.2019.01068 10.1109\/CVPR.2019.01068"},{"key":"3795_CR22","doi-asserted-by":"publisher","unstructured":"Yang T, Zha Z, Zhang H (2019) Making history matter: History-advantage sequence training for visual dialog. In: 2019 IEEE\/CVF International Conference on Computer Vision, ICCV 2019, Seoul, Korea (South), October 27 - November 2, 2019. IEEE. https:\/\/doi.org\/10.1109\/ICCV.2019.00265, pp 2561\u20132569","DOI":"10.1109\/ICCV.2019.00265"},{"key":"3795_CR23","doi-asserted-by":"publisher","first-page":"399","DOI":"10.1016\/j.neucom.2021.03.104","volume":"449","author":"B Lin","year":"2021","unstructured":"Lin B, Zhu Y, Liang X (2021) Heterogeneous excitation-and-squeeze network for visual dialog. Neurocomputing 449:399\u2013410. https:\/\/doi.org\/P10.1016\/j.neucom.2021.03.104","journal-title":"Neurocomputing"},{"key":"3795_CR24","doi-asserted-by":"publisher","unstructured":"Kottur S, Moura JMF, Parikh D, et al. (2018) Visual coreference resolution in visual dialog using neural module networks. In: Ferrari V, Hebert M, Sminchisescu C et al (eds) Computer Vision - ECCV 2018 - 15th European Conference, Munich, Germany, September 8-14, 2018, Proceedings, Part XV, Lecture Notes in Computer Science, vol 11219. Springer. https:\/\/doi.org\/10.1007\/978-3-030-01267-0_10, pp 160\u2013178","DOI":"10.1007\/978-3-030-01267-0_10"},{"key":"3795_CR25","doi-asserted-by":"publisher","unstructured":"Niu Y, Zhang H, Zhang M et al (2019) Recursive visual attention in visual dialog. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019, Long Beach, CA, USA, June 16-20, 2019. Computer Vision Foundation \/ IEEE. https:\/\/doi.org\/10.1109\/CVPR.2019.00684, pp 6679\u20136688","DOI":"10.1109\/CVPR.2019.00684"},{"issue":"7","key":"3795_CR26","doi-asserted-by":"publisher","first-page":"399","DOI":"10.3390\/app11073009","volume":"11","author":"S Park","year":"2021","unstructured":"Park S, Whang T, Yoon Y, et al. (2021) Multi-view attention networks for visual dialog. Appl Sci 11(7):399\u2013410. https:\/\/doi.org\/10.3390\/app11073009","journal-title":"Appl Sci"},{"issue":"6","key":"3795_CR27","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","volume":"39","author":"S Ren","year":"2017","unstructured":"Ren S, He K, Girshick R B et al (2017) Faster R-CNN: towards real-time object detection with region proposal networks. IEEE Trans Pattern Anal Mach Intell 39(6):1137\u20131149. https:\/\/doi.org\/10.1109\/TPAMI.2016.2577031","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"1","key":"3795_CR28","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna R, Zhu Y, Groth O et al (2017) Visual genome: Connecting language and vision using crowdsourced dense image annotations. Int J Comput Vis 123(1):32\u201373. https:\/\/doi.org\/10.1007\/s11263-016-0981-7https:\/\/doi.org\/10.1007\/s11263-016-0981-7","journal-title":"Int J Comput Vis"},{"key":"3795_CR29","doi-asserted-by":"publisher","unstructured":"Pennington J, Socher R, Manning CD (2014) Glove: Global vectors for word representation. In: Moschitti A, Pang B, Daelemans W (eds) Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing, EMNLP 2014, October 25-29. https:\/\/doi.org\/10.3115\/v1\/d14-1162, vol 2014. A meeting of SIGDAT, a Special Interest Group of the ACL. ACL, Doha, Qatar, pp 1532\u20131543","DOI":"10.3115\/v1\/d14-1162"},{"key":"3795_CR30","unstructured":"Vaswani A, Shazeer N, Parmar N et al (2017) Attention is all you need. In: Advances in Neural Information Processing Systems 30: Annual Conference on Neural Information Processing Systems 2017, December 4\u20139, 2017, Long Beach, CA, USA, pp 5998\u20136008. https:\/\/proceedings.neurips.cc\/paper\/2017\/hash\/3f5ee243547dee91fbd053c1c4a845aa-Abstract.html"},{"key":"3795_CR31","doi-asserted-by":"publisher","unstructured":"Yu Z, Yu J, Cui Y et al (2019) Deep modular co-attention networks for visual question answering. In: IEEE Conference on computer vision and pattern recognition, CVPR 2019, Long Beach, CA, USA, June 16-20, 2019. Computer Vision Foundation \/ IEEE. https:\/\/doi.org\/10.1109\/CVPR.2019.00644https:\/\/doi.org\/10.1109\/CVPR.2019.00644, pp 6281\u20136290","DOI":"10.1109\/CVPR.2019.00644 10.1109\/CVPR.2019.00644"},{"key":"3795_CR32","doi-asserted-by":"publisher","unstructured":"Lin T, Maire M, Belongie SJ et al (2014) Microsoft COCO: common objects in context. In: Fleet DJ, Pajdla T, Schiele B et al (eds) Computer Vision - ECCV 2014 - 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part V, Lecture Notes in Computer Science, vol 8693. Springer. https:\/\/doi.org\/10.1007\/978-3-319-10602-1_48, pp 740\u2013755","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"3795_CR33","doi-asserted-by":"crossref","unstructured":"Yang L, Meng F, Wu MD, et al. (2020) Seqdialn: Sequential visual dialog networks in joint visual-linguistic representation space. arXiv:2008.00397","DOI":"10.18653\/v1\/2021.dialdoc-1.2"},{"key":"3795_CR34","doi-asserted-by":"publisher","unstructured":"Agarwal S, Bui T, Lee J et al (2020) History for visual dialog: Do we really need it?. In: Proceedings of the 58th annual meeting of the association for computational linguistics, ACL 2020, Online, July 5-10, 2020. Association for Computational Linguistics. https:\/\/doi.org\/10.18653\/v1\/2020.acl-main.728, pp 8182\u20138197","DOI":"10.18653\/v1\/2020.acl-main.728"},{"key":"3795_CR35","doi-asserted-by":"publisher","unstructured":"Guo D, Wang H, Wang M (2019) Dual visual attention network for visual dialog. In: Kraus S (ed) Proceedings of the twenty-eighth international joint conference on artificial intelligence, IJCAI 2019, Macao, China, August 10-16, 2019. ijcai.org. https:\/\/doi.org\/10.24963\/ijcai.2019\/693, pp 4989\u20134995","DOI":"10.24963\/ijcai.2019\/693"},{"key":"3795_CR36","doi-asserted-by":"crossref","unstructured":"Jiang X, Yu J, Qin Z et al (2020) Dualvd: An adaptive dual encoding model for deep visual understanding in visual dialogue. In: The Thirty-Fourth AAAI Conference on Artificial Intelligence, AAAI 2020, The Thirty-Second Innovative Applications of Artificial Intelligence Conference, IAAI 2020, The Tenth AAAI Symposium on Educational Advances in Artificial Intelligence, EAAI 2020, New York, NY, USA, February 7-12, 2020. AAAI Press. https:\/\/aaai.org\/ojs\/index.php\/AAAI\/article\/view\/6769, pp 11,125\u201311,132","DOI":"10.1609\/aaai.v34i07.6769"},{"key":"3795_CR37","unstructured":"Lu J, Batra D, Parikh D et al (2019) Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. In: Advances in neural information processing systems 32: annual conference on neural information processing systems 2019, NeurIPS 2019, December 8-14, 2019. https:\/\/proceedings.neurips.cc\/paper\/2019\/hash\/c74d97b01eae257e44aa9d5bade97baf-Abstract.html. Vancouver, BC, Canada, pp 13\u201323"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-022-03795-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-022-03795-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-022-03795-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,6,16]],"date-time":"2022-06-16T14:16:46Z","timestamp":1655389006000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-022-03795-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,6,16]]},"references-count":37,"alternative-id":["3795"],"URL":"https:\/\/doi.org\/10.1007\/s10489-022-03795-8","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"type":"print","value":"0924-669X"},{"type":"electronic","value":"1573-7497"}],"subject":[],"published":{"date-parts":[[2022,6,16]]},"assertion":[{"value":"21 May 2022","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 June 2022","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}