{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T03:18:12Z","timestamp":1740107892534,"version":"3.37.3"},"reference-count":38,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2021,3,15]],"date-time":"2021-03-15T00:00:00Z","timestamp":1615766400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,3,15]],"date-time":"2021-03-15T00:00:00Z","timestamp":1615766400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["U20B2070"],"award-info":[{"award-number":["U20B2070"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61976199"],"award-info":[{"award-number":["61976199"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Next Generation AI Project of China","award":["2018AAA0100602"],"award-info":[{"award-number":["2018AAA0100602"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2022,4]]},"DOI":"10.1007\/s00530-020-00745-7","type":"journal-article","created":{"date-parts":[[2021,3,15]],"date-time":"2021-03-15T09:05:01Z","timestamp":1615799101000},"page":"445-456","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Question-relationship guided graph attention network for visual question answer"],"prefix":"10.1007","volume":"28","author":[{"given":"Rui","family":"Liu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Liansheng","family":"Zhuang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhou","family":"Yu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhihao","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tian","family":"Bai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2021,3,15]]},"reference":[{"key":"745_CR1","doi-asserted-by":"crossref","unstructured":"Anderson, P., He, X., Buehler, C., Teney, D., Johnson, M., Gould, S., Zhang, L.: Bottom-up and top-down attention for image captioning and visual question answering. 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 6077\u20136086 (2018)","DOI":"10.1109\/CVPR.2018.00636"},{"key":"745_CR2","unstructured":"Battaglia, P.W., Hamrick, J.B., Bapst, V., Sanchez-Gonzalez, A., Zambaldi, V., Malinowski, M., Tacchetti, A., Raposo, D., Santoro, A., Faulkner, R., et\u00a0al.: Relational inductive biases, deep learning, and graph networks. arXiv:1806.01261 (2018)"},{"key":"745_CR3","doi-asserted-by":"crossref","unstructured":"Ben-Younes, H., Cadene, R., Cord, M., Thome, N.: Mutan: Multimodal tucker fusion for visual question answering. 2017 IEEE International Conference on Computer Vision (ICCV), pp. 2631\u20132639\u00a0(2017)","DOI":"10.1109\/ICCV.2017.285"},{"key":"745_CR4","doi-asserted-by":"crossref","unstructured":"Cadene, R., Ben-Younes, H., Cord, M., Thome, N.: Murel: Multimodal relational reasoning for visual question answering. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1989\u20131998 (2019)","DOI":"10.1109\/CVPR.2019.00209"},{"key":"745_CR5","doi-asserted-by":"crossref","unstructured":"Dai, B., Zhang, Y., Lin, D.: Detecting visual relationships with deep relational networks. 2017 IEEE Conference on Computer Vision and Pattern Recognition\u00a0(CVPR), pp. 3298\u20133308 (2017)","DOI":"10.1109\/CVPR.2017.352"},{"key":"745_CR6","doi-asserted-by":"crossref","unstructured":"Gkioxari, G., Girshick, R., Doll\u00e1r, P., He, K.: Detecting and recognizing human-object interactions. 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 8359\u20138367,18-23 (2018)","DOI":"10.1109\/CVPR.2018.00872"},{"key":"745_CR7","unstructured":"Hudson, D.A., Manning, C.D.: Learning by abstraction: the neural state machine.\u00a0Conference on Neural Information Processing Systems, pp. 5871\u20135884 (2019)"},{"key":"745_CR8","unstructured":"Kim, J.H., Jun, J., Zhang, B.T.: Bilinear attention networks. 32nd Conference on Neural Information Processing Systems\u00a0(NeurlPS), pp. 1564\u20131574 (2018)"},{"key":"745_CR9","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. arXiv preprint arXiv:1412.6980 (2014)"},{"key":"745_CR10","doi-asserted-by":"crossref","unstructured":"Li, L., Gan, Z., Cheng, Y., Liu, J.: Relation-aware graph attention network for visual question answering. 2019 IEEE\/CVF International Conference on Computer Vision\u00a0(ICCV), pp. 1031\u201310321 (2019)","DOI":"10.1109\/ICCV.2019.01041"},{"key":"745_CR11","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TPAMI.2019.2922573","volume":"41","author":"J Liang","year":"2019","unstructured":"Liang, J., Jiang, I., Cao, L., Kalantidis, Y., Li, L.J., Hauptmann, A.G.: Focal visual-text attention for memex question answering. IEEE Trans. Pattern Anal. Mach. Intell. 41, 1 (2019)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"745_CR12","unstructured":"Lin, Z., Feng, M., Santos, C.N.d., Yu, M., Xiang, B., Zhou, B., Bengio, Y.: A structured self-attentive sentence embedding. arXiv preprint arXiv:1703.03130 (2017)"},{"key":"745_CR13","doi-asserted-by":"crossref","unstructured":"Lu, C., Krishna, R., Bernstein, M., Fei-Fei, L.: Visual relationship detection with language priors. ECCV 2016:14th European Conference on Computer Vision, pp. 852\u2013869 (2016)","DOI":"10.1007\/978-3-319-46448-0_51"},{"key":"745_CR14","unstructured":"Lu, J., Yang, J., Batra, D., Parikh, D.: Hierarchical question-image co-attention for visual question answering. 30th Annual Conference on Neural Information Processing Systems\u00a0(NeurlPS), pp. 289\u2013297(2016)"},{"key":"745_CR15","doi-asserted-by":"crossref","unstructured":"Luong, M.T., Pham, H., Manning, C.D.: Effective approaches to attention-based neural machine translation. arXiv preprint arXiv:1508.04025 (2015)","DOI":"10.18653\/v1\/D15-1166"},{"key":"745_CR16","doi-asserted-by":"crossref","unstructured":"Noh, H., Kim, T., Mun, J., Han, B.: Transfer learning via unsupervised task discovery for visual question answering. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 8377\u20138386\u00a0(2019)","DOI":"10.1109\/CVPR.2019.00858"},{"key":"745_CR17","unstructured":"Norcliffe-Brown, W., Vafeias, S., Parisot, S.: Learning conditioned graph structures for interpretable visual question answering. 32nd Conference on Neural Information Processing Systems\u00a0(NeurlPS), pp. 8834\u20139343(2018)"},{"key":"745_CR18","unstructured":"Peng, G., Jiang, Z., You, H., Lu, P., Hoi, S., Wang, X., Li, H.: Dynamic fusion with intra-and inter-modality attention flow for visual question answering.  arXiv:1812.05252 (2018)"},{"key":"745_CR19","unstructured":"Remi, C., Hedi, B.-Y., Cord, M., Thome, N.: Murel: multimodal relational reasoning for visual question answering. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1989\u20131998\u00a0(2019)"},{"key":"745_CR20","doi-asserted-by":"crossref","unstructured":"Ren, S., He, K., Girshick, R., Sun, J.: Faster r-cnn: Towards real-time object detection with region proposal networks. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 39, no. 6, pp. 1137\u20131149\u00a0(2017)","DOI":"10.1109\/TPAMI.2016.2577031"},{"key":"745_CR21","doi-asserted-by":"crossref","unstructured":"Shaw, P., Uszkoreit, J., Vaswani, A.: Self-attention with relative position representations. arXiv preprint arXiv:1803.02155 (2018)","DOI":"10.18653\/v1\/N18-2074"},{"key":"745_CR22","doi-asserted-by":"crossref","unstructured":"Shih, K.J., Singh, S., Hoiem, D.: Where to look: Focus regions for visual question answering. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4613\u20134621 (2016)","DOI":"10.1109\/CVPR.2016.499"},{"key":"745_CR23","doi-asserted-by":"crossref","unstructured":"Singh, A., Natarajan, V., Shah, M., Jiang, Y., Chen, X., Batra, D., Parikh, D., Rohrbach, M.: Towards vqa models that can read. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 8309\u20138318\u00a0(2019)","DOI":"10.1109\/CVPR.2019.00851"},{"key":"745_CR24","doi-asserted-by":"crossref","unstructured":"Tang, K., Zhang, H., Wu, B., Luo, W., Liu, W.: Learning to compose dynamic tree structures for visual contexts. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6612\u20136621\u00a0(2019)","DOI":"10.1109\/CVPR.2019.00678"},{"key":"745_CR25","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141., Polosukhin, I.: Attention is all you need. 31st International Conference on Neural Information Processing Systems, vol. 30, pp. 5998\u20136008 (2017)"},{"key":"745_CR26","unstructured":"Veli\u010dkovi\u0107, P., Cucurull, G., Casanova, A., Romero, A., Lio, P., Bengio, Y.: Graph attention networks. 2018\u2002International Conference on Learning Representations (2018)"},{"key":"745_CR27","unstructured":"Wu, C., Liu, J., Wang, X., Dong, X.: Chain of reasoning for visual question answering. 32nd International Conference on Neural Information Processing Systems, vol. 31, pp. 275\u2013285 (2018)"},{"key":"745_CR28","doi-asserted-by":"crossref","unstructured":"Wu, Z., Pan, S., Chen, F., Long, G., Zhang, C., Yu, P.S.: A comprehensive survey on graph neural networks. IEEE Transactions on Neural Networks and Learning Systems, vol. 32, no. 1, pp. 4\u201324\u00a0(2020)","DOI":"10.1109\/TNNLS.2020.2978386"},{"key":"745_CR29","unstructured":"Xu, K., Ba, J., Kiros, R., Cho, K., Courville, A., Salakhudinov, R., Zemel, R., Bengio, Y.: Show, attend and tell: neural image caption generation with visual attention. 32nd International conference on machine learning (ICML), volume 3 of 3, pp. 477\u2013499\u00a0(2015)\u00a0"},{"key":"745_CR30","first-page":"1230","volume":"33","author":"K Xu","year":"2019","unstructured":"Xu, K., Wang, Z., Shi, J., Li, H., Zhang, Q.C.: A2-net: molecular structure estimation from cryo-em density volumes. Proc. AAAI Conf. Artif. Intell. 33, 1230\u20131237 (2019)","journal-title":"Proc. AAAI Conf. Artif. Intell."},{"key":"745_CR31","doi-asserted-by":"crossref","unstructured":"Yao, T., Pan, Y., Li, Y., Mei, T.: Exploring visual relationship for image captioning. \u00a0ECCV 2018: 15th European Conference on Computer Vision, pp. 711\u2013727 (2018)","DOI":"10.1007\/978-3-030-01264-9_42"},{"key":"745_CR32","unstructured":"Yi, K., Wu, J., Gan, C., Torralba, A., Kohli, P., Tenenbaum, J.: Neural-symbolic vqa: disentangling reasoning from vision and language understanding. Advances in Neural Information Processing Systems, vol. 31, 2018, pp. 1031\u20131042 (2017)"},{"key":"745_CR33","doi-asserted-by":"crossref","unstructured":"Yu, Z., Xu, D., Yu, J., Yu, T., Zhao, Z., Zhuang, Y., Tao, D.: Activitynet-qa: a dataset for understanding complex web videos via question answering. Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33, no. 1, pp. 9127\u20139134\u00a0(2019)","DOI":"10.1609\/aaai.v33i01.33019127"},{"key":"745_CR34","doi-asserted-by":"crossref","unstructured":"Yu, Z., Yu, J., Cui, Y., Tao, D., Tian, Q.: Deep modular co-attention networks for visual question answering. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6274\u20136283\u00a0(2019)","DOI":"10.1109\/CVPR.2019.00644"},{"issue":"12","key":"745_CR35","doi-asserted-by":"publisher","first-page":"5947","DOI":"10.1109\/TNNLS.2018.2817340","volume":"29","author":"Z Yu","year":"2018","unstructured":"Yu, Z., Yu, J., Xiang, C., Fan, J., Tao, D.: Beyond bilinear: generalized multimodal factorized high-order pooling for visual question answering. IEEE Trans. Neural Netw. Learn. Syst. 29(12), 5947\u20135959 (2018)","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"745_CR36","unstructured":"Zhang, C., Chao, W.L., Xuan, D.: An empirical study on leveraging scene graphs for visual question answering. 2018\u2002British Machine Vision Conference (BMVC), p. 288 (2018)"},{"key":"745_CR37","doi-asserted-by":"crossref","unstructured":"Zhang, J., Shih, K.J., Elgammal, A., Tao, A., Catanzaro, B.: Graphical contrastive losses for scene graph parsing. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 11527\u201311535\u00a0(2019)","DOI":"10.1109\/CVPR.2019.01180"},{"key":"745_CR38","doi-asserted-by":"crossref","unstructured":"Yang, Z.,\u00a0He, X., J.L.A.: Stacked\u00a0attention\u00a0networks\u00a0for image question answering.\u00a02016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 21\u201329\u00a0(2016)","DOI":"10.1109\/CVPR.2016.10"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-020-00745-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-020-00745-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-020-00745-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,4,16]],"date-time":"2022-04-16T07:31:41Z","timestamp":1650094301000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-020-00745-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,3,15]]},"references-count":38,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2022,4]]}},"alternative-id":["745"],"URL":"https:\/\/doi.org\/10.1007\/s00530-020-00745-7","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"type":"print","value":"0942-4962"},{"type":"electronic","value":"1432-1882"}],"subject":[],"published":{"date-parts":[[2021,3,15]]},"assertion":[{"value":"10 September 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"26 December 2020","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 March 2021","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}