{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,29]],"date-time":"2026-07-29T14:29:50Z","timestamp":1785335390741,"version":"3.55.0"},"reference-count":71,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2024,7,18]],"date-time":"2024-07-18T00:00:00Z","timestamp":1721260800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,7,18]],"date-time":"2024-07-18T00:00:00Z","timestamp":1721260800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"Natural Science Foundation of Shanghai","award":["21ZR1426500"],"award-info":[{"award-number":["21ZR1426500"]}]},{"name":"The 2022 Graduate Top Innovative Talents Training Program at Shanghai Maritime University","award":["2022YBR005"],"award-info":[{"award-number":["2022YBR005"]}]},{"name":"The 2022 Graduate Top Innovative Talents Training Program at Shanghai Maritime University","award":["2022YBR014"],"award-info":[{"award-number":["2022YBR014"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["No. 52331012"],"award-info":[{"award-number":["No. 52331012"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2025,3]]},"DOI":"10.1007\/s00371-024-03563-4","type":"journal-article","created":{"date-parts":[[2024,7,18]],"date-time":"2024-07-18T20:12:19Z","timestamp":1721333539000},"page":"2737-2754","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":60,"title":["Vman: visual-modified attention network for multimodal paradigms"],"prefix":"10.1007","volume":"41","author":[{"given":"Xiaoyu","family":"Song","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dezhi","family":"Han","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chongqing","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiang","family":"Shen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Huafeng","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,7,18]]},"reference":[{"key":"3563_CR1","doi-asserted-by":"publisher","unstructured":"Song, S., Li, J., Wang, J., Cai, Y., Dong, W.: Mf2-mvqa: A multi-stage feature fusion method for medical visual question answering. In: 2023 IEEE 20th International Symposium on Biomedical Imaging (ISBI), pp. 1\u20135 (2023). https:\/\/doi.org\/10.1109\/ISBI53787.2023.10230530","DOI":"10.1109\/ISBI53787.2023.10230530"},{"issue":"1","key":"3563_CR2","doi-asserted-by":"publisher","first-page":"163","DOI":"10.1109\/TII.2021.3085669","volume":"18","author":"J Li","year":"2022","unstructured":"Li, J., Chen, J., Sheng, B., Li, P., Yang, P., Feng, D.D., Qi, J.: Automatic detection and classification system of domestic waste via multimodel cascaded convolutional neural network. IEEE Trans. Ind. Inf. 18(1), 163\u2013173 (2022). https:\/\/doi.org\/10.1109\/TII.2021.3085669","journal-title":"IEEE Trans. Ind. Inf."},{"key":"3563_CR3","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141., Polosukhin, I.: Attention is all you need. In: Advances in Neural Information Processing Systems, vol. 30 (2017)"},{"key":"3563_CR4","doi-asserted-by":"publisher","unstructured":"Devlin, J., Chang, M.-W., Lee, K., Toutanova, K.: BERT: Pre-training of deep bidirectional transformers for language understanding. In: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Vol. 1 (Long and Short Papers), pp. 4171\u20134186. Association for Computational Linguistics, Minneapolis, Minnesota (2019). https:\/\/doi.org\/10.18653\/v1\/N19-1423","DOI":"10.18653\/v1\/N19-1423"},{"key":"3563_CR5","doi-asserted-by":"publisher","DOI":"10.1016\/J.INFFUS.2023.101861","volume":"99","author":"J Kocon","year":"2023","unstructured":"Kocon, J., Cichecki, I., Kaszyca, O., Kochanek, M., Szydlo, D., Baran, J., Bielaniewicz, J., Gruza, M., Janz, A., Kanclerz, K., Kocon, A., Koptyra, B., Mieleszczenko-Kowszewicz, W., Milkowski, P., Oleksy, M., Piasecki, M., Radlinski, L., Wojtasik, K., Wozniak, S., Kazienko, P.: Chatgpt: jack of all trades, master of none. Inf. Fusion 99, 101861 (2023). https:\/\/doi.org\/10.1016\/J.INFFUS.2023.101861","journal-title":"Inf. Fusion"},{"key":"3563_CR6","doi-asserted-by":"publisher","first-page":"50","DOI":"10.1109\/TMM.2021.3120873","volume":"25","author":"X Lin","year":"2023","unstructured":"Lin, X., Sun, S., Huang, W., Sheng, B., Li, P., Feng, D.D.: Eapt: efficient attention pyramid transformer for image processing. IEEE Trans. Multimedia 25, 50\u201361 (2023). https:\/\/doi.org\/10.1109\/TMM.2021.3120873","journal-title":"IEEE Trans. Multimedia"},{"key":"3563_CR7","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., Houlsby, N.: An image is worth 16x16 words: transformers for image recognition at scale. In: 9th International Conference on Learning Representations, ICLR 2021, Virtual Event, Austria, May 3\u20137, 2021 (2021)"},{"key":"3563_CR8","doi-asserted-by":"publisher","unstructured":"Yuan, L., Chen, Y., Wang, T., Yu, W., Shi, Y., Jiang, Z., Tay, F.E.H., Feng, J., Yan, S.: Tokens-to-token vit: Training vision transformers from scratch on imagenet. In: 2021 IEEE\/CVF International Conference on Computer Vision, ICCV 2021, Montreal, QC, Canada, October 10\u201317, 2021, pp. 538\u2013547 (2021). https:\/\/doi.org\/10.1109\/ICCV48922.2021.00060","DOI":"10.1109\/ICCV48922.2021.00060"},{"key":"3563_CR9","doi-asserted-by":"publisher","unstructured":"Sun, C., Myers, A., Vondrick, C., Murphy, K., Schmid, C.: Videobert: A joint model for video and language representation learning. In: 2019 IEEE\/CVF International Conference on Computer Vision, ICCV 2019, Seoul, Korea (South), October 27\u2013November 2, 2019, pp. 7463\u20137472 (2019). https:\/\/doi.org\/10.1109\/ICCV.2019.00756","DOI":"10.1109\/ICCV.2019.00756"},{"key":"3563_CR10","doi-asserted-by":"publisher","unstructured":"Deng, J., Yang, Z., Chen, T., Zhou, W., Li, H.: Transvg: End-to-end visual grounding with transformers. In: 2021 IEEE\/CVF International Conference on Computer Vision, ICCV 2021, Montreal, QC, Canada, October 10\u201317, 2021, pp. 1749\u20131759 (2021). https:\/\/doi.org\/10.1109\/ICCV48922.2021.00179","DOI":"10.1109\/ICCV48922.2021.00179"},{"key":"3563_CR11","doi-asserted-by":"publisher","unstructured":"Du, Y., Fu, Z., Liu, Q., Wang, Y.: Visual grounding with transformers. In: IEEE International Conference on Multimedia and Expo, ICME 2022, Taipei, Taiwan, July 18\u201322, 2022, pp. 1\u20136 (2022). https:\/\/doi.org\/10.1109\/ICME52920.2022.9859880","DOI":"10.1109\/ICME52920.2022.9859880"},{"key":"3563_CR12","unstructured":"Su, W., Zhu, X., Cao, Y., Li, B., Lu, L., Wei, F., Dai, J.: VL-BERT: pre-training of generic visual-linguistic representations. In: 8th International Conference on Learning Representations, ICLR 2020, Addis Ababa, Ethiopia, April 26\u201330, 2020 (2020)"},{"key":"3563_CR13","doi-asserted-by":"publisher","unstructured":"Li, G., Duan, N., Fang, Y., Gong, M., Jiang, D.: Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training. In: The Thirty-Fourth AAAI Conference on Artificial Intelligence, AAAI 2020, The Thirty-Second Innovative Applications of Artificial Intelligence Conference, IAAI 2020, The Tenth AAAI Symposium on Educational Advances in Artificial Intelligence, EAAI 2020, New York, NY, USA, February 7\u201312, 2020, pp. 11336\u201311344 (2020). https:\/\/doi.org\/10.1609\/AAAI.V34I07.6795","DOI":"10.1609\/AAAI.V34I07.6795"},{"key":"3563_CR14","unstructured":"Zeng, Y., Zhang, X., Li, H.: Multi-grained vision language pre-training: aligning texts with visual concepts. In: Chaudhuri, K., Jegelka, S., Song, L., Szepesv\u00e1ri, C., Niu, G., Sabato, S. (eds.) International Conference on Machine Learning, ICML 2022, 17\u201323 July 2022, Baltimore, Maryland, USA, vol. 162, pp. 25994\u201326009 (2022)"},{"key":"3563_CR15","doi-asserted-by":"publisher","first-page":"6997","DOI":"10.1109\/TMM.2022.3216770","volume":"25","author":"A Mao","year":"2023","unstructured":"Mao, A., Yang, Z., Lin, K., Xuan, J., Liu, Y.: Positional attention guided transformer-like architecture for visual question answering. IEEE Trans. Multim. 25, 6997\u20137009 (2023). https:\/\/doi.org\/10.1109\/TMM.2022.3216770","journal-title":"IEEE Trans. Multim."},{"key":"3563_CR16","doi-asserted-by":"publisher","DOI":"10.1016\/J.PATCOG.2022.108980","volume":"132","author":"C Chen","year":"2022","unstructured":"Chen, C., Han, D., Chang, C.: CAAN: context-aware attention network for visual question answering. Pattern Recognit. 132, 108980 (2022). https:\/\/doi.org\/10.1016\/J.PATCOG.2022.108980","journal-title":"Pattern Recognit."},{"key":"3563_CR17","doi-asserted-by":"publisher","DOI":"10.1016\/J.KNOSYS.2023.110706","volume":"275","author":"C Chen","year":"2023","unstructured":"Chen, C., Han, D., Shen, X.: CLVIN: complete language-vision interaction network for visual question answering. Knowl. Based Syst. 275, 110706 (2023). https:\/\/doi.org\/10.1016\/J.KNOSYS.2023.110706","journal-title":"Knowl. Based Syst."},{"key":"3563_CR18","doi-asserted-by":"publisher","unstructured":"Yu, Z., Yu, J., Cui, Y., Tao, D., Tian, Q.: Deep modular co-attention networks for visual question answering. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019, Long Beach, CA, USA, June 16\u201320, 2019, pp. 6281\u20136290 (2019). https:\/\/doi.org\/10.1109\/CVPR.2019.00644","DOI":"10.1109\/CVPR.2019.00644"},{"key":"3563_CR19","doi-asserted-by":"publisher","unstructured":"Yang, L., Xu, Y., Yuan, C., Liu, W., Li, B., Hu, W.: Improving visual grounding with visual-linguistic verification and iterative reasoning. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2022, New Orleans, LA, USA, June 18\u201324, 2022, pp. 9489\u20139498 (2022). https:\/\/doi.org\/10.1109\/CVPR52688.2022.00928","DOI":"10.1109\/CVPR52688.2022.00928"},{"issue":"6","key":"3563_CR20","doi-asserted-by":"publisher","first-page":"7900","DOI":"10.1109\/TPAMI.2022.3217852","volume":"45","author":"H Ding","year":"2023","unstructured":"Ding, H., Liu, C., Wang, S., Jiang, X.: Vlt: vision-language transformer and query generation for referring segmentation. IEEE Trans. Pattern Anal. Mach. Intell. 45(6), 7900\u20137916 (2023). https:\/\/doi.org\/10.1109\/TPAMI.2022.3217852","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"8","key":"3563_CR21","doi-asserted-by":"publisher","first-page":"4499","DOI":"10.1109\/TNNLS.2021.3116209","volume":"34","author":"Z Xie","year":"2023","unstructured":"Xie, Z., Zhang, W., Sheng, B., Li, P., Chen, C.L.P.: Bagfn: broad attentive graph fusion network for high-order feature interactions. IEEE Trans. Neural Netw. Learn. Syst. 34(8), 4499\u20134513 (2023). https:\/\/doi.org\/10.1109\/TNNLS.2021.3116209","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"3563_CR22","doi-asserted-by":"publisher","unstructured":"Zhou, Y., Ren, T., Zhu, C., Sun, X., Liu, J., Ding, X., Xu, M., Ji, R.: TRAR: routing the attention spans in transformer for visual question answering. In: 2021 IEEE\/CVF International Conference on Computer Vision, ICCV 2021, Montreal, QC, Canada, October 10\u201317, 2021, pp. 2054\u20132064 (2021). https:\/\/doi.org\/10.1109\/ICCV48922.2021.00208","DOI":"10.1109\/ICCV48922.2021.00208"},{"key":"3563_CR23","doi-asserted-by":"publisher","unstructured":"Liao, Y., Liu, S., Li, G., Wang, F., Chen, Y., Qian, C., Li, B.: A real-time cross-modality correlation filtering method for referring expression comprehension. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2020, Seattle, WA, USA, June 13\u201319, 2020, pp. 10877\u201310886 (2020). https:\/\/doi.org\/10.1109\/CVPR42600.2020.01089","DOI":"10.1109\/CVPR42600.2020.01089"},{"key":"3563_CR24","doi-asserted-by":"crossref","unstructured":"Goyal, Y., Khot, T., Summers-Stay, D., Batra, D., Parikh, D.: Making the v in vqa matter: Elevating the role of image understanding in visual question answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 6904\u20136913 (2017)","DOI":"10.1109\/CVPR.2017.670"},{"key":"3563_CR25","doi-asserted-by":"publisher","unstructured":"Yu, L., Poirson, P., Yang, S., Berg, A.C., Berg, T.L.: Modeling context in referring expressions. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) Computer Vision-ECCV 2016\u201414th European Conference, Amsterdam, The Netherlands, October 11\u201314, 2016, Proceedings, Part II, vol. 9906, pp. 69\u201385 (2016). https:\/\/doi.org\/10.1007\/978-3-319-46475-6_5","DOI":"10.1007\/978-3-319-46475-6_5"},{"key":"3563_CR26","doi-asserted-by":"publisher","unstructured":"Mao, J., Huang, J., Toshev, A., Camburu, O., Yuille, A.L., Murphy, K.: Generation and comprehension of unambiguous object descriptions. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016, Las Vegas, NV, USA, June 27\u201330, 2016, pp. 11\u201320 (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.9","DOI":"10.1109\/CVPR.2016.9"},{"issue":"6","key":"3563_CR27","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","volume":"39","author":"S Ren","year":"2017","unstructured":"Ren, S., He, K., Girshick, R., Sun, J.: Faster r-cnn: towards real-time object detection with region proposal networks. IEEE Trans. Pattern Anal. Mach. Intell. 39(6), 1137\u20131149 (2017). https:\/\/doi.org\/10.1109\/TPAMI.2016.2577031","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"2","key":"3563_CR28","doi-asserted-by":"publisher","first-page":"684","DOI":"10.1109\/TPAMI.2019.2911066","volume":"44","author":"R Hong","year":"2022","unstructured":"Hong, R., Liu, D., Mo, X., He, X., Zhang, H.: Learning to compose and reason with language tree structures for visual grounding. IEEE Trans. Pattern Anal. Mach. Intell. 44(2), 684\u2013696 (2022). https:\/\/doi.org\/10.1109\/TPAMI.2019.2911066","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"2","key":"3563_CR29","doi-asserted-by":"publisher","first-page":"1181","DOI":"10.1109\/TPAMI.2023.3328185","volume":"46","author":"F Shi","year":"2024","unstructured":"Shi, F., Gao, R., Huang, W., Wang, L.: Dynamic MDETR: a dynamic multimodal transformer decoder for visual grounding. IEEE Trans. Pattern Anal. Mach. Intell. 46(2), 1181\u20131198 (2024). https:\/\/doi.org\/10.1109\/TPAMI.2023.3328185","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3563_CR30","doi-asserted-by":"publisher","unstructured":"Luo, G., Zhou, Y., Sun, X., Cao, L., Wu, C., Deng, C., Ji, R.: Multi-task collaborative network for joint referring expression comprehension and segmentation. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2020, Seattle, WA, USA, June 13\u201319, 2020, pp. 10031\u201310040 (2020). https:\/\/doi.org\/10.1109\/CVPR42600.2020.01005","DOI":"10.1109\/CVPR42600.2020.01005"},{"key":"3563_CR31","doi-asserted-by":"publisher","unstructured":"Yang, Z., Chen, T., Wang, L., Luo, J.: Improving one-stage visual grounding by recursive sub-query construction. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J. (eds.) Computer Vision-ECCV 2020\u201416th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XIV, vol. 12359, pp. 387\u2013404 (2020). https:\/\/doi.org\/10.1007\/978-3-030-58568-6_23","DOI":"10.1007\/978-3-030-58568-6_23"},{"issue":"1","key":"3563_CR32","doi-asserted-by":"publisher","first-page":"134","DOI":"10.1109\/TNNLS.2021.3090426","volume":"34","author":"Y Zhou","year":"2023","unstructured":"Zhou, Y., Ji, R., Luo, G., Sun, X., Su, J., Ding, X., Lin, C., Tian, Q.: A real-time global inference network for one-stage referring expression comprehension. IEEE Trans. Neural Netw. Learn. Syst. 34(1), 134\u2013143 (2023). https:\/\/doi.org\/10.1109\/TNNLS.2021.3090426","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"3563_CR33","doi-asserted-by":"publisher","unstructured":"Yang, Z., Gong, B., Wang, L., Huang, W., Yu, D., Luo, J.: A fast and accurate one-stage approach to visual grounding. In: 2019 IEEE\/CVF International Conference on Computer Vision, ICCV 2019, Seoul, Korea (South), October 27\u2013November 2, 2019, pp. 4682\u20134692 (2019). https:\/\/doi.org\/10.1109\/ICCV.2019.00478","DOI":"10.1109\/ICCV.2019.00478"},{"key":"3563_CR34","unstructured":"Zhu, J., Xia, Y., Wu, L., He, D., Qin, T., Zhou, W., Li, H., Liu, T.: Incorporating BERT into neural machine translation. In: 8th International Conference on Learning Representations, ICLR 2020, Addis Ababa, Ethiopia, April 26\u201330, 2020 (2020)"},{"key":"3563_CR35","doi-asserted-by":"publisher","unstructured":"Chen, H., Wang, Y., Guo, T., Xu, C., Deng, Y., Liu, Z., Ma, S., Xu, C., Xu, C., Gao, W.: Pre-trained image processing transformer. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2021, Virtual, June 19-25, 2021, pp. 12299\u201312310 (2021). https:\/\/doi.org\/10.1109\/CVPR46437.2021.01212","DOI":"10.1109\/CVPR46437.2021.01212"},{"key":"3563_CR36","doi-asserted-by":"publisher","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., Zagoruyko, S.: End-to-end object detection with transformers. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J. (eds.) Computer Vision-ECCV 2020\u201416th European Conference, Glasgow, UK, August 23-28, 2020, Proceedings, Part I, vol. 12346, pp. 213\u2013229 (2020). https:\/\/doi.org\/10.1007\/978-3-030-58452-8_13","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"3563_CR37","doi-asserted-by":"publisher","unstructured":"Zhou, L., Palangi, H., Zhang, L., Hu, H., Corso, J.J., Gao, J.: Unified vision-language pre-training for image captioning and VQA. In: The Thirty-Fourth AAAI Conference on Artificial Intelligence, AAAI 2020, The Thirty-Second Innovative Applications of Artificial Intelligence Conference, IAAI 2020, The Tenth AAAI Symposium on Educational Advances in Artificial Intelligence, EAAI 2020, New York, NY, USA, February 7\u201312, 2020, pp. 13041\u201313049 (2020). https:\/\/doi.org\/10.1609\/AAAI.V34I07.7005","DOI":"10.1609\/AAAI.V34I07.7005"},{"key":"3563_CR38","unstructured":"Qi, D., Su, L., Song, J., Cui, E., Bharti, T., Sacheti, A.: Imagebert: Cross-modal pre-training with large-scale weak-supervised image-text data. CoRR abs\/2001.07966 (2020)"},{"key":"3563_CR39","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., Sutskever, I.: Learning transferable visual models from natural language supervision. In: Meila, M., Zhang, T. (eds.) Proceedings of the 38th International Conference on Machine Learning, ICML 2021, 18\u201324 July 2021, Virtual Event, vol. 139, pp. 8748\u20138763 (2021)"},{"key":"3563_CR40","unstructured":"Yu, Z., Cui, Y., Yu, J., Tao, D., Tian, Q.: Multimodal unified attention networks for vision-and-language interactions. CoRR abs\/1908.04107 (2019)"},{"key":"3563_CR41","doi-asserted-by":"publisher","first-page":"5344","DOI":"10.1109\/TMM.2022.3190686","volume":"25","author":"Y Liu","year":"2023","unstructured":"Liu, Y., Wei, W., Peng, D., Mao, X., He, Z., Zhou, P.: Depth-aware and semantic guided relational attention network for visual question answering. IEEE Trans. Multim. 25, 5344\u20135357 (2023). https:\/\/doi.org\/10.1109\/TMM.2022.3190686","journal-title":"IEEE Trans. Multim."},{"issue":"13","key":"3563_CR42","doi-asserted-by":"publisher","first-page":"16706","DOI":"10.1007\/s10489-022-04355-w","volume":"53","author":"X Shen","year":"2023","unstructured":"Shen, X., Han, D., Guo, Z., Chen, C., Hua, J., Luo, G.: Local self-attention in transformer for visual question answering. Appl. Intell. 53(13), 16706\u201316723 (2023)","journal-title":"Appl. Intell."},{"key":"3563_CR43","doi-asserted-by":"crossref","unstructured":"Chen, C., Han, D., Chang, C.-C.: Mpcct: Multimodal vision-language learning paradigm with context-based compact transformer. Pattern Recogn. 110084 (2023)","DOI":"10.1016\/j.patcog.2023.110084"},{"issue":"1","key":"3563_CR44","doi-asserted-by":"publisher","first-page":"586","DOI":"10.1007\/S10489-022-03559-4","volume":"53","author":"Z Guo","year":"2023","unstructured":"Guo, Z., Han, D.: Sparse co-attention visual question answering networks based on thresholds. Appl. Intell. 53(1), 586\u2013600 (2023). https:\/\/doi.org\/10.1007\/S10489-022-03559-4","journal-title":"Appl. Intell."},{"key":"3563_CR45","doi-asserted-by":"publisher","unstructured":"Chen, X., Li, H., Li, M., Pan, J.: Learning A sparse transformer network for effective image deraining. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2023, Vancouver, BC, Canada, June 17\u201324, 2023, pp. 5896\u20135905 (2023). https:\/\/doi.org\/10.1109\/CVPR52729.2023.00571","DOI":"10.1109\/CVPR52729.2023.00571"},{"key":"3563_CR46","doi-asserted-by":"publisher","first-page":"2226","DOI":"10.1109\/TMM.2022.3144890","volume":"25","author":"N Jiang","year":"2023","unstructured":"Jiang, N., Sheng, B., Li, P., Lee, T.: Photohelper: portrait photographing guidance via deep feature retrieval and fusion. IEEE Trans. Multim. 25, 2226\u20132238 (2023). https:\/\/doi.org\/10.1109\/TMM.2022.3144890","journal-title":"IEEE Trans. Multim."},{"issue":"11","key":"3563_CR47","doi-asserted-by":"publisher","first-page":"13489","DOI":"10.1109\/TPAMI.2023.3293885","volume":"45","author":"Z Chen","year":"2023","unstructured":"Chen, Z., Qiu, G., Li, P., Zhu, L., Yang, X., Sheng, B.: Mngnas: distilling adaptive combination of multiple searched networks for one-shot neural architecture search. IEEE Trans. Pattern Anal. Mach. Intell. 45(11), 13489\u201313508 (2023). https:\/\/doi.org\/10.1109\/TPAMI.2023.3293885","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3563_CR48","doi-asserted-by":"publisher","unstructured":"Anderson, P., He, X., Buehler, C., Teney, D., Johnson, M., Gould, S., Zhang, L.: Bottom-up and top-down attention for image captioning and visual question answering. In: 2018 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2018, Salt Lake City, UT, USA, June 18\u201322, 2018, pp. 6077\u20136086 (2018). https:\/\/doi.org\/10.1109\/CVPR.2018.00636","DOI":"10.1109\/CVPR.2018.00636"},{"issue":"8","key":"3563_CR49","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 9(8), 1735\u20131780 (1997)","journal-title":"Neural Comput."},{"key":"3563_CR50","doi-asserted-by":"publisher","unstructured":"Pennington, J., Socher, R., Manning, C.D.: Glove: Global vectors for word representation. In: Moschitti, A., Pang, B., Daelemans, W. (eds.) Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing, EMNLP 2014, October 25\u201329, 2014, Doha, Qatar, A Meeting of SIGDAT, a Special Interest Group of The ACL, pp. 1532\u20131543 (2014). https:\/\/doi.org\/10.3115\/V1\/D14-1162","DOI":"10.3115\/V1\/D14-1162"},{"key":"3563_CR51","doi-asserted-by":"crossref","unstructured":"Antol, S., Agrawal, A., Lu, J., Mitchell, M., Batra, D., Zitnick, C.L., Parikh, D.: Vqa: Visual question answering. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2425\u20132433 (2015)","DOI":"10.1109\/ICCV.2015.279"},{"key":"3563_CR52","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna, R., Zhu, Y., Groth, O., Johnson, J., Hata, K., Kravitz, J., Chen, S., Kalantidis, Y., Li, L.-J., Shamma, D.A., et al.: Visual genome: connecting language and vision using crowdsourced dense image annotations. Int. J. Comput. Vis. 123, 32\u201373 (2017)","journal-title":"Int. J. Comput. Vis."},{"key":"3563_CR53","unstructured":"Kim, J., Jun, J., Zhang, B.: Bilinear attention networks. In: Bengio, S., Wallach, H.M., Larochelle, H., Grauman, K., Cesa-Bianchi, N., Garnett, R. (eds.) Advances in Neural Information Processing Systems 31: Annual Conference on Neural Information Processing Systems 2018, NeurIPS 2018, December 3\u20138, 2018, Montr\u00e9al, Canada, pp. 1571\u20131581 (2018)"},{"key":"3563_CR54","doi-asserted-by":"publisher","unstructured":"Yang, X., Lin, G., Lv, F., Liu, F.: Trrnet: Tiered relation reasoning for compositional visual question answering. In: Computer Vision-ECCV 2020\u201416th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XXI. Lecture Notes in Computer Science, vol. 12366, pp. 414\u2013430 (2020). https:\/\/doi.org\/10.1007\/978-3-030-58589-1_25","DOI":"10.1007\/978-3-030-58589-1_25"},{"key":"3563_CR55","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3135655","author":"J Cao","year":"2022","unstructured":"Cao, J., Qin, X., Zhao, S., Shen, J.: Bilateral cross-modality graph matching attention for feature fusion in visual question answering. IEEE Trans. Neural Netw. Learn. Syst. (2022). https:\/\/doi.org\/10.1109\/TNNLS.2021.3135655","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"issue":"6","key":"3563_CR56","doi-asserted-by":"publisher","first-page":"5062","DOI":"10.1007\/S10489-024-05437-7","volume":"54","author":"X Shen","year":"2024","unstructured":"Shen, X., Han, D., Zong, L., Guo, Z., Hua, J.: Relational reasoning and adaptive fusion for visual question answering. Appl. Intell. 54(6), 5062\u20135080 (2024). https:\/\/doi.org\/10.1007\/S10489-024-05437-7","journal-title":"Appl. Intell."},{"key":"3563_CR57","doi-asserted-by":"publisher","first-page":"6730","DOI":"10.1109\/TIP.2021.3097180","volume":"30","author":"W Guo","year":"2021","unstructured":"Guo, W., Zhang, Y., Yang, J., Yuan, X.: Re-attention for visual question answering. IEEE Trans. Image Process. 30, 6730\u20136743 (2021)","journal-title":"IEEE Trans. Image Process."},{"key":"3563_CR58","doi-asserted-by":"publisher","unstructured":"Rahman, T., Chou, S., Sigal, L., Carenini, G.: An improved attention for visual question answering. In: IEEE Conference on Computer Vision and Pattern Recognition Workshops, CVPR Workshops 2021, Virtual, June 19\u201325, 2021, pp. 1653\u20131662 (2021). https:\/\/doi.org\/10.1109\/CVPRW53098.2021.00181","DOI":"10.1109\/CVPRW53098.2021.00181"},{"key":"3563_CR59","doi-asserted-by":"crossref","unstructured":"Hudson, D.A., Manning, C.D.: Gqa: A new dataset for real-world visual reasoning and compositional question answering. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 6700\u20136709 (2019)","DOI":"10.1109\/CVPR.2019.00686"},{"issue":"2","key":"3563_CR60","doi-asserted-by":"publisher","first-page":"1023","DOI":"10.1109\/TNNLS.2021.3104937","volume":"34","author":"D Guo","year":"2023","unstructured":"Guo, D., Xu, C., Tao, D.: Bilinear graph networks for visual question answering. IEEE Trans. Neural Netw. Learn. Syst. 34(2), 1023\u20131034 (2023). https:\/\/doi.org\/10.1109\/TNNLS.2021.3104937","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"issue":"9","key":"3563_CR61","doi-asserted-by":"publisher","first-page":"3097","DOI":"10.1007\/S00371-022-02524-Z","volume":"38","author":"F Yan","year":"2022","unstructured":"Yan, F., Silamu, W., Li, Y., Chai, Y.: Spca-net: a based on spatial position relationship co-attention network for visual question answering. Vis. Comput. 38(9), 3097\u20133108 (2022). https:\/\/doi.org\/10.1007\/S00371-022-02524-Z","journal-title":"Vis. Comput."},{"key":"3563_CR62","unstructured":"Cao, J., Qin, X., Zhao, S., Shen, J.: Bilateral cross-modality graph matching attention for feature fusion in visual question answering. IEEE Trans. Neural Netw. Learn. Syst. (2022)"},{"key":"3563_CR63","doi-asserted-by":"publisher","DOI":"10.1016\/J.IMAVIS.2023.104840","volume":"140","author":"H Yao","year":"2023","unstructured":"Yao, H., Wang, L., Cai, C., Sun, Y., Zhang, Z., Luo, Y.: Multi-modal spatial relational attention networks for visual question answering. Image Vis. Comput. 140, 104840 (2023). https:\/\/doi.org\/10.1016\/J.IMAVIS.2023.104840","journal-title":"Image Vis. Comput."},{"key":"3563_CR64","doi-asserted-by":"crossref","unstructured":"Huang, B., Lian, D., Luo, W., Gao, S.: Look before you leap: learning landmark features for one-stage visual grounding. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 16888\u201316897 (2021)","DOI":"10.1109\/CVPR46437.2021.01661"},{"key":"3563_CR65","doi-asserted-by":"publisher","unstructured":"Ye, J., Lin, X., He, L., Li, D., Chen, Q.: One-stage visual grounding via semantic-aware feature filter, pp. 1702\u20131711 (2021). https:\/\/doi.org\/10.1145\/3474085.3475313","DOI":"10.1145\/3474085.3475313"},{"key":"3563_CR66","doi-asserted-by":"publisher","unstructured":"Yang, S., Li, G., Yu, Y.: Relationship-embedded representation learning for grounding referring expressions. IEEE Trans. Pattern Anal. Mach. Intell. 43(8), 2765\u20132779 (2021). https:\/\/doi.org\/10.1109\/TPAMI.2020.2973983","DOI":"10.1109\/TPAMI.2020.2973983"},{"key":"3563_CR67","doi-asserted-by":"crossref","unstructured":"Chen, L., Ma, W., Xiao, J., Zhang, H., Chang, S.-F.: Ref-nms: breaking proposal bottlenecks in two-stage referring expression grounding. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 35, pp. 1036\u20131044 (2021)","DOI":"10.1609\/aaai.v35i2.16188"},{"key":"3563_CR68","doi-asserted-by":"publisher","unstructured":"Hong, R., Liu, D., Mo, X., He, X., Zhang, H.: Learning to compose and reason with language tree structures for visual grounding. IEEE Trans. Pattern Anal. Mach. Intell. 44(2), 684\u2013696 (2022). https:\/\/doi.org\/10.1109\/TPAMI.2019.2911066","DOI":"10.1109\/TPAMI.2019.2911066"},{"key":"3563_CR69","doi-asserted-by":"publisher","unstructured":"Liu, X., Wang, Z., Shao, J., Wang, X., Li, H.: Improving referring expression grounding with cross-modal attention-guided erasing. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019, Long Beach, CA, USA, June 16\u201320, 2019, pp. 1950\u20131959 (2019). https:\/\/doi.org\/10.1109\/CVPR.2019.00205","DOI":"10.1109\/CVPR.2019.00205"},{"key":"3563_CR70","first-page":"19652","volume":"34","author":"M Li","year":"2021","unstructured":"Li, M., Sigal, L.: Referring transformer: a one-step approach to multi-task visual grounding. Adv. Neural. Inf. Process. Syst. 34, 19652\u201319664 (2021)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"3563_CR71","doi-asserted-by":"publisher","unstructured":"Zhu, C., Zhou, Y., Shen, Y., Luo, G., Pan, X., Lin, M., Chen, C., Cao, L., Sun, X., Ji, R.: Seqtr: a simple yet universal network for visual grounding, vol. 13695, pp. 598\u2013615 (2022). https:\/\/doi.org\/10.1007\/978-3-031-19833-5_35","DOI":"10.1007\/978-3-031-19833-5_35"}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-024-03563-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00371-024-03563-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-024-03563-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,3,3]],"date-time":"2025-03-03T11:30:15Z","timestamp":1741001415000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00371-024-03563-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,7,18]]},"references-count":71,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2025,3]]}},"alternative-id":["3563"],"URL":"https:\/\/doi.org\/10.1007\/s00371-024-03563-4","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"value":"0178-2789","type":"print"},{"value":"1432-2315","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,7,18]]},"assertion":[{"value":"28 June 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 July 2024","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no Conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}