{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,28]],"date-time":"2026-07-28T10:59:09Z","timestamp":1785236349645,"version":"3.55.0"},"reference-count":44,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2024,6,10]],"date-time":"2024-06-10T00:00:00Z","timestamp":1717977600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,6,10]],"date-time":"2024-06-10T00:00:00Z","timestamp":1717977600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2025,2]]},"DOI":"10.1007\/s00371-024-03496-y","type":"journal-article","created":{"date-parts":[[2024,6,10]],"date-time":"2024-06-10T18:01:40Z","timestamp":1718042500000},"page":"1827-1840","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":9,"title":["Multi-label semantic sharing based on graph convolutional network for image-to-text retrieval"],"prefix":"10.1007","volume":"41","author":[{"given":"Ying","family":"Ma","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Meng","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guangyun","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yajun","family":"Sun","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,6,10]]},"reference":[{"issue":"1","key":"3496_CR1","doi-asserted-by":"publisher","first-page":"1339","DOI":"10.1007\/s11042-019-08238-0","volume":"79","author":"D Xia","year":"2020","unstructured":"Xia, D., Miao, L., Fan, A.: A cross- modal multimedia retrieval method using depth correlation mining in big data environment. Multim. Tools Appl. 79(1), 1339\u20131354 (2020)","journal-title":"Multim. Tools Appl."},{"issue":"3","key":"3496_CR2","doi-asserted-by":"publisher","first-page":"1634","DOI":"10.1109\/TCSVT.2021.3075242","volume":"32","author":"XF Dong","year":"2022","unstructured":"Dong, X.F., Liu, L., Zhu, L., et al.: Adversarial graph convolutional network for cross- modal retrieval. IEEE Trans. Circ. Syst Video Technol. 32(3), 1634\u20131645 (2022)","journal-title":"IEEE Trans. Circ. Syst Video Technol."},{"issue":"1","key":"3496_CR3","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3284750","volume":"15","author":"Y Peng","year":"2019","unstructured":"Peng, Y., Qi, J.: CM- GANs: cross- modal generative adversarial networks for common representation learning. ACM Trans. Multim. Comput., Commun. Appl. 15(1), 1\u201324 (2019)","journal-title":"ACM Trans. Multim. Comput., Commun. Appl."},{"issue":"12","key":"3496_CR4","doi-asserted-by":"publisher","first-page":"11588","DOI":"10.1109\/TVT.2018.2890405","volume":"68","author":"F Kou","year":"2019","unstructured":"Kou, F., Du, J., Cui, W., et al.: Common semantic representation method based on object attention and adversarial learning for cross- modal data in IoV. IEEE Trans. Veh. Technol. 68(12), 11588\u201311598 (2019)","journal-title":"IEEE Trans. Veh. Technol."},{"issue":"8","key":"3496_CR5","doi-asserted-by":"publisher","first-page":"4393","DOI":"10.1002\/int.22723","volume":"37","author":"L Shi","year":"2022","unstructured":"Shi, L., Du, J., Cheng, G., et al.: Cross-media search method based on complementary attention and generative adversarial network for social networks. Int. J. Intell. Syst. 37(8), 4393\u20134416 (2022)","journal-title":"Int. J. Intell. Syst."},{"key":"3496_CR6","doi-asserted-by":"publisher","first-page":"148","DOI":"10.1016\/j.neucom.2022.02.007","volume":"483","author":"Z Li","year":"2022","unstructured":"Li, Z., Lu, H., Fu, H., et al.: Image-text bidirectional learning network based cross-modal retrieval. Neurocomputing 483, 148\u2013159 (2022)","journal-title":"Neurocomputing"},{"key":"3496_CR7","doi-asserted-by":"crossref","unstructured":"Cao, Y., Long, M., Wang, J.,et al.: Deep visual-semantic hashing for cross-modal retrieval. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, pp. 1445\u20131454 (2016)","DOI":"10.1145\/2939672.2939812"},{"issue":"5","key":"3496_CR8","doi-asserted-by":"publisher","first-page":"2494","DOI":"10.1109\/TIP.2017.2676345","volume":"26","author":"X Xu","year":"2017","unstructured":"Xu, X., Shen, F., Yang, Y., et al.: Learning discriminative binary codes for large-scale cross-modal retrieval. IEEE Trans. Image Process. 26(5), 2494\u20132507 (2017)","journal-title":"IEEE Trans. Image Process."},{"key":"3496_CR9","doi-asserted-by":"publisher","first-page":"217","DOI":"10.1016\/j.sigpro.2018.09.007","volume":"154","author":"X Lu","year":"2019","unstructured":"Lu, X., Zhu, L., Cheng, Z., et al.: Efficient discrete latent semantic hashing for scalable cross-modal retrieval. Signal Process. 154, 217\u2013231 (2019)","journal-title":"Signal Process."},{"key":"3496_CR10","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3293104","author":"M Meng","year":"2023","unstructured":"Meng, M., Sun, J., Liu, J., et al.: Semantic disentanglement adversarial hashing for cross-modal retrieval. IEEE Trans. Circ. Syst. Video Technol. (2023). https:\/\/doi.org\/10.1109\/TCSVT.2023.3293104","journal-title":"IEEE Trans. Circ. Syst. Video Technol."},{"key":"3496_CR11","doi-asserted-by":"publisher","first-page":"332","DOI":"10.1109\/TIP.2020.3036735","volume":"30","author":"J Lu","year":"2020","unstructured":"Lu, J., Liong, V.E., Tan, Y.P.: Adversarial multi-label variational hashing. IEEE Trans. Image Process. 30, 332\u2013344 (2020)","journal-title":"IEEE Trans. Image Process."},{"key":"3496_CR12","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","volume":"60","author":"DG Lowe","year":"2004","unstructured":"Lowe, D.G.: Distinctive image features from scale-invariant keypoints. Int. J. Comput. Vision 60, 91\u2013110 (2004)","journal-title":"Int. J. Comput. Vision"},{"key":"3496_CR13","doi-asserted-by":"crossref","unstructured":"Gan, C., Yang, T., Gong, B.: Learning attributes equals multi-source domain generalization. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 87\u201397 (2016)","DOI":"10.1109\/CVPR.2016.17"},{"key":"3496_CR14","unstructured":"Wang, D., Gao, X., Wang, X., et al.: Semantic topic multimodal hashing for cross-media retrieval. In: Proceedings of the twenty-fourth international joint conference on artificial intelligence (IJCAI 2015). pp. 3890\u20133896 (2015). https:\/\/www.ijcai.org\/Proceedings\/15\/Papers\/546.pdf"},{"key":"3496_CR15","unstructured":"Jiang, Q.Y., Li, W.J.: Deep cross-modal hashing. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 3232\u20133240"},{"key":"3496_CR16","doi-asserted-by":"crossref","unstructured":"Chen, Z.D., Yu, W.J., Li, C.X. et al.: Dual deep neural networks cross-modal hashing. In: Proceedings of the AAAI Conference on Artificial Intelligence. 2018, 32(1). pp. 274\u2013281. https:\/\/ojs.aaai.org\/index.php\/AAAI\/article\/view\/11249","DOI":"10.1609\/aaai.v32i1.11249"},{"key":"3496_CR17","doi-asserted-by":"publisher","first-page":"3626","DOI":"10.1109\/TIP.2020.2963957","volume":"29","author":"D Xie","year":"2020","unstructured":"Xie, D., Deng, C., Li, C., et al.: Multi-task consistency-preserving adversarial hashing for cross-modal retrieval. IEEE Trans. Image Process. 29, 3626\u20133637 (2020)","journal-title":"IEEE Trans. Image Process."},{"key":"3496_CR18","doi-asserted-by":"crossref","unstructured":"Zhang, X., Lai, H., Feng, J.: Attention- aware deep adversarial hashing for cross-modal retrieval. In: European Conference on Computer Vision. Cham: Springer, pp. 614\u2013629 (2018)","DOI":"10.1007\/978-3-030-01267-0_36"},{"key":"3496_CR19","doi-asserted-by":"publisher","first-page":"255","DOI":"10.1016\/j.neucom.2020.03.019","volume":"400","author":"X Wang","year":"2020","unstructured":"Wang, X., Zou, X., Bakker, E.M., et al.: Self-constraining and attention-based hashing network for bit-scalable crossmodal retrieval. Neurocomputing 400, 255\u2013271 (2020)","journal-title":"Neurocomputing"},{"key":"3496_CR20","unstructured":"Kipf, T N., Welling. M.: Semi-supervised classification with graph convolutional networks. arxiv preprint arxiv:1609.02907 (2016)"},{"key":"3496_CR21","first-page":"982","volume":"2019","author":"R Xu","year":"2019","unstructured":"Xu, R., Li, C., Yan, J., et al.: Graph convolutional network hashing for cross-modal retrieval. IJCAI 2019, 982\u2013988 (2019)","journal-title":"IJCAI"},{"key":"3496_CR22","doi-asserted-by":"crossref","unstructured":"Wang, S., Wang, R., Yao, Z., et al.: Cross-modal scene graph matching for relationship-aware image-text retrieval. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, 1508\u20131517(2020)","DOI":"10.1109\/WACV45572.2020.9093614"},{"key":"3496_CR23","doi-asserted-by":"crossref","unstructured":"Chen, Z M., Wei, X S., Wang, P., et al.: Multi-label image recognition with graph convolutional networks. In: Proceeding of IEEE Conference on Computer Vision Pattern Recognition. pp. 5177\u20135186 (2019)","DOI":"10.1109\/CVPR.2019.00532"},{"key":"3496_CR24","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., et al.: Attention is all you need. In: Advances in Neural Information Processing Systems, 30 (2017)"},{"key":"3496_CR25","unstructured":"Ramesh, A., Dhariwal, P., Nichol, A., et al.: Hierarchical text-conditional image generation with clip latents. 1(2): 3 arxiv preprint arxiv:2204.06125, (2022)"},{"key":"3496_CR26","doi-asserted-by":"crossref","unstructured":"Zhang, R., Guo, Z., Zhang, W., et al.: Pointclip: Ppoint cloud understanding by clip. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition. 8552\u20138562 (2022)","DOI":"10.1109\/CVPR52688.2022.00836"},{"key":"3496_CR27","unstructured":"Fan, L., Krishnan, D., Isola, P., et al.: Improving clip training with language rewrites. In: Advances in Neural Information Processing Systems, 36 (2024)"},{"key":"3496_CR28","unstructured":"Radford, A., Kim, J W., Hallacy, C., et al.: Learning transferable visual models from natural language supervision. In: International Conference on Machine Learning. PMLR, 8748\u20138763 (2021)"},{"key":"3496_CR29","doi-asserted-by":"crossref","unstructured":"Tu, J., Liu. X., Lin. Z., et al.: Differentiable cross-modal hashing via multimodal transformers. In: Proceedings of the 30th ACM International Conference on Multimedia. pp. 453\u2013461 (2022)","DOI":"10.1145\/3503161.3548187"},{"key":"3496_CR30","doi-asserted-by":"crossref","unstructured":"Jiang, D., Ye, M.: Cross-modal implicit relation reasoning and aligning for text-to-image person retrieval. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 2787\u20132797 (2023)","DOI":"10.1109\/CVPR52729.2023.00273"},{"issue":"6","key":"3496_CR31","doi-asserted-by":"publisher","first-page":"84","DOI":"10.1145\/3065386","volume":"60","author":"A Krizhevsky","year":"2017","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: ImageNet classification with deep convolutional neural networks. Commun. ACM 60(6), 84\u201390 (2017)","journal-title":"Commun. ACM"},{"issue":"2","key":"3496_CR32","doi-asserted-by":"publisher","first-page":"301","DOI":"10.1111\/j.1467-9868.2005.00503.x","volume":"67","author":"H Zou","year":"2005","unstructured":"Zou, H., Hastie, T.: Regularization and variable selection via the elastic net. J. R. Stat. Soc. Ser. B Stat Methodol. 67(2), 301\u2013320 (2005)","journal-title":"J. R. Stat. Soc. Ser. B Stat Methodol."},{"key":"3496_CR33","doi-asserted-by":"crossref","unstructured":"Friedman, J., Hastie, T., Tibshirani, R.: Regularization paths for generalized linear models via coordinate descent. J. Stat. Softw. 33(1), 1\u201322 (2010). https:\/\/www.ncbi.nlm.nih.gov\/pmc\/articles\/PMC2929880\/pdf\/nihms201118.pdf","DOI":"10.18637\/jss.v033.i01"},{"key":"3496_CR34","doi-asserted-by":"crossref","unstructured":"Sennrich, R., Haddow, B., Birch, A.: Neural machine translation of rare words with subword units. arxiv preprint arxiv:1508.07909 (2015)","DOI":"10.18653\/v1\/P16-1162"},{"issue":"1","key":"3496_CR35","first-page":"3","volume":"30","author":"AL Maas","year":"2013","unstructured":"Maas, A.L., Hannun, A.Y., Ng, A.Y.: Rectifier nonlinearities improve neural network acoustic models. Proc. icml. 30(1), 3 (2013)","journal-title":"Proc. icml."},{"key":"3496_CR36","unstructured":"Kingma, D P., Ba, J.: Adam: a method for stochastic optimization. arxiv preprint arxiv:1412.6980 (2014)"},{"key":"3496_CR37","doi-asserted-by":"crossref","unstructured":"Huiskes, M J., Lew, M S.: The mir flickr retrieval evaluation. In: Proceedings of the 1st ACM International Conference on Multimedia Information Retrieval. pp. 39-43 (2008)","DOI":"10.1145\/1460096.1460104"},{"key":"3496_CR38","doi-asserted-by":"crossref","unstructured":"Chua, T S., Tang, J., Hong, R., et al.: Nus-wide: a real-world web image database from national university of singapore. In: Proceedings of the ACM International Conference on Image and Video Retrieval. pp. 1\u20139 (2009)","DOI":"10.1145\/1646396.1646452"},{"key":"3496_CR39","doi-asserted-by":"crossref","unstructured":"Lin, T.Y., Maire, M., Belongie, S.: Microsoft coco: common objects in context. Computer Vision-ECCV, et al.: 13th European Conference, Zurich, Switzerland, September 6\u201312, 2014, Proceedings, Part V 13. Springer International Publishing, pp. 740\u2013755 (2014)","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"3496_CR40","doi-asserted-by":"crossref","unstructured":"Cao, Y., Liu, B., Long, M., et al.: Cross-modal hamming hashing. In: Proceedings of the European conference on computer vision (ECCV). pp. 202\u2013218 (2018)","DOI":"10.1007\/978-3-030-01246-5_13"},{"key":"3496_CR41","doi-asserted-by":"crossref","unstructured":"Gu, W., Gu, X., Gu, J., et al.: Adversary guided asymmetric hashing for cross-modal retrieval. In: Proceedings of the 2019 on International Conference on Multimedia Retrieval. pp 159\u2013167 (2019)","DOI":"10.1145\/3323873.3325045"},{"key":"3496_CR42","doi-asserted-by":"crossref","unstructured":"Bai, C., Zeng, C., Ma, Q., et al.: Deep adversarial discrete hashing for cross-modal retrieval. In: Proceedings of the 2020 International Conference on Multimedia Retrieval. pp. 525\u2013531 (2020)","DOI":"10.1145\/3372278.3390711"},{"key":"3496_CR43","doi-asserted-by":"publisher","first-page":"50","DOI":"10.1109\/TMM.2021.3120873","volume":"25","author":"X Lin","year":"2021","unstructured":"Lin, X., Sun, S., Huang, W., et al.: EAPT: efficient attention pyramid transformer for image processing. IEEE Trans. Multimedia 25, 50\u201361 (2021)","journal-title":"IEEE Trans. Multimedia"},{"key":"3496_CR44","doi-asserted-by":"crossref","unstructured":"Pennington, J., Socher, R., Manning, C D.: Glove: global vectors for word representation. In: Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP). pp. 1532\u20131543 (2014)","DOI":"10.3115\/v1\/D14-1162"}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-024-03496-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00371-024-03496-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-024-03496-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,12]],"date-time":"2025-02-12T14:53:04Z","timestamp":1739371984000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00371-024-03496-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,6,10]]},"references-count":44,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2025,2]]}},"alternative-id":["3496"],"URL":"https:\/\/doi.org\/10.1007\/s00371-024-03496-y","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"value":"0178-2789","type":"print"},{"value":"1432-2315","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,6,10]]},"assertion":[{"value":"14 May 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 June 2024","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}