{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,22]],"date-time":"2025-06-22T11:40:03Z","timestamp":1750592403435,"version":"3.41.0"},"reference-count":44,"publisher":"Springer Science and Business Media LLC","issue":"9","license":[{"start":{"date-parts":[[2025,6,22]],"date-time":"2025-06-22T00:00:00Z","timestamp":1750550400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,6,22]],"date-time":"2025-06-22T00:00:00Z","timestamp":1750550400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"The National Social Science Fund of China","award":["19BYY076"],"award-info":[{"award-number":["19BYY076"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Supercomput"],"DOI":"10.1007\/s11227-025-07568-1","type":"journal-article","created":{"date-parts":[[2025,6,22]],"date-time":"2025-06-22T11:16:23Z","timestamp":1750590983000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Text-to-image person retrieval with implicit relation alignment and contrastive learning"],"prefix":"10.1007","volume":"81","author":[{"given":"Xiangyu","family":"Shui","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhenfang","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yun","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hongli","family":"Pei","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kefeng","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Huaxiang","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,6,22]]},"reference":[{"key":"7568_CR1","doi-asserted-by":"crossref","unstructured":"Li S, Xiao T, Li H, Zhou B, Yue D, Wang X (2017) Person search with natural language description. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 1970\u20131979","DOI":"10.1109\/CVPR.2017.551"},{"issue":"2","key":"7568_CR2","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3383184","volume":"16","author":"Z Zheng","year":"2020","unstructured":"Zheng Z, Zheng L, Garrett M, Yang Y, Xu M, Shen Y-D (2020) Dual-path convolutional image-text embeddings with instance loss. ACM Trans Multimedia Comput Commun Appl 16(2):1\u201323","journal-title":"ACM Trans Multimedia Comput Commun Appl"},{"key":"7568_CR3","doi-asserted-by":"publisher","first-page":"4057","DOI":"10.1109\/TIP.2021.3068825","volume":"30","author":"Y Chen","year":"2021","unstructured":"Chen Y, Huang R, Chang H, Tan C, Xue T, Ma B (2021) Cross-modal knowledge adaptation for language-based person search. IEEE Trans Image Process 30:4057\u20134069","journal-title":"IEEE Trans Image Process"},{"key":"7568_CR4","unstructured":"Simonyan K, Zisserman A (2014) Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556"},{"issue":"8","key":"7568_CR5","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"key":"7568_CR6","doi-asserted-by":"crossref","unstructured":"Sarafianos N, Xu X, Kakadiaris IA (2019) Adversarial representation learning for text-to-image matching. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 5814\u20135824","DOI":"10.1109\/ICCV.2019.00591"},{"key":"7568_CR7","doi-asserted-by":"crossref","unstructured":"Zhang Y, Lu H (2018) Deep cross-modal projection learning for image-text matching. In: Proceedings of the European Conference on Computer Vision (ECCV), pp 686\u2013701","DOI":"10.1007\/978-3-030-01246-5_42"},{"key":"7568_CR8","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"7568_CR9","unstructured":"Devlin J, Chang M-W, Lee K, Toutanova K (2018) Bert: pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805"},{"key":"7568_CR10","doi-asserted-by":"publisher","first-page":"171","DOI":"10.1016\/j.neucom.2022.04.081","volume":"494","author":"Y Chen","year":"2022","unstructured":"Chen Y, Zhang G, Lu Y, Wang Z, Zheng Y (2022) Tipcb: a simple but effective part-based convolutional baseline for text-based person search. Neurocomputing 494:171\u2013181","journal-title":"Neurocomputing"},{"key":"7568_CR11","doi-asserted-by":"crossref","unstructured":"Wang Z, Fang Z, Wang J, Yang Y (2020) Vitaa: visual-textual attributes alignment in person search by natural language. In: Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XII 16, pp 402\u2013420. Springer","DOI":"10.1007\/978-3-030-58610-2_24"},{"key":"7568_CR12","doi-asserted-by":"crossref","unstructured":"Wang Z, Zhu A, Xue J, Wan X, Liu C, Wang T, Li Y (2022) Caibc: capturing all-round information beyond color for text-based person retrieval. In: Proceedings of the 30th ACM International Conference on Multimedia, pp 5314\u20135322","DOI":"10.1145\/3503161.3548057"},{"key":"7568_CR13","doi-asserted-by":"crossref","unstructured":"Wu Y, Yan Z, Han X, Li G, Zou C, Cui S (2021) Lapscore: language-guided person search via color reasoning. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 1624\u20131633","DOI":"10.1109\/ICCV48922.2021.00165"},{"key":"7568_CR14","unstructured":"Ding Z, Ding C, Shao Z, Tao D (2021) Semantically self-aligned network for text-to-image part-aware person re-identification. arXiv preprint arXiv:2107.12666"},{"key":"7568_CR15","first-page":"4477","volume":"36","author":"A Farooq","year":"2022","unstructured":"Farooq A, Awais M, Kittler J, Khalid SS (2022) Axm-net: implicit cross-modal feature alignment for person re-identification. Proc AAAI Conf Artif Intell 36:4477\u20134485","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"7568_CR16","doi-asserted-by":"crossref","unstructured":"Shao Z, Zhang X, Fang M, Lin Z, Wang J, Ding C (2022) Learning granularity-unified representations for text-to-image person re-identification. In: Proceedings of the 30th ACM International Conference on Multimedia, pp. 5566\u20135574","DOI":"10.1145\/3503161.3548028"},{"key":"7568_CR17","doi-asserted-by":"crossref","unstructured":"Suo W, Sun M, Niu K, Gao Y, Wang P, Zhang Y, Wu Q (2022) A simple and robust correlation filtering method for text-based person search. In: European Conference on Computer Vision, pp 726\u2013742. Springer","DOI":"10.1007\/978-3-031-19833-5_42"},{"key":"7568_CR18","doi-asserted-by":"crossref","unstructured":"Han X, He S, Zhang L, Xiang T (2021) Text-based person search with limited data. CoRR arXiv:abs\/2110.10807","DOI":"10.5244\/C.35.10"},{"key":"7568_CR19","doi-asserted-by":"crossref","unstructured":"Yan S, Dong N, Zhang L, Tang J (2022) Clip-driven fine-grained text-image person re-identification. arxiv (2022). arXiv preprint arXiv:2210.10276","DOI":"10.1109\/TIP.2023.3327924"},{"key":"7568_CR20","doi-asserted-by":"crossref","unstructured":"Wang B, Yang Y, Xu X, Hanjalic A, Shen HT (2017) Adversarial cross-modal retrieval. In: Proceedings of the 25th ACM International Conference on Multimedia, pp. 154\u2013162","DOI":"10.1145\/3123266.3123326"},{"key":"7568_CR21","unstructured":"Faghri F, Fleet DJ, Kiros JR, Fidler S (2017) Vse++: improving visual-semantic embeddings with hard negatives. arXiv preprint arXiv:1707.05612"},{"key":"7568_CR22","unstructured":"Dutton B (2020) Adversarial canonical correlation analysis. arXiv preprint arXiv:2005.10349"},{"key":"7568_CR23","unstructured":"Kiros R, Salakhutdinov R, Zemel RS (2014) Unifying visual-semantic embeddings with multimodal neural language models. arXiv preprint arXiv:1411.2539"},{"issue":"6","key":"7568_CR24","doi-asserted-by":"publisher","first-page":"84","DOI":"10.1145\/3065386","volume":"60","author":"A Krizhevsky","year":"2017","unstructured":"Krizhevsky A, Sutskever I, Hinton GE (2017) Imagenet classification with deep convolutional neural networks. Commun ACM 60(6):84\u201390","journal-title":"Commun ACM"},{"key":"7568_CR25","doi-asserted-by":"crossref","unstructured":"Ji Z, Wang H, Han J, Pang Y (2019) Saliency-guided attention network for image-sentence matching. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 5754\u20135763","DOI":"10.1109\/ICCV.2019.00585"},{"key":"7568_CR26","doi-asserted-by":"crossref","unstructured":"Lee K-H, Chen X, Hua G, Hu H, He X (2018) Stacked cross attention for image-text matching. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 201\u2013216","DOI":"10.1007\/978-3-030-01225-0_13"},{"key":"7568_CR27","doi-asserted-by":"crossref","unstructured":"Wang Y, Yang H, Qian X, Ma L, Lu J, Li B, Fan X (2019) Position focused attention network for image-text matching. arXiv preprint arXiv:1907.09748","DOI":"10.24963\/ijcai.2019\/526"},{"key":"7568_CR28","doi-asserted-by":"crossref","unstructured":"Liu C, Mao Z, Liu A-A, Zhang T, Wang B, Zhang Y (2019) Focus your attention: a bidirectional focal attention network for image-text matching. In: Proceedings of the 27th ACM International Conference on Multimedia, pp 3\u201311","DOI":"10.1145\/3343031.3350869"},{"key":"7568_CR29","doi-asserted-by":"crossref","unstructured":"Ge X, Chen F, Xu S, Tao F, Jose JM (2023) Cross-modal semantic enhanced interaction for image-sentence retrieval. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp 1022\u20131031","DOI":"10.1109\/WACV56688.2023.00108"},{"key":"7568_CR30","doi-asserted-by":"crossref","unstructured":"Liu C, Mao Z, Zhang T, Xie H, Wang B, Zhang Y (2020) Graph structured network for image-text matching. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 10921\u201310930","DOI":"10.1109\/CVPR42600.2020.01093"},{"key":"7568_CR31","first-page":"7","volume":"2","author":"Z Li","year":"2022","unstructured":"Li Z, Guo C, Feng Z, Hwang J-N, Xue X (2022) Multi-view visual semantic embedding. In: IJCAI 2:7","journal-title":"In: IJCAI"},{"key":"7568_CR32","doi-asserted-by":"crossref","unstructured":"Pan Z, Wu F, Zhang B (2023) Fine-grained image-text matching by cross-modal hard aligning network. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 19275\u201319284","DOI":"10.1109\/CVPR52729.2023.01847"},{"key":"7568_CR33","doi-asserted-by":"publisher","first-page":"21847","DOI":"10.1109\/ACCESS.2020.2969808","volume":"8","author":"Z Li","year":"2020","unstructured":"Li Z, Ling F, Zhang C, Ma H (2020) Combining global and local similarity for cross-media retrieval. IEEE Access 8:21847\u201321856","journal-title":"IEEE Access"},{"key":"7568_CR34","first-page":"1218","volume":"35","author":"H Diao","year":"2021","unstructured":"Diao H, Zhang Y, Ma L, Lu H (2021) Similarity reasoning and filtration for image-text matching. Proc AAAI Conf Artif Intell 35:1218\u20131226","journal-title":"Proc AAAI Conf Artif Intell"},{"issue":"7","key":"7568_CR35","doi-asserted-by":"publisher","first-page":"2866","DOI":"10.1109\/TCSVT.2020.3030656","volume":"31","author":"K Wen","year":"2020","unstructured":"Wen K, Gu X, Cheng Q (2020) Learning dual semantic relations with graph attention for image-text matching. IEEE Trans Circuits Syst Video Technol 31(7):2866\u20132879","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"issue":"2","key":"7568_CR36","doi-asserted-by":"publisher","first-page":"581","DOI":"10.1007\/s11263-023-01891-x","volume":"132","author":"P Gao","year":"2024","unstructured":"Gao P, Geng S, Zhang R, Ma T, Fang R, Zhang Y, Li H, Qiao Y (2024) Clip-adapter: better vision-language models with feature adapters. Int J Comput Vis 132(2):581\u2013595","journal-title":"Int J Comput Vis"},{"key":"7568_CR37","unstructured":"Wang Q, Chen W-j, Li B, Su J, Wang G, Song Q (2025) Heclip: histology-enhanced contrastive learning for imputation of transcriptomics profiles. arXiv preprint arXiv:2501.14948"},{"key":"7568_CR38","unstructured":"Nie Y, He W, Han K, Tang Y, Guo T, Du F, Wang Y (2023) Lightclip: learning multi-level interaction for lightweight vision-language models. arXiv preprint arXiv:2312.00674"},{"key":"7568_CR39","doi-asserted-by":"crossref","unstructured":"Jiang D, Ye M (2023) Cross-modal implicit relation reasoning and aligning for text-to-image person retrieval. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2787\u20132797","DOI":"10.1109\/CVPR52729.2023.00273"},{"key":"7568_CR40","doi-asserted-by":"crossref","unstructured":"Shu X, Wen W, Wu H, Chen K, Song Y, Qiao R, Ren B, Wang X (2022) See finer, see more: implicit modality alignment for text-based person retrieval. In: European Conference on Computer Vision, pp. 624\u2013641. Springer","DOI":"10.1007\/978-3-031-25072-9_42"},{"key":"7568_CR41","doi-asserted-by":"crossref","unstructured":"Zhu A, Wang Z, Li Y, Wan X, Jin J, Wang T, Hu F, Hua G (2021) Dssl: deep surroundings-person separation learning for text-based person retrieval. In: Proceedings of the 29th ACM International Conference on Multimedia, pp. 209\u2013217","DOI":"10.1145\/3474085.3475369"},{"key":"7568_CR42","doi-asserted-by":"crossref","unstructured":"Wang Z, Zhu A, Xue J, Wan X, Liu C, Wang T, Li Y (2022) Look before you leap: improving text-based person retrieval by learning a consistent cross-modal common manifold. In: Proceedings of the 30th ACM International Conference on Multimedia, pp. 1984\u20131992","DOI":"10.1145\/3503161.3548166"},{"key":"7568_CR43","doi-asserted-by":"crossref","unstructured":"Li S, Cao M, Zhang M (2022) Learning semantic-aligned feature representation for text-based person search. In: ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 2724\u20132728. IEEE","DOI":"10.1109\/ICASSP43922.2022.9746846"},{"key":"7568_CR44","doi-asserted-by":"crossref","unstructured":"Yan S, Tang H, Zhang L, Tang J (2023) Image-specific information suppression and implicit local alignment for text-based person search. IEEE Transactions on Neural Networks and Learning Systems","DOI":"10.1109\/TNNLS.2023.3310118"}],"container-title":["The Journal of Supercomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-025-07568-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11227-025-07568-1\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-025-07568-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,22]],"date-time":"2025-06-22T11:16:32Z","timestamp":1750590992000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11227-025-07568-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,22]]},"references-count":44,"journal-issue":{"issue":"9","published-online":{"date-parts":[[2025,6]]}},"alternative-id":["7568"],"URL":"https:\/\/doi.org\/10.1007\/s11227-025-07568-1","relation":{},"ISSN":["1573-0484"],"issn-type":[{"value":"1573-0484","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,6,22]]},"assertion":[{"value":"10 June 2025","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 June 2025","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"1068"}}