{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,3]],"date-time":"2026-06-03T18:56:20Z","timestamp":1780512980705,"version":"3.54.1"},"reference-count":46,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2021,10,22]],"date-time":"2021-10-22T00:00:00Z","timestamp":1634860800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,10,22]],"date-time":"2021-10-22T00:00:00Z","timestamp":1634860800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["World Wide Web"],"published-print":{"date-parts":[[2022,7]]},"DOI":"10.1007\/s11280-021-00953-9","type":"journal-article","created":{"date-parts":[[2021,10,22]],"date-time":"2021-10-22T10:06:34Z","timestamp":1634897194000},"page":"1565-1582","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["Relation-aware aggregation network with auxiliary guidance for text-based person search"],"prefix":"10.1007","volume":"25","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0672-3790","authenticated-orcid":false,"given":"Pengpeng","family":"Zeng","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuaiqi","family":"Jing","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jingkuan","family":"Song","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kaixuan","family":"Fan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiangpeng","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Liansuo","family":"We","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuan","family":"Guo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2021,10,22]]},"reference":[{"key":"953_CR1","doi-asserted-by":"crossref","unstructured":"Anderson, P., He, X., Buehler, C., Teney, D., Johnson, M., Gould, S., Zhang, L.: Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering. In: CVPR, pp. 6077\u20136086 (2018)","DOI":"10.1109\/CVPR.2018.00636"},{"key":"953_CR2","doi-asserted-by":"crossref","unstructured":"Chen, D., Li, H., Liu, X., Shen, Y., Shao, J., Yuan, Z., Wang, X.: Improving Deep Visual Representation for Person Re-Identification by Global and Local Image-Language Association. In: ECCV, pp. 56\u201373 (2018)","DOI":"10.1007\/978-3-030-01270-0_4"},{"key":"953_CR3","doi-asserted-by":"crossref","unstructured":"Chen, T., Xu, C., Luo, J.: Improving Text-Based Person Search by Spatial Matching and Adaptive Threshold. In: WACV, pp. 1879\u20131887 (2018)","DOI":"10.1109\/WACV.2018.00208"},{"key":"953_CR4","unstructured":"Frome, A., Corrado, G.S., Shlens, J., Bengio, S., Dean, J., Ranzato, M., Mikolov, T.: Devise: a Deep Visual-Semantic Embedding Model. In: Burges, C.J.C., Bottou, L., Ghahramani, Z., Weinberger, K.Q. (eds.) NIPS, pp. 2121\u20132129 (2013)"},{"key":"953_CR5","doi-asserted-by":"crossref","unstructured":"Gao, L., Zeng, P., Song, J., Li, Y., Liu, W., Mei, T., Shen, H.T.: Structured Two-Stream Attention Network for Video Question Answering. In: AAAI, pp. 6391\u20136398 (2019)","DOI":"10.1609\/aaai.v33i01.33016391"},{"key":"953_CR6","doi-asserted-by":"crossref","unstructured":"Gao, Z., Gao, L.S., Zhang, H., Cheng, Z., Hong, R.: Deep Spatial Pyramid Features Collaborative Reconstruction for Partial Person Reid. In: ACM MM, pp. 1879\u20131887 (2019)","DOI":"10.1145\/3343031.3350861"},{"key":"953_CR7","unstructured":"Gidaris, S., Singh, P., Komodakis, N.: Unsupervised Representation Learning by Predicting Image Rotations. In: ICLR. Openreview.Net (2018)"},{"issue":"2","key":"953_CR8","doi-asserted-by":"publisher","first-page":"735","DOI":"10.1007\/s11280-018-0530-0","volume":"22","author":"Y Guo","year":"2019","unstructured":"Guo, Y., Zhang, J., Gao, L.: Exploiting long-term temporal dynamics for video captioning. World Wide Web 22(2), 735\u2013749 (2019)","journal-title":"World Wide Web"},{"key":"953_CR9","doi-asserted-by":"crossref","unstructured":"Hao, Y., Wang, N., Gao, X., Li, J., Wang, X.: Dual-Alignment Feature Embedding for Cross-Modality Person Re-Identification. In: Amsaleg, L., Huet, B., Larson, M.A., Gravier, G., Hung, H., Ngo, C., Ooi, W.T. (eds.) ACM MM, pp. 57\u201365 (2019)","DOI":"10.1145\/3343031.3351006"},{"key":"953_CR10","doi-asserted-by":"crossref","unstructured":"Jing, Y., Si, C., Wang, J., Wang, W., Wang, L., Tan, T.: Pose-Guided Multi-Granularity Attention Network for Text-Based Person Search. In: AAAI (2020)","DOI":"10.1609\/aaai.v34i07.6777"},{"key":"953_CR11","unstructured":"Kiros, R., Salakhutdinov, R., Zemel, R.S.: Unifying visual-semantic embeddings with multimodal neural language models. arXiv (2014)"},{"issue":"9","key":"953_CR12","doi-asserted-by":"publisher","first-page":"1825","DOI":"10.1109\/TPAMI.2016.2610969","volume":"39","author":"K Li","year":"2017","unstructured":"Li, K., Qi, G., Ye, J., Hua, K.A.: Linear subspace ranking hashing for cross-modal retrieval. IEEE Trans. Pattern Anal. Mach. Intell. 39(9), 1825\u20131838 (2017)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"953_CR13","doi-asserted-by":"crossref","unstructured":"Li, K., Zhang, Y., Li, K., Li, Y., Fu, Y.: Visual Semantic Reasoning for Image-Text Matching. In: ICCV, pp. 4653\u20134661 (2019)","DOI":"10.1109\/ICCV.2019.00475"},{"key":"953_CR14","doi-asserted-by":"crossref","unstructured":"Li, S., Bak, S., Carr, P., Wang, X.: Diversity Regularized Spatiotemporal Attention for Video-Based Person Re-Identification. In: CVPR, pp. 369\u2013378 (2018)","DOI":"10.1109\/CVPR.2018.00046"},{"key":"953_CR15","doi-asserted-by":"crossref","unstructured":"Li, S., Xiao, T., Li, H., Yang, W., Wang, X.: Identity-Aware Textual-Visual Matching with Latent Co-Attention. In: ICCV, pp. 1908\u20131917 (2017)","DOI":"10.1109\/ICCV.2017.209"},{"key":"953_CR16","doi-asserted-by":"crossref","unstructured":"Li, S., Xiao, T., Li, H., Zhou, B., Yue, D., Wang, X.: Person Search with Natural Language Description. In: CVPR, pp. 5187\u20135196 (2017)","DOI":"10.1109\/CVPR.2017.551"},{"issue":"2","key":"953_CR17","doi-asserted-by":"publisher","first-page":"621","DOI":"10.1007\/s11280-018-0531-z","volume":"22","author":"X Li","year":"2019","unstructured":"Li, X., Zhou, Z., Chen, L., Gao, L.: Residual attention-based LSTM for video captioning. World Wide Web 22(2), 621\u2013636 (2019)","journal-title":"World Wide Web"},{"key":"953_CR18","doi-asserted-by":"crossref","unstructured":"Li, Y., Yao, H., Duan, L., Yao, H., Xu, C.: Adaptive Feature Fusion via Graph Neural Network for Person Re-Identification. In: Amsaleg, L., Huet, B., Larson, M.A., Gravier, G., Hung, H., Ngo, C., Ooi, W.T. (eds.) ACM MM, pp. 2115\u20132123 (2019)","DOI":"10.1145\/3343031.3350982"},{"key":"953_CR19","doi-asserted-by":"crossref","unstructured":"Liu, C., Mao, Z., Liu, A., Zhang, T., Wang, B., Zhang, Y.: Focus Your Attention: a Bidirectional Focal Attention Network for Image-Text Matching. In: Amsaleg, L., Huet, B., Larson, M.A., Gravier, G., Hung, H., Ngo, C., Ooi, W.T. (eds.) ACM MM, pp. 3\u201311 (2019)","DOI":"10.1145\/3343031.3350869"},{"key":"953_CR20","doi-asserted-by":"crossref","unstructured":"Liu, J., Zha, Z., Hong, R., Wang, M., Zhang, Y.: Deep Adversarial Graph Attention Convolution Network for Text-Based Person Search. In: Amsaleg, L., Huet, B., Larson, M.A., Gravier, G., Hung, H., Ngo, C., Ooi, W.T. (eds.) ACM MM, pp. 665\u2013673 (2019)","DOI":"10.1145\/3343031.3350991"},{"key":"953_CR21","doi-asserted-by":"crossref","unstructured":"Liu, X., Wang, Z., Shao, J., Wang, X., Li, H.: Improving Referring Expression Grounding with Cross-Modal Attention-Guided Erasing. In: CVPR, pp. 1950\u20131959 (2019)","DOI":"10.1109\/CVPR.2019.00205"},{"issue":"9","key":"953_CR22","doi-asserted-by":"publisher","first-page":"2345","DOI":"10.1109\/TMM.2019.2954741","volume":"22","author":"D Mandal","year":"2020","unstructured":"Mandal, D., Rao, P., Biswas, S.: Semi-supervised cross-modal retrieval with label prediction. IEEE Trans. Multim. 22(9), 2345\u20132353 (2020)","journal-title":"IEEE Trans. Multim."},{"key":"953_CR23","doi-asserted-by":"crossref","unstructured":"McLaughlin, N., Martinez del Rincon, J., Miller, P.: Recurrent Convolutional Network for Video-Based Person Re-Identification. In: CVPR, pp. 1325\u20131334 (2016)","DOI":"10.1109\/CVPR.2016.148"},{"key":"953_CR24","doi-asserted-by":"crossref","unstructured":"Noroozi, M., Favaro, P.: Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzles. In: ECCV, pp. 69\u201384 (2016)","DOI":"10.1007\/978-3-319-46466-4_5"},{"issue":"2","key":"953_CR25","doi-asserted-by":"publisher","first-page":"220","DOI":"10.1109\/TMM.2008.2009679","volume":"11","author":"N O\u2019Hare","year":"2009","unstructured":"O\u2019Hare, N., Smeaton, A.F.: Context-aware person identification in personal photo collections. IEEE Trans. Multim. 11(2), 220\u2013228 (2009)","journal-title":"IEEE Trans. Multim."},{"key":"953_CR26","doi-asserted-by":"crossref","unstructured":"Pathak, D., Kr\u00e4henb\u00fchl, P., Donahue, J., Darrell, T., Efros, A.A.: Context Encoders: Feature Learning by Inpainting. In: CVPR, pp. 2536\u20132544 (2016)","DOI":"10.1109\/CVPR.2016.278"},{"key":"953_CR27","unstructured":"Ren, S., He, K., Girshick, R., Sun, J.: Faster R-Cnn: Towards Real-Time Object Detection with Region Proposal Networks. In: NIPS, pp. 91\u201399 (2015)"},{"key":"953_CR28","doi-asserted-by":"crossref","unstructured":"Sarafianos, N., Xu, X., Kakadiaris, I.A.: Adversarial Representation Learning for Text-To-Image Matching. In: ICCV, pp. 5813\u20135823 (2019)","DOI":"10.1109\/ICCV.2019.00591"},{"key":"953_CR29","doi-asserted-by":"crossref","unstructured":"Song, J., Yang, Y., Song, Y., Xiang, T., Hospedales, T.M.: Generalizable Person Re-Identification by Domain-Invariant Mapping Network. In: CVPR, pp. 719\u2013728 (2019)","DOI":"10.1109\/CVPR.2019.00081"},{"key":"953_CR30","doi-asserted-by":"crossref","unstructured":"Song, J., Zeng, P., Gao, L., Shen, H.T.: From Pixels to Objects: Cubic Visual Attention for Visual Question Answering. In: Lang, J. (ed.) IJCAI, pp. 906\u2013912 (2018)","DOI":"10.24963\/ijcai.2018\/126"},{"issue":"1","key":"953_CR31","doi-asserted-by":"publisher","first-page":"51","DOI":"10.1109\/TMM.2015.2496139","volume":"18","author":"S Sunderrajan","year":"2016","unstructured":"Sunderrajan, S., Manjunath, B.S.: Context-aware hypergraph modeling for re-identification and summarization. IEEE Trans. Multim. 18(1), 51\u201363 (2016)","journal-title":"IEEE Trans. Multim."},{"key":"953_CR32","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, L., Polosukhin, I.: Attention is All You Need. In: Guyon, I., von Luxburg, U., Bengio, S., Wallach, H.M., Fergus, R., Vishwanathan, S.V.N., Garnett, R. (eds.) NeurIPS, pp. 5998\u20136008 (2017)"},{"key":"953_CR33","doi-asserted-by":"crossref","unstructured":"Venugopalan, S., Rohrbach, M., Donahue, J., Mooney, R.J., Darrell, T., Saenko, K.: Sequence to Sequence - Video to Text. In: ICCV, pp. 4534\u20134542 (2015)","DOI":"10.1109\/ICCV.2015.515"},{"key":"953_CR34","doi-asserted-by":"crossref","unstructured":"Wang, H., Zhang, Y., Ji, Z., Pang, Y., Ma, L.: Consensus-Aware Visual-Semantic Embedding for Image-Text Matching. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J. (eds.) ECCV, vol. 12369, pp 18\u201334. Springer (2020)","DOI":"10.1007\/978-3-030-58586-0_2"},{"key":"953_CR35","doi-asserted-by":"crossref","unstructured":"Wang, T., Xu, X., Yang, Y., Hanjalic, A., Shen, H.T., Song, J.: Matching Images and Text with Multi-Modal Tensor Fusion and Re-Ranking. In: Amsaleg, L., Huet, B., Larson, M.A., Gravier, G., Hung, H., Ngo, C., Ooi, W.T. (eds.) ACM MM, pp. 12\u201320 (2019)","DOI":"10.1145\/3343031.3350875"},{"key":"953_CR36","doi-asserted-by":"crossref","unstructured":"Wang, Y., Bo, C., Wang, D., Wang, S., Qi, Y., Lu, H.: Language Person Search with Mutually Connected Classification Loss. In: ICASSP, pp. 2057\u20132061 (2019)","DOI":"10.1109\/ICASSP.2019.8682456"},{"key":"953_CR37","doi-asserted-by":"crossref","unstructured":"Wang, Z., Fang, Z., Wang, J., Yang, Y.: Vitaa: Visual-Textual Attributes Alignment in Person Search by Natural Language. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J. (eds.) ECCV, vol. 12357, pp 402\u2013420 (2020)","DOI":"10.1007\/978-3-030-58610-2_24"},{"issue":"2","key":"953_CR38","doi-asserted-by":"publisher","first-page":"657","DOI":"10.1007\/s11280-018-0541-x","volume":"22","author":"X Xu","year":"2019","unstructured":"Xu, X., He, L., Lu, H., Gao, L., Ji, Y.: Deep adversarial metric learning for cross-modal retrieval. World Wide Web 22(2), 657\u2013672 (2019)","journal-title":"World Wide Web"},{"issue":"7","key":"953_CR39","doi-asserted-by":"publisher","first-page":"1836","DOI":"10.1109\/TMM.2020.2972168","volume":"22","author":"Z Zha","year":"2020","unstructured":"Zha, Z., Liu, J., Chen, D., Wu, F.: Adversarial attribute-text embedding for person search with natural language query. IEEE Trans. Multim. 22 (7), 1836\u20131846 (2020)","journal-title":"IEEE Trans. Multim."},{"key":"953_CR40","doi-asserted-by":"crossref","unstructured":"Zhang, Q., Lei, Z., Zhang, Z., Li, S.Z.: Context-Aware Attention Network for Image-Text Retrieval. In: CVPR, pp. 3533\u20133542. IEEE (2020)","DOI":"10.1109\/CVPR42600.2020.00359"},{"key":"953_CR41","doi-asserted-by":"crossref","unstructured":"Zhang, R., Isola, P., Efros, A.A.: Colorful Image Colorization. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV, pp. 649\u2013666 (2016)","DOI":"10.1007\/978-3-319-46487-9_40"},{"key":"953_CR42","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Lu, H.: Deep Cross-Modal Projection Learning for Image-Text Matching. In: ECCV, pp. 707\u2013723 (2018)","DOI":"10.1007\/978-3-030-01246-5_42"},{"key":"953_CR43","unstructured":"Zheng, Z., Zheng, L., Garrett, M., Yang, Y., Shen, Y.: Dual-path convolutional image-text embedding. arXiv:1711.05535 (2017)"},{"key":"953_CR44","doi-asserted-by":"crossref","unstructured":"Zhou, Z., Huang, Y., Wang, W., Wang, L., Tan, T.: See the Forest for the Trees: Joint Spatial and Temporal Recurrent Neural Networks for Video-Based Person Re-Identification. In: CVPR, pp. 6776\u20136785 (2017)","DOI":"10.1109\/CVPR.2017.717"},{"key":"953_CR45","doi-asserted-by":"crossref","unstructured":"Zhu, F., Zhu, Y., Chang, X., Liang, X.: Vision-Language Navigation with Self-Supervised Auxiliary Reasoning Tasks. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.01003"},{"issue":"2","key":"953_CR46","doi-asserted-by":"publisher","first-page":"825","DOI":"10.1007\/s11280-018-0581-2","volume":"22","author":"F Zou","year":"2019","unstructured":"Zou, F., Bai, X., Luan, C., Li, K., Wang, Y., Ling, H.: Semi-supervised cross-modal learning for cross modal retrieval and image annotation. World Wide Web 22(2), 825\u2013841 (2019)","journal-title":"World Wide Web"}],"container-title":["World Wide Web"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11280-021-00953-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11280-021-00953-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11280-021-00953-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,7,26]],"date-time":"2022-07-26T08:16:22Z","timestamp":1658823382000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11280-021-00953-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,10,22]]},"references-count":46,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2022,7]]}},"alternative-id":["953"],"URL":"https:\/\/doi.org\/10.1007\/s11280-021-00953-9","relation":{},"ISSN":["1386-145X","1573-1413"],"issn-type":[{"value":"1386-145X","type":"print"},{"value":"1573-1413","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,10,22]]},"assertion":[{"value":"26 December 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 June 2021","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 September 2021","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 October 2021","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}