{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,26]],"date-time":"2026-02-26T15:23:04Z","timestamp":1772119384266,"version":"3.50.1"},"reference-count":72,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2024,12,28]],"date-time":"2024-12-28T00:00:00Z","timestamp":1735344000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,28]],"date-time":"2024-12-28T00:00:00Z","timestamp":1735344000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 62306065"],"award-info":[{"award-number":["No. 62306065"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100021171","name":"Basic and Applied Basic Research Foundation of Guangdong Province","doi-asserted-by":"publisher","award":["No. 2023A1515140104"],"award-info":[{"award-number":["No. 2023A1515140104"]}],"id":[{"id":"10.13039\/501100021171","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100022957","name":"Double Thousand Plan of Jiangxi Province","doi-asserted-by":"publisher","award":["JXSQ2019101077"],"award-info":[{"award-number":["JXSQ2019101077"]}],"id":[{"id":"10.13039\/100022957","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2025,2]]},"DOI":"10.1007\/s00530-024-01621-4","type":"journal-article","created":{"date-parts":[[2024,12,28]],"date-time":"2024-12-28T05:28:39Z","timestamp":1735363719000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Chatting with interactive memory for text-based person retrieval"],"prefix":"10.1007","volume":"31","author":[{"given":"Chen","family":"He","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shenshen","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zheng","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hua","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fumin","family":"Shen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xing","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,12,28]]},"reference":[{"key":"1621_CR1","doi-asserted-by":"crossref","unstructured":"Li, S., Xiao, T., Li, H., Zhou, B., Yue, D., Wang, X.: Person search with natural language description. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 5187\u20135196 (2017)","DOI":"10.1109\/CVPR.2017.551"},{"key":"1621_CR2","unstructured":"Ding, Z., Ding, C., Shao, Z., Tao, D.: Semantically self-aligned network for text-to-image part-aware person re-identification. CoRR arXiv:abs\/2107.12666 (2021)"},{"key":"1621_CR3","doi-asserted-by":"crossref","unstructured":"Specker, A., Cormier, M., Beyerer, J.: UPAR: unified pedestrian attribute recognition and person retrieval. In: WACV, pp. 981\u2013990 (2023)","DOI":"10.1109\/WACV56688.2023.00104"},{"key":"1621_CR4","doi-asserted-by":"crossref","unstructured":"Hou, R., Chang, H., Ma, B., Huang, R., Shan, S.: Bicnet-tks: Learning efficient spatial-temporal representation for video person re-identification. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 2014\u20132023 (2021)","DOI":"10.1109\/CVPR46437.2021.00205"},{"key":"1621_CR5","doi-asserted-by":"publisher","first-page":"5542","DOI":"10.1109\/TIP.2020.2984883","volume":"29","author":"K Niu","year":"2020","unstructured":"Niu, K., Huang, Y., Ouyang, W., Wang, L.: Improving description-based person re-identification by multi-granularity image-text alignments. IEEE Trans. Image Process. 29, 5542\u20135556 (2020)","journal-title":"IEEE Trans. Image Process."},{"key":"1621_CR6","doi-asserted-by":"crossref","unstructured":"Jiang, D., Ye, M.: Cross-modal implicit relation reasoning and aligning for text-to-image person retrieval. CoRR arXiv:abs\/2303.12501 (2023)","DOI":"10.1109\/CVPR52729.2023.00273"},{"key":"1621_CR7","unstructured":"Levy, M., Ben-Ari, R., Darshan, N., Lischinski, D.: Chatting makes perfect\u2013chat-based image retrieval. arXiv preprint arXiv:2305.20062 (2023)"},{"key":"1621_CR8","doi-asserted-by":"crossref","unstructured":"Wang, Z., Xu, X., Wei, j., Xie, N., Yang, Y., Shen, H.T.: Semantics disentangling for cross-modal retrieval. IEEE Transactions on image processing, 1\u201312 (2024)","DOI":"10.1109\/TIP.2024.3374111"},{"key":"1621_CR9","doi-asserted-by":"crossref","unstructured":"Wang, Z., Gao, Z., Guo, K., Yang, Y., Wang, X., Shen, H.T.: Multilateral semantic relations modeling for image text retrieval. In: 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2830\u20132839 (2023)","DOI":"10.1109\/CVPR52729.2023.00277"},{"issue":"2","key":"1621_CR10","doi-asserted-by":"publisher","first-page":"657","DOI":"10.1007\/s11280-018-0541-x","volume":"22","author":"X Xu","year":"2019","unstructured":"Xu, X., He, L., Lu, H., Gao, L., Ji, Y.: Deep adversarial metric learning for cross-modal retrieval. World Wide Web 22(2), 657\u2013672 (2019)","journal-title":"World Wide Web"},{"issue":"5","key":"1621_CR11","doi-asserted-by":"publisher","first-page":"2494","DOI":"10.1109\/TIP.2017.2676345","volume":"26","author":"X Xu","year":"2017","unstructured":"Xu, X., Shen, F., Yang, Y., Shen, H.T., Li, X.: Learning discriminative binary codes for large-scale cross-modal retrieval. IEEE Trans. Image Process. 26(5), 2494\u20132507 (2017)","journal-title":"IEEE Trans. Image Process."},{"key":"1621_CR12","unstructured":"Xu, X., Lu, H., Song, J., Yang, Y., Shen, H.T., Li, X.: Ternary adversarial networks with self-supervision for zero-shot cross-modal retrieval. IEEE Trans. Cybern., pp. 1\u201314 (2019)"},{"issue":"12","key":"1621_CR13","doi-asserted-by":"publisher","first-page":"5412","DOI":"10.1109\/TNNLS.2020.2967597","volume":"31","author":"X Xu","year":"2020","unstructured":"Xu, X., Wang, T., Yang, Y., Zuo, L., Shen, F., Shen, H.T.: Cross-modal attention with semantic consistence for image-text matching. IEEE Trans. Neural Netw. Learn. Syst. 31(12), 5412\u20135425 (2020)","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"1621_CR14","doi-asserted-by":"crossref","unstructured":"Niu, K., Huang, Y., Wang, L.: Textual dependency embedding for person search by language. In: Chen, C.W., Cucchiara, R., Hua, X., Qi, G., Ricci, E., Zhang, Z., Zimmermann, R. (eds.) ACM International Conference on Multimedia, pp. 4032\u20134040 (2020)","DOI":"10.1145\/3394171.3413895"},{"key":"1621_CR15","doi-asserted-by":"publisher","first-page":"51","DOI":"10.1145\/3383184","volume":"16","author":"Z Zheng","year":"2020","unstructured":"Zheng, Z., Zheng, L., Garrett, M., Yang, Y., Xu, M., Shen, Y.: Dual-path convolutional image-text embeddings with instance loss. ACM Trans. Multim. Comput. Commun. Appl. 16, 51\u201315123 (2020)","journal-title":"ACM Trans. Multim. Comput. Commun. Appl."},{"key":"1621_CR16","doi-asserted-by":"crossref","unstructured":"Jing, Y., Si, C., Wang, J., Wang, W., Wang, L., Tan, T.: Pose-guided multi-granularity attention network for text-based person search. In: AAAI, pp. 11189\u201311196 (2020)","DOI":"10.1609\/aaai.v34i07.6777"},{"key":"1621_CR17","doi-asserted-by":"crossref","unstructured":"Suo, W., Sun, M., Niu, K., Gao, Y., Wang, P., Zhang, Y., Wu, Q.: A simple and robust correlation filtering method for text-based person search. In: ECCV, pp. 726\u2013742 (2022)","DOI":"10.1007\/978-3-031-19833-5_42"},{"key":"1621_CR18","doi-asserted-by":"crossref","unstructured":"Farooq, A., Awais, M., Kittler, J., Khalid, S.S.: Axm-net: Implicit cross-modal feature alignment for person re-identification. In: AAAI, pp. 4477\u20134485 (2022)","DOI":"10.1609\/aaai.v36i4.20370"},{"key":"1621_CR19","doi-asserted-by":"crossref","unstructured":"Wang, Z., Fang, Z., Wang, J., Yang, Y.: Vitaa: Visual-textual attributes alignment in person search by natural language. In: Computer Vision - ECCV 2020 - 16th European Conference, Glasgow, UK, August 23-28, 2020, Proceedings, Part XII, vol. 12357, pp. 402\u2013420 (2020)","DOI":"10.1007\/978-3-030-58610-2_24"},{"key":"1621_CR20","doi-asserted-by":"crossref","unstructured":"Aggarwal, S., Babu, R.V., Chakraborty, A.: Text-based person search via attribute-aided matching. In: IEEE Winter Conference on Applications of Computer Vision, pp. 2606\u20132614 (2020)","DOI":"10.1109\/WACV45572.2020.9093640"},{"key":"1621_CR21","doi-asserted-by":"publisher","unstructured":"Wang, Z., Gao, Z., Han, M., Yang, Y., Shen, H.T.: Estimating the semantics via sector embedding for image-text retrieval. IEEE Trans. Multimed., pp. 1\u201312 (2024) https:\/\/doi.org\/10.1109\/TMM.2024.3407664","DOI":"10.1109\/TMM.2024.3407664"},{"key":"1621_CR22","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2024.3381347","author":"Z Wang","year":"2024","unstructured":"Wang, Z., Gao, Z., Yang, Y., Wang, G., Jiao, C., Shen, H.T.: Geometric matching for cross-modal retrieval. IEEE Trans. Neural Netw. Learn. Syst. (2024). https:\/\/doi.org\/10.1109\/TNNLS.2024.3381347","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"issue":"4","key":"1621_CR23","doi-asserted-by":"publisher","first-page":"177","DOI":"10.1007\/s00530-024-01372-2","volume":"30","author":"Z Li","year":"2024","unstructured":"Li, Z., Xie, Y.: Bcra: bidirectional cross-modal implicit relation reasoning and aligning for text-to-image person retrieval. Multimedia Syst. 30(4), 177 (2024)","journal-title":"Multimedia Syst."},{"key":"1621_CR24","doi-asserted-by":"publisher","unstructured":"Gao, J., Xu, C.: Fast video moment retrieval. In: 2021 IEEE\/CVF International Conference on Computer Vision, ICCV 2021, Montreal, QC, Canada, October 10-17, 2021, pp. 1503\u20131512. IEEE, ??? (2021). https:\/\/doi.org\/10.1109\/ICCV48922.2021.00155","DOI":"10.1109\/ICCV48922.2021.00155"},{"issue":"3","key":"1621_CR25","doi-asserted-by":"publisher","first-page":"1646","DOI":"10.1109\/TCSVT.2021.3075470","volume":"32","author":"J Gao","year":"2022","unstructured":"Gao, J., Xu, C.: Learning video moment retrieval without a single annotated video. IEEE Trans. Circuits Syst. Video Technol. 32(3), 1646\u20131657 (2022). https:\/\/doi.org\/10.1109\/TCSVT.2021.3075470","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"1621_CR26","doi-asserted-by":"crossref","unstructured":"Wu, Y., Yan, Z., Han, X., Li, G., Zou, C., Cui, S.: Lapscore: Language-guided person search via color reasoning. In: IEEE\/CVF International Conference on Computer Vision, pp. 1604\u20131613 (2021)","DOI":"10.1109\/ICCV48922.2021.00165"},{"key":"1621_CR27","doi-asserted-by":"crossref","unstructured":"Li, S., Xu, X., Shen, F., Yang, Y.: Multi-granularity separation network for text-based person retrieval with bidirectional refinement regularization. In: Proceedings of the 2023 ACM International Conference on Multimedia Retrieval, pp. 307\u2013315 (2023)","DOI":"10.1145\/3591106.3592253"},{"key":"1621_CR28","unstructured":"Yan, S., Dong, N., Zhang, L., Tang, J.: Clip-driven fine-grained text-image person re-identification. CoRR arXiv:abs\/2210.10276 (2022)"},{"key":"1621_CR29","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., Sutskever, I.: Learning transferable visual models from natural language supervision. In: ICML, vol. 139, pp. 8748\u20138763 (2021)"},{"key":"1621_CR30","doi-asserted-by":"crossref","unstructured":"Anderson, P., He, X., Buehler, C., Teney, D., Johnson, M., Gould, S., Zhang, L.: Bottom-up and top-down attention for image captioning and visual question answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 6077\u20136086 (2018)","DOI":"10.1109\/CVPR.2018.00636"},{"key":"1621_CR31","doi-asserted-by":"crossref","unstructured":"Ben-Younes, H., Cadene, R., Cord, M., Thome, N.: Mutan: Multimodal tucker fusion for visual question answering. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2612\u20132620 (2017)","DOI":"10.1109\/ICCV.2017.285"},{"key":"1621_CR32","doi-asserted-by":"crossref","unstructured":"Cai, G., Zhang, J., Jiang, X., Gong, Y., He, L., Yu, F., Peng, P., Guo, X., Huang, F., Sun, X.: Ask &confirm: Active detail enriching for cross-modal retrieval with partial query. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 1835\u20131844 (2021)","DOI":"10.1109\/ICCV48922.2021.00185"},{"issue":"4","key":"1621_CR33","doi-asserted-by":"publisher","first-page":"1654","DOI":"10.1109\/TNNLS.2020.2986029","volume":"32","author":"X Xu","year":"2021","unstructured":"Xu, X., Wang, T., Yang, Y., Hanjalic, A., Shen, H.T.: Radial graph convolutional network for visual question generation. IEEE Trans. Neural Netw. Learn. Syst. 32(4), 1654\u20131667 (2021)","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"1621_CR34","doi-asserted-by":"crossref","unstructured":"Fan, C., Zhang, X., Zhang, S., Wang, W., Zhang, C., Huang, H.: Heterogeneous memory enhanced multimodal attention model for video question answering. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 1999\u20132007 (2019)","DOI":"10.1109\/CVPR.2019.00210"},{"key":"1621_CR35","doi-asserted-by":"crossref","unstructured":"Gao, J., Ge, R., Chen, K., Nevatia, R.: Motion-appearance co-memory networks for video question answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 6576\u20136585 (2018)","DOI":"10.1109\/CVPR.2018.00688"},{"key":"1621_CR36","doi-asserted-by":"crossref","unstructured":"Huang, D., Chen, P., Zeng, R., Du, Q., Tan, M., Gan, C.: Location-aware graph convolutional networks for video question answering. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, pp. 11021\u201311028 (2020)","DOI":"10.1609\/aaai.v34i07.6737"},{"key":"1621_CR37","doi-asserted-by":"crossref","unstructured":"Jang, Y., Song, Y., Yu, Y., Kim, Y., Kim, G.: Tgif-qa: Toward spatio-temporal reasoning in visual question answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2758\u20132766 (2017)","DOI":"10.1109\/CVPR.2017.149"},{"key":"1621_CR38","doi-asserted-by":"crossref","unstructured":"Jiang, J., Chen, Z., Lin, H., Zhao, X., Gao, Y.: Divide and conquer: Question-guided spatio-temporal contextual attention for video question answering. In: Proceedings of the AAAI Conference on Artificial Intelligence, 34, 11101\u201311108 (2020)","DOI":"10.1609\/aaai.v34i07.6766"},{"key":"1621_CR39","doi-asserted-by":"crossref","unstructured":"Jiang, P., Han, Y.: Reasoning with heterogeneous graph alignment for video question answering. In: Proceedings of the AAAI Conference on Artificial Intelligence, 34, 11109\u201311116 (2020)","DOI":"10.1609\/aaai.v34i07.6767"},{"key":"1621_CR40","doi-asserted-by":"crossref","unstructured":"Das, A., Kottur, S., Gupta, K., Singh, A., Yadav, D., Moura, J.M., Parikh, D., Batra, D.: Visual dialog. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 326\u2013335 (2017)","DOI":"10.1109\/CVPR.2017.121"},{"key":"1621_CR41","doi-asserted-by":"crossref","unstructured":"Das, A., Kottur, S., Moura, J.M., Lee, S., Batra, D.: Learning cooperative visual dialog agents with deep reinforcement learning. In: Proceedings of the IEEE International Conference on Computer Vision, 2951\u20132960 (2017)","DOI":"10.1109\/ICCV.2017.321"},{"key":"1621_CR42","unstructured":"Lee, S.-W., Heo, Y.-J., Zhang, B.-T.: Answerer in questioner\u2019s mind: Information theoretic approach to goal-oriented visual dialog. Adv Neural Inf Process Syst 31 (2018)"},{"key":"1621_CR43","unstructured":"Li, J., Li, D., Xiong, C., Hoi, S.: Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In: International Conference on Machine Learning, 12888\u201312900 (2022). PMLR"},{"key":"1621_CR44","doi-asserted-by":"crossref","unstructured":"Parikh, D., Grauman, K.: Relative attributes. In: 2011 International Conference on Computer Vision, 503\u2013510 (2011). IEEE","DOI":"10.1109\/ICCV.2011.6126281"},{"key":"1621_CR45","doi-asserted-by":"crossref","unstructured":"Kovashka, A., Grauman, K.: Attributes for image retrieval. Visual Attributes, 89\u2013117 (2017)","DOI":"10.1007\/978-3-319-50077-5_5"},{"key":"1621_CR46","doi-asserted-by":"crossref","unstructured":"Kovashka, A., Grauman, K.: Attribute pivots for guiding relevance feedback in image search. In: Proceedings of the IEEE International Conference on Computer Vision, 297\u2013304 (2013)","DOI":"10.1109\/ICCV.2013.44"},{"issue":"5","key":"1621_CR47","doi-asserted-by":"publisher","first-page":"644","DOI":"10.1109\/76.718510","volume":"8","author":"Y Rui","year":"1998","unstructured":"Rui, Y., Huang, T.S., Ortega, M., Mehrotra, S.: Relevance feedback: a power tool for interactive content-based image retrieval. IEEE Trans. Circuits Syst. Video Technol. 8(5), 644\u2013655 (1998)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"1621_CR48","doi-asserted-by":"crossref","unstructured":"Kovashka, A., Parikh, D., Grauman, K.: Whittlesearch: Image search with relative attribute feedback. In: 2012 IEEE Conference on Computer Vision and Pattern Recognition, 2973\u20132980 (2012). IEEE","DOI":"10.1109\/CVPR.2012.6248026"},{"key":"1621_CR49","doi-asserted-by":"crossref","unstructured":"Wu, H., Lu, H., Ma, S.: Willhunter: interactive image retrieval with multilevel relevance. In: Proceedings of the 17th International Conference on Pattern Recognition, 2004. ICPR 2004., 2, 1009\u20131012 (2004). IEEE","DOI":"10.1109\/ICPR.2004.1334430"},{"key":"1621_CR50","doi-asserted-by":"crossref","unstructured":"Liang, K., Albanie, S.: Simple baselines for interactive video retrieval with questions and answers. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 11091\u201311101 (2023)","DOI":"10.1109\/ICCV51070.2023.01018"},{"issue":"6","key":"1621_CR51","doi-asserted-by":"publisher","first-page":"3481","DOI":"10.1007\/s00530-023-01143-5","volume":"29","author":"J Loko\u010d","year":"2023","unstructured":"Loko\u010d, J., Andreadis, S., Bailer, W., Duane, A., Gurrin, C., Ma, Z., Messina, N., Nguyen, T.-N., Pe\u0161ka, L., Rossetto, L., et al.: Interactive video retrieval in the age of effective joint embedding deep models: lessons from the 11th vbs. Multimedia Syst. 29(6), 3481\u20133504 (2023)","journal-title":"Multimedia Syst."},{"key":"1621_CR52","unstructured":"Zhu, D., Chen, J., Shen, X., Li, X., Elhoseiny, M.: Minigpt-4: Enhancing vision-language understanding with advanced large language models. CoRR (2023)"},{"key":"1621_CR53","doi-asserted-by":"crossref","unstructured":"Yang, S., Zhou, Y., Wang, Y., Wu, Y., Zhu, L., Zheng, Z.: Towards unified text-based person retrieval: A large-scale multi-attribute and language search benchmark. CoRR arXiv:abs\/2306.02898 (2023)","DOI":"10.1145\/3581783.3611709"},{"key":"1621_CR54","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., Guo, B.: Swin transformer: Hierarchical vision transformer using shifted windows. In: IEEE\/CVF International Conference on Computer Vision, pp. 9992\u201310002 (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"1621_CR55","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, L., Polosukhin, I.: Attention is all you need. In: Advances in Neural Information Processing Systems, pp. 5998\u20136008 (2017)"},{"key":"1621_CR56","doi-asserted-by":"crossref","unstructured":"Zhu, A., Wang, Z., Li, Y., Wan, X., Jin, J., Wang, T., Hu, F., Hua, G.: Dssl: Deep surroundings-person separation learning for text-based person retrieval. In: Proceedings of the 29th ACM International Conference on Multimedia, pp. 209\u2013217 (2021)","DOI":"10.1145\/3474085.3475369"},{"key":"1621_CR57","doi-asserted-by":"crossref","unstructured":"Wang, Z., Zhu, A., Xue, J., Wan, X., Liu, C., Wang, T., Li, Y.: Caibc: Capturing all-round information beyond color for text-based person retrieval. In: ACM International Conference on Multimedia, pp. 5314\u20135322 (2022)","DOI":"10.1145\/3503161.3548057"},{"key":"1621_CR58","doi-asserted-by":"crossref","unstructured":"Wang, Z., Zhu, A., Xue, J., Wan, X., Liu, C., Wang, T., Li, Y.: Look before you leap: Improving text-based person retrieval by learning A consistent cross-modal common manifold. In: The ACM International Conference on Multimedia, pp. 1984\u20131992 (2022)","DOI":"10.1145\/3503161.3548166"},{"key":"1621_CR59","doi-asserted-by":"crossref","unstructured":"Shao, Z., Zhang, X., Fang, M., Lin, Z., Wang, J., Ding, C.: Learning granularity-unified representations for text-to-image person re-identification. In: The ACM International Conference on Multimedia, pp. 5566\u20135574 (2022)","DOI":"10.1145\/3503161.3548028"},{"key":"1621_CR60","doi-asserted-by":"crossref","unstructured":"Shen, F., Shu, X., Du, X., Tang, J.: Pedestrian-specific bipartite-aware similarity learning for text-based person retrieval. In: Proceedings of the 31st ACM International Conference on Multimedia, pp. 8922\u20138931 (2023)","DOI":"10.1145\/3581783.3612009"},{"key":"1621_CR61","doi-asserted-by":"crossref","unstructured":"Yan, S., Dong, N., Liu, J., Zhang, L., Tang, J.: Learning comprehensive representations with richer self for text-to-image person re-identification. In: Proceedings of the 31st ACM International Conference on Multimedia, pp. 6202\u20136211 (2023)","DOI":"10.1145\/3581783.3611832"},{"key":"1621_CR62","doi-asserted-by":"crossref","unstructured":"Shao, Z., Zhang, X., Ding, C., Wang, J., Wang, J.: Unified pre-training with pseudo texts for text-to-image person re-identification. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 11174\u201311184 (2023)","DOI":"10.1109\/ICCV51070.2023.01026"},{"key":"1621_CR63","unstructured":"Wang, G., Yu, F., Li, J., Jia, Q., Ding, S.: Exploiting the textual potential from vision-language pre-training for text-based person search. CoRR arXiv:abs\/2303.04497 (2023)"},{"key":"1621_CR64","doi-asserted-by":"crossref","unstructured":"Fujii, T., Tarashima, S.: Bilma: Bidirectional local-matching for text-based person re-identification. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 2786\u20132790 (2023)","DOI":"10.1109\/ICCVW60793.2023.00295"},{"key":"1621_CR65","doi-asserted-by":"crossref","unstructured":"Li, S., Xu, X., Yang, Y., Shen, F., Mo, Y., Li, Y., Shen, H.T.: DCEL: deep cross-modal evidential learning for text-based person retrieval. In: The ACM International Conference on Multimedia, pp. 6292\u20136300. ACM, ??? (2023)","DOI":"10.1145\/3581783.3612244"},{"key":"1621_CR66","doi-asserted-by":"crossref","unstructured":"Bai, Y., Cao, M., Gao, D., Cao, Z., Chen, C., Fan, Z., Nie, L., Zhang, M.: Rasa: Relation and sensitivity aware representation learning for text-based person search. CoRR arXiv:abs\/2305.13653 (2023)","DOI":"10.24963\/ijcai.2023\/62"},{"key":"1621_CR67","unstructured":"Cao, M., Bai, Y., Zeng, Z., Ye, M., Zhang, M.: An empirical study of CLIP for text-based person search. CoRR arXiv:abs\/2308.10045 (2023)"},{"key":"1621_CR68","doi-asserted-by":"crossref","unstructured":"Li, S., He, C., Xu, X., Shen, F., Yang, Y., Shen, H.T.: Adaptive uncertainty-based learning for text-based person retrieval. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 38, pp. 3172\u20133180 (2024)","DOI":"10.1609\/aaai.v38i4.28101"},{"key":"1621_CR69","unstructured":"Kingma, D.P., Ba, J.: Adam: A method for stochastic optimization. In: ICLR (2015)"},{"key":"1621_CR70","unstructured":"Yan, S., Tang, H., Zhang, L., Tang, J.: Image-specific information suppression and implicit local alignment for text-based person search. CoRR arXiv:abs\/2208.14365 (2022)"},{"key":"1621_CR71","doi-asserted-by":"publisher","unstructured":"Wu, Z., Ma, B., Chang, H., Shan, S.: Refined knowledge transfer for language-based person search. IEEE Transactions on Multimedia, 1\u201315 (2023) https:\/\/doi.org\/10.1109\/TMM.2023.3251104","DOI":"10.1109\/TMM.2023.3251104"},{"key":"1621_CR72","doi-asserted-by":"crossref","unstructured":"Madasu, A., Oliva, J., Bertasius, G.: Learning to retrieve videos by asking questions. In: Proceedings of the 30th ACM International Conference on Multimedia, pp. 356\u2013365 (2022)","DOI":"10.1145\/3503161.3548361"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-024-01621-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-024-01621-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-024-01621-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,28]],"date-time":"2025-02-28T06:03:45Z","timestamp":1740722625000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-024-01621-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,28]]},"references-count":72,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2025,2]]}},"alternative-id":["1621"],"URL":"https:\/\/doi.org\/10.1007\/s00530-024-01621-4","relation":{"has-preprint":[{"id-type":"doi","id":"10.21203\/rs.3.rs-4825548\/v1","asserted-by":"object"}]},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12,28]]},"assertion":[{"value":"30 July 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 December 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 December 2024","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"31"}}