{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T09:05:11Z","timestamp":1784279111446,"version":"3.55.0"},"reference-count":55,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.patcog.2026.113792","type":"journal-article","created":{"date-parts":[[2026,4,20]],"date-time":"2026-04-20T16:03:03Z","timestamp":1776700983000},"page":"113792","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PC","title":["Smart brain localization retrieval network based on linkage of localization refinement and dynamic planning"],"prefix":"10.1016","volume":"179","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5013-9161","authenticated-orcid":false,"given":"Shengwei","family":"Wang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Keda","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Pengjiao","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yize","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Aobo","family":"Guo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113792_bib0001","series-title":"2025 8th InternationalConference on Information and Computer Technologies (ICICT)","first-page":"186","article-title":"Multimodal retrieval and fusion framework (MRaFF)","author":"Yohannes","year":"2025"},{"key":"10.1016\/j.patcog.2026.113792_bib0002","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"25357","article-title":"URaG: unified retrieval and generationin multimodal LLMs for efficient long document understanding","volume":"40","author":"Shi","year":"2026"},{"key":"10.1016\/j.patcog.2026.113792_bib0003","series-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence","article-title":"Principled multimodal representation learning","author":"Liu","year":"2026"},{"key":"10.1016\/j.patcog.2026.113792_bib0004","doi-asserted-by":"crossref","DOI":"10.1016\/j.jbi.2026.105017","article-title":"Retrieval-augmented in-context learning for multimodal large language models in disease classification","author":"Zhan","year":"2026","journal-title":"J. Biomed. Inf."},{"key":"10.1016\/j.patcog.2026.113792_bib0005","article-title":"Rac3: retrieval-augmented corner case comprehension for autonomous driving with vision-language models","author":"Wang","year":"2026","journal-title":"IEEE Trans. Multimed."},{"issue":"1","key":"10.1016\/j.patcog.2026.113792_bib0006","first-page":"932","article-title":"Improving multimodal social media popularity prediction via selective retrieval knowledge augmentation","volume":"39","author":"Xu","year":"2025","journal-title":"Proc. AAAI Conf. Artif. Intell."},{"issue":"1","key":"10.1016\/j.patcog.2026.113792_bib0007","article-title":"Advanced Deep Learning Frameworks for cross-modal information retrieval: a comprehensive review of techniques, challenges, and future directions","volume":"16","author":"Khan","year":"2026","journal-title":"Wiley Interdiscip. Rev.: Data Min. Knowl. Discov."},{"key":"10.1016\/j.patcog.2026.113792_bib0008","article-title":"Cross-modal retrieval: a systematic review of methods and future directions","author":"Wang","year":"2025","journal-title":"Proc. IEEE"},{"key":"10.1016\/j.patcog.2026.113792_bib0009","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111085","article-title":"Global-aware fragment representation aggregation Network for image\u2013text retrieval","volume":"159","author":"Wang","year":"2025","journal-title":"Pattern. Recognit."},{"key":"10.1016\/j.patcog.2026.113792_bib0010","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111099","article-title":"Text\u2013video retrieval re-ranking via multi-grained cross attention and frozen image encoders","volume":"159","author":"Dai","year":"2025","journal-title":"Pattern. Recognit."},{"issue":"2","key":"10.1016\/j.patcog.2026.113792_bib0011","doi-asserted-by":"crossref","first-page":"423","DOI":"10.1109\/TPAMI.2018.2798607","article-title":"Multimodal machine learning: a survey and taxonomy","volume":"41","author":"Baltru\u0161aitis","year":"2018","journal-title":"IEEe Trans. Pattern. Anal. Mach. Intell."},{"issue":"1","key":"10.1016\/j.patcog.2026.113792_bib0012","doi-asserted-by":"crossref","first-page":"28","DOI":"10.1016\/j.inffus.2011.08.001","article-title":"Multisensor data fusion: a review of the state-of-the-art","volume":"14","author":"Khaleghi","year":"2013","journal-title":"Inform. Fus."},{"issue":"2","key":"10.1016\/j.patcog.2026.113792_bib0013","doi-asserted-by":"crossref","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","article-title":"Distinctive image features from scale-invariant keypoints","volume":"60","author":"Lowe","year":"2004","journal-title":"Int. J. Comput. Vis."},{"issue":"3","key":"10.1016\/j.patcog.2026.113792_bib0014","doi-asserted-by":"crossref","first-page":"145","DOI":"10.1023\/A:1011139631724","article-title":"Modeling the shape of the scene: a holistic representation of the spatial envelope","volume":"42","author":"Oliva","year":"2001","journal-title":"Int. J. Com-puter Vis."},{"key":"10.1016\/j.patcog.2026.113792_bib0015","first-page":"993","article-title":"Latent dirichlet allocation","volume":"3","author":"Blei","year":"2003","journal-title":"J. Mach. Learn. Res."},{"key":"10.1016\/j.patcog.2026.113792_bib0016","series-title":"Advances in Neural Information Processing Systems","first-page":"1607","article-title":"Replicated softmax: an undirected topic model","author":"Hinton","year":"2009"},{"issue":"8","key":"10.1016\/j.patcog.2026.113792_bib0017","doi-asserted-by":"crossref","first-page":"649","DOI":"10.14778\/2732296.2732301","article-title":"Effective multi-modal retrieval based on stacked auto-encoders","volume":"7","author":"Wang","year":"2014","journal-title":"Proc. VLDB Endow."},{"key":"10.1016\/j.patcog.2026.113792_bib0018","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2022.109176","article-title":"Scalable semantic-enhanced supervised hashing for cross-modal retrieval","volume":"251","author":"Yang","year":"2022","journal-title":"Knowl. Based. Syst."},{"issue":"01","key":"10.1016\/j.patcog.2026.113792_bib0019","first-page":"4400","article-title":"Ranking-based deep cross-modal hashing","volume":"33","author":"Liu","year":"2019","journal-title":"Proc. AAAI Conf. Artif. Intell."},{"key":"10.1016\/j.patcog.2026.113792_bib0020","series-title":"ACM SIGIR International Conference on Research and Development in Information Retrieval","first-page":"395","article-title":"Discriminative coupled dictionary hashing for fast cross-media retrieval","author":"Yu","year":"2014"},{"key":"10.1016\/j.patcog.2026.113792_bib0021","doi-asserted-by":"crossref","first-page":"2226","DOI":"10.1109\/TIP.2024.3374111","article-title":"Semantics disentangling for cross-modal retrieval","volume":"33","author":"Wang","year":"2024","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113792_bib0022","series-title":"A Cross Language Information Retrieval Model Based On Latent Semantic Analysis, Intelligent Computing Technology and Automation","first-page":"1082","author":"Li","year":"2024"},{"key":"10.1016\/j.patcog.2026.113792_bib0023","series-title":"IEEE Transactions on Image Processing","first-page":"617","article-title":"Deep relation embedding for cross-modal retrieval","volume":"30","author":"Zhang","year":"2021"},{"key":"10.1016\/j.patcog.2026.113792_bib0024","series-title":"Proceedings of the 45th international ACM SIGIR conference on research and development in information retrieval","first-page":"949","article-title":"Cret: cross-modal retrieval transformer for efficient text-video retrieval","author":"Ji","year":"2022"},{"key":"10.1016\/j.patcog.2026.113792_bib0025","doi-asserted-by":"crossref","unstructured":"M. Ding, Y. Ma, P. Qin, J. Wu, Y. Li, L. Nie, RA-BLIP: multimodal adaptive retrieval-augmented bootstrapping language-image pre-training, 2024, arXiv preprint arXiv:2410.14154.","DOI":"10.1109\/TMM.2025.3599070"},{"key":"10.1016\/j.patcog.2026.113792_bib0026","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2024.102247","article-title":"Deep learning and multi-modal fusion for real-time multi-object tracking: algorithms, challenges, datasets, and comparative study","volume":"105","author":"Wang","year":"2024","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.patcog.2026.113792_bib0027","series-title":"Proceedings of the 2018 world wide web conference","first-page":"689","article-title":"Variational autoencoders for collaborative filtering","author":"Liang","year":"2018"},{"key":"10.1016\/j.patcog.2026.113792_bib0028","article-title":"Multi-agent actor-critic for mixed cooperative-competitive environments","volume":"30","author":"Lowe","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"3","key":"10.1016\/j.patcog.2026.113792_bib0029","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3446374","article-title":"Generative adversarial networks (GANs) challenges, solutions, and future directions","volume":"54","author":"Saxena","year":"2021","journal-title":"ACM Comput. Surv. (CSUR)"},{"issue":"77","key":"10.1016\/j.patcog.2026.113792_bib0030","doi-asserted-by":"crossref","first-page":"eadc8892","DOI":"10.1126\/scirobotics.adc8892","article-title":"Robust flight navigation out of distribution with liquid neural networks","volume":"8","author":"Chahine","year":"2023","journal-title":"Sci. Robot."},{"key":"10.1016\/j.patcog.2026.113792_bib0031","series-title":"2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"10938","article-title":"Multi-modality cross attention network for image and sentence matching","author":"Wei","year":"2020"},{"issue":"10","key":"10.1016\/j.patcog.2026.113792_bib0032","doi-asserted-by":"crossref","first-page":"2315","DOI":"10.1109\/TIT.2004.834737","article-title":"Sparse-graph codes for quantum error correction","volume":"50","author":"MacKay","year":"2004","journal-title":"IEEE Trans. Inf. Theory"},{"key":"10.1016\/j.patcog.2026.113792_bib0033","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110573","article-title":"UVMO: deep unsupervised visual reconstruction-based multimodal-assisted odometry","volume":"153","author":"Han","year":"2024","journal-title":"Pattern. Recognit."},{"key":"10.1016\/j.patcog.2026.113792_bib0034","series-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence","first-page":"423","article-title":"Multimodal machine learning: a survey and taxonomy","volume":"41","author":"Baltru\u0161aitis","year":"2019"},{"issue":"4","key":"10.1016\/j.patcog.2026.113792_bib0035","doi-asserted-by":"crossref","first-page":"247","DOI":"10.1155\/S102602260000056X","article-title":"Theory of adaptive adjustment","volume":"5","author":"Huang","year":"2000","journal-title":"Discrete Dyn. Nat. Soc."},{"key":"10.1016\/j.patcog.2026.113792_bib0036","series-title":"IEEE Transactions on Neural Networks and Learning Systems","first-page":"14247","article-title":"BCAN: bidirectional correct attention network for cross-modal retrieval","volume":"35","author":"Liu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113792_bib0037","unstructured":"V. Mnih, K. Kavukcuoglu, D. Silver, A. Graves, I. Antonoglou, D. Wierstra, M. Riedmiller, Playing atari with deep reinforcement learning, 2013, arXiv preprint arXiv:1312.5602."},{"key":"10.1016\/j.patcog.2026.113792_bib0038","unstructured":"M. Khodak, M. Balcan, A. Talwalkar, Adaptive gradient-based meta-learning methods, 2019, arXiv preprint arXiv:1906.02717."},{"key":"10.1016\/j.patcog.2026.113792_bib0039","series-title":"Proceedings of 2nd International Conference SafeChania","article-title":"Unsupervised classification of urban sound spaces from objective acoustic characteristics","author":"Zervas","year":"2015"},{"key":"10.1016\/j.patcog.2026.113792_bib0040","series-title":"European conference on information retrieval, Berlin, Heidelberg: Springer Berlin Heidelberg","first-page":"345","article-title":"A probabilistic interpretation of precision, recall and F-score, with implication for evaluation","author":"Goutte","year":"2005"},{"key":"10.1016\/j.patcog.2026.113792_bib0041","series-title":"Proceedings of the 22nd ACM international conference on Multimedia","first-page":"7","article-title":"Cross-modal retrieval with correspondence autoencoder","author":"Feng","year":"2014"},{"key":"10.1016\/j.patcog.2026.113792_bib0042","series-title":"IEEE Transactions on Multimedia","first-page":"1363","article-title":"Cross-modal retrieval via deep and bidirectional representation learning","volume":"18","author":"He","year":"2016"},{"key":"10.1016\/j.patcog.2026.113792_bib0043","series-title":"ACM MM","first-page":"1047","article-title":"Contextaware multi-view summarization network for image-text matching","author":"Qu","year":"2020"},{"key":"10.1016\/j.patcog.2026.113792_bib0044","series-title":"IEEE Transactions on Multimedia","first-page":"4480","article-title":"Deep cross-modal retrieval between spatial image and acoustic speech","volume":"26","author":"Qian","year":"2024"},{"key":"10.1016\/j.patcog.2026.113792_bib0045","series-title":"Proc. ACM Int. Conf. Multimedia","first-page":"154","article-title":"Adversarial cross-modal retrieval","author":"Wang","year":"2017"},{"key":"10.1016\/j.patcog.2026.113792_bib0046","series-title":"Proc. Int. Conf. Comput. Vis. Pattern Recognit","first-page":"10394","article-title":"Deep supervised cross-modal retrieval","author":"Zhen","year":"2019"},{"key":"10.1016\/j.patcog.2026.113792_bib0047","series-title":"IEEE Transactions on Multimedia","first-page":"1338","article-title":"Frame-wise cross-modal matching for video moment retrieval","volume":"24","author":"Tang","year":"2022"},{"key":"10.1016\/j.patcog.2026.113792_bib0048","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"334","article-title":"Language-driven temporal activity localization: a semantic matching reinforcement learning model","author":"Wang","year":"2019"},{"key":"10.1016\/j.patcog.2026.113792_bib0049","series-title":"AAAI","first-page":"12168","article-title":"Temporally grounding language queries in videos by contextual boundary-aware prediction","author":"Wang","year":"2020"},{"key":"10.1016\/j.patcog.2026.113792_bib0050","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, Workshop","article-title":"Tripping through time: efficient localization of activities in videos","author":"Hahn","year":"2019"},{"key":"10.1016\/j.patcog.2026.113792_bib0051","doi-asserted-by":"crossref","first-page":"2226","DOI":"10.1109\/TIP.2024.3374111","article-title":"Semantics disentangling for cross-modal retrieval","volume":"33","author":"Wang","year":"2024","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113792_bib0052","series-title":"Internvideo2: scaling foundation models for multimodal video understanding, European Conference on Computer Vision","first-page":"396","author":"Wang","year":"2024"},{"key":"10.1016\/j.patcog.2026.113792_bib0053","series-title":"Proceedings of the 2024 International Conference on Multimedia Retrieval","first-page":"211","article-title":"Anchor-aware deep metric learning for audio-visual retrieval","author":"Zeng","year":"2024"},{"issue":"1","key":"10.1016\/j.patcog.2026.113792_bib0054","doi-asserted-by":"crossref","first-page":"20","DOI":"10.1038\/s43586-021-00018-1","article-title":"CLIP and complementary methods","volume":"1","author":"Hafner","year":"2021","journal-title":"Nat. Rev. Methods Primers"},{"key":"10.1016\/j.patcog.2026.113792_bib0055","first-page":"12888","article-title":"Blip: bootstrapping language-image pre-training for unified vision-language understanding and generation, international conference on machine learning","author":"Li","year":"2022","journal-title":"PMLR"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326007570?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326007570?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T08:26:31Z","timestamp":1784276791000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326007570"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":55,"alternative-id":["S0031320326007570"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113792","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Smart brain localization retrieval network based on linkage of localization refinement and dynamic planning","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113792","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"113792"}}