{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T01:23:52Z","timestamp":1777512232176,"version":"3.51.4"},"reference-count":62,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2024,12,24]],"date-time":"2024-12-24T00:00:00Z","timestamp":1734998400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,24]],"date-time":"2024-12-24T00:00:00Z","timestamp":1734998400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Multimed Info Retr"],"published-print":{"date-parts":[[2025,3]]},"DOI":"10.1007\/s13735-024-00352-6","type":"journal-article","created":{"date-parts":[[2024,12,24]],"date-time":"2024-12-24T10:15:38Z","timestamp":1735035338000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["CAMIR: fine-tuning CLIP and multi-head cross-attention mechanism for multimodal image retrieval with sketch and text features"],"prefix":"10.1007","volume":"14","author":[{"given":"Fan","family":"Yang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Nor Azman","family":"Ismail","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yee Yong","family":"Pang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Alhuseen Omar","family":"Alsayed","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,12,24]]},"reference":[{"key":"352_CR1","doi-asserted-by":"publisher","first-page":"15377","DOI":"10.1109\/ACCESS.2020.2968154","volume":"8","author":"W Cao","year":"2020","unstructured":"Cao W, Feng W, Lin Q et al (2020) A review of hashing methods for Multimodal Retrieval. IEEE Access 8:15377\u201315391. https:\/\/doi.org\/10.1109\/ACCESS.2020.2968154","journal-title":"IEEE Access"},{"key":"352_CR2","doi-asserted-by":"publisher","first-page":"18798","DOI":"10.1038\/s41598-024-68800-1","volume":"14","author":"E Breznik","year":"2024","unstructured":"Breznik E, Wetzer E, Lindblad J, Sladoje N (2024) Cross-modality sub-image retrieval using contrastive multimodal image representations. Sci Rep 14:18798. https:\/\/doi.org\/10.1038\/s41598-024-68800-1","journal-title":"Sci Rep"},{"key":"352_CR3","doi-asserted-by":"crossref","unstructured":"Ashok Kumar P, Subha Mastan Rao T, Arun Raj L, Pugazhendi E (2021) An efficient text-based image retrieval using natural language processing (NLP) techniques. In: Intelligent system design: Proceedings of intelligent system design: INDIA 2019. Springer, pp 505\u2013519","DOI":"10.1007\/978-981-15-5400-1_52"},{"key":"352_CR4","doi-asserted-by":"crossref","unstructured":"Sangkloy P, Jitkrittum W, Yang D, Hays J (2022) A sketch is Worth a Thousand words. Image Retrieval with Text and Sketch","DOI":"10.1007\/978-3-031-19839-7_15"},{"key":"352_CR5","doi-asserted-by":"publisher","first-page":"2278","DOI":"10.1109\/5.726791","volume":"86","author":"Y LeCun","year":"1998","unstructured":"LeCun Y, Bottou L, Bengio Y, Haffner P (1998) Gradient-based learning applied to document recognition. Proc IEEE 86:2278\u20132324","journal-title":"Proc IEEE"},{"key":"352_CR6","doi-asserted-by":"crossref","unstructured":"Hochreiter S (1997) Long short-term memory. Neural Computation MIT-","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"352_CR7","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3383184","volume":"16","author":"Z Zheng","year":"2020","unstructured":"Zheng Z, Zheng L, Garrett M et al (2020) Dual-path convolutional image-text embeddings with instance loss. ACM Trans Multimedia Comput Commun Appl (TOMM) 16:1\u201323","journal-title":"ACM Trans Multimedia Comput Commun Appl (TOMM)"},{"key":"352_CR8","doi-asserted-by":"crossref","unstructured":"Chen J, Zhuge H (2018) Abstractive text-image summarization using multi-modal attentional hierarchical RNN. In: Proceedings of the 2018 conference on empirical methods in natural language processing. pp 4046\u20134056","DOI":"10.18653\/v1\/D18-1438"},{"key":"352_CR9","unstructured":"Devlin J (2018) Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:181004805"},{"key":"352_CR10","unstructured":"Radford A, Kim JW, Hallacy C et al Learning Transferable Visual Models From Natural Language Supervision"},{"key":"352_CR11","doi-asserted-by":"publisher","first-page":"285","DOI":"10.1109\/TPAMI.2022.3148853","volume":"45","author":"P Xu","year":"2023","unstructured":"Xu P, Hospedales TM, Yin Q et al (2023) Deep learning for free-hand sketch: a Survey. IEEE Trans Pattern Anal Mach Intell 45:285\u2013312. https:\/\/doi.org\/10.1109\/TPAMI.2022.3148853","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"352_CR12","first-page":"344","volume":"7","author":"H Kavitha","year":"2017","unstructured":"Kavitha H, Sudhamani M (2017) Experimental analysis of SIFT and SURF features for multi-object image retrieval. Int J Comput Vis Rob 7:344\u2013356","journal-title":"Int J Comput Vis Rob"},{"key":"352_CR13","doi-asserted-by":"publisher","first-page":"1624","DOI":"10.1109\/TVCG.2010.266","volume":"17","author":"M Eitz","year":"2011","unstructured":"Eitz M, Hildebrand K, Boubekeur T, Alexa M (2011) Sketch-based image Retrieval: Benchmark and Bag-of-features descriptors. IEEE Trans Visual Comput Graphics 17:1624\u20131636. https:\/\/doi.org\/10.1109\/TVCG.2010.266","journal-title":"IEEE Trans Visual Comput Graphics"},{"key":"352_CR14","doi-asserted-by":"publisher","first-page":"73","DOI":"10.1016\/j.patrec.2019.01.006","volume":"130","author":"X Zhang","year":"2020","unstructured":"Zhang X, Huang Y, Zou Q et al (2020) A hybrid convolutional neural network for sketch recognition. Pattern Recognit Lett 130:73\u201382. https:\/\/doi.org\/10.1016\/j.patrec.2019.01.006","journal-title":"Pattern Recognit Lett"},{"key":"352_CR15","doi-asserted-by":"publisher","first-page":"484","DOI":"10.1007\/s11263-020-01382-3","volume":"129","author":"Q Yu","year":"2021","unstructured":"Yu Q, Song J, Song Y-Z et al (2021) Fine-Grained Instance-Level sketch-based image Retrieval. Int J Comput Vis 129:484\u2013500. https:\/\/doi.org\/10.1007\/s11263-020-01382-3","journal-title":"Int J Comput Vis"},{"key":"352_CR16","doi-asserted-by":"publisher","first-page":"108528","DOI":"10.1016\/j.patcog.2022.108528","volume":"126","author":"O Tursun","year":"2022","unstructured":"Tursun O, Denman S, Sridharan S et al (2022) An efficient framework for zero-shot sketch-based image retrieval. Pattern Recogn 126:108528. https:\/\/doi.org\/10.1016\/j.patcog.2022.108528","journal-title":"Pattern Recogn"},{"key":"352_CR17","doi-asserted-by":"publisher","first-page":"67","DOI":"10.1016\/j.imavis.2019.06.010","volume":"89","author":"X Zhang","year":"2019","unstructured":"Zhang X, Li X, Liu Y, Feng F (2019) A survey on freehand sketch recognition and retrieval. Image Vis Comput 89:67\u201387. https:\/\/doi.org\/10.1016\/j.imavis.2019.06.010","journal-title":"Image Vis Comput"},{"key":"352_CR18","doi-asserted-by":"crossref","unstructured":"Changpinyo S, Pont-Tuset J, Ferrari V, Soricut R (2021) Telling the what while pointing to the where: Multimodal queries for image retrieval. In: Proceedings of the IEEE\/CVF international conference on computer vision. pp 12136\u201312146","DOI":"10.1109\/ICCV48922.2021.01192"},{"key":"352_CR19","doi-asserted-by":"crossref","unstructured":"Vo N, Jiang L, Sun C et al (2019) Composing Text and Image for Image Retrieval - an Empirical Odyssey. In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Long Beach, CA, USA, pp 6432\u20136441","DOI":"10.1109\/CVPR.2019.00660"},{"key":"352_CR20","doi-asserted-by":"publisher","first-page":"31","DOI":"10.1007\/s13735-012-0006-4","volume":"1","author":"S Romberg","year":"2012","unstructured":"Romberg S, Lienhart R, H\u00f6rster E (2012) Multimodal image retrieval: fusing modalities with multilayer multimodal PLSA. Int J Multimedia Inform Retr 1:31\u201344","journal-title":"Int J Multimedia Inform Retr"},{"key":"352_CR21","unstructured":"Shen S, Li LH, Tan H et al (2021) How Much Can CLIP Benefit Vision-and-Language Tasks?"},{"key":"352_CR22","doi-asserted-by":"crossref","unstructured":"Seddati O, Dupont S, Mahmoudi S (2017) Quadruplet Networks for Sketch-Based Image Retrieval. In: Proceedings of the 2017 ACM on International Conference on Multimedia Retrieval. ACM, Bucharest Romania, pp 184\u2013191","DOI":"10.1145\/3078971.3078985"},{"key":"352_CR23","doi-asserted-by":"publisher","first-page":"108508","DOI":"10.1016\/j.patcog.2021.108508","volume":"125","author":"X Zhang","year":"2022","unstructured":"Zhang X, Shen M, Li X, Feng F (2022) A deformable CNN-based triplet model for fine-grained sketch-based image retrieval. Pattern Recogn 125:108508. https:\/\/doi.org\/10.1016\/j.patcog.2021.108508","journal-title":"Pattern Recogn"},{"key":"352_CR24","doi-asserted-by":"publisher","first-page":"264","DOI":"10.1109\/LSP.2020.3043972","volume":"28","author":"Z Yang","year":"2021","unstructured":"Yang Z, Zhu X, Qian J, Liu P (2021) Dark-Aware Network for Fine-Grained sketch-based image Retrieval. IEEE Signal Process Lett 28:264\u2013268. https:\/\/doi.org\/10.1109\/LSP.2020.3043972","journal-title":"IEEE Signal Process Lett"},{"key":"352_CR25","doi-asserted-by":"crossref","unstructured":"Zhou G, Ji Z, Chen X, Wang B (2022) StrokeNet: Harmonizing Stoke Domains Between Sketches and Natural Images for Sketch-based Image Retrieval. In: 2022 26th International Conference on Pattern Recognition (ICPR). IEEE, Montreal, QC, Canada, pp 3370\u20133375","DOI":"10.1109\/ICPR56361.2022.9956593"},{"key":"352_CR26","doi-asserted-by":"crossref","unstructured":"Gupta A, Agarwal D, Veenu, Bhatia MPS (2018) Performance Analysis of Content Based Image Retrieval Systems. In: 2018 International Conference on Computing, Power and Communication Technologies (GUCON). IEEE, Greater Noida, Uttar Pradesh, India, pp 899\u2013902","DOI":"10.1109\/GUCON.2018.8675107"},{"key":"352_CR27","unstructured":"Douze M, Guzhva A, Deng C et al (2024) The Faiss library"},{"key":"352_CR28","doi-asserted-by":"publisher","first-page":"2687","DOI":"10.1109\/TCSVT.2021.3080920","volume":"32","author":"SR Dubey","year":"2022","unstructured":"Dubey SR (2022) A Decade Survey of Content Based Image Retrieval using deep learning. IEEE Trans Circuits Syst Video Technol 32:2687\u20132704. https:\/\/doi.org\/10.1109\/TCSVT.2021.3080920","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"352_CR29","doi-asserted-by":"publisher","first-page":"790","DOI":"10.1016\/j.cviu.2013.02.005","volume":"117","author":"R Hu","year":"2013","unstructured":"Hu R, Collomosse J (2013) A performance evaluation of gradient field HOG descriptor for sketch based image retrieval. Comput Vis Image Underst 117:790\u2013806. https:\/\/doi.org\/10.1016\/j.cviu.2013.02.005","journal-title":"Comput Vis Image Underst"},{"key":"352_CR30","doi-asserted-by":"publisher","first-page":"569","DOI":"10.1109\/TPAMI.2014.2345401","volume":"37","author":"M-M Cheng","year":"2015","unstructured":"Cheng M-M, Mitra NJ, Huang X et al (2015) Global contrast based Salient Region detection. IEEE Trans Pattern Anal Mach Intell 37:569\u2013582. https:\/\/doi.org\/10.1109\/TPAMI.2014.2345401","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"352_CR31","doi-asserted-by":"publisher","first-page":"1083","DOI":"10.1007\/s00138-018-0953-8","volume":"29","author":"Y Li","year":"2018","unstructured":"Li Y, Li W (2018) A survey of sketch-based image retrieval. Mach Vis Appl 29:1083\u20131100. https:\/\/doi.org\/10.1007\/s00138-018-0953-8","journal-title":"Mach Vis Appl"},{"key":"352_CR32","doi-asserted-by":"publisher","first-page":"32393","DOI":"10.1109\/ACCESS.2019.2903534","volume":"7","author":"Y Song","year":"2019","unstructured":"Song Y, Lei J, Peng B et al (2019) Edge-guided cross-domain learning with shape regression for sketch-based image Retrieval. IEEE Access 7:32393\u201332399. https:\/\/doi.org\/10.1109\/ACCESS.2019.2903534","journal-title":"IEEE Access"},{"key":"352_CR33","doi-asserted-by":"crossref","unstructured":"Qi Y, Song Y-Z, Zhang H, Liu J (2016) Sketch-based image retrieval via Siamese convolutional neural network. In: 2016 IEEE International Conference on Image Processing (ICIP). IEEE, Phoenix, AZ, USA, pp 2460\u20132464","DOI":"10.1109\/ICIP.2016.7532801"},{"key":"352_CR34","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/2897824.2925954","volume":"35","author":"P Sangkloy","year":"2016","unstructured":"Sangkloy P, Burnell N, Ham C, Hays J (2016) The sketchy database: learning to retrieve badly drawn bunnies. ACM Trans Graph 35:1\u201312. https:\/\/doi.org\/10.1145\/2897824.2925954","journal-title":"ACM Trans Graph"},{"key":"352_CR35","doi-asserted-by":"publisher","first-page":"27","DOI":"10.1016\/j.cviu.2017.06.007","volume":"164","author":"T Bui","year":"2017","unstructured":"Bui T, Ribeiro L, Ponti M, Collomosse J (2017) Compact descriptors for sketch-based image retrieval using a triplet loss convolutional neural network. Comput Vis Image Underst 164:27\u201337. https:\/\/doi.org\/10.1016\/j.cviu.2017.06.007","journal-title":"Comput Vis Image Underst"},{"key":"352_CR36","doi-asserted-by":"crossref","unstructured":"Seddati O, Dupont S, Mahmoudi S, Dutoit T (2022) Towards Human Performance on Sketch-Based Image Retrieval. In: International Conference on Content-based Multimedia Indexing. ACM, Graz Austria, pp 77\u201383","DOI":"10.1145\/3549555.3549582"},{"key":"352_CR37","doi-asserted-by":"crossref","unstructured":"Sain A, Bhunia AK, Chowdhury PN et al (2023) CLIP for All Things Zero-Shot Sketch-Based Image Retrieval, Fine-Grained or Not. In: 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Vancouver, BC, Canada, pp 2765\u20132775","DOI":"10.1109\/CVPR52729.2023.00271"},{"key":"352_CR38","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-023-17675-x","author":"H Zhang","year":"2023","unstructured":"Zhang H, Cheng D, Jiang H et al (2023) Task-like training paradigm in CLIP for zero-shot sketch-based image retrieval. Multimed Tools Appl. https:\/\/doi.org\/10.1007\/s11042-023-17675-x","journal-title":"Multimed Tools Appl"},{"key":"352_CR39","doi-asserted-by":"crossref","unstructured":"Koley S, Bhunia AK, Sain A et al (2024) You\u2019ll never walk alone. A Sketch and Text Duet for Fine-Grained Image Retrieval","DOI":"10.1109\/CVPR52733.2024.01562"},{"key":"352_CR40","doi-asserted-by":"crossref","unstructured":"Chen T, Deng J, Luo J (2020) Adaptive offline quintuplet loss for image-text matching. In: Computer vision\u2013ECCV 2020: 16th european conference, glasgow, UK, august 23\u201328, 2020, proceedings, part XIII 16. Springer, pp 549\u2013565","DOI":"10.1007\/978-3-030-58601-0_33"},{"key":"352_CR41","doi-asserted-by":"publisher","first-page":"111431","DOI":"10.1016\/j.knosys.2024.111431","volume":"287","author":"Z Li","year":"2024","unstructured":"Li Z, Guo C, Wang X et al (2024) Integrating listwise ranking into pairwise-based image-text retrieval. Knowl Based Syst 287:111431. https:\/\/doi.org\/10.1016\/j.knosys.2024.111431","journal-title":"Knowl Based Syst"},{"key":"352_CR42","doi-asserted-by":"crossref","unstructured":"Eisenschtat A, Wolf L (2017) Linking image and text with 2-way nets. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp 4601\u20134611","DOI":"10.1109\/CVPR.2017.201"},{"key":"352_CR43","unstructured":"Jia C, Yang Y, Xia Y et al Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision"},{"key":"352_CR44","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/AIPR60534.2023.10440710.","volume-title":"2023 IEEE Applied Imagery Pattern Recognition Workshop (AIPR)","author":"M Sultan","year":"2023","unstructured":"Sultan M, Jacobs L, Stylianou A, Pless R (2023) Exploring CLIP for real-world, text-based image retrieval. In: 2023 IEEE applied imagery pattern recognition workshop (AIPR). pp 1\u20136. https:\/\/doi.org\/10.1109\/AIPR60534.2023.10440710"},{"key":"352_CR45","doi-asserted-by":"crossref","unstructured":"Patil AP, Benagi A, Rage C et al (2024) CLIP-Based Image Retrieval: A Comparative Study Using CEITM Evaluation. In: 2024 1st International Conference on Communications and Computer Science (InCCCS). IEEE, Bangalore, India, pp 1\u20137","DOI":"10.1109\/InCCCS60947.2024.10593420"},{"key":"352_CR46","doi-asserted-by":"crossref","unstructured":"Hong T, Guo X, Ma J (2022) ITMix: Image-Text Mix Augmentation for Transferring CLIP to Image Classification. In: 2022 16th IEEE International Conference on Signal Processing (ICSP). IEEE, Beijing, China, pp 129\u2013133","DOI":"10.1109\/ICSP56322.2022.9965292"},{"key":"352_CR47","doi-asserted-by":"publisher","DOI":"10.1007\/s13042-024-02321-1","author":"J Li","year":"2024","unstructured":"Li J, Sun S, Zhang K et al (2024) Single-stage zero-shot object detection network based on CLIP and pseudo-labeling. Int J Mach Learn Cyber. https:\/\/doi.org\/10.1007\/s13042-024-02321-1","journal-title":"Int J Mach Learn Cyber"},{"key":"352_CR48","doi-asserted-by":"publisher","first-page":"376","DOI":"10.1016\/j.aej.2024.08.103","volume":"109","author":"F Yan","year":"2024","unstructured":"Yan F, Zhang M, Wei B et al (2024) FMC: Multimodal fake news detection based on multi-granularity feature fusion and contrastive learning. Alexandria Eng J 109:376\u2013393. https:\/\/doi.org\/10.1016\/j.aej.2024.08.103","journal-title":"Alexandria Eng J"},{"key":"352_CR49","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3469877.3493593","volume-title":"ACM Multimedia Asia","author":"A Baldrati","year":"2021","unstructured":"Baldrati A, Bertini M, Uricchio T, Del Bimbo A (2022) Conditioned image retrieval for fashion using contrastive learning and CLIP-based features. In: Proceedings of the 3rd ACM international conference on multimedia in asia. Association for Computing Machinery, New York, NY, USA"},{"key":"352_CR50","doi-asserted-by":"crossref","unstructured":"Baldrati A, Bertini M, Uricchio T, Del Bimbo A (2022) Effective conditioned and composed image retrieval combining CLIP-based features. In: 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, New Orleans, LA, USA, pp 21434\u201321442","DOI":"10.1109\/CVPR52688.2022.02080"},{"key":"352_CR51","doi-asserted-by":"crossref","unstructured":"Zhang J, Xu X, Li R et al (2024) Weakly supervised infrared and visible image fusion based on attention mechanism. In: 2024 36th Chinese Control and Decision Conference (CCDC). IEEE, Xi\u2019an, China, pp 4693\u20134698","DOI":"10.1109\/CCDC62350.2024.10587763"},{"key":"352_CR52","doi-asserted-by":"publisher","unstructured":"Langlois J, Dupuis C, St-Pierre N, Hollis M (2023) Short video recommendation through multimodal feature fusion with attention mechanism. Res Sq. https:\/\/doi.org\/10.21203\/rs.3.rs-3753341\/v1","DOI":"10.21203\/rs.3.rs-3753341\/v1"},{"key":"352_CR53","doi-asserted-by":"publisher","first-page":"199","DOI":"10.3390\/biomimetics8020199","volume":"8","author":"Z Wen","year":"2023","unstructured":"Wen Z, Lin W, Wang T, Xu G (2023) Distract your Attention: Multi-head Cross Attention Network for Facial Expression Recognition. Biomimetics 8:199. https:\/\/doi.org\/10.3390\/biomimetics8020199","journal-title":"Biomimetics"},{"key":"352_CR54","doi-asserted-by":"publisher","first-page":"2069","DOI":"10.3390\/electronics13112069","volume":"13","author":"H Li","year":"2024","unstructured":"Li H, Lu Y, Zhu H (2024) Multi-modal sentiment analysis based on image and text Fusion based on Cross-attention mechanism. Electronics 13:2069. https:\/\/doi.org\/10.3390\/electronics13112069","journal-title":"Electronics"},{"key":"352_CR55","doi-asserted-by":"crossref","unstructured":"Baldrati A, Bertini M, Uricchio T, Del Bimbo A (2022) Conditioned and composed image retrieval combining and partially fine-tuning CLIP-based features. In: 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). IEEE, New Orleans, LA, USA, pp 4955\u20134964","DOI":"10.1109\/CVPRW56347.2022.00543"},{"key":"352_CR56","doi-asserted-by":"publisher","first-page":"85","DOI":"10.3390\/asi4040085","volume":"4","author":"HS Sharaf Al-deen","year":"2021","unstructured":"Sharaf Al-deen HS, Zeng Z, Al-sabri R, Hekmat A (2021) An Improved Model for analyzing textual sentiment based on a deep neural network using multi-head attention mechanism. ASI 4:85. https:\/\/doi.org\/10.3390\/asi4040085","journal-title":"ASI"},{"key":"352_CR57","unstructured":"Loshchilov I, Hutter F, others (2017) Fixing weight decay regularization in adam. arXiv preprint arXiv:171105101 5:"},{"key":"352_CR58","unstructured":"Seddati O, Hubens N, Dupont S, Dutoit T (2023) A recipe for efficient SBIR models. Combining Relative Triplet Loss with Batch Normalization and Knowledge Distillation"},{"key":"352_CR59","doi-asserted-by":"publisher","first-page":"22333","DOI":"10.1007\/s11042-017-4799-2","volume":"76","author":"O Seddati","year":"2017","unstructured":"Seddati O, Dupont S, Mahmoudi S (2017) DeepSketch 3: analyzing deep neural networks features for better sketch recognition and sketch-based image retrieval. Multimed Tools Appl 76:22333\u201322359. https:\/\/doi.org\/10.1007\/s11042-017-4799-2","journal-title":"Multimed Tools Appl"},{"key":"352_CR60","doi-asserted-by":"publisher","first-page":"108291","DOI":"10.1016\/j.patcog.2021.108291","volume":"122","author":"Y Chen","year":"2022","unstructured":"Chen Y, Zhang Z, Wang Y et al (2022) AE-Net: fine-grained sketch-based image retrieval via attention-enhanced network. Pattern Recogn 122:108291. https:\/\/doi.org\/10.1016\/j.patcog.2021.108291","journal-title":"Pattern Recogn"},{"key":"352_CR61","unstructured":"Seddati O, Dupont S, Mahmoudi S, Dutoit T (2022) Transformers and CNNs. both Beat Humans on SBIR"},{"key":"352_CR62","doi-asserted-by":"publisher","first-page":"2370","DOI":"10.1609\/aaai.v36i2.20136","volume":"36","author":"J Tian","year":"2022","unstructured":"Tian J, Xu X, Shen F et al (2022) TVT: three-way vision transformer through multi-modal Hypersphere Learning for zero-shot sketch-based image Retrieval. AAAI 36:2370\u20132378. https:\/\/doi.org\/10.1609\/aaai.v36i2.20136","journal-title":"AAAI"}],"container-title":["International Journal of Multimedia Information Retrieval"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s13735-024-00352-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s13735-024-00352-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s13735-024-00352-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,3,17]],"date-time":"2025-03-17T07:33:09Z","timestamp":1742196789000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s13735-024-00352-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,24]]},"references-count":62,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2025,3]]}},"alternative-id":["352"],"URL":"https:\/\/doi.org\/10.1007\/s13735-024-00352-6","relation":{},"ISSN":["2192-6611","2192-662X"],"issn-type":[{"value":"2192-6611","type":"print"},{"value":"2192-662X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12,24]]},"assertion":[{"value":"20 October 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 November 2024","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 December 2024","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 December 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"2"}}