{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T15:46:07Z","timestamp":1776786367369,"version":"3.51.2"},"reference-count":79,"publisher":"Springer Science and Business Media LLC","issue":"24","license":[{"start":{"date-parts":[[2020,10,30]],"date-time":"2020-10-30T00:00:00Z","timestamp":1604016000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,10,30]],"date-time":"2020-10-30T00:00:00Z","timestamp":1604016000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2022,10]]},"DOI":"10.1007\/s11042-020-09983-3","type":"journal-article","created":{"date-parts":[[2020,10,30]],"date-time":"2020-10-30T20:02:46Z","timestamp":1604088166000},"page":"34213-34243","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":9,"title":["CAESAR: concept augmentation based semantic representation for cross-modal retrieval"],"prefix":"10.1007","volume":"81","author":[{"given":"Lei","family":"Zhu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiayu","family":"Song","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiangxiang","family":"Wei","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Yu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jun","family":"Long","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,10,30]]},"reference":[{"key":"9983_CR1","unstructured":"Andrew G, Arora R, Bilmes J, Livescu K (2013) Deep canonical correlation analysis. In: ICML"},{"issue":"6","key":"9983_CR2","doi-asserted-by":"publisher","first-page":"345","DOI":"10.1007\/s00530-010-0182-0","volume":"16","author":"PK Atrey","year":"2010","unstructured":"Atrey PK, Hossain MA, Saddik AE, Kankanhalli MS (2010) Multimodal fusion for multimedia analysis: a survey. Multimedia Systems 16(6):345\u2013379","journal-title":"Multimedia Systems"},{"key":"9983_CR3","doi-asserted-by":"crossref","unstructured":"Ballan L, Uricchio T, Seidenari L, Del Bimbo A (2014) A cross-media model for automatic image annotation. In: Proceedings of international conference on multimedia retrieval, ACM, p 73","DOI":"10.1145\/2578726.2578728"},{"issue":"2","key":"9983_CR4","doi-asserted-by":"publisher","first-page":"423","DOI":"10.1109\/TPAMI.2018.2798607","volume":"41","author":"T Baltru\u0161aitis","year":"2018","unstructured":"Baltru\u0161aitis T, Ahuja C, Morency L-P (2018) Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell 41(2):423\u2013443","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"9983_CR5","doi-asserted-by":"crossref","unstructured":"Blei DM, Jordan MI (2003) Modeling annotated data. In: Proceedings of the 26th annual international ACM SIGIR conference on Research and development in information retrieval, ACM, pp 127\u2013134","DOI":"10.1145\/860435.860460"},{"key":"9983_CR6","first-page":"993","volume":"3","author":"DM Blei","year":"2003","unstructured":"Blei DM, Ng AY, Jordan MI, Lafferty J (2003) Latent dirichlet allocation. J Mach Learn Res 3:993\u20131022","journal-title":"J Mach Learn Res"},{"key":"9983_CR7","doi-asserted-by":"crossref","unstructured":"Bottou L (2010) Large-scale machine learning with stochastic gradient descent. In: Proceedings of COMPSTAT\u20192010, Springer, pp 177\u2013186","DOI":"10.1007\/978-3-7908-2604-3_16"},{"key":"9983_CR8","doi-asserted-by":"crossref","unstructured":"Bottou L (2012) Stochastic gradient descent tricks. In: Neural networks: tricks of the trade, Springer, pp 421\u2013436","DOI":"10.1007\/978-3-642-35289-8_25"},{"issue":"9","key":"9983_CR9","doi-asserted-by":"publisher","first-page":"2542","DOI":"10.1109\/TCYB.2017.2742705","volume":"48","author":"G Cao","year":"2017","unstructured":"Cao G, Iosifidis A, Chen K, Gabbouj M (2017) Generalized multi-view embedding for visual recognition and cross-modal retrieval. IEEE Transactions on Cybernetics 48(9):2542\u20132555","journal-title":"IEEE Transactions on Cybernetics"},{"key":"9983_CR10","doi-asserted-by":"crossref","unstructured":"Chua T-S, Tang J, Hong R, Li H, Luo Z, Zheng Y (2009) Nus-wide: a real-world web image database from national university of singapore. In: Proceedings of the ACM international conference on image and video retrieval, ACM, p 48","DOI":"10.1145\/1646396.1646452"},{"issue":"8","key":"9983_CR11","doi-asserted-by":"publisher","first-page":"3893","DOI":"10.1109\/TIP.2018.2821921","volume":"27","author":"C Deng","year":"2018","unstructured":"Deng C, Chen Z, Liu X, Gao X, Tao D (2018) Triplet-based deep hashing network for cross-modal retrieval. IEEE Trans Image Process 27(8):3893\u20133903","journal-title":"IEEE Trans Image Process"},{"key":"9983_CR12","unstructured":"Donahue J, Jia Y, Vinyals O, Hoffman J, Zhang N, Tzeng E, Darrell T (2014) Decaf: a deep convolutional activation feature for generic visual recognition. In: International conference on machine learning, pp 647\u2013655"},{"key":"9983_CR13","unstructured":"DPLSNTMCM C, Cadene R (2018) Cross-modal retrieval in the cooking context: learning semantic text-image embeddings. In: ACM SIGIR"},{"issue":"2","key":"9983_CR14","doi-asserted-by":"publisher","first-page":"303","DOI":"10.1007\/s11263-009-0275-4","volume":"88","author":"M Everingham","year":"2010","unstructured":"Everingham M, Van Gool L, Williams CK, Winn J, Zisserman A (2010) The pascal visual object classes(voc) challenge. Int J Comput Vis 88(2):303\u2013338","journal-title":"Int J Comput Vis"},{"key":"9983_CR15","doi-asserted-by":"crossref","unstructured":"Feng F, Wang X, Li R (2014) Cross-modal retrieval with correspondence autoencoder. In: Proceedings of the 22nd ACM international conference on Multimedia, ACM, pp 7\u201316","DOI":"10.1145\/2647868.2654902"},{"key":"9983_CR16","unstructured":"Fu R, Li B, Gao Y, Wang P (2016) Content-based image retrieval based on cnn and svm. In: 2016 2nd IEEE international conference on computer and communications (ICCC), IEEE, pp 638\u2013642"},{"issue":"2","key":"9983_CR17","doi-asserted-by":"publisher","first-page":"210","DOI":"10.1007\/s11263-013-0658-4","volume":"106","author":"Y Gong","year":"2012","unstructured":"Gong Y, Ke Q, Isard M, Lazebnik S (2012) A multi-view embedding space for modeling internet images, tags, and their semantics. Int J Comput Vis 106(2):210\u2013233","journal-title":"Int J Comput Vis"},{"key":"9983_CR18","doi-asserted-by":"crossref","unstructured":"Gordo A, Almaz\u00e1n J, Revaud J, Larlus D (2016) Deep image retrieval: Learning global representations for image search. In: European conference on computer vision, Springer, pp 241\u2013257","DOI":"10.1007\/978-3-319-46466-4_15"},{"key":"9983_CR19","doi-asserted-by":"crossref","unstructured":"Gu J, Cai J, Joty SR, Niu L, Wang G (2018) Look, imagine and match: improving textual-visual cross-modal retrieval with generative models. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 7181\u20137189","DOI":"10.1109\/CVPR.2018.00750"},{"issue":"12","key":"9983_CR20","doi-asserted-by":"publisher","first-page":"2639","DOI":"10.1162\/0899766042321814","volume":"16","author":"DR Hardoon","year":"2004","unstructured":"Hardoon DR, Szedmak S, Shawe-Taylor J (2004) Canonical correlation analysis: an overview with application to learning methods. Neural Comput 16 (12):2639\u20132664","journal-title":"Neural Comput"},{"key":"9983_CR21","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"9983_CR22","doi-asserted-by":"crossref","unstructured":"He L, Xu X, Lu H, Yang Y, Shen F, Shen HT (2017) Unsupervised cross-modal retrieval through adversarial learning. In: 2017 IEEE International conference on multimedia and expo (ICME), IEEE, pp 1153\u20131158","DOI":"10.1109\/ICME.2017.8019549"},{"key":"9983_CR23","doi-asserted-by":"crossref","unstructured":"He X, Peng Y, Xie L (2019) A new benchmark and approach for fine-grained cross-media retrieval. In: Proceedings of the 27th ACM international conference on multimedia, ACM, pp 1740\u2013 1748","DOI":"10.1145\/3343031.3350974"},{"key":"9983_CR24","doi-asserted-by":"crossref","unstructured":"Herbrich R (2000) Large margin rank boundaries for ordinal regression. Advances in Large Margin Classifiers 115\u2013132","DOI":"10.7551\/mitpress\/1113.003.0010"},{"key":"9983_CR25","unstructured":"Hinton GE, Srivastava N, Krizhevsky A, Sutskever I, Salakhutdinov RR Improving neural networks by preventing co-adaptation of feature detectors. arXiv:1207.0580"},{"key":"9983_CR26","doi-asserted-by":"crossref","unstructured":"Hotelling H Relations between two sets of variates, vol 28","DOI":"10.2307\/2333955"},{"issue":"2","key":"9983_CR27","doi-asserted-by":"publisher","first-page":"134","DOI":"10.1007\/s11263-011-0494-3","volume":"100","author":"SJ Hwang","year":"2012","unstructured":"Hwang SJ, Grauman K (2012) Learning the relative importance of objects from tagged images for retrieval and cross-modal search. Int J Comput Vis 100 (2):134\u2013153","journal-title":"Int J Comput Vis"},{"key":"9983_CR28","doi-asserted-by":"crossref","unstructured":"Joachims T (2002) Optimizing search engines using clickthrough data. In: Proceedings of the eighth ACM SIGKDD international conference on knowledge discovery and data mining, ACM, pp 133\u2013 142","DOI":"10.1145\/775047.775067"},{"key":"9983_CR29","unstructured":"Krizhevsky A, Sutskever I, Hinton GE (2012) Imagenet classification with deep convolutional neural networks. In: Advances in neural information processing systems, pp 1097\u20131105"},{"issue":"11","key":"9983_CR30","doi-asserted-by":"publisher","first-page":"2278","DOI":"10.1109\/5.726791","volume":"86","author":"Y LeCun","year":"1998","unstructured":"LeCun Y, Bottou L, Bengio Y, Haffner P, et al (1998) Gradient-based learning applied to document recognition. Proc IEEE 86(11):2278\u20132324","journal-title":"Proc IEEE"},{"issue":"1","key":"9983_CR31","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/1126004.1126005","volume":"2","author":"MS Lew","year":"2006","unstructured":"Lew M S, Sebe N, Djeraba C, Jain R (2006) Content-based multimedia information retrieval: state of the art and challenges. ACM Trans Multimed Comput Commun Appl(TOMM) 2(1):1\u201319","journal-title":"ACM Trans Multimed Comput Commun Appl(TOMM)"},{"key":"9983_CR32","doi-asserted-by":"crossref","unstructured":"Li C-X, Chen Z-D, Zhang P-F, Luo X, Nie L, Zhang W, Xu X-S (2018) Scratch: a scalable discrete matrix factorization hashing for cross-modal retrieval. In: 2018 ACM multimedia conference on multimedia conference, ACM, pp 1\u20139","DOI":"10.1145\/3240508.3240547"},{"issue":"12","key":"9983_CR33","doi-asserted-by":"publisher","first-page":"5706","DOI":"10.1109\/TIP.2017.2736343","volume":"26","author":"P Liu","year":"2017","unstructured":"Liu P, Guo J-M, Wu C-Y, Cai D (2017) Fusion of deep learning and compressed domain features for content-based image retrieval. IEEE Trans Image Process 26(12):5706\u20135717","journal-title":"IEEE Trans Image Process"},{"issue":"2","key":"9983_CR34","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","volume":"60","author":"DG Lowe","year":"2004","unstructured":"Lowe DG (2004) Distinctive image features from scale-invariant keypoints. Int J Comput Vis 60(2):91\u2013110","journal-title":"Int J Comput Vis"},{"key":"9983_CR35","doi-asserted-by":"crossref","unstructured":"Messina A, Montagnuolo M (2009) A generalised cross-modal clustering method applied to multimedia news semantic indexing and retrieval. In: Proceedings of the 18th international conference on world wide web, ACM, pp 321\u2013330","DOI":"10.1145\/1526709.1526753"},{"key":"9983_CR36","volume-title":"Multivariate analysis","author":"N Martin","year":"1979","unstructured":"Martin N, Maes H (1979) Multivariate analysis. Academic Press, London"},{"key":"9983_CR37","doi-asserted-by":"crossref","unstructured":"Matsuo S, Yanai K (2016) Cnn-based style vector for style image retrieval. In: Proceedings of the 2016 ACM on international conference on multimedia retrieval, ACM, pp 309\u2013312","DOI":"10.1145\/2911996.2912057"},{"issue":"1","key":"9983_CR38","first-page":"135","volume":"4","author":"RJ Muirhead","year":"1986","unstructured":"Muirhead RJ, Anderson TW (1986) An introduction to multivariate statistical analysis. J Bus Econ Stat 4(1):135","journal-title":"J Bus Econ Stat"},{"key":"9983_CR39","unstructured":"Ngiam J, Khosla A, Kim M, Nam J, Lee H, Ng AY (2011) Multimodal deep learning. In: Proceedings of the 28th international conference on machine learning (ICML-11), pp 689\u2013696"},{"key":"9983_CR40","doi-asserted-by":"crossref","unstructured":"Pei-Xia S, Hui-Ting L, Tao L (2016) Learning discriminative cnn features and similarity metrics for image retrieval. In: 2016 IEEE International conference on signal processing, communications and computing (ICSPCC), IEEE, pp 1\u20135","DOI":"10.1109\/ICSPCC.2016.7753634"},{"issue":"1","key":"9983_CR41","first-page":"22","volume":"15","author":"Y Peng","year":"2019","unstructured":"Peng Y, Qi J (2019) Cm-gans: cross-modal generative adversarial networks for common representation learning. ACM Trans Multimed Comput Commun Appl (TOMM) 15(1):22","journal-title":"ACM Trans Multimed Comput Commun Appl (TOMM)"},{"issue":"9","key":"9983_CR42","doi-asserted-by":"publisher","first-page":"2372","DOI":"10.1109\/TCSVT.2017.2705068","volume":"28","author":"Y Peng","year":"2017","unstructured":"Peng Y, Huang X, Zhao Y (2017) An overview of cross-media retrieval: concepts, methodologies, benchmarks, and challenges. IEEE Transactions on Circuits and Systems for Video Technology 28(9):2372\u20132385","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"issue":"11","key":"9983_CR43","doi-asserted-by":"publisher","first-page":"5585","DOI":"10.1109\/TIP.2018.2852503","volume":"27","author":"Y Peng","year":"2018","unstructured":"Peng Y, Qi J, Yuan Y (2018) Modality-specific cross-modal similarity measurement with recurrent attention network. IEEE Trans Image Process 27(11):5585\u20135599","journal-title":"IEEE Trans Image Process"},{"key":"9983_CR44","doi-asserted-by":"crossref","unstructured":"Pennington J, Socher R, Manning C (2014) Glove: global vectors for word representation. In: Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP), pp 1532\u20131543","DOI":"10.3115\/v1\/D14-1162"},{"issue":"3","key":"9983_CR45","doi-asserted-by":"publisher","first-page":"521","DOI":"10.1109\/TPAMI.2013.142","volume":"36","author":"JC Pereira","year":"2013","unstructured":"Pereira JC, Coviello E, Doyle G, Rasiwasia N, Lanckriet G R, Levy R, Vasconcelos N (2013) On the role of correlation and abstraction in cross-modal multimedia retrieval. IEEE Trans Pattern Anal Mach Intell 36(3):521\u2013535","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"9983_CR46","doi-asserted-by":"crossref","unstructured":"Ranjan V, Rasiwasia N, Jawahar CV (2015) Multi-label cross-modal retrieval. In: International conference on computer vision(ICCV 2015)","DOI":"10.1109\/ICCV.2015.466"},{"key":"9983_CR47","unstructured":"Rashtchian C, Young P, Hodosh M, Hockenmaier J (2010) Collecting image annotations using amazon\u2019s mechanical turk. In: Proceedings of the NAACL HLT 2010 workshop on creating speech and language data with Amazon\u2019s mechanical turk, Association for Computational Linguistics, pp 139\u2013147"},{"key":"9983_CR48","doi-asserted-by":"crossref","unstructured":"Rasiwasia N, Pereira JC, Coviello E, Doyle G, Lanckriet GRG, Levy R, Vasconcelos N (2010) A new approach to cross-modal multimedia retrieval","DOI":"10.1145\/1873951.1873987"},{"key":"9983_CR49","doi-asserted-by":"crossref","unstructured":"Seddati O, Dupont S, Mahmoudi S, Parian M (2017) Towards good practices for image retrieval based on CNN features. In: Proceedings of the IEEE international conference on computer vision workshops, pp 1246\u20131255","DOI":"10.1109\/ICCVW.2017.150"},{"key":"9983_CR50","unstructured":"Sermanet P, Eigen D, Zhang X, Mathieu M, Fergus R, LeCun Y Overfeat: integrated recognition, localization and detection using convolutional networks. arXiv:1312.6229"},{"key":"9983_CR51","doi-asserted-by":"crossref","unstructured":"Sharif Razavian A, Azizpour H, Sullivan J, Carlsson S (2014) Cnn features off-the-shelf: an astounding baseline for recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition workshops, pp 806\u2013813","DOI":"10.1109\/CVPRW.2014.131"},{"key":"9983_CR52","doi-asserted-by":"crossref","unstructured":"Shen Y, Liu L, Shao L, Song J (2017) Deep binaries: Encoding semantic-rich cues for efficient textual-visual cross retrieval. In: Proceedings of the IEEE international conference on computer vision, pp 4097\u20134106","DOI":"10.1109\/ICCV.2017.441"},{"key":"9983_CR53","unstructured":"Simonyan K, Zisserman A Very deep convolutional networks for large-scale image recognition. arXiv:1409.1556"},{"key":"9983_CR54","doi-asserted-by":"crossref","unstructured":"Sivic J, Zisserman A (2003) Video google: a text retrieval approach to object matching in videos. In: Null, IEEE, p 1470","DOI":"10.1109\/ICCV.2003.1238663"},{"key":"9983_CR55","doi-asserted-by":"crossref","unstructured":"Szegedy C, Liu W, Jia Y, Sermanet P, Reed S, Anguelov D, Erhan D, Vanhoucke V, Rabinovich A (2015) Going deeper with convolutions. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1\u20139","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"9983_CR56","doi-asserted-by":"crossref","unstructured":"Thompson B (2005) Canonical correlation analysis, encyclopedia of statistics in behavioral science. Wiley Online Library","DOI":"10.1002\/0470013192.bsa068"},{"key":"9983_CR57","doi-asserted-by":"crossref","unstructured":"Van Ginneken B, Setio AA, Jacobs C, Ciompi F (2015) Off-the-shelf convolutional neural network features for pulmonary nodule detection in computed tomography scans. In: 2015 IEEE 12th international symposium on biomedical imaging (ISBI), IEEE, pp 286\u2013289","DOI":"10.1109\/ISBI.2015.7163869"},{"key":"9983_CR58","unstructured":"Virtanen S, Jia Y, Klami A, Darrell T Factorized multi-modal topic model. arXiv:1210.4920"},{"key":"9983_CR59","doi-asserted-by":"crossref","unstructured":"Wan J, Wang D, Hoi S C H, Wu P, Zhu J, Zhang Y, Li J (2014) Deep learning for content-based image retrieval: a comprehensive study. In: Proceedings of the 22nd ACM international conference on multimedia, ACM, pp 157\u2013166","DOI":"10.1145\/2647868.2654948"},{"issue":"7","key":"9983_CR60","doi-asserted-by":"publisher","first-page":"1454","DOI":"10.1109\/TMM.2017.2663324","volume":"19","author":"S Wang","year":"2017","unstructured":"Wang S, Guo W (2017) Sparse multigraph embedding for multimodal feature representation. IEEE Trans Multimed 19(7):1454\u20131466","journal-title":"IEEE Trans Multimed"},{"key":"9983_CR61","doi-asserted-by":"crossref","unstructured":"Wang C, Yang H, Meinel C (2015) Deep semantic mapping for cross-modal retrieval. In: 2015 IEEE 27th international conference on tools with artificial intelligence (ICTAI), IEEE, pp 234\u2013241","DOI":"10.1109\/ICTAI.2015.45"},{"issue":"C","key":"9983_CR62","first-page":"425","volume":"171","author":"S Wang","year":"2015","unstructured":"Wang S, Lu J, Gu X, Weyori BA, Yang JY (2015) Unsupervised discriminant canonical correlation analysis based on spectral clustering. Neurocomputing 171(C):425\u2013433","journal-title":"Neurocomputing"},{"key":"9983_CR63","unstructured":"Wang K, Yin Q, Wang W, Wu S, Wang LA comprehensive survey on cross-modal retrieval. arXiv:1607.06215"},{"key":"9983_CR64","doi-asserted-by":"crossref","unstructured":"Wang B, Yang Y, Xu X, Hanjalic A, Shen HT (2017) Adversarial cross-modal retrieval. In: Proceedings of the 25th ACM international conference on multimedia, ACM, pp 154\u2013162","DOI":"10.1145\/3123266.3123326"},{"issue":"2","key":"9983_CR65","first-page":"449","volume":"47","author":"Y Wei","year":"2016","unstructured":"Wei Y, Zhao Y, Lu C, Wei S, Liu L, Zhu Z, Yan S (2016) Cross-modal retrieval with cnn visual features: a new baseline. IEEE Transactions on Cybernetics 47(2):449\u2013460","journal-title":"IEEE Transactions on Cybernetics"},{"issue":"4","key":"9983_CR66","doi-asserted-by":"publisher","first-page":"1602","DOI":"10.1109\/TIP.2018.2878970","volume":"28","author":"L Wu","year":"2018","unstructured":"Wu L, Wang Y, Shao L (2018) Cycle-consistent deep generative hashing for cross-modal retrieval. IEEE Trans Image Process 28(4):1602\u20131612","journal-title":"IEEE Trans Image Process"},{"key":"9983_CR67","doi-asserted-by":"crossref","unstructured":"Yakhnenko O, Honavar V (2009) Multi-modal hierarchical dirichlet process model for predicting image annotation and image-object label correspondence. In: Proceedings of the 2009 SIAM international conference on data mining, SIAM, pp 283\u2013293","DOI":"10.1137\/1.9781611972795.25"},{"issue":"8","key":"9983_CR68","doi-asserted-by":"publisher","first-page":"2927","DOI":"10.1016\/j.patcog.2010.02.015","volume":"43","author":"Y Yang","year":"2010","unstructured":"Yang Y, Wu F, Xu D, Zhuang Y, Chia L-T (2010) Cross-media retrieval using query dependent search methods. Pattern Recogn 43(8):2927\u20132936","journal-title":"Pattern Recogn"},{"key":"9983_CR69","doi-asserted-by":"crossref","unstructured":"Yang E, Deng C, Liu W, Liu X, Tao D, Gao X (2017) Pairwise relationship guided deep hashing for cross-modal retrieval. In: Thirty-first AAAI conference on artificial intelligence","DOI":"10.1609\/aaai.v31i1.10719"},{"key":"9983_CR70","doi-asserted-by":"crossref","unstructured":"Yang X, Ramesh P, Chitta R, Madhvanath S, Bernal EA, Luo J (2017) Deep multimodal representation learning from temporal data. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 5447\u20135455","DOI":"10.1109\/CVPR.2017.538"},{"issue":"11","key":"9983_CR71","doi-asserted-by":"publisher","first-page":"5288","DOI":"10.1109\/TIP.2018.2845136","volume":"27","author":"J Yang","year":"2018","unstructured":"Yang J, Liang J, Shen H, Wang K, Rosin PL, Yang M-H (2018) Dynamic match kernel with deep convolutional features for image retrieval. IEEE Trans Image Process 27(11):5288\u20135302","journal-title":"IEEE Trans Image Process"},{"key":"9983_CR72","unstructured":"Yu J, Cong Y, Qin Z, Wan T (2012) Cross-modal topic correlations for multimedia retrieval. In: Proceedings of the 21st international conference on pattern recognition (ICPR2012), IEEE, pp 246\u2013249"},{"key":"9983_CR73","doi-asserted-by":"crossref","unstructured":"Yu J, Lu Y, Qin Z, Zhang W, Liu Y, Tan J, Guo L (2018) Modeling text with graph convolutional network for cross-modal information retrieval. In: Pacific rim conference on multimedia, Springer, pp 223\u2013234","DOI":"10.1007\/978-3-030-00776-8_21"},{"key":"9983_CR74","doi-asserted-by":"crossref","unstructured":"Zhai X, Peng Y, Xiao J (2012) Cross-modality correlation propagation for cross-media retrieval. In: 2012 IEEE international conference on acoustics, speech and signal processing (ICASSP), IEEE, pp 2337\u20132340","DOI":"10.1109\/ICASSP.2012.6288383"},{"issue":"07","key":"9983_CR75","first-page":"1463","volume":"52","author":"B Zhang","year":"2015","unstructured":"Zhang B, Hao J, Ma G, Yue J, Zhang J, Shi Z (2015) Mixture of probabilistic canonical correlation analysis. Journal of Computer Research and Development 52(07):1463\u20131476","journal-title":"Journal of Computer Research and Development"},{"issue":"21","key":"9983_CR76","doi-asserted-by":"publisher","first-page":"30839","DOI":"10.1007\/s11042-018-6750-6","volume":"78","author":"C Zhang","year":"2019","unstructured":"Zhang C, Lin Y, Zhu L, Zhang Z, Tang Y, Huang F (2019) Efficient region of visual interests search for geo-multimedia data. Multimedia Tools and Applications 78(21):30839\u201330863","journal-title":"Multimedia Tools and Applications"},{"key":"9983_CR77","doi-asserted-by":"crossref","unstructured":"Zhen L, Hu P, Wang X, Peng D (2019) Deep supervised cross-modal retrieval. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 10394\u201310403","DOI":"10.1109\/CVPR.2019.01064"},{"key":"9983_CR78","doi-asserted-by":"publisher","first-page":"180571","DOI":"10.1109\/ACCESS.2019.2940055","volume":"7","author":"L Zhu","year":"2019","unstructured":"Zhu L, Long J, Zhang C, Yu W, Yuan X, Sun L (2019) An efficient approach for geo-multimedia cross-modal retrieval. IEEE Access 7:180571\u2013180589","journal-title":"IEEE Access"},{"key":"9983_CR79","doi-asserted-by":"publisher","first-page":"263","DOI":"10.1016\/j.neucom.2016.01.053","volume":"191","author":"C Zu","year":"2016","unstructured":"Zu C, Zhang D (2016) Canonical sparse cross-view correlation analysis. Neurocomputing 191:263\u2013272","journal-title":"Neurocomputing"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09983-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-020-09983-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09983-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,8,16]],"date-time":"2024-08-16T18:17:44Z","timestamp":1723832264000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-020-09983-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,30]]},"references-count":79,"journal-issue":{"issue":"24","published-print":{"date-parts":[[2022,10]]}},"alternative-id":["9983"],"URL":"https:\/\/doi.org\/10.1007\/s11042-020-09983-3","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,10,30]]},"assertion":[{"value":"31 December 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 June 2020","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 September 2020","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 October 2020","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}