{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:27:15Z","timestamp":1740122835708,"version":"3.37.3"},"reference-count":32,"publisher":"Springer Science and Business Media LLC","issue":"23","license":[{"start":{"date-parts":[[2017,5,6]],"date-time":"2017-05-06T00:00:00Z","timestamp":1494028800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61371128","61532005"],"award-info":[{"award-number":["61371128","61532005"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"National Hi-Tech Research and Development Program of China","award":["2014AA015102"],"award-info":[{"award-number":["2014AA015102"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2017,12]]},"DOI":"10.1007\/s11042-017-4726-6","type":"journal-article","created":{"date-parts":[[2017,5,6]],"date-time":"2017-05-06T15:44:22Z","timestamp":1494085462000},"page":"25109-25127","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["Cross-media similarity metric learning with unified deep networks"],"prefix":"10.1007","volume":"76","author":[{"given":"Jinwei","family":"Qi","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xin","family":"Huang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuxin","family":"Peng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,5,6]]},"reference":[{"key":"4726_CR1","first-page":"1247","volume-title":"International Conference on Machine Learning (ICML)","author":"G Andrew","year":"2013","unstructured":"Andrew G, Arora R, Bilmes JA, Livescu K (2013) Deep canonical correlation analysis International Conference on Machine Learning (ICML), pp 1247\u20131255"},{"key":"4726_CR2","first-page":"1","volume-title":"International Conference on Computer Vision (ICCV)","author":"A Bosch","year":"2007","unstructured":"Bosch A, Zisserman A, Munoz X (2007) Image classification using random forests and ferns International Conference on Computer Vision (ICCV), pp 1\u20138"},{"key":"4726_CR3","volume-title":"ACM International Conference on Image and Video Retrieval (ACM-CIVR","author":"T Chua","year":"2009","unstructured":"Chua T, Tang J, Hong R, Li H, Luo Z, Zheng Y (2009) Nus-wide: a real-world web image database from national university of Singapore ACM International Conference on Image and Video Retrieval (ACM-CIVR"},{"key":"4726_CR4","first-page":"15","volume-title":"European Conference on Computer Vision (ECCV)","author":"A Farhadi","year":"2010","unstructured":"Farhadi A, Hejrati SMM, Sadeghi MA, Young P, Rashtchian C, Hockenmaier J, Forsyth DA (2010) Every picture tells a story: Generating sentences from images European Conference on Computer Vision (ECCV), pp 15\u201329"},{"key":"4726_CR5","doi-asserted-by":"crossref","first-page":"7","DOI":"10.1145\/2647868.2654902","volume-title":"ACM international conference on Multimedia (ACM-MM)","author":"F Feng","year":"2014","unstructured":"Feng F, Wang X, Li R (2014) Cross-modal retrieval with correspondence autoencoder ACM international conference on Multimedia (ACM-MM), pp 7\u201316"},{"key":"4726_CR6","first-page":"3279","volume-title":"Conference on Computer Vision and Pattern Recognition (CVPR)","author":"X Han","year":"2015","unstructured":"Han X, Leung T, Jia Y, Sukthankar R, Berg AC (2015) Matchnet: Unifying feature and metric learning for patch-based matching Conference on Computer Vision and Pattern Recognition (CVPR), pp 3279\u20133286"},{"issue":"12","key":"4726_CR7","doi-asserted-by":"publisher","first-page":"2639","DOI":"10.1162\/0899766042321814","volume":"16","author":"DR Hardoon","year":"2004","unstructured":"Hardoon DR, Szedm\u00e1k S (2004) Canonical correlation analysis: An overview with application to learning methods. Neural Comput 16(12):2639\u20132664","journal-title":"Neural Comput"},{"issue":"7","key":"4726_CR8","doi-asserted-by":"publisher","first-page":"1527","DOI":"10.1162\/neco.2006.18.7.1527","volume":"18","author":"GE Hinton","year":"2006","unstructured":"Hinton GE, Osindero S, Teh YW (2006) A fast learning algorithm for deep belief nets. Neural Comput 18(7):1527\u20131554","journal-title":"Neural Comput"},{"key":"4726_CR9","doi-asserted-by":"publisher","first-page":"84","DOI":"10.1007\/978-3-319-24261-3_7","volume-title":"Similarity-Based Pattern Recognition (SIMBAD)","author":"E Hoffer","year":"2015","unstructured":"Hoffer E, Ailon N (2015) Deep metric learning using triplet network Similarity-Based Pattern Recognition (SIMBAD), pp 84\u201392"},{"key":"4726_CR10","doi-asserted-by":"crossref","unstructured":"Hotelling H (1936) Relations between two sets of variates. Biometrika 321\u2013377","DOI":"10.1093\/biomet\/28.3-4.321"},{"key":"4726_CR11","first-page":"604","volume-title":"ACM international conference on Multimedia (ACM-MM)","author":"D Li","year":"2003","unstructured":"Li D, Dimitrova N, Li M, Sethi IK (2003) Multimedia content processing through cross-modal association ACM international conference on Multimedia (ACM-MM), pp 604\u2013611"},{"key":"4726_CR12","first-page":"703","volume-title":"IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)","author":"BS Manjunath","year":"2001","unstructured":"Manjunath BS, Ohm JR, Vinod VV, Yamada A (2001) Color and texture descriptors IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), pp 703\u2013715"},{"key":"4726_CR13","first-page":"689","volume-title":"International Conference on Machine Learning (ICML)","author":"J Ngiam","year":"2011","unstructured":"Ngiam J, Khosla A, Kim M, Nam J, Lee H, Ng AY (2011) Multimodal deep learning International Conference on Machine Learning (ICML), pp 689\u2013696"},{"issue":"2","key":"4726_CR14","doi-asserted-by":"publisher","first-page":"13:1","DOI":"10.1145\/2180868.2180875","volume":"30","author":"L Nie","year":"2012","unstructured":"Nie L, Wang M, Zha Z, Chua T (2012) Oracle in image search: A content-based approach to performance prediction. ACM Trans Inf Syst 30(2):13:1\u201313:23","journal-title":"ACM Trans Inf Syst"},{"key":"4726_CR15","doi-asserted-by":"crossref","first-page":"59","DOI":"10.1145\/2393347.2393363","volume-title":"ACM international conference on Multimedia (ACM-MM)","author":"L Nie","year":"2012","unstructured":"Nie L, Yan S, Wang M, Hong R, Chua T (2012) Harvesting visual concepts for image search with complex queries ACM international conference on Multimedia (ACM-MM), pp 59\u201368"},{"key":"4726_CR16","first-page":"145","volume-title":"International Conference on Computer Vision (ICCV)","author":"A Oliva","year":"2001","unstructured":"Oliva A, Torralba A (2001) Modeling the shape of the scene: A holistic representation of the spatial envelope International Conference on Computer Vision (ICCV), pp 145\u2013175"},{"key":"4726_CR17","first-page":"3846","volume-title":"International Joint Conference on Artificial Intelligence (IJCAI)","author":"Y Peng","year":"2016","unstructured":"Peng Y, Huang X, Qi J (2016) Cross-media shared representation by hierarchical learning with multiple deep networks International Joint Conference on Artificial Intelligence (IJCAI), pp 3846\u20133853"},{"issue":"5","key":"4726_CR18","doi-asserted-by":"publisher","first-page":"612","DOI":"10.1109\/TCSVT.2006.873157","volume":"16","author":"Y Peng","year":"2006","unstructured":"Peng Y, Ngo CW (2006) Clip-based similarity measure for query-dependent clip retrieval and video summarization. IEEE Trans Circuits Syst Video Technol (TCSVT) 16(5):612\u2013627","journal-title":"IEEE Trans Circuits Syst Video Technol (TCSVT)"},{"key":"4726_CR19","first-page":"251","volume-title":"ACM international conference on Multimedia (ACM-MM)","author":"N Rasiwasia","year":"2010","unstructured":"Rasiwasia N, Costa Pereira J, Coviello E, Doyle G, Lanckriet GR, Levy R, Vasconcelos N (2010) A new approach to cross-modal multimedia retrieval ACM international conference on Multimedia (ACM-MM), pp 251\u2013260"},{"key":"4726_CR20","volume-title":"Advances in Neural Information Processing Systems (NIPS)","author":"R Salakhutdinov","year":"1607","unstructured":"Salakhutdinov R, Hinton GE (1607) Replicated softmax: an undirected topic model Advances in Neural Information Processing Systems (NIPS)"},{"issue":"8","key":"4726_CR21","doi-asserted-by":"publisher","first-page":"1967","DOI":"10.1162\/NECO_a_00311","volume":"24","author":"R Salakhutdinov","year":"2012","unstructured":"Salakhutdinov R, Hinton GE (2012) An efficient learning procedure for deep boltzmann machines. Neural Comput 24(8):1967\u20132006","journal-title":"Neural Comput"},{"key":"4726_CR22","volume-title":"International Conference on Machine Learning (ICML)","author":"N Srivastava","year":"2012","unstructured":"Srivastava N, Salakhutdinov R (2012) Learning representations for multimodal data with deep belief nets International Conference on Machine Learning (ICML)"},{"key":"4726_CR23","first-page":"2222","volume-title":"Advances in Neural Information Processing Systems (NIPS)","author":"N Srivastava","year":"2012","unstructured":"Srivastava N, Salakhutdinov R (2012) Multimodal learning with deep boltzmann machines Advances in Neural Information Processing Systems (NIPS), pp 2222\u20132230"},{"key":"4726_CR24","first-page":"153","volume-title":"The International Society for Music Information Retrieval (ISMIR)","author":"R Typke","year":"2005","unstructured":"Typke R, Wiering F, Veltkamp RC (2005) A survey of music information retrieval systems The International Society for Music Information Retrieval (ISMIR), pp 153\u2013160"},{"key":"4726_CR25","doi-asserted-by":"crossref","first-page":"1096","DOI":"10.1145\/1390156.1390294","volume-title":"International Conference on Machine Learning (ICML)","author":"P Vincent","year":"2008","unstructured":"Vincent P, Larochelle H, Bengio Y, Manzagol P (2008) Extracting and composing robust features with denoising autoencoders International Conference on Machine Learning (ICML), pp 1096\u20131103"},{"key":"4726_CR26","first-page":"1386","volume-title":"Conference on Computer Vision and Pattern Recognition (CVPR)","author":"J Wang","year":"2014","unstructured":"Wang J, Song Y, Leung T, Rosenberg C, Wang J, Philbin J, Chen B, Wu Y (2014) Learning fine-grained image similarity with deep ranking Conference on Computer Vision and Pattern Recognition (CVPR), pp 1386\u20131393"},{"key":"4726_CR27","first-page":"1083","volume-title":"International Conference on Machine Learning (ICML)","author":"W Wang","year":"2015","unstructured":"Wang W, Arora R, Livescu K, Bilmes JA (2015) On deep multi-view representation learning International Conference on Machine Learning (ICML), pp 1083\u20131092"},{"key":"4726_CR28","first-page":"1481","volume-title":"Advances in Neural Information Processing Systems (NIPS)","author":"M Welling","year":"2004","unstructured":"Welling M, Rosen-Zvi M, Hinton GE (2004) Exponential family harmoniums with an application to information retrieval Advances in Neural Information Processing Systems (NIPS), pp 1481\u20131488"},{"key":"4726_CR29","first-page":"3441","volume-title":"IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","author":"F Yan","year":"2015","unstructured":"Yan F, Mikolajczyk K (2015) Deep correlation for matching images and text IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp 3441\u20133450"},{"issue":"4","key":"4726_CR30","doi-asserted-by":"publisher","first-page":"544","DOI":"10.1109\/TCSVT.2008.918763","volume":"18","author":"J Yu","year":"2008","unstructured":"Yu J, Tian Q (2008) Semantic subspace projection and its applications in image retrieval. IEEE Trans Circuits Syst Video Technol (TCSVT) 18(4):544\u2013548","journal-title":"IEEE Trans Circuits Syst Video Technol (TCSVT)"},{"key":"4726_CR31","first-page":"1198","volume-title":"AAAI Conference on Artificial Intelligence (AAAI)","author":"X Zhai","year":"2013","unstructured":"Zhai X, Peng Y, Xiao J (2013) Heterogeneous metric learning with joint graph regularization for cross-media retrieval AAAI Conference on Artificial Intelligence (AAAI), pp 1198\u20131204"},{"key":"4726_CR32","doi-asserted-by":"publisher","first-page":"965","DOI":"10.1109\/TCSVT.2013.2276704","volume":"24","author":"X Zhai","year":"2014","unstructured":"Zhai X, Peng Y, Xiao J (2014) Learning cross-media joint representation with sparse and semi-supervised regularization. IEEE Trans Circuits Syst Video Technol (TCSVT) 24:965\u2013978","journal-title":"IEEE Trans Circuits Syst Video Technol (TCSVT)"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11042-017-4726-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-017-4726-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-017-4726-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,7,28]],"date-time":"2022-07-28T08:47:20Z","timestamp":1658998040000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11042-017-4726-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,5,6]]},"references-count":32,"journal-issue":{"issue":"23","published-print":{"date-parts":[[2017,12]]}},"alternative-id":["4726"],"URL":"https:\/\/doi.org\/10.1007\/s11042-017-4726-6","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"type":"print","value":"1380-7501"},{"type":"electronic","value":"1573-7721"}],"subject":[],"published":{"date-parts":[[2017,5,6]]},"assertion":[{"value":"15 September 2016","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 March 2017","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 April 2017","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 May 2017","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}