{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,7]],"date-time":"2025-11-07T08:33:59Z","timestamp":1762504439740},"reference-count":38,"publisher":"Institute of Electronics, Information and Communications Engineers (IEICE)","issue":"6","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEICE Trans. Inf. &amp; Syst."],"published-print":{"date-parts":[[2021,6,1]]},"DOI":"10.1587\/transinf.2020edp7226","type":"journal-article","created":{"date-parts":[[2021,5,31]],"date-time":"2021-05-31T22:40:39Z","timestamp":1622500839000},"page":"873-880","source":"Crossref","is-referenced-by-count":2,"title":["Deep Metric Learning for Multi-Label and Multi-Object Image Retrieval"],"prefix":"10.1587","volume":"E104.D","author":[{"given":"Jonathan","family":"MOJOO","sequence":"first","affiliation":[{"name":"Department of Information Engineering, Graduate School of Engineering, Hiroshima University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Takio","family":"KURITA","sequence":"additional","affiliation":[{"name":"Graduate School of Advanced Science and Engineering, Hiroshima University"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"532","reference":[{"key":"1","doi-asserted-by":"publisher","unstructured":"[1] T. Kato, T. Kurita, and H. Shimogaki, \u201cMultimedia interaction with image database systems,\u201d ACM SIGCHI Bulletin, vol.22, no.1, pp.52-54, 1990. 10.1145\/101288.101299","DOI":"10.1145\/101288.101299"},{"key":"2","doi-asserted-by":"publisher","unstructured":"[2] Y. Rui, T.S. Huang, M. Ortega, and S. Mehrotra, \u201cRelevance feedback: a power tool for interactive content-based image retrieval,\u201d IEEE Transactions on Circuits and Systems for Video Technology, vol.8, no.5, pp.644-655, 1998. 10.1109\/76.718510","DOI":"10.1109\/76.718510"},{"key":"3","doi-asserted-by":"publisher","unstructured":"[3] T. Takahashi and T. Kurita, \u201cMixture of subspaces image representation and compact coding for large-scale image retrieval,\u201d IEEE Transactions on Pattern Analysis and Machine Intelligence, vol.37, no.7, pp.1469-1479, 2015. 10.1109\/tpami.2014.2382092","DOI":"10.1109\/TPAMI.2014.2382092"},{"key":"4","doi-asserted-by":"crossref","unstructured":"[4] A.K. Alhassan and A.A. Alfaki, \u201cColor and texture fusion-based method for content-based image retrieval,\u201d Proc. 2017 International Conference on Communication, Control, Computing and Electronics Engineering, pp.1-6, IEEE, 2017. 10.1109\/iccccee.2017.7867649","DOI":"10.1109\/ICCCCEE.2017.7867649"},{"key":"5","doi-asserted-by":"publisher","unstructured":"[5] P.P. Mane and N.G. Bawane, \u201cAn effective technique for the content based image retrieval to reduce the semantic gap based on an optimal classifier technique,\u201d Pattern Recognition and Image Analysis, vol.26, no.3, pp.597-607, 2016. 10.1134\/s1054661816030159","DOI":"10.1134\/S1054661816030159"},{"key":"6","doi-asserted-by":"publisher","unstructured":"[6] A. Alzu&apos;bi, A. Amira, and N. Ramzan, \u201cSemantic content-based image retrieval: A comprehensive study,\u201d Journal of Visual Communication and Image Representation, vol.32, no.Supplement C, pp.20-54, 2015. 10.1016\/j.jvcir.2015.07.012","DOI":"10.1016\/j.jvcir.2015.07.012"},{"key":"7","unstructured":"[7] T. Kurita and T. Kato, \u201cLearning of personal visual impression for image database systems,\u201d Proc. 2nd International Conference on Document Analysis and Recognition, pp.547-552, 1993. 10.1109\/icdar.1993.395676"},{"key":"8","doi-asserted-by":"publisher","unstructured":"[8] X. Li, T. Uricchio, L. Ballan, M. Bertini, C.G.M. Snoek, and A.D. Bimbo, \u201cSocializing the semantic gap: A comparative survey on image tag assignment, refinement, and retrieval,\u201d ACM Comput. Surv., vol.49, no.1, pp.14:1-14:39, 2016. 10.1145\/2906152","DOI":"10.1145\/2906152"},{"key":"9","unstructured":"[9] M.D. Zeiler and R. Fergus, \u201cStochastic pooling for regularization of deep convolutional neural networks,\u201d 2013, URL https:\/\/arxiv.org\/abs\/1301.3557"},{"key":"10","unstructured":"[10] P. Sermanet, D. Eigen, X. Zhang, M. Mathieu, R. Fergus, and Y. LeCun, \u201cOverfeat: Integrated recognition, localization and detection using convolutional networks,\u201d 2013, URL https:\/\/arxiv.org\/abs\/1312.6229"},{"key":"11","doi-asserted-by":"crossref","unstructured":"[11] A. Sharif Razavian, H. Azizpour, J. Sullivan, and S. Carlsson, \u201cCnn features off-the-shelf: an astounding baseline for recognition,\u201d Proc. IEEE conference on computer vision and pattern recognition workshops, pp.806-813, 2014. 10.1109\/cvprw.2014.131","DOI":"10.1109\/CVPRW.2014.131"},{"key":"12","doi-asserted-by":"crossref","unstructured":"[12] E. Hoffer and N. Ailon, \u201cDeep metric learning using triplet network,\u201d Proc. International Workshop on Similarity-Based Pattern Recognition, vol.9370, pp.84-92, Springer, 2015. 10.1007\/978-3-319-24261-3_7","DOI":"10.1007\/978-3-319-24261-3_7"},{"key":"13","doi-asserted-by":"publisher","unstructured":"[13] J. Vogel and B. Schiele, \u201cSemantic modeling of natural scenes for content-based image retrieval,\u201d International Journal of Computer Vision, vol.72, no.2, pp.133-157, 2007. 10.1007\/s11263-006-8614-1","DOI":"10.1007\/s11263-006-8614-1"},{"key":"14","doi-asserted-by":"crossref","unstructured":"[14] J. Johnson, R. Krishna, M. Stark, L.-J. Li, D.A. Shamma, M.S. Bernstein, and L. Fei-Fei, \u201cImage retrieval using scene graphs,\u201d Proc. 2015 IEEE Conference on Computer Vision and Pattern Recognition, pp.3668-3678, 2015. 10.1109\/cvpr.2015.7298990","DOI":"10.1109\/CVPR.2015.7298990"},{"key":"15","unstructured":"[15] X. Han, T. Leung, Y. Jia, R. Sukthankar, and A.C. Berg, \u201cMatchnet: Unifying feature and metric learning for patch-based matching,\u201d Proc. 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.3279-3286, 2015. 10.1109\/cvpr.2015.7298948"},{"key":"16","doi-asserted-by":"crossref","unstructured":"[16] J. Masci, D. Migliore, M.M. Bronstein, and J. Schmidhuber, \u201cDescriptor learning for omnidirectional image matching,\u201d Proc. Registration and Recognition in Images and Videos, vol.532, pp.49-62, Springer, 2014. 10.1007\/978-3-642-44907-9_3","DOI":"10.1007\/978-3-642-44907-9_3"},{"key":"17","doi-asserted-by":"crossref","unstructured":"[17] S. Zagoruyko and N. Komodakis, \u201cLearning to compare image patches via convolutional neural networks,\u201d Proc. 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.4353-4361, 2015. 10.1109\/cvpr.2015.7299064","DOI":"10.1109\/CVPR.2015.7299064"},{"key":"18","doi-asserted-by":"crossref","unstructured":"[18] J. Wang, Y. Song, T. Leung, C. Rosenberg, J. Wang, J. Philbin, B. Chen, and Y. Wu, \u201cLearning fine-grained image similarity with deep ranking,\u201d Proc. IEEE Conference on Computer Vision and Pattern Recognition, pp.1386-1393, 2014. 10.1109\/cvpr.2014.180","DOI":"10.1109\/CVPR.2014.180"},{"key":"19","doi-asserted-by":"crossref","unstructured":"[19] F. Schroff, D. Kalenichenko, and J. Philbin, \u201cFacenet: A unified embedding for face recognition and clustering,\u201d Proc. IEEE conference on computer vision and pattern recognition, pp.815-823, 2015. 10.1109\/cvpr.2015.7298682","DOI":"10.1109\/CVPR.2015.7298682"},{"key":"20","doi-asserted-by":"crossref","unstructured":"[20] P. Wohlhart and V. Lepetit, \u201cLearning descriptors for object recognition and 3d pose estimation,\u201d Proc. IEEE Conference on Computer Vision and Pattern Recognition, pp.3109-3118, 2015. 10.1109\/cvpr.2015.7298930","DOI":"10.1109\/CVPR.2015.7298930"},{"key":"21","doi-asserted-by":"crossref","unstructured":"[21] J. Wang, F. Zhou, S. Wen, X. Liu, and Y. Lin, \u201cDeep metric learning with angular loss,\u201d Proc. IEEE International Conference on Computer Vision, pp.2593-2601, 2017. 10.1109\/iccv.2017.283","DOI":"10.1109\/ICCV.2017.283"},{"key":"22","doi-asserted-by":"crossref","unstructured":"[22] S. Zhang, Y. Gong, and J. Wang, \u201cDeep metric learning with improved triplet loss for face clustering in videos,\u201d Proc. Pacific Rim Conference on Multimedia, vol.9916, pp.497-508, Springer, 2016. 10.1007\/978-3-319-48890-5_49","DOI":"10.1007\/978-3-319-48890-5_49"},{"key":"23","unstructured":"[23] A. Hermans, L. Beyer, and B. Leibe, \u201cIn Defense of the Triplet Loss for Person Re-Identification,\u201d arXiv preprint arXiv:1703.07737, 2017."},{"key":"24","doi-asserted-by":"crossref","unstructured":"[24] G. Chechik, V. Sharma, U. Shalit, and S. Bengio, \u201cLarge scale online learning of image similarity through ranking,\u201d Journal of Machine Learning Research, vol.11, pp.1109-1135, 2010.","DOI":"10.1007\/978-3-642-02172-5_2"},{"key":"25","unstructured":"[25] R. Xia, Y. Pan, H. Lai, C. Liu, and S. Yan, \u201cSupervised hashing for image retrieval via image representation learning,\u201d Proc. 28th AAAI Conference on Artificial Intelligence, pp.2156-2162, AAAI Press, 2014."},{"key":"26","doi-asserted-by":"crossref","unstructured":"[26] H. Lai, Y. Pan, Y. Liu, and S. Yan, \u201cSimultaneous feature learning and hash coding with deep neural networks,\u201d Proc. IEEE conference on computer vision and pattern recognition, pp.3270-3278, 2015. 10.1109\/cvpr.2015.7298947","DOI":"10.1109\/CVPR.2015.7298947"},{"key":"27","unstructured":"[27] Y. Cao, M. Long, J. Wang, H. Zhu, and Q. Wen, \u201cDeep quantization network for efficient image retrieval,\u201d Proc. 13th AAAI Conference on Artificial Intelligence, pp.3457-3463, 2016."},{"key":"28","doi-asserted-by":"crossref","unstructured":"[28] Y. Cao, M. Long, J. Wang, and S. Liu, \u201cDeep visual-semantic quantization for efficient image retrieval,\u201d Proc. IEEE Conference on Computer Vision and Pattern Recognition, pp.1328-1337, 2017. 10.1109\/cvpr.2017.104","DOI":"10.1109\/CVPR.2017.104"},{"key":"29","doi-asserted-by":"crossref","unstructured":"[29] B. Liu, Y. Cao, M. Long, J. Wang, and J. Wang, \u201cDeep triplet quantization,\u201d Proc. 26th ACM international conference on Multimedia, pp.755-763, 2018. 10.1145\/3240508.3240516","DOI":"10.1145\/3240508.3240516"},{"key":"30","unstructured":"[30] F. Zhao, Y. Huang, L. Wang, and T. Tan, \u201cDeep semantic ranking based hashing for multi-label image retrieval,\u201d Proc. IEEE conference on computer vision and pattern recognition, pp.1556-1564, 2015. 10.1109\/cvpr.2015.7298763"},{"key":"31","doi-asserted-by":"publisher","unstructured":"[31] H. Lai, P. Yan, X. Shu, Y. Wei, and S. Yan, \u201cInstance-aware hashing for multi-label image retrieval,\u201d IEEE Transactions on Image Processing, vol.25, no.6, pp.2469-2479, 2016. 10.1109\/tip.2016.2545300","DOI":"10.1109\/TIP.2016.2545300"},{"key":"32","doi-asserted-by":"publisher","unstructured":"[32] Z. Zhang, Q. Zou, Y. Lin, L. Chen, and S. Wang, \u201cImproved deep hashing with soft pairwise similarity for multi-label image retrieval,\u201d IEEE Transactions on Multimedia, vol.22, no.2, pp.540-553, 2020. 10.1109\/tmm.2019.2929957","DOI":"10.1109\/TMM.2019.2929957"},{"key":"33","unstructured":"[33] A. Santoro, D. Raposo, D.G. Barrett, M. Malinowski, R. Pascanu, P. Battaglia, and T. Lillicrap, \u201cA simple neural network module for relational reasoning,\u201d Proc. Conference on neural information processing systems, pp.4967-4976, 2017."},{"key":"34","doi-asserted-by":"crossref","unstructured":"[34] N. Messina, G. Amato, F. Carrara, F. Falchi, and C. Gennaro, \u201cLearning relationship-aware visual features,\u201d Proc. European Conference on Computer Vision, vol.11132, pp.486-501, 2018. 10.1007\/978-3-030-11018-5_40","DOI":"10.1007\/978-3-030-11018-5_40"},{"key":"35","unstructured":"[35] A. Krizhevsky, I. Sutskever, and G.E. Hinton, \u201cImagenet classification with deep convolutional neural networks,\u201d Proc. Conference on neural information processing systems, pp.1097-1105, 2012."},{"key":"36","doi-asserted-by":"crossref","unstructured":"[36] P. Jaccard, \u201cThe distribution of the flora in the alpine zone,\u201d New phytologist, vol.11, no.2, pp.37-50, 1912. 10.1111\/j.1469-8137.1912.tb05611.x","DOI":"10.1111\/j.1469-8137.1912.tb05611.x"},{"key":"37","doi-asserted-by":"crossref","unstructured":"[37] T.-S. Chua, J. Tang, R. Hong, H. Li, Z. Luo, and Y. Zheng, \u201cNus-wide: a real-world web image database from national university of singapore,\u201d Proc. ACM international conference on image and video retrieval, pp.1-9, 2009. 10.1145\/1646396.1646452","DOI":"10.1145\/1646396.1646452"},{"key":"38","doi-asserted-by":"crossref","unstructured":"[38] T.-Y. Lin, M. Maire, S. Belongie, J. Hays, P. Perona, D. Ramanan, P. Doll\u00e1r, and C.L. Zitnick, \u201cMicrosoft coco: Common objects in context,\u201d Proc. European conference on computer vision, vol.8693, pp.740-755, Springer, 2014. 10.1007\/978-3-319-10602-1_48","DOI":"10.1007\/978-3-319-10602-1_48"}],"container-title":["IEICE Transactions on Information and Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E104.D\/6\/E104.D_2020EDP7226\/_pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,6,5]],"date-time":"2021-06-05T06:20:32Z","timestamp":1622874032000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E104.D\/6\/E104.D_2020EDP7226\/_article"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,6,1]]},"references-count":38,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2021]]}},"URL":"https:\/\/doi.org\/10.1587\/transinf.2020edp7226","relation":{},"ISSN":["0916-8532","1745-1361"],"issn-type":[{"value":"0916-8532","type":"print"},{"value":"1745-1361","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,6,1]]}}}