{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T03:45:49Z","timestamp":1780371949831,"version":"3.54.1"},"reference-count":54,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2021,1,5]],"date-time":"2021-01-05T00:00:00Z","timestamp":1609804800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,1,5]],"date-time":"2021-01-05T00:00:00Z","timestamp":1609804800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61771025"],"award-info":[{"award-number":["61771025"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61925201"],"award-info":[{"award-number":["61925201"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2021,4]]},"DOI":"10.1007\/s11263-020-01392-1","type":"journal-article","created":{"date-parts":[[2021,1,5]],"date-time":"2021-01-05T10:04:41Z","timestamp":1609841081000},"page":"921-941","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":14,"title":["Hierarchical Visual-Textual Knowledge Distillation for Life-Long Correlation Learning"],"prefix":"10.1007","volume":"129","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8502-5685","authenticated-orcid":false,"given":"Yuxin","family":"Peng","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jinwei","family":"Qi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhaoda","family":"Ye","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yunkan","family":"Zhuo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2021,1,5]]},"reference":[{"key":"1392_CR1","unstructured":"Akaho, S. (2006). A kernel method for canonical correlation analysis. arXiv preprint arXiv:cs\/0609071"},{"key":"1392_CR2","doi-asserted-by":"crossref","unstructured":"Aljundi, R., Chakravarty, P., & Tuytelaars, T. (2017). Expert gate: Lifelong learning with a network of experts. In Conference on computer vision and pattern recognition (CVPR) (pp. 7120\u20137129).","DOI":"10.1109\/CVPR.2017.753"},{"key":"1392_CR3","unstructured":"Andrew, G., Arora, R., Bilmes, J. A., & Livescu, K. (2013). Deep canonical correlation analysis. In International conference on machine learning (ICML) (pp. 1247\u20131255)."},{"key":"1392_CR4","doi-asserted-by":"crossref","unstructured":"Eisenschtat, A., & Wolf, L. (2017). Linking image and text with 2-way nets. In Conference on computer vision and pattern recognition (CVPR) (pp. 1855\u20131865).","DOI":"10.1109\/CVPR.2017.201"},{"key":"1392_CR5","doi-asserted-by":"crossref","unstructured":"Feng, F., Wang, X., & Li, R. (2014). Cross-modal retrieval with correspondence autoencoder. In ACM conference on multimedia (ACM-MM) (pp. 7\u201316).","DOI":"10.1145\/2647868.2654902"},{"key":"1392_CR6","doi-asserted-by":"crossref","unstructured":"Fukui, A., Park, D.H., Yang, D., Rohrbach, A., Darrell, T., & Rohrbach, M. (2016). Multimodal compact bilinear pooling for visual question answering and visual grounding. In Conference on empirical methods in natural language processing (EMNLP) (pp. 457\u2013468).","DOI":"10.18653\/v1\/D16-1044"},{"issue":"12","key":"1392_CR7","first-page":"1387","volume":"84","author":"IJ Goodfellow","year":"2013","unstructured":"Goodfellow, I. J., Mirza, M., Xiao, D., Courville, A., & Bengio, Y. (2013). An empirical investigation of catastrophic forgetting in gradient-based neural networks. Computer Science, 84(12), 1387\u201391.","journal-title":"Computer Science"},{"key":"1392_CR8","first-page":"723","volume":"13","author":"A Gretton","year":"2012","unstructured":"Gretton, A., Borgwardt, K. M., Rasch, M. J., Sch\u00f6lkopf, B., & Smola, A. J. (2012). A kernel two-sample test. Journal of Machine Learning Research, 13, 723\u2013773.","journal-title":"Journal of Machine Learning Research"},{"issue":"12","key":"1392_CR9","doi-asserted-by":"publisher","first-page":"2639","DOI":"10.1162\/0899766042321814","volume":"16","author":"DR Hardoon","year":"2004","unstructured":"Hardoon, D. R., Szedm\u00e1k, S., & Shawe-Taylor, J. (2004). Canonical correlation analysis: An overview with application to learning methods. Neural Computation, 16(12), 2639\u20132664.","journal-title":"Neural Computation"},{"key":"1392_CR10","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In Conference on computer vision and pattern recognition (CVPR) (pp. 770\u2013778).","DOI":"10.1109\/CVPR.2016.90"},{"key":"1392_CR11","unstructured":"Hinton, G. E., Vinyals, O., & Dean, J. (2015). Distilling the knowledge in a neural network. arXiv preprint arXiv:1503.02531."},{"key":"1392_CR12","doi-asserted-by":"crossref","unstructured":"Huang, Y., Wu, Q., Song, C., & Wang, L. (2018a). Learning semantic concepts and order for image and sentence matching. In Conference on computer vision and pattern recognition (CVPR) (pp. 6163\u20136171).","DOI":"10.1109\/CVPR.2018.00645"},{"key":"1392_CR13","doi-asserted-by":"crossref","unstructured":"Huang, Y., Wu, Q., & Wang, L. (2018b). Learning semantic concepts and order for image and sentence matching. In Computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2018.00645"},{"issue":"3","key":"1392_CR14","doi-asserted-by":"publisher","first-page":"370","DOI":"10.1109\/TMM.2015.2390499","volume":"17","author":"C Kang","year":"2015","unstructured":"Kang, C., Xiang, S., Liao, S., Xu, C., & Pan, C. (2015). Learning consistent feature representation for cross-modal multimedia retrieval. IEEE Transactions on Multimedia (TMM), 17(3), 370\u2013381.","journal-title":"IEEE Transactions on Multimedia (TMM)"},{"key":"1392_CR15","doi-asserted-by":"crossref","unstructured":"Karpathy, A., & Li, F. (2015). Deep visual-semantic alignments for generating image descriptions. In Conference on computer vision and pattern recognition (CVPR) (pp. 3128\u20133137).","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"1392_CR16","doi-asserted-by":"crossref","unstructured":"Kim, Y. (2014). Convolutional neural networks for sentence classification. In Conference on empirical methods in natural language processing (EMNLP) (pp. 1746\u20131751).","DOI":"10.3115\/v1\/D14-1181"},{"issue":"13","key":"1392_CR17","doi-asserted-by":"publisher","first-page":"3521","DOI":"10.1073\/pnas.1611835114","volume":"114","author":"J Kirkpatrick","year":"2016","unstructured":"Kirkpatrick, J., Pascanu, R., Rabinowitz, N., Veness, J., Desjardins, G., Rusu, A. A., et al. (2016). Overcoming catastrophic forgetting in neural networks. Proceedings of the National Academy of Sciences (PNAS), 114(13), 3521\u20133526.","journal-title":"Proceedings of the National Academy of Sciences (PNAS)"},{"key":"1392_CR18","doi-asserted-by":"crossref","unstructured":"Krause, J., Johnson, J., Krishna, R., & Fei-Fei, L. (2017). A hierarchical approach for generating descriptive image paragraphs. In Computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2017.356"},{"key":"1392_CR19","unstructured":"Krizhevsky, A., Sutskever, I., & Hinton, G. E. (2012). Imagenet classification with deep convolutional neural networks. In Advances in neural information processing systems (NeurIPS) (pp. 1106\u20131114)."},{"key":"1392_CR20","doi-asserted-by":"crossref","unstructured":"Lee, K. H., Chen, X., Hua, G., Hu, H., & He, X. (2018). Stacked cross attention for image-text matching. In European conference on computer vision (ECCV) (pp. 212\u2013228).","DOI":"10.1007\/978-3-030-01225-0_13"},{"key":"1392_CR21","doi-asserted-by":"crossref","unstructured":"Li, D., Dimitrova, N., Li, M., & Sethi, I. K. (2003). Multimedia content processing through cross-modal association. In ACM conference on multimedia (ACM-MM) (pp. 604\u2013611).","DOI":"10.1145\/957013.957143"},{"issue":"12","key":"1392_CR22","doi-asserted-by":"publisher","first-page":"2935","DOI":"10.1109\/TPAMI.2017.2773081","volume":"40","author":"Z Li","year":"2018","unstructured":"Li, Z., & Hoiem, D. (2018). Learning without forgetting. IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 40(12), 2935\u20132947.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)"},{"key":"1392_CR23","doi-asserted-by":"crossref","unstructured":"Lin, T., Maire, M., Belongie, S. J., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C. L. (2014). Microsoft coco: Common objects in context. In European conference on computer vision (ECCV) (pp. 740\u2013755).","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"1392_CR24","unstructured":"Lin, Y., Pang, Z., Wang, D., & Zhuang, Y. (2017). Task-driven visual saliency and attention-based visual question answering. arXiv preprint arXiv:1702.06700."},{"key":"1392_CR25","doi-asserted-by":"crossref","unstructured":"Mallya, A., & Lazebnik, S. (2018). Packnet: Adding multiple tasks to a single network by iterative pruning. In Conference on computer vision and pattern recognition (CVPR) (pp. 7765\u20137773).","DOI":"10.1109\/CVPR.2018.00810"},{"key":"1392_CR26","doi-asserted-by":"crossref","unstructured":"Mitchell, T. M., Cohen, W. W, Jr., E. R. H., Talukdar, P. P., Yang, B., Betteridge, J., et al. (2018). Never-ending learning. Communications of the ACM, 61(5), 103\u2013115.","DOI":"10.1145\/3191513"},{"key":"1392_CR27","unstructured":"Ngiam, J., Khosla, A., Kim, M., Nam, J., Lee, H., & Ng, A. Y. (2011). Multimodal deep learning. In International conference on machine learning (ICML) (pp. 689\u2013696)."},{"key":"1392_CR28","unstructured":"Peng, Y., Huang, X., & Qi, J. (2016a). Cross-media shared representation by hierarchical learning with multiple deep networks. In International joint conference on artificial intelligence (IJCAI) (pp. 3846\u20133853)."},{"issue":"3","key":"1392_CR29","doi-asserted-by":"publisher","first-page":"583","DOI":"10.1109\/TCSVT.2015.2400779","volume":"26","author":"Y Peng","year":"2016","unstructured":"Peng, Y., Zhai, X., Zhao, Y., & Huang, X. (2016b). Semi-supervised cross-media feature learning with unified patch graph regularization. IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 26(3), 583\u2013596.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)"},{"issue":"9","key":"1392_CR30","doi-asserted-by":"publisher","first-page":"2372","DOI":"10.1109\/TCSVT.2017.2705068","volume":"28","author":"Y Peng","year":"2017","unstructured":"Peng, Y., Huang, X., & Zhao, Y. (2017). An overview of cross-media retrieval: Concepts, methodologies, benchmarks, and challenges. IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 28(9), 2372\u20132385.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)"},{"issue":"2","key":"1392_CR31","doi-asserted-by":"publisher","first-page":"405","DOI":"10.1109\/TMM.2017.2742704","volume":"20","author":"Y Peng","year":"2018","unstructured":"Peng, Y., Qi, J., Huang, X., & Yuan, Y. (2018a). CCL: Cross-modal correlation learning with multi-grained fusion by hierarchical network. IEEE Transactions on Multimedia (TMM), 20(2), 405\u2013420.","journal-title":"IEEE Transactions on Multimedia (TMM)"},{"issue":"11","key":"1392_CR32","doi-asserted-by":"publisher","first-page":"5585","DOI":"10.1109\/TIP.2018.2852503","volume":"27","author":"Y Peng","year":"2018","unstructured":"Peng, Y., Qi, J., & Yuan, Y. (2018b). Modality-specific cross-modal similarity measurement with recurrent attention network. IEEE Transactions on Image Processing (TIP), 27(11), 5585\u20135599.","journal-title":"IEEE Transactions on Image Processing (TIP)"},{"key":"1392_CR33","doi-asserted-by":"crossref","unstructured":"Qi, J., Peng, Y., Zhuo, Y. (2018). Life-long cross-media correlation learning. In ACM conference on multimedia (ACM-MM). ACM (pp. 528\u2013536).","DOI":"10.1145\/3240508.3240558"},{"key":"1392_CR34","doi-asserted-by":"crossref","unstructured":"Ranjan, V., Rasiwasia, N., & Jawahar, C. V. (2015). Multi-label cross-modal retrieval. In IEEE international conference on computer vision (ICCV) (pp. 4094\u20134102).","DOI":"10.1109\/ICCV.2015.466"},{"key":"1392_CR35","doi-asserted-by":"crossref","unstructured":"Rasiwasia, N., Costa\u00a0Pereira, J., Coviello, E., Doyle, G., Lanckriet. G. R., Levy, R., & Vasconcelos, N. (2010). A new approach to cross-modal multimedia retrieval. In ACM conference on multimedia (ACM-MM) (pp. 251\u2013260).","DOI":"10.1145\/1873951.1873987"},{"key":"1392_CR36","doi-asserted-by":"crossref","unstructured":"Reed, S.E., Akata, Z., Lee, H., & Schiele, B. (2016). Learning deep representations of fine-grained visual descriptions. In Conference on computer vision and pattern recognition (CVPR) (pp. 49\u201358).","DOI":"10.1109\/CVPR.2016.13"},{"key":"1392_CR37","unstructured":"Rusu, A. A., Rabinowitz, N. C., Desjardins, G., Soyer, H., Kirkpatrick, J., Kavukcuoglu, K., Pascanu, R., & Hadsell, R. (2016). Progressive neural networks. arXiv preprint arXiv:1606.04671."},{"key":"1392_CR38","unstructured":"Shin, H., Lee, J. K., Kim, J., & Kim, J. (2017). Continual learning with deep generative replay. In Advances in neural information processing systems (NeurIPS) (pp. 2994\u20133003)."},{"key":"1392_CR39","unstructured":"Simonyan, K., & Zisserman, A. (2014). Very deep convolutional networks for large-scale image recognition. In International conference on learning representations (ICLR)."},{"key":"1392_CR40","doi-asserted-by":"crossref","unstructured":"Song, Y., & Soleymani, M. (2019). Polysemous visual-semantic embedding for cross-modal retrieval. In Computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2019.00208"},{"key":"1392_CR41","unstructured":"Triki, A. R., Aljundi, R., Blaschko, M. B., & Tuytelaars, T. (2017). Encoder based lifelong learning. In IEEE international conference on computer vision (ICCV) (pp. 1329\u20131337)."},{"key":"1392_CR42","doi-asserted-by":"crossref","unstructured":"Wang, B., Yang, Y., Xu, X., Hanjalic, A., & Hengtao, S. (2017). Adversarial cross-modal retrieval. In ACM conference on multimedia (ACM-MM) (pp. 154\u2013162).","DOI":"10.1145\/3123266.3123326"},{"issue":"10","key":"1392_CR43","doi-asserted-by":"publisher","first-page":"2010","DOI":"10.1109\/TPAMI.2015.2505311","volume":"38","author":"K Wang","year":"2016","unstructured":"Wang, K., He, R., Wang, L., Wang, W., & Tan, T. (2016a). Joint feature selection and subspace learning for cross-modal retrieval. IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 38(10), 2010\u20132023.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)"},{"key":"1392_CR44","doi-asserted-by":"crossref","unstructured":"Wang, L., Li, Y., & Lazebnik, S. (2016b). Learning deep structure-preserving image-text embeddings. In Conference on computer vision and pattern recognition (CVPR) (pp. 5005\u20135013).","DOI":"10.1109\/CVPR.2016.541"},{"key":"1392_CR45","doi-asserted-by":"crossref","unstructured":"Wang, S., Chen, Y., Zhuo, J., Huang, Q., & Tian, Q. (2018). Joint global and co-attentive representation learning for image-sentence retrieval. In ACM conference on multimedia (ACM-MM) (pp. 1398\u20131406).","DOI":"10.1145\/3240508.3240535"},{"issue":"2","key":"1392_CR46","first-page":"449","volume":"47","author":"Y Wei","year":"2017","unstructured":"Wei, Y., Zhao, Y., Lu, C., Wei, S., Liu, L., Zhu, Z., et al. (2017). Cross-modal retrieval with CNN visual features: A new baseline. IEEE Transactions on Cybernetics (TCYB), 47(2), 449\u2013460.","journal-title":"IEEE Transactions on Cybernetics (TCYB)"},{"key":"1392_CR47","unstructured":"Xu, J., & Zhu, Z. (2018). Reinforced continual learning. In Advances in neural information processing systems (NeurIPS) (pp. 907\u2013916)."},{"key":"1392_CR48","doi-asserted-by":"crossref","unstructured":"Yan, F., & Mikolajczyk, K. (2015). Deep correlation for matching images and text. In Conference on computer vision and pattern recognition (CVPR) (pp. 3441\u20133450).","DOI":"10.1109\/CVPR.2015.7298966"},{"key":"1392_CR49","unstructured":"Yoon, J., Yang, E., Lee, J., & Ju Hwang, S. (2017). Lifelong learning with dynamically expandable networks. arXiv preprint arXiv:1708.01547."},{"key":"1392_CR50","unstructured":"Zagoruyko, S., & Komodakis, N. (2016). Paying more attention to attention: Improving the performance of convolutional neural networks via attention transfer. arXiv preprint arXiv:1612.03928."},{"key":"1392_CR51","unstructured":"Zenke, F., Poole, B., & Ganguli, S. (2017). Continual learning through synaptic intelligence. In International conference on machine learning (ICML) (pp. 3987\u20133995)."},{"key":"1392_CR52","doi-asserted-by":"crossref","unstructured":"Zhai, X., Peng, Y., & Xiao, J. (2013). Heterogeneous metric learning with joint graph regularization for cross-media retrieval. In AAAI conference on artificial intelligence (AAAI) (pp. 1198\u20131204).","DOI":"10.1609\/aaai.v27i1.8464"},{"key":"1392_CR53","doi-asserted-by":"publisher","first-page":"965","DOI":"10.1109\/TCSVT.2013.2276704","volume":"24","author":"X Zhai","year":"2014","unstructured":"Zhai, X., Peng, Y., & Xiao, J. (2014). Learning cross-media joint representation with sparse and semi-supervised regularization. IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 24, 965\u2013978.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)"},{"key":"1392_CR54","unstructured":"Zhang, X., Zhao, J., & LeCun, Y. (2015). Character-level convolutional networks for text classification. In Advances in neural information processing systems (NeurIPS) (pp. 649\u2013657)."}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-020-01392-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-020-01392-1\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-020-01392-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,10]],"date-time":"2022-12-10T15:31:08Z","timestamp":1670686268000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-020-01392-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,1,5]]},"references-count":54,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2021,4]]}},"alternative-id":["1392"],"URL":"https:\/\/doi.org\/10.1007\/s11263-020-01392-1","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,1,5]]},"assertion":[{"value":"3 January 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 October 2020","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 January 2021","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}