{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,12]],"date-time":"2026-07-12T03:10:48Z","timestamp":1783825848285,"version":"3.55.0"},"reference-count":59,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2023,11,24]],"date-time":"2023-11-24T00:00:00Z","timestamp":1700784000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,11,24]],"date-time":"2023-11-24T00:00:00Z","timestamp":1700784000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2024,5]]},"DOI":"10.1007\/s11263-023-01898-4","type":"journal-article","created":{"date-parts":[[2023,11,24]],"date-time":"2023-11-24T05:02:05Z","timestamp":1700802125000},"page":"1546-1556","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":19,"title":["Mimic before Reconstruct: Enhancing Masked Autoencoders with Feature Mimicking"],"prefix":"10.1007","volume":"132","author":[{"given":"Peng","family":"Gao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ziyi","family":"Lin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Renrui","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rongyao","family":"Fang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongyang","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongsheng","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yu","family":"Qiao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2023,11,24]]},"reference":[{"key":"1898_CR1","unstructured":"Baevski, A., Hsu, W. N., Xu, Q., Babu, A., Gu, J., & Auli, M. (2022). Data2vec: A general framework for self-supervised learning in speech, vision and language. arXiv preprint arXiv:2202.03555."},{"key":"1898_CR2","doi-asserted-by":"crossref","unstructured":"Bai, Y. (2022). Masked autoencoders enable efficient knowledge distillers. arXiv preprint arXiv:2208.12256.","DOI":"10.1109\/CVPR52729.2023.02323"},{"key":"1898_CR3","unstructured":"Bao, H., Dong, L. & Wei, F. (2021) . Beit: Bert pre-training of image transformers. arXiv preprint arXiv:2106.08254."},{"key":"1898_CR4","first-page":"1877","volume":"33","author":"T Brown","year":"2020","unstructured":"Brown, T., et al. (2020). Language models are few-shot learners. Advances in Neural Information Processing Systems, 33, 1877\u20131901.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"1898_CR5","doi-asserted-by":"crossref","unstructured":"Caron, M., Touvron, H., Misra, I., J\u00e9gou, H., Mairal, J., Bojanowski, P., & Joulin, A. (2021). Emerging properties in self-supervised vision transformers. In Proceedings of the IEEE\/CVF international conference on computer vision (pp. 9650\u20139660).","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"1898_CR6","doi-asserted-by":"crossref","unstructured":"Chen, X., Ding, M., Wang, X., Xin, Y., Mo, S., Wang, Y., Han, S., Luo, P., Zeng, G., & Wang, J. (2022). Context autoencoder for self-supervised representation learning. arXiv preprint arXiv:2202.03026.","DOI":"10.1007\/s11263-023-01852-4"},{"key":"1898_CR7","unstructured":"Chen, T., Kornblith, S., Norouzi, M. & Hinton, G. (2020). A simple framework for contrastive learning of visual representations. In: PMLR (pp. 1597\u20131607)."},{"key":"1898_CR8","doi-asserted-by":"crossref","unstructured":"Chen, X., Xie, S. & He, K. (2021). An empirical study of training self-supervised vision transformers, In 2021 IEEE\/CVF International Conference on Computer Vision (ICCV) (pp. 9620\u20139629).","DOI":"10.1109\/ICCV48922.2021.00950"},{"key":"1898_CR9","doi-asserted-by":"crossref","unstructured":"Chen, A., Zhang, K., Zhang, R., Wang, Z., Lu, Y., Guo, Y., & Zhang, S. (2023). PIMAE: Point cloud and image interactive masked autoencoders for 3d object detection. In: CVPR 2023.","DOI":"10.1109\/CVPR52729.2023.00512"},{"key":"1898_CR10","unstructured":"Dalal, N. & Triggs, B. (2005). Histograms of oriented gradients for human detection. In: IEEE (Vol.\u00a01, pp. 886\u2013893)."},{"key":"1898_CR11","unstructured":"Devlin, J., Chang, M.-W., Lee, K. & Toutanova, K. (2018). Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805."},{"key":"1898_CR12","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., & Uszkoreit, J. (2020). An image is worth $$16\\times 16$$ words: Transformers for image recognition at scale. arXiv preprint arXiv:2010.11929."},{"key":"1898_CR13","doi-asserted-by":"crossref","unstructured":"Fu, K., Gao, P., Liu, S., Zhang, R., Qiao, Y., & Wang, M. (2022). Pos-bert: Point cloud one-stage bert pre-training. arXiv preprint arXiv:2204.00989.","DOI":"10.2139\/ssrn.4438099"},{"key":"1898_CR14","unstructured":"Gao, P., Lu, J., Li, H., Mottaghi, R. & Kembhavi, A. (2021). Container: Context aggregation network. arXiv preprint arXiv:2106.01401."},{"key":"1898_CR15","unstructured":"Gao, P., Ma, T., Li, H., Dai, J. & Qiao, Y. (2022). MCMAE: Masked convolution meets masked autoencoders. Advances in Neural Information Processing Systems, 35, 35632\u201335644."},{"key":"1898_CR16","doi-asserted-by":"crossref","unstructured":"Guo, J., Han, K., Wu, H., Tang, Y., Chen, X., Wang, Y., & Xu, C. (2022). CMT: Convolutional neural networks meet vision transformers (pp. 12175\u201312185).","DOI":"10.1109\/CVPR52688.2022.01186"},{"key":"1898_CR17","doi-asserted-by":"crossref","unstructured":"Guo, Z., Zhang, R., Qiu, L., Li, X. & Heng, P.\u00a0A. (2023). Joint-mae: 2d-3d joint masked autoencoders for 3d point cloud pre-training. In: IJCAI 2023.","DOI":"10.24963\/ijcai.2023\/88"},{"key":"1898_CR18","doi-asserted-by":"crossref","unstructured":"He, K., Chen, X., Xie, S., Li, Y., Doll\u00e1r, P., & Girshick, R. (2022). Masked autoencoders are scalable vision learners. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 16000\u201316009).","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"1898_CR19","doi-asserted-by":"crossref","unstructured":"He, K., Chen, X., Xie, S., Li, Y., Doll\u00e1r, P., & Girshick, R. (2022). Masked autoencoders are scalable vision learners.","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"1898_CR20","doi-asserted-by":"crossref","unstructured":"He, K., Fan, H., Wu, Y., Xie, S. & Girshick, R. (2020). Momentum contrast for unsupervised visual representation learning. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 9729\u20139738).","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"1898_CR21","doi-asserted-by":"crossref","unstructured":"He, K., Gkioxari, G., Doll\u00e1r, P. & Girshick, R. (2017). Mask r-CNN. In Proceedings of the IEEE international conference on computer vision (pp. 2961\u20132969).","DOI":"10.1109\/ICCV.2017.322"},{"key":"1898_CR22","unstructured":"Hinton, G., Vinyals, O., & Dean, J. (2015). Distilling the knowledge in a neural network. arXiv preprint arXiv:1503.02531."},{"key":"1898_CR23","unstructured":"Hou, Z., Sun, F., Chen, Y.-K., Xie, Y. & Kung, S.-Y. (2022). Milan: Masked image pretraining on language assisted representation. arXiv preprint arXiv:2208.06049."},{"key":"1898_CR24","unstructured":"Huang, Z., Jin, X., Lu, C., Hou, Q., Cheng, M.M., Fu, D., Shen, X., & Feng, J. (2022). Contrastive masked autoencoders are stronger vision learners. arXiv preprint arXiv:2207.13532."},{"key":"1898_CR25","unstructured":"Huang, L., You, S., Zheng, M., Wang, F., Qian, C., & Yamasaki, T. (2022). Green hierarchical vision transformer for masked image modeling. arXiv preprint arXiv:2205.13515."},{"key":"1898_CR26","doi-asserted-by":"crossref","unstructured":"Kakogeorgiou, I., Gidaris, S., Psomas, B., Avrithis, Y., Bursuc, A., Karantzalos, K., & Komodakis, N. (2022). What to hide from your students: Attention-guided masked image modeling. arXiv preprint arXiv:2203.12719.","DOI":"10.1007\/978-3-031-20056-4_18"},{"key":"1898_CR27","doi-asserted-by":"crossref","unstructured":"Li, Y., Mao, H., Girshick, R. & He, K. (2022) . Exploring plain vision transformer backbones for object detection. arXiv preprint arXiv:2203.16527.","DOI":"10.1007\/978-3-031-20077-9_17"},{"key":"1898_CR28","unstructured":"Li, X., Wang, W., Yang, L. & Yang, J. (2022). Uniform masking: Enabling mae pre-training for pyramid-based vision transformers with locality. arXiv preprint arXiv:2205.10063."},{"key":"1898_CR29","doi-asserted-by":"crossref","unstructured":"Li, K., Wang, Y., Zhang, J., Gao, P., Song, G., Liu, Y., Li, H., & Qiao, Y. (2022). Uniformer: Unifying convolution and self-attention for visual recognition. arXiv preprint arXiv:2201.09450.","DOI":"10.1109\/TPAMI.2023.3282631"},{"key":"1898_CR30","doi-asserted-by":"crossref","unstructured":"Li, W., Xie, J. & Loy, C.\u00a0C. (2023). Correlational image modeling for self-supervised visual pre-training. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 15105\u201315115).","DOI":"10.1109\/CVPR52729.2023.01450"},{"key":"1898_CR31","unstructured":"Li, Y., Xie, S., Chen, X., Dollar, P., He, K., & Girshick, R. (2021). Benchmarking detection transfer learning with vision transformers. arXiv preprint arXiv:2111.11429."},{"key":"1898_CR32","first-page":"13165","volume":"34","author":"Z Li","year":"2021","unstructured":"Li, Z., Chen, Z., Yang, F., Li, W., Zhu, Y., Zhao, C., Deng, R., Wu, L., Zhao, R., Tang, M., & Wang, J. (2021). MST: Masked self-supervised transformer for visual representation. Advances in Neural Information Processing Systems, 34, 13165\u201313176.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"1898_CR33","doi-asserted-by":"crossref","unstructured":"Lin, T.Y., Doll\u00e1r, P., Girshick, R., He, K., Hariharan, B., & Belongie, S. (2017). Feature pyramid networks for object detection. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 2117\u20132125).","DOI":"10.1109\/CVPR.2017.106"},{"key":"1898_CR34","doi-asserted-by":"crossref","unstructured":"Lin, T.Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C. L. (2014). Microsoft coco: Common objects in context (pp. 740\u2013755). Springer.","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"1898_CR35","unstructured":"Liu, J., Huang, X., Liu, Y. & Li, H. (2022) . Mixmim: Mixed and masked image modeling for efficient visual representation learning. arXiv preprint arXiv:2205.13137."},{"key":"1898_CR36","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., & Guo, B. (2021). Swin transformer: Hierarchical vision transformer using shifted windows. In Proceedings of the IEEE\/CVF international conference on computer vision (pp. 10012\u201310022).","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"1898_CR37","unstructured":"Loshchilov, I. & Hutter, F. (2018). Fixing weight decay regularization in ADAM. https:\/\/openreview.net\/pdf?id=rk6qdGgCZ"},{"key":"1898_CR38","doi-asserted-by":"crossref","unstructured":"Mu, N., Kirillov, A., Wagner, D. & Xie, S. (2022). Slip: Self-supervision meets language-image pre-training (pp. 529\u2013544). Springer.","DOI":"10.1007\/978-3-031-19809-0_30"},{"key":"1898_CR39","unstructured":"Peng, Z., Dong, L., Bao, H., Ye, Q. & Wei, F. (2022) . Beit v2: Masked image modeling with vector-quantized visual tokenizers. arXiv preprint arXiv:2208.06366."},{"key":"1898_CR40","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., & Krueger, G. (2021). Learning transferable visual models from natural language supervision. In: International conference on machine learning (pp. 8748\u20138763). PMLR."},{"key":"1898_CR41","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., & Krueger, G. (2021). Learning transferable visual models from natural language supervision."},{"issue":"8","key":"1898_CR42","first-page":"9","volume":"1","author":"A Radford","year":"2019","unstructured":"Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., & Sutskever, I. (2019). Language models are unsupervised multitask learners. OpenAI blog, 1(8), 9.","journal-title":"OpenAI blog"},{"key":"1898_CR43","unstructured":"Ramesh, A., Dhariwal, P., Nichol, A., Chu, C. & Chen, M. (2022). Hierarchical text-conditional image generation with clip latents. arXiv preprint arXiv:2204.06125."},{"key":"1898_CR44","unstructured":"Ramesh, A., Pavlov, M., Goh, G., Gray, S., Voss, C., Radford, A., Chen, M., & Sutskever, I. (2021). Zero-shot text-to-image generation. In: PMLR (pp. 8821\u20138831)."},{"issue":"3","key":"1898_CR45","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky, O., Deng, J., Su, H., Krause, J., Satheesh, S., Ma, S., Huang, Z., Karpathy, A., Khosla, A., Bernstein, M., & Berg, A. C. (2015). Imagenet large scale visual recognition challenge. International Journal of Computer Vision, 115(3), 211\u2013252.","journal-title":"International Journal of Computer Vision"},{"key":"1898_CR46","unstructured":"Shi, H., Gao, J., Xu, H., Liang, X., Li, Z., Kong, L., Lee, S., & Kwok, J. T. (2022). Revisiting over-smoothing in bert from the perspective of graph. arXiv preprint arXiv:2202.08625."},{"key":"1898_CR47","unstructured":"Shi, Y., Siddharth, N., Torr, P. & Kosiorek, A.\u00a0R. (2022). Adversarial masking for self-supervised learning. In: PMLR (pp. 20026\u201320040)."},{"key":"1898_CR48","doi-asserted-by":"crossref","unstructured":"Wang, L., Liang, F., Li, Y., Zhang, H., Ouyang, W., & Shao, J. (2022). Repre: Improving self-supervised vision transformer with reconstructive pre-training. arXiv preprint arXiv:2201.06857.","DOI":"10.24963\/ijcai.2022\/200"},{"key":"1898_CR49","doi-asserted-by":"crossref","unstructured":"Wei, C., Fan, H., Xie, S., Wu, C.Y., Yuille, A., & Feichtenhofer, C. (2022). Masked feature prediction for self-supervised visual pre-training (pp. 14668\u201314678).","DOI":"10.1109\/CVPR52688.2022.01426"},{"key":"1898_CR50","unstructured":"Wei, Y., Hu, H., Xie, Z., Zhang, Z., Cao, Y., Bao, J., Chen, D., & Guo, B. (2022). Contrastive learning rivals masked image modeling in fine-tuning via feature distillation. arXiv preprint arXiv:2205.14141."},{"key":"1898_CR51","doi-asserted-by":"crossref","unstructured":"Wei, L., Xie, L., Zhou, W., Li, H. & Tian, Q. (2022). MVP: Multimodality-guided visual pre-training. In European conference on computer vision (pp. 337\u2013353). Springer.","DOI":"10.1007\/978-3-031-20056-4_20"},{"key":"1898_CR52","doi-asserted-by":"crossref","unstructured":"Wu, Z., Xiong, Y., Yu, S.\u00a0X. & Lin, D. (2018). Unsupervised feature learning via non-parametric instance discrimination. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 3733\u20133742).","DOI":"10.1109\/CVPR.2018.00393"},{"key":"1898_CR53","doi-asserted-by":"crossref","unstructured":"Xiang, W., Yang, H., Huang, D. & Wang, Y. (2023). Denoising diffusion autoencoders are unified self-supervised learners. arXiv preprint arXiv:2303.09769.","DOI":"10.1109\/ICCV51070.2023.01448"},{"key":"1898_CR54","first-page":"30392","volume":"34","author":"T Xiao","year":"2021","unstructured":"Xiao, T., Singh, M., Mintun, E., Darrell, T., Doll\u00e1r, P., & Girshick, R. (2021). Early convolutions help transformers see better. Advances in Neural Information Processing Systems, 34, 30392\u201330400.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"1898_CR55","unstructured":"Xie, J., Li, W., Zhan, X., Liu, Z., Ong, Y. S., & Loy, C. C. (2022). Masked frequency modeling for self-supervised visual pre-training. arXiv preprint arXiv:2206.07706."},{"key":"1898_CR56","doi-asserted-by":"crossref","unstructured":"Xie, Z., Zhang, Z., Cao, Y., Lin, Y., Bao, J., Yao, Z., Dai, Q., & Hu, H. (2022). Simmim: A simple framework for masked image modeling. In Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (pp. 9653\u20139663).","DOI":"10.1109\/CVPR52688.2022.00943"},{"key":"1898_CR57","unstructured":"Zhang, R., Guo, Z., Gao, P., Fang, R., Zhao, B., Wang, D., Qiao, Y., & Li, H. (2022). Point-m2ae: Multi-scale masked autoencoders for hierarchical point cloud pre-training. In: NeurIPS 2022."},{"key":"1898_CR58","unstructured":"Zhang, H., Li, F., Liu, S., Zhang, L., Su, H., Zhu, J., Ni, L. M., & Shum, H. Y. (2022). Dino: Detr with improved denoising anchor boxes for end-to-end object detection. arXiv preprint arXiv:2203.03605."},{"key":"1898_CR59","doi-asserted-by":"crossref","unstructured":"Zhang, R., Wang, L., Qiao, Y., Gao, P. & Li, H. (2023). Learning 3d representations from 2d pre-trained models via image-to-point masked autoencoders. In: CVPR 2023.","DOI":"10.1109\/CVPR52729.2023.02085"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01898-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-023-01898-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01898-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,5,7]],"date-time":"2024-05-07T08:07:39Z","timestamp":1715069259000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-023-01898-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,11,24]]},"references-count":59,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2024,5]]}},"alternative-id":["1898"],"URL":"https:\/\/doi.org\/10.1007\/s11263-023-01898-4","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,11,24]]},"assertion":[{"value":"1 March 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 August 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 November 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}