{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T01:18:45Z","timestamp":1784164725523,"version":"3.55.0"},"publisher-location":"Cham","reference-count":104,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031736490","type":"print"},{"value":"9783031736506","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,21]],"date-time":"2024-11-21T00:00:00Z","timestamp":1732147200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,21]],"date-time":"2024-11-21T00:00:00Z","timestamp":1732147200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-73650-6_25","type":"book-chapter","created":{"date-parts":[[2024,11,20]],"date-time":"2024-11-20T18:16:41Z","timestamp":1732126601000},"page":"431-450","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":13,"title":["AMD: Automatic Multi-step Distillation of\u00a0Large-Scale Vision Models"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8145-3436","authenticated-orcid":false,"given":"Cheng","family":"Han","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qifan","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sohail A.","family":"Dianat","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Majid","family":"Rabbani","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Raghuveer M.","family":"Rao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yi","family":"Fang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3804-8945","authenticated-orcid":false,"given":"Qiang","family":"Guan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lifu","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dongfang","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,11,21]]},"reference":[{"key":"25_CR1","unstructured":"Beal, J., Kim, E., Tzeng, E., Park, D.H., Zhai, A., Kislyuk, D.: Toward transformer-based object detection. arXiv preprint arXiv:2012.09958 (2020)"},{"key":"25_CR2","doi-asserted-by":"crossref","unstructured":"Bengio, Y., Courville, A., Vincent, P.: Representation learning: a review and new perspectives. In: IEEE TPAMI (2013)","DOI":"10.1109\/TPAMI.2013.50"},{"key":"25_CR3","doi-asserted-by":"crossref","unstructured":"Beyer, L., Zhai, X., Royer, A., Markeeva, L., Anil, R., Kolesnikov, A.: Knowledge distillation: a good teacher is patient and consistent. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01065"},{"key":"25_CR4","doi-asserted-by":"crossref","unstructured":"Binici, K., Pham, N.T., Mitra, T., Leman, K.: Preventing catastrophic forgetting and distribution mismatch in knowledge distillation via synthetic data. In: WACV (2022)","DOI":"10.1109\/WACV51458.2022.00368"},{"key":"25_CR5","unstructured":"Brown, T., et\u00a0al.: Language models are few-shot learners. In: NeurIPS (2020)"},{"key":"25_CR6","unstructured":"Cao, S., Li, M., Hays, J., Ramanan, D., Wang, Y.X., Gui, L.: Learning lightweight object detectors via multi-teacher progressive distillation. In: ICML (2023)"},{"key":"25_CR7","doi-asserted-by":"crossref","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., Zagoruyko, S.: End-to-end object detection with transformers. In: ECCV (2020)","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"25_CR8","doi-asserted-by":"crossref","unstructured":"Chen, D., Mei, J.P., Zhang, Y., Wang, C., Wang, Z., Feng, Y., Chen, C.: Cross-layer distillation with semantic calibration. In: AAAI (2021)","DOI":"10.1609\/aaai.v35i8.16865"},{"key":"25_CR9","doi-asserted-by":"crossref","unstructured":"Chen, H., Wang, Y., Xu, C., Xu, C., Tao, D.: Learning student networks via feature embedding. In: IEEE TNNLS (2020)","DOI":"10.1109\/TNNLS.2020.2970494"},{"key":"25_CR10","doi-asserted-by":"crossref","unstructured":"Chen, X., Cao, Q., Zhong, Y., Zhang, J., Gao, S., Tao, D.: Dearkd: data-efficient early knowledge distillation for vision transformers. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01174"},{"key":"25_CR11","unstructured":"Chen, Z., et al.: Minidisc: minimal distillation schedule for language model compression. arXiv preprint arXiv:2205.14570 (2022)"},{"key":"25_CR12","doi-asserted-by":"crossref","unstructured":"Cho, J.H., Hariharan, B.: On the efficacy of knowledge distillation. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00489"},{"key":"25_CR13","unstructured":"Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: Bert: pre-training of deep bidirectional transformers for language understanding. In: NAACL-HLT (2018)"},{"key":"25_CR14","doi-asserted-by":"crossref","unstructured":"Ding, X., Ding, G., Guo, Y., Han, J.: Centripetal SQD for pruning very deep convolutional networks with complicated structure. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00508"},{"key":"25_CR15","unstructured":"Dong, X., Chen, S., Pan, S.: Learning to prune deep neural networks via layer-wise optimal brain surgeon. In: NeurIPS (2017)"},{"key":"25_CR16","unstructured":"Dosovitskiy, A., et\u00a0al.: An image is worth 16x16 words: transformers for image recognition at scale. In: ICLR (2021)"},{"key":"25_CR17","unstructured":"Fan, A., Grave, E., Joulin, A.: Reducing transformer depth on demand with structured dropout. In: ICLR (2020)"},{"key":"25_CR18","doi-asserted-by":"crossref","unstructured":"Fang, G., Ma, X., Song, M., Mi, M.B., Wang, X.: Depgraph: towards any structural pruning. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01544"},{"key":"25_CR19","unstructured":"Fournier, Q., Caron, G.M., Aloise, D.: A practical survey on faster and lighter transformers. arXiv preprint arXiv:2103.14636 (2021)"},{"key":"25_CR20","doi-asserted-by":"publisher","first-page":"154","DOI":"10.1016\/j.neucom.2020.10.113","volume":"433","author":"M Gao","year":"2021","unstructured":"Gao, M., Wang, Y., Wan, L.: Residual error based knowledge distillation. Neurocomputing 433, 154\u2013161 (2021)","journal-title":"Neurocomputing"},{"key":"25_CR21","doi-asserted-by":"crossref","unstructured":"Gou, J., Yu, B., Maybank, S.J., Tao, D.: Knowledge distillation: a survey. In: IJCV (2021)","DOI":"10.1007\/s11263-021-01453-z"},{"key":"25_CR22","unstructured":"Guo, Y., Yao, A., Chen, Y.: Dynamic network surgery for efficient dnns. In: NeurIPS (2016)"},{"key":"25_CR23","unstructured":"Han, C., et\u00a0al.: Prototypical transformer as unified motion learners. In: ICML (2024)"},{"key":"25_CR24","doi-asserted-by":"crossref","unstructured":"Han, C., et al: An effective and efficient approach for visual prompt tuning. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01604"},{"key":"25_CR25","unstructured":"Han, C., et al.: Facing the elephant in the room: visual prompt tuning or full finetuning? In: ICLR (2024)"},{"key":"25_CR26","unstructured":"Han, S., Mao, H., Dally, W.J.: Deep compression: compressing deep neural networks with pruning, trained quantization and huffman coding. arXiv preprint arXiv:1510.00149 (2015)"},{"key":"25_CR27","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"25_CR28","doi-asserted-by":"crossref","unstructured":"He, T., Shen, C., Tian, Z., Gong, D., Sun, C., Yan, Y.: Knowledge adaptation for efficient semantic segmentation. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00067"},{"key":"25_CR29","unstructured":"He, X., Li, C., Zhang, P., Yang, J., Wang, X.E.: Parameter-efficient fine-tuning for vision transformers. arXiv preprint arXiv:2203.16329 (2022)"},{"key":"25_CR30","doi-asserted-by":"crossref","unstructured":"Heo, B., Lee, M., Yun, S., Choi, J.Y.: Knowledge transfer via distillation of activation boundaries formed by hidden neurons. In: AAAI (2019)","DOI":"10.1609\/aaai.v33i01.33013779"},{"key":"25_CR31","unstructured":"Hinton, G., Vinyals, O., Dean, J.: Distilling the knowledge in a neural network. arXiv preprint arXiv:1503.02531 (2015)"},{"key":"25_CR32","unstructured":"Hou, L., Huang, Z., Shang, L., Jiang, X., Chen, X., Liu, Q.: Dynabert: dynamic bert with adaptive width and depth. In: NeurIPS (2020)"},{"key":"25_CR33","unstructured":"Howard, A.G., et al.: Mobilenets: efficient convolutional neural networks for mobile vision applications. arXiv preprint arXiv:1704.04861 (2017)"},{"key":"25_CR34","unstructured":"Huang, Z., Wang, N.: Like what you like: Knowledge distill via neuron selectivity transfer. arXiv preprint arXiv:1707.01219 (2017)"},{"key":"25_CR35","unstructured":"Islam, K.: Recent advances in vision transformer: a survey and outlook of recent work. arXiv preprint arXiv:2203.01536 (2022)"},{"key":"25_CR36","doi-asserted-by":"crossref","unstructured":"Jia, M., et al.: Visual prompt tuning. In: ECCV (2022)","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"25_CR37","doi-asserted-by":"crossref","unstructured":"Jin, X., et al.: Knowledge distillation via route constrained optimization. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00143"},{"key":"25_CR38","unstructured":"Kim, J., Park, S., Kwak, N.: Paraphrasing complex network: Network compression via factor transfer. In: NeurIPS (2018)"},{"key":"25_CR39","doi-asserted-by":"crossref","unstructured":"Kim, J., Lee, H., Woo, S.S.: IMF: integrating matched features using attentive logit in knowledge distillation. In: IJCAI (2023)","DOI":"10.24963\/ijcai.2023\/108"},{"key":"25_CR40","unstructured":"Kim, S.W., Kim, H.E.: Transferring knowledge to smaller network with class-distance loss (2017)"},{"key":"25_CR41","doi-asserted-by":"crossref","unstructured":"Kim, T., Oh, J., Kim, N., Cho, S., Yun, S.Y.: Comparing kullback-leibler divergence and mean squared error loss in knowledge distillation. arXiv preprint arXiv:2105.08919 (2021)","DOI":"10.24963\/ijcai.2021\/362"},{"key":"25_CR42","doi-asserted-by":"crossref","unstructured":"Kolesnikov, A., et al.: Big transfer (bit): general visual representation learning. In: ECCV (2020)","DOI":"10.1007\/978-3-030-58558-7_29"},{"key":"25_CR43","unstructured":"Krizhevsky, A., Hinton, G., et\u00a0al.: Learning multiple layers of features from tiny images (2009)"},{"key":"25_CR44","unstructured":"Li, H., Kadav, A., Durdanovic, I., Samet, H., Graf, H.P.: Pruning filters for efficient convnets. arXiv preprint arXiv:1608.08710 (2016)"},{"key":"25_CR45","unstructured":"Li, Y., et al.: Efficientformer: vision transformers at mobilenet speed. In: NeurIPS (2022)"},{"key":"25_CR46","doi-asserted-by":"crossref","unstructured":"Li, Z., Li, X., Yang, L., Zhao, B., Song, R., Luo, L., Li, J., Yang, J.: Curriculum temperature for knowledge distillation. In: AAAI (2023)","DOI":"10.1609\/aaai.v37i2.25236"},{"key":"25_CR47","doi-asserted-by":"crossref","unstructured":"Liu, C., Tao, C., Feng, J., Zhao, D.: Multi-granularity structural knowledge distillation for language model compression. In: ACL (2022)","DOI":"10.18653\/v1\/2022.acl-long.71"},{"key":"25_CR48","unstructured":"Liu, X., Li, L., Li, C., Yao, A.: Norm: knowledge distillation via n-to-one representation matching. In: ICLR (2023)"},{"key":"25_CR49","unstructured":"Liu, Y., et al.: Roberta: a robustly optimized bert pretraining approach. In: ICLR (2020)"},{"key":"25_CR50","doi-asserted-by":"crossref","unstructured":"Liu, Z., et\u00a0al.: Swin transformer v2: scaling up capacity and resolution. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01170"},{"key":"25_CR51","doi-asserted-by":"crossref","unstructured":"Liu, Z., et al.: Swin transformer: hierarchical vision transformer using shifted windows. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"25_CR52","unstructured":"Loshchilov, I., Hutter, F.: Decoupled weight decay regularization. In: ICML (2017)"},{"key":"25_CR53","unstructured":"Ma, X., Fang, G., Wang, X.: Llm-pruner: on the structural pruning of large language models. arXiv preprint arXiv:2305.11627 (2023)"},{"key":"25_CR54","unstructured":"Michel, P., Levy, O., Neubig, G.: Are sixteen heads really better than one? In: NeurIPS (2019)"},{"key":"25_CR55","doi-asserted-by":"crossref","unstructured":"Mirzadeh, S.I., Farajtabar, M., Li, A., Levine, N., Matsukawa, A., Ghasemzadeh, H.: Improved knowledge distillation via teacher assistant. In: AAAI (2020)","DOI":"10.1609\/aaai.v34i04.5963"},{"key":"25_CR56","unstructured":"M\u00fcller, R., Kornblith, S., Hinton, G.E.: When does label smoothing help? In: NeurIPS (2019)"},{"key":"25_CR57","doi-asserted-by":"crossref","unstructured":"Ni, Z., Yang, F., Wen, S., Zhang, G.: Dual relation knowledge distillation for object detection. arXiv preprint arXiv:2302.05637 (2023)","DOI":"10.24963\/ijcai.2023\/142"},{"key":"25_CR58","doi-asserted-by":"crossref","unstructured":"Pan, X., Xia, Z., Song, S., Li, L.E., Huang, G.: 3d object detection with pointformer. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00738"},{"key":"25_CR59","unstructured":"Park, S., Lee, J., Mo, S., Shin, J.: Lookahead: a far-sighted alternative of magnitude-based pruning. arXiv preprint arXiv:2002.04809 (2020)"},{"key":"25_CR60","doi-asserted-by":"crossref","unstructured":"Park, W., Kim, D., Lu, Y., Cho, M.: Relational knowledge distillation. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00409"},{"key":"25_CR61","doi-asserted-by":"crossref","unstructured":"Passalis, N., Tzelepi, M., Tefas, A.: Heterogeneous knowledge distillation using information flow modeling. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00241"},{"key":"25_CR62","doi-asserted-by":"crossref","unstructured":"Passban, P., Wu, Y., Rezagholizadeh, M., Liu, Q.: Alp-kd: Attention-based layer projection for knowledge distillation. In: AAAI (2021)","DOI":"10.1609\/aaai.v35i15.17610"},{"key":"25_CR63","unstructured":"Paszke, A., et al.: Pytorch: an imperative style, high-performance deep learning library. In: NeurIPS (2019)"},{"key":"25_CR64","doi-asserted-by":"crossref","unstructured":"Peng, B., et al.: Correlation congruence for knowledge distillation. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00511"},{"issue":"140","key":"25_CR65","first-page":"1","volume":"21","author":"C Raffel","year":"2020","unstructured":"Raffel, C., et al.: Exploring the limits of transfer learning with a unified text-to-text transformer. J. Mach. Learn. Res. 21(140), 1\u201367 (2020)","journal-title":"J. Mach. Learn. Res."},{"key":"25_CR66","doi-asserted-by":"crossref","unstructured":"Ren, S., Gao, Z., Hua, T., Xue, Z., Tian, Y., He, S., Zhao, H.: Co-advise: cross inductive bias distillation. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01627"},{"key":"25_CR67","unstructured":"Romero, A., Ballas, N., Kahou, S.E., Chassang, A., Gatta, C., Bengio, Y.: Fitnets: hints for thin deep nets. arXiv preprint arXiv:1412.6550 (2014)"},{"issue":"3","key":"25_CR68","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky, O., et al.: ImageNet large scale visual recognition challenge. IJCV 115(3), 211\u2013252 (2015)","journal-title":"IJCV"},{"key":"25_CR69","doi-asserted-by":"crossref","unstructured":"Sandler, M., Howard, A., Zhu, M., Zhmoginov, A., Chen, L.C.: Mobilenetv2: inverted residuals and linear bottlenecks. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00474"},{"key":"25_CR70","doi-asserted-by":"crossref","unstructured":"Shu, C., Liu, Y., Gao, J., Yan, Z., Shen, C.: Channel-wise knowledge distillation for dense prediction. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00526"},{"key":"25_CR71","doi-asserted-by":"crossref","unstructured":"Son, W., Na, J., Choi, J., Hwang, W.: Densely guided knowledge distillation using multiple teacher assistants. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00926"},{"key":"25_CR72","doi-asserted-by":"crossref","unstructured":"Strudel, R., Garcia, R., Laptev, I., Schmid, C.: Segmenter: transformer for semantic segmentation. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00717"},{"key":"25_CR73","unstructured":"Tian, Y., Krishnan, D., Isola, P.: Contrastive representation distillation. In: ICLR (2019)"},{"issue":"2","key":"25_CR74","doi-asserted-by":"publisher","first-page":"1372","DOI":"10.1109\/TPAMI.2022.3159581","volume":"45","author":"Z Tian","year":"2022","unstructured":"Tian, Z., et al.: Adaptive perspective distillation for semantic segmentation. IEEE TPAMI 45(2), 1372\u20131387 (2022)","journal-title":"IEEE TPAMI"},{"key":"25_CR75","unstructured":"Touvron, H., Cord, M., Douze, M., Massa, F., Sablayrolles, A., J\u00e9gou, H.: Training data-efficient image transformers & distillation through attention. In: ICML (2021)"},{"key":"25_CR76","doi-asserted-by":"crossref","unstructured":"Tung, F., Mori, G.: Similarity-preserving knowledge distillation. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00145"},{"key":"25_CR77","doi-asserted-by":"crossref","unstructured":"Van\u00a0Erven, T., Harremos, P.: R\u00e9nyi divergence and kullback-leibler divergence. In: IEEE TIT (2014)","DOI":"10.1109\/TIT.2014.2320500"},{"key":"25_CR78","unstructured":"Vaswani, A., et al.: Attention is all you need. In: NeurIPS (2017)"},{"key":"25_CR79","doi-asserted-by":"crossref","unstructured":"Wang, H., Zhu, Y., Adam, H., Yuille, A., Chen, L.C.: Max-deeplab: end-to-end panoptic segmentation with mask transformers. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00542"},{"key":"25_CR80","unstructured":"Wang, W., Han, C., Zhou, T., Liu, D.: Visual recognition with deep nearest centroids. In: ICLR (2023)"},{"key":"25_CR81","doi-asserted-by":"crossref","unstructured":"Wang, W., Wei, F., Dong, L., Bao, H., Yang, N., Zhou, M.: Minilm: deep self-attention distillation for task-agnostic compression of pre-trained transformers. In: NeurIPS (2020)","DOI":"10.18653\/v1\/2021.findings-acl.188"},{"key":"25_CR82","doi-asserted-by":"crossref","unstructured":"Wang, X., Fu, T., Liao, S., Wang, S., Lei, Z., Mei, T.: Exclusivity-consistency regularized knowledge distillation for face recognition. In: ECCV (2020)","DOI":"10.1007\/978-3-030-58586-0_20"},{"key":"25_CR83","doi-asserted-by":"crossref","unstructured":"Wang, Y., et al.: End-to-end video instance segmentation with transformers. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00863"},{"key":"25_CR84","doi-asserted-by":"crossref","unstructured":"Wu, S., Chen, H., Quan, X., Wang, Q., Wang, R.: Ad-kd: attribution-driven knowledge distillation for language model compression. In: ACL (2023)","DOI":"10.18653\/v1\/2023.acl-long.471"},{"key":"25_CR85","doi-asserted-by":"crossref","unstructured":"Wu, Y., Rezagholizadeh, M., Ghaddar, A., Haidar, M.A., Ghodsi, A.: Universal-kd: attention-based output-grounded intermediate layer knowledge distillation. In: EMNLP (2021)","DOI":"10.18653\/v1\/2021.emnlp-main.603"},{"key":"25_CR86","doi-asserted-by":"crossref","unstructured":"Xia, M., Zhong, Z., Chen, D.: Structured pruning learns compact and accurate models. In: ACL (2022)","DOI":"10.18653\/v1\/2022.acl-long.107"},{"key":"25_CR87","doi-asserted-by":"crossref","unstructured":"Yan, L., Han, C., Xu, Z., Liu, D., Wang, Q.: Prompt learns prompt: exploring knowledge-aware generative prompt collaboration for video captioning. In: IJCAI (2023)","DOI":"10.24963\/ijcai.2023\/180"},{"key":"25_CR88","unstructured":"Yang, Z., Li, Z., Zeng, A., Li, Z., Yuan, C., Li, Y.: ViTKD: practical guidelines for ViT feature knowledge distillation. arXiv preprint arXiv:2209.02432 (2022)"},{"key":"25_CR89","unstructured":"Yao, X., ZHANG, Y., Chen, Z., Jia, J., Yu, B.: Distill vision transformers to CNNs via low-rank representation approximation (2022)"},{"key":"25_CR90","doi-asserted-by":"crossref","unstructured":"Yim, J., Joo, D., Bae, J., Kim, J.: A gift from knowledge distillation: fast optimization, network minimization and transfer learning. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.754"},{"key":"25_CR91","doi-asserted-by":"crossref","unstructured":"You, S., Xu, C., Xu, C., Tao, D.: Learning from multiple teacher networks. In: SIGKDD (2017)","DOI":"10.1145\/3097983.3098135"},{"key":"25_CR92","unstructured":"You, Z., Yan, K., Ye, J., Ma, M., Wang, P.: Gate decorator: global filter pruning method for accelerating deep convolutional neural networks. In: NeurIPS (2019)"},{"key":"25_CR93","doi-asserted-by":"crossref","unstructured":"Yu, L., Yazici, V.O., Liu, X., Weijer, J.V.D., Cheng, Y., Ramisa, A.: Learning metrics from teachers: compact networks for image embedding. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00302"},{"key":"25_CR94","doi-asserted-by":"crossref","unstructured":"Yu, R., et al.: NISP: pruning networks using neuron importance score propagation. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00958"},{"key":"25_CR95","unstructured":"Yuan, L., et\u00a0al.: Florence: a new foundation model for computer vision. arXiv preprint arXiv:2111.11432 (2021)"},{"key":"25_CR96","doi-asserted-by":"crossref","unstructured":"Yuan, Z., Song, X., Bai, L., Wang, Z., Ouyang, W.: Temporal-channel transformer for 3d lidar-based video object detection for autonomous driving. In: IEEE TCSVT (2021)","DOI":"10.1109\/TCSVT.2021.3082763"},{"key":"25_CR97","unstructured":"Zagoruyko, S., Komodakis, N.: Paying more attention to attention: improving the performance of convolutional neural networks via attention transfer. arXiv preprint arXiv:1612.03928 (2016)"},{"key":"25_CR98","doi-asserted-by":"crossref","unstructured":"Zhang, C., Wan, H., Shen, X., Wu, Z.: Patchformer: an efficient point transformer with patch attention. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01150"},{"key":"25_CR99","doi-asserted-by":"crossref","unstructured":"Zhang, L., Ma, K.: Structured knowledge distillation for accurate and efficient object detection. In: IEEE TPAMI (2023)","DOI":"10.1109\/TPAMI.2023.3300470"},{"key":"25_CR100","doi-asserted-by":"crossref","unstructured":"Zhao, B., Cui, Q., Song, R., Qiu, Y., Liang, J.: Decoupled knowledge distillation. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01165"},{"key":"25_CR101","doi-asserted-by":"crossref","unstructured":"Zhao, B., Song, R., Liang, J.: Cumulative spatial knowledge distillation for vision transformers. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00565"},{"key":"25_CR102","doi-asserted-by":"crossref","unstructured":"Zheng, S., et\u00a0al.: Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00681"},{"key":"25_CR103","unstructured":"Zhixing, D., Zhang, R., Chang, M., Liu, S., Chen, T., Chen, Y., et\u00a0al.: Distilling object detectors with feature richness. In: NeurIPS (2021)"},{"key":"25_CR104","unstructured":"Zhu, X., Su, W., Lu, L., Li, B., Wang, X., Dai, J.: Deformable detr: deformable transformers for end-to-end object detection. In: ICLR (2021)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-73650-6_25","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,20]],"date-time":"2024-11-20T19:08:16Z","timestamp":1732129696000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-73650-6_25"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,21]]},"ISBN":["9783031736490","9783031736506"],"references-count":104,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-73650-6_25","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,21]]},"assertion":[{"value":"21 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}