{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,27]],"date-time":"2026-03-27T09:11:59Z","timestamp":1774602719092,"version":"3.50.1"},"reference-count":81,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2026,2,21]],"date-time":"2026-02-21T00:00:00Z","timestamp":1771632000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,2,21]],"date-time":"2026-02-21T00:00:00Z","timestamp":1771632000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100014219","name":"National Science Fund for Distinguished Young Scholars","doi-asserted-by":"publisher","award":["(No. 62025603)"],"award-info":[{"award-number":["(No. 62025603)"]}],"id":[{"id":"10.13039\/501100014219","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["(No. U21B2037"],"award-info":[{"award-number":["(No. U21B2037"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. U22B2051"],"award-info":[{"award-number":["No. U22B2051"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. U23A20383"],"award-info":[{"award-number":["No. U23A20383"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. U21A20472"],"award-info":[{"award-number":["No. U21A20472"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 62176222"],"award-info":[{"award-number":["No. 62176222"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 62176223"],"award-info":[{"award-number":["No. 62176223"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 62176226"],"award-info":[{"award-number":["No. 62176226"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 62072386"],"award-info":[{"award-number":["No. 62072386"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 62072387"],"award-info":[{"award-number":["No. 62072387"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 62072389"],"award-info":[{"award-number":["No. 62072389"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 62002305"],"award-info":[{"award-number":["No. 62002305"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 62272401)"],"award-info":[{"award-number":["No. 62272401)"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Natural Science Foundation of Fujian Province of China","award":["(No. 2021J06003, No.2022J06001)"],"award-info":[{"award-number":["(No. 2021J06003, No.2022J06001)"]}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["(Xiamen University: No. 20720240053)"],"award-info":[{"award-number":["(Xiamen University: No. 20720240053)"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2026,3]]},"DOI":"10.1007\/s11263-025-02702-1","type":"journal-article","created":{"date-parts":[[2026,2,21]],"date-time":"2026-02-21T07:39:30Z","timestamp":1771659570000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Not All Attention is Needed: Parameter and Computation Efficient Tuning for Multi-modal Large Language Models via Effective Attention Skipping"],"prefix":"10.1007","volume":"134","author":[{"given":"Qiong","family":"Wu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yiyi","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Weihao","family":"Ye","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaoshuai","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9163-2932","authenticated-orcid":false,"given":"Rongrong","family":"Ji","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,2,21]]},"reference":[{"key":"2702_CR1","doi-asserted-by":"publisher","first-page":"235","DOI":"10.1023\/A:1013689704352","volume":"47","author":"P Auer","year":"2002","unstructured":"Auer, P., Cesa-Bianchi, N., & Fischer, P. (2002). Finite-time analysis of the multiarmed bandit problem. Machine Learning,47, 235\u2013256.","journal-title":"Machine Learning"},{"key":"2702_CR2","doi-asserted-by":"publisher","first-page":"23716","DOI":"10.52202\/068431-1723","volume":"35","author":"J-B Alayrac","year":"2022","unstructured":"Alayrac, J.-B., Donahue, J., Luc, P., Miech, A., Barr, I., Hasson, Y., Lenc, K., Mensch, A., Millican, K., Reynolds, M., et al. (2022). Flamingo: A visual language model for few-shot learning. Advances in Neural Information Processing Systems,35, 23716\u201323736.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2702_CR3","unstructured":"Bao, H., Dong, L., Piao, S., Wei, F.: Beit: BERT pre-training of image transformers. In: ICLR (2022)"},{"key":"2702_CR4","first-page":"1877","volume":"33","author":"T Brown","year":"2020","unstructured":"Brown, T., Mann, B., Ryder, N., Subbiah, M., Kaplan, J. D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al. (2020). Language models are few-shot learners. Advances in Neural Information Processing Systems,33, 1877\u20131901.","journal-title":"Advances in Neural Information Processing Systems"},{"issue":"4","key":"2702_CR5","doi-asserted-by":"publisher","first-page":"1108","DOI":"10.1007\/s11263-023-01904-9","volume":"132","author":"A Bulat","year":"2024","unstructured":"Bulat, A., & Tzimiropoulos, G. (2024). Language-aware soft prompting: Text-to-text optimization for few- and zero-shot adaptation of V & l models. International Journal of Computer Vision,132(4), 1108\u20131125.","journal-title":"International Journal of Computer Vision"},{"key":"2702_CR6","first-page":"32897","volume":"35","author":"H Bao","year":"2022","unstructured":"Bao, H., Wang, W., Dong, L., Liu, Q., Mohammed, O. K., Aggarwal, K., Som, S., Piao, S., & Wei, F. (2022). Vlmo: Unified vision-language pre-training with mixture-of-modality-experts. Advances in Neural Information Processing Systems,35, 32897\u201332912.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2702_CR7","unstructured":"Cho, J., Lei, J., Tan, H., Bansal, M.: Unifying vision-and-language tasks via text generation. In: International Conference on Machine Learning, pp. 1931\u20131942 (2021). PMLR"},{"key":"2702_CR8","first-page":"1691","volume":"119","author":"M Chen","year":"2020","unstructured":"Chen, M., Radford, A., Child, R., Wu, J., Jun, H., Luan, D., & Sutskever, I. (2020). Generative pretraining from pixels. In: ICML. Proceedings of Machine Learning Research,119, 1691\u20131703.","journal-title":"In: ICML. Proceedings of Machine Learning Research"},{"key":"2702_CR9","doi-asserted-by":"crossref","unstructured":"Chen, Z., Wu, J., Wang, W., Su, W., Chen, G., Xing, S., Muyan, Z., Zhang, Q., Zhu, X., Lu, L., et al.: Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks. arXiv preprint arXiv:2312.14238 (2023)","DOI":"10.1109\/CVPR52733.2024.02283"},{"key":"2702_CR10","doi-asserted-by":"crossref","unstructured":"Chen, L., Zhao, H., Liu, T., Bai, S., Lin, J., Zhou, C., Chang, B.: An image is worth 1\/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models. In: European Conference on Computer Vision, pp. 19\u201335 (2024). Springer","DOI":"10.1007\/978-3-031-73004-7_2"},{"key":"2702_CR11","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., Houlsby, N.: An image is worth 16x16 words: Transformers for image recognition at scale. In: ICLR (2021)"},{"key":"2702_CR12","unstructured":"Dong, Y., Cordonnier, J.-B., Loukas, A.: Attention is not all you need: Pure attention loses rank doubly exponentially with depth. In: International Conference on Machine Learning, pp. 2793\u20132803 (2021). PMLR"},{"issue":"8","key":"2702_CR13","first-page":"4065","volume":"44","author":"J Dong","year":"2021","unstructured":"Dong, J., Li, X., Xu, C., Yang, X., Yang, G., Wang, X., & Wang, M. (2021). Dual encoding for video retrieval by text. IEEE Transactions on Pattern Analysis and Machine Intelligence,44(8), 4065\u20134080.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2702_CR14","doi-asserted-by":"publisher","first-page":"10088","DOI":"10.52202\/075280-0441","volume":"36","author":"T Dettmers","year":"2023","unstructured":"Dettmers, T., Pagnoni, A., Holtzman, A., & Zettlemoyer, L. (2023). Qlora: Efficient finetuning of quantized llms. Advances in Neural Information Processing Systems,36, 10088\u201310115.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2702_CR15","doi-asserted-by":"crossref","unstructured":"Dou, Z.-Y., Xu, Y., Gan, Z., Wang, J., Wang, S., Wang, L., Zhu, C., Zhang, P., Yuan, L., Peng, N., et al.: An empirical study of training end-to-end vision-and-language transformers. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 18166\u201318176 (2022)","DOI":"10.1109\/CVPR52688.2022.01763"},{"key":"2702_CR16","doi-asserted-by":"crossref","unstructured":"Gao, P., Geng, S., Zhang, R., Ma, T., Fang, R., Zhang, Y., Li, H., Qiao, Y.: Clip-adapter: Better vision-language models with feature adapters. IJCV, 1\u201315 (2023)","DOI":"10.1007\/s11263-023-01891-x"},{"key":"2702_CR17","unstructured":"Gao, P., Han, J., Zhang, R., Lin, Z., Geng, S., Zhou, A., Zhang, W., Lu, P., He, C., Yue, X., et al.: Llama-adapter v2: Parameter-efficient visual instruction model. arXiv preprint arXiv:2304.15010 (2023)"},{"issue":"4","key":"2702_CR18","doi-asserted-by":"publisher","first-page":"398","DOI":"10.1007\/s11263-018-1116-0","volume":"127","author":"Y Goyal","year":"2019","unstructured":"Goyal, Y., Khot, T., Agrawal, A., Summers-Stay, D., Batra, D., & Parikh, D. (2019). Making the V in VQA matter: Elevating the role of image understanding in visual question answering. International Journal of Computer Vision,127(4), 398\u2013414.","journal-title":"International Journal of Computer Vision"},{"key":"2702_CR19","doi-asserted-by":"crossref","unstructured":"Goyal, Y., Khot, T., Summers-Stay, D., Batra, D., Parikh, D.: Making the V in VQA matter: Elevating the role of image understanding in visual question answering. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6325\u20136334 (2017)","DOI":"10.1109\/CVPR.2017.670"},{"key":"2702_CR20","doi-asserted-by":"crossref","unstructured":"Goyal, Y., Khot, T., Summers-Stay, D., Batra, D., Parikh, D.: Making the v in vqa matter: Elevating the role of image understanding in visual question answering. In: CVPR, pp. 6904\u20136913 (2017)","DOI":"10.1109\/CVPR.2017.670"},{"issue":"7","key":"2702_CR21","doi-asserted-by":"publisher","first-page":"6238","DOI":"10.1109\/TCSVT.2024.3358415","volume":"34","author":"D Guo","year":"2024","unstructured":"Guo, D., Li, K., Hu, B., Zhang, Y., & Wang, M. (2024). Benchmarking micro-action recognition: Dataset, method, and application. IEEE Transactions on Circuits and Systems for Video Technology,34(7), 6238\u20136252.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"2702_CR22","unstructured":"Houlsby, N., Giurgiu, A., Jastrzebski, S., Morrone, B., De\u00a0Laroussilhe, Q., Gesmundo, A., Attariyan, M., Gelly, S.: Parameter-efficient transfer learning for nlp. In: International Conference on Machine Learning, pp. 2790\u20132799 (2019). PMLR"},{"key":"2702_CR23","unstructured":"Han, Y., Liu, X., Ding, P., Wang, D., Chen, H., Yan, Q., Huang, S.: Rethinking token reduction in mllms: Towards a unified paradigm for training-free acceleration. arXiv preprint arXiv:2411.17686 (2024)"},{"key":"2702_CR24","unstructured":"Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W.: Lora: Low-rank adaptation of large language models. In: International Conference on Learning Representations (Int. Conf. Learn. Represent.) (2022)"},{"key":"2702_CR25","unstructured":"Hu, E.J., shen, Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W.: LoRA: Low-rank adaptation of large language models. In: Int. Conf. Learn. Represent. (2022)"},{"key":"2702_CR26","unstructured":"He, J., Zhou, C., Ma, X., Berg-Kirkpatrick, T., Neubig, G.: Towards a unified view of parameter-efficient transfer learning. In: International Conference on Learning Representations (Int. Conf. Learn. Represent.) (2022)"},{"issue":"1","key":"2702_CR27","doi-asserted-by":"publisher","first-page":"185","DOI":"10.1007\/s11263-023-01858-y","volume":"132","author":"J Jiang","year":"2024","unstructured":"Jiang, J., Liu, Z., & Zheng, N. (2024). Correlation information bottleneck: Towards adapting pretrained multimodal models for robust visual question answering. International Journal of Computer Vision,132(1), 185\u2013207.","journal-title":"International Journal of Computer Vision"},{"key":"2702_CR28","doi-asserted-by":"crossref","unstructured":"Jia, M., Tang, L., Chen, B.-C., Cardie, C., Belongie, S., Hariharan, B., Lim, S.-N.: Visual prompt tuning. In: ECCV, pp. 709\u2013727 (2022). Springer","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"2702_CR29","doi-asserted-by":"crossref","unstructured":"Jia, M., Tang, L., Chen, B., Cardie, C., Belongie, S.J., Hariharan, B., Lim, S.: Visual prompt tuning. In: European Conference on Computer Vision (ECCV), pp. 709\u2013727 (2022)","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"2702_CR30","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Fei-Fei, L.: Deep visual-semantic alignments for generating image descriptions. IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI \/ PAMI), 664\u2013676 (2017)","DOI":"10.1109\/TPAMI.2016.2598339"},{"key":"2702_CR31","doi-asserted-by":"publisher","first-page":"36187","DOI":"10.52202\/075280-1569","volume":"36","author":"J Kim","year":"2023","unstructured":"Kim, J., Lee, J. H., Kim, S., Park, J., Yoo, K. M., Kwon, S. J., & Lee, D. (2023). Memory-efficient fine-tuning of compressed large language models via sub-4-bit integer quantization. Advances in Neural Information Processing Systems,36, 36187\u201336207.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2702_CR32","first-page":"1022","volume":"34","author":"R Karimi Mahabadi","year":"2021","unstructured":"Karimi Mahabadi, R., Henderson, J., & Ruder, S. (2021). Compacter: Efficient low-rank hypercomplex adapter layers. Advances in Neural Information Processing Systems,34, 1022\u20131035.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2702_CR33","unstructured":"Krishnamoorthi, R.: Quantizing deep convolutional networks for efficient inference: A whitepaper. arXiv preprint arXiv: 1806.08342 (2018)"},{"key":"2702_CR34","unstructured":"Kim, W., Son, B., Kim, I.: Vilt: Vision-and-language transformer without convolution or region supervision. In: International Conference on Machine Learning (ICML), pp. 5583\u20135594 (2021)"},{"key":"2702_CR35","unstructured":"Kenton, J.D.M.-W.C., Toutanova, L.K.: Bert: Pre-training of deep bidirectional transformers for language understanding. In: NAACL-HLT, pp. 4171\u20134186 (2019)"},{"key":"2702_CR36","unstructured":"Lu, J., Batra, D., Parikh, D., Lee, S.: Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. Adv. Neural Inform. Process. Syst. 32 (2019)"},{"key":"2702_CR37","unstructured":"Luo, G., Huang, M., Zhou, Y., Sun, X., Jiang, G., Wang, Z., Ji, R.: Towards efficient visual adaption via structural re-parameterization. arXiv preprint arXiv:2302.08106 (2023)"},{"key":"2702_CR38","doi-asserted-by":"crossref","unstructured":"Li, X.L., Liang, P.: Prefix-tuning: Optimizing continuous prompts for generation. In: ACL, pp. 4582\u20134597 (2021)","DOI":"10.18653\/v1\/2021.acl-long.353"},{"key":"2702_CR39","doi-asserted-by":"crossref","unstructured":"Li, X.L., Liang, P.: Prefix-tuning: Optimizing continuous prompts for generation. In: Annual Meeting of the Association for Computational Linguistics (ACL), pp. 4582\u20134597 (2021)","DOI":"10.18653\/v1\/2021.acl-long.353"},{"key":"2702_CR40","doi-asserted-by":"crossref","unstructured":"Liu, H., Li, C., Li, Y., Lee, Y.J.: Improved baselines with visual instruction tuning. arXiv preprint arXiv:2310.03744 (2023)","DOI":"10.1109\/CVPR52733.2024.02484"},{"key":"2702_CR41","unstructured":"Li, J., Li, D., Savarese, S., Hoi, S.: Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. In: International Conference on Machine Learning (2023)"},{"key":"2702_CR42","unstructured":"Li, J., Li, D., Savarese, S., Hoi, S.C.H.: BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models. In: ICML. Proceedings of Machine Learning Research, vol. 202, pp. 19730\u201319742 (2023)"},{"key":"2702_CR43","unstructured":"Liu, H., Li, C., Wu, Q., Lee, Y.J.: Visual instruction tuning. arXiv preprint arXiv:2304.08485 (2023)"},{"key":"2702_CR44","unstructured":"Liu, H., Li, C., Wu, Q., Lee, Y.J.: Visual instruction tuning. In: NeruIPS (2023)"},{"key":"2702_CR45","first-page":"2507","volume":"35","author":"P Lu","year":"2022","unstructured":"Lu, P., Mishra, S., Xia, T., Qiu, L., Chang, K.-W., Zhu, S.-C., Tafjord, O., Clark, P., & Kalyan, A. (2022). Learn to explain: Multimodal reasoning via thought chains for science question answering. Advances in Neural Information Processing Systems,35, 2507\u20132521.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2702_CR46","unstructured":"Liu, Y., Ott, M., Goyal, N., Du, J., Joshi, M., Chen, D., Levy, O., Lewis, M., Zettlemoyer, L., Stoyanov, V.: Roberta: A robustly optimized bert pretraining approach. arXiv preprint arXiv:1907.11692 (2019)"},{"key":"2702_CR47","unstructured":"Lin, B., Tang, Z., Ye, Y., Cui, J., Zhu, B., Jin, P., Zhang, J., Ning, M., Yuan, L.: Moe-llava: Mixture of experts for large vision-language models. Computing Research Repository (CoRR) (2024)"},{"key":"2702_CR48","doi-asserted-by":"crossref","unstructured":"Luo, G., Yang, X., Dou, W., Wang, Z., Liu, J., Dai, J., Qiao, Y., Zhu, X.: Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training. arXiv preprint arXiv:2410.08202 (2024)","DOI":"10.1109\/CVPR52734.2025.02324"},{"key":"2702_CR49","unstructured":"Li, L.H., Yatskar, M., Yin, D., Hsieh, C.-J., Chang, K.-W.: Visualbert: A simple and performant baseline for vision and language. arXiv preprint arXiv:1908.03557 (2019)"},{"key":"2702_CR50","first-page":"29615","volume":"36","author":"G Luo","year":"2023","unstructured":"Luo, G., Zhou, Y., Ren, T., Chen, S., Sun, X., & Ji, R. (2023). Cheap and quick: Efficient vision-language instruction tuning for large language models. Advances in Neural Information Processing Systems,36, 29615.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2702_CR51","first-page":"3386","volume":"31","author":"G Luo","year":"2022","unstructured":"Luo, G., Zhou, Y., Sun, X., Wang, Y., Cao, L., Wu, Y., Huang, F., & Ji, R. (2022). Towards lightweight transformer via group-wise transformation for vision-and-language tasks. TIP,31, 3386\u20133398.","journal-title":"TIP"},{"key":"2702_CR52","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11263-023-01871-1","volume":"132","author":"G Luo","year":"2023","unstructured":"Luo, G., Zhou, Y., Sun, X., Wu, Y., Gao, Y., & Ji, R. (2023). Towards language-guided visual recognition via dynamic convolutions. International Journal of Computer Vision,132, 1\u201319.","journal-title":"International Journal of Computer Vision"},{"key":"2702_CR53","doi-asserted-by":"crossref","unstructured":"Liu, B., Zhan, L., Xu, L., Ma, L., Yang, Y. & Wu, X. (2021). Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering. In: ISBI, pp. 1650\u20131654. IEEE.","DOI":"10.1109\/ISBI48211.2021.9434010"},{"key":"2702_CR54","first-page":"17629","volume":"33","author":"F Meng","year":"2020","unstructured":"Meng, F., Cheng, H., Li, K., Luo, H., Guo, X., Lu, G., & Sun, X. (2020). Pruning filter in filter. Adv. Neural Inform. Process. Syst.,33, 17629\u201317640.","journal-title":"Adv. Neural Inform. Process. Syst."},{"key":"2702_CR55","first-page":"20989","volume":"33","author":"A Martins","year":"2020","unstructured":"Martins, A., Farinhas, A., Treviso, M., Niculae, V., Aguiar, P., & Figueiredo, M. (2020). Sparse and continuous attention mechanisms. Advances in Neural Information Processing Systems,33, 20989\u201321001.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2702_CR56","doi-asserted-by":"crossref","unstructured":"Marino, K., Rastegari, M., Farhadi, A. & Mottaghi, R. (2019). Ok-vqa: A visual question answering benchmark requiring external knowledge. In: CVPR, pp. 3195\u20133204.","DOI":"10.1109\/CVPR.2019.00331"},{"key":"2702_CR57","unstructured":"OpenAI, R. (2023). Gpt-4 technical report. arXiv preprint arXiv:2303.08774."},{"key":"2702_CR58","doi-asserted-by":"crossref","unstructured":"Plummer, B.A., Wang, L., Cervantes, C.M., Caicedo, J.C., Hockenmaier, J. & Lazebnik, S. (2017). Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models. International Journal of Computer Vision (IJCV), 74\u201393.","DOI":"10.1007\/s11263-016-0965-7"},{"key":"2702_CR59","doi-asserted-by":"crossref","unstructured":"Sung, Y., Cho, J. & Bansal, M. (2022). VL-ADAPTER: parameter-efficient transfer learning for vision-and-language tasks. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 5217\u20135227.","DOI":"10.1109\/CVPR52688.2022.00516"},{"key":"2702_CR60","doi-asserted-by":"crossref","unstructured":"Sung, Y.-L., Cho, J. & Bansal, M. (2022). Vl-adapter: Parameter-efficient transfer learning for vision-and-language tasks. In: CVPR, pp. 5227\u20135237.","DOI":"10.1109\/CVPR52688.2022.00516"},{"key":"2702_CR61","unstructured":"Su, W., Zhu, X., Cao, Y., Li, B., Lu, L., Wei, F. & Dai, J. (2019). Vl-bert: Pre-training of generic visual-linguistic representations. In: Int. Conf. Learn. Represent."},{"key":"2702_CR62","doi-asserted-by":"crossref","unstructured":"Suhr, A., Zhou, S., Zhang, A., Zhang, I., Bai, H. & Artzi, Y. (2019). A corpus for reasoning about natural language grounded in photographs. In: Annual Meeting of the Association for Computational Linguistics (ACL), pp. 6418\u20136428.","DOI":"10.18653\/v1\/P19-1644"},{"key":"2702_CR63","first-page":"24261","volume":"34","author":"IO Tolstikhin","year":"2021","unstructured":"Tolstikhin, I. O., Houlsby, N., Kolesnikov, A., Beyer, L., Zhai, X., Unterthiner, T., Yung, J., Steiner, A., Keysers, D., Uszkoreit, J., et al. (2021). Mlp-mixer: An all-mlp architecture for vision. Advances in Neural Information Processing Systems,34, 24261\u201324272.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2702_CR64","unstructured":"Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T., Rozi\u00e8re, B., Goyal, N., Hambro, E., Azhar, F., et al. (2023). Llama: Open and efficient foundation language models. arXiv preprint arXiv:2302.13971."},{"key":"2702_CR65","doi-asserted-by":"crossref","unstructured":"Tong, B., Lai, B., Zhou, Y., Luo, G., Shen, Y., Li, K., Sun, X. & Ji, R. (2024) Flashsloth: Lightning multimodal large language models via embedded visual compression. arXiv preprint arXiv:2412.04317.","DOI":"10.1109\/CVPR52734.2025.01358"},{"key":"2702_CR66","first-page":"9565","volume":"37","author":"C Tian","year":"2024","unstructured":"Tian, C., Shi, Z., Guo, Z., Li, L., & Xu, C.-Z. (2024). Hydralora: An asymmetric lora architecture for efficient fine-tuning. Advances in Neural Information Processing Systems,37, 9565\u20139584.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2702_CR67","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141. & Polosukhin, I. (2017). Attention is all you need. Advances in Neural Information Processing Systems30."},{"key":"2702_CR68","unstructured":"Wu, Q., Huang, S., Zhou, Y., Dai, P., Shu, A., Jiang, G. & Ji, R. (2023). Approximated prompt tuning for vision-language pre-trained models. arXiv preprint arXiv:2306.15706."},{"key":"2702_CR69","unstructured":"Wang, T., Jiang, W., Lu, Z., Zheng, F., Cheng, R., Yin, C. & Luo, P. (2022). Vlmixer: Unpaired vision-language pre-training via cross-modal cutmix. In: International Conference on Machine Learning. Proceedings of Machine Learning Research, vol. 162, pp. 22680\u201322690."},{"key":"2702_CR70","unstructured":"Wu, Q., Ke, Z., Zhou, Y., Sun, X. & Ji, R. (2024). Routing experts: Learning to route dynamic experts in multi-modal large language models. arXiv preprint arXiv:2407.14093."},{"key":"2702_CR71","first-page":"41034","volume":"36","author":"Q Wu","year":"2023","unstructured":"Wu, Q., Yu, W., Zhou, Y., Huang, S., Sun, X., & Ji, R. (2023). Parameter and computation efficient transfer learning for vision-language pre-trained models. Advances in Neural Information Processing Systems,36, 41034.","journal-title":"Advances in Neural Information Processing Systems"},{"issue":"7","key":"2702_CR72","doi-asserted-by":"publisher","first-page":"3965","DOI":"10.1109\/TGRS.2017.2685945","volume":"55","author":"G Xia","year":"2017","unstructured":"Xia, G., Hu, J., Hu, F., Shi, B., Bai, X., Zhong, Y., Zhang, L., & Lu, X. (2017). AID: A benchmark data set for performance evaluation of aerial scene classification. IEEE Transactions on Geoscience and Remote Sensing,55(7), 3965\u20133981.","journal-title":"IEEE Transactions on Geoscience and Remote Sensing"},{"key":"2702_CR73","doi-asserted-by":"crossref","unstructured":"Ye, W., Wu, Q., Lin, W. & Zhou, Y. (2025). Fit and prune: Fast and training-free visual token pruning for multi-modal large language models. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 39, pp. 22128\u201322136.","DOI":"10.1609\/aaai.v39i21.34366"},{"key":"2702_CR74","unstructured":"Zhang, Q., Cheng, A., Lu, M., Zhuo, Z., Wang, M., Cao, J., Guo, S., She, Q. & Zhang, S. (2024). [cls] attention is all you need for training-free visual token pruning: Make vlm inference faster. arXiv preprint arXiv:2412.01818."},{"key":"2702_CR75","unstructured":"Zhu, D., Chen, J., Shen, X., Li, X. & Elhoseiny, M. (2023). Minigpt-4: Enhancing vision-language understanding with advanced large language models. CoRR arXiv: 2304.10592."},{"key":"2702_CR76","unstructured":"Zhou, B., Hu, Y., Weng, X., Jia, J., Luo, J., Liu, X., Wu, J. & Huang, L. (2024). Tinyllava: A framework of small-scale large multimodal models. arXiv preprint arXiv:2402.14289."},{"key":"2702_CR77","unstructured":"Zhang, R., Han, J., Zhou, A., Hu, X., Yan, S., Lu, P., Li, H., Gao, P. & Qiao, Y. (2023). Llama-adapter: Efficient fine-tuning of language models with zero-init attention. arXiv preprint arXiv:2303.16199."},{"key":"2702_CR78","unstructured":"Zhang, S., Roller, S., Goyal, N., Artetxe, M., Chen, M., Chen, S., Dewan, C., Diab, M., Li, X., Lin, X.V., et al. (2022). Opt: Open pre-trained transformer language models. URL arXiv: 2205.01068."},{"issue":"3","key":"2702_CR79","doi-asserted-by":"publisher","first-page":"731","DOI":"10.1007\/s11263-023-01918-3","volume":"132","author":"HH Zhao","year":"2024","unstructured":"Zhao, H. H., Wang, P., Zhao, Y., Luo, H., Wang, F., & Shou, M. Z. (2024). SCT: A simple baseline for parameter-efficient fine-tuning via salient channels. International Journal of Computer Vision,132(3), 731\u2013749.","journal-title":"International Journal of Computer Vision"},{"issue":"9","key":"2702_CR80","doi-asserted-by":"publisher","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","volume":"130","author":"K Zhou","year":"2022","unstructured":"Zhou, K., Yang, J., Loy, C. C., & Liu, Z. (2022). Learning to prompt for vision-language models. International Journal of Computer Vision,130(9), 2337\u20132348.","journal-title":"International Journal of Computer Vision"},{"key":"2702_CR81","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Zhu, M., Liu, N., Xu, Z. & Peng, Y. (2024). Llava-phi: Efficient multi-modal assistant with small language model. In: Proceedings of the 1st International Workshop on Efficient Multimedia Computing Under Limited, pp. 18\u201322.","DOI":"10.1145\/3688863.3689575"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02702-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-025-02702-1","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02702-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,27]],"date-time":"2026-03-27T08:36:27Z","timestamp":1774600587000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-025-02702-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,2,21]]},"references-count":81,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2026,3]]}},"alternative-id":["2702"],"URL":"https:\/\/doi.org\/10.1007\/s11263-025-02702-1","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,2,21]]},"assertion":[{"value":"6 February 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"2 September 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 February 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors have no relevant financial or non-financial interests to disclose.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflicts of Interest"}},{"value":"The authors have no relevant ethics approval to disclose.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethics Approval and Consent to Participate"}},{"value":"All authors agreed to participate in this work and made clear contributions.","order":4,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent for Participate"}},{"value":"All authors agreed with the content and that all gave explicit consent to submit and that they obtained consent from the responsible authorities at the institute\/organization where the work has been carried out.","order":5,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent for Publication"}},{"value":"Our code is publicly released at\n                      \n                      .","order":6,"name":"Ethics","group":{"name":"EthicsHeading","label":"Code Availability"}}],"article-number":"128"}}