{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,14]],"date-time":"2026-06-14T21:41:44Z","timestamp":1781473304992,"version":"3.54.1"},"reference-count":26,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2025,4,17]],"date-time":"2025-04-17T00:00:00Z","timestamp":1744848000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2025,4,17]],"date-time":"2025-04-17T00:00:00Z","timestamp":1744848000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"DOI":"10.13039\/501100000781","name":"European Research Council","doi-asserted-by":"publisher","award":["101088553"],"award-info":[{"award-number":["101088553"]}],"id":[{"id":"10.13039\/501100000781","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J CARS"],"abstract":"<jats:title>Abstract<\/jats:title>\n          <jats:sec>\n            <jats:title>Purpose<\/jats:title>\n            <jats:p>Surgical workflow analysis is crucial for improving surgical efficiency and safety. However, previous studies rely heavily on large-scale annotated datasets, posing challenges in cost, scalability, and reliance on expert annotations. To address this, we propose Surg-FTDA (Few-shot Text-driven Adaptation), designed to handle various surgical workflow analysis tasks with minimal paired image\u2013label data.<\/jats:p>\n          <\/jats:sec>\n          <jats:sec>\n            <jats:title>Methods<\/jats:title>\n            <jats:p>Our approach has two key components. First, few-shot selection-based modality alignment selects a small subset of images and aligns their embeddings with text embeddings from the downstream task, bridging the modality gap. Second, text-driven adaptation leverages only text data to train a decoder, eliminating the need for paired image\u2013text data. This decoder is then applied to aligned image embeddings, enabling image-related tasks without explicit image\u2013text pairs.<\/jats:p>\n          <\/jats:sec>\n          <jats:sec>\n            <jats:title>Results<\/jats:title>\n            <jats:p>We evaluate our approach on generative tasks (image captioning) and discriminative tasks (triplet recognition and phase recognition). Results show that Surg-FTDA outperforms baselines and generalizes well across downstream tasks.<\/jats:p>\n          <\/jats:sec>\n          <jats:sec>\n            <jats:title>Conclusion<\/jats:title>\n            <jats:p>We propose a text-driven adaptation approach that mitigates the modality gap and handles multiple downstream tasks in surgical workflow analysis, with minimal reliance on large annotated datasets. The code and dataset will be released in <jats:ext-link xmlns:xlink=\"http:\/\/www.w3.org\/1999\/xlink\" xlink:href=\"https:\/\/github.com\/CAMMApublic\/Surg-FTDA\" ext-link-type=\"uri\">https:\/\/github.com\/CAMMApublic\/Surg-FTDA<\/jats:ext-link>.<\/jats:p>\n          <\/jats:sec>","DOI":"10.1007\/s11548-025-03341-0","type":"journal-article","created":{"date-parts":[[2025,4,17]],"date-time":"2025-04-17T04:19:14Z","timestamp":1744863554000},"page":"1175-1183","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":8,"title":["Text-driven adaptation of foundation models for few-shot surgical workflow analysis"],"prefix":"10.1007","volume":"20","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-8868-7816","authenticated-orcid":false,"given":"Tingxuan","family":"Chen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kun","family":"Yuan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Vinkle","family":"Srivastav","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Nassir","family":"Navab","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Nicolas","family":"Padoy","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,4,17]]},"reference":[{"key":"3341_CR1","volume":"76","author":"L Maier-Hein","year":"2022","unstructured":"Maier-Hein L, Eisenmann M, Sarikaya D, M\u00e4rz K, Collins T, Malpani A, Fallert J, Feussner H, Giannarou S, Mascagni P et al (2022) Surgical data science-from concepts toward clinical translation. Media 76:102306","journal-title":"Media"},{"issue":"2","key":"3341_CR2","doi-asserted-by":"publisher","first-page":"82","DOI":"10.1080\/13645706.2019.1584116","volume":"28","author":"N Padoy","year":"2019","unstructured":"Padoy N (2019) Machine and deep learning for workflow recognition during surgery. Minim Invasive Ther Allied Technol 28(2):82\u201390","journal-title":"Minim Invasive Ther Allied Technol"},{"issue":"1","key":"3341_CR3","doi-asserted-by":"publisher","first-page":"86","DOI":"10.1109\/TMI.2016.2593957","volume":"36","author":"AP Twinanda","year":"2016","unstructured":"Twinanda AP, Shehata S, Mutter D, Marescaux J, De Mathelin M, Padoy N (2016) Endonet: a deep architecture for recognition tasks on laparoscopic videos. IEEE Trans Med Imaging 36(1):86\u201397","journal-title":"IEEE Trans Med Imaging"},{"key":"3341_CR4","doi-asserted-by":"publisher","DOI":"10.1016\/j.media.2022.102611","volume":"82","author":"K Yuan","year":"2022","unstructured":"Yuan K, Holden M, Gao S, Lee W (2022) Anticipation for surgical workflow through instrument interaction and recognized signals. Med Image Anal 82:102611","journal-title":"Med Image Anal"},{"key":"3341_CR5","doi-asserted-by":"crossref","unstructured":"Murali A, Alapatt D, Mascagni P, Vardazaryan A, Garcia A, Okamoto N, Mutter D, Padoy N (2023) Latent graph representations for critical view of safety assessment. IEEE Trans Med Imaging","DOI":"10.1109\/TMI.2023.3333034"},{"key":"3341_CR6","doi-asserted-by":"crossref","unstructured":"Czempiel T, Paschali M, Keicher M, Simson W, Feussner H, Kim ST, Navab N (2020) Tecno: Surgical phase recognition with multi-stage temporal convolutional networks. In: Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2020: 23rd International Conference, Lima, Peru, October 4\u20138, 2020, Proceedings, Part III 23, pp. 343\u2013352. Springer","DOI":"10.1007\/978-3-030-59716-0_33"},{"key":"3341_CR7","doi-asserted-by":"crossref","unstructured":"Gao X, Jin Y, Long Y, Dou Q, Heng P-A (2021) Trans-svnet: Accurate phase recognition from surgical videos via hybrid embedding aggregation transformer. In: Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2021: 24th International Conference, Strasbourg, France, September 27\u2013October 1, 2021, Proceedings, Part IV 24, pp. 593\u2013603. Springer","DOI":"10.1007\/978-3-030-87202-1_57"},{"key":"3341_CR8","unstructured":"Yuan K, Srivastav V, Yu T, Lavanchy J, Mascagni P, Navab N, Padoy N (2023) Learning multi-modal representations by watching hundreds of surgical video lectures. arXiv preprint arXiv:2307.15220"},{"key":"3341_CR9","doi-asserted-by":"crossref","unstructured":"Yuan K, Srivastav V, Navab N, Padoy N (2024) Hecvl: Hierarchical video-language pretraining for zero-shot surgical phase recognition. In: International Conference on Medical Image Computing and Computer-Assisted Intervention, pp. 306\u2013316. Springer","DOI":"10.1007\/978-3-031-72089-5_29"},{"key":"3341_CR10","unstructured":"Yuan K, Srivastav V, Navab N, Padoy N (2024) Procedure-aware surgical video-language pretraining with hierarchical knowledge augmentation. arXiv preprint arXiv:2410.00263"},{"key":"3341_CR11","volume":"78","author":"CI Nwoye","year":"2022","unstructured":"Nwoye CI, Yu T, Gonzalez C, Seeliger B, Mascagni P, Mutter D, Marescaux J, Padoy N (2022) Rendezvous: attention mechanisms for the recognition of surgical action triplets in endoscopic videos. Media 78:102433","journal-title":"Media"},{"key":"3341_CR12","doi-asserted-by":"crossref","unstructured":"Seenivasan L, Islam M, Krishna AK, Ren H (2022) Surgical-vqa: visual question answering in surgical scenes using transformer. In: MICCAI, pp. 33\u201343","DOI":"10.1007\/978-3-031-16449-1_4"},{"issue":"7","key":"3341_CR13","doi-asserted-by":"publisher","first-page":"1409","DOI":"10.1007\/s11548-024-03141-y","volume":"19","author":"K Yuan","year":"2024","unstructured":"Yuan K, Kattel M, Lavanchy JL, Navab N, Srivastav V, Padoy N (2024) Advancing surgical vqa with scene graph knowledge. Int J Comput Assist Radiol Surg 19(7):1409\u20131417","journal-title":"Int J Comput Assist Radiol Surg"},{"key":"3341_CR14","doi-asserted-by":"crossref","unstructured":"Zhou K, Yang J, Loy CC, Liu Z (2022) Conditional prompt learning for vision-language models. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 16816\u201316825","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"3341_CR15","doi-asserted-by":"crossref","unstructured":"Yao H, Zhang R, Xu C (2023) Visual-language prompt tuning with knowledge-guided context optimization. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 6757\u20136767","DOI":"10.1109\/CVPR52729.2023.00653"},{"key":"3341_CR16","unstructured":"Wang M, Xing J, Liu Y (2021) Actionclip: a new paradigm for video action recognition. arXiv preprint arXiv:2109.08472"},{"key":"3341_CR17","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky O, Deng J, Su H, Krause J, Satheesh S, Ma S, Huang Z, Karpathy A, Khosla A, Bernstein M et al (2015) Imagenet large scale visual recognition challenge. Int J Comput Vis 115:211\u2013252","journal-title":"Int J Comput Vis"},{"key":"3341_CR18","doi-asserted-by":"publisher","unstructured":"Nukrai D, Mokady R, Globerson A (2022) Text-only training for image captioning using noise-injected CLIP. In: Goldberg Y, Kozareva Z, Zhang Y. (eds.) Findings of the Association for Computational Linguistics: EMNLP 2022, pp. 4055\u20134063. Association for Computational Linguistics, Abu Dhabi, United Arab Emirates. https:\/\/doi.org\/10.18653\/v1\/2022.findings-emnlp.299","DOI":"10.18653\/v1\/2022.findings-emnlp.299"},{"key":"3341_CR19","doi-asserted-by":"crossref","unstructured":"Gu S, Clark C, Kembhavi A (2023) I can\u2019t believe there\u2019s no images! learning visual tasks using only language supervision. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 2672\u20132683","DOI":"10.1109\/ICCV51070.2023.00252"},{"issue":"1","key":"3341_CR20","doi-asserted-by":"publisher","first-page":"100","DOI":"10.2307\/2346830","volume":"28","author":"JA Hartigan","year":"1979","unstructured":"Hartigan JA, Wong MA (1979) A k-means clustering algorithm. Appl Stat 28(1):100\u2013108","journal-title":"Appl Stat"},{"key":"3341_CR21","unstructured":"Qi CR, Yi L, Su H, Guibas LJ (2017) Pointnet++: deep hierarchical feature learning on point sets in a metric space. arXiv preprint arXiv:1706.02413"},{"key":"3341_CR22","unstructured":"Radford A, Kim JW, Hallacy C, Ramesh A, Goh G, Agarwal S, Sastry G, Askell A, Mishkin P, Clark J, et al. (2021) Learning transferable visual models from natural language supervision. In: International Conference on Machine Learning, pp 8748\u20138763. PMLR"},{"key":"3341_CR23","unstructured":"Radford A, Wu J, Child R, Luan D, Amodei D, Sutskever I et al (2019) Language models are unsupervised multitask learners. OpenAI blog 1(8):9"},{"key":"3341_CR24","doi-asserted-by":"crossref","unstructured":"Papineni K, Roukos S, Ward T, Zhu W-J (2002) Bleu: a method for automatic evaluation of machine translation. In: Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, pp 311\u2013318","DOI":"10.3115\/1073083.1073135"},{"key":"3341_CR25","unstructured":"Banerjee S, Lavie A (2005) Meteor: an automatic metric for mt evaluation with improved correlation with human judgments. In: Proceedings of the Acl Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation And\/or Summarization, pp 65\u201372"},{"key":"3341_CR26","doi-asserted-by":"crossref","unstructured":"Vedantam R, Lawrence Zitnick C, Parikh D (2015) Cider: consensus-based image description evaluation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 4566\u20134575","DOI":"10.1109\/CVPR.2015.7299087"}],"container-title":["International Journal of Computer Assisted Radiology and Surgery"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11548-025-03341-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11548-025-03341-0\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11548-025-03341-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,14]],"date-time":"2025-06-14T11:34:34Z","timestamp":1749900874000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11548-025-03341-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,17]]},"references-count":26,"journal-issue":{"issue":"6","published-online":{"date-parts":[[2025,6]]}},"alternative-id":["3341"],"URL":"https:\/\/doi.org\/10.1007\/s11548-025-03341-0","relation":{},"ISSN":["1861-6429"],"issn-type":[{"value":"1861-6429","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,4,17]]},"assertion":[{"value":"20 January 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 February 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 April 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors have no relevant financial or non-financial interests to disclose.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}},{"value":"This study does not involve human participants or animal studies requiring ethical approval.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical Approval"}},{"value":"This study uses publicly available datasets that do not contain personally identifiable information.","order":4,"name":"Ethics","group":{"name":"EthicsHeading","label":"Informed Consent"}},{"value":"The authors consent to the publication of this article in IJCARS.","order":5,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent for Publication"}}]}}