{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,14]],"date-time":"2026-06-14T21:41:29Z","timestamp":1781473289070,"version":"3.54.1"},"publisher-location":"Cham","reference-count":24,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783032051400","type":"print"},{"value":"9783032051417","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,9,20]],"date-time":"2025-09-20T00:00:00Z","timestamp":1758326400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,9,20]],"date-time":"2025-09-20T00:00:00Z","timestamp":1758326400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-3-032-05141-7_41","type":"book-chapter","created":{"date-parts":[[2025,9,19]],"date-time":"2025-09-19T08:17:30Z","timestamp":1758269850000},"page":"423-432","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Multi-modal Representations for\u00a0Fine-Grained Multi-Label Critical View of\u00a0Safety Recognition"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-3788-6832","authenticated-orcid":false,"given":"Britty","family":"Baby","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1044-038X","authenticated-orcid":false,"given":"Vinkle","family":"Srivastav","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-8314-9336","authenticated-orcid":false,"given":"Pooja P.","family":"Jain","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6030-8862","authenticated-orcid":false,"given":"Kun","family":"Yuan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7288-3023","authenticated-orcid":false,"given":"Pietro","family":"Mascagni","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5010-4137","authenticated-orcid":false,"given":"Nicolas","family":"Padoy","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,9,20]]},"reference":[{"key":"41_CR1","doi-asserted-by":"crossref","unstructured":"Cubuk, E.D., Zoph, B., Shlens, J., Le, Q.V.: RandAugment: practical automated data augmentation with a reduced search space. In: CVPR Workshops (2020)","DOI":"10.1109\/CVPRW50498.2020.00359"},{"key":"41_CR2","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"41_CR3","unstructured":"Honarmand, M., Jamal, M.A., Mohareri, O.: VidlPRO: a video-language pre-training framework for robotic and laparoscopic surgery. arXiv (2024)"},{"key":"41_CR4","unstructured":"Huang, K., Altosaar, J., Ranganath, R.: ClinicalBERT: modeling clinical notes and predicting hospital readmission. arXiv (2019)"},{"key":"41_CR5","unstructured":"Lavanchy, J.L., Ramesh, S., Dall\u2019Alba, D., Gonzalez, C., Fiorini, P., et\u00a0al.: Challenges in multi-centric generalization: phase and step recognition in Roux-en-Y gastric bypass surgery, pp.\u00a01\u20139. IJCARS (2024)"},{"issue":"1","key":"41_CR6","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1038\/s41597-025-04642-4","volume":"12","author":"P Mascagni","year":"2025","unstructured":"Mascagni, P., Alapatt, D., Murali, A., Vardazaryan, A., Garcia, A., et al.: Endoscapes, a critical view of safety and surgical scene segmentation dataset for laparoscopic cholecystectomy. Sci. Data 12(1), 1\u20138 (2025)","journal-title":"Sci. Data"},{"key":"41_CR7","doi-asserted-by":"crossref","unstructured":"Murali, A., Alapatt, D., Mascagni, P., Vardazaryan, A., Garcia, A., et\u00a0al.: Encoding surgical videos as latent spatiotemporal graphs for object and anatomy-driven reasoning. In: MICCAI, pp. 647\u2013657 (2023)","DOI":"10.1007\/978-3-031-43996-4_62"},{"key":"41_CR8","unstructured":"Murali, A., Alapatt, D., Mascagni, P., Vardazaryan, A., Garcia, A., et\u00a0al.: The endoscapes dataset for surgical scene segmentation, object detection, and critical view of safety assessment: official splits and benchmark. arXiv (2023)"},{"key":"41_CR9","doi-asserted-by":"crossref","unstructured":"Murali, A., Alapatt, D., Mascagni, P., Vardazaryan, A., Garcia, A., et\u00a0al.: Latent graph representations for critical view of safety assessment. TMI (2023)","DOI":"10.1109\/TMI.2023.3333034"},{"key":"41_CR10","doi-asserted-by":"crossref","unstructured":"Ni, B., Peng, H., Chen, M., Zhang, S., Meng, G., et\u00a0al.: Expanding language-image pretrained models for general video recognition. In: ECCV, pp. 1\u201318 (2022)","DOI":"10.1007\/978-3-031-19772-7_1"},{"key":"41_CR11","doi-asserted-by":"crossref","unstructured":"Nwoye, C.I., Yu, T., Gonzalez, C., Seeliger, B., Mascagni, P., et\u00a0al.: Rendezvous: attention mechanisms for the recognition of surgical action triplets in endoscopic videos. Med. Image Anal. 102433 (2022)","DOI":"10.1016\/j.media.2022.102433"},{"key":"41_CR12","unstructured":"OpenAI: ChatGPT-4: Large language model (2024). https:\/\/chat.openai.com. Accessed 8 May 2024"},{"key":"41_CR13","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., et\u00a0al.: Learning transferable visual models from natural language supervision. In: ICML, pp. 8748\u20138763 (2021)"},{"key":"41_CR14","doi-asserted-by":"crossref","unstructured":"Satyanaik, S., Murali, A., Alapatt, D., Wang, X., Mascagni, P., et\u00a0al.: Optimizing latent graph representations of surgical scenes for unseen domain generalization. IJCARS 1\u20138 (2024)","DOI":"10.1007\/s11548-024-03121-2"},{"issue":"1","key":"41_CR15","first-page":"101","volume":"180","author":"SM Strasberg","year":"1995","unstructured":"Strasberg, S.M., Hertl, M., Soper, N.J.: An analysis of the problem of biliary injury during laparoscopic cholecystectomy. J. Am. Coll. Surg. 180(1), 101\u2013125 (1995)","journal-title":"J. Am. Coll. Surg."},{"key":"41_CR16","unstructured":"Sun, X., Hu, P., Saenko, K.: Dualcoop: Fast adaptation to multi-label recognition with limited annotations. In: NeurIPS, vol. 35, pp. 30569\u201330582 (2022)"},{"issue":"1","key":"41_CR17","first-page":"86","volume":"36","author":"AP Twinanda","year":"2016","unstructured":"Twinanda, A.P., Shehata, S., Mutter, D., Marescaux, J., Mathelin, M., Padoy, N.: EndoNet: a deep architecture for recognition tasks on laparoscopic videos. TMI 36(1), 86\u201397 (2016)","journal-title":"TMI"},{"key":"41_CR18","unstructured":"Wang, M., Xing, J., Mei, J., Liu, Y., Jiang, Y.: ActionCLIP: adapting language-image pretrained models for video action recognition. IEEE Trans. Neural Netw. Learn. Syst. (2023)"},{"key":"41_CR19","doi-asserted-by":"crossref","unstructured":"Yang, L., Zhang, R.Y., Wang, Y., Xie, X.: MMA: multi-modal adapter for vision-language models. In: CVPR, pp. 23826\u201323837 (2024)","DOI":"10.1109\/CVPR52733.2024.02249"},{"key":"41_CR20","unstructured":"Yuan, K., Navab, N., Padoy, N., et al.: Procedure-aware surgical video-language pretraining with hierarchical knowledge augmentation. In: NeurIPS, vol. 37, pp. 122952\u2013122983 (2024)"},{"key":"41_CR21","doi-asserted-by":"crossref","unstructured":"Yuan, K., Srivastav, V., Navab, N., Padoy, N.: HecVL: hierarchical video-language pretraining for zero-shot surgical phase recognition. In: MICCAI, pp. 306\u2013316 (2024)","DOI":"10.1007\/978-3-031-72089-5_29"},{"key":"41_CR22","doi-asserted-by":"crossref","unstructured":"Yuan, K., et al.: Learning multi-modal representations by watching hundreds of surgical video lectures. Med. Image Anal. 103644 (2025)","DOI":"10.1016\/j.media.2025.103644"},{"key":"41_CR23","doi-asserted-by":"crossref","unstructured":"Zou, X., Dou, Z.Y., Yang, J., Gan, Z., Li, L., et\u00a0al.: Generalized decoding for pixel, image, and language. In: CVPR, pp. 15116\u201315127 (2023)","DOI":"10.1109\/CVPR52729.2023.01451"},{"key":"41_CR24","unstructured":"Zou, X., Yang, J., Zhang, H., Li, F., Li, L., et\u00a0al.: Segment everything everywhere all at once. In: NeurIPS, vol. 36 (2024)"}],"container-title":["Lecture Notes in Computer Science","Medical Image Computing and Computer Assisted Intervention \u2013 MICCAI 2025"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-032-05141-7_41","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,19]],"date-time":"2025-09-19T08:17:42Z","timestamp":1758269862000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-032-05141-7_41"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,20]]},"ISBN":["9783032051400","9783032051417"],"references-count":24,"URL":"https:\/\/doi.org\/10.1007\/978-3-032-05141-7_41","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,9,20]]},"assertion":[{"value":"20 September 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"The authors have no competing interests to declare relevant to this article.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Disclosure of Interests"}},{"value":"MICCAI","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Medical Image Computing and Computer-Assisted Intervention","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Daejeon","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Korea (Republic of)","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 September 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27 September 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"28","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"miccai2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/conferences.miccai.org\/2025\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}