{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T16:02:25Z","timestamp":1783180945077,"version":"3.54.6"},"publisher-location":"Singapore","reference-count":49,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819609079","type":"print"},{"value":"9789819609086","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,12,7]],"date-time":"2024-12-07T00:00:00Z","timestamp":1733529600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,7]],"date-time":"2024-12-07T00:00:00Z","timestamp":1733529600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-96-0908-6_5","type":"book-chapter","created":{"date-parts":[[2024,12,6]],"date-time":"2024-12-06T19:26:19Z","timestamp":1733513179000},"page":"81-97","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":16,"title":["AutoAD-Zero: A Training-Free Framework for\u00a0Zero-Shot Audio Description"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-1123-493X","authenticated-orcid":false,"given":"Junyu","family":"Xie","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1874-9664","authenticated-orcid":false,"given":"Tengda","family":"Han","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2345-5441","authenticated-orcid":false,"given":"Max","family":"Bain","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2190-9013","authenticated-orcid":false,"given":"Arsha","family":"Nagrani","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8438-6152","authenticated-orcid":false,"given":"G\u00fcl","family":"Varol","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-8609-6826","authenticated-orcid":false,"given":"Weidi","family":"Xie","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8945-8573","authenticated-orcid":false,"given":"Andrew","family":"Zisserman","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,12,7]]},"reference":[{"key":"5_CR1","unstructured":"AI@Meta: Llama 3 model card (2024), https:\/\/github.com\/meta-llama\/llama3\/blob\/main\/MODEL_CARD.md"},{"key":"5_CR2","doi-asserted-by":"crossref","unstructured":"Bain, M., Huh, J., Han, T., Zisserman, A.: WhisperX: Time-accurate speech transcription of long-form audio. In: INTERSPEECH (2023)","DOI":"10.21437\/Interspeech.2023-78"},{"key":"5_CR3","doi-asserted-by":"crossref","unstructured":"Bain, M., Nagrani, A., Brown, A., Zisserman, A.: Condensed movies: Story based retrieval with contextual embeddings. In: ACCV (2020)","DOI":"10.1007\/978-3-030-69541-5_28"},{"key":"5_CR4","unstructured":"Bar, A., Gandelsman, Y., Darrell, T., Globerson, A., Efros, A.: Visual prompting via image inpainting. NeurIPS (2022)"},{"key":"5_CR5","doi-asserted-by":"crossref","unstructured":"Cai, M., Liu, H., Mustikovela, S.K., Meyer, G.P., Chai, Y., Park, D., Lee, Y.J.: Making large multimodal models understand arbitrary visual prompts. In: CVPR (2024)","DOI":"10.1109\/CVPR52733.2024.01227"},{"key":"5_CR6","unstructured":"Cheng, Z., Leng, S., Zhang, H., Xin, Y., Li, X., Chen, G., Zhu, Y., Zhang, W., Luo, Z., Zhao, D., Bing, L.: Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms. arXiv preprint arXiv:2406.07476 (2024)"},{"key":"5_CR7","unstructured":"Chu, P., Wang, J., Abrantes, A.: LLM-AD: Large language model based audio description system. arXiv preprint arXiv:2405.00983 (2024)"},{"key":"5_CR8","doi-asserted-by":"crossref","unstructured":"Deng, J., Guo, J., Ververas, E., Kotsia, I., Zafeiriou, S.: Retinaface: Single-shot multi-level face localisation in the wild. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00525"},{"key":"5_CR9","doi-asserted-by":"crossref","unstructured":"Deng, J., Guo, J., Xue, N., Zafeiriou, S.: ArcFace: Additive angular margin loss for deep face recognition. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00482"},{"key":"5_CR10","unstructured":"Ghermi, R., Wang, X., Kalogeiton, V., Laptev, I.: Short Film Dataset (SFD): A benchmark for story-level video understanding. arXiv preprint arXiv:2406.10221 (2024)"},{"key":"5_CR11","unstructured":"Ghermi, R., Wang, X., Kalogeiton, V., Laptev, I.: Short film dataset (sfd): A benchmark for story-level video understanding. arXiv preprint arXiv:2406.10221 (2024)"},{"key":"5_CR12","doi-asserted-by":"crossref","unstructured":"Han, T., Bain, M., Nagrani, A., Varol, G., Xie, W., Zisserman, A.: AutoAD II: The sequel - who, when, and what in movie audio description. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01255"},{"key":"5_CR13","doi-asserted-by":"crossref","unstructured":"Han, T., Bain, M., Nagrani, A., Varol, G., Xie, W., Zisserman, A.: AutoAD: Movie Description in Context. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01815"},{"key":"5_CR14","doi-asserted-by":"crossref","unstructured":"Han, T., Bain, M., Nagrani, A., Varol, G., Xie, W., Zisserman, A.: AutoAD III: The prequel \u2013 back to the pixels. In: CVPR (2024)","DOI":"10.1109\/CVPR52733.2024.01720"},{"key":"5_CR15","doi-asserted-by":"crossref","unstructured":"Huang, Q., Liu, W., Lin, D.: Person search in videos with one portrait through visual and temporal links. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01261-8_26"},{"key":"5_CR16","doi-asserted-by":"crossref","unstructured":"Huang, Q., Xiong, Y., Rao, A., Wang, J., Lin, D.: Movienet: A holistic dataset for movie understanding. In: ECCV (2020)","DOI":"10.1007\/978-3-030-58548-8_41"},{"key":"5_CR17","doi-asserted-by":"crossref","unstructured":"Jia, M., Tang, L., Chen, B.C., Cardie, C., Belongie, S., Hariharan, B., Lim, S.N.: Visual prompt tuning. In: ECCV (2022)","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"5_CR18","doi-asserted-by":"crossref","unstructured":"Ju, C., Han, T., Zheng, K., Zhang, Y., Xie, W.: Prompting visual-language models for efficient video understanding. In: ECCV (2022)","DOI":"10.1007\/978-3-031-19833-5_7"},{"key":"5_CR19","unstructured":"Kojima, T., Gu, S.S., Reid, M., Matsuo, Y., Iwasawa, Y.: Large language models are zero-shot reasoners. NeurIPS (2022)"},{"key":"5_CR20","doi-asserted-by":"crossref","unstructured":"Korbar, B., Huh, J., Zisserman, A.: Look, listen and recognise: Character-aware audio-visual subtitling. arXiv preprint arXiv:2401.12039 (2024)","DOI":"10.1109\/ICASSP48485.2024.10446480"},{"key":"5_CR21","doi-asserted-by":"crossref","unstructured":"Lei, J., Yu, L., Bansal, M., Berg, T.L.: TVQA: Localized, compositional video question answering. In: EMNLP (2018)","DOI":"10.18653\/v1\/D18-1167"},{"key":"5_CR22","doi-asserted-by":"crossref","unstructured":"Lester, B., Al-Rfou, R., Constant, N.: The power of scale for parameter-efficient prompt tuning. arXiv preprint arXiv:2104.08691 (2021)","DOI":"10.18653\/v1\/2021.emnlp-main.243"},{"key":"5_CR23","doi-asserted-by":"crossref","unstructured":"Li, X.L., Liang, P.: Prefix-tuning: Optimizing continuous prompts for generation. arXiv preprint arXiv:2101.00190 (2021)","DOI":"10.18653\/v1\/2021.acl-long.353"},{"key":"5_CR24","unstructured":"Lin, K., Ahmed, F., Li, L., Lin, C.C., Azarnasab, E., Yang, Z., Wang, J., Liang, L., Liu, Z., Lu, Y., Liu, C., Wang, L.: MM-Vid: Advancing video understanding with GPT-4V(ision). arXiv preprint arXiv:2310.19773 (2023)"},{"key":"5_CR25","doi-asserted-by":"crossref","unstructured":"Lin, K., Li, L., Lin, C.C., Ahmed, F., Gan, Z., Liu, Z., Lu, Y., Wang, L.: SwinBERT: End-to-end transformers with sparse attention for video captioning. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01742"},{"key":"5_CR26","doi-asserted-by":"crossref","unstructured":"Lu, Z., Grauman, K.: Story-driven summarization for egocentric video. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.350"},{"key":"5_CR27","unstructured":"Luo, H., Ji, L., Shi, B., Huang, H., Duan, N., Li, T., Chen, X., Zhou, M.: UniViLM: A unified video and language pre-training model for multimodal understanding and generation. arXiv preprint arXiv:2002.06353 (2020)"},{"key":"5_CR28","doi-asserted-by":"crossref","unstructured":"Raajesh, H., Desanur, N.R., Khan, Z., Tapaswi, M.: Micap: A unified model for identity-aware movie descriptions. In: CVPR (2024)","DOI":"10.1109\/CVPR52733.2024.01329"},{"key":"5_CR29","doi-asserted-by":"crossref","unstructured":"Rohrbach, A., Rohrbach, M., Tandon, N., Schiele, B.: A dataset for movie description. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298940"},{"key":"5_CR30","doi-asserted-by":"crossref","unstructured":"Rohrbach, A., Torabi, A., Rohrbach, M., Tandon, N., Pal, C., Larochelle, H., Courville, A., Schiele, B.: Movie description. IJCV (2017)","DOI":"10.1007\/s11263-016-0987-1"},{"key":"5_CR31","unstructured":"Salewski, L., Alaniz, S., Rio-Torto, I., Schulz, E., Akata, Z.: In-context impersonation reveals large language models\u2019 strengths and biases. NeurIPS (2024)"},{"key":"5_CR32","doi-asserted-by":"crossref","unstructured":"Seo, P.H., Nagrani, A., Arnab, A., Schmid, C.: End-to-end generative pretraining for multimodal video captioning. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01743"},{"key":"5_CR33","doi-asserted-by":"crossref","unstructured":"Shtedritski, A., Rupprecht, C., Vedaldi, A.: What does CLIP know about a red circle? visual prompt engineering for VLMs. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01101"},{"key":"5_CR34","doi-asserted-by":"crossref","unstructured":"Soldan, M., Pardo, A., Alc\u00e1zar, J.L., Caba, F., Zhao, C., Giancola, S., Ghanem, B.: MAD: A scalable dataset for language grounding in videos from movie audio descriptions. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00497"},{"key":"5_CR35","doi-asserted-by":"crossref","unstructured":"Srivastava, D., Singh, A.K., Tapaswi, M.: How you feelin\u2019? Learning emotions and mental states in movie scenes. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00248"},{"key":"5_CR36","unstructured":"Touvron, H., Martin, L., Stone, K., Albert, P., Almahairi, A., Babaei, Y., Bashlykov, N., Batra, S., Bhargava, P., Bhosale, S., Bikel, D., Blecher, L., Ferrer, C.C., Chen, M., Cucurull, G., Esiobu, D., Fernandes, J., Fu, J., Fu, W., Fuller, B., Gao, C., Goswami, V., Goyal, N., Hartshorn, A., Hosseini, S., Hou, R., Inan, H., Kardas, M., Kerkez, V., Khabsa, M., Kloumann, I., Korenev, A., Koura, P.S., Lachaux, M.A., Lavril, T., Lee, J., Liskovich, D., Lu, Y., Mao, Y., Martinet, X., Mihaylov, T., Mishra, P., Molybog, I., Nie, Y., Poulton, A., Reizenstein, J., Rungta, R., Saladi, K., Schelten, A., Silva, R., Smith, E.M., Subramanian, R., Tan, X.E., Tang, B., Taylor, R., Williams, A., Kuan, J.X., Xu, P., Yan, Z., Zarov, I., Zhang, Y., Fan, A., Kambadur, M., Narang, S., Rodriguez, A., Stojnic, R., Edunov, S., Scialom, T.: Llama 2: Open foundation and fine-tuned chat models. arXiv preprint arXiv: 2307.09288 (2023)"},{"key":"5_CR37","doi-asserted-by":"crossref","unstructured":"Vedantam, R., Lawrence\u00a0Zitnick, C., Parikh, D.: CIDEr: Consensus-based image description evaluation. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"5_CR38","unstructured":"Wang, H., Tong, Z., Zheng, K., Shen, Y., Wang, L.: Contextual AD narration with interleaved multimodal sequence. arXiv preprint arXiv: 2403.12922 (2024)"},{"key":"5_CR39","unstructured":"Wei, J., Wang, X., Schuurmans, D., Bosma, M., Xia, F., Chi, E., Le, Q.V., Zhou, D., et\u00a0al.: Chain-of-thought prompting elicits reasoning in large language models. NeurIPS (2022)"},{"key":"5_CR40","unstructured":"Wu, C., Lei, J., Zheng, Q., Zhao, W., Lin, W., Zhang, X., Zhou, X., Zhao, Z., Zhang, Y., Wang, Y., et\u00a0al.: Can GPT-4V(ision) serve medical applications? Case studies on GPT-4V for multimodal medical diagnosis. arXiv preprint arXiv:2310.09909 (2023)"},{"key":"5_CR41","unstructured":"Xie, J., Han, T., Bain, M., Nagrani, A., Varol, G., Xie, W., Zisserman, A.: AutoAD-Zero: A training-free framework for zero-shot audio description. arXiv preprint arXiv:2407.15850 (2024), https:\/\/arxiv.org\/abs\/2407.15850"},{"key":"5_CR42","unstructured":"Yan, Z., Zhang, K., Zhou, R., He, L., Li, X., Sun, L.: Multimodal ChatGPT for medical applications: an experimental study of GPT-4V. arXiv preprint arXiv:2310.19061 (2023)"},{"key":"5_CR43","unstructured":"Yang, J., Zhang, H., Li, F., Zou, X., Li, C., Gao, J.: Set-of-mark prompting unleashes extraordinary visual grounding in GPT-4V. arXiv preprint arXiv:2310.11441 (2023)"},{"key":"5_CR44","unstructured":"Yang, Z., Li, L., Lin, K., Wang, J., Lin, C.C., Liu, Z., Wang, L.: The dawn of LMMs: Preliminary explorations with gpt-4v (ision). arXiv preprint arXiv:2309.17421 (2023)"},{"key":"5_CR45","unstructured":"Ye, X., Chen, J., Li, X., Xin, H., Li, C., Zhou, S., Bu, J.: MMAD: Multi-modal movie audio description. In: LREC-COLING (2024)"},{"key":"5_CR46","doi-asserted-by":"crossref","unstructured":"Zhang, C., Lin, K., Yang, Z., Wang, J., Li, L., Lin, C.C., Liu, Z., Wang, L.: MM-Narrator: Narrating long-form videos with multimodal in-context learning. In: CVPR (2024)","DOI":"10.1109\/CVPR52733.2024.01295"},{"key":"5_CR47","doi-asserted-by":"crossref","unstructured":"Zhang, K., Chao, W.L., Sha, F., Grauman, K.: Video summarization with long short-term memory. In: ECCV (2016)","DOI":"10.1007\/978-3-319-46478-7_47"},{"key":"5_CR48","doi-asserted-by":"crossref","unstructured":"Zhou, K., Yang, J., Loy, C.C., Liu, Z.: Conditional prompt learning for vision-language models. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"5_CR49","doi-asserted-by":"crossref","unstructured":"Zhou, K., Yang, J., Loy, C.C., Liu, Z.: Learning to prompt for vision-language models. IJCV 130(9) (2022)","DOI":"10.1007\/s11263-022-01653-1"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ACCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-96-0908-6_5","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,6]],"date-time":"2024-12-06T20:10:12Z","timestamp":1733515812000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-96-0908-6_5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,7]]},"ISBN":["9789819609079","9789819609086"],"references-count":49,"URL":"https:\/\/doi.org\/10.1007\/978-981-96-0908-6_5","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12,7]]},"assertion":[{"value":"7 December 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ACCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Asian Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Hanoi","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Vietnam","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"12 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"accv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}