{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,27]],"date-time":"2025-09-27T15:10:11Z","timestamp":1758985811876,"version":"3.44.0"},"reference-count":58,"publisher":"Springer Science and Business Media LLC","issue":"13","license":[{"start":{"date-parts":[[2025,8,1]],"date-time":"2025-08-01T00:00:00Z","timestamp":1754006400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,8,1]],"date-time":"2025-08-01T00:00:00Z","timestamp":1754006400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62377034"],"award-info":[{"award-number":["62377034"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2025,8]]},"DOI":"10.1007\/s10489-025-06699-5","type":"journal-article","created":{"date-parts":[[2025,8,1]],"date-time":"2025-08-01T12:28:59Z","timestamp":1754051339000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Explicit-implicit feature modeling in drama videos: dataset and benchmark"],"prefix":"10.1007","volume":"55","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0954-2757","authenticated-orcid":false,"given":"Zexing","family":"Du","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaojun","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,8,1]]},"reference":[{"key":"6699_CR1","unstructured":"Radford A, Kim JW, Hallacy C, Ramesh A, Goh G, Agarwal S, Sastry G, Askell A, Mishkin P, Clark J et al (2021) Learning transferable visual models from natural language supervision. In: International Conference on Machine Learning. PMLR, pp 8748\u20138763"},{"key":"6699_CR2","doi-asserted-by":"crossref","unstructured":"Zhang J, Huang J, Jin S, Lu S (2024) Vision-language models for vision tasks: A survey. IEEE Trans Pattern Anal Mach Intell","DOI":"10.1109\/TPAMI.2024.3369699"},{"issue":"4","key":"6699_CR3","doi-asserted-by":"publisher","first-page":"447","DOI":"10.1007\/s11633-022-1410-8","volume":"20","author":"X Wang","year":"2023","unstructured":"Wang X, Chen G, Qian G, Gao P, Wei X-Y, Wang Y, Tian Y, Gao W (2023) Large-scale multi-modal pre-trained models: A comprehensive survey. Mach Intell Res 20(4):447\u2013482","journal-title":"Mach Intell Res"},{"key":"6699_CR4","doi-asserted-by":"crossref","unstructured":"Girdhar R, El-Nouby A, Liu Z, Singh M, Alwala KV, Joulin A, Misra I (2023) Imagebind: One embedding space to bind them all. In: CVPR","DOI":"10.1109\/CVPR52729.2023.01457"},{"issue":"20","key":"6699_CR5","doi-asserted-by":"publisher","first-page":"23039","DOI":"10.1007\/s10489-023-04756-5","volume":"53","author":"X Wu","year":"2023","unstructured":"Wu X, Tao C, Zhang J, Sun Q, Wang J, Li W, Liu Y, Guo Y (2023) Space or time for video classification transformers. Appl Intell 53(20):23039\u201323048","journal-title":"Appl Intell"},{"issue":"7","key":"6699_CR6","doi-asserted-by":"publisher","first-page":"5197","DOI":"10.1007\/s10489-024-05408-y","volume":"54","author":"Y Ming","year":"2024","unstructured":"Ming Y, Zhou J, Jia X, Zheng Q, Xiong L, Feng F, Hu N (2024) F2d-sifpnet: a frequency 2d slow-i-fast-p network for faster compressed video action recognition. Appl Intell 54(7):5197\u20135215","journal-title":"Appl Intell"},{"issue":"2","key":"6699_CR7","doi-asserted-by":"publisher","first-page":"2133","DOI":"10.1007\/s10489-022-03226-8","volume":"53","author":"Z Jia","year":"2023","unstructured":"Jia Z, Li J, Du Z, Ru J, Wang Y, Wu C, Zhang Y, Yu S, Wang Z, Sun C et al (2023) Automatic video clip and mixing based on semantic sentence matching. Appl Intell 53(2):2133\u20132146","journal-title":"Appl Intell"},{"key":"6699_CR8","doi-asserted-by":"publisher","DOI":"10.1016\/j.jecp.2019.104782","volume":"194","author":"S Oehlschlaeger","year":"2020","unstructured":"Oehlschlaeger S, Vo ML-H (2020) Development of scene knowledge: Evidence from explicit and implicit scene knowledge measures. J Exp Child Psychol 194:104782","journal-title":"J Exp Child Psychol"},{"key":"6699_CR9","doi-asserted-by":"crossref","unstructured":"Dursun S, Eken S (2023) Multimodal sentiment analysis in natural disaster data on social media. EAI Endorsed Trans Smart Cities 7(4)","DOI":"10.4108\/eetsc.5860"},{"issue":"4","key":"6699_CR10","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11760-025-03951-w","volume":"19","author":"E G\u00fcm\u00fc\u015fkaynak","year":"2025","unstructured":"G\u00fcm\u00fc\u015fkaynak E, Eken S (2025) The future of action recognition: are multi-modal visual language models the key? SIViP 19(4):1\u201312","journal-title":"SIViP"},{"key":"6699_CR11","doi-asserted-by":"crossref","unstructured":"Du Z, He D, Wang X, Wang Q (2023) Learning semantics-guided representations for scoring figure skating. IEEE Trans Multimed","DOI":"10.1109\/TMM.2023.3328180"},{"key":"6699_CR12","doi-asserted-by":"crossref","unstructured":"Gao X, Zhao Y, Zhang J, Cai L (2021) Pairwise emotional relationship recognition in drama videos: Dataset and benchmark. In: Proceedings of the 29th ACM international conference on multimedia, pp 3380\u20133389","DOI":"10.1145\/3474085.3475493"},{"key":"6699_CR13","doi-asserted-by":"crossref","unstructured":"He B, Li H, Jang YK, Jia M, Cao X, Shah A, Shrivastava A, Lim S-N (2024) Ma-lmm: Memory-augmented large multimodal model for long-term video understanding. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 13504\u201313514","DOI":"10.1109\/CVPR52733.2024.01282"},{"key":"6699_CR14","doi-asserted-by":"crossref","unstructured":"Zhang H, Li X, Bing L (2023) Video-llama: An instruction-tuned audio-visual language model for video understanding. arXiv preprint arXiv:2306.02858","DOI":"10.18653\/v1\/2023.emnlp-demo.49"},{"key":"6699_CR15","unstructured":"Li K, He Y, Wang Y, Li Y, Wang W, Luo P, Wang Y, Wang L, Qiao Y (2023) Videochat: Chat-centric video understanding. arXiv preprint arXiv:2305.06355"},{"key":"6699_CR16","unstructured":"Chen L, Hu H, Zhang M, Chen Y, Wang Z, Li Y, Shyam P, Zhou T, Huang H, Yang M-H et al (2024) Omnixr: Evaluating omni-modality language models on reasoning across modalities. arXiv preprint arXiv:2410.12219"},{"key":"6699_CR17","unstructured":"Wu R, Wang H, Chen H-T, Carneiro G (2024) Deep multimodal learning with missing modality: A survey. arXiv preprint arXiv:2409.07825"},{"issue":"8033","key":"6699_CR18","doi-asserted-by":"publisher","first-page":"466","DOI":"10.1038\/s41586-024-07618-3","volume":"634","author":"MY Lu","year":"2024","unstructured":"Lu MY, Chen B, Williamson DF, Chen RJ, Zhao M, Chow AK, Ikemura K, Kim A, Pouli D, Patel A et al (2024) A multimodal generative ai copilot for human pathology. Nature 634(8033):466\u2013473","journal-title":"Nature"},{"key":"6699_CR19","doi-asserted-by":"crossref","unstructured":"Antol S, Agrawal A, Lu J, Mitchell M, Batra D, Zitnick CL, Parikh D (2015) Vqa: Visual question answering. In: Proceedings of the IEEE international conference on computer vision, pp 2425\u20132433","DOI":"10.1109\/ICCV.2015.279"},{"key":"6699_CR20","doi-asserted-by":"crossref","unstructured":"Li L, Lei J, Gan Z, Liu J (2021) Adversarial vqa: A new benchmark for evaluating the robustness of vqa models. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 2042\u20132051","DOI":"10.1109\/ICCV48922.2021.00205"},{"key":"6699_CR21","unstructured":"Chen W, Chang M-W, Schlinger E, Wang W, Cohen WW (2020) Open question answering over tables and text. arXiv preprint arXiv:2010.10439"},{"key":"6699_CR22","unstructured":"Ordonez V, Kulkarni G, Berg T (2011) Im2text: Describing images using 1 million captioned photographs. Adv Neural Inform Process Syst 24"},{"key":"6699_CR23","doi-asserted-by":"crossref","unstructured":"Krishna R, Hata K, Ren F, Fei-Fei L, Carlos\u00a0Niebles J (2017) Dense-captioning events in videos. In: Proceedings of the IEEE international conference on computer vision, pp 706\u2013715","DOI":"10.1109\/ICCV.2017.83"},{"key":"6699_CR24","unstructured":"Li L, Lei J, Gan Z, Yu L, Chen Y-C, Pillai R, Cheng Y, Zhou L, Wang XE, Wang WY et al (2021) Value: A multi-task benchmark for video-and-language understanding evaluation. arXiv preprint arXiv:2106.04632"},{"issue":"12","key":"6699_CR25","doi-asserted-by":"publisher","first-page":"8717","DOI":"10.1109\/TPAMI.2018.2889052","volume":"44","author":"T Afouras","year":"2018","unstructured":"Afouras T, Chung JS, Senior A, Vinyals O, Zisserman A (2018) Deep audio-visual speech recognition. IEEE Trans Pattern Anal Mach Intell 44(12):8717\u20138727","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"6699_CR26","doi-asserted-by":"crossref","unstructured":"Wu H, Gao Y, Guo X, Al-Halah Z, Rennie S, Grauman K, Feris R (2021) Fashion iq: A new dataset towards retrieving images by natural language feedback. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 11307\u201311317","DOI":"10.1109\/CVPR46437.2021.01115"},{"key":"6699_CR27","doi-asserted-by":"crossref","unstructured":"Miech A, Zhukov D, Alayrac J-B, Tapaswi M, Laptev I, Sivic J (2019) Howto100m: Learning a text-video embedding by watching hundred million narrated video clips. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 2630\u20132640","DOI":"10.1109\/ICCV.2019.00272"},{"key":"6699_CR28","doi-asserted-by":"crossref","unstructured":"Hu X, Gan Z, Wang J, Yang Z, Liu Z, Lu Y, Wang L (2022) Scaling up vision-language pre-training for image captioning. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 17980\u201317989","DOI":"10.1109\/CVPR52688.2022.01745"},{"key":"6699_CR29","unstructured":"Schuhmann C, Vencu R, Beaumont R, Kaczmarczyk R, Mullis C, Katta A, Coombes T, Jitsev J, Komatsuzaki A (2021) Laion-400m: Open dataset of clip-filtered 400 million image-text pairs. arXiv preprint arXiv:2111.02114"},{"key":"6699_CR30","unstructured":"Kay W, Carreira J, Simonyan K, Zhang B, Hillier C, Vijayanarasimhan S, Viola F, Green T, Back T, Natsev P et\u00a0al (2017) The kinetics human action video dataset. arXiv preprint arXiv:1705.06950"},{"key":"6699_CR31","doi-asserted-by":"crossref","unstructured":"Wang Y, Gao D, Yu L, Lei W, Feiszli M, Shou MZ (2022) Geb+: A benchmark for generic event boundary captioning, grounding and retrieval. In: European conference on computer vision. Springer, pp 709\u2013725","DOI":"10.1007\/978-3-031-19833-5_41"},{"key":"6699_CR32","doi-asserted-by":"crossref","unstructured":"Zhou L, Xu C, Corso J (2018) Towards automatic learning of procedures from web instructional videos. In: Proceedings of the AAAI conference on artificial intelligence, vol 32","DOI":"10.1609\/aaai.v32i1.12342"},{"key":"6699_CR33","doi-asserted-by":"crossref","unstructured":"Huang G, Pang B, Zhu Z, Rivera C, Soricut R (2020) Multimodal pretraining for dense video captioning. arXiv preprint arXiv:2011.11760","DOI":"10.18653\/v1\/2020.aacl-main.48"},{"key":"6699_CR34","doi-asserted-by":"crossref","unstructured":"Hua H, Tang Y, Xu C, Luo J (2024) V2xum-llm: Cross-modal video summarization with temporal prompt instruction tuning. arXiv preprint arXiv:2404.12353","DOI":"10.1609\/aaai.v39i4.32374"},{"key":"6699_CR35","unstructured":"Xu H, Ye Q, Wu X, Yan M, Miao Y, Ye J, Xu G, Hu A, Shi Y, Xu G et\u00a0al (2023) Youku-mplug: A 10 million large-scale chinese video-language dataset for pre-training and benchmarks. arXiv preprint arXiv:2306.04362"},{"key":"6699_CR36","doi-asserted-by":"crossref","unstructured":"Jang Y, Song Y, Yu Y, Kim Y, Kim G (2017) Tgif-qa: Toward spatio-temporal reasoning in visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2758\u20132766","DOI":"10.1109\/CVPR.2017.149"},{"key":"6699_CR37","doi-asserted-by":"crossref","unstructured":"Lei J, Yu L, Bansal M, Berg TL (2018) Tvqa: Localized, compositional video question answering. arXiv preprint arXiv:1809.01696","DOI":"10.18653\/v1\/D18-1167"},{"key":"6699_CR38","doi-asserted-by":"crossref","unstructured":"Xia J, Zhuge M, Geng T, Fan S, Wei Y, He Z, Zheng F (2023) Skating-mixer: Long-term sport audio-visual modeling with mlps. In: Proceedings of the AAAI conference on artificial intelligence, vol 37, pp 2901\u20132909","DOI":"10.1609\/aaai.v37i3.25392"},{"key":"6699_CR39","unstructured":"OpenAI: Chatgpt. https:\/\/openai.com\/blog\/chatgpt (2023)"},{"key":"6699_CR40","unstructured":"Touvron H, Lavril T, Izacard G, Martinet X, Lachaux M-A, Lacroix T, Rozi\u00e8re B, Goyal N, Hambro E, Azhar F et\u00a0al (2023) Llama: Open and efficient foundation language models. arXiv preprint arXiv:2302.13971"},{"key":"6699_CR41","unstructured":"Li J, Li D, Savarese S, Hoi S (2023) Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. In: International Conference on Machine Learning. PMLR, pp 19730\u201319742"},{"key":"6699_CR42","unstructured":"Zhu D, Chen J, Shen X, Li X, Elhoseiny M (2023) Minigpt-4: Enhancing vision-language understanding with advanced large language models. arXiv preprint arXiv:2304.10592"},{"key":"6699_CR43","first-page":"23716","volume":"35","author":"J-B Alayrac","year":"2022","unstructured":"Alayrac J-B, Donahue J, Luc P, Miech A, Barr I, Hasson Y, Lenc K, Mensch A, Millican K, Reynolds M et al (2022) Flamingo: a visual language model for few-shot learning. Adv Neural Inf Process Syst 35:23716\u201323736","journal-title":"Adv Neural Inf Process Syst"},{"key":"6699_CR44","unstructured":"Li J, Li D, Savarese S, Hoi S (2023) BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. In: Proceedings of the 40th international conference on machine learning. PMLR, 202:19730\u201319742"},{"key":"6699_CR45","unstructured":"Wang W, Chen Z, Chen X, Wu J, Zhu X, Zeng G, Luo P, Lu T, Zhou J, Qiao Y et\u00a0al (2024) Visionllm: Large language model is also an open-ended decoder for vision-centric tasks. Adv Neural Inform Process Syst 36"},{"key":"6699_CR46","doi-asserted-by":"crossref","unstructured":"Maaz M, Rasheed H, Khan S, Khan FS (2023) Video-chatgpt: Towards detailed video understanding via large vision and language models. arXiv preprint arXiv:2306.05424","DOI":"10.18653\/v1\/2024.acl-long.679"},{"key":"6699_CR47","doi-asserted-by":"crossref","unstructured":"Islam MM, Bertasius G (2022) Long movie clip classification with state-space video models. In: European Conference on Computer Vision. Springer, pp 87\u2013104","DOI":"10.1007\/978-3-031-19833-5_6"},{"key":"6699_CR48","doi-asserted-by":"crossref","unstructured":"Zhang Z, Gu Y, Plummer BA, Miao X, Liu J, Wang H (2024) Movie genre classification by language augmentation and shot sampling. In: Proceedings of the IEEE\/CVF winter conference on applications of computer vision, pp 7275\u20137285","DOI":"10.1109\/WACV57701.2024.00711"},{"key":"6699_CR49","first-page":"19472","volume":"37","author":"L Chen","year":"2024","unstructured":"Chen L, Wei X, Li J, Dong X, Zhang P, Zang Y, Chen Z, Duan H, Tang Z, Yuan L et al (2024) Sharegpt4video: Improving video understanding and generation with better captions. Adv Neural Inf Process Syst 37:19472\u201319495","journal-title":"Adv Neural Inf Process Syst"},{"key":"6699_CR50","doi-asserted-by":"crossref","unstructured":"Wang Y, Li K, Li X, Yu J, He Y, Chen G, Pei B, Zheng R, Wang Z, Shi Y et al (2024) Internvideo2: Scaling foundation models for multimodal video understanding. In: European conference on computer vision. Springer, pp 396\u2013416","DOI":"10.1007\/978-3-031-73013-9_23"},{"key":"6699_CR51","doi-asserted-by":"crossref","unstructured":"Li K, Li X, Wang Y, He Y, Wang Y, Wang L, Qiao Y (2024) Videomamba: State space model for efficient video understanding. In: European Conference on Computer Vision. Springer, pp 237\u2013255","DOI":"10.1007\/978-3-031-73347-5_14"},{"key":"6699_CR52","doi-asserted-by":"crossref","unstructured":"Ghosh S, Kumar S, Seth A, Evuru CKR, Tyagi U, Sakshi S, Nieto O, Duraiswami R, Manocha D (2024) Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities. arXiv preprint arXiv:2406.11768","DOI":"10.18653\/v1\/2024.emnlp-main.361"},{"key":"6699_CR53","doi-asserted-by":"crossref","unstructured":"Liu Z, Ning J, Cao Y, Wei Y, Zhang Z, Lin S, Hu H (2022) Video swin transformer. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 3202\u20133211","DOI":"10.1109\/CVPR52688.2022.00320"},{"issue":"1","key":"6699_CR54","first-page":"19","volume":"1","author":"V Tiwari","year":"2010","unstructured":"Tiwari V (2010) Mfcc and its applications in speaker recognition. Int J Emerg Technol 1(1):19\u201322","journal-title":"Int J Emerg Technol"},{"key":"6699_CR55","unstructured":"Devlin J (2018) Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805"},{"key":"6699_CR56","doi-asserted-by":"crossref","unstructured":"Carion N, Massa F, Synnaeve G, Usunier N, Kirillov A, Zagoruyko S (2020) End-to-end object detection with transformers. In: European Conference on Computer Vision. Springer, pp 213\u2013229","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"6699_CR57","doi-asserted-by":"crossref","unstructured":"Farha YA, Gall J (2019) Ms-tcn: Multi-stage temporal convolutional network for action segmentation. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 3575\u20133584","DOI":"10.1109\/CVPR.2019.00369"},{"key":"6699_CR58","unstructured":"Maaten L, Hinton G (2008) Visualizing data using t-sne. J Mach Learn Res 9(11)"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-025-06699-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-025-06699-5\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-025-06699-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,27]],"date-time":"2025-09-27T14:32:42Z","timestamp":1758983562000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-025-06699-5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,8]]},"references-count":58,"journal-issue":{"issue":"13","published-print":{"date-parts":[[2025,8]]}},"alternative-id":["6699"],"URL":"https:\/\/doi.org\/10.1007\/s10489-025-06699-5","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"type":"print","value":"0924-669X"},{"type":"electronic","value":"1573-7497"}],"subject":[],"published":{"date-parts":[[2025,8]]},"assertion":[{"value":"4 June 2025","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 August 2025","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"902"}}