{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,14]],"date-time":"2026-01-14T15:47:50Z","timestamp":1768405670291,"version":"3.49.0"},"reference-count":42,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2024,12,9]],"date-time":"2024-12-09T00:00:00Z","timestamp":1733702400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,9]],"date-time":"2024-12-09T00:00:00Z","timestamp":1733702400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2025,1]]},"DOI":"10.1007\/s10489-024-05994-x","type":"journal-article","created":{"date-parts":[[2024,12,9]],"date-time":"2024-12-09T11:38:35Z","timestamp":1733744315000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Novel multimodal contrast learning framework using zero-shot prediction for abnormal behavior recognition"],"prefix":"10.1007","volume":"55","author":[{"given":"Hai Chuan","family":"Liu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Anis Salwa","family":"Mohd Khairuddin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Joon Huang","family":"Chuah","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xian Min","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiao Dan","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Li Ming","family":"Fang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Si Bo","family":"Kong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,12,9]]},"reference":[{"key":"5994_CR1","doi-asserted-by":"publisher","unstructured":"Zhou J, Herencsar N (2023) Abnormal behavior determination model of multimedia classroom students based on multi-task deep learning. Mobile Netw Appl. https:\/\/doi.org\/10.1007\/s11036-023-02187-7","DOI":"10.1007\/s11036-023-02187-7"},{"key":"5994_CR2","doi-asserted-by":"publisher","first-page":"41","DOI":"10.1007\/s12652-017-0597-y","volume":"10","author":"SS Yun","year":"2019","unstructured":"Yun SS, Nguyen Q, Choi J (2019) Recognition of emergency situations using audio-visual perception sensor network for ambient assistive living. J Ambient Intell Humaniz Comput 10:41\u201355. https:\/\/doi.org\/10.1007\/s12652-017-0597-y","journal-title":"J Ambient Intell Humaniz Comput"},{"key":"5994_CR3","doi-asserted-by":"publisher","unstructured":"Lu M, Li D, Xu F (2022) Recognition of students\u2019 abnormal behaviors in english learning and analysis of psychological stress based on deep learning. Front Psychol 13. https:\/\/doi.org\/10.3389\/fpsyg.2022.1025304","DOI":"10.3389\/fpsyg.2022.1025304"},{"issue":"12","key":"5994_CR4","doi-asserted-by":"publisher","first-page":"19,091","DOI":"10.1007\/s11042-022-14100-7","volume":"82","author":"J Mo","year":"2023","unstructured":"Mo J, Zhu R, Yuan H et al (2023) Student behavior recognition based on multitask learning. Multimed Tools Appl 82(12):19,091-19,108. https:\/\/doi.org\/10.1007\/s11042-022-14100-7","journal-title":"Multimed Tools Appl"},{"issue":"2","key":"5994_CR5","doi-asserted-by":"publisher","first-page":"2907","DOI":"10.1007\/s11042-020-09741-5","volume":"80","author":"M Rashmi","year":"2021","unstructured":"Rashmi M, Ashwin TS, Guddeti RMR (2021) Surveillance video analysis for student action recognition and localization inside computer laboratories of a smart campus. Multimed Tools Appl 80(2):2907\u20132929. https:\/\/doi.org\/10.1007\/s11042-020-09741-5","journal-title":"Multimed Tools Appl"},{"issue":"1","key":"5994_CR6","doi-asserted-by":"publisher","first-page":"89","DOI":"10.18280\/ts.380109","volume":"38","author":"Y Xie","year":"2021","unstructured":"Xie Y, Zhang S, Liu Y (2021) Abnormal behavior recognition in classroom pose estimation of college students based on spatiotemporal representation learning. Trait Signal 38(1):89\u201395. https:\/\/doi.org\/10.18280\/ts.380109","journal-title":"Trait Signal"},{"issue":"8","key":"5994_CR7","doi-asserted-by":"publisher","first-page":"1617","DOI":"10.1007\/s11760-020-01705-4","volume":"14","author":"S Banerjee","year":"2020","unstructured":"Banerjee S, Ashwin TS, Guddeti RMR (2020) Multimodal behavior analysis in computer-enabled laboratories using nonverbal cues. Signal Image Video Process 14(8):1617\u20131624. https:\/\/doi.org\/10.1007\/s11760-020-01705-4","journal-title":"Signal Image Video Process"},{"key":"5994_CR8","doi-asserted-by":"publisher","first-page":"923","DOI":"10.1109\/TIFS.2020.3023791","volume":"16","author":"G Chen","year":"2021","unstructured":"Chen G, Liu P, Liu Z et al (2021) Neuroaed: Towards efficient abnormal event detection in visual surveillance with neuromorphic vision sensor. IEEE Trans Inf Forensic Secur 16:923\u2013936. https:\/\/doi.org\/10.1109\/TIFS.2020.3023791","journal-title":"IEEE Trans Inf Forensic Secur"},{"issue":"14, SI","key":"5994_CR9","doi-asserted-by":"publisher","first-page":"8335","DOI":"10.1007\/s00521-020-05587-y","volume":"33","author":"B Sun","year":"2021","unstructured":"Sun B, Wu Y, Zhao K et al (2021) Student class behavior dataset: a video dataset for recognizing, detecting, and captioning students\u2019 behaviors in classroom scenes. Neural Comput Appl 33(14, SI):8335\u20138354. https:\/\/doi.org\/10.1007\/s00521-020-05587-y","journal-title":"Neural Comput Appl"},{"key":"5994_CR10","doi-asserted-by":"publisher","first-page":"38,471","DOI":"10.1109\/ACCESS.2023.3266440","volume":"11","author":"HC Liu","year":"2023","unstructured":"Liu HC, Chuah JH, Khairuddin ASM et al (2023) Campus abnormal behavior recognition with temporal segment transformers. IEEE Access 11:38,471-38,484. https:\/\/doi.org\/10.1109\/ACCESS.2023.3266440","journal-title":"IEEE Access"},{"key":"5994_CR11","doi-asserted-by":"publisher","unstructured":"Ni B, Peng H, Chen M et al (2022). Expanding language-image pretrained models for general video recognition. In:17th European conference on computer vision (ECCV), Tel Aviv, ISRAEL, OCT 23-27, 2022. https:\/\/doi.org\/10.1007\/978-3-031-19772-7_1","DOI":"10.1007\/978-3-031-19772-7_1"},{"key":"5994_CR12","doi-asserted-by":"publisher","unstructured":"Wang M, Xing J, Mei J et al (2023) Actionclip: Adapting language-image pretrained models for video action recognition. IEEE Trans Neural Netw Learn Syst. https:\/\/doi.org\/10.1109\/TNNLS.2023.3331841","DOI":"10.1109\/TNNLS.2023.3331841"},{"key":"5994_CR13","doi-asserted-by":"publisher","first-page":"293","DOI":"10.1016\/j.neucom.2022.07.028","volume":"508","author":"H Luo","year":"2022","unstructured":"Luo H, Ji L, Zhong M et al (2022) Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning. Neurocomputing 508:293\u2013304. https:\/\/doi.org\/10.1016\/j.neucom.2022.07.028","journal-title":"Neurocomputing"},{"key":"5994_CR14","doi-asserted-by":"publisher","unstructured":"Lin Z, Geng S, Zhang R et al (2022). Frozen clip models are efficient video learners. In: 17th European conference on computer vision (ECCV), Tel Aviv, ISRAEL, OCT 23-27, 2022. https:\/\/doi.org\/10.1007\/978-3-031-19833-5_23","DOI":"10.1007\/978-3-031-19833-5_23"},{"key":"5994_CR15","doi-asserted-by":"publisher","first-page":"159","DOI":"10.1016\/j.neucom.2021.01.036","volume":"439","author":"V Estevam","year":"2021","unstructured":"Estevam V, Pedrini H, Menotti D (2021) Zero-shot action recognition in videos: A survey. Neurocomputing 439:159\u2013175. https:\/\/doi.org\/10.1016\/j.neucom.2021.01.036","journal-title":"Neurocomputing"},{"issue":"20","key":"5994_CR16","doi-asserted-by":"publisher","first-page":"24,142","DOI":"10.1007\/s10489-023-04808-w","volume":"53","author":"N Wu","year":"2023","unstructured":"Wu N, Kera H, Kawamoto K (2023) Improving zero-shot action recognition using human instruction with text description. Appl Intell 53(20):24,142-24,156. https:\/\/doi.org\/10.1007\/s10489-023-04808-w","journal-title":"Appl Intell"},{"key":"5994_CR17","doi-asserted-by":"publisher","unstructured":"Qi Q, Wang H, Su T et al (2022) Learning temporal information and object relation for zero-shot action recognition. Displays 73. https:\/\/doi.org\/10.1016\/j.displa.2022.102177","DOI":"10.1016\/j.displa.2022.102177"},{"key":"5994_CR18","doi-asserted-by":"publisher","unstructured":"Xia X, Dong G, Li F et al (2023) When clip meets cross-modal hashing retrieval: A new strong baseline. Inf Fusion 100. https:\/\/doi.org\/10.1016\/j.inffus.2023.101968","DOI":"10.1016\/j.inffus.2023.101968"},{"key":"5994_CR19","doi-asserted-by":"publisher","unstructured":"Sun B, Kong D, Wang S et al (2022) Gan for vision, kg for relation: A two-stage network for zero-shot action recognition. Pattern Recognit 126. https:\/\/doi.org\/10.1016\/j.patcog.2022.108563","DOI":"10.1016\/j.patcog.2022.108563"},{"key":"5994_CR20","unstructured":"Radford A, Kim JW, Hallacy C, et\u00a0al (2021) Learning transferable visual models from natural language supervision. In: International conference on machine learning (ICML), ELECTR NETWORK, JUL 18-24, 2021"},{"issue":"1","key":"5994_CR21","doi-asserted-by":"publisher","first-page":"260","DOI":"10.1109\/TCSVT.2023.3284977","volume":"34","author":"T Su","year":"2023","unstructured":"Su T, Wang H, Qi Q et al (2023) Transductive learning with prior knowledge for generalized zero-shot action recognition. IEEE T Circ Syst Vid 34(1):260\u2013273. https:\/\/doi.org\/10.1109\/TCSVT.2023.3284977","journal-title":"IEEE T Circ Syst Vid"},{"key":"5994_CR22","doi-asserted-by":"publisher","first-page":"1683","DOI":"10.1109\/TIP.2024.3368961","volume":"33","author":"Z Tan","year":"2024","unstructured":"Tan Z, Wu Y, Liu Q et al (2024) Exploring the application of large-scale pre-trained models on adverse weather removal. IEEE T Image Process 33:1683\u20131698. https:\/\/doi.org\/10.1109\/TIP.2024.3368961","journal-title":"IEEE T Image Process"},{"issue":"7","key":"5994_CR23","doi-asserted-by":"publisher","first-page":"4747","DOI":"10.1109\/TPAMI.2024.3357503","volume":"46","author":"Z Wu","year":"2024","unstructured":"Wu Z, Weng Z, Peng W et al (2024) Building an open-vocabulary video clip model with better architectures, optimization and data. IEEE Trans Pattern Anal Mach Intell 46(7):4747\u20134762. https:\/\/doi.org\/10.1109\/TPAMI.2024.3357503","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"5994_CR24","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3335859","author":"D Chen","year":"2023","unstructured":"Chen D, Wu Z, Liu F et al (2023) Protoclip: Prototypical contrastive language image pretraining. IEEE T Neur Net Lear. https:\/\/doi.org\/10.1109\/TNNLS.2023.3335859","journal-title":"IEEE T Neur Net Lear"},{"issue":"11","key":"5994_CR25","doi-asserted-by":"publisher","first-page":"6519","DOI":"10.1109\/TCSVT.2023.3272627","volume":"33","author":"J Gao","year":"2023","unstructured":"Gao J, Hou Y, Guo Z et al (2023) Learning spatio-temporal semantics and cluster relation for zero-shot action recognition. IEEE T Circ Syst Vid 33(11):6519\u20136530. https:\/\/doi.org\/10.1109\/TCSVT.2023.3272627","journal-title":"IEEE T Circ Syst Vid"},{"key":"5994_CR26","doi-asserted-by":"publisher","first-page":"1940","DOI":"10.1109\/TMM.2023.3264847","volume":"25","author":"C Qi","year":"2023","unstructured":"Qi C, Feng Z, Xing M et al (2023) Energy-based temporal summarized attentive network for zero-shot action recognition. IEEE Trans Multimedia 25:1940\u20131953. https:\/\/doi.org\/10.1109\/TMM.2023.3264847","journal-title":"IEEE Trans Multimedia"},{"issue":"20","key":"5994_CR27","doi-asserted-by":"publisher","first-page":"24,142","DOI":"10.1007\/s10489-023-04808-w","volume":"53","author":"N Wu","year":"2023","unstructured":"Wu N, Kera H, Kawamoto K (2023) Improving zero-shot action recognition using human instruction with text description. Appl Intell 53(20):24,142-24,156. https:\/\/doi.org\/10.1007\/s10489-023-04808-w","journal-title":"Appl Intell"},{"key":"5994_CR28","doi-asserted-by":"publisher","unstructured":"Xu B, Shu X, Zhang J et al (2023) Spatiotemporal decouple-and-squeeze contrastive learning for semisupervised skeleton-based action recognition. IEEE Trans Neural Netw Learn Syst. https:\/\/doi.org\/10.1109\/TNNLS.2023.3247103","DOI":"10.1109\/TNNLS.2023.3247103"},{"issue":"9","key":"5994_CR29","doi-asserted-by":"publisher","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","volume":"130","author":"K Zhou","year":"2022","unstructured":"Zhou K, Yang J, Loy CC et al (2022) Learning to prompt for vision-language models. Int J Comput Vis 130(9):2337\u20132348. https:\/\/doi.org\/10.1007\/s11263-022-01653-1","journal-title":"Int J Comput Vis"},{"key":"5994_CR30","doi-asserted-by":"publisher","unstructured":"Gao P, Geng S, Zhang R et al (2023) Clip-adapter: Better vision-language models with feature adapters. Int J Comput Vis. https:\/\/doi.org\/10.1007\/s11263-023-01891-x","DOI":"10.1007\/s11263-023-01891-x"},{"key":"5994_CR31","doi-asserted-by":"publisher","unstructured":"Zhang R, Zhang W, Fang R, et\u00a0al (2022) Tip-adapter: Training-free adaption of clip for few-shot classification. In: 17th European conference on computer vision (ECCV), Tel Aviv, ISRAEL, OCT 23-27, 2022. https:\/\/doi.org\/10.1007\/978-3-031-19833-5_29","DOI":"10.1007\/978-3-031-19833-5_29"},{"key":"5994_CR32","doi-asserted-by":"crossref","unstructured":"Wang L, Huang B, Zhao Z, et\u00a0al (2023) Videomae v2: Scaling video masked autoencoders with dual masking. In: IEEE\/CVF conference on computer vision and pattern recognition (CVPR), Vancouver, CANADA, JUN 17-24, 2023","DOI":"10.1109\/CVPR52729.2023.01398"},{"key":"5994_CR33","doi-asserted-by":"publisher","unstructured":"Ju C, Han T, Zheng K et al (2022). Prompting visual-language models for efficient video understanding. In: 17th European conference on computer vision (ECCV), Tel Aviv, ISRAEL, OCT 23-27, 2022. https:\/\/doi.org\/10.1007\/978-3-031-19833-5_7","DOI":"10.1007\/978-3-031-19833-5_7"},{"key":"5994_CR34","doi-asserted-by":"publisher","first-page":"1940","DOI":"10.1109\/TMM.2023.3264847","volume":"25","author":"C Qi","year":"2023","unstructured":"Qi C, Feng Z, Xing M et al (2023) Energy-based temporal summarized attentive network for zero-shot action recognition. IEEE Trans Multimed 25:1940\u20131953. https:\/\/doi.org\/10.1109\/TMM.2023.3264847","journal-title":"IEEE Trans Multimed"},{"issue":"6","key":"5994_CR35","doi-asserted-by":"publisher","first-page":"7836","DOI":"10.1109\/TPAMI.2022.3218596","volume":"45","author":"F Sener","year":"2023","unstructured":"Sener F, Saraf R, Yao A (2023) Transferring knowledge from text to video: Zero-shot anticipation for procedural actions. IEEE Trans Pattern Anal Mach Intell 45(6):7836\u20137852. https:\/\/doi.org\/10.1109\/TPAMI.2022.3218596","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"5994_CR36","doi-asserted-by":"publisher","unstructured":"Zara G, Roy S, Rota P, et\u00a0al (2023) Autolabel: Clip-based framework for open-set video domain adaptation. In: IEEE\/CVF conference on computer vision and pattern recognition (CVPR), Vancouver, CANADA, JUN 17-24, 2023. https:\/\/doi.org\/10.1109\/CVPR52729.2023.01107","DOI":"10.1109\/CVPR52729.2023.01107"},{"key":"5994_CR37","doi-asserted-by":"publisher","unstructured":"Guzhov A, Raue F, Hees J, et\u00a0al (2022) Audioclip: Extending clip to image, text and audio. In: 47th IEEE international conference on acoustics, speech and signal processing (ICASSP), Singapore, SINGAPORE, MAY 22-27, 2022. https:\/\/doi.org\/10.1109\/ICASSP43922.2022.9747631","DOI":"10.1109\/ICASSP43922.2022.9747631"},{"key":"5994_CR38","doi-asserted-by":"publisher","unstructured":"Deng L, Deng F, Zhou K et al (2024) Multi-level attention network: Mixed time-frequency channel attention and multi-scale self-attentive standard deviation pooling for speaker recognition. Eng Appl Artif Intell 128. https:\/\/doi.org\/10.1016\/j.engappai.2023.107439","DOI":"10.1016\/j.engappai.2023.107439"},{"key":"5994_CR39","unstructured":"Gu X, Lin TY, Kuo W, et\u00a0al (2022) Open-vocabulary object detection via vision and language knowledge distillation. In: 10th International conference on learning representations (ICLR), April 25-29 , 2022"},{"key":"5994_CR40","doi-asserted-by":"crossref","unstructured":"Wang L, Xiong Y, Wang Z, et\u00a0al (2016) Temporal segment networks: Towards good practices for deep action recognition. In: 14th European conference on computer vision (ECCV), Amsterdam, NETHERLANDS, OCT 08-16, 2016","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"5994_CR41","doi-asserted-by":"publisher","unstructured":"Wei D, Tian Y, Wei L, et\u00a0al (2022) Efficient dual attention slowfast networks for video action recognition 222. https:\/\/doi.org\/10.1016\/j.cviu.2022.103484","DOI":"10.1016\/j.cviu.2022.103484"},{"key":"5994_CR42","doi-asserted-by":"publisher","unstructured":"Liu Z, Ning J, Cao Y, et\u00a0al (2022) Video swin transformer. In: IEEE\/CVF conference on computer vision and pattern recognition (CVPR), New Orleans, LA, JUN 18-24, 2022. https:\/\/doi.org\/10.1109\/CVPR52688.2022.00320","DOI":"10.1109\/CVPR52688.2022.00320"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-024-05994-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-024-05994-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-024-05994-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,20]],"date-time":"2025-01-20T15:06:07Z","timestamp":1737385567000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-024-05994-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,9]]},"references-count":42,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2025,1]]}},"alternative-id":["5994"],"URL":"https:\/\/doi.org\/10.1007\/s10489-024-05994-x","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"value":"0924-669X","type":"print"},{"value":"1573-7497","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12,9]]},"assertion":[{"value":"30 September 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 December 2024","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}},{"value":"The research conducted in this study adhered to ethical guidelines and principles. The data used in this study are sourced from publicly available, open-access datasets. Data used in research comply with provider terms, and no identifiable information was used. This study did not require informed consent since the data was already de-identified and publicly accessible.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethics approval"}}],"article-number":"110"}}