{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,17]],"date-time":"2025-11-17T21:57:38Z","timestamp":1763416658742,"version":"3.45.0"},"publisher-location":"Singapore","reference-count":21,"publisher":"Springer Nature Singapore","isbn-type":[{"type":"print","value":"9789819530571"},{"type":"electronic","value":"9789819530588"}],"license":[{"start":{"date-parts":[[2025,11,18]],"date-time":"2025-11-18T00:00:00Z","timestamp":1763424000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,11,18]],"date-time":"2025-11-18T00:00:00Z","timestamp":1763424000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-981-95-3058-8_19","type":"book-chapter","created":{"date-parts":[[2025,11,17]],"date-time":"2025-11-17T21:52:43Z","timestamp":1763416363000},"page":"218-225","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["MTCA-ViT: Multi-Modal Temporal Contrastive Vision Transformer for\u00a0Depression Detection"],"prefix":"10.1007","author":[{"given":"Liangguo","family":"Wang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuxuan","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiaqian","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Eziz","family":"Tursun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,11,18]]},"reference":[{"key":"19_CR1","unstructured":"COVID-19 Mental Disorders Collaborators. Global prevalence and burden of depressive and anxiety disorders in 204 countries and territories in 2020 due to the COVID-19 pandemic. The Lancet 398(10312), 1700\u20131712 (2021)"},{"issue":"1","key":"19_CR2","doi-asserted-by":"publisher","first-page":"56","DOI":"10.1136\/jnnp.23.1.56","volume":"23","author":"M Hamilton","year":"1960","unstructured":"Hamilton, M.: A rating scale for depression. J. Neurol. Neurosur. Psych. 23(1), 56\u201362 (1960)","journal-title":"J. Neurol. Neurosur. Psych."},{"key":"19_CR3","doi-asserted-by":"publisher","first-page":"10","DOI":"10.1016\/j.specom.2015.03.004","volume":"71","author":"N Cummins","year":"2015","unstructured":"Cummins, N., Scherer, S., Krajewski, J., Schnieder, S., Epps, J., Quatieri, T.F.: A review of depression and suicide risk assessment using speech analysis. Speech Commun. 71, 10\u201349 (2015)","journal-title":"Speech Commun."},{"key":"19_CR4","doi-asserted-by":"crossref","unstructured":"Yang, L., Jiang, D., He, L., Pei, E., Oveneke, M.C., Sahli, H.: Multimodal measurement of depression using deep learning models. In: Proceedings of the 7th Annual Workshop on Audio\/Visual Emotion Challenge, pp. 53\u201359 (2017)","DOI":"10.1145\/3133944.3133948"},{"key":"19_CR5","doi-asserted-by":"publisher","DOI":"10.1016\/j.bspc.2022.104561","volume":"82","author":"M Fang","year":"2023","unstructured":"Fang, M., Peng, S., Liang, Y., Gong, Y., Lyu, X., Li, S.: A multimodal fusion model with multi-level attention mechanism for depression detection. Biomed. Signal Process. Control 82, 104561 (2023)","journal-title":"Biomed. Signal Process. Control"},{"key":"19_CR6","doi-asserted-by":"crossref","unstructured":"Ma, X., Yang, H., Chen, Q., Huang, D., Wang, Y.: DepAudioNet: an efficient deep model for audio based depression classification. In: Proceedings of the 6th International Workshop on Audio\/Visual Emotion Challenge, pp. 35\u201342 (2016)","DOI":"10.1145\/2988257.2988267"},{"issue":"3","key":"19_CR7","doi-asserted-by":"publisher","first-page":"1366","DOI":"10.1109\/TAFFC.2020.3003816","volume":"13","author":"D Avola","year":"2020","unstructured":"Avola, D., Cinque, L., Fagioli, A., Foresti, G.L., Massaroni, C.: Deep temporal analysis for non-acted body affect recognition. IEEE Trans. Affect. Comput. 13(3), 1366\u20131377 (2020)","journal-title":"IEEE Trans. Affect. Comput."},{"issue":"2","key":"19_CR8","doi-asserted-by":"publisher","first-page":"423","DOI":"10.1109\/TPAMI.2018.2798607","volume":"41","author":"T Baltru\u0161aitis","year":"2018","unstructured":"Baltru\u0161aitis, T., Ahuja, C., Morency, L.-P.: Multimodal machine learning: a survey and taxonomy. IEEE Trans. Patt. Anal. Mach. Intell. 41(2), 423\u2013443 (2018)","journal-title":"IEEE Trans. Patt. Anal. Mach. Intell."},{"key":"19_CR9","doi-asserted-by":"publisher","first-page":"1079448","DOI":"10.3389\/fpsyt.2023.1079448","volume":"14","author":"W Pan","year":"2023","unstructured":"Pan, W., et al.: Exploring the ability of vocal biomarkers in distinguishing depression from bipolar disorder, schizophrenia, and healthy controls. Front. Psych. 14, 1079448 (2023)","journal-title":"Front. Psych."},{"issue":"4","key":"19_CR10","doi-asserted-by":"publisher","first-page":"578","DOI":"10.1109\/TAFFC.2017.2650899","volume":"9","author":"Y Zhu","year":"2017","unstructured":"Zhu, Y., Shang, Y., Shao, Z., Guo, G.: Automated depression diagnosis based on deep networks to encode facial appearance and dynamics. IEEE Trans. Affect. Comput. 9(4), 578\u2013584 (2017)","journal-title":"IEEE Trans. Affect. Comput."},{"issue":"4","key":"19_CR11","doi-asserted-by":"publisher","first-page":"478","DOI":"10.1109\/TAFFC.2016.2634527","volume":"9","author":"S Alghowinem","year":"2016","unstructured":"Alghowinem, S., et al.: Multimodal depression detection: Fusion analysis of paralinguistic, head pose and eye gaze behaviors. IEEE Trans. Affect. Comput. 9(4), 478\u2013490 (2016)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"19_CR12","unstructured":"Chen, T., Kornblith, S., Norouzi, M., Hinton, G.: A simple framework for contrastive learning of visual representations. In: International Conference on Machine Learning, pp. 1597\u20131607 (2020)"},{"key":"19_CR13","doi-asserted-by":"crossref","unstructured":"Wang, X., Wu, Y., Zhu, L., Yang, Y. : Symbiotic attention with privileged information for egocentric action recognition. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, no. 07, pp. 12249\u201312256 (2020)","DOI":"10.1609\/aaai.v34i07.6907"},{"key":"19_CR14","unstructured":"Dosovitskiy, A., et al.: An image is worth 16x16 words: Transformers for image recognition at scale. In: International Conference on Learning Representations (2021)"},{"key":"19_CR15","unstructured":"Choi, E., et al.: Retain: An interpretable predictive model for healthcare using reverse time attention mechanism. Adv. Neural Inf. Process. Syst. 29 (2016)"},{"key":"19_CR16","unstructured":"Vaswani, A., et al.: Attention is all you need. Adv. Neural Inf. Process. Syst. 30 (2017)"},{"issue":"12","key":"19_CR17","doi-asserted-by":"publisher","first-page":"2014","DOI":"10.1093\/jamia\/ocac168","volume":"29","author":"M Golovanevsky","year":"2022","unstructured":"Golovanevsky, M., Eickhoff, C., Singh, R.: Multimodal attention-based deep learning for Alzheimer\u2019s disease diagnosis. J. Am. Med. Inf. Assoc. 29(12), 2014\u20132022 (2022)","journal-title":"J. Am. Med. Inf. Assoc."},{"key":"19_CR18","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2024.112264","volume":"300","author":"D Cui","year":"2024","unstructured":"Cui, D., Xin, C., Wu, L., Wang, Y., Zhang, J.: ConvTransformer Attention Network for temporal action detection. Knowledge-Based Syst. 300, 112264 (2024)","journal-title":"Knowledge-Based Syst."},{"key":"19_CR19","unstructured":"Zhang, Y., Wang, X., Li, H., Yang, Y., Li, X.: LMVD: a large-scale multimodal vlog dataset for depression detection in the wild. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 20961\u201320971 (2023)"},{"key":"19_CR20","doi-asserted-by":"crossref","unstructured":"Chollet, F.: Xception: Deep learning with depthwise separable convolutions. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1251\u20131258 (2017)","DOI":"10.1109\/CVPR.2017.195"},{"key":"19_CR21","doi-asserted-by":"crossref","unstructured":"Hu, J., Shen, L., Sun, G.: Squeeze-and-excitation networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 7132\u20137141 (2018)","DOI":"10.1109\/CVPR.2018.00745"}],"container-title":["Lecture Notes in Computer Science","Knowledge Science, Engineering and Management"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-95-3058-8_19","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,17]],"date-time":"2025-11-17T21:52:46Z","timestamp":1763416366000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-95-3058-8_19"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,11,18]]},"ISBN":["9789819530571","9789819530588"],"references-count":21,"URL":"https:\/\/doi.org\/10.1007\/978-981-95-3058-8_19","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2025,11,18]]},"assertion":[{"value":"18 November 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"KSEM","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Knowledge Science, Engineering and Management","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Macao","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 August 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"7 August 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"ksem2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/ksem2025.scimeeting.cn\/en\/web\/index\/27434","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}