{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,23]],"date-time":"2026-07-23T00:25:55Z","timestamp":1784766355244,"version":"3.55.0"},"publisher-location":"Cham","reference-count":50,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031250743","type":"print"},{"value":"9783031250750","type":"electronic"}],"license":[{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023]]},"DOI":"10.1007\/978-3-031-25075-0_42","type":"book-chapter","created":{"date-parts":[[2023,2,19]],"date-time":"2023-02-19T09:16:53Z","timestamp":1676798213000},"page":"623-639","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":61,"title":["Multi-modal Depression Estimation Based on\u00a0Sub-attentional Fusion"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8220-6947","authenticated-orcid":false,"given":"Ping-Cheng","family":"Wei","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5419-9292","authenticated-orcid":false,"given":"Kunyu","family":"Peng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4724-9164","authenticated-orcid":false,"given":"Alina","family":"Roitberg","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1090-667X","authenticated-orcid":false,"given":"Kailun","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3471-328X","authenticated-orcid":false,"given":"Jiaming","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8046-4945","authenticated-orcid":false,"given":"Rainer","family":"Stiefelhagen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2023,2,19]]},"reference":[{"key":"42_CR1","doi-asserted-by":"crossref","unstructured":"Akbar, H., Dewi, S., Rozali, Y.A., Lunanta, L.P., Anwar, N., Anwar, D.: Exploiting facial action unit in video for recognizing depression using metaheuristic and neural networks. In: ICCSAI (2021)","DOI":"10.1109\/ICCSAI53272.2021.9609747"},{"key":"42_CR2","doi-asserted-by":"crossref","unstructured":"Al Hanai, T., Ghassemi, M.M., Glass, J.R.: Detecting depression with audio\/text sequence modeling of interviews. In: Interspeech (2018)","DOI":"10.21437\/Interspeech.2018-2522"},{"issue":"1","key":"42_CR3","doi-asserted-by":"publisher","first-page":"262","DOI":"10.1109\/TAFFC.2018.2870884","volume":"12","author":"M Al Jazaery","year":"2021","unstructured":"Al Jazaery, M., Guo, G.: Video-based depression level analysis by encoding deep spatiotemporal features. IEEE Trans. Affect. Comput. 12(1), 262\u2013268 (2021)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"42_CR4","unstructured":"Bhukya, B.B., Sravanthi, K.: Major depression disorder (2019)"},{"key":"42_CR5","doi-asserted-by":"publisher","first-page":"115","DOI":"10.1016\/j.patrec.2021.07.005","volume":"150","author":"Q Chen","year":"2021","unstructured":"Chen, Q., Chaturvedi, I., Ji, S., Cambria, E.: Sequential fusion of facial appearance and dynamics for depression recognition. Pattern Recognit. Lett. 150, 115\u2013121 (2021)","journal-title":"Pattern Recognit. Lett."},{"key":"42_CR6","unstructured":"Chen, X., Hsieh, C.J., Gong, B.: When vision transformers outperform ResNets without pre-training or strong data augmentations. In: ICLR (2022)"},{"key":"42_CR7","doi-asserted-by":"crossref","unstructured":"Cohn, J.F., et al.: Detecting depression from facial actions and vocal prosody. In: ACII (2009)","DOI":"10.1109\/ACII.2009.5349358"},{"key":"42_CR8","doi-asserted-by":"crossref","unstructured":"Cummins, N., Joshi, J., Dhall, A., Sethu, V., Goecke, R., Epps, J.: Diagnosis of depression by behavioural signals: a multimodal approach. In: AVEC@ACM Multimedia (2013)","DOI":"10.1145\/2512530.2512535"},{"key":"42_CR9","doi-asserted-by":"crossref","unstructured":"Dai, Y., Gieseke, F., Oehmcke, S., Wu, Y., Barnard, K.: Attentional feature fusion. In: WACV (2021)","DOI":"10.1109\/WACV48630.2021.00360"},{"key":"42_CR10","unstructured":"DAIC-WOZ Database. https:\/\/dcapswoz.ict.usc.edu\/. Accessed 21 Oct 2019"},{"key":"42_CR11","unstructured":"Dinkel, H., Wu, M., Yu, K.: Text-based depression detection on sparse data. arXiv preprint arXiv:1904.05154 (2019)"},{"key":"42_CR12","doi-asserted-by":"crossref","unstructured":"Du, Z., Li, W., Huang, D., Wang, Y.: Encoding visual behaviors with attentive temporal convolution for depression prediction. In: FG (2019)","DOI":"10.1109\/FG.2019.8756584"},{"key":"42_CR13","doi-asserted-by":"crossref","unstructured":"Dumpala, S.H., Rempel, S., Dikaios, K., Sajjadian, M., Uher, R., Oore, S.: Estimating severity of depression from acoustic features and embeddings of natural speech. In: ICASSP (2021)","DOI":"10.1109\/ICASSP39728.2021.9414129"},{"key":"42_CR14","unstructured":"Foret, P., Kleiner, A., Mobahi, H., Neyshabur, B.: Sharpness-aware minimization for efficiently improving generalization. In: ICLR (2021)"},{"issue":"6","key":"42_CR15","doi-asserted-by":"publisher","first-page":"332","DOI":"10.1097\/00005053-198406000-00004","volume":"172","author":"L Fossi","year":"1984","unstructured":"Fossi, L., Faravelli, C., Paoli, M.: The ethological approach to the assessment of depressive disorders. J. Nerv. Mental Dis. 172(6), 332\u2013341 (1984)","journal-title":"J. Nerv. Mental Dis."},{"key":"42_CR16","doi-asserted-by":"crossref","unstructured":"Gong, Y., Poellabauer, C.: Topic modeling based multi-modal depression detection. In: AVEC@ACM Multimedia (2017)","DOI":"10.1145\/3133944.3133945"},{"key":"42_CR17","unstructured":"Gratch, J., et al.: The distress analysis interview corpus of human and computer interviews. In: LREC (2014)"},{"key":"42_CR18","doi-asserted-by":"crossref","unstructured":"Guo, Y., Zhu, C., Hao, S., Hong, R.: Automatic depression detection via learning and fusing features from visual cues. arXiv preprint arXiv:2203.00304 (2022)","DOI":"10.1109\/TCSS.2022.3202316"},{"issue":"4","key":"42_CR19","first-page":"S92","volume":"13","author":"A Halfin","year":"2007","unstructured":"Halfin, A.: Depression: the benefits of early and appropriate treatment. Am. J. Manag. Care 13(4), S92 (2007)","journal-title":"Am. J. Manag. Care"},{"key":"42_CR20","doi-asserted-by":"crossref","unstructured":"Hao, Y., Cao, Y., Li, B., Rahman, M.: Depression recognition based on text and facial expression. In: SPIE (2021)","DOI":"10.1117\/12.2606315"},{"key":"42_CR21","doi-asserted-by":"crossref","unstructured":"He, L., Jiang, D., Sahli, H.: Multimodal depression recognition with dynamic visual and audio cues. In: ACII (2015)","DOI":"10.1109\/ACII.2015.7344581"},{"key":"42_CR22","doi-asserted-by":"publisher","first-page":"56","DOI":"10.1016\/j.inffus.2021.10.012","volume":"80","author":"L He","year":"2022","unstructured":"He, L., et al.: Deep learning for depression recognition with audiovisual cues: a review. Inf. Fusion 80, 56\u201386 (2022)","journal-title":"Inf. Fusion"},{"issue":"4","key":"42_CR23","doi-asserted-by":"publisher","first-page":"597","DOI":"10.1017\/S0033291703001399","volume":"34","author":"F Jacobi","year":"2004","unstructured":"Jacobi, F., et al.: Prevalence, co-morbidity and correlates of mental disorders in the general population: results from the German health interview and examination survey (GHS). Psychol. Med. 34(4), 597\u2013611 (2004)","journal-title":"Psychol. Med."},{"issue":"3","key":"42_CR24","doi-asserted-by":"publisher","first-page":"217","DOI":"10.1007\/s12193-013-0123-2","volume":"7","author":"J Joshi","year":"2013","unstructured":"Joshi, J., et al.: Multimodal assistive technologies for depression diagnosis and monitoring. J. Multimodal User Interfaces 7(3), 217\u2013228 (2013)","journal-title":"J. Multimodal User Interfaces"},{"key":"42_CR25","doi-asserted-by":"crossref","unstructured":"Kaya, H., Salah, A.A.: Eyes whisper depression: a CCA based multimodal approach. In: ACM Multimedia (2014)","DOI":"10.1145\/2647868.2654978"},{"issue":"1\u20133","key":"42_CR26","doi-asserted-by":"publisher","first-page":"163","DOI":"10.1016\/j.jad.2008.06.026","volume":"114","author":"K Kroenke","year":"2009","unstructured":"Kroenke, K., Strine, T.W., Spitzer, R.L., Williams, J.B., Berry, J.T., Mokdad, A.H.: The PHQ-8 as a measure of current depression in the general population. J. Affect. Disord. 114(1\u20133), 163\u2013173 (2009)","journal-title":"J. Affect. Disord."},{"issue":"9","key":"42_CR27","doi-asserted-by":"publisher","first-page":"771","DOI":"10.1001\/archpsyc.1989.01810090013002","volume":"46","author":"DJ Kupfer","year":"1989","unstructured":"Kupfer, D.J., Frank, E., Perel, J.M.: The advantage of early treatment intervention in recurrent depression. Arch. Gen. Psychiatry 46(9), 771\u2013775 (1989)","journal-title":"Arch. Gen. Psychiatry"},{"issue":"9","key":"42_CR28","doi-asserted-by":"publisher","first-page":"3166","DOI":"10.3390\/app10093166","volume":"10","author":"CJ Lin","year":"2020","unstructured":"Lin, C.J., Lin, C.H., Jeng, S.Y.: Using feature fusion and parameter optimization of dual-input convolutional neural network for face gender recognition. Appl. Sci. 10(9), 3166 (2020)","journal-title":"Appl. Sci."},{"key":"42_CR29","doi-asserted-by":"crossref","unstructured":"Ma, X., Yang, H., Chen, Q., Huang, D., Wang, Y.: DepAudioNet: an efficient deep model for audio based depression classification. In: AVEC@ACM Multimedia (2016)","DOI":"10.1145\/2988257.2988267"},{"key":"42_CR30","unstructured":"World Health Organization: Depression and other common mental disorders: global health estimates. Technical report, World Health Organization (2017)"},{"key":"42_CR31","doi-asserted-by":"crossref","unstructured":"Pampouchidou, A., et al.: Depression assessment by fusing high and low level features from audio, video, and text. In: AVEC@ACM Multimedia (2016)","DOI":"10.1145\/2988257.2988266"},{"issue":"4","key":"42_CR32","doi-asserted-by":"publisher","first-page":"445","DOI":"10.1109\/TAFFC.2017.2724035","volume":"10","author":"A Pampouchidou","year":"2019","unstructured":"Pampouchidou, A., et al.: Automatic assessment of depression based on visual cues: a systematic review. IEEE Trans. Affect. Comput. 10(4), 445\u2013470 (2019)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"42_CR33","unstructured":"Paszke, A., et al.: PyTorch: an imperative style, high-performance deep learning library. In: NeurIPS (2019)"},{"key":"42_CR34","doi-asserted-by":"crossref","unstructured":"Rathi, S., Kaur, B., Agrawal, R.: Enhanced depression detection from facial cues using univariate feature selection techniques. In: PReMI (2019)","DOI":"10.1007\/978-3-030-34869-4_3"},{"key":"42_CR35","doi-asserted-by":"crossref","unstructured":"Ray, A., Kumar, S., Reddy, R., Mukherjee, P., Garg, R.: Multi-level attention network using text, audio and video for depression prediction. In: AVEC@MM (2019)","DOI":"10.1145\/3347320.3357697"},{"key":"42_CR36","doi-asserted-by":"crossref","unstructured":"Saidi, A., Othman, S.B., Saoud, S.B.: Hybrid CNN-SVM classifier for efficient depression detection system. In: IC_ASET (2020)","DOI":"10.1109\/IC_ASET49463.2020.9318302"},{"key":"42_CR37","unstructured":"Salimath, A.K., Thomas, R.K., Reddy, S.R., Qiao, Y.: Detecting levels of depression in text based on metrics. arXiv preprint arXiv:1807.03397 (2018)"},{"key":"42_CR38","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2021.116076","volume":"189","author":"S Sardari","year":"2022","unstructured":"Sardari, S., Nakisa, B., Rastgoo, M.N., Eklund, P.: Audio based depression detection using convolutional autoencoder. Expert Syst. Appl. 189, 116076 (2022)","journal-title":"Expert Syst. Appl."},{"key":"42_CR39","doi-asserted-by":"crossref","unstructured":"Scherer, K.R.: Vocal affect expression: a review and a model for future research (1986)","DOI":"10.1037\/0033-2909.99.2.143"},{"key":"42_CR40","doi-asserted-by":"crossref","unstructured":"Stepanov, E.A., et al.: Depression severity estimation from multiple modalities. In: HealthCom (2018)","DOI":"10.1109\/HealthCom.2018.8531119"},{"key":"42_CR41","doi-asserted-by":"crossref","unstructured":"Tang, Y., et al.: Uncertainty-aware score distribution learning for action quality assessment. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00986"},{"key":"42_CR42","doi-asserted-by":"crossref","unstructured":"Uddin, M.A., Joolee, J.B., Sohn, K.A.: Deep multi-modal network based automated depression severity estimation. IEEE Trans. Affect. Comput. (2022)","DOI":"10.1109\/TAFFC.2022.3179478"},{"key":"42_CR43","doi-asserted-by":"crossref","unstructured":"Valstar, M., et al.: AVEC 2016: depression, mood, and emotion recognition workshop and challenge. In: ACM Multimedia (2016)","DOI":"10.1145\/2988257.2988258"},{"key":"42_CR44","doi-asserted-by":"crossref","unstructured":"Valstar, M., et al.: AVEC 2016: depression, mood, and emotion recognition workshop and challenge. In: AVEC@ACM Multimedia (2016)","DOI":"10.1145\/2988257.2988258"},{"issue":"3","key":"42_CR45","doi-asserted-by":"publisher","first-page":"319","DOI":"10.1037\/h0036706","volume":"83","author":"P Waxer","year":"1974","unstructured":"Waxer, P.: Nonverbal cues for depression. J. Abnorm. Psychol. 83(3), 319 (1974)","journal-title":"J. Abnorm. Psychol."},{"key":"42_CR46","unstructured":"WHO: Depression key facts. World Health Organization (2021). https:\/\/www.who.int\/news-room\/fact-sheets\/detail\/depression"},{"key":"42_CR47","doi-asserted-by":"crossref","unstructured":"Williamson, J.R., et al.: Detecting depression using vocal, facial and semantic communication cues. In: AVEC@ACM Multimedia (2016)","DOI":"10.1145\/2988257.2988263"},{"key":"42_CR48","doi-asserted-by":"crossref","unstructured":"Williamson, J.R., Quatieri, T.F., Helfer, B.S., Horwitz, R., Yu, B., Mehta, D.D.: Vocal biomarkers of depression based on motor incoordination. In: AVEC@ACM Multimedia (2013)","DOI":"10.1145\/2512530.2512531"},{"issue":"2","key":"42_CR49","doi-asserted-by":"publisher","first-page":"865","DOI":"10.1109\/JBHI.2021.3092628","volume":"26","author":"W Xie","year":"2022","unstructured":"Xie, W., et al.: Interpreting depression from question-wise long-term video recording of SDS evaluation. IEEE J. Biomed. Health Inform. 26(2), 865\u2013875 (2022)","journal-title":"IEEE J. Biomed. Health Inform."},{"issue":"4","key":"42_CR50","doi-asserted-by":"publisher","first-page":"578","DOI":"10.1109\/TAFFC.2017.2650899","volume":"9","author":"Y Zhu","year":"2018","unstructured":"Zhu, Y., Shang, Y., Shao, Z., Guo, G.: Automated depression diagnosis based on deep networks to encode facial appearance and dynamics. IEEE Trans. Affect. Comput. 9(4), 578\u2013584 (2018)","journal-title":"IEEE Trans. Affect. Comput."}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2022 Workshops"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-25075-0_42","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,2,19]],"date-time":"2023-02-19T09:36:11Z","timestamp":1676799371000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-25075-0_42"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023]]},"ISBN":["9783031250743","9783031250750"],"references-count":50,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-25075-0_42","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023]]},"assertion":[{"value":"19 February 2023","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Tel Aviv","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Israel","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2022","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 October 2022","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27 October 2022","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2022","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2022.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Double-blind","order":1,"name":"type","label":"Type","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"CMT","order":2,"name":"conference_management_system","label":"Conference Management System","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"5804","order":3,"name":"number_of_submissions_sent_for_review","label":"Number of Submissions Sent for Review","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"1645","order":4,"name":"number_of_full_papers_accepted","label":"Number of Full Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"0","order":5,"name":"number_of_short_papers_accepted","label":"Number of Short Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"28% - The value is computed by the equation \"Number of Full Papers Accepted \/ Number of Submissions Sent for Review * 100\" and then rounded to a whole number.","order":6,"name":"acceptance_rate_of_full_papers","label":"Acceptance Rate of Full Papers","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.21","order":7,"name":"average_number_of_reviews_per_paper","label":"Average Number of Reviews per Paper","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.91","order":8,"name":"average_number_of_papers_per_reviewer","label":"Average Number of Papers per Reviewer","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"Yes","order":9,"name":"external_reviewers_involved","label":"External Reviewers Involved","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"From the workshops, 367 reviewed full papers have been selected for publication","order":10,"name":"additional_info_on_review_process","label":"Additional Info on Review Process","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}}]}}