{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,3]],"date-time":"2026-04-03T15:13:40Z","timestamp":1775229220615,"version":"3.50.1"},"publisher-location":"Cham","reference-count":42,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031783043","type":"print"},{"value":"9783031783050","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,12,4]],"date-time":"2024-12-04T00:00:00Z","timestamp":1733270400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,4]],"date-time":"2024-12-04T00:00:00Z","timestamp":1733270400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-78305-0_26","type":"book-chapter","created":{"date-parts":[[2024,12,3]],"date-time":"2024-12-03T10:11:10Z","timestamp":1733220670000},"page":"403-418","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Fusing Multimodal Streams for Improved Group Emotion Recognition in Videos"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8622-7251","authenticated-orcid":false,"given":"Deepak","family":"Kumar","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-0532-6324","authenticated-orcid":false,"given":"Piyush","family":"Dhamdhere","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6277-6267","authenticated-orcid":false,"given":"Balasubramanian","family":"Raman","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,12,4]]},"reference":[{"key":"26_CR1","doi-asserted-by":"publisher","first-page":"204","DOI":"10.1016\/j.inffus.2021.06.003","volume":"76","author":"SA Abdu","year":"2021","unstructured":"Abdu, S.A., Yousef, A.H., Salem, A.: Multimodal video sentiment analysis using deep learning approaches, a survey. Information Fusion 76, 204\u2013226 (2021)","journal-title":"Information Fusion"},{"key":"26_CR2","doi-asserted-by":"crossref","unstructured":"Augusma, A., Vaufreydaz, D., Letu\u00e9, F.: Multimodal group emotion recognition in-the-wild using privacy-compliant features. In: Proceedings of the 25th International Conference on Multimodal Interaction. pp. 750\u2013754 (2023)","DOI":"10.1145\/3577190.3616546"},{"key":"26_CR3","unstructured":"Baevski, A., Zhou, Y., Mohamed, A., Auli, M.: wav2vec 2.0: A framework for self-supervised learning of speech representations. Advances in neural information processing systems 33, 12449\u201312460 (2020)"},{"key":"26_CR4","doi-asserted-by":"crossref","unstructured":"Balaji, B., Oruganti, V.R.M.: Multi-level feature fusion for group-level emotion recognition. In: Proceedings of the 19th ACM international conference on multimodal interaction. pp. 583\u2013586 (2017)","DOI":"10.1145\/3136755.3143013"},{"key":"26_CR5","unstructured":"Belova, N.S.: Group-level affect recognition in video using deviation of frame features. In: Analysis of Images, Social Networks and Texts: 10th International Conference, AIST 2021, Tbilisi, Georgia, December 16\u201318, 2021, Revised Selected Papers. vol. 13217, p.\u00a0199. Springer Nature (2022)"},{"key":"26_CR6","unstructured":"Bertasius, G., Wang, H., Torresani, L.: Is space-time attention all you need for video understanding? In: Proceedings of the International Conference on Machine Learning (ICML) (July 2021)"},{"key":"26_CR7","doi-asserted-by":"crossref","unstructured":"Castro, S., Hazarika, D., P\u00e9rez-Rosas, V., Zimmermann, R., Mihalcea, R., Poria, S.: Towards multimodal sarcasm detection (an _obviously_ perfect paper). arXiv preprint arXiv:1906.01815 (2019)","DOI":"10.18653\/v1\/P19-1455"},{"key":"26_CR8","doi-asserted-by":"publisher","first-page":"843","DOI":"10.3758\/s13423-013-0564-3","volume":"21","author":"JA Collins","year":"2014","unstructured":"Collins, J.A., Olson, I.R.: Knowledge is power: How conceptual knowledge transforms visual cognition. Psychonomic bulletin & review 21, 843\u2013860 (2014)","journal-title":"Psychonomic bulletin & review"},{"issue":"1","key":"26_CR9","doi-asserted-by":"publisher","first-page":"347","DOI":"10.1109\/TAFFC.2020.2986969","volume":"13","author":"MG Constantin","year":"2020","unstructured":"Constantin, M.G., \u015etefan, L.D., Ionescu, B., Demarty, C.H., Sj\u00f6berg, M., Schedl, M., Gravier, G.: Affect in multimedia: Benchmarking violent scenes detection. IEEE Trans. Affect. Comput. 13(1), 347\u2013366 (2020)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"26_CR10","doi-asserted-by":"crossref","unstructured":"Dhall, A., Sharma, G., Goecke, R., Gedeon, T.: Emotiw 2020: Driver gaze, group emotion, student engagement and physiological signal based challenges. In: Proceedings of the 2020 International Conference on Multimodal Interaction. pp. 784\u2013789 (2020)","DOI":"10.1145\/3382507.3417973"},{"key":"26_CR11","unstructured":"Evtodienko, L.: Multimodal end-to-end group emotion recognition using cross-modal attention. arXiv preprint arXiv:2111.05890 (2021)"},{"key":"26_CR12","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Fan, H., Malik, J., He, K.: Slowfast networks for video recognition. In: Proceedings of the IEEE\/CVF international conference on computer vision. pp. 6202\u20136211 (2019)","DOI":"10.1109\/ICCV.2019.00630"},{"key":"26_CR13","doi-asserted-by":"publisher","first-page":"53930","DOI":"10.1109\/ACCESS.2018.2870063","volume":"6","author":"PM Ferreira","year":"2018","unstructured":"Ferreira, P.M., Marques, F., Cardoso, J.S., Rebelo, A.: Physiological inspired deep neural networks for emotion recognition. IEEE Access 6, 53930\u201353943 (2018)","journal-title":"IEEE Access"},{"key":"26_CR14","doi-asserted-by":"crossref","unstructured":"Guo, X., Zhu, B., Polan\u00eda, L.F., Boncelet, C., Barner, K.E.: Group-level emotion recognition using hybrid deep models based on faces, scenes, skeletons and visual attentions. In: Proceedings of the 20th ACM International Conference on Multimodal Interaction. pp. 635\u2013639 (2018)","DOI":"10.1145\/3242969.3264990"},{"key":"26_CR15","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"26_CR16","volume-title":"OpenCV computer vision with python","author":"J Howse","year":"2013","unstructured":"Howse, J.: OpenCV computer vision with python, vol. 27. Packt Publishing Birmingham, UK (2013)"},{"issue":"2","key":"26_CR17","doi-asserted-by":"publisher","first-page":"713","DOI":"10.1109\/TAFFC.2019.2953664","volume":"13","author":"X Huang","year":"2019","unstructured":"Huang, X., Dhall, A., Goecke, R., Pietik\u00e4inen, M., Zhao, G.: Analyzing group-level emotion with global alignment kernel based approach. IEEE Trans. Affect. Comput. 13(2), 713\u2013728 (2019)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"26_CR18","doi-asserted-by":"crossref","unstructured":"Jin, B.T., Abdelrahman, L., Chen, C.K., Khanzada, A.: Fusical: Multimodal fusion for video sentiment. In: Proceedings of the 2020 International Conference on Multimodal Interaction. pp. 798\u2013806 (2020)","DOI":"10.1145\/3382507.3417966"},{"key":"26_CR19","unstructured":"Jocher, G., Chaurasia, A., Qiu, J.: Ultralytics YOLO (Jan 2023), https:\/\/github.com\/ultralytics\/ultralytics"},{"issue":"1","key":"26_CR20","doi-asserted-by":"publisher","first-page":"99","DOI":"10.1006\/obhd.2001.2974","volume":"86","author":"JR Kelly","year":"2001","unstructured":"Kelly, J.R., Barsade, S.G.: Mood and emotions in small groups and work teams. Organ. Behav. Hum. Decis. Process. 86(1), 99\u2013130 (2001)","journal-title":"Organ. Behav. Hum. Decis. Process."},{"issue":"3","key":"26_CR21","doi-asserted-by":"publisher","first-page":"1195","DOI":"10.1109\/TAFFC.2020.2981446","volume":"13","author":"S Li","year":"2020","unstructured":"Li, S., Deng, W.: Deep facial expression recognition: A survey. IEEE Trans. Affect. Comput. 13(3), 1195\u20131215 (2020)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"26_CR22","doi-asserted-by":"crossref","unstructured":"Liu, C., Jiang, W., Wang, M., Tang, T.: Group level audio-video emotion recognition using hybrid networks. In: Proceedings of the 2020 International Conference on Multimodal Interaction. pp. 807\u2013812 (2020)","DOI":"10.1145\/3382507.3417968"},{"key":"26_CR23","doi-asserted-by":"crossref","unstructured":"Magnani, L., Civita, S., Massara, G.P.: Visual cognition and cognitive modeling. Human and machine vision: Analogies and divergencies pp. 229\u2013243 (1994)","DOI":"10.1007\/978-1-4899-1004-2_16"},{"key":"26_CR24","unstructured":"Morris, R.G., Tarassenko, L., Kenward, M.: Cognitive systems-Information processing meets brain science. Elsevier (2005)"},{"key":"26_CR25","doi-asserted-by":"publisher","first-page":"259","DOI":"10.1146\/annurev.psych.121208.131605","volume":"63","author":"PM Niedenthal","year":"2012","unstructured":"Niedenthal, P.M., Brauer, M.: Social functionality of human emotion. Annu. Rev. Psychol. 63, 259\u2013285 (2012)","journal-title":"Annu. Rev. Psychol."},{"key":"26_CR26","unstructured":"O\u2019Malley, T., Bursztein, E., Long, J., Chollet, F., Jin, H., Invernizzi, L., et\u00a0al.: Kerastuner. https:\/\/github.com\/keras-team\/keras-tuner (2019)"},{"key":"26_CR27","doi-asserted-by":"crossref","unstructured":"Pan, C., Yu, D., Sijiang, L., Zhen, G., Lei, Y.: Group emotion recognition based on multilayer hybrid network. In: 2018 IEEE 3rd International Conference on Image, Vision and Computing (ICIVC). pp. 173\u2013177. IEEE (2018)","DOI":"10.1109\/ICIVC.2018.8492827"},{"key":"26_CR28","doi-asserted-by":"crossref","unstructured":"Petrova, A., Vaufreydaz, D., Dessus, P.: Group-level emotion recognition using a unimodal privacy-safe non-individual approach. In: Proceedings of the 2020 International Conference on Multimodal Interaction. pp. 813\u2013820 (2020)","DOI":"10.1145\/3382507.3417969"},{"key":"26_CR29","doi-asserted-by":"crossref","unstructured":"Pinto, J.R., Gon\u00e7alves, T., Pinto, C., Sanhudo, L., Fonseca, J., Gon\u00e7alves, F., Carvalho, P., Cardoso, J.S.: Audiovisual classification of group emotion valence using activity recognition networks. In: 2020 IEEE 4th International Conference on Image Processing, Applications and Systems (IPAS). pp. 114\u2013119. IEEE (2020)","DOI":"10.1109\/IPAS50080.2020.9334943"},{"issue":"3","key":"26_CR30","doi-asserted-by":"publisher","first-page":"237","DOI":"10.3103\/S1060992X22030055","volume":"31","author":"AV Savchenko","year":"2022","unstructured":"Savchenko, A.V., Makarov, I.: Neural network model for video-based analysis of student\u2019s emotions in e-learning. Optical Memory and Neural Networks 31(3), 237\u2013244 (2022)","journal-title":"Optical Memory and Neural Networks"},{"issue":"2","key":"26_CR31","doi-asserted-by":"publisher","first-page":"1056","DOI":"10.1109\/TAFFC.2021.3104170","volume":"14","author":"G Sharma","year":"2021","unstructured":"Sharma, G., Dhall, A., Cai, J.: Audio-visual automatic group affect analysis. IEEE Trans. Affect. Comput. 14(2), 1056\u20131069 (2021)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"26_CR32","doi-asserted-by":"crossref","unstructured":"Sharma, G., Ghosh, S., Dhall, A.: Automatic group level affect and cohesion prediction in videos. In: 2019 8th International Conference on Affective Computing and Intelligent Interaction Workshops and Demos (ACIIW). pp. 161\u2013167. IEEE (2019)","DOI":"10.1109\/ACIIW.2019.8925231"},{"key":"26_CR33","doi-asserted-by":"crossref","unstructured":"Tian, Y., Lu, G., Yan, Y., Zhai, G., Chen, L., Gao, Z.: A coding framework and benchmark towards low-bitrate video understanding. IEEE Transactions on Pattern Analysis and Machine Intelligence (2024)","DOI":"10.1109\/TPAMI.2024.3367879"},{"key":"26_CR34","doi-asserted-by":"crossref","unstructured":"Tian, Y., Lu, G., Zhai, G., Gao, Z.: Non-semantics suppressed mask learning for unsupervised video semantic compression. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 13610\u201313622 (2023)","DOI":"10.1109\/ICCV51070.2023.01252"},{"issue":"10","key":"26_CR35","doi-asserted-by":"publisher","first-page":"2453","DOI":"10.1007\/s11263-022-01661-1","volume":"130","author":"Y Tian","year":"2022","unstructured":"Tian, Y., Yan, Y., Zhai, G., Guo, G., Gao, Z.: Ean: event adaptive network for enhanced action recognition. Int. J. Comput. Vision 130(10), 2453\u20132471 (2022)","journal-title":"Int. J. Comput. Vision"},{"issue":"1","key":"26_CR36","doi-asserted-by":"publisher","first-page":"89","DOI":"10.1109\/TAFFC.2021.3065726","volume":"14","author":"EA Veltmeijer","year":"2021","unstructured":"Veltmeijer, E.A., Gerritsen, C., Hindriks, K.V.: Automatic emotion recognition for groups: a review. IEEE Trans. Affect. Comput. 14(1), 89\u2013107 (2021)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"26_CR37","doi-asserted-by":"publisher","first-page":"19","DOI":"10.1016\/j.inffus.2022.03.009","volume":"83","author":"Y Wang","year":"2022","unstructured":"Wang, Y., Song, W., Tao, W., Liotta, A., Yang, D., Li, X., Gao, S., Sun, Y., Ge, W., Zhang, W., et al.: A systematic review on affective computing: Emotion models, databases, and recent advances. Information Fusion 83, 19\u201352 (2022)","journal-title":"Information Fusion"},{"key":"26_CR38","doi-asserted-by":"crossref","unstructured":"Wang, Y., Wu, J., Heracleous, P., Wada, S., Kimura, R., Kurihara, S.: Implicit knowledge injectable cross attention audiovisual model for group emotion recognition. In: Proceedings of the 2020 international conference on multimodal interaction. pp. 827\u2013834 (2020)","DOI":"10.1145\/3382507.3417960"},{"key":"26_CR39","unstructured":"Xiao, F., Lee, Y.J., Grauman, K., Malik, J., Feichtenhofer, C.: Audiovisual slowfast networks for video recognition. arXiv preprint arXiv:2001.08740 (2020)"},{"key":"26_CR40","doi-asserted-by":"crossref","unstructured":"Zadeh, A., Chan, M., Liang, P.P., Tong, E., Morency, L.P.: Social-iq: A question answering benchmark for artificial social intelligence. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 8807\u20138817 (2019)","DOI":"10.1109\/CVPR.2019.00901"},{"issue":"3","key":"26_CR41","doi-asserted-by":"publisher","first-page":"1034","DOI":"10.1109\/TCSVT.2021.3072412","volume":"32","author":"K Zhang","year":"2021","unstructured":"Zhang, K., Li, Y., Wang, J., Cambria, E., Li, X.: Real-time video emotion recognition based on reinforcement learning and domain knowledge. IEEE Trans. Circuits Syst. Video Technol. 32(3), 1034\u20131047 (2021)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"26_CR42","doi-asserted-by":"crossref","unstructured":"Zhao, S., Ma, Y., Gu, Y., Yang, J., Xing, T., Xu, P., Hu, R., Chai, H., Keutzer, K.: An end-to-end visual-audio attention network for emotion recognition in user-generated videos. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol.\u00a034, pp. 303\u2013311 (2020)","DOI":"10.1609\/aaai.v34i01.5364"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-78305-0_26","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,3]],"date-time":"2024-12-03T11:21:16Z","timestamp":1733224876000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-78305-0_26"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,4]]},"ISBN":["9783031783043","9783031783050"],"references-count":42,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-78305-0_26","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12,4]]},"assertion":[{"value":"4 December 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICPR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Pattern Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Kolkata","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"India","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"1 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"5 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icpr2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/icpr2024.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}