{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,16]],"date-time":"2026-06-16T10:58:49Z","timestamp":1781607529033,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":39,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T00:00:00Z","timestamp":1634515200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,10,18]]},"DOI":"10.1145\/3462244.3479931","type":"proceedings-article","created":{"date-parts":[[2021,10,15]],"date-time":"2021-10-15T14:41:47Z","timestamp":1634308907000},"page":"521-529","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":36,"title":["Graph Capsule Aggregation for Unaligned Multimodal Sequences"],"prefix":"10.1145","author":[{"given":"Jianfeng","family":"Wu","sequence":"first","affiliation":[{"name":"Sun Yat-sen University, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sijie","family":"Mai","sequence":"additional","affiliation":[{"name":"Sun Yat-sen University, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haifeng","family":"Hu","sequence":"additional","affiliation":[{"name":"Sun Yat-sen University, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2021,10,18]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"Wenliang Dai Zihan Liu Tiezheng Yu and Pascale Fung. 2020. Modality-Transferable Emotion Embeddings for Low-Resource Multimodal Emotion Recognition. CoRR abs\/2009.09629(2020). arxiv:2009.09629https:\/\/arxiv.org\/abs\/2009.09629  Wenliang Dai Zihan Liu Tiezheng Yu and Pascale Fung. 2020. Modality-Transferable Emotion Embeddings for Low-Resource Multimodal Emotion Recognition. CoRR abs\/2009.09629(2020). arxiv:2009.09629https:\/\/arxiv.org\/abs\/2009.09629"},{"key":"e_1_3_2_1_2_1","volume-title":"COVAREP: A Collaborative Voice Analysis Repository for Speech Technologies. In ICASSP. 960\u2013964.","author":"Degottex Gilles","year":"2014","unstructured":"Gilles Degottex , John Kane , Thomas Drugman , Tuomo Raitio , and Stefan Scherer . 2014 . COVAREP: A Collaborative Voice Analysis Repository for Speech Technologies. In ICASSP. 960\u2013964. Gilles Degottex, John Kane, Thomas Drugman, Tuomo Raitio, and Stefan Scherer. 2014. COVAREP: A Collaborative Voice Analysis Repository for Speech Technologies. In ICASSP. 960\u2013964."},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1382"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143891"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"crossref","unstructured":"Yue Gu Kangning Yang Shiyu Fu Shuhong Chen Xinyu Li and Ivan Marsic. 2018. Multimodal Affective Analysis Using Hierarchical Attention Strategy with Word-Level Alignment. In ACL. 2225\u20132235.  Yue Gu Kangning Yang Shiyu Fu Shuhong Chen Xinyu Li and Ivan Marsic. 2018. Multimodal Affective Analysis Using Hierarchical Attention Strategy with Word-Level Alignment. In ACL. 2225\u20132235.","DOI":"10.18653\/v1\/P18-1207"},{"key":"e_1_3_2_1_6_1","unstructured":"Will Hamilton Zhitao Ying and Jure Leskovec. 2017. Inductive representation learning on large graphs. In Advances in neural information processing systems. 1024\u20131034.  Will Hamilton Zhitao Ying and Jure Leskovec. 2017. Inductive representation learning on large graphs. In Advances in neural information processing systems. 1024\u20131034."},{"key":"e_1_3_2_1_7_1","volume-title":"International Conference on Learning Representations. https:\/\/openreview.net\/forum?id=HJWLfGWRb","author":"Hinton E","year":"2018","unstructured":"Geoffrey\u00a0 E Hinton , Sara Sabour , and Nicholas Frosst . 2018 . Matrix capsules with EM routing . In International Conference on Learning Representations. https:\/\/openreview.net\/forum?id=HJWLfGWRb Geoffrey\u00a0E Hinton, Sara Sabour, and Nicholas Frosst. 2018. Matrix capsules with EM routing. In International Conference on Learning Representations. https:\/\/openreview.net\/forum?id=HJWLfGWRb"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"e_1_3_2_1_9_1","volume-title":"Multimodal Transformer Fusion for Continuous Emotion Recognition. In ICASSP 2020 - 2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). 3507\u20133511","author":"Huang Jian","year":"2020","unstructured":"Jian Huang , Jianhua Tao , Bin Liu , Zheng Lian , and Mingyue Niu . 2020 . Multimodal Transformer Fusion for Continuous Emotion Recognition. In ICASSP 2020 - 2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). 3507\u20133511 . https:\/\/doi.org\/10.1109\/ICASSP40776.2020.9053762 Jian Huang, Jianhua Tao, Bin Liu, Zheng Lian, and Mingyue Niu. 2020. Multimodal Transformer Fusion for Continuous Emotion Recognition. In ICASSP 2020 - 2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). 3507\u20133511. https:\/\/doi.org\/10.1109\/ICASSP40776.2020.9053762"},{"key":"e_1_3_2_1_10_1","unstructured":"iMotions 2017. 2017. iMotions. Facial expression analysis(2017).  iMotions 2017. 2017. iMotions. Facial expression analysis(2017)."},{"key":"e_1_3_2_1_11_1","unstructured":"Thomas\u00a0N Kipf and Max Welling. 2016. Semi-supervised classification with graph convolutional networks. In ICLR.  Thomas\u00a0N Kipf and Max Welling. 2016. Semi-supervised classification with graph convolutional networks. In ICLR."},{"key":"e_1_3_2_1_12_1","unstructured":"Adam\u00a0R. Kosiorek Sara Sabour Yee\u00a0Whye Teh and Geoffrey\u00a0E. Hinton. 2019. Stacked Capsule Autoencoders. arxiv:1906.06818\u00a0[stat.ML]  Adam\u00a0R. Kosiorek Sara Sabour Yee\u00a0Whye Teh and Geoffrey\u00a0E. Hinton. 2019. Stacked Capsule Autoencoders. arxiv:1906.06818\u00a0[stat.ML]"},{"key":"e_1_3_2_1_13_1","first-page":"486","article-title":"Tools","volume":"29","author":"Latour Bruno","year":"1994","unstructured":"Bruno Latour , K.\u00a0 R. Gibson , and T. Ingold . 1994 . Tools , Language and Cognition in Human Evolution. Man 29 , 2 (1994), 486 . Bruno Latour, K.\u00a0R. Gibson, and T. Ingold. 1994. Tools, Language and Cognition in Human Evolution. Man 29, 2 (1994), 486.","journal-title":"Language and Cognition in Human Evolution. Man"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"crossref","unstructured":"Paul\u00a0Pu Liang Ziyin Liu Amir Zadeh and Louis\u00a0Philippe Morency. 2018. Multimodal Language Analysis with Recurrent Multistage Fusion. In EMNLP. 150\u2013161.  Paul\u00a0Pu Liang Ziyin Liu Amir Zadeh and Louis\u00a0Philippe Morency. 2018. Multimodal Language Analysis with Recurrent Multistage Fusion. In EMNLP. 150\u2013161.","DOI":"10.18653\/v1\/D18-1014"},{"key":"e_1_3_2_1_15_1","unstructured":"S. Mai H. Hu J. Xu and S. Xing. 2020. Multi-Fusion Residual Memory Network for Multimodal Human Sentiment Comprehension. IEEE Transactions on Affective Computing(2020) 1\u20131.  S. Mai H. Hu J. Xu and S. Xing. 2020. Multi-Fusion Residual Memory Network for Multimodal Human Sentiment Comprehension. IEEE Transactions on Affective Computing(2020) 1\u20131."},{"key":"e_1_3_2_1_16_1","unstructured":"Sijie Mai Songlong Xing Jiaxuan He Ying Zeng and Haifeng Hu. 2020. Analyzing Unaligned Multimodal Sequence via Graph Convolution and Graph Pooling Fusion. CoRR abs\/2011.13572(2020). arxiv:2011.13572https:\/\/arxiv.org\/abs\/2011.13572  Sijie Mai Songlong Xing Jiaxuan He Ying Zeng and Haifeng Hu. 2020. Analyzing Unaligned Multimodal Sequence via Graph Convolution and Graph Pooling Fusion. CoRR abs\/2011.13572(2020). arxiv:2011.13572https:\/\/arxiv.org\/abs\/2011.13572"},{"key":"e_1_3_2_1_17_1","volume-title":"Proceedings of 52nd Annual Meeting of the Association for Computational Linguistics: System Demonstrations.","author":"Manning D.","unstructured":"C.\u00a0 D. Manning , M. Surdeanu , J. Bauer , J. Finkel , and D. Mcclosky . 2014. The Stanford CoreNLP Natural Language Processing Toolkit . In Proceedings of 52nd Annual Meeting of the Association for Computational Linguistics: System Demonstrations. C.\u00a0D. Manning, M. Surdeanu, J. Bauer, J. Finkel, and D. Mcclosky. 2014. The Stanford CoreNLP Natural Language Processing Toolkit. In Proceedings of 52nd Annual Meeting of the Association for Computational Linguistics: System Demonstrations."},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.2008.2010350"},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"crossref","unstructured":"Jeffrey Pennington Richard Socher and Christopher\u00a0D. Manning. 2014. GloVe: Global Vectors for Word Representation. In Empirical Methods in Natural Language Processing (EMNLP). 1532\u20131543. http:\/\/www.aclweb.org\/anthology\/D14-1162  Jeffrey Pennington Richard Socher and Christopher\u00a0D. Manning. 2014. GloVe: Global Vectors for Word Representation. In Empirical Methods in Natural Language Processing (EMNLP). 1532\u20131543. http:\/\/www.aclweb.org\/anthology\/D14-1162","DOI":"10.3115\/v1\/D14-1162"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"crossref","unstructured":"Hai Pham Paul\u00a0Pu Liang Thomas Manzini Louis\u00a0Philippe Morency and Pocz\u01d2s Barnab\u01ces. 2019. Found in Translation: Learning Robust Joint Representations by Cyclic Translations Between Modalities. In AAAI. 6892\u20136899.  Hai Pham Paul\u00a0Pu Liang Thomas Manzini Louis\u00a0Philippe Morency and Pocz\u01d2s Barnab\u01ces. 2019. Found in Translation: Learning Robust Joint Representations by Cyclic Translations Between Modalities. In AAAI. 6892\u20136899.","DOI":"10.1609\/aaai.v33i01.33016892"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W18-3308"},{"key":"e_1_3_2_1_22_1","unstructured":"Sara Sabour Nicholas Frosst and Geoffrey\u00a0E. Hinton. 2017. Dynamic Routing Between Capsules. CoRR abs\/1710.09829(2017). arxiv:1710.09829http:\/\/arxiv.org\/abs\/1710.09829  Sara Sabour Nicholas Frosst and Geoffrey\u00a0E. Hinton. 2017. Dynamic Routing Between Capsules. CoRR abs\/1710.09829(2017). arxiv:1710.09829http:\/\/arxiv.org\/abs\/1710.09829"},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.2008.2005605"},{"key":"e_1_3_2_1_24_1","unstructured":"Yao-Hung\u00a0Hubert Tsai Shaojie Bai Paul\u00a0Pu Liang J.\u00a0Zico Kolter Louis-Philippe Morency and Ruslan Salakhutdinov. 2019. Multimodal Transformer for Unaligned Multimodal Language Sequences. In ACL. 6558\u20136569.  Yao-Hung\u00a0Hubert Tsai Shaojie Bai Paul\u00a0Pu Liang J.\u00a0Zico Kolter Louis-Philippe Morency and Ruslan Salakhutdinov. 2019. Multimodal Transformer for Unaligned Multimodal Language Sequences. In ACL. 6558\u20136569."},{"key":"e_1_3_2_1_25_1","unstructured":"Yao Hung\u00a0Hubert Tsai Paul\u00a0Pu Liang Amir Zadeh Louis\u00a0Philippe Morency and Ruslan Salakhutdinov. 2019. Learning Factorized Multimodal Representations. In ICLR.  Yao Hung\u00a0Hubert Tsai Paul\u00a0Pu Liang Amir Zadeh Louis\u00a0Philippe Morency and Ruslan Salakhutdinov. 2019. Learning Factorized Multimodal Representations. In ICLR."},{"key":"e_1_3_2_1_26_1","volume-title":"Multimodal Routing: Improving Local and Global Interpretability of Multimodal Language Analysis. arXiv:arXiv:2004.14198","author":"Tsai Hung\u00a0Hubert","year":"2020","unstructured":"Yao- Hung\u00a0Hubert Tsai , Martin\u00a0 Q. Ma , Muqiao Yang , Ruslan Salakhutdinov , and Louis-Philippe Morency . 2020 . Multimodal Routing: Improving Local and Global Interpretability of Multimodal Language Analysis. arXiv:arXiv:2004.14198 Yao-Hung\u00a0Hubert Tsai, Martin\u00a0Q. Ma, Muqiao Yang, Ruslan Salakhutdinov, and Louis-Philippe Morency. 2020. Multimodal Routing: Improving Local and Global Interpretability of Multimodal Language Analysis. arXiv:arXiv:2004.14198"},{"key":"e_1_3_2_1_27_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan\u00a0N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is all you need. In NIPS. 5998\u20136008.  Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan\u00a0N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is all you need. In NIPS. 5998\u20136008."},{"key":"e_1_3_2_1_28_1","unstructured":"Petar Veli\u010dkovi\u0107 Guillem Cucurull Arantxa Casanova Adriana Romero Pietro Lio and Yoshua Bengio. 2018. Graph attention networks. In ICLR.  Petar Veli\u010dkovi\u0107 Guillem Cucurull Arantxa Casanova Adriana Romero Pietro Lio and Yoshua Bengio. 2018. Graph attention networks. In ICLR."},{"key":"e_1_3_2_1_29_1","unstructured":"Keyulu Xu Weihua Hu Jure Leskovec and Stefanie Jegelka. 2019. How powerful are graph neural networks?. In ICLR.  Keyulu Xu Weihua Hu Jure Leskovec and Stefanie Jegelka. 2019. How powerful are graph neural networks?. In ICLR."},{"key":"e_1_3_2_1_30_1","volume-title":"MTGAT: Multimodal Temporal Graph Attention Networks for Unaligned Human Multimodal Language Sequences. CoRR abs\/2010.11985(2020). arxiv:2010.11985https:\/\/arxiv.org\/abs\/2010.11985","author":"Yang Jianing","year":"2020","unstructured":"Jianing Yang , Yongxin Wang , Ruitao Yi , Yuying Zhu , Azaan Rehman , Amir Zadeh , Soujanya Poria , and Louis-Philippe Morency . 2020 . MTGAT: Multimodal Temporal Graph Attention Networks for Unaligned Human Multimodal Language Sequences. CoRR abs\/2010.11985(2020). arxiv:2010.11985https:\/\/arxiv.org\/abs\/2010.11985 Jianing Yang, Yongxin Wang, Ruitao Yi, Yuying Zhu, Azaan Rehman, Amir Zadeh, Soujanya Poria, and Louis-Philippe Morency. 2020. MTGAT: Multimodal Temporal Graph Attention Networks for Unaligned Human Multimodal Language Sequences. CoRR abs\/2010.11985(2020). arxiv:2010.11985https:\/\/arxiv.org\/abs\/2010.11985"},{"key":"e_1_3_2_1_31_1","unstructured":"Zhitao Ying Jiaxuan You Christopher Morris Xiang Ren Will Hamilton and Jure Leskovec. 2018. Hierarchical graph representation learning with differentiable pooling. In Advances in neural information processing systems. 4800\u20134810.  Zhitao Ying Jiaxuan You Christopher Morris Xiang Ren Will Hamilton and Jure Leskovec. 2018. Hierarchical graph representation learning with differentiable pooling. In Advances in neural information processing systems. 4800\u20134810."},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"publisher","DOI":"10.1121\/1.2935783"},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"crossref","unstructured":"Amir Zadeh Minghai Chen Soujanya Poria Erik Cambria and Louis\u00a0Philippe Morency. 2017. Tensor Fusion Network for Multimodal Sentiment Analysis. In EMNLP. 1114\u20131125.  Amir Zadeh Minghai Chen Soujanya Poria Erik Cambria and Louis\u00a0Philippe Morency. 2017. Tensor Fusion Network for Multimodal Sentiment Analysis. In EMNLP. 1114\u20131125.","DOI":"10.18653\/v1\/D17-1115"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"crossref","unstructured":"Amir Zadeh Paul\u00a0Pu Liang Navonil Mazumder Soujanya Poria Erik Cambria and Louis\u00a0Philippe Morency. 2018. Memory Fusion Network for Multi-view Sequential Learning. In AAAI. 5634\u20135641.  Amir Zadeh Paul\u00a0Pu Liang Navonil Mazumder Soujanya Poria Erik Cambria and Louis\u00a0Philippe Morency. 2018. Memory Fusion Network for Multi-view Sequential Learning. In AAAI. 5634\u20135641.","DOI":"10.1609\/aaai.v32i1.12021"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"crossref","unstructured":"Amir Zadeh Paul\u00a0Pu Liang Soujanya Poria Prateek Vij Erik Cambria and Louis\u00a0Philippe Morency. 2018. Multi-attention Recurrent Network for Human Communication Comprehension. In AAAI. 5642\u20135649.  Amir Zadeh Paul\u00a0Pu Liang Soujanya Poria Prateek Vij Erik Cambria and Louis\u00a0Philippe Morency. 2018. Multi-attention Recurrent Network for Human Communication Comprehension. In AAAI. 5642\u20135649.","DOI":"10.1609\/aaai.v32i1.12024"},{"key":"e_1_3_2_1_36_1","unstructured":"Amir Zadeh Paul\u00a0Pu Liang Jonathan Vanbriesen Soujanya Poria Edmund Tong Erik Cambria Minghai Chen and Louis\u00a0Philippe Morency. 2018. Multimodal Language Analysis in the Wild: CMU-MOSEI Dataset and Interpretable Dynamic Fusion Graph. In ACL. 2236\u20132246.  Amir Zadeh Paul\u00a0Pu Liang Jonathan Vanbriesen Soujanya Poria Edmund Tong Erik Cambria Minghai Chen and Louis\u00a0Philippe Morency. 2018. Multimodal Language Analysis in the Wild: CMU-MOSEI Dataset and Interpretable Dynamic Fusion Graph. In ACL. 2236\u20132246."},{"key":"e_1_3_2_1_37_1","unstructured":"A. Zadeh C. Mao K. Shi Y. Zhang P.\u00a0P. Liang S. Poria and L.\u00a0P. Morency. 2019. Factorized Multimodal Transformer for Multimodal Sequential Learning. (2019).  A. Zadeh C. Mao K. Shi Y. Zhang P.\u00a0P. Liang S. Poria and L.\u00a0P. Morency. 2019. Factorized Multimodal Transformer for Multimodal Sequential Learning. (2019)."},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/MIS.2016.94"},{"key":"e_1_3_2_1_39_1","unstructured":"Muhan Zhang and Yixin Chen. 2018. Link prediction based on graph neural networks. In Advances in Neural Information Processing Systems. 5165\u20135175.  Muhan Zhang and Yixin Chen. 2018. Link prediction based on graph neural networks. In Advances in Neural Information Processing Systems. 5165\u20135175."}],"event":{"name":"ICMI '21: INTERNATIONAL CONFERENCE ON MULTIMODAL INTERACTION","location":"Montr\u00e9al QC Canada","acronym":"ICMI '21","sponsor":["SIGCHI ACM Special Interest Group on Computer-Human Interaction"]},"container-title":["Proceedings of the 2021 International Conference on Multimodal Interaction"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3462244.3479931","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3462244.3479931","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:48:55Z","timestamp":1750193335000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3462244.3479931"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,10,18]]},"references-count":39,"alternative-id":["10.1145\/3462244.3479931","10.1145\/3462244"],"URL":"https:\/\/doi.org\/10.1145\/3462244.3479931","relation":{},"subject":[],"published":{"date-parts":[[2021,10,18]]},"assertion":[{"value":"2021-10-18","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}