{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,20]],"date-time":"2026-03-20T13:49:24Z","timestamp":1774014564339,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":68,"publisher":"ACM","license":[{"start":{"date-parts":[[2025,4,22]],"date-time":"2025-04-22T00:00:00Z","timestamp":1745280000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,4,22]]},"DOI":"10.1145\/3696410.3714841","type":"proceedings-article","created":{"date-parts":[[2025,4,22]],"date-time":"2025-04-22T22:52:18Z","timestamp":1745362338000},"page":"2120-2134","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":3,"title":["Learning by Comparing: Boosting Multimodal Affective Computing through Ordinal Learning"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-9763-375X","authenticated-orcid":false,"given":"Sijie","family":"Mai","sequence":"first","affiliation":[{"name":"South China Normal University, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8842-2045","authenticated-orcid":false,"given":"Ying","family":"Zeng","sequence":"additional","affiliation":[{"name":"Sun Yat-sen University, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4884-323X","authenticated-orcid":false,"given":"Haifeng","family":"Hu","sequence":"additional","affiliation":[{"name":"Sun Yat-sen University, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,4,22]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/FG.2018.00019"},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2798607"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.2307\/2334029"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/MIS.2016.31"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P19-1455"},{"key":"e_1_3_2_1_6_1","volume-title":"Robust Contrastive Learning against Noisy Views. arXiv preprint arXiv:2201.04309","author":"Chuang Ching-Yao","year":"2022","unstructured":"Ching-Yao Chuang, R Devon Hjelm, Xin Wang, Vibhav Vineet, Neel Joshi, Antonio Torralba, Stefanie Jegelka, and Yale Song. 2022. Robust Contrastive Learning against Noisy Views. arXiv preprint arXiv:2201.04309 (2022)."},{"key":"e_1_3_2_1_7_1","volume-title":"COVAREP: A Collaborative Voice Analysis Repository for Speech Technologies. In ICASSP. 960--964.","author":"Degottex Gilles","year":"2014","unstructured":"Gilles Degottex, John Kane, Thomas Drugman, Tuomo Raitio, and Stefan Scherer. 2014. COVAREP: A Collaborative Voice Analysis Repository for Speech Technologies. In ICASSP. 960--964."},{"key":"e_1_3_2_1_8_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT.","author":"Devlin J.","year":"2019","unstructured":"J. Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT."},{"key":"e_1_3_2_1_9_1","volume-title":"32nd conference on neural information processing systems (NIPS","author":"Dumpala Sri Harsha","year":"2019","unstructured":"Sri Harsha Dumpala, Imran Sheikh, Rupayan Chakraborty, and Sunil Kumar Kopparapu. 2019. Audio-visual fusion for sentiment classification using cross-modal autoencoder. In 32nd conference on neural information processing systems (NIPS 2018). 1--4."},{"key":"e_1_3_2_1_10_1","first-page":"6704","article-title":"Cyclip: Cyclic contrastive language-image pretraining","volume":"35","author":"Goel Shashank","year":"2022","unstructured":"Shashank Goel, Hritik Bansal, Sumit Bhatia, Ryan Rossi, Vishwa Vinay, and Aditya Grover. 2022. Cyclip: Cyclic contrastive language-image pretraining. Advances in Neural Information Processing Systems, Vol. 35 (2022), 6704--6719.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.723"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053648"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i14.17534"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1211"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413678"},{"key":"e_1_3_2_1_16_1","volume-title":"International Conference on Learning Representations.","author":"He Pengcheng","year":"2021","unstructured":"Pengcheng He, Xiaodong Liu, Jianfeng Gao, and Weizhu Chen. 2021. DeBERTa: Ddecoding-enhanced BERT with disentangled attention. In International Conference on Learning Representations."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1145\/3462244.3479927"},{"key":"e_1_3_2_1_18_1","unstructured":"Ming Hou Jiajia Tang Jianhai Zhang Wanzeng Kong and Qibin Zhao. 2019. Deep Multimodal Multilinear Fusion with High-order Polynomial Pooling. In Advances in Neural Information Processing Systems. 12113--12122."},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.emnlp-main.534"},{"key":"e_1_3_2_1_20_1","volume-title":"Recent Trends of Multimodal Affective Computing: A Survey from NLP Perspective. arXiv preprint arXiv:2409.07388","author":"Hu Guimin","year":"2024","unstructured":"Guimin Hu, Yi Xin, Weimin Lyu, Haojian Huang, Chang Sun, Zhihong Zhu, Lin Gui, and Ruichu Cai. 2024. Recent Trends of Multimodal Affective Computing: A Survey from NLP Perspective. arXiv preprint arXiv:2409.07388 (2024)."},{"key":"e_1_3_2_1_21_1","volume-title":"Noe Pion, Philippe Weinzaepfel, and Diane Larlus.","author":"Kalantidis Yannis","year":"2020","unstructured":"Yannis Kalantidis, Mert Bulent Sariyildiz, Noe Pion, Philippe Weinzaepfel, and Diane Larlus. 2020. Hard negative mixing for contrastive learning. arXiv preprint arXiv:2010.01028 (2020)."},{"key":"e_1_3_2_1_22_1","volume-title":"Supervised Contrastive Learning. ArXiv","author":"Khosla Prannay","year":"2020","unstructured":"Prannay Khosla, Piotr Teterwak, Chen Wang, Aaron Sarna, Yonglong Tian, Phillip Isola, Aaron Maschinot, Ce Liu, and Dilip Krishnan. 2020. Supervised Contrastive Learning. ArXiv, Vol. abs\/2004.11362 (2020)."},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2022.11.022"},{"key":"e_1_3_2_1_24_1","volume-title":"MMATR: A Lightweight Approach for Multimodal Sentiment Analysis Based on Tensor Methods. In ICASSP 2023--2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Koromilas Panagiotis","year":"2023","unstructured":"Panagiotis Koromilas, Mihalis A Nicolaou, Theodoros Giannakopoulos, and Yannis Panagakis. 2023. MMATR: A Lightweight Approach for Multimodal Sentiment Analysis Based on Tensor Methods. In ICASSP 2023--2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 1--5."},{"key":"e_1_3_2_1_25_1","volume-title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations. In International Conference on Learning Representations.","author":"Lan Zhenzhong","year":"2020","unstructured":"Zhenzhong Lan, Mingda Chen, Sebastian Goodman, Kevin Gimpel, Piyush Sharma, and Radu Soricut. 2020. ALBERT: A Lite BERT for Self-supervised Learning of Language Representations. In International Conference on Learning Representations."},{"key":"e_1_3_2_1_26_1","volume-title":"Interpretable multimodal sentiment analysis based on textual modality descriptions by using large-scale language models. arXiv preprint arXiv:2305.06162","author":"Li Sixia","year":"2023","unstructured":"Sixia Li and Shogo Okada. 2023. Interpretable multimodal sentiment analysis based on textual modality descriptions by using large-scale language models. arXiv preprint arXiv:2305.06162 (2023)."},{"key":"e_1_3_2_1_27_1","volume-title":"CorMulT: A Semi-supervised Modality Correlation-aware Multimodal Transformer for Sentiment Analysis. arXiv preprint arXiv:2407.07046","author":"Li Yangmin","year":"2024","unstructured":"Yangmin Li, Ruiqi Zhu, and Wengen Li. 2024. CorMulT: A Semi-supervised Modality Correlation-aware Multimodal Transformer for Sentiment Analysis. arXiv preprint arXiv:2407.07046 (2024)."},{"key":"e_1_3_2_1_28_1","volume-title":"Qibin Zhao, Ruslan Salakhutdinov, and Louis-Philippe Morency.","author":"Liang Paul Pu","year":"2019","unstructured":"Paul Pu Liang, Zhun Liu, Yao-Hung Hubert Tsai, Qibin Zhao, Ruslan Salakhutdinov, and Louis-Philippe Morency. 2019. Learning Representations from Imperfect Time Series Data via Tensor Rank Regularization. In ACL. 1569--1576."},{"key":"e_1_3_2_1_29_1","volume-title":"MultiBench: Multiscale Benchmarks for Multimodal Representation Learning. In Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track (Round 1).","author":"Liang Paul Pu","unstructured":"Paul Pu Liang, Yiwei Lyu, Xiang Fan, Zetian Wu, Yun Cheng, Jason Wu, Leslie Yufan Chen, Peter Wu, Michelle A Lee, Yuke Zhu, et al. [n.,d.]. MultiBench: Multiscale Benchmarks for Multimodal Representation Learning. In Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track (Round 1)."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1145\/3589335.3651971"},{"key":"e_1_3_2_1_31_1","volume-title":"Decoupled Weight Decay Regularization. In International Conference on Learning Representations. https:\/\/arxiv.org\/abs\/1711","author":"Loshchilov Ilya","year":"2019","unstructured":"Ilya Loshchilov and Frank Hutter. 2019. Decoupled Weight Decay Regularization. In International Conference on Learning Representations. https:\/\/arxiv.org\/abs\/1711.05101"},{"key":"e_1_3_2_1_32_1","volume-title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. Advances in neural information processing systems","author":"Lu Jiasen","year":"2019","unstructured":"Jiasen Lu, Dhruv Batra, Devi Parikh, and Stefan Lee. 2019. Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. Advances in neural information processing systems, Vol. 32 (2019)."},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"crossref","unstructured":"Sijie Mai Haifeng Hu and Songlong Xing. 2019. Divide Conquer and Combine: Hierarchical Feature Fusion Network with Local and Global Perspectives for Multimodal Affective Computing. In ACL. 481--492.","DOI":"10.18653\/v1\/P19-1046"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i01.5347"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2022.11.003"},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2023.101920"},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2022.3172360"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.17763\/haer.47.3.8840364413869005"},{"key":"e_1_3_2_1_39_1","volume-title":"CoMIR: Contrastive multimodal image representation for registration. Advances in neural information processing systems","author":"Pielawski Nicolas","year":"2020","unstructured":"Nicolas Pielawski, Elisabeth Wetzer, Johan \u00d6fverstedt, Jiahao Lu, Carolina W\u00e4hlby, Joakim Lindblad, and Natasa Sladoje. 2020. CoMIR: Contrastive multimodal image representation for registration. Advances in neural information processing systems, Vol. 33 (2020), 18433--18444."},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2017.02.003"},{"key":"e_1_3_2_1_41_1","unstructured":"Alec Radford Jeffrey Wu Rewon Child David Luan Dario Amodei Ilya Sutskever et al. 2019. Language models are unsupervised multitask learners. OpenAI blog Vol. 1 8 (2019) 9."},{"key":"e_1_3_2_1_42_1","volume-title":"Advances in Neural Information Processing Systems","volume":"36","author":"Rafailov Rafael","year":"2024","unstructured":"Rafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D Manning, Stefano Ermon, and Chelsea Finn. 2024. Direct preference optimization: Your language model is secretly a reward model. Advances in Neural Information Processing Systems, Vol. 36 (2024)."},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.5555\/3455716.3455856"},{"key":"e_1_3_2_1_44_1","first-page":"2359","article-title":"Integrating Multimodal Information in Large Pretrained Transformers","volume":"2020","author":"Rahman Wasifur","year":"2020","unstructured":"Wasifur Rahman, M. Hasan, Sangwu Lee, Amir Zadeh, Chengfeng Mao, Louis-Philippe Morency, and E. Hoque. 2020. Integrating Multimodal Information in Large Pretrained Transformers. ACL, Vol. 2020 (2020), 2359--2369.","journal-title":"ACL"},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-long.214"},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.83"},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.eacl-main.8"},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3548025"},{"key":"e_1_3_2_1_49_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i05.6431"},{"key":"e_1_3_2_1_50_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3325770"},{"key":"e_1_3_2_1_51_1","volume-title":"J. Zico Kolter, Louis-Philippe Morency, and Ruslan Salakhutdinov.","author":"Hubert Tsai Yao-Hung","year":"2019","unstructured":"Yao-Hung Hubert Tsai, Shaojie Bai, Paul Pu Liang, J. Zico Kolter, Louis-Philippe Morency, and Ruslan Salakhutdinov. 2019a. Multimodal Transformer for Unaligned Multimodal Language Sequences. In ACL. 6558--6569."},{"key":"e_1_3_2_1_52_1","volume-title":"Amir Zadeh, Louis Philippe Morency, and Ruslan Salakhutdinov.","author":"Hubert Tsai Yao Hung","year":"2019","unstructured":"Yao Hung Hubert Tsai, Paul Pu Liang, Amir Zadeh, Louis Philippe Morency, and Ruslan Salakhutdinov. 2019b. Learning Factorized Multimodal Representations. In ICLR."},{"key":"e_1_3_2_1_53_1","article-title":"Visualizing data using t-SNE","volume":"9","author":"der Maaten Laurens Van","year":"2008","unstructured":"Laurens Van der Maaten and Geoffrey Hinton. 2008. Visualizing data using t-SNE. Journal of machine learning research, Vol. 9, 11 (2008).","journal-title":"Journal of machine learning research"},{"key":"e_1_3_2_1_54_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is all you need. In Advances in neural information processing systems. 5998--6008."},{"key":"e_1_3_2_1_55_1","volume-title":"International conference on machine learning. PMLR, 6438--6447","author":"Verma Vikas","year":"2019","unstructured":"Vikas Verma, Alex Lamb, Christopher Beckham, Amir Najafi, Ioannis Mitliagkas, David Lopez-Paz, and Yoshua Bengio. 2019. Manifold mixup: Better representations by interpolating hidden states. In International conference on machine learning. PMLR, 6438--6447."},{"key":"e_1_3_2_1_56_1","doi-asserted-by":"publisher","DOI":"10.1145\/3366423.3380000"},{"key":"e_1_3_2_1_57_1","article-title":"Distance metric learning for large margin nearest neighbor classification","volume":"10","author":"Weinberger Kilian Q","year":"2009","unstructured":"Kilian Q Weinberger and Lawrence K Saul. 2009. Distance metric learning for large margin nearest neighbor classification. Journal of machine learning research, Vol. 10, 2 (2009).","journal-title":"Journal of machine learning research"},{"key":"e_1_3_2_1_58_1","volume-title":"Neuro-Inspired Information-Theoretic Hierarchical Perception for Multimodal Learning. In The Twelfth International Conference on Learning Representations.","author":"Xiao Xiongye","year":"2024","unstructured":"Xiongye Xiao, Gengshuo Liu, Gaurav Gupta, Defu Cao, Shixuan Li, Yaxing Li, Tianqing Fang, Mingxi Cheng, and Paul Bogdan. 2024. Neuro-Inspired Information-Theoretic Hierarchical Perception for Multimodal Learning. In The Twelfth International Conference on Learning Representations."},{"key":"e_1_3_2_1_59_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3376564"},{"key":"e_1_3_2_1_60_1","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2022.3155290"},{"key":"e_1_3_2_1_61_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.421"},{"key":"e_1_3_2_1_62_1","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2018.2879512"},{"key":"e_1_3_2_1_63_1","doi-asserted-by":"crossref","unstructured":"Amir Zadeh Minghai Chen Soujanya Poria Erik Cambria and Louis Philippe Morency. 2017. Tensor Fusion Network for Multimodal Sentiment Analysis. In EMNLP. 1114--1125.","DOI":"10.18653\/v1\/D17-1115"},{"key":"e_1_3_2_1_64_1","volume-title":"Navonil Mazumder, Soujanya Poria, Erik Cambria, and Louis Philippe Morency.","author":"Zadeh Amir","year":"2018","unstructured":"Amir Zadeh, Paul Pu Liang, Navonil Mazumder, Soujanya Poria, Erik Cambria, and Louis Philippe Morency. 2018a. Memory Fusion Network for Multi-view Sequential Learning. In AAAI. 5634--5641."},{"key":"e_1_3_2_1_65_1","volume-title":"Jonathan Vanbriesen, Soujanya Poria, Edmund Tong, Erik Cambria, Minghai Chen, and Louis Philippe Morency.","author":"Zadeh Amir","year":"2018","unstructured":"Amir Zadeh, Paul Pu Liang, Jonathan Vanbriesen, Soujanya Poria, Edmund Tong, Erik Cambria, Minghai Chen, and Louis Philippe Morency. 2018b. Multimodal Language Analysis in the Wild: Carnegie Mellon University-MOSEI Dataset and Interpretable Dynamic Fusion Graph. In ACL. 2236--2246."},{"key":"e_1_3_2_1_66_1","volume-title":"Multimodal Sentiment Intensity Analysis in Videos: Facial Gestures and Verbal Messages","author":"Zadeh Amir","year":"2016","unstructured":"Amir Zadeh, Rowan Zellers, Eli Pincus, and Louis Philippe Morency. 2016. Multimodal Sentiment Intensity Analysis in Videos: Facial Gestures and Verbal Messages. IEEE Intelligent Systems, Vol. 31, 6 (11 2016), 82--88."},{"key":"e_1_3_2_1_67_1","volume-title":"International Conference on Learning Representations.","author":"Zhang Hongyi","year":"2018","unstructured":"Hongyi Zhang, Moustapha Cisse, Yann N Dauphin, and David Lopez-Paz. 2018. mixup: Beyond Empirical Risk Minimization. In International Conference on Learning Representations."},{"key":"e_1_3_2_1_68_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2023.02.028"}],"event":{"name":"WWW '25: The ACM Web Conference 2025","location":"Sydney NSW Australia","acronym":"WWW '25","sponsor":["SIGWEB ACM Special Interest Group on Hypertext, Hypermedia, and Web"]},"container-title":["Proceedings of the ACM on Web Conference 2025"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3696410.3714841","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3696410.3714841","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T01:18:42Z","timestamp":1750295922000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3696410.3714841"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,22]]},"references-count":68,"alternative-id":["10.1145\/3696410.3714841","10.1145\/3696410"],"URL":"https:\/\/doi.org\/10.1145\/3696410.3714841","relation":{},"subject":[],"published":{"date-parts":[[2025,4,22]]},"assertion":[{"value":"2025-04-22","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}