{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T20:18:04Z","timestamp":1783455484429,"version":"3.55.0"},"reference-count":110,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"8","license":[{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1109\/tpami.2026.3675685","type":"journal-article","created":{"date-parts":[[2026,3,19]],"date-time":"2026-03-19T20:06:58Z","timestamp":1773950818000},"page":"9114-9128","source":"Crossref","is-referenced-by-count":1,"title":["Principled Multimodal Representation Learning"],"prefix":"10.1109","volume":"48","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-6037-8580","authenticated-orcid":false,"given":"Xiaohao","family":"Liu","sequence":"first","affiliation":[{"name":"National University of Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3615-0919","authenticated-orcid":false,"given":"Xiaobo","family":"Xia","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, and National University of Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6565-7511","authenticated-orcid":false,"given":"See-Kiong","family":"Ng","sequence":"additional","affiliation":[{"name":"National University of Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6097-7807","authenticated-orcid":false,"given":"Tat-Seng","family":"Chua","sequence":"additional","affiliation":[{"name":"National University of Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","first-page":"689","article-title":"Multimodal deep learning","volume-title":"Proc. Int. Conf. Mach. Learn.","volume":"11","author":"Ngiam","year":"2011"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2501"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3429301"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3275156"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3420239"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.1009"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3328185"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2798607"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747669"},{"key":"ref10","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Radford","year":"2021"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01457"},{"key":"ref12","first-page":"1","article-title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment","volume-title":"Proc. 12th Int. Conf. Learn. Representations","author":"Zhu","year":"2024"},{"key":"ref13","first-page":"1","article-title":"Omnibind: Large-scale omni multimodal representation via binding spaces","volume-title":"Proc. 13th Int. Conf. Learn. Representations","author":"Wang","year":"2025"},{"key":"ref14","first-page":"1","article-title":"Continual multimodal contrastive learning","volume-title":"Proc. 39th Annu. Conf. Neural Inf. Process. Syst.","author":"Liu","year":"2025"},{"key":"ref15","first-page":"1","article-title":"What to align in multimodal contrastive learning?","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Dufumier","year":"2025"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.5555\/3524938.3525087"},{"key":"ref18","first-page":"9929","article-title":"Understanding contrastive representation learning through alignment and uniformity on the hypersphere","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wang","year":"2020"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW50498.2020.00347"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.544"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00836"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02526"},{"key":"ref23","article-title":"Point-bind & point-LLM: Aligning point cloud with multi-modality for 3D understanding, generation, and instruction following","author":"Guo","year":"2023"},{"issue":"2139","key":"ref24","first-page":"52233","article-title":"FreeBind: Free lunch in unified multimodal space via knowledge fusion","author":"Wang","year":"2024","journal-title":"Porc. Int. Conf. Mach. Learn."},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00175"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19781-9_24"},{"key":"ref27","first-page":"1","article-title":"InternVid: A large-scale video-text dataset for multimodal understanding and generation","volume-title":"Proc. 12th Int. Conf. Learn. Representations","author":"Wang","year":"2024"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.52202\/075280-3185"},{"key":"ref29","first-page":"60785","article-title":"Videoprism: A foundational visual encoder for video understanding","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Zhao","year":"2024"},{"key":"ref30","first-page":"12888","article-title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li","year":"2022"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.52202\/068431-0412"},{"key":"ref32","first-page":"1","article-title":"Gramian multimodal representation learning and alignment","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Cicchetti","year":"2025"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00089"},{"key":"ref34","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Jia","year":"2021"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0102"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10095889"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2022.07.028"},{"key":"ref38","article-title":"Improved baselines with momentum contrastive learning","author":"Chen","year":"2020"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3479776"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1145\/3746027.3758174"},{"key":"ref41","article-title":"UNIVL: A unified video and language pre-training model for multimodal understanding and generation","author":"Luo","year":"2020"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01660"},{"key":"ref43","first-page":"1","article-title":"Value: A multi-task benchmark for video-and-language understanding evaluation","volume-title":"Proc. Adv. Neural Inf. Process. Syst. Datasets Benchmarks","author":"Li","year":"2021"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747631"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2021-1312"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i8.26153"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.56021\/9781421407944"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-86940-2_10"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1007\/0-306-47815-3_5"},{"issue":"912","key":"ref50","first-page":"1","article-title":"Singular value decomposition (SVD) and generalized singular value decomposition","volume":"907","author":"Abdi","year":"2007","journal-title":"Encyclopedia Meas. Statist."},{"key":"ref51","first-page":"18411","article-title":"What if neural networks had SVDs?","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Mathiasen","year":"2020"},{"key":"ref52","first-page":"22554","article-title":"An analysis of SVD for deep rotation estimation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Levinson"},{"key":"ref53","first-page":"5806","article-title":"Stabilizing gradients for deep neural networks via efficient SVD parameterization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Zhang","year":"2018"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-47969-4_47"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2000.854772"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01485"},{"key":"ref57","article-title":"AdaSVD: Adaptive singular value decomposition for large language models","author":"Li","year":"2025"},{"key":"ref58","first-page":"1","article-title":"SVD-LLM: Truncation-aware singular value decomposition for large language model compression","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Wang","year":"2025"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00673"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.52202\/079017-3846"},{"key":"ref61","first-page":"4348","article-title":"Understanding multimodal contrastive learning and incorporating unpaired data","volume-title":"Proc. Int. Conf. Artif. Intell. Statist.","author":"Nakada","year":"2023"},{"key":"ref62","article-title":"Leveraging perfect multimodal alignment and Gaussian assumptions for cross-modal transfer","author":"Kamboj","year":"2025"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1007\/BF02288367"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0463"},{"key":"ref65","first-page":"2782","article-title":"Efficient and scalable Bayesian neural nets with rank-1 factors","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Dusenberry","year":"2020"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/TIT.2017.2653801"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1007\/s00348-019-2768-4"},{"key":"ref68","first-page":"1","article-title":"Sample selection with uncertainty of losses for learning with noisy labels","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Xia","year":"2022"},{"key":"ref69","first-page":"7597","article-title":"Part-dependent label noise: Towards instance-dependent label noise","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Xia","year":"2020"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i17.33972"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00305"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01826"},{"key":"ref73","article-title":"TVTSV2: Learning out-of-the-box spatiotemporal visual representations at scale","author":"Zeng","year":"2023"},{"key":"ref74","article-title":"VideoCoCa: Video-text modeling with zero-shot transfer from contrastive captioners","author":"Yan","year":"2022"},{"key":"ref75","article-title":"Multi-granularity correspondence learning from long-term noisy videos","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Lin","year":"2023"},{"key":"ref76","first-page":"1","article-title":"Internvideo: General video foundation models via generative and discriminative learning","author":"Wang","year":"2022"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01413"},{"key":"ref78","first-page":"38728","article-title":"mPLUG-2: A modularized multi-modal foundation model across text, image and video","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Xu","year":"2023"},{"key":"ref79","first-page":"190","article-title":"Collecting highly parallel data for paraphrase evaluation","volume-title":"Proc. Assoc. Comput. Linguist.","author":"Chen","year":"2011"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.618"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.83"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00468"},{"key":"ref83","first-page":"119","article-title":"Audiocaps: Generating captions for audios in the wild","volume-title":"Proc. Assoc. Comput. Linguist.","author":"Kim","year":"2019"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9052990"},{"issue":"27","key":"ref85","first-page":"1","article-title":"The neuro bureau preprocessing initiative: Open sharing of preprocessed neuroimaging data and derivatives","volume":"7","author":"Craddock","year":"2013","journal-title":"Front. Neuroinform."},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3479776"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01107"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.63317\/4y77shug4kxq"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01566"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01776"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.naacl-main.333"},{"key":"ref92","article-title":"Improving the detection of autism spectrum disorder by combining structural and functional mri information","volume":"25","author":"Raki\u0107","year":"2020","journal-title":"NeuroImage: Clin."},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1016\/j.media.2018.06.001"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1016\/j.neuroimage.2016.09.046"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1855"},{"key":"ref96","article-title":"EVA-CLIP: Improved training techniques for CLIP at scale","author":"Sun","year":"2023"},{"key":"ref97","first-page":"5178","article-title":"Beats: Audio pre-training with acoustic tokenizers","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Chen","year":"2023"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1810.04805"},{"key":"ref99","first-page":"1","article-title":"Decoupled weight decay regularization","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Loshchilov","year":"2019"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00498"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0987-1"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3149712"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053174"},{"key":"ref104","article-title":"UCF101: A dataset of 101 human actions classes from videos in the wild","author":"Soomro","year":"2012"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-33715-4_54"},{"key":"ref107","first-page":"14080","article-title":"A touch, vision, and language dataset for multimodal alignment","volume-title":"Proc. 41st Int. Conf. Mach. Learn.","author":"Fu","year":"2024"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/JSTARS.2014.2305441"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3170249"},{"key":"ref110","first-page":"1","article-title":"A method for stochastic optimization","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Kinga","year":"2015"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/34\/11595778\/11447476.pdf?arnumber=11447476","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T19:45:06Z","timestamp":1783453506000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11447476\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8]]},"references-count":110,"journal-issue":{"issue":"8"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2026.3675685","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,8]]}}}