{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,23]],"date-time":"2026-07-23T16:40:22Z","timestamp":1784824822607,"version":"3.55.0"},"reference-count":82,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.01006","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"10807-10818","source":"Crossref","is-referenced-by-count":2,"title":["Joint Self-Supervised Video Alignment and Action Segmentation"],"prefix":"10.1109","author":[{"given":"Ali Shah","family":"Ali","sequence":"first","affiliation":[{"name":"Retrocausal, Inc.,Redmond,WA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Syed Ahmed","family":"Mahmood","sequence":"additional","affiliation":[{"name":"Retrocausal, Inc.,Redmond,WA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mubin","family":"Saeed","sequence":"additional","affiliation":[{"name":"Retrocausal, Inc.,Redmond,WA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Andrey","family":"Konin","sequence":"additional","affiliation":[{"name":"Retrocausal, Inc.,Redmond,WA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"M. Zeeshan","family":"Zia","sequence":"additional","affiliation":[{"name":"Retrocausal, Inc.,Redmond,WA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Quoc-Huy","family":"Tran","sequence":"additional","affiliation":[{"name":"Retrocausal, Inc.,Redmond,WA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Discrimnet: Semisupervised action recognition from videos using generative adversarial networks","author":"Ahsan","year":"2018","journal-title":"arXiv preprint"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.495"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00089"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00994"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00233"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_9"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00305"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.502"},{"key":"ref9","first-page":"794","article-title":"Gradnorm: Gradient normalization for adaptive loss balancing in deep multitask networks","volume-title":"International conference on machine learning","author":"Chen","year":"2018"},{"key":"ref10","article-title":"Opel: Optimal transport guided procedure learning","volume-title":"The Thirty-eighth Annual Conference on Neural Information Processing Systems","author":"Shafayet Chowdhury","year":"2024"},{"key":"ref11","article-title":"Sinkhorn distances: Lightspeed computation of optimal transport","author":"Cuturi","year":"2013","journal-title":"Advances in neural information processing systems"},{"key":"ref12","first-page":"894","article-title":"Soft-dtw: a differentiable loss function for time-series","volume-title":"International conference on machine learning","author":"Cuturi","year":"2017"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2022.103406"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00312"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00629"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3327284"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01766"},{"key":"ref18","article-title":"Temporal cycleconsistency learning","volume-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Dwibedi","year":"2019"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206514"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00630"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00331"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.607"},{"key":"ref23","article-title":"Unsupervised representation learning by predicting image rotations","volume-title":"International Conference on Learning Representations","author":"Gidaris","year":"2018"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.465"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00550"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00784"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr42600.2020.00644"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00781"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3379571"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018545"},{"key":"ref31","author":"Kingma","year":"2014","journal-title":"Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.105"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01234"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01954"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00800"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46493-0_35"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.96"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.79"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2024.3505856"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.49"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2863285"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01244"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413548"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00222"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00799"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00452"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46448-0_32"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1145\/1553374.1553469"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.628"},{"key":"ref50","author":"Paszke","year":"2017","journal-title":"Automatic differentiation in pytorch"},{"key":"ref51","article-title":"Gromovwasserstein averaging of kernel and distance matrices","volume-title":"International conference on machine learning, pages 26642672. PMLR","author":"Peyr\u00e9","year":"2016"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.262"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00689"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00499"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8462891"},{"key":"ref56","first-page":"5373","article-title":"Accurate point cloud registration with robust optimal transport","volume":"34","author":"Shen","year":"2021","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58571-6_3"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i7.32751"},{"key":"ref59","first-page":"843","article-title":"Unsupervised learning of video representations using lstms","volume-title":"International conference on machine learning","author":"Srivastava","year":"2015"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1145\/2493432.2493482"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00965"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01308"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP42928.2021.9506759"},{"key":"ref64","article-title":"Introduction to optimal transport","author":"Thorpe","year":"2018","journal-title":"Notes of Course at University of Cambridge"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1584"},{"key":"ref66","first-page":"6275","article-title":"Optimal transport for structured data with application on graphs","volume-title":"International Conference on Machine Learning","author":"Titouan","year":"2019"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00675"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72973-7_9"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/WACV57701.2024.00630"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.3390\/a13090212"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00128"},{"key":"ref72","first-page":"613","article-title":"Generating videos with scene dynamics","author":"Vondrick","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58520-4_30"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00813"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00840"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01058"},{"key":"ref77","first-page":"6932","article-title":"Gromov-wasserstein learning for graph matching and node embedding","volume-title":"International conference on machine learning","author":"Xu","year":"2019"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01385"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00658"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.280"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11853"},{"key":"ref82","article-title":"Unsupervised learning of visual invariance with temporal coherence","author":"Zou","year":"2011","journal-title":"NIPS 2011 workshop on deep learning and unsupervised feature learning"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11445395.pdf?arnumber=11445395","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T06:37:57Z","timestamp":1777531077000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11445395\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":82,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.01006","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}