{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,4]],"date-time":"2026-05-04T09:59:56Z","timestamp":1777888796556,"version":"3.51.4"},"reference-count":56,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100018537","name":"National Science and Technology Major Project","doi-asserted-by":"publisher","award":["2022ZD0114902"],"award-info":[{"award-number":["2022ZD0114902"]}],"id":[{"id":"10.13039\/501100018537","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.00997","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"10708-10718","source":"Crossref","is-referenced-by-count":0,"title":["Open-World Skill Discovery from Unsegmented Demonstration Videos"],"prefix":"10.1109","author":[{"given":"Jingwen","family":"Deng","sequence":"first","affiliation":[{"name":"Peking University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zihao","family":"Wang","sequence":"additional","affiliation":[{"name":"Peking University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shaofei","family":"Cai","sequence":"additional","affiliation":[{"name":"Peking University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Anji","family":"Liu","sequence":"additional","affiliation":[{"name":"University of California,Los Angeles"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yitao","family":"Liang","sequence":"additional","affiliation":[{"name":"Peking University"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"The optioncritic architecture","volume-title":"Proceedings of the AAAI conference on artificial intelligence","author":"Bacon","year":"2017"},{"key":"ref2","article-title":"Option discovery using deep skill chaining","volume-title":"International Conference on Learning Representations","author":"Bagaria","year":"2019"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1789"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.049"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01320"},{"key":"ref6","article-title":"Groot: Learning to follow instructions by watching gameplay videos","volume-title":"The Twelfth International Conference on Learning Representations","author":"Cai","year":"2023"},{"key":"ref7","article-title":"Rocket-1: Master openworld interaction with visual-temporal context prompting","volume-title":"NeurIPS 2024 Workshop on Open-World Agents","author":"Cai","year":"2024"},{"key":"ref8","article-title":"Exploring large language model based intelligent agents: Definitions, methods, and prospects","author":"Cheng","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref9","article-title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","author":"Comanici","year":"2025","journal-title":"arXiv preprint arXiv"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1016\/j.neuropsychologia.2009.02.003"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/p19-1285"},{"key":"ref12","first-page":"8469","article-title":"PaLMe: An embodied multimodal language model","volume-title":"Proceedings of the 40th International Conference on Machine Learning","author":"Driess","year":"2023"},{"key":"ref13","article-title":"Vtnet: Visual transformer network for object goal navigation","volume-title":"International Conference on Learning Representations","author":"Du","year":"2021"},{"key":"ref14","article-title":"Diversity is all you need: Learning skills without a reward function","volume-title":"International Conference on Learning Representations","author":"Eysenbach","year":"2019"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1333"},{"issue":"2","key":"ref16","first-page":"23","article-title":"Philip Gage. A new algorithm for data compression","volume":"12","year":"1994","journal-title":"The C Users Journal"},{"key":"ref17","article-title":"Seed1.5-vl technical report","author":"Guo","year":"2025","journal-title":"arXiv preprint arXiv"},{"key":"ref18","article-title":"Luban: Building open-ended creative agents via autonomous embodied verification","author":"Guo","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2019\/339"},{"key":"ref20","article-title":"Mastering diverse domains through world models","author":"Hafner","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.52202\/068431-0519"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73113-6_1"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01441"},{"key":"ref24","article-title":"Auto-encoding variational bayes","volume-title":"International Conference on Learning Representations","author":"Kingma","year":"2014"},{"key":"ref25","first-page":"34183428","article-title":"CompILE: Compositional imitation learning and execution","volume-title":"Proceedings of the 36th International Conference on Machine Learning","author":"Kipf","year":"2019"},{"key":"ref26","first-page":"46324646","article-title":"Flexible option learning","volume":"34","author":"Klissarov","year":"2021","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.920"},{"key":"ref28","article-title":"Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks","author":"Li","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.52202\/075280-3064"},{"key":"ref30","article-title":"Mcu: A task-centric framework for open-ended agent evaluation in minecraft","author":"Lin","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2025.XXI.012"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01543"},{"key":"ref33","volume-title":"ByteDance Seed. Ui-tars-1.5","year":"2025"},{"key":"ref34","first-page":"8624","article-title":"Learning robot skills with temporal variational inference","volume-title":"International Conference on Machine Learning","author":"Shankar","year":"2020"},{"key":"ref35","first-page":"4654","article-title":"Taco: Learning task decomposition via temporal alignment for control","volume-title":"International Conference on Machine Learning","author":"Shiarlis","year":"2018"},{"key":"ref36","article-title":"Learning structured output representation using deep conditional generative models","volume":"28","author":"Sohn","year":"2015","journal-title":"Advances in neural information processing systems"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1016\/s0004-3702(99)00052-1"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2021.3068891"},{"key":"ref39","article-title":"Voyager: An open-ended embodied agent with large language models","author":"Wang","year":"2024","journal-title":"Transactions on Machine Learning Research"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.102"},{"key":"ref41","article-title":"Describe, explain, plan and select: interactive planning with 11 ms enables open-world multi-task agents","volume":"36","author":"Wang","year":"2023","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3511593"},{"key":"ref43","first-page":"73278","article-title":"Omnijarvis: Unified vision-language-action tokenization enables open-world instruction following agents","volume":"37","author":"Wang","year":"2025","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref44","article-title":"Future-conditioned unsupervised pretraining for decision transformer","volume-title":"International Conference on Machine Learning","author":"Xie","year":"2023"},{"key":"ref45","article-title":"Plan4mc: Skill reinforcement learning and planning for open-world minecraft tasks","author":"Yuan","year":"2023","journal-title":"ArXiv"},{"key":"ref46","article-title":"Pre-training goal-based models for sample-efficient reinforcement learning","volume-title":"The Twelfth International Conference on Learning Representations","author":"Yuan","year":"2024"},{"key":"ref47","article-title":"Event perception: a mindbrain perspective","author":"Jeffrey","year":"2007","journal-title":"Psychological bulletin"},{"key":"ref48","article-title":"Creative agents: Empowering agents with imagination for creative tasks","author":"Zhang","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i16.29710"},{"key":"ref50","article-title":"Optimizing latent goal by learning from trajectory preference","author":"Zhao","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref51","article-title":"Do we really need a complex agent system?\\\\ distill embodied agent into a single model","author":"Zhao","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref52","first-page":"arXiv","article-title":"Towards evaluating generalist agents: An automated benchmark in open world","author":"Zheng","year":"2023","journal-title":"arXiv e-prints"},{"key":"ref53","article-title":"Minedreamer: Learning to follow instructions via chain-ofimagination for simulated-world control","author":"Zhou","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref54","article-title":"Ghost in the minecraft: Generally capable agents for open-world environments via large language models with text-based knowledge and memory","author":"Zhu","year":"2023","journal-title":"ArXiv"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3146589"},{"key":"ref56","first-page":"2165","article-title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","volume-title":"Proceedings of The 7th Conference on Robot Learning","author":"Zitkovich","year":"2023"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11446087.pdf?arnumber=11446087","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T04:58:29Z","timestamp":1777611509000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11446087\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":56,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.00997","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}