{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,2]],"date-time":"2025-10-02T00:30:30Z","timestamp":1759365030234,"version":"build-2065373602"},"reference-count":30,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,7,26]],"date-time":"2025-07-26T00:00:00Z","timestamp":1753488000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,7,26]],"date-time":"2025-07-26T00:00:00Z","timestamp":1753488000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,7,26]]},"DOI":"10.23919\/mva65244.2025.11175125","type":"proceedings-article","created":{"date-parts":[[2025,9,26]],"date-time":"2025-09-26T17:35:13Z","timestamp":1758908113000},"page":"1-6","source":"Crossref","is-referenced-by-count":0,"title":["Modality Selection and Skill Segmentation via Cross-Modality Attention"],"prefix":"10.23919","author":[{"given":"Jiawei","family":"Jiang","sequence":"first","affiliation":[{"name":"Science Tokyo"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kei","family":"Ota","sequence":"additional","affiliation":[{"name":"Mitsubishi Electric"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Devesh K.","family":"Jha","sequence":"additional","affiliation":[{"name":"MERL"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Asako","family":"Kanezaki","sequence":"additional","affiliation":[{"name":"Science Tokyo &amp; RIKEN AIP"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"article-title":"Language models are few-shot learners","volume-title":"Proceedings of the 34th International Conference on Neural Information Processing Systems","author":"Brown","key":"ref1"},{"article-title":"The llama 3 herd of models","year":"2024","author":"Grattafiori","key":"ref2"},{"article-title":"Visual instruction tuning","year":"2023","author":"Liu","key":"ref3"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.090"},{"article-title":"Open X-Embodiment: Robotic learning datasets and RT-X models","year":"2023","author":"O\u2019Neill","key":"ref5"},{"article-title":"Do as i can and not as i say: Grounding language in robotic affordances","year":"2022","author":"Ahn","key":"ref6"},{"key":"ref7","doi-asserted-by":"crossref","DOI":"10.1109\/ICRA55743.2025.11127987","article-title":"Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding","author":"Jones","year":"2025"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.041"},{"key":"ref9","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume-title":"Proceedings of the 34th International Conference on Neural Information Processing Systems","author":"Ho"},{"article-title":"Score-based generative modeling through stochastic differential equations","volume-title":"International Conference on Learning Representations","author":"Song","key":"ref10"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1177\/02783649241273668"},{"key":"ref12","doi-asserted-by":"crossref","DOI":"10.15607\/RSS.2024.XX.067","article-title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","author":"Ze","year":"2024"},{"key":"ref13","doi-asserted-by":"crossref","DOI":"10.1109\/IROS58592.2024.10802498","article-title":"JUICER: Data-Efficient Imitation Learning for Robotic Assembly","author":"Ankile","year":"2024"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.028"},{"article-title":"Diffusion Policy Policy Optimization","year":"2024","author":"Ren","key":"ref15"},{"article-title":"ObjectFolder: A Dataset of Objects with Implicit Visual, Auditory, and Tactile Representations","year":"2021","author":"Gao","key":"ref16"},{"key":"ref17","doi-asserted-by":"crossref","DOI":"10.1109\/CVPR52688.2022.01034","article-title":"ObjectFolder 2.0: A Multisensory Object Dataset for Sim2Real Transfer","author":"Gao","year":"2022"},{"article-title":"The ObjectFolder Benchmark: Multisensory Learning with Neural and Real Objects","year":"2023","author":"Gao","key":"ref18"},{"article-title":"See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation","year":"2022","author":"Li","key":"ref19"},{"article-title":"Play to the score: Stage-guided dynamic multi-sensory fusion for robotic manipulation","volume-title":"8th Annual Conference on Robot Learning","author":"Feng","key":"ref20"},{"key":"ref21","doi-asserted-by":"crossref","DOI":"10.1201\/9780429489105","volume-title":"Behavior Trees in Robotics and AI: An Introduction","author":"Colledanchise","year":"2018"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1146\/annurev-control-091420-084139"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9812057"},{"key":"ref24","first-page":"14 298","article-title":"Learning Geometric Reasoning and Control for Long-Horizon Tasks from Visual Input","volume-title":"2021 IEEE International Conference on Robotics and Automation (ICRA)","author":"Driess"},{"key":"ref25","first-page":"1476","article-title":"Multistage Cable Routing Through Hierarchical Imitation Learning","volume-title":"IEEE Transactions on Robotics","volume":"40","author":"Luo","year":"2024"},{"key":"ref26","first-page":"5104","article-title":"DexSkills: Skill Segmentation Using Haptic Data for Learning Autonomous Long-Horizon Robotic Manipulation Tasks","volume-title":"2024 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","author":"Mao"},{"key":"ref27","doi-asserted-by":"crossref","DOI":"10.1109\/ICRA57147.2024.10610567","article-title":"Generalize by Touching: Tactile Ensemble Skill Transfer for Robotic Furniture Assembly","author":"Lin","year":"2024"},{"article-title":"From imitation to refinement \u2013 residual rl for precise visual assembly","year":"2024","author":"Ankile","key":"ref28"},{"article-title":"Residual policy learning","year":"2019","author":"Silver","key":"ref29"},{"article-title":"R3M: A Universal Visual Representation for Robot Manipulation","year":"2022","author":"Nair","key":"ref30"}],"event":{"name":"2025 19th International Conference on Machine Vision and Applications (MVA)","start":{"date-parts":[[2025,7,26]]},"location":"Kyoto, Japan","end":{"date-parts":[[2025,7,28]]}},"container-title":["2025 19th International Conference on Machine Vision and Applications (MVA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11174131\/11175049\/11175125.pdf?arnumber=11175125","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,1]],"date-time":"2025-10-01T05:18:56Z","timestamp":1759295936000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11175125\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7,26]]},"references-count":30,"URL":"https:\/\/doi.org\/10.23919\/mva65244.2025.11175125","relation":{},"subject":[],"published":{"date-parts":[[2025,7,26]]}}}