{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,7,11]],"date-time":"2025-07-11T10:37:09Z","timestamp":1752230229170,"version":"3.38.0"},"reference-count":61,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,12,10]],"date-time":"2024-12-10T00:00:00Z","timestamp":1733788800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,12,10]],"date-time":"2024-12-10T00:00:00Z","timestamp":1733788800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,12,10]]},"DOI":"10.1109\/robio64047.2024.10907650","type":"proceedings-article","created":{"date-parts":[[2025,3,7]],"date-time":"2025-03-07T18:33:40Z","timestamp":1741372420000},"page":"843-850","source":"Crossref","is-referenced-by-count":1,"title":["Visual Robotic Manipulation with Depth-Aware Pretraining"],"prefix":"10.1109","author":[{"given":"Jinming","family":"Li","sequence":"first","affiliation":[{"name":"School of Science, Shanghai University,Department of Mathematics,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wanying","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Science, Shanghai University,Department of Mathematics,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yaxin","family":"Peng","sequence":"additional","affiliation":[{"name":"School of Science, Shanghai University,Department of Mathematics,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chaomin","family":"Shen","sequence":"additional","affiliation":[{"name":"School of Computer Science, East China Normal University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yichen","family":"Zhu","sequence":"additional","affiliation":[{"name":"Midea Group,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiyuan","family":"Xu","sequence":"additional","affiliation":[{"name":"Midea Group,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/WACV56688.2023.00241"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.025"},{"volume-title":"Pre-training for manipulation: The case for shape biased vision transformers","author":"Burns","key":"ref3"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01549"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.261"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-26351-4_20"},{"key":"ref8","article-title":"Exploratory grasping: Asymptotically optimal algorithms for grasping challenging polyhedral objects","author":"Danielczuk","year":"2020","journal-title":"arXiv preprint"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2022.xviii.063"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2019.2956365"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9812138"},{"key":"ref13","article-title":"Maniskill2: A unified benchmark for generalizable manipulation skills","author":"Gu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref14","article-title":"On pre-training for visuo-motor control: Revisiting a learning-from-scratch baseline","author":"Hansen","year":"2022","journal-title":"arXiv preprint"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref18","article-title":"Human instruction-following with deep reinforcement learning via transfer-learning from text","author":"Hill","year":"2020","journal-title":"arXiv preprint"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00564"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20077-9_40"},{"key":"ref21","first-page":"991","article-title":"Bc-z: Zero-shot task generalization with robotic imitation learning","volume-title":"Conference on Robot Learning","author":"Jang"},{"key":"ref22","article-title":"Vima: General robot manipulation with multimodal prompts","author":"Jiang","year":"2022","journal-title":"arXiv preprint"},{"key":"ref23","article-title":"Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipulation","author":"Kalashnikov","year":"2018","journal-title":"arXiv preprint"},{"key":"ref24","article-title":"Mt-opt: Continuous multi-task robotic reinforcement learning at scale","author":"Kalashnikov","year":"2021","journal-title":"arXiv preprint"},{"key":"ref25","article-title":"Mmro: Are multimodal llms eligible as the brain for in-home robotics?","author":"Li","year":"2024","journal-title":"arXiv preprint"},{"key":"ref26","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-031-72992-8_22","article-title":"Mm-safetybench: A benchmark for safety evaluation of multimodal large language models","volume-title":"European Conference on Computer Vision","author":"Liu"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2024\/901"},{"key":"ref28","article-title":"Language conditioned imitation learning over unstructured data","author":"Lynch","year":"2020","journal-title":"arXiv preprint"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.012"},{"key":"ref30","first-page":"1303","article-title":"Learning language-conditioned robot behavior from offline data and crowd-sourced annotation","volume-title":"Conference on Robot Learning","author":"Nair"},{"key":"ref31","article-title":"Dinov2: Learning robust visual features without supervision","author":"Oquab","year":"2023","journal-title":"arXiv preprint"},{"key":"ref32","first-page":"17359","article-title":"The unsurprising effectiveness of pre-trained vision models for control","volume-title":"International Conference on Machine Learning","author":"Parisi"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487517"},{"key":"ref34","first-page":"652","article-title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","volume-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","author":"Qi"},{"key":"ref35","article-title":"Robot learning with sensorimotor pre-training","author":"Radosavovic","year":"2023","journal-title":"arXiv preprint"},{"key":"ref36","first-page":"416","article-title":"Real-world robot learning with masked visual pre-training","volume-title":"Conference on Robot Learning","author":"Radosavovic"},{"key":"ref37","article-title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations","author":"Rajeswaran","year":"2017","journal-title":"arXiv preprint"},{"key":"ref38","article-title":"A generalist agent","author":"Reed","year":"2022","journal-title":"arXiv preprint"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.74"},{"key":"ref40","article-title":"Multi-view masked world models for visual robotic manipulation","author":"Seo","year":"2023","journal-title":"arXiv preprint"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.074"},{"key":"ref42","article-title":"Lossless adaptation of pretrained vision models for robotic manipulation","author":"Sharma","year":"2023","journal-title":"arXiv preprint"},{"key":"ref43","article-title":"Distilled feature fields enable few-shot language-guided manipulation","author":"Shen","year":"2023","journal-title":"arXiv preprint"},{"key":"ref44","first-page":"785","article-title":"Perceiver-actor: A multi-task transformer for robotic manipulation","volume-title":"Conference on Robot Learning","author":"Shridhar"},{"key":"ref45","article-title":"Attention is all you need","author":"Vaswani","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref46","article-title":"Bridgedata v2: A dataset for robot learning at scale","author":"Walke","year":"2023","journal-title":"arXiv preprint"},{"key":"ref47","article-title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","author":"Wen","year":"2024","journal-title":"arXiv preprint"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10609992"},{"key":"ref49","article-title":"Masked visual pre-training for motor control","author":"Xiao","year":"2022","journal-title":"arXiv preprint"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01641"},{"key":"ref51","article-title":"Large batch training of convolutional networks","author":"You","year":"2017","journal-title":"arXiv preprint"},{"key":"ref52","first-page":"13022","article-title":"Pre-trained image encoder for generalizable visual reinforcement learning","volume":"35","author":"Yuan","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-43415-0_5"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611525"},{"key":"ref55","article-title":"Scaling diffusion policy in transformer to 1 billion parameters for robotic manipulation","author":"Zhu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref56","article-title":"A comprehensive overhaul of multimodal assistant with small language models","author":"Zhu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref57","first-page":"32011","article-title":"Teach less, learn more: On the undistillable classes in knowledge distillation","volume":"35","author":"Zhu","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01703"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00501"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01889"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1145\/3688863.3689575"}],"event":{"name":"2024 IEEE International Conference on Robotics and Biomimetics (ROBIO)","start":{"date-parts":[[2024,12,10]]},"location":"Bangkok, Thailand","end":{"date-parts":[[2024,12,14]]}},"container-title":["2024 IEEE International Conference on Robotics and Biomimetics (ROBIO)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10906779\/10907273\/10907650.pdf?arnumber=10907650","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,3,8]],"date-time":"2025-03-08T07:55:24Z","timestamp":1741420524000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10907650\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,10]]},"references-count":61,"URL":"https:\/\/doi.org\/10.1109\/robio64047.2024.10907650","relation":{},"subject":[],"published":{"date-parts":[[2024,12,10]]}}}