{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,20]],"date-time":"2026-03-20T16:22:18Z","timestamp":1774023738985,"version":"3.50.1"},"reference-count":66,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,5,19]],"date-time":"2025-05-19T00:00:00Z","timestamp":1747612800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,5,19]],"date-time":"2025-05-19T00:00:00Z","timestamp":1747612800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,5,19]]},"DOI":"10.1109\/icra55743.2025.11127934","type":"proceedings-article","created":{"date-parts":[[2025,9,2]],"date-time":"2025-09-02T17:28:56Z","timestamp":1756834136000},"page":"3617-3624","source":"Crossref","is-referenced-by-count":8,"title":["FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning"],"prefix":"10.1109","author":[{"given":"Jiaheng","family":"Hu","sequence":"first","affiliation":[{"name":"Allen Institute for Artificial Intelligence (Ai2)"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rose","family":"Hendrix","sequence":"additional","affiliation":[{"name":"Allen Institute for Artificial Intelligence (Ai2)"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ali","family":"Farhadi","sequence":"additional","affiliation":[{"name":"Allen Institute for Artificial Intelligence (Ai2)"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Aniruddha","family":"Kembhavi","sequence":"additional","affiliation":[{"name":"Allen Institute for Artificial Intelligence (Ai2)"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Roberto","family":"Mart\u00edn-Mart\u00edn","sequence":"additional","affiliation":[{"name":"University of Texas,Austin"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Peter","family":"Stone","sequence":"additional","affiliation":[{"name":"University of Texas,Austin"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kuo-Hao","family":"Zeng","sequence":"additional","affiliation":[{"name":"Allen Institute for Artificial Intelligence (Ai2)"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kiana","family":"Ehsani","sequence":"additional","affiliation":[{"name":"Allen Institute for Artificial Intelligence (Ai2)"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Gpt-4 technical report","author":"Achiam","year":"2023","journal-title":"arXiv preprint"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1098\/rstb.2002.1258"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.025"},{"key":"ref5","article-title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","author":"Brohan","year":"2023","journal-title":"arXiv preprint"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611477"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01537"},{"key":"ref8","volume-title":"Reinforcement learning: An introduction","author":"Sutton","year":"2018"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i27.35095"},{"key":"ref10","article-title":"Poliformer: Scaling onpolicy rl with transformers results in masterful navigators","author":"Zeng","year":"2024","journal-title":"arXiv preprint"},{"key":"ref11","article-title":"The ingredients of real-world robotic reinforcement learning","author":"Zhu","year":"2020","journal-title":"arXiv preprint"},{"key":"ref12","first-page":"34 556","article-title":"Jump-start reinforcement learning","volume-title":"International Conference on Machine Learning.","author":"Uchendu","year":"2023"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01716"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2018.xiv.049"},{"key":"ref15","first-page":"28955","article-title":"Reincarnating reinforcement learning: Reusing prior computation to accelerate progress","volume":"35","author":"Agarwal","year":"2022","journal-title":"Advances in neural information processing systems"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1177\/02783649241281508"},{"key":"ref17","article-title":"Toward general-purpose robots via foundation models: A survey and meta-analysis","author":"Hu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref18","article-title":"Octo: An open-source generalist robot policy","author":"Team","year":"2024","journal-title":"arXiv preprint"},{"key":"ref19","article-title":"Robocat: A self-improving generalist agent for robotic manipulation","author":"Bousmalis","year":"2023","journal-title":"Transactions on Machine Learning Research"},{"key":"ref20","article-title":"Openvla: An open-source vision-language-action model","author":"Kim","year":"2024","journal-title":"arXiv preprint"},{"key":"ref21","article-title":"Vint: A foundation model for visual navigation","author":"Shah","year":"2023","journal-title":"arXiv preprint"},{"key":"ref22","article-title":"Solving rubik\u2019s cube with a robot hand","author":"Akkaya","year":"2019","journal-title":"arXiv preprint"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.049"},{"key":"ref24","article-title":"Investigating multi-task pretraining and generalization in reinforcement learning","volume-title":"The Eleventh International Conference on Learning Representations","author":"Taiga","year":"2023"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1613\/jair.1.13673"},{"issue":"7","key":"ref26","article-title":"Transfer learning for reinforcement learning domains: A survey","volume":"10","author":"Taylor","year":"2009","journal-title":"Journal of Machine Learning Research"},{"key":"ref27","article-title":"Awac: Accelerating online reinforcement learning with offline datasets","author":"Nair","year":"2020","journal-title":"arXiv preprint"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11757"},{"key":"ref29","article-title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","author":"Gupta","year":"2019","journal-title":"arXiv preprint"},{"key":"ref30","article-title":"Never stop learning: The effectiveness of fine-tuning in robotic reinforcement learning","author":"Julian","year":"2020","journal-title":"arXiv preprint"},{"key":"ref31","article-title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards","author":"Vecerik","year":"2017","journal-title":"arXiv preprint"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-05181-4_10"},{"key":"ref33","article-title":"Aw-opt: Learning robotic skills with imitation and reinforcement at scale","author":"Lu","year":"2021","journal-title":"arXiv preprint"},{"key":"ref34","first-page":"24639","article-title":"Video pretraining (vpt): Learning to act by watching unlabeled online videos","volume":"35","author":"Baker","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3292075"},{"key":"ref36","volume-title":"Fine-tuning reinforcement learning models is secretly a forgetting mitigation problem","author":"Wo\u0142czyk","year":"2024"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2024.xx.056"},{"key":"ref38","article-title":"Bootstrapping reinforcement learning with imitation for vision-based agile flight","author":"Xing","year":"2024","journal-title":"arXiv preprint"},{"key":"ref39","article-title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","volume":"36","author":"Nakamoto","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref40","article-title":"Offline reinforcement learning with implicit q-learning","author":"Kostrikov","year":"2021","journal-title":"arXiv preprint"},{"key":"ref41","first-page":"1702","article-title":"Offline-to-online reinforcement learning via balanced replay and pessimistic q-ensemble","volume-title":"Conference on Robot Learning.","author":"Lee","year":"2022"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.019"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2018.XIV.009"},{"key":"ref44","first-page":"627","article-title":"A reduction of imitation learning and structured prediction to no-regret online learning","volume-title":"Proceedings of the fourteenth international conference on artificial intelligence and statistics. JMLR Workshop and Conference Proceedings","author":"Ross","year":"2011"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2021.3070203"},{"key":"ref46","first-page":"5793","article-title":"Inductive biases and variable creation in self-attention mechanisms","volume-title":"International Conference on Machine Learning.","author":"Edelman","year":"2022"},{"key":"ref47","article-title":"Ai2-thor: An interactive 3d environment for visual ai","author":"Kolve","year":"2017","journal-title":"arXiv preprint"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01263"},{"key":"ref49","first-page":"5982","article-title":"Procthor: Largescale embodied ai using procedural generation","volume":"35","author":"Deitke","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref50","first-page":"8093","article-title":"Behavior-1k: A benchmark for embodied ai with 1,000 everyday activities and realistic simulation","volume-title":"Conference on Robot Learning.","author":"Li","year":"2023"},{"key":"ref51","article-title":"Mini-behavior: A procedurally generated benchmark for long-horizon decision-making in embodied ai","author":"Jin","year":"2023","journal-title":"arXiv preprint"},{"key":"ref52","article-title":"Habitat 3.0: A co-habitat for humans, avatars and robots","author":"Puig","year":"2023","journal-title":"arXiv preprint"},{"key":"ref53","article-title":"robosuite: A modular simulation framework and benchmark for robot learning","author":"Zhu","year":"2020","journal-title":"arXiv preprint"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01111"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/SSCI47803.2020.9308468"},{"key":"ref56","article-title":"Dinov2: Learning robust visual features without supervision","author":"Oquab","year":"2023","journal-title":"arXiv preprint"},{"key":"ref57","first-page":"606","article-title":"Efficiently scaling transformer inference","volume-title":"Proceedings of Machine Learning and Systems","volume":"5","author":"Pope","year":"2023"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref59","first-page":"1861","article-title":"Soft actor-critic: Offpolicy maximum entropy deep reinforcement learning with a stochastic actor","volume-title":"International conference on machine learning.","author":"Haarnoja","year":"2018"},{"key":"ref60","volume-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01441"},{"key":"ref62","article-title":"Selective visual representations improve convergence and generalization for embodied ai","author":"Eftekhar","year":"2023","journal-title":"arXiv preprint"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9811922"},{"key":"ref64","article-title":"Robot learning in homes: Improving generalization and reducing dataset bias","volume":"31","author":"Gupta","year":"2018","journal-title":"Advances in neural information processing systems"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00932"},{"key":"ref66","article-title":"Reconciling reality through simulation: A real-to-sim-to-real approach for robust manipulation","author":"Torne","year":"2024","journal-title":"arXiv preprint"}],"event":{"name":"2025 IEEE International Conference on Robotics and Automation (ICRA)","location":"Atlanta, GA, USA","start":{"date-parts":[[2025,5,19]]},"end":{"date-parts":[[2025,5,23]]}},"container-title":["2025 IEEE International Conference on Robotics and Automation (ICRA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11127273\/11127223\/11127934.pdf?arnumber=11127934","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,3]],"date-time":"2025-09-03T06:06:24Z","timestamp":1756879584000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11127934\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,5,19]]},"references-count":66,"URL":"https:\/\/doi.org\/10.1109\/icra55743.2025.11127934","relation":{},"subject":[],"published":{"date-parts":[[2025,5,19]]}}}