{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T19:58:59Z","timestamp":1779220739202,"version":"3.51.4"},"reference-count":59,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2024,12,23]],"date-time":"2024-12-23T00:00:00Z","timestamp":1734912000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,23]],"date-time":"2024-12-23T00:00:00Z","timestamp":1734912000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100004837","name":"Ministerio de Ciencia e Innovaci\u00f3n","doi-asserted-by":"publisher","award":["PID2019-104323RB-C3"],"award-info":[{"award-number":["PID2019-104323RB-C3"]}],"id":[{"id":"10.13039\/501100004837","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100006302","name":"Universidad de Alcal\u00e1","doi-asserted-by":"publisher","award":["GP2023-06"],"award-info":[{"award-number":["GP2023-06"]}],"id":[{"id":"10.13039\/501100006302","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2025,2]]},"DOI":"10.1007\/s10489-024-06115-4","type":"journal-article","created":{"date-parts":[[2024,12,23]],"date-time":"2024-12-23T07:53:46Z","timestamp":1734940426000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Visual semantic navigation with real robots"],"prefix":"10.1007","volume":"55","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5624-0076","authenticated-orcid":false,"given":"Carlos","family":"Guti\u00e9rrez-\u00c1lvarez","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pablo","family":"R\u00edos-Navarro","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rafael","family":"Flor-Rodr\u00edguez-Rabad\u00e1n","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Francisco\u00a0Javier","family":"Acevedo-Rodr\u00edguez","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Roberto Javier","family":"L\u00f3pez-Sastre","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,12,23]]},"reference":[{"key":"6115_CR1","doi-asserted-by":"crossref","unstructured":"Ramrakhya R, Batra D, Wijmans E, Das A (2023) PIRLNav: pretraining with imitation and rl finetuning for ObjectNav. In: CVPR","DOI":"10.1109\/CVPR52729.2023.01716"},{"key":"6115_CR2","doi-asserted-by":"crossref","unstructured":"Cai W, Wang T, Cheng G, Xu L, Sun C (2024) DGMem: Learning visual navigation policy without any labels by dynamic graph memory. Appl Intell","DOI":"10.1007\/s10489-024-05323-2"},{"key":"6115_CR3","unstructured":"Chang M, Gupta A, Gupta S (2020) Semantic visual navigation by watching youtube videos. In: NeurIPS"},{"key":"6115_CR4","unstructured":"Batra D, Gokaslan A, Kembhavi A, Maksymets O, Mottaghi R, Savva M, Toshev A, Wijmans E (2020) ObjectNav revisited: on evaluation of embodied agents navigating to objects. In: arXiv. arXiv:2006.13171"},{"key":"6115_CR5","unstructured":"Quigley M, Gerkey B, Conley K, Faust J, Foote T, Leibs J, Berger E, Wheeler R, Ng A (2009) ROS: an open-source robot operating system. In: ICRA, Workshop on Open Source Robotics"},{"key":"6115_CR6","doi-asserted-by":"crossref","unstructured":"Newcombe RA, Izadi S, Hilliges O, Molyneaux D, Kim D, Davison AJ, Kohi P, Shotton J, Hodges S, Fitzgibbon A (2011) KinectFusion: Real-time dense surface mapping and tracking. In: International symposium on mixed and augmented reality","DOI":"10.1109\/ISMAR.2011.6162880"},{"issue":"1","key":"6115_CR7","doi-asserted-by":"publisher","first-page":"99","DOI":"10.1016\/S0004-3702(01)00069-8","volume":"128","author":"S Thrun","year":"2001","unstructured":"Thrun S, Fox D, Burgard W, Dellaert F (2001) Robust monte carlo localization for mobile robots. Artif Intell 128(1):99\u2013141. https:\/\/doi.org\/10.1016\/S0004-3702(01)00069-8","journal-title":"Artif Intell"},{"issue":"4","key":"6115_CR8","doi-asserted-by":"publisher","first-page":"407","DOI":"10.1177\/0278364910388963","volume":"30","author":"ES Jones","year":"2011","unstructured":"Jones ES, Soatto S (2011) Visual-inertial navigation, mapping and localization: A scalable real-time causal approach. Int J Robot Res 30(4):407\u2013430. https:\/\/doi.org\/10.1177\/0278364910388963","journal-title":"Int J Robot Res"},{"key":"6115_CR9","doi-asserted-by":"crossref","unstructured":"Sattler T, Maddern W, Toft C, Torii A, Hammarstrand L, Stenborg E, Safari D, Okutomi M, Pollefeys M, Sivic J, Kahl F, Pajdla T (2018) Benchmarking 6dof outdoor visual localization in changing conditions. In: CVPR","DOI":"10.1109\/CVPR.2018.00897"},{"key":"6115_CR10","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2022.117734","volume":"205","author":"I Abaspur Kazerouni","year":"2022","unstructured":"Abaspur Kazerouni I, Fitzgerald L, Dooly G, Toal D (2022) A survey of state-of-the-art on visual slam. Expert Syst Appl 205:117734","journal-title":"Expert Syst Appl"},{"key":"6115_CR11","doi-asserted-by":"crossref","unstructured":"Campos C, Elvira R, Rodr\u00edguez JJG, M Montiel JM, D Tard\u00f3s J (2021) Orb-slam3: An accurate open-source library for visual, visual\u2013inertial, and multimap slam. IEEE Transactions on Robotics","DOI":"10.1109\/TRO.2021.3075644"},{"key":"6115_CR12","doi-asserted-by":"crossref","unstructured":"Labb\u00e9 M, Michaud F (2022) Multi-session visual slam for illumination-invariant re-localization in indoor environments. Frontiers in Robotics and AI","DOI":"10.3389\/frobt.2022.801886"},{"key":"6115_CR13","doi-asserted-by":"crossref","unstructured":"Zhang L, Wei L-Y, Shen P, Wei W, Zhu G, Song J (2018) Semantic slam based on object detection and improved octomap. IEEE Access","DOI":"10.1109\/ACCESS.2018.2873617"},{"key":"6115_CR14","doi-asserted-by":"crossref","unstructured":"Rosinol A, Abate M, Chang Y, Carlone L (2020) Kimera: an open-source library for real-time metric-semantic localization and mapping. ICRA","DOI":"10.1109\/ICRA40945.2020.9196885"},{"key":"6115_CR15","doi-asserted-by":"publisher","first-page":"119068","DOI":"10.1016\/j.eswa.2022.119068","volume":"213","author":"S Jin","year":"2023","unstructured":"Jin S, Dai X, Meng Q (2023) focusing on the right regions - guided saliency prediction for visual slam. Expert Syst Appl 213:119068","journal-title":"Expert Syst Appl"},{"key":"6115_CR16","doi-asserted-by":"crossref","unstructured":"Ramrakhya R, Undersander E, Batra D, Das A (2022) Habitat-Web : learning embodied object-search strategies from human demonstrations at scale. In: CVPR","DOI":"10.1109\/CVPR52688.2022.00511"},{"key":"6115_CR17","unstructured":"Yadav K, Ramrakhya R, Majumdar A, Berges V-P, Kuhar S, Batra D, Baevski A, Maksymets O (2023) Offline visual representation learning for embodied navigation. In: ICLR"},{"key":"6115_CR18","doi-asserted-by":"crossref","unstructured":"Guti\u00e9rrez-Maestro E, L\u00f3pez-Sastre R.J, Maldonado-Basc\u00f3n S (2019) Collision anticipation via deep reinforcement learning for visual navigation. In: IbPRIA","DOI":"10.1007\/978-3-030-31332-6_34"},{"key":"6115_CR19","doi-asserted-by":"crossref","unstructured":"Khandelwal A, Weihs L, Mottaghi R, Kembhavi A (2022) Simple but effective: CLIP embeddings for embodied AI. In: CVPR","DOI":"10.1109\/CVPR52688.2022.01441"},{"key":"6115_CR20","unstructured":"Chaplot DS, Gandhi D, Gupta A, Salakhutdinov R (2020) Object goal navigation using goal-oriented semantic exploration. In: NeurIPS"},{"key":"6115_CR21","doi-asserted-by":"crossref","unstructured":"Zhu Y, Mottaghi R, Kolve E, Lim JJ, Gupta A, Fei-Fei L, Farhadi A (2017) Target-driven visual navigation in indoor scenes using deep reinforcement learning. In: ICLR","DOI":"10.1109\/ICRA.2017.7989381"},{"key":"6115_CR22","unstructured":"Wijmans E, Kadian A, Morcos A, Lee S, Essa I, Parikh D, Savva M, Batra D (2020) DD-PPO: learning near-perfect pointgoal navigators from 2.5 billion frames. In: ICLR"},{"issue":"2","key":"6115_CR23","doi-asserted-by":"publisher","first-page":"3154","DOI":"10.1109\/LRA.2022.3145964","volume":"7","author":"X Liu","year":"2022","unstructured":"Liu X, Guo D, Liu H, Sun F (2022) Multi-agent embodied visual semantic navigation with scene prior knowledge. IEEE Rob Autom Lett 7(2):3154\u20133161. https:\/\/doi.org\/10.1109\/LRA.2022.3145964","journal-title":"IEEE Rob Autom Lett"},{"key":"6115_CR24","unstructured":"Yadav K, Majumdar A, Ramrakhya R, Yokoyama N, Baevski A, Kira Z, Maksymets O, Batra D (2023) OVRL-V2: A simple state-of-art baseline for imagenav and objectnav. ArXiv"},{"key":"6115_CR25","doi-asserted-by":"crossref","unstructured":"Xu D, Chen P, Zhou X, Wang Y, Tan G (2024) Deep reinforcement learning based mapless navigation for industrial AMRs: advancements in generalization via potential risk state augmentation. Appl Intell","DOI":"10.1007\/s10489-024-05679-5"},{"key":"6115_CR26","doi-asserted-by":"crossref","unstructured":"Yokoyama N, Ramrakhya R, Das A, Batra D, Ha S (2024) HM3D-OVON : A dataset and benchmark for open-vocabulary object goal navigation. IROS","DOI":"10.1109\/IROS58592.2024.10802709"},{"key":"6115_CR27","doi-asserted-by":"crossref","unstructured":"Ye J, Batra D, Das A, Wijmans E (2021) Auxiliary tasks and exploration enable ObjectGoal navigation. In: ICCV","DOI":"10.1109\/ICCV48922.2021.01581"},{"key":"6115_CR28","unstructured":"Yang W, Wang X, Farhadi A, Gupta A.K, Mottaghi R (2018) Visual semantic navigation using scene priors. ICLR"},{"key":"6115_CR29","doi-asserted-by":"crossref","unstructured":"Mousavian A, Toshev A, Fiser M, Kosecka J, Davidson J (2018) Visual representations for semantic target driven navigation. ICRA","DOI":"10.1109\/ICRA.2019.8793493"},{"key":"6115_CR30","doi-asserted-by":"crossref","unstructured":"Wang H, Wang Y, Zhong F, Wu M, Zhang J, Wang Y, Dong H (2023) Learning semantic-agnostic and spatial-aware representation for generalizable visual-audio navigation. IEEE Rob Autom Lett","DOI":"10.1109\/LRA.2023.3272518"},{"key":"6115_CR31","doi-asserted-by":"crossref","unstructured":"Kondoh H, Kanezaki A (2023) Multi-goal audio-visual navigation using sound direction map. ArXiv","DOI":"10.1109\/IROS55552.2023.10341819"},{"key":"6115_CR32","doi-asserted-by":"publisher","unstructured":"Staroverov A, Muravyev K, Yakovlev K, Panov AI (2023) Skill fusion in hybrid robotic framework for visual object goal navigation, vol 12. https:\/\/doi.org\/10.3390\/robotics12040104. https:\/\/www.mdpi.com\/2218-6581\/12\/4\/104","DOI":"10.3390\/robotics12040104"},{"key":"6115_CR33","doi-asserted-by":"publisher","first-page":"23244","DOI":"10.1007\/s10489-023-04754-7","volume":"53","author":"Z Li","year":"2023","unstructured":"Li Z, Zhou A (2023) RDDRL: a recurrent deduction deep reinforcement learning model for multimodal vision-robot navigation. Appl Intell 53:23244\u201323270","journal-title":"Appl Intell"},{"issue":"15","key":"6115_CR34","doi-asserted-by":"publisher","first-page":"17600","DOI":"10.1007\/s10489-022-03317-6","volume":"52","author":"K Zhou","year":"2022","unstructured":"Zhou K, Guo C, Zhang H (2022) Improving indoor visual navigation generalization with scene priors and markov relational reasoning. Appl Intell 52(15):17600\u201317613","journal-title":"Appl Intell"},{"key":"6115_CR35","doi-asserted-by":"crossref","unstructured":"Kang J, Chen B, Zhong P, Yang H, Sheng Y, Wang J (2024) HSPNav: Hierarchical scene prior learning for visual semantic navigation towards real settings. ICRA","DOI":"10.1109\/ICRA57147.2024.10610061"},{"key":"6115_CR36","doi-asserted-by":"crossref","unstructured":"Wang J, Soh H (2024) Probable object location (polo) score estimation for efficient object goal navigation. ICRA","DOI":"10.1109\/ICRA57147.2024.10610671"},{"key":"6115_CR37","doi-asserted-by":"crossref","unstructured":"Wasserman J, Chowdhary G, Gupta A, Jain U (2024) Exploitation-guided exploration for semantic embodied navigation. ICRA","DOI":"10.1109\/ICRA57147.2024.10610117"},{"key":"6115_CR38","doi-asserted-by":"crossref","unstructured":"Yokoyama N, Ha S, Batra D, Wang J, Bucher B (2024) VLFM: Vision-language frontier maps for zero-shot semantic navigation. ICRA","DOI":"10.1109\/ICRA57147.2024.10610712"},{"key":"6115_CR39","unstructured":"Shah D, Bhorkar A, Leen H, Kostrikov I, Rhinehart N, Levine S (2022) Offline reinforcement learning for visual navigation. In: CoRL"},{"key":"6115_CR40","doi-asserted-by":"publisher","unstructured":"Wortsman M, Ehsani K, Rastegari M, Farhadi A, Mottaghi R (2019) Learning to Learn How to Learn: self-adaptive visual navigation using meta-learning. CVPR, pp 6743\u20136752. https:\/\/doi.org\/10.1109\/cvpr.2019.00691","DOI":"10.1109\/cvpr.2019.00691"},{"key":"6115_CR41","doi-asserted-by":"crossref","unstructured":"Luo Q, Sorokin M, Ha S (2021) A few shot adaptation of visual navigation skills to new observations using meta-learning. In: ICRA, pp 13231\u201313237","DOI":"10.1109\/ICRA48506.2021.9561056"},{"key":"6115_CR42","doi-asserted-by":"crossref","unstructured":"Zhang S, Li W, Song X, Bai Y, Jiang S (2022 Generative meta-adversarial network for unseen object navigation. In: ECCV )","DOI":"10.1007\/978-3-031-19842-7_18"},{"key":"6115_CR43","unstructured":"Huang W, Xia F, Shah D, Driess D, Zeng A, Lu Y, Florence PR, Mordatch I, Levine S, Hausman K, Ichter B (2023) Grounded decoding: Guiding text generation with grounded models for robot control. ArXiv"},{"key":"6115_CR44","unstructured":"Zhou K-Q, Zheng K, Pryor C, Shen Y, Jin H, Getoor L, Wang XE (2023) ESC: Exploration with soft commonsense constraints for zero-shot object navigation. ArXiv )"},{"key":"6115_CR45","doi-asserted-by":"publisher","first-page":"116973","DOI":"10.1016\/j.eswa.2022.116973","volume":"199","author":"M Kim","year":"2022","unstructured":"Kim M, Ladosz P, Oh H (2022) Monocular vision-based time-to-collision estimation for small drones by domain adaptation of simulated images. Expert Syst Appl 199:116973","journal-title":"Expert Syst Appl"},{"key":"6115_CR46","doi-asserted-by":"crossref","unstructured":"Kadian A, Truong J, Gokaslan A, Clegg A, Wijmans E, Lee S, Savva M, Chernova S, Batra D (2020) Sim2Real predictivity: Does evaluation in simulation predict real-world performance? IEEE Rob Autom Lett","DOI":"10.1109\/LRA.2020.3013848"},{"key":"6115_CR47","doi-asserted-by":"crossref","unstructured":"Sadeghi F, Levine S (2017) CAD2RL: Real single-image flight without a single real image. In: Robotics: science and systems","DOI":"10.15607\/RSS.2017.XIII.034"},{"key":"6115_CR48","doi-asserted-by":"crossref","unstructured":"Son D, Yang H, Lee D (2020) Sim-to-real transfer of bolting tasks with tight tolerance. In: IROS","DOI":"10.1109\/IROS45743.2020.9341644"},{"key":"6115_CR49","doi-asserted-by":"crossref","unstructured":"Hwangbo J, Lee J, Dosovitskiy A, Bellicoso D, Tsounis V, Koltun V, Hutter M (2019) Learning agile and dynamic motor skills for legged robots. Science Robotics","DOI":"10.1126\/scirobotics.aau5872"},{"key":"6115_CR50","unstructured":"Agarwal A, Kumar A, Malik J, Pathak D (2022) Legged locomotion in challenging terrains using egocentric vision. In: CoRL"},{"key":"6115_CR51","doi-asserted-by":"crossref","unstructured":"Gervet T, Chintala S, Batra D, Malik J, Chaplot DS (2022) Navigating to Objects in the Real World. Sci Rob","DOI":"10.1126\/scirobotics.adf6991"},{"key":"6115_CR52","unstructured":"Ltd. K (2023) ROS wrapper for Kobuki base Turtlebot 2. https:\/\/github.com\/yujinrobot\/kobuki.git"},{"key":"6115_CR53","doi-asserted-by":"crossref","unstructured":"Nasri N, L\u00f3pez-Sastre RJ, Pacheco-da-Costa S, Fern\u00e1ndez-Munilla I, Guti\u00e9rrez-\u00c1lvarez C, Pousada-Garc\u00eda T, Acevedo-Rodr\u00edguez FJ, Maldonado-Basc\u00f3n S (2022) Assistive robot with an ai-based application for the reinforcement of activities of daily living: Technical validation with users affected by neurodevelopmental disorders. Applied Sciences","DOI":"10.3390\/app12199566"},{"key":"6115_CR54","unstructured":"Ltd O (2023) ROS wrapper for Astra camera. https:\/\/github.com\/orbbec\/ros_astra_camera"},{"key":"6115_CR55","unstructured":"Szot A, Clegg A, Undersander E, Wijmans E, Zhao Y, Turner J, Maestre N, Mukadam M, Chaplot DS, Maksymets O, Gokaslan A, Vondru\u0161 V, Dharur S, Meier F, Galuba W, Chang A, Kira Z, Koltun V, Malik J, Savva M, Batra D (2021) Habitat 2.0: Training home assistants to rearrange their habitat. In: NeurIPS"},{"key":"6115_CR56","doi-asserted-by":"crossref","unstructured":"He K, Gkioxari G, Doll\u00e1r P, Girshick R (2017) Mask R-CNN. In: ICCV","DOI":"10.1109\/ICCV.2017.322"},{"key":"6115_CR57","doi-asserted-by":"crossref","unstructured":"Sethian JA (1996) A fast marching level set method for monotonically advancing fronts. In: Proceedings of the National Academy of Sciences","DOI":"10.1073\/pnas.93.4.1591"},{"key":"6115_CR58","unstructured":"Ramakrishnan SK, Gokaslan A, Wijmans E, Maksymets O, Clegg A, Turner J, Undersander E, Galuba W, Westbury A, Chang AX, Savva M, Zhao Y, Batra D (2021) Habitat-Matterport 3D Dataset (HM3D): 1000 large-scale 3D environments for embodied AI. In: NeurIPS"},{"key":"6115_CR59","unstructured":"Wijmans E, Kadian A, Morcos AS, Lee S, Essa I, Parikh D, Savva M, Batra D (2019) DD-PPO: Learning near-perfect pointgoal navigators from 2.5 billion frames. In: ICLR"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-024-06115-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-024-06115-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-024-06115-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,30]],"date-time":"2025-01-30T16:03:36Z","timestamp":1738253016000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-024-06115-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,23]]},"references-count":59,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2025,2]]}},"alternative-id":["6115"],"URL":"https:\/\/doi.org\/10.1007\/s10489-024-06115-4","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"value":"0924-669X","type":"print"},{"value":"1573-7497","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12,23]]},"assertion":[{"value":"23 November 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 December 2024","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Statements and Declarations"}},{"value":"The authors have no relevant financial or non-financial interests to disclose.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflicts of Interest"}},{"value":"This research is already publicly available on arXiv () as a pre-print.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Publication Status"}}],"article-number":"206"}}