{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,19]],"date-time":"2026-08-19T20:15:18Z","timestamp":1787170518237,"version":"build-2736575974"},"reference-count":21,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2023,5,24]],"date-time":"2023-05-24T00:00:00Z","timestamp":1684886400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,5,24]],"date-time":"2023-05-24T00:00:00Z","timestamp":1684886400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Real-Time Image Proc"],"published-print":{"date-parts":[[2023,8]]},"DOI":"10.1007\/s11554-023-01318-3","type":"journal-article","created":{"date-parts":[[2023,5,24]],"date-time":"2023-05-24T01:02:40Z","timestamp":1684890160000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":9,"title":["Language meets YOLOv8 for metric monocular SLAM"],"prefix":"10.1007","volume":"20","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8914-1904","authenticated-orcid":false,"given":"Jose","family":"Martinez-Carranza","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2133-8716","authenticated-orcid":false,"given":"Delia Iraz\u00fa","family":"Hern\u00e1ndez-Far\u00edas","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9440-9944","authenticated-orcid":false,"given":"L. Oyuki","family":"Rojas-Perez","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9998-7444","authenticated-orcid":false,"given":"Aldrich A.","family":"Cabrera-Ponce","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2023,5,24]]},"reference":[{"key":"1318_CR1","unstructured":"2086341682@qq.com: coco128 dataset. (2021).https:\/\/universe.roboflow.com\/2086341682-qq-com\/coco128-xilzt Visited on 2023-03-15"},{"key":"1318_CR2","doi-asserted-by":"crossref","unstructured":"Anderson P, Wu Q, Teney D, Bruce J, Johnson M, S\u00fcnderhauf N, Reid ID, Gould S, van\u00a0den Hengel A (2017) Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments. CoRR arXiv:abs\/1711.07280. Accessed 15 Mar 2023","DOI":"10.1109\/CVPR.2018.00387"},{"key":"1318_CR3","doi-asserted-by":"publisher","first-page":"698","DOI":"10.1109\/TPAMI.1987.4767965","volume":"5","author":"KS Arun","year":"1987","unstructured":"Arun, K.S., Huang, T.S., Blostein, S.D.: Least-squares fitting of two 3-d point sets. IEEE Trans. Pattern Anal. Mach. Intell. 5, 698\u2013700 (1987)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1318_CR4","unstructured":"Auty D, Mikolajczyk K (2022) ObjCAViT: Improving Monocular Depth Estimation Using Natural Language Models And Image-Object Cross-Attention. 10.48550\/ARXIV.2211.17232. arXiv:2211.17232. Accessed 15 Mar 2023"},{"key":"1318_CR5","unstructured":"Chan W, Park D, Lee C, Zhang Y, Le Q (2021) Norouzi, M.: Speechstew: Simply mix all available speech recognition data to train one large neural network. arXiv preprint arXiv:2104.02133. Accessed 15 Mar 2023"},{"issue":"6","key":"1318_CR6","doi-asserted-by":"publisher","first-page":"1052","DOI":"10.1109\/TPAMI.2007.1049","volume":"29","author":"AJ Davison","year":"2007","unstructured":"Davison, A.J., Reid, I.D., Molton, N.D., Stasse, O.: MonoSLAM: real-time single camera SLAM. IEEE Trans. Pattern Anal. Mach. Intell. 29(6), 1052\u20131067 (2007)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1318_CR7","unstructured":"Driess D, Xia F, Sajjadi MSM, Lynch C, Chowdhery A, Ichter B, Wahid A, Tompson J, Vuong Q, Yu T, Huang W, Chebotar Y, Sermanet P, Duckworth D, Levine S, Vanhoucke V, Hausman K, Toussaint M, Greff K, Zeng A, Mordatch I, Florence P (2023) PaLM-E: An Embodied Multimodal Language Model. In: arXiv preprint arXiv:2303.03378. Accessed 15 Mar 2023"},{"key":"1318_CR8","unstructured":"Gadre SY, Wortsman M, Ilharco G, Schmidt L, Song S (2022) CLIP on Wheels: Zero-Shot Object Navigation as Object Localization and Exploration. arXiv:abs\/2203.10421. Accessed 15 Mar 2023"},{"key":"1318_CR9","doi-asserted-by":"publisher","unstructured":"Gu J, Stefani E, Wu Q, Thomason J, Wang X (2022) Vision-and-language navigation: A survey of tasks, methods, and future directions. In: Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 7606\u20137623. Association for Computational Linguistics, Dublin, Ireland. https:\/\/doi.org\/10.18653\/v1\/2022.acl-long.524. https:\/\/aclanthology.org\/2022.acl-long.524. Accessed 15 Mar 2023","DOI":"10.18653\/v1\/2022.acl-long.524"},{"key":"1318_CR10","doi-asserted-by":"crossref","unstructured":"Huang C, Mees O, Zeng A, Burgard W (2022) Visual language maps for robot navigation. arXiv preprint arXiv:2210.05714. Accessed 15 Mar 2023","DOI":"10.1109\/ICRA48891.2023.10160969"},{"key":"1318_CR11","unstructured":"Jia C, Yang Y, Xia Y, Chen Y, Parekh Z, Pham H, Le QV, Sung Y, Li Z, Duerig T (2021) Scaling up visual and vision-language representation learning with noisy text supervision. CoRR arXiv:abs\/2102.05918"},{"key":"1318_CR12","doi-asserted-by":"publisher","first-page":"740","DOI":"10.1007\/978-3-319-10602-1_48","volume-title":"Computer Vision-ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6\u201312, 2014, Proceedings, Part V 13","author":"TY Lin","year":"2014","unstructured":"Lin, T.Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., Zitnick, C.L.: Microsoft COCO: Common Objects in COntext. In: Computer Vision-ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6\u201312, 2014, Proceedings, Part V 13, pp. 740\u2013755. Springer, New York (2014)"},{"issue":"2","key":"1318_CR13","doi-asserted-by":"publisher","first-page":"404","DOI":"10.1109\/LRA.2016.2633290","volume":"2","author":"G Loianno","year":"2016","unstructured":"Loianno, G., Brunner, C., McGrath, G., Kumar, V.: Estimation, control, and planning for aggressive flight with a small quadrotor with a single camera and IMU. IEEE Robot Autom Lett 2(2), 404\u2013411 (2016)","journal-title":"IEEE Robot Autom Lett"},{"issue":"35","key":"1318_CR14","doi-asserted-by":"publisher","first-page":"eaaw9710","DOI":"10.1126\/scirobotics.aaw9710","volume":"4","author":"K McGuire","year":"2019","unstructured":"McGuire, K., De Wagter, C., Tuyls, K., Kappen, H., de Croon, G.C.: Minimal navigation solution for a swarm of tiny flying robots to explore an unknown environment. Sci. Robot. 4(35), eaaw9710 (2019)","journal-title":"Sci. Robot."},{"issue":"5","key":"1318_CR15","doi-asserted-by":"publisher","first-page":"1147","DOI":"10.1109\/TRO.2015.2463671","volume":"31","author":"R Mur-Artal","year":"2015","unstructured":"Mur-Artal, R., Montiel, J.M.M., Tardos, J.D.: ORB-SLAM: a versatile and accurate monocular SLAM system. IEEE Trans. Rob. 31(5), 1147\u20131163 (2015)","journal-title":"IEEE Trans. Rob."},{"issue":"16","key":"1318_CR16","doi-asserted-by":"publisher","first-page":"7259","DOI":"10.3390\/app11167259","volume":"11","author":"S Park","year":"2021","unstructured":"Park, S., Bokijonov, S., Choi, Y.: Review of microsoft hololens applications over the past five years. Appl. Sci. 11(16), 7259 (2021)","journal-title":"Appl. Sci."},{"key":"1318_CR17","unstructured":"Radford A, Kim JW, Hallacy C, Ramesh A, Goh G, Agarwal S, Sastry G, Askell A, Mishkin P, Clark J, Krueger G, Sutskever I (2021) Learning Transferable Visual Models From Natural Language Supervision. In: Meila, M., Zhang, T.: (eds.) Proceedings of the 38th International Conference on Machine Learning, Proceedings of Machine Learning Research. PMLR. 139: 8748\u20138763."},{"key":"1318_CR18","doi-asserted-by":"publisher","first-page":"184","DOI":"10.1016\/j.robot.2017.07.011","volume":"96","author":"C Rascon","year":"2017","unstructured":"Rascon, C., Meza, I.: Localization of sound sources in robotics: a review. Robot. Auton. Syst. 96, 184\u2013210 (2017)","journal-title":"Robot. Auton. Syst."},{"key":"1318_CR19","doi-asserted-by":"crossref","unstructured":"Redmon J, Divvala S, Girshick R, Farhadi A (2016) You only look once: unified, real-time object detection. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp 779\u2013788","DOI":"10.1109\/CVPR.2016.91"},{"key":"1318_CR20","unstructured":"Ultralytics: YOLOv8 object detection. https:\/\/ultralytics.com\/yolov8 (2021). Accessed 14 Mar 2023"},{"key":"1318_CR21","doi-asserted-by":"crossref","unstructured":"Zhang R, Zeng Z, Guo Z, Li Y (2022) Can language understand depth? In: Proceedings of the 30th ACM International Conference on Multimedia MM \u201922. Association for Computing Machinery, New York. pp 6868-6874","DOI":"10.1145\/3503161.3549201"}],"container-title":["Journal of Real-Time Image Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11554-023-01318-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11554-023-01318-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11554-023-01318-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,7,24]],"date-time":"2023-07-24T15:20:06Z","timestamp":1690212006000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11554-023-01318-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,5,24]]},"references-count":21,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2023,8]]}},"alternative-id":["1318"],"URL":"https:\/\/doi.org\/10.1007\/s11554-023-01318-3","relation":{},"ISSN":["1861-8200","1861-8219"],"issn-type":[{"value":"1861-8200","type":"print"},{"value":"1861-8219","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,5,24]]},"assertion":[{"value":"21 April 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"11 May 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 May 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"59"}}