{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,13]],"date-time":"2026-07-13T20:09:09Z","timestamp":1783973349186,"version":"3.55.0"},"reference-count":62,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,27]],"date-time":"2026-06-27T00:00:00Z","timestamp":1782518400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"funder":[{"DOI":"10.13039\/100005825","name":"USDA NIFA","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100005825","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Computers and Electronics in Agriculture"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.compag.2026.112058","type":"journal-article","created":{"date-parts":[[2026,6,27]],"date-time":"2026-06-27T10:26:58Z","timestamp":1782556018000},"page":"112058","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Visual-language-guided task planning for horticultural robots"],"prefix":"10.1016","volume":"252","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7281-9109","authenticated-orcid":false,"given":"Jose","family":"Cuaran","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kendall","family":"Koe","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Aditya","family":"Potnis","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Naveen K.","family":"Uppalapati","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Girish","family":"Chowdhary","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.compag.2026.112058_b1","series-title":"Do as I can, not as I say: Grounding language in robotic affordances","author":"Ahn","year":"2022"},{"key":"10.1016\/j.compag.2026.112058_b2","series-title":"2025 IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"5687","article-title":"Agrogpt: Efficient agricultural vision-language model with expert tuning","author":"Awais","year":"2025"},{"key":"10.1016\/j.compag.2026.112058_b3","series-title":"Objectnav revisited: On evaluation of embodied agents navigating to objects","author":"Batra","year":"2020"},{"key":"10.1016\/j.compag.2026.112058_b4","series-title":"A vision-language-action flow model for general robot control","author":"Black","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b5","series-title":"Rt-1: Robotics transformer for real-world control at scale","author":"Brohan","year":"2022"},{"key":"10.1016\/j.compag.2026.112058_b6","series-title":"Mapgpt: Map-guided prompting with adaptive path planning for vision-and-language navigation","author":"Chen","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b7","doi-asserted-by":"crossref","unstructured":"Cheng, A.C., Ji, Y., Yang, Z., Zou, X., Kautz, J., Biyik, E., Yin, H., Liu, S., Wang, X., 2025. Navila: Legged robot vision-language-action model for navigation. In: RSS.","DOI":"10.15607\/RSS.2025.XXI.018"},{"key":"10.1016\/j.compag.2026.112058_b8","series-title":"Mobility vla: Multimodal instruction navigation with long-context vlms and topological graphs","author":"Chiang","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b9","first-page":"3","article-title":"Reducing the barrier to entry of complex robotic software: a moveit! case study","volume":"5","author":"Coleman","year":"2014","journal-title":"J. Softw. Eng. Robot."},{"key":"10.1016\/j.compag.2026.112058_b10","series-title":"2025 IEEE International Conference on Robotics and Automation","first-page":"12716","article-title":"Active semantic mapping with mobile manipulator in horticultural environments","author":"Cuaran","year":"2025"},{"key":"10.1016\/j.compag.2026.112058_b11","series-title":"Robot navigation using physically grounded vision-language models in outdoor environments","author":"Elnoor","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b12","series-title":"2025 IEEE International Conference on Robotics and Automation","first-page":"2391","article-title":"Vlm-gronav: Robot navigation using physically grounded vision-language models in outdoor environments","author":"Elnoor","year":"2025"},{"key":"10.1016\/j.compag.2026.112058_b13","doi-asserted-by":"crossref","first-page":"189","DOI":"10.1016\/0004-3702(71)90010-5","article-title":"Strips: A new approach to the application of theorem proving to problem solving","volume":"2","author":"Fikes","year":"1971","journal-title":"Artificial Intelligence"},{"key":"10.1016\/j.compag.2026.112058_b14","series-title":"2024 IEEE International Conference on Robotics and Automation","first-page":"15847","article-title":"Autonomous apple fruitlet sizing with next best view planning","author":"Freeman","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b15","doi-asserted-by":"crossref","DOI":"10.1155\/2024\/2126734","article-title":"Application of precision agriculture technologies for sustainable crop production and environmental sustainability: A systematic review","volume":"2024","author":"Getahun","year":"2024","journal-title":"Sci. World J."},{"key":"10.1016\/j.compag.2026.112058_b16","series-title":"Enter the mind palace: Reasoning and planning for long-term active embodied question answering","author":"Ginting","year":"2025"},{"key":"10.1016\/j.compag.2026.112058_b17","unstructured":"Goetting, D., Singh, H.G., Loquercio, A., 2024. End-to-end navigation with vlms: Transforming spatial reasoning into question-answering. In: Workshop on Language and Robot Learning: Language as an Interface."},{"key":"10.1016\/j.compag.2026.112058_b18","series-title":"Overconfidence is key: Verbalized uncertainty evaluation in large language and vision-language models","author":"Groot","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b19","series-title":"Zest: an llm-based zero-shot traversability navigation for unknown environments","author":"Gummadi","year":"2025"},{"key":"10.1016\/j.compag.2026.112058_b20","article-title":"Multimodal language models in agriculture: A tutorial and survey","author":"Haghighat","year":"2025","journal-title":"Authorea Prepr."},{"key":"10.1016\/j.compag.2026.112058_b21","series-title":"move_base","author":"Hershberger","year":"2020"},{"key":"10.1016\/j.compag.2026.112058_b22","doi-asserted-by":"crossref","first-page":"189","DOI":"10.1007\/s10514-012-9321-0","article-title":"Octomap: An efficient probabilistic 3d mapping framework based on octrees","volume":"34","author":"Hornung","year":"2013","journal-title":"Auton. Robots"},{"key":"10.1016\/j.compag.2026.112058_b23","series-title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning","author":"Hu","year":"2023"},{"key":"10.1016\/j.compag.2026.112058_b24","series-title":"International Conference on Machine Learning","first-page":"9118","article-title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","author":"Huang","year":"2022"},{"key":"10.1016\/j.compag.2026.112058_b25","series-title":"Visual language maps for robot navigation","author":"Huang","year":"2022"},{"key":"10.1016\/j.compag.2026.112058_b26","series-title":"Inner monologue: Embodied reasoning through planning with language models","author":"Huang","year":"2022"},{"key":"10.1016\/j.compag.2026.112058_b27","series-title":"Roboexp: Action-conditioned scene graph via interactive exploration for robotic manipulation","author":"Jiang","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b28","series-title":"2011 IEEE International Conference on Robotics and Automation","first-page":"1470","article-title":"Hierarchical task and motion planning in the now","author":"Kaelbling","year":"2011"},{"key":"10.1016\/j.compag.2026.112058_b29","series-title":"High Tunnel Tomatoes","author":"Kaiser","year":"2012"},{"key":"10.1016\/j.compag.2026.112058_b30","series-title":"Openvla: An open-source vision-language-action model","author":"Kim","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b31","series-title":"Experience is the best teacher: Grounding vlms for robotics through self-generated memory","author":"Lan","year":"2025"},{"key":"10.1016\/j.compag.2026.112058_b32","series-title":"2019 IEEE\/RSJ International Conference on Intelligent Robots and Systems","first-page":"3890","article-title":"3D move to see: Multi-perspective visual servoing towards the next best view within unstructured and occluded environments","author":"Lehnert","year":"2019"},{"key":"10.1016\/j.compag.2026.112058_b33","series-title":"Code as policies: Language model programs for embodied control","author":"Liang","year":"2022"},{"key":"10.1016\/j.compag.2026.112058_b34","doi-asserted-by":"crossref","unstructured":"Majumdar, A., Ajay, A., Zhang, X., Putta, P., Yenamandra, S., Henaff, M., Silwal, S., Mcvay, P., Maksymets, O., Arnaud, S., et al., 2024. Openeqa: Embodied question answering in the era of foundation models. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 16488\u201316498.","DOI":"10.1109\/CVPR52733.2024.01560"},{"key":"10.1016\/j.compag.2026.112058_b35","series-title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","author":"Nasiriany","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b36","series-title":"Agriclip: Adapting clip for agriculture and livestock via domain-specialized cross-model alignment","author":"Nawaz","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b37","series-title":"2023 IEEE\/RSJ International Conference on Intelligent Robots and Systems","first-page":"4226","article-title":"Panoptic mapping with fruit completion and pose estimation for horticultural robots","author":"Pan","year":"2023"},{"key":"10.1016\/j.compag.2026.112058_b38","series-title":"A vision-language foundation model for leaf disease identification","author":"Quoc","year":"2025"},{"key":"10.1016\/j.compag.2026.112058_b39","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.compag.2026.112058_b40","series-title":"2024 IEEE International Conference on Robotics and Automation","first-page":"14070","article-title":"Cape: Corrective actions from precondition errors using large language models","author":"Raman","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b41","series-title":"2024 IEEE\/RSJ International Conference on Intelligent Robots and Systems","first-page":"13837","article-title":"Convoi: Context-aware navigation using vision language models in outdoor and indoor environments","author":"Sathyamoorthy","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b42","series-title":"Conference on Robot Learning","first-page":"492","article-title":"Lm-nav: Robotic navigation with large pre-trained models of language, vision, and action","author":"Shah","year":"2023"},{"key":"10.1016\/j.compag.2026.112058_b43","series-title":"Agrobench: Vision-language model benchmark in agriculture","author":"Shinoda","year":"2025"},{"key":"10.1016\/j.compag.2026.112058_b44","doi-asserted-by":"crossref","first-page":"508","DOI":"10.1109\/LRA.2024.3511409","article-title":"Vlm-social-nav: Socially aware robot navigation through scoring using vision-language models","volume":"10","author":"Song","year":"2024","journal-title":"IEEE Robot. Autom. Lett."},{"key":"10.1016\/j.compag.2026.112058_b45","doi-asserted-by":"crossref","first-page":"9","DOI":"10.3390\/robotics14020009","article-title":"Agricultural robotics: A technical review addressing challenges in sustainable crop production","volume":"14","author":"Spagnuolo","year":"2025","journal-title":"Robotics"},{"key":"10.1016\/j.compag.2026.112058_b46","series-title":"Automatic behavior tree expansion with llms for robotic manipulation","author":"Styrud","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b47","doi-asserted-by":"crossref","first-page":"339","DOI":"10.21273\/HORTTECH.13.2.0339","article-title":"Yields and economics of high tunnels for production of warm-season vegetable crops","volume":"13","author":"Waterer","year":"2003","journal-title":"HortTechnology"},{"key":"10.1016\/j.compag.2026.112058_b48","series-title":"2025 IEEE International Conference on Robotics and Automation","first-page":"7044","article-title":"Behav: Behavioral rule guided autonomy using vlms for robot navigation in outdoor scenes","author":"Weerakoon","year":"2025"},{"key":"10.1016\/j.compag.2026.112058_b49","doi-asserted-by":"crossref","unstructured":"Werby, A., Huang, C., B\u00fcchner, M., Valada, A., Burgard, W., 2024. Hierarchical open-vocabulary 3d scene graphs for language-grounded robot navigation. In: First Workshop on Vision-Language Models for Navigation and Manipulation at ICRA 2024.","DOI":"10.15607\/RSS.2024.XX.077"},{"key":"10.1016\/j.compag.2026.112058_b50","doi-asserted-by":"crossref","unstructured":"Wolfe, J., Marthi, B., Russell, S., 2010. Combined task and motion planning for mobile manipulation. In: Proceedings of the International Conference on Automated Planning and Scheduling. pp. 254\u2013257.","DOI":"10.1609\/icaps.v20i1.13436"},{"key":"10.1016\/j.compag.2026.112058_b51","series-title":"Voronav: Voronoi-based zero-shot object navigation with large language model","author":"Wu","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b52","doi-asserted-by":"crossref","first-page":"8350","DOI":"10.3390\/app14188350","article-title":"A framework for agricultural intelligent analysis based on a visual language large model","volume":"14","author":"Yu","year":"2024","journal-title":"Appl. Sci."},{"key":"10.1016\/j.compag.2026.112058_b53","series-title":"2021 IEEE\/RSJ International Conference on Intelligent Robots and Systems","first-page":"3271","article-title":"Viewpoint planning for fruit size and position estimation","author":"Zaenker","year":"2021"},{"key":"10.1016\/j.compag.2026.112058_b54","series-title":"ICINCO 2022-19th International Conference on Informatics in Control, Automation and Robotics","first-page":"476","article-title":"Task and motion planning methods: applications and limitations","author":"Zhang","year":"2022"},{"key":"10.1016\/j.compag.2026.112058_b55","doi-asserted-by":"crossref","DOI":"10.1016\/j.compag.2024.109587","article-title":"Visual large language model for wheat disease diagnosis in the wild","volume":"227","author":"Zhang","year":"2024","journal-title":"Comput. Electron. Agric."},{"key":"10.1016\/j.compag.2026.112058_b56","series-title":"Agrivln: Vision-and-language navigation for agricultural robots","author":"Zhao","year":"2025"},{"key":"10.1016\/j.compag.2026.112058_b57","series-title":"Closed-loop open-vocabulary mobile manipulation with gpt-4v","author":"Zhi","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b58","series-title":"Topv-nav: Unlocking the top-view spatial reasoning potential of mllm for zero-shot object navigation","author":"Zhong","year":"2024"},{"key":"10.1016\/j.compag.2026.112058_b59","series-title":"European Conference on Computer Vision","first-page":"350","article-title":"Detecting twenty-thousand classes using image-level supervision","author":"Zhou","year":"2022"},{"key":"10.1016\/j.compag.2026.112058_b60","doi-asserted-by":"crossref","first-page":"6109","DOI":"10.3390\/s24186109","article-title":"Few-shot image classification of crop diseases based on vision\u2013language models","volume":"24","author":"Zhou","year":"2024","journal-title":"Sensors"},{"key":"10.1016\/j.compag.2026.112058_b61","series-title":"Conference on Robot Learning","first-page":"2165","article-title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","author":"Zitkovich","year":"2023"},{"key":"10.1016\/j.compag.2026.112058_b62","series-title":"Leveraging llms for mission planning in precision agriculture","author":"Zuzu\u00e1rregui","year":"2025"}],"container-title":["Computers and Electronics in Agriculture"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0168169926006538?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0168169926006538?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,13]],"date-time":"2026-07-13T19:56:57Z","timestamp":1783972617000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0168169926006538"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":62,"alternative-id":["S0168169926006538"],"URL":"https:\/\/doi.org\/10.1016\/j.compag.2026.112058","relation":{},"ISSN":["0168-1699"],"issn-type":[{"value":"0168-1699","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Visual-language-guided task planning for horticultural robots","name":"articletitle","label":"Article Title"},{"value":"Computers and Electronics in Agriculture","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.compag.2026.112058","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"112058"}}