{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T02:40:14Z","timestamp":1784601614978,"version":"3.55.0"},"reference-count":46,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/100012905","name":"Department of Science and Technology of Shandong Province","doi-asserted-by":"publisher","award":["YDZX2025124"],"award-info":[{"award-number":["YDZX2025124"]}],"id":[{"id":"10.13039\/100012905","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002367","name":"Chinese Academy of Sciences","doi-asserted-by":"publisher","award":["XDA0450000"],"award-info":[{"award-number":["XDA0450000"]}],"id":[{"id":"10.13039\/501100002367","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002367","name":"Chinese Academy of Sciences","doi-asserted-by":"publisher","award":["XDA0450202"],"award-info":[{"award-number":["XDA0450202"]}],"id":[{"id":"10.13039\/501100002367","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.patcog.2026.113836","type":"journal-article","created":{"date-parts":[[2026,4,24]],"date-time":"2026-04-24T15:42:04Z","timestamp":1777045324000},"page":"113836","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":1,"special_numbering":"PC","title":["Segment and pick any fruit: Text-prompted robotic harvesting"],"prefix":"10.1016","volume":"179","author":[{"given":"Zhaoxin","family":"Fan","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaotong","family":"Su","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4601-4996","authenticated-orcid":false,"given":"Yanfeng","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuan","family":"Fang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zeyu","family":"Gao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jungui","family":"Feng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuanzhe","family":"Hu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113836_b1","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2023.110140","article-title":"CS-net: Conv-simpleformer network for agricultural image segmentation","volume":"147","author":"Liu","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113836_b2","article-title":"Learn from foundation model: Fruit detection model without manual annotation","author":"Wang","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113836_b3","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.112628","article-title":"LigTomDet: Knowledge distillation in a new lightweight tomato disease detection model in planting fields","volume":"172","author":"Sun","year":"2026","journal-title":"Pattern Recognit."},{"issue":"2","key":"10.1016\/j.patcog.2026.113836_b4","doi-asserted-by":"crossref","first-page":"140","DOI":"10.1016\/j.compag.2011.07.001","article-title":"Green citrus detection using \u2018eigenfruit\u2019, color and circular gabor texture features under natural outdoor conditions","volume":"78","author":"Kurtulmus","year":"2011","journal-title":"Comput. Electron. Agric."},{"key":"10.1016\/j.patcog.2026.113836_b5","article-title":"A machine vision algorithm combining adaptive segmentation and shape analysis for orange fruit detection","author":"Hannan","year":"2009","journal-title":"Agric. Eng. Int.: CIGR J."},{"issue":"7","key":"10.1016\/j.patcog.2026.113836_b6","doi-asserted-by":"crossref","first-page":"6989","DOI":"10.1109\/TITS.2023.3264573","article-title":"A cross-scale and illumination invariance-based model for robust object detection in traffic surveillance scenarios","volume":"24","author":"Lu","year":"2023","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"key":"10.1016\/j.patcog.2026.113836_b7","doi-asserted-by":"crossref","first-page":"70","DOI":"10.1016\/j.neucom.2022.09.117","article-title":"Cross stage partial connections based weighted bi-directional feature pyramid and enhanced spatial transformation network for robust object detection","volume":"513","author":"Lu","year":"2022","journal-title":"Neurocomputing"},{"key":"10.1016\/j.patcog.2026.113836_b8","doi-asserted-by":"crossref","DOI":"10.1016\/j.compag.2025.110192","article-title":"YOLOR-stem: Gaussian rotating bounding boxes and probability similarity measure for enhanced tomato main stem detection","volume":"233","author":"Gao","year":"2025","journal-title":"Comput. Electron. Agric."},{"key":"10.1016\/j.patcog.2026.113836_b9","doi-asserted-by":"crossref","DOI":"10.1016\/j.compag.2024.108620","article-title":"Occlusion-aware fruit segmentation in complex natural environments under shape prior","volume":"217","author":"Liang","year":"2024","journal-title":"Comput. Electron. Agric."},{"key":"10.1016\/j.patcog.2026.113836_b10","doi-asserted-by":"crossref","DOI":"10.1016\/j.compag.2025.111183","article-title":"Instance segmentation and spatial positioning of waxberries in complex environments","volume":"240","author":"Chen","year":"2026","journal-title":"Comput. Electron. Agric."},{"key":"10.1016\/j.patcog.2026.113836_b11","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.patcog.2026.113836_b12","doi-asserted-by":"crossref","unstructured":"Timo L\u00fcddecke, Alexander Ecker, Image segmentation using text and image prompts, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 7086\u20137096.","DOI":"10.1109\/CVPR52688.2022.00695"},{"key":"10.1016\/j.patcog.2026.113836_b13","doi-asserted-by":"crossref","unstructured":"Jian Ding, Nan Xue, Gui-Song Xia, Dengxin Dai, Decoupling zero-shot semantic segmentation, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 11583\u201311592.","DOI":"10.1109\/CVPR52688.2022.01129"},{"key":"10.1016\/j.patcog.2026.113836_b14","series-title":"European Conference on Computer Vision","first-page":"540","article-title":"Scaling open-vocabulary image segmentation with image-level labels","author":"Ghiasi","year":"2022"},{"key":"10.1016\/j.patcog.2026.113836_b15","doi-asserted-by":"crossref","unstructured":"Xueyan Zou, Zi-Yi Dou, Jianwei Yang, Zhe Gan, Linjie Li, Chunyuan Li, Xiyang Dai, Harkirat Behl, Jianfeng Wang, Lu Yuan, et al., Generalized decoding for pixel, image, and language, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 15116\u201315127.","DOI":"10.1109\/CVPR52729.2023.01451"},{"key":"10.1016\/j.patcog.2026.113836_b16","article-title":"A machine vision system for the apple harvesting robot","author":"Bulanon","year":"2001","journal-title":"Agric. Eng. Int.: CIGR J."},{"issue":"10","key":"10.1016\/j.patcog.2026.113836_b17","first-page":"1144","article-title":"Recognition and localization of ripen tomato based on machine vision","volume":"5","author":"Arefi","year":"2011","journal-title":"Aust. J. Crop. Sci."},{"key":"10.1016\/j.patcog.2026.113836_b18","doi-asserted-by":"crossref","unstructured":"Joseph Redmon, Santosh Divvala, Ross Girshick, Ali Farhadi, You only look once: Unified, real-time object detection, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2016, pp. 779\u2013788.","DOI":"10.1109\/CVPR.2016.91"},{"key":"10.1016\/j.patcog.2026.113836_b19","series-title":"European Conference on Computer Vision","first-page":"21","article-title":"Ssd: Single shot multibox detector","author":"Liu","year":"2016"},{"key":"10.1016\/j.patcog.2026.113836_b20","unstructured":"Kaiming He, Georgia Gkioxari, Piotr Doll\u00e1r, Ross Girshick, Mask r-cnn, in: Proceedings of the IEEE International Conference on Computer Vision, 2017, pp. 2961\u20132969."},{"key":"10.1016\/j.patcog.2026.113836_b21","doi-asserted-by":"crossref","DOI":"10.1016\/j.compag.2020.105302","article-title":"Fruit detection, segmentation and 3D visualisation of environments in apple orchards","volume":"171","author":"Kang","year":"2020","journal-title":"Comput. Electron. Agric."},{"key":"10.1016\/j.patcog.2026.113836_b22","doi-asserted-by":"crossref","first-page":"9102","DOI":"10.1109\/ACCESS.2020.2964608","article-title":"Real-time apple detection system using embedded systems with hardware accelerators: An edge AI application","volume":"8","author":"Mazzia","year":"2020","journal-title":"IEEE Access"},{"issue":"6","key":"10.1016\/j.patcog.2026.113836_b23","doi-asserted-by":"crossref","first-page":"1107","DOI":"10.1007\/s11119-019-09642-0","article-title":"Deep learning for real-time fruit detection and orchard fruit load estimation: Benchmarking of \u2018mangoyolo\u2019","volume":"20","author":"Koirala","year":"2019","journal-title":"Precis. Agric."},{"key":"10.1016\/j.patcog.2026.113836_b24","series-title":"European Conference on Computer Vision","first-page":"1","article-title":"Textonboost: Joint appearance, shape and context modeling for multi-class object recognition and segmentation","author":"Shotton","year":"2006"},{"issue":"5","key":"10.1016\/j.patcog.2026.113836_b25","doi-asserted-by":"crossref","first-page":"898","DOI":"10.1109\/TPAMI.2010.161","article-title":"Contour detection and hierarchical image segmentation","volume":"33","author":"Arbelaez","year":"2010","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113836_b26","doi-asserted-by":"crossref","unstructured":"Ning Xu, Brian Price, Scott Cohen, Jimei Yang, Thomas S Huang, Deep interactive object selection, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2016, pp. 373\u2013381.","DOI":"10.1109\/CVPR.2016.47"},{"key":"10.1016\/j.patcog.2026.113836_b27","doi-asserted-by":"crossref","unstructured":"Alexander Kirillov, Kaiming He, Ross Girshick, Carsten Rother, Piotr Doll\u00e1r, Panoptic segmentation, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2019, pp. 9404\u20139413.","DOI":"10.1109\/CVPR.2019.00963"},{"key":"10.1016\/j.patcog.2026.113836_b28","doi-asserted-by":"crossref","unstructured":"Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C Berg, Wan-Yen Lo, et al., Segment anything, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2023, pp. 4015\u20134026.","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"10.1016\/j.patcog.2026.113836_b29","series-title":"Sam 2: Segment anything in images and videos","author":"Ravi","year":"2024"},{"key":"10.1016\/j.patcog.2026.113836_b30","series-title":"International Conference on Machine Learning","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","author":"Jia","year":"2021"},{"key":"10.1016\/j.patcog.2026.113836_b31","series-title":"Language-driven semantic segmentation","author":"Li","year":"2022"},{"key":"10.1016\/j.patcog.2026.113836_b32","doi-asserted-by":"crossref","unstructured":"Feng Liang, Bichen Wu, Xiaoliang Dai, Kunpeng Li, Yinan Zhao, Hang Zhang, Peizhao Zhang, Peter Vajda, Diana Marculescu, Open-vocabulary semantic segmentation with mask-adapted clip, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 7061\u20137070.","DOI":"10.1109\/CVPR52729.2023.00682"},{"key":"10.1016\/j.patcog.2026.113836_b33","series-title":"Grounded sam: Assembling open-world models for diverse visual tasks","author":"Ren","year":"2024"},{"key":"10.1016\/j.patcog.2026.113836_b34","doi-asserted-by":"crossref","first-page":"19769","DOI":"10.52202\/075280-0868","article-title":"Segment everything everywhere all at once","volume":"36","author":"Zou","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"1","key":"10.1016\/j.patcog.2026.113836_b35","doi-asserted-by":"crossref","first-page":"22885","DOI":"10.1038\/s41598-023-50129-w","article-title":"Tomato maturity recognition with convolutional transformers","volume":"13","author":"Khan","year":"2023","journal-title":"Sci. Rep."},{"key":"10.1016\/j.patcog.2026.113836_b36","doi-asserted-by":"crossref","DOI":"10.1016\/j.compag.2020.105736","article-title":"A fast and accurate deep learning method for strawberry instance segmentation","volume":"178","author":"P\u00e9rez-Borrero","year":"2020","journal-title":"Comput. Electron. Agric."},{"key":"10.1016\/j.patcog.2026.113836_b37","doi-asserted-by":"crossref","unstructured":"Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun, Deep residual learning for image recognition, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2016, pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"10.1016\/j.patcog.2026.113836_b38","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113836_b39","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"234","article-title":"U-net: Convolutional networks for biomedical image segmentation","author":"Ronneberger","year":"2015"},{"key":"10.1016\/j.patcog.2026.113836_b40","series-title":"Rethinking atrous convolution for semantic image segmentation. arxiv 2017","first-page":"1","author":"Chen","year":"2019"},{"key":"10.1016\/j.patcog.2026.113836_b41","unstructured":"Hengshuang Zhao, Jianping Shi, Xiaojuan Qi, Xiaogang Wang, Jiaya Jia, Pyramid scene parsing network, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2017, pp. 2881\u20132890."},{"key":"10.1016\/j.patcog.2026.113836_b42","doi-asserted-by":"crossref","unstructured":"Bowen Cheng, Ishan Misra, Alexander G. Schwing, Alexander Kirillov, Rohit Girdhar, Masked-attention mask transformer for universal image segmentation, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 1290\u20131299.","DOI":"10.1109\/CVPR52688.2022.00135"},{"key":"10.1016\/j.patcog.2026.113836_b43","first-page":"12077","article-title":"SegFormer: Simple and efficient design for semantic segmentation with transformers","volume":"34","author":"Xie","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113836_b44","doi-asserted-by":"crossref","unstructured":"Xin Lai, Zhuotao Tian, Yukang Chen, Yanwei Li, Yuhui Yuan, Shu Liu, Jiaya Jia, Lisa: Reasoning segmentation via large language model, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 9579\u20139589.","DOI":"10.1109\/CVPR52733.2024.00915"},{"key":"10.1016\/j.patcog.2026.113836_b45","series-title":"Language segment-anything","author":"Medeiros","year":"2025"},{"issue":"5","key":"10.1016\/j.patcog.2026.113836_b46","doi-asserted-by":"crossref","first-page":"3929","DOI":"10.1109\/TRO.2023.3281153","article-title":"Anygrasp: Robust and efficient grasp perception in spatial and temporal domains","volume":"39","author":"Fang","year":"2023","journal-title":"IEEE Trans. Robot."}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326008010?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326008010?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T08:23:52Z","timestamp":1784276632000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326008010"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":46,"alternative-id":["S0031320326008010"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113836","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Segment and pick any fruit: Text-prompted robotic harvesting","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113836","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"113836"}}