{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T13:53:50Z","timestamp":1784296430462,"version":"3.55.0"},"reference-count":128,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,2,12]],"date-time":"2026-02-12T00:00:00Z","timestamp":1770854400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100000780","name":"European Commission","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100000780","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100018693","name":"Horizon Europe","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100018693","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Computer Vision and Image Understanding"],"published-print":{"date-parts":[[2026,4]]},"DOI":"10.1016\/j.cviu.2026.104703","type":"journal-article","created":{"date-parts":[[2026,2,21]],"date-time":"2026-02-21T16:15:03Z","timestamp":1771690503000},"page":"104703","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":2,"special_numbering":"C","title":["A survey on class-agnostic counting: Advancements from reference-based to open-world text-guided approaches"],"prefix":"10.1016","volume":"267","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6985-0439","authenticated-orcid":false,"given":"Luca","family":"Ciampi","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-9238-4485","authenticated-orcid":false,"given":"Ali","family":"Azmoudeh","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6077-9683","authenticated-orcid":false,"given":"Elif Ecem","family":"Akbaba","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-0493-6792","authenticated-orcid":false,"given":"Erdi","family":"Sar\u0131ta\u015f","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ziya Ata","family":"Yaz\u0131c\u0131","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haz\u0131m Kemal","family":"Ekenel","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0171-4315","authenticated-orcid":false,"given":"Giuseppe","family":"Amato","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6258-5313","authenticated-orcid":false,"given":"Fabrizio","family":"Falchi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"3","key":"10.1016\/j.cviu.2026.104703_b1","doi-asserted-by":"crossref","first-page":"1105","DOI":"10.1016\/j.ejor.2014.02.054","article-title":"Modeling framework for optimal evacuation of large-scale crowded pedestrian facilities","volume":"237","author":"Abdelghany","year":"2014","journal-title":"European J. Oper. Res."},{"key":"10.1016\/j.cviu.2026.104703_b2","series-title":"Artificial Intelligence and Soft Computing - 18th International Conference, ICAISC 2019, Zakopane, Poland, June 16-20, 2019, Proceedings, Part I","first-page":"3","article-title":"Spikeletfcn: Counting spikelets from infield wheat crop images using fully convolutional networks","volume":"vol. 11508","author":"Alkhudaydi","year":"2019"},{"key":"10.1016\/j.cviu.2026.104703_b3","series-title":"2019 IEEE Symposium on Computers and Communications","first-page":"1","article-title":"Counting vehicles with deep learning in onboard UAV imagery","author":"Amato","year":"2019"},{"key":"10.1016\/j.cviu.2026.104703_b4","unstructured":"Amini-Naieni,\u00a0N., Amini-Naieni,\u00a0K., Han,\u00a0T., Zisserman,\u00a0A., 2023. Open-world Text-specified Object Counting. In: British Machine Vision Conference."},{"key":"10.1016\/j.cviu.2026.104703_b5","series-title":"Computer Vision - ECCV 2016 - 14th European Conference, Amsterdam, the Netherlands, October 11-14, 2016, Proceedings, Part VII","first-page":"483","article-title":"Counting in the wild","volume":"vol. 9911","author":"Arteta","year":"2016"},{"issue":"1","key":"10.1016\/j.cviu.2026.104703_b6","doi-asserted-by":"crossref","first-page":"96","DOI":"10.2307\/3033551","article-title":"The not-so-lonely crowd: Friendship groups in collective behavior","volume":"40","author":"Aveni","year":"1977","journal-title":"Sociometry"},{"key":"10.1016\/j.cviu.2026.104703_b7","series-title":"IEEE Symposium on Computers and Communications","first-page":"1","article-title":"A spatio- temporal attentive network for video-based crowd counting","author":"Avvenuti","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b8","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/j.neucom.2022.08.037","article-title":"A survey on deep learning-based single image crowd counting: Network design, loss function and supervisory signal","volume":"508","author":"Bai","year":"2022","journal-title":"Neurocomputing"},{"key":"10.1016\/j.cviu.2026.104703_b9","series-title":"IEEE International Conference on Imaging Systems and Techniques","first-page":"1","article-title":"Smart counting of unboxed stocks in the warehouse 4.0 ecosystem","author":"Balaska","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b10","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2022.117125","article-title":"An embedded toolset for human activity monitoring in critical environments","volume":"199","author":"Benedetto","year":"2022","journal-title":"Expert Syst. Appl."},{"issue":"3","key":"10.1016\/j.cviu.2026.104703_b11","doi-asserted-by":"crossref","first-page":"351","DOI":"10.1177\/0049124116629166","article-title":"Size matters: Quantifying protest by counting participants","volume":"47","author":"Biggs","year":"2018","journal-title":"Sociol. Methods Res."},{"key":"10.1016\/j.cviu.2026.104703_b12","series-title":"Proceedings of the 2016 ACM Conference on Multimedia Conference","first-page":"640","article-title":"CrowdNet: A deep convolutional network for dense crowd counting","author":"Boominathan","year":"2016"},{"key":"10.1016\/j.cviu.2026.104703_b13","series-title":"Computer Vision - ECCV 2018 - 15th European Conference, Munich, Germany, September 8-14, 2018, Proceedings, Part V","first-page":"757","article-title":"Scale aggregation network for accurate and efficient crowd counting","volume":"vol. 11209","author":"Cao","year":"2018"},{"key":"10.1016\/j.cviu.2026.104703_b14","series-title":"2021 IEEE\/CVF International Conference on Computer Vision","first-page":"9630","article-title":"Emerging properties in self-supervised vision transformers","author":"Caron","year":"2021"},{"issue":"12","key":"10.1016\/j.cviu.2026.104703_b15","doi-asserted-by":"crossref","first-page":"17465","DOI":"10.1109\/TNNLS.2023.3304348","article-title":"Crowd counting based on multiscale spatial guided perception aggregation network","volume":"35","author":"Chen","year":"2024","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.cviu.2026.104703_b16","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2022.102500","article-title":"Learning to count biological structures with raters\u2019 uncertainty","volume":"80","author":"Ciampi","year":"2022","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.cviu.2026.104703_b17","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2022.117929","article-title":"Multi-camera vehicle counting using edge-AI","volume":"207","author":"Ciampi","year":"2022","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.cviu.2026.104703_b18","series-title":"IEEE\/CVF Winter Conference on Applications of Computer Vision, WACV 2025, Tucson, AZ, USA, February 26\u2013March 6, 2025","first-page":"7970","article-title":"Mind the prompt: A novel benchmark for prompt-based class-agnostic counting","author":"Ciampi","year":"2025"},{"key":"10.1016\/j.cviu.2026.104703_b19","series-title":"Proceedings of the 16th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications, VISIGRAPP 2021, Volume 5: VISAPP, Online Streaming, February 8-10, 2021","first-page":"185","article-title":"Domain adaptation for traffic density estimation","author":"Ciampi","year":"2021"},{"key":"10.1016\/j.cviu.2026.104703_b20","series-title":"Night and day instance segmented park (NDISPark) dataset: a collection of images taken by day and by night for vehicle detection, segmentation and counting in parking areas","author":"Ciampi","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b21","doi-asserted-by":"crossref","DOI":"10.1016\/j.ecoinf.2023.102384","article-title":"A deep learning-based pipeline for whitefly pest abundance estimation on chromotropic sticky traps","volume":"78","author":"Ciampi","year":"2023","journal-title":"Ecol. Inform."},{"key":"10.1016\/j.cviu.2026.104703_b22","series-title":"Pest sticky traps: a dataset for whitefly pest population density estimation in chromotropic sticky traps","author":"Ciampi","year":"2023"},{"key":"10.1016\/j.cviu.2026.104703_b23","series-title":"2017 IEEE International Conference on Computer Vision Workshops","first-page":"18","article-title":"Count-ception: Counting by fully convolutional redundant counting","author":"Cohen","year":"2017"},{"key":"10.1016\/j.cviu.2026.104703_b24","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"16985","article-title":"Referring expression counting","author":"Dai","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b25","series-title":"IEEE International Conference on Computer Vision","first-page":"764","article-title":"Deformable convolutional networks","author":"Dai","year":"2017"},{"key":"10.1016\/j.cviu.2026.104703_b26","doi-asserted-by":"crossref","first-page":"64460","DOI":"10.1109\/ACCESS.2019.2914254","article-title":"Video-based vehicle counting framework","volume":"7","author":"Dai","year":"2019","journal-title":"IEEE Access"},{"key":"10.1016\/j.cviu.2026.104703_b27","series-title":"Counting objects in images using DeepLearning: Methods and current challenges","author":"D\u2019Alessandro","year":"2023"},{"key":"10.1016\/j.cviu.2026.104703_b28","series-title":"Computer Vision - ECCV 2024 - 18th European Conference, Milan, Italy, September 29-October 4, 2024, Proceedings, Part IV","first-page":"75","article-title":"AFreeCA: Annotation-free counting for all","volume":"vol. 15062","author":"D\u2019Alessandro","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b29","series-title":"Encyclopedia of Sciences and Religions","first-page":"422","article-title":"Collective behavior","author":"Del\u00a0Re","year":"2013"},{"key":"10.1016\/j.cviu.2026.104703_b30","series-title":"9th International Conference on Learning Representations, ICLR 2021, Virtual Event, Austria, May 3-7, 2021","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2021"},{"key":"10.1016\/j.cviu.2026.104703_b31","series-title":"IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"5431","article-title":"Semantic generative augmentations for few-shot counting","author":"Doubinsky","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b32","doi-asserted-by":"crossref","first-page":"224","DOI":"10.1016\/j.neucom.2021.02.103","article-title":"A survey of crowd counting and density estimation based on convolutional neural network","volume":"472","author":"Fan","year":"2022","journal-title":"Neurocomputing"},{"key":"10.1016\/j.cviu.2026.104703_b33","series-title":"Proceedings of the 34th International Conference on Machine Learning","first-page":"1126","article-title":"Model-agnostic meta-learning for fast adaptation of deep networks","volume":"vol. 70","author":"Finn","year":"2017"},{"key":"10.1016\/j.cviu.2026.104703_b34","series-title":"CNN-based density estimation and crowd counting: A survey","author":"Gao","year":"2020"},{"key":"10.1016\/j.cviu.2026.104703_b35","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110556","article-title":"CSTrans: Correlation-guided self-activation transformer for counting everything","volume":"153","author":"Gao","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.cviu.2026.104703_b36","series-title":"2015 IEEE International Conference on Computer Vision","first-page":"1440","article-title":"Fast R-CNN","author":"Girshick","year":"2015"},{"key":"10.1016\/j.cviu.2026.104703_b37","series-title":"Computer Vision - ECCV 2022 - 17th European Conference, Tel Aviv, Israel, October 23-27, 2022, Proceedings, Part XXXIII","first-page":"388","article-title":"Class-agnostic object counting robust to intraclass diversity","volume":"vol. 13693","author":"Gong","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b38","article-title":"Generative adversarial nets","volume":"vol. 27","author":"Goodfellow","year":"2014"},{"issue":"4","key":"10.1016\/j.cviu.2026.104703_b39","doi-asserted-by":"crossref","first-page":"50","DOI":"10.3390\/bdcc5040050","article-title":"Advances in convolution neural networks based crowd counting and density estimation","volume":"5","author":"Gouiaa","year":"2021","journal-title":"Big Data Cogn. Comput."},{"key":"10.1016\/j.cviu.2026.104703_b40","series-title":"Pattern Recognition and Image Analysis - 7th Iberian Conference, IbPRIA 2015, Santiago de Compostela, Spain, June 17-19, 2015, Proceedings","first-page":"423","article-title":"Extremely overlapping vehicle counting","volume":"vol. 9117","author":"Guerrero-G\u00f3mez-Olmedo","year":"2015"},{"issue":"3","key":"10.1016\/j.cviu.2026.104703_b41","doi-asserted-by":"crossref","first-page":"693","DOI":"10.5755\/j01.itc.52.3.33701","article-title":"A survey on regression-based crowd counting techniques","volume":"52","author":"Hao","year":"2023","journal-title":"Inf. Technol. Control."},{"issue":"14","key":"10.1016\/j.cviu.2026.104703_b42","doi-asserted-by":"crossref","first-page":"5286","DOI":"10.3390\/s22145286","article-title":"Convolutional neural networks and heuristic methods for crowd counting: A systematic review","volume":"22","author":"Hassen","year":"2022","journal-title":"Sensors"},{"key":"10.1016\/j.cviu.2026.104703_b43","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"15979","article-title":"Masked autoencoders are scalable vision learners","author":"He","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b44","series-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"770","article-title":"Deep residual learning for image recognition","author":"He","year":"2016"},{"issue":"3","key":"10.1016\/j.cviu.2026.104703_b45","doi-asserted-by":"crossref","first-page":"583","DOI":"10.1109\/TPAMI.2014.2345390","article-title":"High-speed tracking with kernelized correlation filters","volume":"37","author":"Henriques","year":"2015","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.cviu.2026.104703_b46","series-title":"Learning to count anything: Reference-less class-agnostic counting with weak supervision","author":"Hobley","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b47","series-title":"Computer Vision - ECCV 2024 - 18th European Conference, Milan, Italy, September 29-October 4, 2024, Proceedings, Part XI","first-page":"304","article-title":"ABC easy as 123: A blind counter for exemplar-free multi-class class-agnostic counting","volume":"vol. 15069","author":"Hobley","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b48","series-title":"IEEE Winter Conference on Applications of Computer Vision","first-page":"1280","article-title":"Crowd counting using scale-aware attention networks","author":"Hossain","year":"2019"},{"key":"10.1016\/j.cviu.2026.104703_b49","series-title":"IEEE International Conference on Computer Vision","first-page":"4165","article-title":"Drone-based object counting by Spatially Regularized Regional proposal network","author":"Hsieh","year":"2017"},{"key":"10.1016\/j.cviu.2026.104703_b50","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"17067","article-title":"Point, segment and count: A generalized framework for object counting","author":"Huang","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b51","series-title":"Computer Vision - ECCV 2024 - 18th European Conference, Milan, Italy, September 29-October 4, 2024, Proceedings, Part LXIX","first-page":"1","article-title":"Class-agnostic object counting with text-to-image diffusion model","volume":"vol. 15127","author":"Hui","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b52","series-title":"Computer Vision - ECCV 2018 - 15th European Conference, Munich, Germany, September 8-14, 2018, Proceedings, Part II","first-page":"544","article-title":"Composition loss for counting, density map estimation and localization in dense crowds","volume":"vol. 11206","author":"Idrees","year":"2018"},{"key":"10.1016\/j.cviu.2026.104703_b53","series-title":"Proceedings of the 31st ACM International Conference on Multimedia","first-page":"4535","article-title":"CLIP-count: Towards text-guided zero-shot object counting","author":"Jiang","year":"2023"},{"key":"10.1016\/j.cviu.2026.104703_b54","series-title":"Advances in Computer, Communication and Computational Sciences","first-page":"851","article-title":"A survey on crowd counting methods and datasets","author":"Jingying","year":"2021"},{"key":"10.1016\/j.cviu.2026.104703_b55","series-title":"Thirty-Eighth AAAI Conference on Artificial Intelligence, AAAI 2024, Thirty-Sixth Conference on Innovative Applications of Artificial Intelligence, IAAI 2024, Fourteenth Symposium on Educational Advances in Artificial Intelligence","first-page":"2714","article-title":"VLCounter: Text-aware visual representation for zero-shot object counting","author":"Kang","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b56","doi-asserted-by":"crossref","DOI":"10.1016\/j.imavis.2022.104597","article-title":"Revisiting crowd counting: State-of-the-art, trends, and future perspectives","volume":"129","author":"Khan","year":"2023","journal-title":"Image Vis. Comput."},{"key":"10.1016\/j.cviu.2026.104703_b57","series-title":"IEEE\/CVF International Conference on Computer Vision","first-page":"3992","article-title":"Segment anything","author":"Kirillov","year":"2023"},{"key":"10.1016\/j.cviu.2026.104703_b58","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"22924","article-title":"Learning to count without annotations","author":"Knobel","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b59","series-title":"Advances in Neural Information Processing Systems 23: 24th Annual Conference on Neural Information Processing Systems 2010. Proceedings of a Meeting Held 6-9 December 2010, Vancouver, British Columbia, Canada","first-page":"1324","article-title":"Learning to count objects in images","author":"Lempitsky","year":"2010"},{"issue":"3","key":"10.1016\/j.cviu.2026.104703_b60","doi-asserted-by":"crossref","first-page":"853","DOI":"10.1007\/s10044-021-00959-z","article-title":"Approaches on crowd counting and density estimation: a review","volume":"24","author":"Li","year":"2021","journal-title":"Pattern Anal. Appl."},{"key":"10.1016\/j.cviu.2026.104703_b61","series-title":"CLIP surgery for better explainability with enhancement in open-vocabulary tasks","author":"Li","year":"2023"},{"key":"10.1016\/j.cviu.2026.104703_b62","series-title":"Thirty-Eighth AAAI Conference on Artificial Intelligence, AAAI 2024, Thirty-Sixth Conference on Innovative Applications of Artificial Intelligence, IAAI 2024, Fourteenth Symposium on Educational Advances in Artificial Intelligence","first-page":"3468","article-title":"A fixed-point approach to unified prompt-based counting","author":"Lin","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b63","series-title":"Computer Vision - ECCV 2014 - 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part V","first-page":"740","article-title":"Microsoft COCO: common objects in context","volume":"vol. 8693","author":"Lin","year":"2014"},{"key":"10.1016\/j.cviu.2026.104703_b64","series-title":"33rd British Machine Vision Conference 2022","first-page":"313","article-title":"Scale-prior deformable convolution for exemplar-guided class-agnostic counting","author":"Lin","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b65","unstructured":"Liu,\u00a0H., Li,\u00a0C., Wu,\u00a0Q., Lee,\u00a0Y.J., 2023. Visual Instruction Tuning. In: Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023. NeurIPS 2023, New Orleans, la, USA, December 10 - 16, 2023."},{"key":"10.1016\/j.cviu.2026.104703_b66","series-title":"IEEE Conference on Computer Vision and Pattern Recognition","first-page":"5099","article-title":"Context-aware crowd counting","author":"Liu","year":"2019"},{"key":"10.1016\/j.cviu.2026.104703_b67","series-title":"Computer Vision - ECCV 2024 - 18th European Conference, Milan, Italy, September 29-October 4, 2024, Proceedings, Part XLVII","first-page":"38","article-title":"Grounding DINO: marrying DINO with grounded pre-training for open-set object detection","volume":"vol. 15105","author":"Liu","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b68","series-title":"33rd British Machine Vision Conference 2022","first-page":"370","article-title":"Countr: Transformer-based generalised visual counting","author":"Liu","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b69","series-title":"TasselNet: Counting maize tassels in the wild via local counts regression network","author":"Lu","year":"2017"},{"key":"10.1016\/j.cviu.2026.104703_b70","series-title":"Computer Vision - ACCV 2018 - 14th Asian Conference on Computer Vision, Perth, Australia, December 2-6, 2018, Revised Selected Papers, Part III","first-page":"669","article-title":"Class-agnostic counting","volume":"11363","author":"Lu","year":"2018"},{"key":"10.1016\/j.cviu.2026.104703_b71","series-title":"2018 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"616","article-title":"Deep extreme cut: From extreme points to object segmentation","author":"Maninis","year":"2018"},{"key":"10.1016\/j.cviu.2026.104703_b72","doi-asserted-by":"crossref","first-page":"75","DOI":"10.1016\/j.patrec.2023.03.017","article-title":"MACnet: Mask augmented counting network for class-agnostic counting","volume":"169","author":"McCarthy","year":"2023","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.cviu.2026.104703_b73","series-title":"AAAI-25, Sponsored by the Association for the Advancement of Artificial Intelligence, February 25 - March 4, 2025, Philadelphia, PA, USA","first-page":"19537","article-title":"OmniCount: Multi-label object counting with semantic-geometric priors","author":"Mondal","year":"2025"},{"key":"10.1016\/j.cviu.2026.104703_b74","series-title":"Computer Vision - ECCV 2020 - 16th European Conference, Glasgow, UK, August 23-28, 2020, Proceedings, Part XXV","first-page":"681","article-title":"A metric learning reality check","volume":"vol. 12370","author":"Musgrave","year":"2020"},{"key":"10.1016\/j.cviu.2026.104703_b75","series-title":"The Thirty-Fourth AAAI Conference on Artificial Intelligence, AAAI 2020, the Thirty-Second Innovative Applications of Artificial Intelligence Conference, IAAI 2020, the Tenth AAAI Symposium on Educational Advances in Artificial Intelligence","first-page":"11799","article-title":"Crowd counting with decomposed uncertainty","author":"Oh","year":"2020"},{"key":"10.1016\/j.cviu.2026.104703_b76","series-title":"Representation learning with contrastive predictive coding","author":"van\u00a0den Oord","year":"2018"},{"key":"10.1016\/j.cviu.2026.104703_b77","series-title":"CountingDINO: A training-free pipeline for class-agnostic counting using unsupervised backbones","author":"Pacini","year":"2025"},{"issue":"1","key":"10.1016\/j.cviu.2026.104703_b78","doi-asserted-by":"crossref","DOI":"10.1186\/s40317-021-00247-x","article-title":"Counting sea lions and elephants from aerial photography using deep learning with density maps","volume":"9","author":"Padubidri","year":"2021","journal-title":"Anim. Biotelemetry"},{"key":"10.1016\/j.cviu.2026.104703_b79","doi-asserted-by":"crossref","first-page":"2448","DOI":"10.1016\/j.procs.2023.01.220","article-title":"Crowd counting analysis using deep learning: a critical review","volume":"218","author":"Patwal","year":"2023","journal-title":"Procedia Comput. Sci."},{"key":"10.1016\/j.cviu.2026.104703_b80","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"23293","article-title":"DAVE - A detect-and-verify paradigm for low-shot counting","author":"Pelhan","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b81","series-title":"2017 IEEE International Conference on Computer Vision Workshops","first-page":"2055","article-title":"Deep learning for multi-task plant phenotyping","author":"Pound","year":"2017"},{"key":"10.1016\/j.cviu.2026.104703_b82","series-title":"Proceedings of the 38th International Conference on Machine Learning, ICML 2021, 18-24 July 2021, Virtual Event","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume":"vol. 139","author":"Radford","year":"2021"},{"key":"10.1016\/j.cviu.2026.104703_b83","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops","first-page":"4220","article-title":"Vicinal counting networks","author":"Ranjan","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b84","series-title":"Computer Vision - ACCV 2022 - 16th Asian Conference on Computer Vision, Macao, China, December 4-8, 2022, Proceedings, Part IV","first-page":"71","article-title":"Exemplar free class agnostic counting","volume":"vol.13844","author":"Ranjan","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b85","series-title":"IEEE Conference on Computer Vision and Pattern Recognition","first-page":"3394","article-title":"Learning to count everything","author":"Ranjan","year":"2021"},{"key":"10.1016\/j.cviu.2026.104703_b86","unstructured":"Ren,\u00a0S., He,\u00a0K., Girshick,\u00a0R.B., Sun,\u00a0J., 2015. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks. In: Advances in Neural Information Processing Systems 28: Annual Conference on Neural Information Processing Systems 2015, December 7-12, 2015, Montreal, Quebec, Canada. pp. 91\u201399."},{"issue":"3","key":"10.1016\/j.cviu.2026.104703_b87","doi-asserted-by":"crossref","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","article-title":"ImageNet large scale visual recognition challenge","volume":"115","author":"Russakovsky","year":"2015","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.cviu.2026.104703_b88","series-title":"2017 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"4031","article-title":"Switching convolutional neural network for crowd counting","author":"Sam","year":"2017"},{"key":"10.1016\/j.cviu.2026.104703_b89","series-title":"15th IEEE International Conference on Advanced Video and Signal Based Surveillance","first-page":"1","article-title":"Detecting and counting sheep with a convolutional neural network","author":"Sarwar","year":"2018"},{"key":"10.1016\/j.cviu.2026.104703_b90","series-title":"NeurIPS","article-title":"LAION-5B: an open large-scale dataset for training next generation image-text models","author":"Schuhmann","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b91","series-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"1874","article-title":"Real-time single image and video super-resolution using an efficient sub-pixel convolutional neural network","author":"Shi","year":"2016"},{"key":"10.1016\/j.cviu.2026.104703_b92","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"9519","article-title":"Represent, compare, and learn: A similarity-aware framework for class-agnostic counting","author":"Shi","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b93","series-title":"IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"322","article-title":"Training-free object counting with prompts","author":"Shi","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b94","series-title":"2018 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"5382","article-title":"Crowd counting with deep negative correlation learning","author":"Shi","year":"2018"},{"key":"10.1016\/j.cviu.2026.104703_b95","doi-asserted-by":"crossref","first-page":"3","DOI":"10.1016\/j.patrec.2017.07.007","article-title":"A survey of recent advances in CNN-based single image crowd counting and density estimation","volume":"107","author":"Sindagi","year":"2018","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.cviu.2026.104703_b96","doi-asserted-by":"crossref","first-page":"148","DOI":"10.1016\/j.patrec.2023.04.018","article-title":"ConCoNet: Class-agnostic counting with positive and negative exemplars","volume":"171","author":"Soliven","year":"2023","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.cviu.2026.104703_b97","doi-asserted-by":"crossref","first-page":"2220","DOI":"10.1109\/ACCESS.2017.2782260","article-title":"Vehicle detection and counting in high-resolution aerial images using convolutional regression neural network","volume":"6","author":"Tayara","year":"2018","journal-title":"IEEE Access"},{"key":"10.1016\/j.cviu.2026.104703_b98","doi-asserted-by":"crossref","DOI":"10.1016\/j.compag.2019.05.049","article-title":"Automated pig counting using deep learning","volume":"163","author":"Tian","year":"2019","journal-title":"Comput. Electron. Agric."},{"key":"10.1016\/j.cviu.2026.104703_b99","series-title":"IEEE\/CVF International Conference on Computer Vision","first-page":"18826","article-title":"A low-shot object counting network with iterative prototype adaptation","author":"\u00d0ukic","year":"2023"},{"key":"10.1016\/j.cviu.2026.104703_b100","unstructured":"Vaswani,\u00a0A., Shazeer,\u00a0N., Parmar,\u00a0N., Uszkoreit,\u00a0J., Jones,\u00a0L., Gomez,\u00a0A.N., Kaiser,\u00a0L., Polosukhin,\u00a0I., 2017. Attention is All you Need. In: Advances in Neural Information Processing Systems 30: Annual Conference on Neural Information Processing Systems 2017, December 4-9, 2017, Long Beach, CA, USA. pp. 5998\u20136008."},{"key":"10.1016\/j.cviu.2026.104703_b101","unstructured":"Vinyals,\u00a0O., Blundell,\u00a0C., Lillicrap,\u00a0T., Kavukcuoglu,\u00a0K., Wierstra,\u00a0D., 2016. Matching Networks for One Shot Learning. In: Advances in Neural Information Processing Systems 29: Annual Conference on Neural Information Processing Systems 2016, December 5-10, 2016, Barcelona, Spain. pp. 3630\u20133638."},{"issue":"4","key":"10.1016\/j.cviu.2026.104703_b102","doi-asserted-by":"crossref","first-page":"600","DOI":"10.1109\/TIP.2003.819861","article-title":"Image quality assessment: from error visibility to structural similarity","volume":"13","author":"Wang","year":"2004","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.cviu.2026.104703_b103","series-title":"IEEE Conference on Computer Vision and Pattern Recognition","first-page":"8198","article-title":"Learning from synthetic data for crowd counting in the wild","author":"Wang","year":"2019"},{"key":"10.1016\/j.cviu.2026.104703_b104","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110513","article-title":"GCNet: Probing self-similarity learning for generalized counting network","volume":"153","author":"Wang","year":"2024","journal-title":"Pattern Recognit."},{"issue":"6","key":"10.1016\/j.cviu.2026.104703_b105","doi-asserted-by":"crossref","first-page":"4675","DOI":"10.1109\/TCYB.2020.3033428","article-title":"Density-aware curriculum learning for crowd counting","volume":"52","author":"Wang","year":"2022","journal-title":"IEEE Trans. Cybern."},{"key":"10.1016\/j.cviu.2026.104703_b106","series-title":"Thirty-Eighth AAAI Conference on Artificial Intelligence, AAAI 2024, Thirty-Sixth Conference on Innovative Applications of Artificial Intelligence, IAAI 2024, Fourteenth Symposium on Educational Advances in Artificial Intelligence","first-page":"5832","article-title":"Vision transformer off-the-shelf: A surprising baseline for few-shot class-agnostic counting","author":"Wang","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b107","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2024.106126","article-title":"SATCount: A scale-aware transformer-based class-agnostic counting framework","volume":"172","author":"Wang","year":"2024","journal-title":"Neural Netw."},{"key":"10.1016\/j.cviu.2026.104703_b108","series-title":"IEEE Conference on Computer Vision and Pattern Recognition","first-page":"1328","article-title":"Fast online object tracking and segmentation: A unifying approach","author":"Wang","year":"2019"},{"issue":"3","key":"10.1016\/j.cviu.2026.104703_b109","doi-asserted-by":"crossref","first-page":"283","DOI":"10.1080\/21681163.2016.1149104","article-title":"Microscopy cell counting and detection with fully convolutional regression networks","volume":"6","author":"Xie","year":"2018","journal-title":"Comput. Methods Biomech. Biomed. Eng. Imaging Vis."},{"key":"10.1016\/j.cviu.2026.104703_b110","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"15548","article-title":"Zero-shot object counting","author":"Xu","year":"2023"},{"key":"10.1016\/j.cviu.2026.104703_b111","series-title":"Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence","first-page":"1507","article-title":"Learning spatial similarity distribution for few-shot object counting","author":"Xu","year":"2024"},{"key":"10.1016\/j.cviu.2026.104703_b112","series-title":"2019 Chinese Control and Decision Conference","first-page":"5284","article-title":"Spatio-temporal discriminative correlation filter based object tracking","author":"Xu","year":"2019"},{"key":"10.1016\/j.cviu.2026.104703_b113","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.111394","article-title":"Versatile correlation learning for size-robust generalized counting: A new perspective","volume":"286","author":"Yang","year":"2024","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.cviu.2026.104703_b114","series-title":"IEEE Winter Conference on Applications of Computer Vision","first-page":"869","article-title":"Class-agnostic few-shot object counting","author":"Yang","year":"2021"},{"issue":"9","key":"10.1016\/j.cviu.2026.104703_b115","doi-asserted-by":"crossref","first-page":"13637","DOI":"10.1007\/s11042-022-13957-y","article-title":"Survey on algorithms of people counting in dense crowd and crowd density estimation","volume":"82","author":"Yang","year":"2023","journal-title":"Multim. Tools Appl."},{"key":"10.1016\/j.cviu.2026.104703_b116","series-title":"mPLUG-owl: Modularization empowers large language models with multimodality","author":"Ye","year":"2023"},{"key":"10.1016\/j.cviu.2026.104703_b117","unstructured":"Yin,\u00a0Z., Wang,\u00a0J., Cao,\u00a0J., Shi,\u00a0Z., Liu,\u00a0D., Li,\u00a0M., Huang,\u00a0X., Wang,\u00a0Z., Sheng,\u00a0L., Bai,\u00a0L., Shao,\u00a0J., Ouyang,\u00a0W., 2023. LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark. In: Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023. NeurIPS 2023, New Orleans, la, USA, December 10 - 16, 2023."},{"key":"10.1016\/j.cviu.2026.104703_b118","series-title":"IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"6304","article-title":"Few-shot object counting with similarity-aware feature enhancement","author":"You","year":"2023"},{"key":"10.1016\/j.cviu.2026.104703_b119","series-title":"Proceedings of the 36th International Conference on Machine Learning","first-page":"7354","article-title":"Self-attention generative adversarial networks","volume":"vol. 97","author":"Zhang","year":"2019"},{"key":"10.1016\/j.cviu.2026.104703_b120","series-title":"IEEE Conference on Computer Vision and Pattern Recognition","first-page":"833","article-title":"Cross-scene crowd counting via deep convolutional neural networks","author":"Zhang","year":"2015"},{"key":"10.1016\/j.cviu.2026.104703_b121","series-title":"IEEE International Conference on Computer Vision","first-page":"3687","article-title":"FCN-rLSTM: Deep spatio-temporal neural networks for vehicle counting in city cameras","author":"Zhang","year":"2017"},{"key":"10.1016\/j.cviu.2026.104703_b122","series-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"589","article-title":"Single-image crowd counting via multi-column convolutional neural network","author":"Zhang","year":"2016"},{"key":"10.1016\/j.cviu.2026.104703_b123","doi-asserted-by":"crossref","first-page":"1134","DOI":"10.1109\/TIP.2023.3240839","article-title":"Deformable density estimation via adaptive representation","volume":"32","author":"Zhao","year":"2023","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.cviu.2026.104703_b124","series-title":"Computer Vision - ECCV 2022 - 17th European Conference, Tel Aviv, Israel, October 23-27, 2022, Proceedings, Part XXVIII","first-page":"696","article-title":"Extract free dense labels from CLIP","volume":"vol. 13688","author":"Zhou","year":"2022"},{"key":"10.1016\/j.cviu.2026.104703_b125","series-title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","author":"Zhu","year":"2023"},{"key":"10.1016\/j.cviu.2026.104703_b126","series-title":"IEEE Conference on Computer Vision and Pattern Recognition","first-page":"9308","article-title":"Deformable ConvNets V2: more deformable, better results","author":"Zhu","year":"2019"},{"key":"10.1016\/j.cviu.2026.104703_b127","series-title":"17th IEEE International Conference on Bioinformatics and Bioengineering","first-page":"51","article-title":"An extended type cell detection and counting method based on FCN","author":"Zhu","year":"2017"},{"key":"10.1016\/j.cviu.2026.104703_b128","series-title":"Computer Vision - ECCV 2024 - 18th European Conference, Milan, Italy, September 29-October 4, 2024, Proceedings, Part V","first-page":"368","article-title":"Zero-shot object counting with good exemplars","volume":"vol. 15063","author":"Zhu","year":"2024"}],"container-title":["Computer Vision and Image Understanding"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1077314226000706?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1077314226000706?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,4,14]],"date-time":"2026-04-14T22:15:56Z","timestamp":1776204956000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1077314226000706"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4]]},"references-count":128,"alternative-id":["S1077314226000706"],"URL":"https:\/\/doi.org\/10.1016\/j.cviu.2026.104703","relation":{},"ISSN":["1077-3142"],"issn-type":[{"value":"1077-3142","type":"print"}],"subject":[],"published":{"date-parts":[[2026,4]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"A survey on class-agnostic counting: Advancements from reference-based to open-world text-guided approaches","name":"articletitle","label":"Article Title"},{"value":"Computer Vision and Image Understanding","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.cviu.2026.104703","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Author(s). Published by Elsevier Inc.","name":"copyright","label":"Copyright"}],"article-number":"104703"}}