{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T08:04:18Z","timestamp":1784534658269,"version":"3.55.0"},"reference-count":58,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,6]],"date-time":"2026-06-06T00:00:00Z","timestamp":1780704000000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["E2ET1104"],"award-info":[{"award-number":["E2ET1104"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61836002"],"award-info":[{"award-number":["61836002"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U21B2038"],"award-info":[{"award-number":["U21B2038"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62272438"],"award-info":[{"award-number":["62272438"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62236008"],"award-info":[{"award-number":["62236008"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002367","name":"Chinese Academy of Sciences","doi-asserted-by":"publisher","award":["KGFZD-145-23-18"],"award-info":[{"award-number":["KGFZD-145-23-18"]}],"id":[{"id":"10.13039\/501100002367","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Journal of Visual Communication and Image Representation"],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1016\/j.jvcir.2026.104856","type":"journal-article","created":{"date-parts":[[2026,6,5]],"date-time":"2026-06-05T06:41:03Z","timestamp":1780641663000},"page":"104856","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["SeqCount: A sequence modeling framework for class-agnostic counting"],"prefix":"10.1016","volume":"119","author":[{"given":"Yiming","family":"Zhao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guorong","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xinyan","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiang","family":"He","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhenjun","family":"Han","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuankai","family":"Qi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.jvcir.2026.104856_b1","series-title":"CVPR","first-page":"1","article-title":"Privacy preserving crowd monitoring: Counting people without people models or tracking","author":"Chan","year":"2008"},{"issue":"7","key":"10.1016\/j.jvcir.2026.104856_b2","first-page":"9654","article-title":"Frequency feature pyramid network with global-local consistency loss for crowd-and-vehicle counting in congested scenes","volume":"23","author":"Yu","year":"2022","journal-title":"TITS"},{"issue":"12","key":"10.1016\/j.jvcir.2026.104856_b3","first-page":"15920","article-title":"Scale region recognition network for object counting in intelligent transportation system","volume":"24","author":"Guo","year":"2023","journal-title":"TITS"},{"issue":"4","key":"10.1016\/j.jvcir.2026.104856_b4","first-page":"3103","article-title":"Nssnet: Scale-aware object counting with non-scale suppression","volume":"23","author":"Liu","year":"2020","journal-title":"TITS"},{"issue":"5","key":"10.1016\/j.jvcir.2026.104856_b5","first-page":"3420","article-title":"A perspective-embedded scale-selection network for crowd counting in public transportation","volume":"25","author":"Yi","year":"2024","journal-title":"TITS"},{"issue":"3","key":"10.1016\/j.jvcir.2026.104856_b6","first-page":"3422","article-title":"Transportation object counting with graph-based adaptive auxiliary learning","volume":"24","author":"Meng","year":"2022","journal-title":"TITS"},{"key":"10.1016\/j.jvcir.2026.104856_b7","doi-asserted-by":"crossref","DOI":"10.1016\/j.ijdrr.2025.105800","article-title":"BanglaCalamityMMD: A comprehensive benchmark dataset for multimodal disaster identification in the low-resource bangla language","author":"Faria","year":"2025","journal-title":"Int. J. Disaster Risk Reduct."},{"key":"10.1016\/j.jvcir.2026.104856_b8","article-title":"MultiBanFakeDetect: Integrating advanced fusion techniques for multimodal detection of bangla fake news in under-resourced contexts","author":"Faria","year":"2025","journal-title":"Int. J. Inf. Manag. Data Insights"},{"key":"10.1016\/j.jvcir.2026.104856_b9","article-title":"Flight delay prediction using machine learning and explainable AI: a case study on hazrat shahjalal international airport, dhaka","author":"Chowdhury","year":"2025","journal-title":"Case Stud. Transp. Policy"},{"key":"10.1016\/j.jvcir.2026.104856_b10","series-title":"ICIP","first-page":"1215","article-title":"End-to-end crowd counting via joint learning local and global count","author":"Shang","year":"2016"},{"key":"10.1016\/j.jvcir.2026.104856_b11","doi-asserted-by":"crossref","DOI":"10.1016\/j.jvcir.2025.104387","article-title":"Learning scalable omni-scale distribution for crowd counting","volume":"107","author":"Wang","year":"2025","journal-title":"J. Vis. Commun. Image Represent."},{"key":"10.1016\/j.jvcir.2026.104856_b12","doi-asserted-by":"crossref","DOI":"10.1016\/j.jvcir.2024.104323","article-title":"Crowd counting network based on attention feature fusion and multi-column feature enhancement","volume":"105","author":"Liu","year":"2024","journal-title":"J. Vis. Commun. Image Represent."},{"key":"10.1016\/j.jvcir.2026.104856_b13","doi-asserted-by":"crossref","DOI":"10.1016\/j.jvcir.2024.104078","article-title":"Correlation-attention guided regression network for efficient crowd counting","volume":"99","author":"Zeng","year":"2024","journal-title":"J. Vis. Commun. Image Represent."},{"key":"10.1016\/j.jvcir.2026.104856_b14","series-title":"ECCV","first-page":"785","article-title":"A large contextual dataset for classification, detection and counting of cars with deep learning","author":"Mundhenk","year":"2016"},{"key":"10.1016\/j.jvcir.2026.104856_b15","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2020.106485","article-title":"Deeply scale aggregation network for object counting","volume":"210","author":"Li","year":"2020","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.jvcir.2026.104856_b16","series-title":"ECCV","first-page":"483","article-title":"Counting in the wild","author":"Arteta","year":"2016"},{"key":"10.1016\/j.jvcir.2026.104856_b17","series-title":"CVPR","first-page":"3394","article-title":"Learning to count everything","author":"Ranjan","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104856_b18","series-title":"BMVC","first-page":"313","article-title":"Scale-prior deformable convolution for exemplar-guided class-agnostic counting","author":"Lin","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104856_b19","series-title":"CVPR","first-page":"9529","article-title":"Represent, compare, and learn: A similarity-aware framework for class-agnostic counting","author":"Shi","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104856_b20","series-title":"WACV","first-page":"6315","article-title":"Few-shot object counting with similarity-aware feature enhancement","author":"You","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104856_b21","series-title":"BMVC","first-page":"370","article-title":"CounTR: Transformer-based generalised visual counting","author":"Chang","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104856_b22","series-title":"WACV","first-page":"870","article-title":"Class-agnostic few-shot object counting","author":"Yang","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104856_b23","series-title":"ICCV","first-page":"18872","article-title":"A low-shot object counting network with iterative prototype adaptation","author":"Djukic","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104856_b24","series-title":"AAAI","first-page":"5832","article-title":"Vision transformer off-the-shelf: A surprising baseline for few-shot class-agnostic counting","volume":"38","author":"Wang","year":"2024"},{"issue":"3","key":"10.1016\/j.jvcir.2026.104856_b25","doi-asserted-by":"crossref","first-page":"1357","DOI":"10.1109\/TPAMI.2020.3022878","article-title":"Kernel-based density map generation for dense object counting","volume":"44","author":"Wan","year":"2020","journal-title":"PAMI"},{"key":"10.1016\/j.jvcir.2026.104856_b26","series-title":"CVPR","first-page":"770","article-title":"Deep residual learning for image recognition","author":"He","year":"2016"},{"key":"10.1016\/j.jvcir.2026.104856_b27","series-title":"ECCV","first-page":"348","article-title":"Few-shot object counting and detection","author":"Nguyen","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104856_b28","series-title":"CVPR","article-title":"Weakly supervised video individual counting weakly supervised video individual counting","author":"Liu","year":"2024"},{"key":"10.1016\/j.jvcir.2026.104856_b29","series-title":"Proc. Iberian Conf. Pattern Recognit. Image Anal.","first-page":"423","article-title":"Extremely overlapping vehicle counting","author":"Guerrero-G\u00f3mez-Olmedo","year":"2015"},{"key":"10.1016\/j.jvcir.2026.104856_b30","series-title":"ICCV","first-page":"4145","article-title":"Drone-based object counting by spatially regularized regional proposal network","author":"Hsieh","year":"2017"},{"key":"10.1016\/j.jvcir.2026.104856_b31","series-title":"CVPR","first-page":"23293","article-title":"DAVE - a detect-and-verify paradigm for low-shot counting","author":"Pelhan","year":"2024"},{"key":"10.1016\/j.jvcir.2026.104856_b32","article-title":"Counting with ease: Class-agnostic counting via one-shot detection across diverse domains","author":"Peng","year":"2025","journal-title":"Neural Netw."},{"key":"10.1016\/j.jvcir.2026.104856_b33","first-page":"66260","article-title":"A novel unified architecture for low-shot counting by detection and segmentation","author":"Pelhan","year":"2024","journal-title":"NIPS"},{"key":"10.1016\/j.jvcir.2026.104856_b34","series-title":"ICCV","first-page":"4015","article-title":"Segment anything","author":"Kirillov","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104856_b35","series-title":"ACCV","first-page":"669","article-title":"Class-agnostic counting","author":"Lu","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104856_b36","series-title":"ICML","first-page":"1126","article-title":"Model-agnostic meta-learning for fast adaptation of deep networks","author":"Finn","year":"2017"},{"key":"10.1016\/j.jvcir.2026.104856_b37","series-title":"EMNLP","first-page":"1724","article-title":"Learning phrase representations using RNN encoder\u2013decoder for statistical machine translation","author":"Cho","year":"2014"},{"key":"10.1016\/j.jvcir.2026.104856_b38","series-title":"NeurIPS","first-page":"3104","article-title":"Sequence to sequence learning with neural networks","author":"Ilya Sutskever","year":"2014"},{"key":"10.1016\/j.jvcir.2026.104856_b39","first-page":"5998","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"NIPS"},{"key":"10.1016\/j.jvcir.2026.104856_b40","series-title":"ECCV","first-page":"213","article-title":"End-to-end object detection with transformers","author":"Carion","year":"2020"},{"key":"10.1016\/j.jvcir.2026.104856_b41","series-title":"ICLR","article-title":"Pix2seq: A language modeling framework for object detection","author":"Chen","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104856_b42","first-page":"31333","article-title":"A unified sequence interface for vision tasks","volume":"35","author":"Chen","year":"2022","journal-title":"NIPS"},{"key":"10.1016\/j.jvcir.2026.104856_b43","series-title":"ICML","first-page":"8821","article-title":"Zero-shot text-to-image generation","author":"Ramesh","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104856_b44","series-title":"Video generation models as world simulators","author":"Brooks","year":"2024"},{"key":"10.1016\/j.jvcir.2026.104856_b45","series-title":"ECCV","first-page":"164","article-title":"Weighing counts: Sequential crowd counting by reinforcement learning","author":"Liu","year":"2020"},{"key":"10.1016\/j.jvcir.2026.104856_b46","series-title":"ECCV","first-page":"740","article-title":"Microsoft coco: Common objects in context","author":"Lin","year":"2014"},{"key":"10.1016\/j.jvcir.2026.104856_b47","series-title":"ICLR","article-title":"Decoupled weight decay regularization","author":"Loshchilov","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104856_b48","series-title":"CVPR","first-page":"4013","article-title":"Few-shot object detection with attention-RPN and multi-relation detector","author":"Fan","year":"2020"},{"issue":"3","key":"10.1016\/j.jvcir.2026.104856_b49","first-page":"3090","article-title":"Few-shot object detection and viewpoint estimation for objects in the wild","volume":"45","author":"Xiao","year":"2022","journal-title":"PAMI"},{"key":"10.1016\/j.jvcir.2026.104856_b50","series-title":"ECCV","first-page":"615","article-title":"Towards perspective-free object counting with deep learning","author":"Onoro-Rubio","year":"2016"},{"key":"10.1016\/j.jvcir.2026.104856_b51","series-title":"CVPR","first-page":"1091","article-title":"Csrnet: Dilated convolutional neural networks for understanding the highly congested scenes","author":"Li","year":"2018"},{"issue":"10","key":"10.1016\/j.jvcir.2026.104856_b52","first-page":"3513","article-title":"Counting objects by blockwise classification","volume":"30","author":"Liu","year":"2019","journal-title":"TITS"},{"key":"10.1016\/j.jvcir.2026.104856_b53","series-title":"CVPR","first-page":"3225","article-title":"Adcrowdnet: An attention-injective deformable convolutional network for crowd understanding","author":"Liu","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104856_b54","series-title":"WACV","first-page":"1941","article-title":"Scale pyramid network for crowd counting","author":"Chen","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104856_b55","series-title":"CVPR","first-page":"6469","article-title":"Point in, box out: Beyond counting persons in crowds","author":"Liu","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104856_b56","article-title":"Faster r-cnn: Towards real-time object detection with region proposal networks","volume":"28","author":"Ren","year":"2015","journal-title":"NIPS"},{"key":"10.1016\/j.jvcir.2026.104856_b57","series-title":"CVPR","first-page":"779","article-title":"You only look once: Unified, real-time object detection","author":"Redmon","year":"2016"},{"key":"10.1016\/j.jvcir.2026.104856_b58","series-title":"ICCV","first-page":"6142","article-title":"Bayesian loss for crowd count estimation with point supervision","author":"Ma","year":"2019"}],"container-title":["Journal of Visual Communication and Image Representation"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1047320326001513?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1047320326001513?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T07:23:53Z","timestamp":1784532233000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1047320326001513"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8]]},"references-count":58,"alternative-id":["S1047320326001513"],"URL":"https:\/\/doi.org\/10.1016\/j.jvcir.2026.104856","relation":{},"ISSN":["1047-3203"],"issn-type":[{"value":"1047-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,8]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"SeqCount: A sequence modeling framework for class-agnostic counting","name":"articletitle","label":"Article Title"},{"value":"Journal of Visual Communication and Image Representation","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.jvcir.2026.104856","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier Inc.","name":"copyright","label":"Copyright"}],"article-number":"104856"}}