{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T14:47:41Z","timestamp":1783003661097,"version":"3.54.5"},"reference-count":43,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62276260"],"award-info":[{"award-number":["62276260"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2024YFE0210600"],"award-info":[{"award-number":["2024YFE0210600"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004826","name":"Natural Science Foundation of Beijing Municipality","doi-asserted-by":"publisher","award":["L247028"],"award-info":[{"award-number":["L247028"]}],"id":[{"id":"10.13039\/501100004826","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.patcog.2026.113560","type":"journal-article","created":{"date-parts":[[2026,3,27]],"date-time":"2026-03-27T16:49:32Z","timestamp":1774630172000},"page":"113560","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":1,"special_numbering":"PB","title":["Seg-LLaVA: Empowering pixel-level understanding with large vision language model"],"prefix":"10.1016","volume":"179","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-0123-3505","authenticated-orcid":false,"given":"Fan","family":"Yang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yousong","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yufei","family":"Zhan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongyin","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xin","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yaowei","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ming","family":"Tang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xin","family":"Ning","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jinqiao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113560_bib0001","doi-asserted-by":"crossref","first-page":"23716","DOI":"10.52202\/068431-1723","article-title":"Flamingo: a visual language model for few-shot learning","volume":"35","author":"Alayrac","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113560_bib0002","series-title":"International Conference on Machine Learning","first-page":"19730","article-title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"key":"10.1016\/j.patcog.2026.113560_bib0003","doi-asserted-by":"crossref","first-page":"49250","DOI":"10.52202\/075280-2142","article-title":"InstructBLIP: towards general-purpose vision-language models with instruction tuning","volume":"36","author":"Dai","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113560_bib0004","first-page":"34892","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113560_bib0005","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"9579","article-title":"LISA: reasoning segmentation via large language model","author":"Lai","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0006","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"13009","article-title":"GLaMM: pixel grounding large multimodal model","author":"Rasheed","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0007","series-title":"CVPR","article-title":"HyperSeg: towards universal visual segmentation with large language model","author":"Wei","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0008","series-title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems","article-title":"FOCUS: unified vision-language modeling for interactive editing driven by referential segmentation","author":"Yang","year":"2025"},{"key":"10.1016\/j.patcog.2026.113560_bib0009","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"18653","article-title":"PolyFormer: referring image segmentation as sequential polygon generation","author":"Liu","year":"2023"},{"key":"10.1016\/j.patcog.2026.113560_bib0010","first-page":"61501","article-title":"VisionLLM: large language model is also an open-ended decoder for vision-centric tasks","volume":"36","author":"Wang","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113560_bib0011","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"12193","article-title":"PolarMask: single shot instance segmentation with polar representation","author":"Xie","year":"2020"},{"key":"10.1016\/j.patcog.2026.113560_bib0012","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"14076","article-title":"Jack of all tasks master of many: designing general-purpose coarse-to-fine vision-language model","author":"Pramanick","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0013","series-title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics","article-title":"Unnatural instructions: tuning language models with (almost) no human labor","author":"Honovich","year":"2022"},{"key":"10.1016\/j.patcog.2026.113560_bib0014","series-title":"The Association for Computational Linguistics","article-title":"Self-instruct: aligning language models with self-generated instructions","author":"Wang","year":"2022"},{"key":"10.1016\/j.patcog.2026.113560_bib0015","unstructured":"J. Achiam, S. Adler, S. Agarwal, L. Ahmad, I. Akkaya, F.L. Aleman, D. Almeida, J. Altenschmidt, S. Altman, S. Anadkat, et al., GPT-4 technical report, 2023, arXiv: 2303.08774."},{"key":"10.1016\/j.patcog.2026.113560_bib0016","unstructured":"F. Yang, Z. Chen, Y. Zhu, X. Li, J. Wang, From seeing to predicting: a vision-language framework for trajectory forecasting and controlled video generation, 2025, arXiv: 2510.00806."},{"key":"10.1016\/j.patcog.2026.113560_bib0017","unstructured":"K. Chen, Z. Zhang, W. Zeng, R. Zhang, F. Zhu, R. Zhao, Shikra: unleashing multimodal LLM\u2019s referential dialogue magic, 2023, arXiv: 2306.15195."},{"key":"10.1016\/j.patcog.2026.113560_bib0018","series-title":"ICLR","article-title":"FERRET: refer and ground anything anywhere at any granularity","author":"You","year":"2023"},{"key":"10.1016\/j.patcog.2026.113560_bib0019","unstructured":"P. Wang, S. Bai, S. Tan, S. Wang, Z. Fan, J. Bai, K. Chen, X. Liu, J. Wang, W. Ge, et al., Qwen2-VL: Enhancing vision-language model\u2019s perception of the world at any resolution, 2024, arXiv: 2409.12191."},{"key":"10.1016\/j.patcog.2026.113560_bib0020","article-title":"Investigating synthetic-to-real transfer robustness for stereo matching and optical flow estimation","author":"Zhang","year":"2025","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113560_bib0021","series-title":"European Conference on Computer Vision","first-page":"52","article-title":"GPT4RoI: instruction tuning large language model on region-of-interest","author":"Zhang","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0022","first-page":"121475","article-title":"CogVLM: visual expert for pretrained language models","volume":"37","author":"Wang","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113560_bib0023","first-page":"1","article-title":"Fully decoupled end-to-end person search: an approach without conflicting objectives","author":"Zhang","year":"2025","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.113560_bib0024","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"26374","article-title":"PixelLM: pixel reasoning with large multimodal model","author":"Ren","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0025","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"4818","article-title":"Florence-2: advancing a unified representation for a variety of vision tasks","author":"Xiao","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0026","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"3065","article-title":"LLaFS: when large language models meet few-shot segmentation","author":"Zhu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0027","unstructured":"M. Tschannen, A. Gritsenko, X. Wang, M.F. Naeem, I. Alabdulmohsin, N. Parthasarathy, T. Evans, L. Beyer, Y. Xia, B. Mustafa, et al., SigLIP 2: multilingual vision-language encoders with improved semantic understanding, localization, and dense features, 2025, arXiv: 2502.14786."},{"key":"10.1016\/j.patcog.2026.113560_bib0028","series-title":"European Conference on Computer Vision","first-page":"69","article-title":"Modeling context in referring expressions","author":"Yu","year":"2016"},{"key":"10.1016\/j.patcog.2026.113560_bib0029","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"11","article-title":"Generation and comprehension of unambiguous object descriptions","author":"Mao","year":"2016"},{"key":"10.1016\/j.patcog.2026.113560_bib0030","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"23592","article-title":"GRES: generalized referring expression segmentation","author":"Liu","year":"2023"},{"key":"10.1016\/j.patcog.2026.113560_bib0031","unstructured":"X. Chen, H. Fang, T.-Y. Lin, R. Vedantam, S. Gupta, P. Doll\u00e1r, C.L. Zitnick, Microsoft coco captions: data collection and evaluation server, 2015, arXiv: 1504.00325."},{"key":"10.1016\/j.patcog.2026.113560_bib0032","series-title":"Asian Conference on Computer Vision","first-page":"123","article-title":"Video object segmentation with language referring expressions","author":"Khoreva","year":"2018"},{"key":"10.1016\/j.patcog.2026.113560_bib0033","series-title":"European Conference on Computer Vision","first-page":"74","article-title":"PSALM: pixelwise segmentation with large multi-modal model","author":"Zhang","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0034","unstructured":"Q. Team, Qwen2 technical report, 2024, arXiv: 2407.10671."},{"key":"10.1016\/j.patcog.2026.113560_bib0035","unstructured":"M. Honnibal, I. Montani, spaCy 2: Natural language understanding with Bloom embeddings, convolutional neural networks and incremental parsing, 2017. To appear."},{"key":"10.1016\/j.patcog.2026.113560_bib0036","series-title":"European Conference on Computer Vision","first-page":"38","article-title":"Grounding DINO: marrying dino with grounded pre-training for open-set object detection","author":"Liu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0037","unstructured":"N. Ravi, V. Gabeur, Y.-T. Hu, R. Hu, C. Ryali, T. Ma, H. Khedr, R. R\u00e4dle, C. Rolland, L. Gustafson, et al., SAM 2: segment anything in images and videos, 2024, arXiv: 2408.00714."},{"key":"10.1016\/j.patcog.2026.113560_bib0038","series-title":"EMNLP","article-title":"Evaluating object hallucination in large vision-language models","author":"Li","year":"2023"},{"key":"10.1016\/j.patcog.2026.113560_bib0039","series-title":"NeurIPS","article-title":"MME-survey: a comprehensive survey on evaluation of multimodal llms","author":"Fu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0040","series-title":"European Conference on Computer Vision","first-page":"216","article-title":"MMBench: is your multi-modal model an all-around player?","author":"Liu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0041","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"9556","article-title":"MMMU: a massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI","author":"Yue","year":"2024"},{"key":"10.1016\/j.patcog.2026.113560_bib0042","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"4995","article-title":"Visual7W: grounded question answering in images","author":"Zhu","year":"2016"},{"key":"10.1016\/j.patcog.2026.113560_bib0043","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"10437","article-title":"12-in-1: multi-task vision and language representation learning","author":"Lu","year":"2020"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326005261?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326005261?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,12]],"date-time":"2026-06-12T21:08:08Z","timestamp":1781298488000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326005261"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":43,"alternative-id":["S0031320326005261"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113560","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Seg-LLaVA: Empowering pixel-level understanding with large vision language model","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113560","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Published by Elsevier Ltd.","name":"copyright","label":"Copyright"}],"article-number":"113560"}}