{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,8]],"date-time":"2026-05-08T15:58:15Z","timestamp":1778255895359,"version":"3.51.4"},"reference-count":101,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.00635","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"6748-6760","source":"Crossref","is-referenced-by-count":1,"title":["A Simple Yet Mighty Hartley Diffusion Versatilist for Generalizable Dense Vision Tasks"],"prefix":"10.1109","author":[{"given":"Qi","family":"Bi","sequence":"first","affiliation":[{"name":"Westlake University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jingjun","family":"Yi","sequence":"additional","affiliation":[{"name":"Tencent Jarvis Lab,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Huimin","family":"Huang","sequence":"additional","affiliation":[{"name":"Tencent Jarvis Lab,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Zheng","sequence":"additional","affiliation":[{"name":"Tencent Jarvis Lab,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haolan","family":"Zhan","sequence":"additional","affiliation":[{"name":"Monash University,Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wei","family":"Ji","sequence":"additional","affiliation":[{"name":"Yale University,United States"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yawen","family":"Huang","sequence":"additional","affiliation":[{"name":"Tencent Jarvis Lab,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuexiang","family":"Li","sequence":"additional","affiliation":[{"name":"Macau University,Macau"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yefeng","family":"Zheng","sequence":"additional","affiliation":[{"name":"Westlake University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Segdiff: Image segmentation with diffusion probabilistic models","author":"Amit","year":"2021","journal-title":"arXiv preprint arXiv"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00300"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00400"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19769-7_28"},{"key":"ref5","article-title":"Zoedepth: Zero-shot transfer by combining relative and metric depth","author":"Farooq Bhat","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2414"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2983"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i2.27838"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i2.27840"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.02220"},{"key":"ref11","article-title":"Virtual kitti 2","author":"Cabon","year":"2020","journal-title":"arXiv preprint arXiv"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2019.00274"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.01816"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.00090"},{"key":"ref15","article-title":"Analog bits: Generating discrete data using diffusion models with self-conditioning","author":"Chen","year":"2022","journal-title":"arXiv preprint arXiv"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00090"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00135"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01141"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.350"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3419007"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00223"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73247-8_25"},{"key":"ref23","article-title":"Toward a diffusion-based generalist for dense vision tasks","author":"Fan","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1755"},{"key":"ref25","article-title":"Prompting diffusion representations for cross-domain semantic segmentation","author":"Gong","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0174"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00572"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02311"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/JRPROC.1942.234333"},{"key":"ref30","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume":"33","author":"Ho","year":"2020","journal-title":"NeurIPS"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00682"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr46437.2021.01216"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01987"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72933-1_6"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00907"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2836318"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-11015-4_25"},{"key":"ref38","article-title":"From big to small: Multi-scale local planar guidance for monocular depth estimation","author":"Han Lee","year":"2019","journal-title":"arXiv preprint arXiv"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.01133"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2867951"},{"key":"ref41","first-page":"11945","article-title":"Joint semantic mining for weakly supervised rgb-d salient object detection","volume":"34","author":"Li","year":"2021","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/TMI.2023.3325703"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1007\/s11633-023-1458-0"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00741"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00717"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01167"},{"key":"ref48","article-title":"Decoupled weight decay regularization","author":"Loshchilov","year":"2017","journal-title":"arXiv preprint arXiv"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00788"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00883"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.534"},{"key":"ref52","first-page":"8162","article-title":"Improved denoising diffusion probabilistic models","author":"Quinn Nichol","year":"2021","journal-title":"ICML"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/WACV57701.2024.00281"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72998-0_3"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02672"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00262"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00963"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6865"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01176"},{"key":"ref60","article-title":"Hierarchical text-conditional image generation with clip latents","author":"Ramesh","year":"2022","journal-title":"arXiv preprint arXiv"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46475-6_7"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.352"},{"key":"ref64","article-title":"Monocular depth estimation using diffusion models","author":"Saxena","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i11.17162"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-33715-4_54"},{"key":"ref67","article-title":"Denoising diffusion implicit models","author":"Song","year":"2020","journal-title":"arXiv preprint arXiv"},{"key":"ref68","first-page":"34369","article-title":"Distribution free domain generalization","volume-title":"International Conference on Machine Learning","author":"Tong","year":"2023"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73337-6_14"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02193"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72633-0_5"},{"key":"ref72","article-title":"Diode: A dense indoor and outdoor depth dataset","author":"Vasiljevic","year":"2019","journal-title":"arXiv preprint arXiv"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3681168"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02704"},{"key":"ref75","first-page":"1336","article-title":"Diffusion models for implicit image segmentation ensembles","author":"Wolleb","year":"2022","journal-title":"MIDL"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00117"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01204"},{"key":"ref78","article-title":"Segformer: Simple and efficient design for semantic segmentation with transformers","volume":"34","author":"Xie","year":"2021","journal-title":"NeurIPS"},{"key":"ref79","article-title":"What matters when repurposing diffusion models for general dense perception tasks?","author":"Xu","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00289"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01415"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72784-9_21"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19800-7_8"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72117-5_41"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3680906"},{"issue":"5","key":"ref86","article-title":"Bdd100k: A diverse driving video database with scalable annotation tooling","volume":"2","author":"Yu","year":"2018","journal-title":"arXiv preprint arXiv"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1399"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i7.28506"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW50498.2020.00238"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00389"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00219"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1173"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-96-0917-8_2"},{"key":"ref94","article-title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","author":"Zhang","year":"2022","journal-title":"arXiv preprint arXiv"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00275"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00791"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.00560"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.52202\/068431-0025"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.544"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00025"},{"key":"ref101","article-title":"Deformable detr: Deformable transformers for end-to-end object detection","author":"Zhu","year":"2020","journal-title":"ICLR"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11446205.pdf?arnumber=11446205","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T05:25:52Z","timestamp":1777613152000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11446205\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":101,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.00635","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}