{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,23]],"date-time":"2026-06-23T20:47:01Z","timestamp":1782247621013,"version":"3.54.5"},"reference-count":46,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"CCF-Tencent Rhino-Bird Funds"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. on Image Process."],"published-print":{"date-parts":[[2026]]},"DOI":"10.1109\/tip.2026.3698363","type":"journal-article","created":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T19:58:29Z","timestamp":1780603109000},"page":"6211-6220","source":"Crossref","is-referenced-by-count":0,"title":["Rethinking Token-Wise Feature Caching: Accelerating Diffusion Transformers With Dual Feature Caching"],"prefix":"10.1109","volume":"35","author":[{"given":"Chang","family":"Zou","sequence":"first","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-1999-4619","authenticated-orcid":false,"given":"Shikang","family":"Zheng","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Evelyn","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Runlin","family":"Guo","sequence":"additional","affiliation":[{"name":"Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haohang","family":"Xu","sequence":"additional","affiliation":[{"name":"Huawei Technologies Ltd., Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhengyi","family":"Shi","sequence":"additional","affiliation":[{"name":"Xiamen University, Xiamen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8697-695X","authenticated-orcid":false,"given":"Conghui","family":"He","sequence":"additional","affiliation":[{"name":"Shanghai AI Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xuming","family":"Hu","sequence":"additional","affiliation":[{"name":"The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3341-183X","authenticated-orcid":false,"given":"Linfeng","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume-title":"Proc. NIPS","volume":"33","author":"Ho"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref3","article-title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","author":"Blattmann","year":"2023","journal-title":"arXiv:2311.15127"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"ref5","volume-title":"DiT4Edit: Diffusion Transformer for Image Editing","author":"Feng et al","year":"2024"},{"key":"ref6","article-title":"$\\Delta$\n-DiT: A training-free acceleration method tailored for diffusion transformers","author":"Chen","year":"2024","journal-title":"arXiv:2406.01125"},{"key":"ref7","article-title":"Learning-to-cache: Accelerating diffusion transformer via layer caching","author":"Ma","year":"2024","journal-title":"arXiv:2406.01733"},{"key":"ref8","article-title":"Fora: Fast-forward caching in diffusion transformer acceleration","author":"Selvaraju","year":"2024","journal-title":"arXiv:2407.01425"},{"key":"ref9","article-title":"Accelerating diffusion transformers with token-wise feature caching","author":"Zou","year":"2024","journal-title":"arXiv:2410.05317"},{"key":"ref10","first-page":"14205","article-title":"Denoising diffusion implicit models","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Song"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.52202\/068431-0418"},{"key":"ref12","article-title":"DPM-solver++: Fast solver for guided sampling of diffusion probabilistic models","author":"Lu","year":"2022","journal-title":"arXiv:2211.01095"},{"key":"ref13","first-page":"23666","article-title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","volume-title":"Proc. 11th Int. Conf. Learn. Represent.","author":"Liu"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW59228.2023.00484"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0731"},{"key":"ref16","first-page":"90530","article-title":"SVDQuant: Absorbing outliers by low-rank components for 4-bit diffusion models","volume-title":"Proc. 13th Int. Conf. Learn. Represent.","author":"Li"},{"key":"ref17","article-title":"Sparse VideoGen: Accelerating video diffusion transformers with spatial\u2013temporal sparsity","author":"Xi","year":"2025","journal-title":"arXiv:2502.01776"},{"key":"ref18","article-title":"Sparse VideoGen2: Accelerate video generation with sparse attention via semantic-aware permutation","author":"Yang","year":"2025","journal-title":"arXiv:2505.18875"},{"key":"ref19","article-title":"TurboDiffusion: Accelerating video diffusion models by 100\u2013200 times","author":"Zhang","year":"2025","journal-title":"arXiv:2512.16093"},{"key":"ref20","first-page":"65038","article-title":"SageAttention: Accurate 8-bit attention for plug-and-play inference acceleration","volume-title":"Proc. Int. Conf. Learn. Represent. (ICLR)","author":"Zhang"},{"key":"ref21","first-page":"75097","article-title":"SageAttention2: Efficient attention with thorough outlier smoothing and per-thread INT4 quantization","volume-title":"Proc. Int. Conf. Mach. Learn. (ICML)","author":"Zhang"},{"key":"ref22","article-title":"SANA: Efficient high-resolution image synthesis with linear diffusion transformer","author":"Xie","year":"2024","journal-title":"arXiv:2410.10629"},{"key":"ref23","article-title":"SANA 1.5: Efficient scaling of training-time and inference-time compute in linear diffusion transformer","author":"Xie","year":"2025","journal-title":"arXiv:2501.18427"},{"key":"ref24","article-title":"SANA-Video: Efficient video generation with block linear diffusion transformer","author":"Chen","year":"2025","journal-title":"arXiv:2509.24695"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01502"},{"key":"ref26","first-page":"52032","article-title":"PolaFormer: Polarity-aware linear attention for vision transformers","volume-title":"Proc. 13th Int. Conf. Learn. Represent.","author":"Meng"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01492"},{"key":"ref28","article-title":"Real-time video generation with pyramid attention broadcast","author":"Zhao","year":"2024","journal-title":"arXiv:2408.12588"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1145\/3746027.3755009"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01636"},{"key":"ref31","first-page":"15853","article-title":"From reusing to forecasting: Accelerating diffusion models with taylorseers","volume-title":"Proc. IEEE\/CVF Int. Conf. Comput. Vis. (ICCV)","author":"Liu"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1145\/3746027.3755479"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1145\/3746027.3755331"},{"key":"ref34","article-title":"FreqCa: Accelerating diffusion models via frequency-aware caching","author":"Liu","year":"2025","journal-title":"arXiv:2510.08669"},{"issue":"5","key":"ref35","doi-asserted-by":"crossref","DOI":"10.1061\/(ASCE)CP.1943-5487.0001034","article-title":"AdaLN: A vision transformer for multidomain learning and predisaster building information extraction from images","volume":"36","author":"Guo","year":"2022","journal-title":"J. Comput. Civil Eng."},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1189"},{"key":"ref37","volume-title":"FLUX","author":"Labs","year":"2024"},{"key":"ref38","volume-title":"Open-Sora: Democratizing Efficient Video Production for All","author":"Zheng","year":"2024"},{"key":"ref39","first-page":"10144","article-title":"PixArt-$\\alpha$\n: Fast training of diffusion transformer for photorealistic text-to-image synthesis","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Chen"},{"key":"ref40","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","author":"Saharia","year":"2022","journal-title":"arXiv:2205.11487"},{"key":"ref41","article-title":"ImageReward: Learning and evaluating human preferences for text-to-image generation","author":"Xu","year":"2023","journal-title":"arXiv:2304.05977"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2270"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02060"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref45","first-page":"6626","article-title":"GANs trained by a two time-scale update rule converge to a local Nash equilibrium","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"30","author":"Heusel"},{"key":"ref46","article-title":"Cross-attention makes inference cumbersome in text-to-image diffusion models","author":"Zhang","year":"2024","journal-title":"arXiv:2404.02747v1"}],"container-title":["IEEE Transactions on Image Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/83\/11355710\/11551851.pdf?arnumber=11551851","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,23]],"date-time":"2026-06-23T19:47:29Z","timestamp":1782244049000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11551851\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":46,"URL":"https:\/\/doi.org\/10.1109\/tip.2026.3698363","relation":{},"ISSN":["1057-7149","1941-0042"],"issn-type":[{"value":"1057-7149","type":"print"},{"value":"1941-0042","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}