{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,24]],"date-time":"2026-07-24T12:02:31Z","timestamp":1784894551929,"version":"3.55.0"},"reference-count":49,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"Aeronautical Science Foundation of China","award":["2022Z071077002"],"award-info":[{"award-number":["2022Z071077002"]}]},{"DOI":"10.13039\/501100005046","name":"Natural Science Foundation of Heilongjiang Province of China","doi-asserted-by":"crossref","award":["LH2021F026"],"award-info":[{"award-number":["LH2021F026"]}],"id":[{"id":"10.13039\/501100005046","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Fundamental Research Funds for Central Universities","award":["HIT.NSRIF202243"],"award-info":[{"award-number":["HIT.NSRIF202243"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2026,7]]},"DOI":"10.1007\/s00530-026-02476-7","type":"journal-article","created":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T14:44:59Z","timestamp":1783781099000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Advancing 3D scene generation through GCWA with dynamic upsampling using two-stage diffusion model"],"prefix":"10.1007","volume":"32","author":[{"given":"Shaoxun","family":"Ye","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaoguang","family":"Di","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ximing","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,7,11]]},"reference":[{"key":"2476_CR1","unstructured":"Lee, J., Im, W., Lee, S., et al.: Diffusion probabilistic models for scene-scale 3d categorical data. arXiv preprint arXiv:2301.00527 (2023)"},{"key":"2476_CR2","doi-asserted-by":"crossref","unstructured":"Liu, Y., Li, X., Li, X., : Pyramid diffusion for fine 3d large scene generation. In: Eur. Conf. Comput. Vis., pp. 71\u201387 (2024). Springer","DOI":"10.1007\/978-3-031-72890-7_5"},{"key":"2476_CR3","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D.: High-resolution image synthesis with latent diffusion models. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit, pp. 10684\u201310695. (2022)","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"2476_CR4","doi-asserted-by":"crossref","unstructured":"Peebles, W., Xie, S.: Scalable diffusion models with transformers. In: Proc. IEEE Int. Conf. Comput. Vis, pp. 4195\u20134205. (2023)","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"2476_CR5","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P., Brox, T.: U-net: Convolutional networks for biomedical image segmentation. Int. Conf. Med. Image Comput. Comput. Assist. Interv , 234\u2013241 (2015) Springer","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"2476_CR6","unstructured":"Dosovitskiy, A.: An image is worth 16x16 words: Transformers for image recognition at scale, (2020). arXiv:2010.11929 arXiv preprint"},{"issue":"3","key":"2476_CR7","doi-asserted-by":"publisher","first-page":"8439","DOI":"10.1109\/LRA.2022.3188435","volume":"7","author":"J Wilson","year":"2022","unstructured":"Wilson, J., Song, J., Fu, Y.: Motionsc: Data set and network for real-time semantic mapping in dynamic environments. IEEE Robot. Autom. 7(3), 8439\u20138446 (2022)","journal-title":"IEEE Robot. Autom."},{"key":"2476_CR8","doi-asserted-by":"crossref","unstructured":"Behley, J., Garbade, M., Milioto, A.: Semantickitti: A dataset for semantic scene understanding of lidar sequences. In: Proc. IEEE Int. Conf. Comput. Vis, pp. 9297\u20139307. (2019)","DOI":"10.1109\/ICCV.2019.00939"},{"key":"2476_CR9","first-page":"6840","volume":"33","author":"J Ho","year":"2020","unstructured":"Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. Adv. Neural. Inf. Process. Syst. 33, 6840\u20136851 (2020)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"2476_CR10","unstructured":"Nichol, A.Q., Dhariwal, P.: Improved denoising diffusion probabilistic models. Int. Conf. Mach. Learn , 8162\u20138171 (2021). (PMLR)"},{"key":"2476_CR11","unstructured":"Song, J., Meng, C., Ermon, S.: Denoising diffusion implicit models, (2020). arXiv:2010.02502 arXiv preprint"},{"key":"2476_CR12","unstructured":"Sohl-Dickstein, J., Weiss, E., Maheswaranathan, N.: Deep unsupervised learning using nonequilibrium thermodynamics. Int. Conf. Mach. Learn , 2256\u20132265 (2015). (pmlr)"},{"issue":"47","key":"2476_CR13","first-page":"1","volume":"23","author":"J Ho","year":"2022","unstructured":"Ho, J., Saharia, C., Chan, W.: Cascaded diffusion models for high fidelity image generation. J. Mach. Learn. Res. 23(47), 1\u201333 (2022)","journal-title":"J. Mach. Learn. Res."},{"key":"2476_CR14","doi-asserted-by":"publisher","first-page":"36479","DOI":"10.52202\/068431-2643","volume":"35","author":"C Saharia","year":"2022","unstructured":"Saharia, C., Chan, W., Saxena, S.: Photorealistic text-to-image diffusion models with deep language understanding. Adv. Neural. Inf. Process. Syst. 35, 36479\u201336494 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"2476_CR15","doi-asserted-by":"crossref","unstructured":"Anvekar, T., Tabib, R.A., Hegde, D.: Vg-vae: a venatus geometry point-cloud variational auto-encoder. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit, pp. 2978\u20132985. (2022)","DOI":"10.1109\/CVPRW56347.2022.00336"},{"key":"2476_CR16","first-page":"6608","volume":"34","author":"A-C Cheng","year":"2021","unstructured":"Cheng, A.-C., Li, X., Sun, M.: Learning 3d dense correspondence via canonical point autoencoder. Adv. Neural. Inf. Process. Syst. 34, 6608\u20136620 (2021)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"2476_CR17","doi-asserted-by":"crossref","unstructured":"Zhou, L., Du, Y., Wu, J.: 3d shape generation and completion through point-voxel diffusion. In: Proc. IEEE Int. Conf. Comput. Vis, pp. 5826\u20135835. (2021)","DOI":"10.1109\/ICCV48922.2021.00577"},{"key":"2476_CR18","first-page":"10021","volume":"35","author":"A Vahdat","year":"2022","unstructured":"Vahdat, A., Williams, F., Gojcic, Z.: Lion: Latent point diffusion models for 3d shape generation. Adv. Neural. Inf. Process. Syst. 35, 10021\u201310039 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"2476_CR19","doi-asserted-by":"crossref","unstructured":"Luo, S., Hu, W.: Diffusion probabilistic models for 3d point cloud generation. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit, pp. 2837\u20132845. (2021)","DOI":"10.1109\/CVPR46437.2021.00286"},{"key":"2476_CR20","doi-asserted-by":"crossref","unstructured":"Cheng, Y.-C., Lee, H.-Y., Tulyakov, S.: Sdfusion: Multimodal 3d shape completion, reconstruction, and generation. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit, pp. 4456\u20134465. (2023)","DOI":"10.1109\/CVPR52729.2023.00433"},{"key":"2476_CR21","doi-asserted-by":"crossref","unstructured":"Chen, H., Gu, J., Chen, A., : Single-stage diffusion nerf: A unified approach to 3d generation and reconstruction. In: Proc. IEEE Int. Conf. Comput. Vis., pp. 2416\u20132425 (2023)","DOI":"10.1109\/ICCV51070.2023.00229"},{"key":"2476_CR22","doi-asserted-by":"crossref","unstructured":"Erko\u00e7, Z., Ma, F., Shan, Q.: Hyperdiffusion: Generating implicit neural fields with weight-space diffusion. In: Proc. IEEE Int. Conf. Comput. Vis, pp. 14300\u201314310. (2023)","DOI":"10.1109\/ICCV51070.2023.01315"},{"issue":"2","key":"2476_CR23","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3635304","volume":"43","author":"J Hu","year":"2024","unstructured":"Hu, J., Hui, K.-H., Liu, Z.: Neural wavelet-domain diffusion for 3d shape generation, inversion, and manipulation. ACM Trans. Graphics 43(2), 1\u201318 (2024)","journal-title":"ACM Trans. Graphics"},{"key":"2476_CR24","doi-asserted-by":"crossref","unstructured":"Li, M., Duan, Y., Zhou, J.: Diffusion-sdf: Text-to-shape via voxelized diffusion. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit, pp. 12642\u201312651. (2023)","DOI":"10.1109\/CVPR52729.2023.01216"},{"key":"2476_CR25","doi-asserted-by":"crossref","unstructured":"Shue, J.R., Chan, E.R., Po, R.: 3d neural field generation using triplane diffusion. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit, pp. 20875\u201320886. (2023)","DOI":"10.1109\/CVPR52729.2023.02000"},{"key":"2476_CR26","doi-asserted-by":"publisher","first-page":"1258","DOI":"10.1109\/TNSE.2025.3593324","volume":"13","author":"H Xiang","year":"2026","unstructured":"Xiang, H., Zhang, T., Yi, C.: An optimization of feedback signal transmission and reconstruction for tactile internet: a multi-objective bayesian approach. IEEE Trans. Network Sci. Eng. 13, 1258\u20131275 (2026). https:\/\/doi.org\/10.1109\/TNSE.2025.3593324","journal-title":"IEEE Trans. Network Sci. Eng."},{"key":"2476_CR27","doi-asserted-by":"crossref","unstructured":"Xiang, H., Zhang, T., Liu, Z., Chen, L., Yi, C.: A multi-objective bayesian approach for optimizing e2e performance of nfv-based tactile internet with subjective-objective evaluation. IEEE Internet of Things Journal, 1\u20131 (2025) doi:10.1109\/JIOT.2025.3640187","DOI":"10.1109\/JIOT.2025.3640187"},{"issue":"4","key":"2476_CR28","doi-asserted-by":"publisher","first-page":"271","DOI":"10.1109\/MNET.2024.3507157","volume":"39","author":"H Xiang","year":"2025","unstructured":"Xiang, H., Yi, C., Wu, K., Chen, J., Cai, J., Niyato, D., Shen, X.: Realizing immersive communications in human digital twin by edge computing empowered tactile internet: Visions and case study. IEEE Network 39(4), 271\u2013279 (2025). https:\/\/doi.org\/10.1109\/MNET.2024.3507157","journal-title":"IEEE Network"},{"key":"2476_CR29","doi-asserted-by":"crossref","unstructured":"Tang, J., Nie, Y., Markhasin, L.: Diffuscene: Denoising diffusion models for generative indoor scene synthesis. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit, pp. 20507\u201320518. (2024)","DOI":"10.1109\/CVPR52733.2024.01938"},{"key":"2476_CR30","doi-asserted-by":"publisher","first-page":"55729","DOI":"10.52202\/079017-1771","volume":"37","author":"M Jiang","year":"2024","unstructured":"Jiang, M., Bai, Y., Cornman, A.: Scenediffuser: Efficient and controllable driving simulation initialization and rollout. Adv. Neural. Inf. Process. Syst. 37, 55729\u201355760 (2024)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"2476_CR31","doi-asserted-by":"crossref","unstructured":"Lee, J., Lee, S., Jo, C., : Semcity: Semantic scene generation with triplane diffusion. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit., pp. 28337\u201328347 (2024)","DOI":"10.1109\/CVPR52733.2024.02677"},{"key":"2476_CR32","doi-asserted-by":"crossref","unstructured":"Wang, J., Chen, K., Xu, R.: Carafe: Content-aware reassembly of features. In: Proc. IEEE Int. Conf. Comput. Vis, pp. 3007\u20133016. (2019)","DOI":"10.1109\/ICCV.2019.00310"},{"key":"2476_CR33","doi-asserted-by":"crossref","unstructured":"Lu, H., Liu, W., Fu, H.: Fade: Fusing the assets of decoder and encoder for task-agnostic upsampling. In: Eur. Conf. Comput. Vis, pp. 231\u2013247. Springer (2022)","DOI":"10.1007\/978-3-031-19812-0_14"},{"key":"2476_CR34","doi-asserted-by":"publisher","first-page":"20889","DOI":"10.52202\/068431-1519","volume":"35","author":"H Lu","year":"2022","unstructured":"Lu, H., Liu, W., Ye, Z.: Sapa: Similarity-aware point affiliation for feature upsampling. Adv. Neural. Inf. Process. Syst. 35, 20889\u201320901 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"2476_CR35","doi-asserted-by":"crossref","unstructured":"Dai, J., Qi, H., Xiong, Y.: Deformable convolutional networks. In: Proc. IEEE Int. Conf. Comput. Vis, pp. 764\u2013773. (2017)","DOI":"10.1109\/ICCV.2017.89"},{"key":"2476_CR36","doi-asserted-by":"crossref","unstructured":"Zhu, X., Hu, H., Lin, S.: Deformable convnets v2: More deformable, better results. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit, pp. 9308\u20139316. (2019)","DOI":"10.1109\/CVPR.2019.00953"},{"key":"2476_CR37","unstructured":"Zhu, X., Su, W., Lu, L.: Deformable detr: Deformable transformers for end-to-end object detection, (2020). arXiv:2010.04159 arXiv preprint"},{"key":"2476_CR38","unstructured":"Liu, W., Lu, H., Fu, H.: Learning to upsample by learning to sample. In: Proc. IEEE Int. Conf. Comput. Vis, pp. 6027\u20136037. (2023)"},{"key":"2476_CR39","first-page":"17981","volume":"34","author":"J Austin","year":"2021","unstructured":"Austin, J., Johnson, D.D., Ho, J.: Structured denoising diffusion models in discrete state-spaces. Adv. Neural. Inf. Process. Syst. 34, 17981\u201317993 (2021)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"2476_CR40","doi-asserted-by":"crossref","unstructured":"Shi, W., Caballero, J., Husz\u00e1r, F.: Real-time single image and video super-resolution using an efficient sub-pixel convolutional neural network. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit, pp. 1874\u20131883. (2016)","DOI":"10.1109\/CVPR.2016.207"},{"key":"2476_CR41","volume-title":"Attention is all you need","author":"A Vaswani","year":"2017","unstructured":"Vaswani, A.: Attention is all you need. Adv. Neural Inf. Process, Syst (2017)"},{"key":"2476_CR42","unstructured":"Heusel, M., Ramsauer, H., Unterthiner, T.: Gans trained by a two time-scale update rule converge to a local nash equilibrium. Adv. Neural. Inf. Process. Syst. , 30 (2017)"},{"key":"2476_CR43","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Vanhoucke, V., Ioffe, S.: Rethinking the inception architecture for computer vision. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit, pp. 2818\u20132826. (2016)","DOI":"10.1109\/CVPR.2016.308"},{"issue":"12","key":"2476_CR44","doi-asserted-by":"publisher","first-page":"2481","DOI":"10.1109\/TPAMI.2016.2644615","volume":"39","author":"V Badrinarayanan","year":"2017","unstructured":"Badrinarayanan, V., Kendall, A., Cipolla, R.: Segnet: A deep convolutional encoder-decoder architecture for image segmentation. IEEE Trans. Pattern Anal. Mach. Intell. 39(12), 2481\u20132495 (2017)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2476_CR45","unstructured":"Graham, B., Maaten, L.: Submanifold sparse convolutional networks, (2017). arXiv:1706.01307 arXiv preprint"},{"key":"2476_CR46","unstructured":"Qi, C.R., Yi, L., Su, H., et al.: Pointnet++: Deep hierarchical feature learning on point sets in a metric space. Adv. Neural Inf. Process. Syst. 30 (2017)"},{"key":"2476_CR47","doi-asserted-by":"crossref","unstructured":"Graham, B., Engelcke, M., Van Der Maaten, L.: 3d semantic segmentation with submanifold sparse convolutional networks. In: Proc. IEEE Conf. Comput. Vis. Pattern Recognit, pp. 9224\u20139232. (2018)","DOI":"10.1109\/CVPR.2018.00961"},{"key":"2476_CR48","doi-asserted-by":"publisher","first-page":"98","DOI":"10.1007\/s11263-014-0733-5","volume":"111","author":"M Everingham","year":"2015","unstructured":"Everingham, M., Eslami, S.A., Van Gool, L.: The pascal visual object classes challenge: A retrospective. Int. J. Comput. Vis. 111, 98\u2013136 (2015)","journal-title":"Int. J. Comput. Vis."},{"key":"2476_CR49","unstructured":"Loshchilov, I., Hutter, F.: Decoupled weight decay regularization, (2017). arXiv:1711.05101 arXiv preprint"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-026-02476-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-026-02476-7","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-026-02476-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,24]],"date-time":"2026-07-24T11:29:46Z","timestamp":1784892586000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-026-02476-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7]]},"references-count":49,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2026,7]]}},"alternative-id":["2476"],"URL":"https:\/\/doi.org\/10.1007\/s00530-026-02476-7","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,7]]},"assertion":[{"value":"12 October 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 May 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"11 July 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"The authors declare that they have no known competing financial interests or personal relationships that could have appeared to influence the work reported in this paper.","order":1,"name":"Ethics","label":"Conflict of interest","group":{"name":"EthicsHeading","label":"Declarations"}}],"article-number":"416"}}