{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T12:04:12Z","timestamp":1784203452885,"version":"3.55.0"},"reference-count":56,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/100032267","name":"Key Laboratory of Software Engineering of Yunnan Province","doi-asserted-by":"publisher","award":["2023SE103"],"award-info":[{"award-number":["2023SE103"]}],"id":[{"id":"10.13039\/100032267","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62472137"],"award-info":[{"award-number":["62472137"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neural Networks"],"published-print":{"date-parts":[[2026,10]]},"DOI":"10.1016\/j.neunet.2026.109058","type":"journal-article","created":{"date-parts":[[2026,5,7]],"date-time":"2026-05-07T23:30:00Z","timestamp":1778196600000},"page":"109058","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Object-centric image editing via position-structure guided diffusion"],"prefix":"10.1016","volume":"202","author":[{"given":"Qi","family":"Si","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiangrui","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bo","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhao","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mingbo","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yun","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haijun","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"4","key":"10.1016\/j.neunet.2026.109058_bib0001","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3592450","article-title":"Blended latent diffusion","volume":"42","author":"Avrahami","year":"2023","journal-title":"ACM Transactions on Graphics (TOG)"},{"key":"10.1016\/j.neunet.2026.109058_bib0002","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"18208","article-title":"Blended diffusion for text-driven editing of natural images","author":"Avrahami","year":"2022"},{"key":"10.1016\/j.neunet.2026.109058_bib0003","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision","first-page":"22560","article-title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing","author":"Cao","year":"2023"},{"key":"10.1016\/j.neunet.2026.109058_bib0004","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision","first-page":"9650","article-title":"Emerging properties in self-supervised vision transformers","author":"Caron","year":"2021"},{"key":"10.1016\/j.neunet.2026.109058_bib0005","doi-asserted-by":"crossref","first-page":"9353","DOI":"10.52202\/075280-0410","article-title":"Textdiffuser: Diffusion models as text painters","volume":"36","author":"Chen","year":"2023","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.neunet.2026.109058_bib0006","series-title":"European conference on computer vision","first-page":"386","article-title":"Textdiffuser-2: Unleashing the power of language models for text rendering","author":"Chen","year":"2024"},{"key":"10.1016\/j.neunet.2026.109058_bib0007","unstructured":"Couairon, G., Verbeek, J., Schwenk, H., & Cord, M. (2022). Diffedit: Diffusion-based semantic image editing with mask guidance. arXiv: 2210.11427."},{"key":"10.1016\/j.neunet.2026.109058_bib0008","first-page":"8780","article-title":"Diffusion models beat gans on image synthesis","volume":"34","author":"Dhariwal","year":"2021","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.neunet.2026.109058_bib0009","series-title":"Advances in neural information processing systems","first-page":"8780","article-title":"Diffusion models beat GANs on image synthesis","volume":"vol. 34","author":"Dhariwal","year":"2021"},{"key":"10.1016\/j.neunet.2026.109058_bib0010","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107754","article-title":"Shaping pre-trained language models for task-specific embedding generation via consistency calibration","volume":"191","author":"Gao","year":"2025","journal-title":"Neural Networks"},{"key":"10.1016\/j.neunet.2026.109058_bib0011","article-title":"Generative adversarial nets","volume":"27","author":"Goodfellow","year":"2014","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.neunet.2026.109058_bib0012","doi-asserted-by":"crossref","unstructured":"Hessel, J., Holtzman, A., Forbes, M., Bras, R. L., & Choi, Y. (2021). Clipscore: A reference-free evaluation metric for image captioning. arXiv: 2104.08718.","DOI":"10.18653\/v1\/2021.emnlp-main.595"},{"key":"10.1016\/j.neunet.2026.109058_bib0013","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume":"33","author":"Ho","year":"2020","journal-title":"Advances in Neural Information Pocessing Systems"},{"key":"10.1016\/j.neunet.2026.109058_bib0014","series-title":"Advances in neural information processing systems","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume":"Vol. 33","author":"Ho","year":"2020"},{"key":"10.1016\/j.neunet.2026.109058_bib0015","unstructured":"Ho, J., & Salimans, T. (2022). Classifier-free diffusion guidance. arXiv: 2207.12598."},{"key":"10.1016\/j.neunet.2026.109058_bib0016","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2024.106777","article-title":"Pfb-diff: Progressive feature blending diffusion for text-driven image editing","volume":"181","author":"Huang","year":"2025","journal-title":"Neural Networks"},{"key":"10.1016\/j.neunet.2026.109058_bib0017","unstructured":"Ju, X., Zeng, A., Bian, Y., Liu, S., & Xu, Q. (2023). Direct inversion: Boosting diffusion-based editing with 3 lines of code. https:\/\/arxiv.org\/abs\/2310.01506."},{"key":"10.1016\/j.neunet.2026.109058_bib0018","series-title":"Bounded editing: Multi-object image manipulation with region-specific control","first-page":"1122-1129","author":"Kang","year":"2025"},{"key":"10.1016\/j.neunet.2026.109058_bib0019","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"6007","article-title":"Imagic: Text-based real image editing with diffusion models","author":"Kawar","year":"2023"},{"key":"10.1016\/j.neunet.2026.109058_bib0020","series-title":"Predicting Structured Data","article-title":"A tutorial on energy-based learning","volume":"vol. 1","author":"LeCun","year":"2006"},{"key":"10.1016\/j.neunet.2026.109058_bib0021","series-title":"Proceedings of the computer vision and pattern recognition conference (CVPR)","first-page":"2683","article-title":"Moedit: On learning quantity perception for multi-object image editing","author":"Li","year":"2025"},{"key":"10.1016\/j.neunet.2026.109058_bib0022","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"7817","article-title":"Towards understanding cross and self-attention in stable diffusion for text-guided image editing","author":"Liu","year":"2024"},{"key":"10.1016\/j.neunet.2026.109058_bib0023","series-title":"Proceedings of the IEEE\/CVF winter conference on applications of computer vision","first-page":"289","article-title":"More control for free! image synthesis with semantic diffusion guidance","author":"Liu","year":"2023"},{"key":"10.1016\/j.neunet.2026.109058_bib0024","article-title":"Information constraints on auto-encoding variational bayes","volume":"31","author":"Lopez","year":"2018","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.neunet.2026.109058_bib0025","article-title":"G-neuroDAVIS: A generative model for data visualization through a generalized embedding","author":"Maitra","year":"2025","journal-title":"Neural Networks"},{"key":"10.1016\/j.neunet.2026.109058_bib0026","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"9192","article-title":"Contrastive denoising score for text-guided latent diffusion image editing","author":"Nam","year":"2024"},{"key":"10.1016\/j.neunet.2026.109058_bib0027","unstructured":"Nguyen, T.-T., Nguyen, D.-A., Tran, A., & Pham, C. (2024). Flexedit: Flexible and controllable diffusion-based object-centric image editing. https:\/\/arxiv.org\/abs\/2403.18605."},{"key":"10.1016\/j.neunet.2026.109058_bib0028","doi-asserted-by":"crossref","unstructured":"Nguyen, T.-T., Nguyen, Q., Nguyen, K., Tran, A., & Pham, C. (2025). Swiftedit: Lightning fast text-guided image editing via one-step diffusion. https:\/\/arxiv.org\/abs\/2412.04301.","DOI":"10.1109\/CVPR52734.2025.02002"},{"key":"10.1016\/j.neunet.2026.109058_bib0029","unstructured":"Nichol, A., Dhariwal, P., Ramesh, A., Shyam, P., Mishkin, P., McGrew, B., Sutskever, I., & Chen, M. (2021). Glide: Towards photorealistic image generation and editing with text-guided diffusion models. arXiv: 2112.10741."},{"key":"10.1016\/j.neunet.2026.109058_bib0030","unstructured":"Pan, L., Zhang, T., Chen, B., Zhou, Q., Ke, W., S\u00fcsstrunk, S., & Salzmann, M. (2024). Coherent and multi-modality image inpainting via latent space optimization. arXiv: 2407.08019."},{"key":"10.1016\/j.neunet.2026.109058_bib0031","series-title":"Proceedings of the computer vision and pattern recognition conference (CVPR)","first-page":"2791","article-title":"Compass control: Multi object orientation control for text-to-image generation","author":"Parihar","year":"2025"},{"key":"10.1016\/j.neunet.2026.109058_bib0032","unstructured":"Ren, T., Liu, S., Zeng, A., Lin, J., Li, K., Cao, H., Chen, J., Huang, X., Chen, Y., Yan, F., Zeng, Z., Zhang, H., Li, F., Yang, J., Li, H., Jiang, Q., & Zhang, L. (2024). Grounded SAM: Assembling open-world models for diverse visual tasks. https:\/\/arxiv.org\/abs\/2401.14159."},{"key":"10.1016\/j.neunet.2026.109058_bib0033","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"10684","article-title":"High-resolution image synthesis with latent diffusion models","author":"Rombach","year":"2022"},{"key":"10.1016\/j.neunet.2026.109058_bib0034","doi-asserted-by":"crossref","first-page":"36479","DOI":"10.52202\/068431-2643","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","volume":"35","author":"Saharia","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.neunet.2026.109058_bib0035","doi-asserted-by":"crossref","first-page":"143","DOI":"10.1016\/j.neunet.2023.08.055","article-title":"Symmetric LINEX loss twin support vector machine for robust classification and its fast iterative algorithm","volume":"168","author":"Si","year":"2023","journal-title":"Neural Networks"},{"key":"10.1016\/j.neunet.2026.109058_bib0036","doi-asserted-by":"crossref","DOI":"10.1016\/j.asoc.2025.113317","article-title":"A kernel-free quadratic surface twin support vector machine with capped l1-norm distance metric for robust classification","volume":"180","author":"Si","year":"2025","journal-title":"Applied Soft Computing"},{"key":"10.1016\/j.neunet.2026.109058_bib0037","unstructured":"Song, J., Meng, C., & Ermon, S. (2020). Denoising diffusion implicit models. arXiv: 2010.02502."},{"key":"10.1016\/j.neunet.2026.109058_bib0038","unstructured":"Wang, K., Song, X., Liu, M., Yuan, J., & Guan, W. (2025a). Vision-guided and mask-enhanced adaptive denoising for prompt-based image editing. https:\/\/arxiv.org\/abs\/2410.10496."},{"key":"10.1016\/j.neunet.2026.109058_bib0039","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107915","article-title":"Long-range diffusion for weakly camouflaged object segmentation","author":"Wang","year":"2025","journal-title":"Neural Networks"},{"key":"10.1016\/j.neunet.2026.109058_bib0040","article-title":"Point2pix-zero: Point-driven refined diffusion for multi-object image editing","volume":"170","author":"Wang","year":"2025","journal-title":"Pattern Recognition"},{"key":"10.1016\/j.neunet.2026.109058_bib0041","unstructured":"Xu, S., Huang, Y., Pan, J., Ma, Z., & Chai, J. (2023). Inversion-free image editing with natural language. https:\/\/arxiv.org\/abs\/2312.04965."},{"key":"10.1016\/j.neunet.2026.109058_bib0042","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107695","article-title":"Adversarial regularized diffusion model for fair recommendations","volume":"190","author":"Yang","year":"2025","journal-title":"Neural Networks"},{"key":"10.1016\/j.neunet.2026.109058_bib0043","unstructured":"Yang, X., Zhu, L., Fan, H., & Yang, Y. (2024a). Eva: Zero-shot accurate attributes and multi-object video editing. https:\/\/arxiv.org\/abs\/2403.16111."},{"key":"10.1016\/j.neunet.2026.109058_bib0044","unstructured":"Yang, Z., Ding, G., Wang, W., Chen, H., Zhuang, B., & Shen, C. (2024b). Object-aware inversion and reassembly for image editing. https:\/\/arxiv.org\/abs\/2310.12149."},{"key":"10.1016\/j.neunet.2026.109058_bib0045","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision","first-page":"23174","article-title":"Freedom: Training-free energy-guided conditional diffusion model","author":"Yu","year":"2023"},{"key":"10.1016\/j.neunet.2026.109058_bib0046","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision","first-page":"3836","article-title":"Adding conditional control to text-to-image diffusion models","author":"Zhang","year":"2023"},{"key":"10.1016\/j.neunet.2026.109058_bib0047","series-title":"Proceedings of the international joint conference on artificial intelligence","first-page":"7946","article-title":"Towards highly realistic artistic style transfer via stable diffusion with step-aware and layer-aware prompt","author":"Zhang","year":"2024"},{"key":"10.1016\/j.neunet.2026.109058_bib0048","doi-asserted-by":"crossref","DOI":"10.1016\/j.engappai.2025.111005","article-title":"Vectorsketcher: Learning to create a vector-based free-hand sketch","volume":"156","author":"Zhang","year":"2025","journal-title":"Engineering Applications of Artificial Intelligence"},{"key":"10.1016\/j.neunet.2026.109058_bib0049","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2025.129434","article-title":"Lgast: Towards high-quality arbitrary style transfer with local-global style learning","volume":"623","author":"Zhang","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neunet.2026.109058_bib0050","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"15745","article-title":"Artbank: Artistic style transfer with pre-trained diffusion model and implicit style prompt bank","volume":"Vol. 38","author":"Zhang","year":"2024"},{"key":"10.1016\/j.neunet.2026.109058_bib0051","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107556","article-title":"Spast: Arbitrary style transfer with style priors via pre-trained large-scale model","volume":"189","author":"Zhang","year":"2025","journal-title":"Neural Networks"},{"key":"10.1016\/j.neunet.2026.109058_bib0052","doi-asserted-by":"crossref","first-page":"3609","DOI":"10.52202\/068431-0261","article-title":"Egsde: Unpaired image-to-image translation via energy-guided stochastic differential equations","volume":"35","author":"Zhao","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.neunet.2026.109058_bib0053","series-title":"European conference on computer vision","first-page":"350","article-title":"Detecting twenty-thousand classes using image-level supervision","author":"Zhou","year":"2022"},{"key":"10.1016\/j.neunet.2026.109058_bib0054","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107814","article-title":"Key features-guided multi-view collaborative network for image captioning","volume":"191","author":"Zhu","year":"2025","journal-title":"Neural Networks"},{"key":"10.1016\/j.neunet.2026.109058_bib0055","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"7864","article-title":"Towards efficient diffusion-based image editing with instant attention masks","volume":"Vol. 38","author":"Zou","year":"2024"},{"key":"10.1016\/j.neunet.2026.109058_bib0056","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2024.106818","article-title":"Cut-and-paste: Subject-driven video editing with attention control","volume":"181","author":"Zuo","year":"2025","journal-title":"Neural Networks"}],"container-title":["Neural Networks"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0893608026005186?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0893608026005186?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T11:11:29Z","timestamp":1784200289000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0893608026005186"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,10]]},"references-count":56,"alternative-id":["S0893608026005186"],"URL":"https:\/\/doi.org\/10.1016\/j.neunet.2026.109058","relation":{},"ISSN":["0893-6080"],"issn-type":[{"value":"0893-6080","type":"print"}],"subject":[],"published":{"date-parts":[[2026,10]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Object-centric image editing via position-structure guided diffusion","name":"articletitle","label":"Article Title"},{"value":"Neural Networks","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neunet.2026.109058","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"109058"}}