{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,26]],"date-time":"2026-07-26T14:04:39Z","timestamp":1785074679846,"version":"3.55.0"},"reference-count":45,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"funder":[{"DOI":"10.13039\/100010097","name":"China Association for Science and Technology","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100010097","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Array"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.array.2026.100973","type":"journal-article","created":{"date-parts":[[2026,6,6]],"date-time":"2026-06-06T06:42:37Z","timestamp":1780728157000},"page":"100973","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["ViMGS-SLAM: A real-time monocular 3DGS-based SLAM via multiscale vision transformers"],"prefix":"10.1016","volume":"31","author":[{"ORCID":"https:\/\/orcid.org\/0009-0009-2359-9101","authenticated-orcid":false,"given":"Huixin","family":"Zhu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Junyang","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yutie","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chen","family":"Xie","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Fan","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiayi","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"1","key":"10.1016\/j.array.2026.100973_b1","doi-asserted-by":"crossref","first-page":"15","DOI":"10.1007\/s10846-022-01643-y","article-title":"Real-time artificial intelligence based visual simultaneous localization and mapping in dynamic environments\u2013a review","volume":"105","author":"Wan Aasim","year":"2022","journal-title":"J Intell Robot Syst"},{"issue":"1","key":"10.1016\/j.array.2026.100973_b2","doi-asserted-by":"crossref","first-page":"28","DOI":"10.1108\/IR-04-2024-0166","article-title":"Visual SLAM algorithm in dynamic environment based on deep learning","volume":"52","author":"Yu","year":"2025","journal-title":"Ind Robot Int J"},{"key":"10.1016\/j.array.2026.100973_b3","doi-asserted-by":"crossref","DOI":"10.1109\/TNNLS.2025.3552598","article-title":"A survey on self-supervised monocular depth estimation based on deep neural networks","author":"Dong","year":"2025","journal-title":"IEEE Trans Neural Networks Learn Syst"},{"key":"10.1016\/j.array.2026.100973_b4","series-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020"},{"issue":"08","key":"10.1016\/j.array.2026.100973_b5","doi-asserted-by":"crossref","DOI":"10.1142\/S0218001425560014","article-title":"Few-shot counting with multi-scale vision transformers and attention mechanisms","volume":"39","author":"Chen","year":"2025","journal-title":"Int J Pattern Recognit Artif Intell"},{"issue":"3","key":"10.1016\/j.array.2026.100973_b6","doi-asserted-by":"crossref","first-page":"215","DOI":"10.1007\/s10489-024-06207-1","article-title":"Efficient knowledge distillation using a shift window target-aware transformer","volume":"55","author":"Feng","year":"2025","journal-title":"Appl Intell"},{"key":"10.1016\/j.array.2026.100973_b7","article-title":"ViT-MVT: A unified vision transformer network for multiple vision tasks","author":"Xie","year":"2023","journal-title":"IEEE Trans Neural Networks Learn Syst"},{"issue":"4","key":"10.1016\/j.array.2026.100973_b8","doi-asserted-by":"crossref","first-page":"139.1","DOI":"10.1145\/3592433","article-title":"3D Gaussian splatting for real-time radiance field rendering","volume":"42","author":"Kerbl","year":"2023","journal-title":"ACM Trans Graph"},{"key":"10.1016\/j.array.2026.100973_b9","article-title":"Dense monocular SLAM in real-time with structured Gaussian representation","author":"Liu","year":"2025","journal-title":"IEEE Rob Autom Lett"},{"key":"10.1016\/j.array.2026.100973_b10","series-title":"Vings-mono: Visual-inertial gaussian splatting monocular slam in large scenes","author":"Wu","year":"2025"},{"key":"10.1016\/j.array.2026.100973_b11","series-title":"Photoreg: Photometrically registering 3d gaussian splatting models","author":"Yuan","year":"2024"},{"key":"10.1016\/j.array.2026.100973_b12","series-title":"Lm-gaussian: Boost sparse-view 3d gaussian splatting with large model priors","author":"Yu","year":"2024"},{"issue":"4","key":"10.1016\/j.array.2026.100973_b13","doi-asserted-by":"crossref","first-page":"613","DOI":"10.1007\/s41095-024-0436-y","article-title":"Recent advances in 3d gaussian splatting","volume":"10","author":"Wu","year":"2024","journal-title":"Comput Vis Media"},{"key":"10.1016\/j.array.2026.100973_b14","series-title":"The replica dataset: A digital replica of indoor spaces","author":"Straub","year":"2019"},{"key":"10.1016\/j.array.2026.100973_b15","doi-asserted-by":"crossref","unstructured":"Zhu Zihan, Peng Songyou, Larsson Viktor, Xu Weiwei, Bao Hujun, Cui Zhaopeng, Oswald Martin R, Pollefeys Marc. Nice-slam: Neural implicit scalable encoding for slam. In: IEEE conf. comput. vis. pattern recognit. 2022, p. 12786\u201396.","DOI":"10.1109\/CVPR52688.2022.01245"},{"key":"10.1016\/j.array.2026.100973_b16","series-title":"Int. symp. mix augment. real","first-page":"499","article-title":"Vox-fusion: Dense tracking and mapping with voxel-based neural implicit representation","author":"Yang","year":"2022"},{"key":"10.1016\/j.array.2026.100973_b17","doi-asserted-by":"crossref","unstructured":"Wang Hengyi, Wang Jingwen, Agapito Lourdes. Co-slam: Joint coordinate and sparse parametric encodings for neural real-time slam. In: Proc. IEEE\/CVF conf. comput. vis. pattern recognit. 2023, p. 13293\u2013302.","DOI":"10.1109\/CVPR52729.2023.01277"},{"key":"10.1016\/j.array.2026.100973_b18","doi-asserted-by":"crossref","unstructured":"Yan Chi, Qu Delin, Xu Dan, Zhao Bin, Wang Zhigang, Wang Dong, Li Xuelong. Gs-slam: Dense visual slam with 3d gaussian splatting. In: IEEE conf. comput. vis. pattern recognit. 2024, p. 19595\u2013604.","DOI":"10.1109\/CVPR52733.2024.01853"},{"key":"10.1016\/j.array.2026.100973_b19","doi-asserted-by":"crossref","unstructured":"Keetha Nikhil, Karhade Jay, Jatavallabhula Krishna Murthy, Yang Gengshan, Scherer Sebastian, Ramanan Deva, Luiten Jonathon. Splatam: Splat track & map 3d gaussians for dense rgb-d slam. In: IEEE conf. comput. vis. pattern recognit. 2024, p. 21357\u201366.","DOI":"10.1109\/CVPR52733.2024.02018"},{"key":"10.1016\/j.array.2026.100973_b20","doi-asserted-by":"crossref","unstructured":"Matsuki Hidenobu, Murai Riku, Kelly Paul HJ, Davison Andrew J. Gaussian splatting slam. In: IEEE conf. comput. vis. pattern recognit. 2024, p. 18039\u201348.","DOI":"10.1109\/CVPR52733.2024.01708"},{"key":"10.1016\/j.array.2026.100973_b21","article-title":"Depth map prediction from a single image using a multi-scale deep network","volume":"27","author":"Eigen","year":"2014","journal-title":"Adv Neural Inf Process Syst"},{"key":"10.1016\/j.array.2026.100973_b22","doi-asserted-by":"crossref","unstructured":"Eigen David, Fergus Rob. Predicting depth, surface normals and semantic labels with a common multi-scale convolutional architecture. In: Proc. IEEE int. conf. comput. vis. 2015, p. 2650\u20138.","DOI":"10.1109\/ICCV.2015.304"},{"issue":"4","key":"10.1016\/j.array.2026.100973_b23","doi-asserted-by":"crossref","first-page":"2396","DOI":"10.1109\/TPAMI.2023.3330944","article-title":"Monocular depth estimation: A thorough review","volume":"46","author":"Arampatzakis","year":"2023","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"10","key":"10.1016\/j.array.2026.100973_b24","doi-asserted-by":"crossref","first-page":"2410","DOI":"10.1109\/TPAMI.2019.2936024","article-title":"Semi-supervised adversarial monocular depth estimation","volume":"42","author":"Ji","year":"2019","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"5","key":"10.1016\/j.array.2026.100973_b25","doi-asserted-by":"crossref","first-page":"690","DOI":"10.3390\/sym11050690","article-title":"A semi-supervised monocular stereo matching method","volume":"11","author":"Zhang","year":"2019","journal-title":"Symmetry-Basel"},{"issue":"5","key":"10.1016\/j.array.2026.100973_b26","doi-asserted-by":"crossref","first-page":"115","DOI":"10.1007\/s00138-024-01586-4","article-title":"Dyna-MSDepth: multi-scale self-supervised monocular depth estimation network for visual SLAM in dynamic scenes","volume":"35","author":"Yao","year":"2024","journal-title":"Mach Vis Appl"},{"issue":"5","key":"10.1016\/j.array.2026.100973_b27","doi-asserted-by":"crossref","DOI":"10.3934\/era.2024163","article-title":"Hybrid self-supervised monocular visual odometry system based on spatio-temporal features","volume":"32","author":"Yuan","year":"2024","journal-title":"Electron Res Arch"},{"key":"10.1016\/j.array.2026.100973_b28","first-page":"1","article-title":"Weakly supervised 3-d building reconstruction from monocular remote sensing images","volume":"62","author":"Li","year":"2024","journal-title":"IEEE Trans Geosci Remote Sens"},{"key":"10.1016\/j.array.2026.100973_b29","doi-asserted-by":"crossref","unstructured":"Guizilini Vitor, Vasiljevic Igor, Chen Dian, Ambru\u015f Rare\u015f, Gaidon Adrien. Towards zero-shot scale-aware monocular depth estimation. In: Proc. IEEE int. conf. comput. vis. 2023, p. 9233\u201343.","DOI":"10.1109\/ICCV51070.2023.00847"},{"key":"10.1016\/j.array.2026.100973_b30","doi-asserted-by":"crossref","unstructured":"Li Zhengqi, Snavely Noah. Megadepth: Learning single-view depth prediction from internet photos. In: Proc. IEEE conf. comput. vis. pattern recognit. 2018, p. 2041\u201350.","DOI":"10.1109\/CVPR.2018.00218"},{"issue":"3","key":"10.1016\/j.array.2026.100973_b31","doi-asserted-by":"crossref","first-page":"1623","DOI":"10.1109\/TPAMI.2020.3019967","article-title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","volume":"44","author":"Ranftl","year":"2020","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"10.1016\/j.array.2026.100973_b32","doi-asserted-by":"crossref","unstructured":"Eftekhar Ainaz, Sax Alexander, Malik Jitendra, Zamir Amir. Omnidata: A scalable pipeline for making multi-task mid-level vision datasets from 3d scans. In: Proc. IEEE conf. comput. vis. pattern recognit. 2021, p. 10786\u201396.","DOI":"10.1109\/ICCV48922.2021.01061"},{"key":"10.1016\/j.array.2026.100973_b33","series-title":"Midas v3. 1\u2013a model zoo for robust monocular relative depth estimation","author":"Birkl","year":"2023"},{"key":"10.1016\/j.array.2026.100973_b34","series-title":"Depth pro: Sharp monocular metric depth in less than a second","author":"Bochkovskii","year":"2024"},{"key":"10.1016\/j.array.2026.100973_b35","doi-asserted-by":"crossref","unstructured":"Ke Bingxin, Obukhov Anton, Huang Shengyu, Metzger Nando, Daudt Rodrigo Caye, Schindler Konrad. Repurposing diffusion-based image generators for monocular depth estimation. In: IEEE conf. comput. vis. pattern recognit. 2024, p. 9492\u2013502.","DOI":"10.1109\/CVPR52733.2024.00907"},{"key":"10.1016\/j.array.2026.100973_b36","series-title":"Ranking of pattern for use in automation","first-page":"211","year":"2024"},{"key":"10.1016\/j.array.2026.100973_b37","first-page":"2","article-title":"Locating industrial parts with subpixel accuracies","volume":"vol. 728","author":"Young","year":"1987"},{"issue":"3","key":"10.1016\/j.array.2026.100973_b38","doi-asserted-by":"crossref","first-page":"223","DOI":"10.1109\/TVCG.2002.1021576","article-title":"EWA splatting","volume":"8","author":"Zwicker","year":"2002","journal-title":"IEEE Trans Vis Comput Graphics"},{"issue":"2","key":"10.1016\/j.array.2026.100973_b39","doi-asserted-by":"crossref","first-page":"151","DOI":"10.1109\/34.481540","article-title":"Conic reconstruction and correspondence from two views","volume":"18","author":"Quan","year":"1996","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"1","key":"10.1016\/j.array.2026.100973_b40","doi-asserted-by":"crossref","first-page":"30","DOI":"10.1007\/s10462-024-10955-4","article-title":"Scene reconstruction techniques for autonomous driving: a review of 3D Gaussian splatting","volume":"58","author":"Zhu","year":"2024","journal-title":"Artif Intell Rev"},{"key":"10.1016\/j.array.2026.100973_b41","series-title":"IEEE int. conf. intell. rob. syst","first-page":"573","article-title":"A benchmark for the evaluation of RGB-D SLAM systems","author":"Sturm","year":"2012"},{"key":"10.1016\/j.array.2026.100973_b42","doi-asserted-by":"crossref","unstructured":"Zhang Youmin, Tosi Fabio, Mattoccia Stefano, Poggi Matteo. Go-slam: Global optimization for consistent 3d instant reconstruction. In: Proc. IEEE int. conf. comput. vis. 2023, p. 3727\u201337.","DOI":"10.1109\/ICCV51070.2023.00345"},{"key":"10.1016\/j.array.2026.100973_b43","series-title":"IEEE int. conf. robot. autom","first-page":"11061","article-title":"MGSO: Monocular real-time photometric SLAM with efficient 3D Gaussian splatting","author":"Hu","year":"2025"},{"key":"10.1016\/j.array.2026.100973_b44","doi-asserted-by":"crossref","unstructured":"Sandstr\u00f6m Erik, Li Yue, Van Gool Luc, Oswald Martin R. Point-slam: Dense neural point cloud-based slam. In: Proc. IEEE int. conf. comput. vis. 2023, p. 18433\u201344.","DOI":"10.1109\/ICCV51070.2023.01690"},{"key":"10.1016\/j.array.2026.100973_b45","series-title":"Proc. eur. conf. comput. vis","first-page":"180","article-title":"Rgbd gs-icp slam","author":"Ha","year":"2024"}],"container-title":["Array"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S2590005626002961?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S2590005626002961?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,26]],"date-time":"2026-07-26T13:56:58Z","timestamp":1785074218000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S2590005626002961"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":45,"alternative-id":["S2590005626002961"],"URL":"https:\/\/doi.org\/10.1016\/j.array.2026.100973","relation":{},"ISSN":["2590-0056"],"issn-type":[{"value":"2590-0056","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"ViMGS-SLAM: A real-time monocular 3DGS-based SLAM via multiscale vision transformers","name":"articletitle","label":"Article Title"},{"value":"Array","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.array.2026.100973","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier Inc.","name":"copyright","label":"Copyright"}],"article-number":"100973"}}