{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,26]],"date-time":"2026-07-26T17:35:21Z","timestamp":1785087321832,"version":"3.55.0"},"reference-count":66,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2024,8,12]],"date-time":"2024-08-12T00:00:00Z","timestamp":1723420800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,8,12]],"date-time":"2024-08-12T00:00:00Z","timestamp":1723420800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2025,2]]},"DOI":"10.1007\/s11263-024-02183-8","type":"journal-article","created":{"date-parts":[[2024,8,12]],"date-time":"2024-08-12T07:02:45Z","timestamp":1723446165000},"page":"611-627","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":56,"title":["FMGS: Foundation Model Embedded 3D Gaussian Splatting for Holistic 3D Scene Understanding"],"prefix":"10.1007","volume":"133","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-4158-3153","authenticated-orcid":false,"given":"Xingxing","family":"Zuo","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Pouya","family":"Samangouei","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yunwen","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yan","family":"Di","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mingyang","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,8,12]]},"reference":[{"key":"2183_CR1","first-page":"23716","volume":"35","author":"J-B Alayrac","year":"2022","unstructured":"Alayrac, J.-B., Donahue, J., Luc, P., Miech, A., Barr, I., Hasson, Y., Lenc, K., Mensch, A., Millican, K., Reynolds, M., et al. (2022). Flamingo: A visual language model for few-shot learning. Advances in Neural Information Processing Systems, 35, 23716\u201323736.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2183_CR2","unstructured":"Amir, S., Gandelsman, Y., Bagon, S., & Dekel, T. (2021). Deep vit features as dense visual descriptors., 2(3), 4. arXiv:2112.05814."},{"key":"2183_CR3","doi-asserted-by":"crossref","unstructured":"Azuma, D., Miyanishi, T., Kurita, S., & Kawanabe, M. (2022). Scanqa: 3d question answering for spatial scene understanding. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 19129\u201319139).","DOI":"10.1109\/CVPR52688.2022.01854"},{"key":"2183_CR4","doi-asserted-by":"crossref","unstructured":"Barron, J. T., Mildenhall, B., Tancik, M., Hedman, P., Martin-Brualla, R., & Srinivasan, P. P. (2021). Mip-nerf: A multiscale representation for anti-aliasing neural radiance fields. In Proceedings of the IEEE\/CVF international conference on computer vision (pp. 5855\u20135864).","DOI":"10.1109\/ICCV48922.2021.00580"},{"key":"2183_CR5","doi-asserted-by":"crossref","unstructured":"Barron, J. T., Mildenhall, B., Verbin, D., Srinivasan, P. P., & Hedman, P. (2022). Mip-nerf 360: Unbounded anti-aliased neural radiance fields. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 5470\u20135479).","DOI":"10.1109\/CVPR52688.2022.00539"},{"key":"2183_CR6","doi-asserted-by":"crossref","unstructured":"Barron, J. T., Mildenhall, B., Verbin, D., Srinivasan, P. P., Hedman, P. (2023). Zip-nerf: Anti-aliased grid-based neural radiance fields. In ICCV.","DOI":"10.1109\/ICCV51070.2023.01804"},{"key":"2183_CR7","doi-asserted-by":"crossref","unstructured":"Caron, M., Touvron, H., Misra, I., J\u00e9gou, H., Mairal, J., Bojanowski, P., & Joulin, A. (2021). Emerging properties in self-supervised vision transformers. In Proceedings of the IEEE\/CVF international conference on computer vision (pp. 9650\u20139660).","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"2183_CR8","doi-asserted-by":"crossref","unstructured":"Cascante-Bonilla, P., Hui, W., Wang, L., Feris, R. S., & Ordonez, V. (2022). Simvqa: Exploring simulated environments for visual question answering. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 5056\u20135066).","DOI":"10.1109\/CVPR52688.2022.00500"},{"key":"2183_CR9","unstructured":"Cen, J., Zhou, Z., Fang, J., Yang, C., Shen, W., Xie, L., Zhang, X., & Tian, Q. (2023). Segment anything in 3D with nerfs. In NeurIPS ."},{"key":"2183_CR10","doi-asserted-by":"crossref","unstructured":"Chen, A., Xu, Z., Geiger, A., Yu, J., & Su, H. (2022). Tensorf: Tensorial radiance fields. In European conference on computer vision (pp. 333\u2013350). Springer.","DOI":"10.1007\/978-3-031-19824-3_20"},{"key":"2183_CR11","unstructured":"Chen, G., & Wang, W. (2024). A survey on 3D Gaussian splatting. arXiv preprint arXiv:2401.03890."},{"key":"2183_CR12","doi-asserted-by":"crossref","unstructured":"Chen, H., Blomqvist, K., Milano, F., & Siegwart, R. (2023). Panoptic vision-language feature fields. arXiv preprint arXiv:2309.05448.","DOI":"10.1109\/IROS55552.2023.10342275"},{"key":"2183_CR13","doi-asserted-by":"crossref","unstructured":"Cherti, M., Beaumont, R., Wightman, R., Wortsman, M., Ilharco, G., Gordon, C., Schuhmann, C., Schmidt, L., & Jitsev, J. (2022). Reproducible scaling laws for contrastive language-image learning. arXiv preprint arXiv:2212.07143.","DOI":"10.1109\/CVPR52729.2023.00276"},{"key":"2183_CR14","doi-asserted-by":"crossref","unstructured":"Corona, R., Zhu, S., Klein, D., & Darrell, T. (2022). Voxel-informed language grounding. arXiv preprint arXiv:2205.09710.","DOI":"10.18653\/v1\/2022.acl-short.7"},{"key":"2183_CR15","doi-asserted-by":"crossref","unstructured":"Dai, A., Chang, A. X., Savva, M., Halber, M., Funkhouser, T., & Nie\u00dfner, M. (2017). Scannet: Richly-annotated 3D reconstructions of indoor scenes. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 5828\u20135839).","DOI":"10.1109\/CVPR.2017.261"},{"key":"2183_CR16","doi-asserted-by":"crossref","unstructured":"Fei, B., Xu, J., Zhang, R., Zhou, Q., Yang, W., & He, Y. (2024). 3D Gaussian as a new vision era: A survey. arXiv preprint arXiv:2402.07181.","DOI":"10.1109\/TVCG.2024.3397828"},{"key":"2183_CR17","unstructured":"Ghiasi, G., Gu, X., Cui, Y., & Lin, T.-Y. (2021). Open-vocabulary image segmentation. arXiv preprint arXiv:2112.12143."},{"key":"2183_CR18","doi-asserted-by":"crossref","unstructured":"Gordon, D., Kembhavi, A., Rastegari, M., Redmon, J., Fox, D., & Farhadi, A. (2018). Iqa: Visual question answering in interactive environments. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 4089\u20134098).","DOI":"10.1109\/CVPR.2018.00430"},{"issue":"3","key":"2183_CR19","doi-asserted-by":"publisher","first-page":"3037","DOI":"10.1109\/LRA.2019.2923960","volume":"4","author":"M Grinvald","year":"2019","unstructured":"Grinvald, M., Furrer, F., Novkovic, T., Chung, J. J., Cadena, C., Siegwart, R., & Nieto, J. (2019). Volumetric instance-aware semantic mapping and 3d object discovery. IEEE Robotics and Automation Letters, 4(3), 3037\u20133044.","journal-title":"IEEE Robotics and Automation Letters"},{"key":"2183_CR20","doi-asserted-by":"crossref","unstructured":"Gu, Q., Kuwajerwala, A., Morin, S., Jatavallabhula, K. M., Sen, B., Agarwal, A., Rivera, C., Paul, W., Ellis, K., Chellappa, R., Gan, C., Miguel de Melo, C., Tenenbaum, J. B., Torralba, A., Shkurti, F., & Paull, L. (2023). Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning. arXiv.","DOI":"10.1109\/ICRA57147.2024.10610243"},{"key":"2183_CR21","unstructured":"Gu, X., Lin, T.-Y., Kuo, W., & Cui, Y. (2021). Open-vocabulary object detection via vision and language knowledge distillation. arXiv preprint arXiv:2104.13921."},{"key":"2183_CR22","doi-asserted-by":"crossref","unstructured":"Izadi, S., Kim, D., Hilliges, O., Molyneaux, D., Newcombe, R., Kohli, P., Shotton, J., Hodges, S., Freeman, D., & Davison, A., et\u00a0al. (2011). Kinectfusion: Real-time 3d reconstruction and interaction using a moving depth camera. In Proceedings of the 24th annual ACM symposium on User interface software and technology (pp. 559\u2013568).","DOI":"10.1145\/2047196.2047270"},{"key":"2183_CR23","doi-asserted-by":"crossref","unstructured":"Jatavallabhula, K.\u00a0M., Kuwajerwala, A., Gu, Q., Omama, M., Chen, T., Li, S., Iyer, G., Saryazdi, S., Keetha, N., Tewari, A., Tenenbaum, J. B., de\u00a0Melo, C.\u00a0M., Krishna, M., Paull, L., Shkurti, F., & Torralba, A. (2023). Conceptfusion: Open-set multimodal 3d mapping.","DOI":"10.15607\/RSS.2023.XIX.066"},{"key":"2183_CR24","doi-asserted-by":"crossref","unstructured":"Karkus, P., Cai, S., & Hsu, D. (2021). Differentiable slam-net: Learning particle slam for visual navigation. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 2815\u20132825).","DOI":"10.1109\/CVPR46437.2021.00284"},{"key":"2183_CR25","doi-asserted-by":"crossref","unstructured":"Keetha, N., Karhade, J., Jatavallabhula, K.\u00a0M., Yang, G., Scherer, S., Ramanan, D., & Luiten, J. (2023). Splatam: Splat, track & map 3d gaussians for dense rgb-d slam. arXiv preprint arXiv:2312.02126.","DOI":"10.1109\/CVPR52733.2024.02018"},{"issue":"4","key":"2183_CR26","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3592433","volume":"42","author":"B Kerbl","year":"2023","unstructured":"Kerbl, B., Kopanas, G., Leimk\u00fchler, T., & Drettakis, G. (2023). 3d gaussian splatting for real-time radiance field rendering. ACM Transactions on Graphics (ToG), 42(4), 1\u201314.","journal-title":"ACM Transactions on Graphics (ToG)"},{"key":"2183_CR27","doi-asserted-by":"crossref","unstructured":"Kerr, J., Kim, C.\u00a0M., Goldberg, K., Kanazawa, A., & Tancik, M. (2023). Lerf: Language embedded radiance fields. In Proceedings of the IEEE\/CVF international conference on computer vision (pp. 19729\u201319739).","DOI":"10.1109\/ICCV51070.2023.01807"},{"key":"2183_CR28","doi-asserted-by":"crossref","unstructured":"Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, L. C., Tete X., Gustafson, W., Spencer, B., Alexander,\u00a0C., & Wan-Yen, L., et\u00a0al. (2023). Segment anything. In Proceedings of the IEEE\/CVF international conference on computer vision (pp. 4015\u20134026).","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"2183_CR29","unstructured":"Kobayashi, S., Matsumoto, E., & Sitzmann, V. (2022). Decomposing nerf for editing via feature field distillation. In Advances in neural information processing systems volume\u00a035."},{"key":"2183_CR30","unstructured":"Li, B., Weinberger, K.\u00a0Q., Belongie, S., Koltun, V., & Ranftl, R. (2022). Language-driven semantic segmentation. arXiv preprint arXiv:2201.03546."},{"key":"2183_CR31","doi-asserted-by":"crossref","unstructured":"Liang, F., Wu, B., Dai, X., Li, K., Zhao, Y., Zhang, H., Zhang, P., Vajda, P., & Marculescu, D. (2022). Open-vocabulary semantic segmentation with mask-adapted clip. arXiv preprint arXiv:2210.04150.","DOI":"10.1109\/CVPR52729.2023.00682"},{"key":"2183_CR32","doi-asserted-by":"crossref","unstructured":"Lin, K., Wang, L., & Liu, Z. (2021). End-to-end human pose and mesh reconstruction with transformers. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 1954\u20131963).","DOI":"10.1109\/CVPR46437.2021.00199"},{"key":"2183_CR33","unstructured":"Liu, K., Zhan, F., Zhang, J., Xu, M., Yu, Y., El\u00a0Saddik, A., Theobalt, C., Xing, E., & Lu, S. (2023). Weakly supervised 3d open-vocabulary segmentation. In Thirty-seventh conference on neural information processing systems."},{"key":"2183_CR34","unstructured":"Liu, K., Zhan, F., Zhang, J., Xu, M., Yu, Y., Saddik, A. E., Theobalt, C., Xing, E., & Lu, S. (2023). 3d open-vocabulary segmentation with foundation models. arXiv preprint arXiv:2305.14093."},{"key":"2183_CR35","unstructured":"Lu, S., Chang, H., Jing, E.\u00a0P., Boularias, A., & Bekris, K. (2023). OVIR-3d: Open-vocabulary 3d instance retrieval without training on 3d data. In 7th annual conference on robot learning."},{"key":"2183_CR36","doi-asserted-by":"crossref","unstructured":"Lu, Y., Xu, C., Wei, X., Xie, X., Tomizuka, M., Keutzer, K., & Zhang, S. (2023). Open-vocabulary point-cloud object detection without 3d annotation. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR52729.2023.00121"},{"key":"2183_CR37","doi-asserted-by":"crossref","unstructured":"L\u00fcddecke, T., & Ecker, A. (2022). Image segmentation using text and image prompts. In CVPR (pp. 7086\u20137096).","DOI":"10.1109\/CVPR52688.2022.00695"},{"key":"2183_CR38","doi-asserted-by":"crossref","unstructured":"Mildenhall, B., Srinivasan, P. P., Tancik, M., Barron, J. T., & Ramamoorthi, R. (2020). Nerf: Representing scenes as neural radiance fields for view synthesis. In ECCV.","DOI":"10.1007\/978-3-030-58452-8_24"},{"key":"2183_CR39","doi-asserted-by":"crossref","unstructured":"Minderer, M., Gritsenko, A., Stone, A., Neumann, M., Weissenborn, D., Dosovitskiy, A., Mahendran, A., Arnab, A., Dehghani, M., & Shen, Z., et\u00a0al. (2022). Simple open-vocabulary object detection with vision transformers. arXiv preprint arXiv:2205.06230.","DOI":"10.1007\/978-3-031-20080-9_42"},{"issue":"4","key":"2183_CR40","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3528223.3530127","volume":"41","author":"T M\u00fcller","year":"2022","unstructured":"M\u00fcller, T., Evans, A., Schied, C., & Keller, A. (2022). Instant neural graphics primitives with a multiresolution hash encoding. ACM Transactions on Graphics (ToG), 41(4), 1\u201315.","journal-title":"ACM Transactions on Graphics (ToG)"},{"key":"2183_CR41","doi-asserted-by":"crossref","unstructured":"Narita, G., Seno, T., Ishikawa, T., & Kaji, Y. (2019). Panopticfusion: Online volumetric semantic mapping at the level of stuff and things. In IEEE\/RSJ international conference on intelligent robots and systems (IROS) (pp. 4205\u20134212).","DOI":"10.1109\/IROS40897.2019.8967890"},{"key":"2183_CR42","unstructured":"Qi, C.\u00a0R,. Su, H., Mo, K., & Guibas, L.\u00a0J. (2017). Pointnet: Deep learning on point sets for 3d classification and segmentation. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 652\u2013660)."},{"key":"2183_CR43","doi-asserted-by":"crossref","unstructured":"Qin, M., Li, W., Zhou, J., Wang, H., & Pfister, H. (2024). Langsplat: 3d language gaussian splatting. In Proceedings of the IEEE\/CVF international conference on computer vision.","DOI":"10.1109\/CVPR52733.2024.01895"},{"key":"2183_CR44","unstructured":"Radford, A., Kim, J.\u00a0W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., & Clark, J., et\u00a0al. (2021). Learning transferable visual models from natural language supervision. In International conference on machine learning (pp. 8748\u20138763). PMLR."},{"key":"2183_CR45","doi-asserted-by":"crossref","unstructured":"Schonberger, J. L., & Frahm, J.-M. (2016). Structure-from-motion revisited. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 4104\u20134113).","DOI":"10.1109\/CVPR.2016.445"},{"key":"2183_CR46","doi-asserted-by":"crossref","unstructured":"Schonberger, J. L., & Frahm, J.-M. (2016). Structure-from-motion revisited. Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 4104\u20134113).","DOI":"10.1109\/CVPR.2016.445"},{"issue":"10","key":"2183_CR47","doi-asserted-by":"publisher","first-page":"2494","DOI":"10.1109\/TPAMI.2019.2947048","volume":"42","author":"T Sch\u00f6ps","year":"2019","unstructured":"Sch\u00f6ps, T., Sattler, T., & Pollefeys, M. (2019). Surfelmeshing: Online surfel-based mesh reconstruction. IEEE Transactions on Pattern Analysis and Machine Intelligence, 42(10), 2494\u20132507.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2183_CR48","unstructured":"Shafiullah, N. M. M., Paxton, C., Pinto, L., Chintala, S., & Szlam, A. (2022). Clip-fields: Weakly supervised semantic fields for robotic memory. arXiv preprint arXiv:2210.05663."},{"key":"2183_CR49","doi-asserted-by":"crossref","unstructured":"Shi, J.-C., Wang, M., Duan, H.-B., & Guan, S.-H. (2024). LEGaussians: Language embedded 3d gaussians for open-vocabulary scene understanding. In Proceedings of the IEEE\/CVF international conference on computer vision.","DOI":"10.1109\/CVPR52733.2024.00510"},{"key":"2183_CR50","doi-asserted-by":"crossref","unstructured":"Sun, J., Xie, Y., Chen, L., Zhou, X., & Bao, H. (2021). Neuralrecon: Real-time coherent 3d reconstruction from monocular video. Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 15598\u201315607).","DOI":"10.1109\/CVPR46437.2021.01534"},{"key":"2183_CR51","unstructured":"Takmaz, A., Fedele, E., Sumner, R.\u00a0W., Pollefeys, M., Tombari, F., & Engelmann, F. (2023). OpenMask3D: Open-vocabulary 3D instance segmentation. In Advances in neural information processing systems (NeurIPS)."},{"key":"2183_CR52","unstructured":"Thomason, J., Shridhar, M., Bisk, Y., Paxton, C., & Zettlemoyer, L. (2022). Language grounding with 3d objects. In Conference on robot learning (pp. 1691\u20131701)."},{"key":"2183_CR53","unstructured":"Tsagkas, N., Mac\u00a0A. O., & Lu, C.\u00a0X. (2023). Vl-fields: Towards language-grounded neural implicit spatial representations. arXiv preprint arXiv:2305.12427."},{"key":"2183_CR54","doi-asserted-by":"crossref","unstructured":"Tschernezki, V., Laina, I., Larlus, D., & Vedaldi, A. (2022). Neural feature fusion fields: 3D distillation of self-supervised 2D image representations. In 3DV.","DOI":"10.1109\/3DV57658.2022.00056"},{"key":"2183_CR55","doi-asserted-by":"crossref","unstructured":"Wang, Z., Lu, Y., Li, Q., Tao, X., Guo, Y., Gong, M., & Liu, T. (2022). Cris: Clip-driven referring image segmentation. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 11686\u201311695).","DOI":"10.1109\/CVPR52688.2022.01139"},{"key":"2183_CR56","doi-asserted-by":"crossref","unstructured":"Xu, Q., Xu, Z., Philip, J., Bi, S., Shu, Z., Sunkavalli, K., & Neumann, U. (2022). Point-nerf: Point-based neural radiance fields. CoRR. arXiv: 2201.08845.","DOI":"10.1109\/CVPR52688.2022.00536"},{"key":"2183_CR57","doi-asserted-by":"crossref","unstructured":"Xue, L., Gao, M., Xing, C., Mart\u00edn-Mart\u00edn, R., Wu, J., Xiong, C., Xu, R., Niebles, J.\u00a0C., & Savarese, S. (2022). Ulip: Learning unified representation of language, image and point cloud for 3d understanding. arXiv preprint arXiv:2212.05171.","DOI":"10.1109\/CVPR52729.2023.00120"},{"key":"2183_CR58","doi-asserted-by":"crossref","unstructured":"Xue, L., Yu, N., Zhang, S., Li, J., Mart\u00edn-Mart\u00edn, R., Wu, J., Xiong, C., Xu, R., Niebles, J.\u00a0C., & Savarese, S. (2023). Ulip-2: Towards scalable multimodal pre-training for 3d understanding.","DOI":"10.1109\/CVPR52733.2024.02558"},{"issue":"12","key":"2183_CR59","doi-asserted-by":"publisher","first-page":"3446","DOI":"10.1109\/TVCG.2020.3023634","volume":"26","author":"X Yang","year":"2020","unstructured":"Yang, X., Zhou, L., Jiang, H., Tang, Z., Wang, Y., Bao, H., & Zhang, G. (2020). Mobile3drecon: Real-time monocular 3d reconstruction on a mobile phone. IEEE Transactions on Visualization and Computer Graphics, 26(12), 3446\u20133456.","journal-title":"IEEE Transactions on Visualization and Computer Graphics"},{"key":"2183_CR60","doi-asserted-by":"crossref","unstructured":"Ye, J., Wang, N., & Wang, X. (2023). Featurenerf: Learning generalizable nerfs by distilling pre-trained vision foundation models. arXiv preprint arXiv:2303.12786.","DOI":"10.1109\/ICCV51070.2023.00823"},{"issue":"6","key":"2183_CR61","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3355089.3356513","volume":"38","author":"W Yifan","year":"2019","unstructured":"Yifan, W., Serena, F., Shihao, W., \u00d6ztireli, C., & Sorkine-Hornung, O. (2019). Differentiable surface splatting for point-based geometry processing. ACM Transactions on Graphics (TOG), 38(6), 1\u201314.","journal-title":"ACM Transactions on Graphics (TOG)"},{"key":"2183_CR62","unstructured":"Ze, Y., Yan, G., Yueh-Hua, W., Macaluso, A., Ge, Y., Ye, J., & Hansen, N. (2023). CoRL: Multi-task real robot learning with generalizable neural feature fields."},{"key":"2183_CR63","doi-asserted-by":"crossref","unstructured":"Zhang, R., Guo, Z., Zhang, W., Li, K., Miao, X., Cui, B., Qiao, Y., Gao, P., & Li, H. (2021). Pointclip: Point cloud understanding by clip. arXiv preprint arXiv:2112.02413.","DOI":"10.1109\/CVPR52688.2022.00836"},{"key":"2183_CR64","doi-asserted-by":"crossref","unstructured":"Zhou, S., Chang, H., Jiang, S., Fan, Z., Zhu, Z., Xu, D., Chari, P., You, S., Wang, Z., & Kadambi, A. (2024). Feature 3DGS: Supercharging 3d Gaussian splatting to enable distilled feature fields. In Proceedings of the IEEE\/CVF international conference on computer vision.","DOI":"10.1109\/CVPR52733.2024.02048"},{"key":"2183_CR65","doi-asserted-by":"crossref","unstructured":"Zhou, X., Girdhar, R., Joulin, A., Kr\u00e4henb\u00fchl, P., & Misra, I. (2022). Detecting twenty-thousand classes using image-level supervision. In ECCV (pp. 350\u2013368). Springer.","DOI":"10.1007\/978-3-031-20077-9_21"},{"key":"2183_CR66","doi-asserted-by":"crossref","unstructured":"Zwicker, M., Pfister, H., Van\u00a0Baar, J., & Gross, M. (2001). Ewa volume splatting. In Proceedings visualization.","DOI":"10.1145\/383259.383300"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02183-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-024-02183-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02183-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,22]],"date-time":"2025-01-22T06:39:53Z","timestamp":1737527993000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-024-02183-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,8,12]]},"references-count":66,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2025,2]]}},"alternative-id":["2183"],"URL":"https:\/\/doi.org\/10.1007\/s11263-024-02183-8","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,8,12]]},"assertion":[{"value":"16 December 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 July 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 August 2024","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}