{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,11]],"date-time":"2025-09-11T19:10:26Z","timestamp":1757617826973,"version":"3.44.0"},"reference-count":64,"publisher":"Springer Science and Business Media LLC","issue":"11","license":[{"start":{"date-parts":[[2025,4,12]],"date-time":"2025-04-12T00:00:00Z","timestamp":1744416000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,4,12]],"date-time":"2025-04-12T00:00:00Z","timestamp":1744416000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100017693","name":"Guilin Science and Technology Bureau","doi-asserted-by":"publisher","award":["JB23023006","JB23023006","JB23023006","JB23023006","JB23023006","JB23023006"],"award-info":[{"award-number":["JB23023006","JB23023006","JB23023006","JB23023006","JB23023006","JB23023006"]}],"id":[{"id":"10.13039\/501100017693","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100011785","name":"Science and Technology Department of Guangxi Zhuang Autonomous Region","doi-asserted-by":"publisher","award":["2022JBGS022","2022JBGS022","2022JBGS022","2022JBGS022","2022JBGS022","2022JBGS022"],"award-info":[{"award-number":["2022JBGS022","2022JBGS022","2022JBGS022","2022JBGS022","2022JBGS022","2022JBGS022"]}],"id":[{"id":"10.13039\/501100011785","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2025,9]]},"DOI":"10.1007\/s00371-025-03900-1","type":"journal-article","created":{"date-parts":[[2025,4,12]],"date-time":"2025-04-12T04:32:23Z","timestamp":1744432343000},"page":"8795-8812","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Swin-AFF: an improved accuracy 6D pose estimation network for high reflection and texture-less workpieces based on Swin transformer"],"prefix":"10.1007","volume":"41","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1147-655X","authenticated-orcid":false,"given":"Zhentao","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiyang","family":"Guo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yun","family":"Feng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7177-9136","authenticated-orcid":false,"given":"Guanjun","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Panfeng","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wenlei","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,4,12]]},"reference":[{"key":"3900_CR1","doi-asserted-by":"publisher","first-page":"102089","DOI":"10.1016\/j.rcim.2020.102089","volume":"68","author":"K Wang","year":"2021","unstructured":"Wang, K., Liu, D., Liu, Z., Wang, Q., Tan, J.: An assembly precision analysis method based on a general part digital twin model. Robot. Comput.-Integr. Manuf. 68, 102089 (2021). https:\/\/doi.org\/10.1016\/j.rcim.2020.102089","journal-title":"Robot. Comput.-Integr. Manuf."},{"key":"3900_CR2","doi-asserted-by":"publisher","first-page":"42345","DOI":"10.1109\/ACCESS.2021.3065956","volume":"9","author":"B Zhou","year":"2021","unstructured":"Zhou, B., Liu, Y., Xiao, Y., Zhou, R., Gan, Y., Fang, F.: Intelligent guidance programming of welding robot for 3d curved welding seam. IEEE Access. 9, 42345\u201342357 (2021). https:\/\/doi.org\/10.1109\/ACCESS.2021.3065956","journal-title":"IEEE Access."},{"key":"3900_CR3","doi-asserted-by":"publisher","first-page":"3887","DOI":"10.1109\/TCYB.2018.2851666","volume":"49","author":"Y Cong","year":"2019","unstructured":"Cong, Y., Tian, D., Feng, Y., Fan, B., Yu, H.: Speedup 3-d texture-less object recognition against self-occlusion for intelligent manufacturing. IEEE Trans. Cybern. 49, 3887\u20133897 (2019). https:\/\/doi.org\/10.1109\/TCYB.2018.2851666","journal-title":"IEEE Trans. Cybern."},{"key":"3900_CR4","doi-asserted-by":"publisher","first-page":"11856","DOI":"10.1609\/aaai.v34i07.6859","volume":"34","author":"Q-H Pham","year":"2020","unstructured":"Pham, Q.-H., Uy, M.A., Hua, B.-S., Nguyen, D.T., Roig, G., Yeung, S.-K.: Lcd: learned cross-domain descriptors for 2d\u20133d matching. Proc. AAAI Conf. Artif. Intell. 34, 11856\u201311864 (2020). https:\/\/doi.org\/10.1609\/aaai.v34i07.6859","journal-title":"Proc. AAAI Conf. Artif. Intell."},{"key":"3900_CR5","doi-asserted-by":"crossref","unstructured":"Xiang, Y., Schmidt, T., Narayanan, V., Fox, D.: PoseCNN: A convolutional neural network for 6d object pose estimation in cluttered scenes. In: Robotics: Science and Systems XIV. Robotics: Science and Systems Foundation (2018)","DOI":"10.15607\/RSS.2018.XIV.019"},{"key":"3900_CR6","doi-asserted-by":"publisher","first-page":"108903","DOI":"10.1016\/j.patcog.2022.108903","volume":"132","author":"J Wang","year":"2022","unstructured":"Wang, J., Qiu, L., Yi, G., Zhang, S., Wang, Y.: Multiple geometry representations for 6d object pose estimation in occluded or truncated scenes. Pattern Recognit. 132, 108903 (2022). https:\/\/doi.org\/10.1016\/j.patcog.2022.108903","journal-title":"Pattern Recognit."},{"key":"3900_CR7","doi-asserted-by":"publisher","first-page":"10990","DOI":"10.1109\/JSTARS.2021.3119654","volume":"14","author":"L Gao","year":"2021","unstructured":"Gao, L., Liu, H., Yang, M., Chen, L., Wan, Y., Xiao, Z., Qian, Y.: STransFuse: fusing swin transformer and convolutional neural network for remote sensing image semantic segmentation. IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens. 14, 10990\u201311003 (2021). https:\/\/doi.org\/10.1109\/JSTARS.2021.3119654","journal-title":"IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens."},{"key":"3900_CR8","doi-asserted-by":"crossref","unstructured":"Wang, C., Xu, D., Zhu, Y., Martin-Martin, R., Lu, C., Fei-Fei, L., Savarese, S.: DenseFusion: 6D Object Pose Estimation by Iterative Dense Fusion (2019)","DOI":"10.1109\/CVPR.2019.00346"},{"key":"3900_CR9","doi-asserted-by":"crossref","unstructured":"He, Y., Sun, W., Huang, H., Liu, J., Fan, H., Sun, J.: Pvn3d: A deep point-wise 3d keypoints voting network for 6dof pose estimation. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 11629\u201311638. IEEE, Seattle, WA, USA (2020)","DOI":"10.1109\/CVPR42600.2020.01165"},{"key":"3900_CR10","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., Guo, B.: Swin Transformer: Hierarchical Vision Transformer using Shifted Windows. In: 2021 IEEE\/CVF INTERNATIONAL CONFERENCE ON COMPUTER VISION (ICCV 2021). pp. 9992\u201310002, ELECTR NETWORK (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"3900_CR11","doi-asserted-by":"crossref","unstructured":"Yao, J., Chen, J., Niu, L., Sheng, B.: Scene-aware Human Pose Generation using Transformer. In: Proceedings of the 31st ACM International Conference on Multimedia. pp. 2847\u20132855. Association for Computing Machinery, New York, NY, USA (2023)","DOI":"10.1145\/3581783.3612439"},{"key":"3900_CR12","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., Guo, B.: Swin transformer: Hierarchical vision transformer using shifted windows. In: 2021 IEEE\/CVF International Conference on Computer Vision (ICCV). pp. 9992\u201310002. IEEE, Montreal, QC, Canada (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"3900_CR13","doi-asserted-by":"crossref","unstructured":"Xiong, Z., Wang, C., Li, Y., Luo, Y., Cao, Y.: Swin-Pose: Swin Transformer Based Human Pose Estimation. arXiv 2022. ArXiv Prepr. ArXiv220107384.","DOI":"10.1109\/MIPR54900.2022.00048"},{"key":"3900_CR14","doi-asserted-by":"publisher","first-page":"563","DOI":"10.3390\/electronics13030563","volume":"13","author":"Y Jiang","year":"2024","unstructured":"Jiang, Y., Yang, K., Zhu, J., Qin, L.: YOLO-Rlepose: improved YOLO based on swin transformer and Rle-Oks loss for multi-person pose estimation. Electronics 13, 563 (2024)","journal-title":"Electronics"},{"key":"3900_CR15","doi-asserted-by":"publisher","first-page":"7029","DOI":"10.3390\/s24217029","volume":"24","author":"X Wan","year":"2024","unstructured":"Wan, X., Ju, J., Tang, J., Lin, M., Rao, N., Chen, D., Liu, T., Li, J., Bian, F., Xiong, N.: MPCTrans: multi-perspective cue-aware joint relationship representation for 3D hand pose estimation via swin transformer. Sensors 24, 7029 (2024)","journal-title":"Sensors"},{"key":"3900_CR16","unstructured":"Fu, Q., Liu, X., Xu, R., Niebles, J.C., Kitani, K.M.: Deformer: Dynamic Fusion Transformer for Robust Hand Pose Estimation Supplementary Material"},{"key":"3900_CR17","doi-asserted-by":"crossref","unstructured":"Li, Z., Stamos, I.: Depth-based 6DoF Object Pose Estimation using Swin Transformer. arXiv 2023. ArXiv Prepr. ArXiv230302133","DOI":"10.1109\/IROS55552.2023.10342215"},{"key":"3900_CR18","first-page":"1","volume":"72","author":"G Zhou","year":"2022","unstructured":"Zhou, G., Wang, D., Yan, Y., Liu, C., Chen, Q.: 6-D object pose estimation using multiscale point cloud transformer. IEEE Trans. Instrum. Meas. 72, 1\u201311 (2022)","journal-title":"IEEE Trans. Instrum. Meas."},{"key":"3900_CR19","doi-asserted-by":"publisher","first-page":"5409011","DOI":"10.1109\/TGRS.2022.3168465","volume":"60","author":"X Meng","year":"2022","unstructured":"Meng, X., Wang, N., Shao, F., Li, S.: Vision transformer for pansharpening. IEEE Trans. Geosci. Remote Sens. 60, 5409011 (2022). https:\/\/doi.org\/10.1109\/TGRS.2022.3168465","journal-title":"IEEE Trans. Geosci. Remote Sens."},{"key":"3900_CR20","doi-asserted-by":"publisher","first-page":"1200","DOI":"10.1109\/JAS.2022.105686","volume":"9","author":"J Ma","year":"2022","unstructured":"Ma, J., Tang, L., Fan, F., Huang, J., Mei, X., Ma, Y.: SwinFusion: cross-domain long-range learning for general image fusion via swin transformer. IEEECAA J. Autom. Sin. 9, 1200\u20131217 (2022)","journal-title":"IEEECAA J. Autom. Sin."},{"key":"3900_CR21","doi-asserted-by":"crossref","unstructured":"Hinterstoisser, S., Lepetit, V., Ilic, S., Holzer, S., Bradski, G., Konolige, K., Navab, N.: Model Based Training, Detection and Pose Estimation of Texture-Less 3D Objects in Heavily Cluttered Scenes. In: Computer Vision\u2013ACCV 2012: 11th Asian Conference on Computer Vision, Daejeon, Korea, November 5\u20139, 2012, Revised Selected Papers, Part I 11. pp. 548\u2013562. Springer (2013)","DOI":"10.1007\/978-3-642-37331-2_42"},{"key":"3900_CR22","doi-asserted-by":"publisher","first-page":"5912","DOI":"10.1109\/LRA.2022.3154807","volume":"7","author":"L Chen","year":"2022","unstructured":"Chen, L., Yang, H., Wu, C., Wu, S.: Mp6d: an rgb-d dataset for metal parts\u2019 6d pose estimation. IEEE Robot. Autom. Lett. 7, 5912\u20135919 (2022). https:\/\/doi.org\/10.1109\/LRA.2022.3154807","journal-title":"IEEE Robot. Autom. Lett."},{"key":"3900_CR23","doi-asserted-by":"crossref","unstructured":"Damen, D.: Real-time Learning and Detection of 3D Texture-less Objects: A Scalable Approach. In: British Machine Vision Conference (2012)","DOI":"10.5244\/C.26.23"},{"key":"3900_CR24","doi-asserted-by":"crossref","unstructured":"Brachmann, E., Michel, F., Krull, A., Yang, M.Y., Gumhold, S., Rother, C.: Uncertainty-Driven 6D Pose Estimation of Objects and Scenes from a Single RGB Image (2016)","DOI":"10.1109\/CVPR.2016.366"},{"key":"3900_CR25","doi-asserted-by":"crossref","unstructured":"Nazir, A., Cheema, M.N., Sheng, B., Li, P., Kim, J., Lee, T.-Y.: Living Donor-Recipient Pair Matching for Liver Transplant via Ternary Tree Representation With Cascade Incremental Learning (2021)","DOI":"10.1109\/TBME.2021.3050310"},{"key":"3900_CR26","doi-asserted-by":"crossref","unstructured":"Karambakhsh, A., Sheng, B., Li, P., Li, H., Kim, J., Jung, Y., Chen, C.L.P.: SparseVoxNet: 3-D Object Recognition With Sparsely Aggregation of 3-D Dense Blocks (2024)","DOI":"10.1109\/TNNLS.2022.3175775"},{"key":"3900_CR27","doi-asserted-by":"crossref","unstructured":"Rad, M., Lepetit, V.: BB8: A Scalable, Accurate, Robust to Partial Occlusion Method for Predicting the 3D Poses of Challenging Objects without Using Depth (2017)","DOI":"10.1109\/ICCV.2017.413"},{"key":"3900_CR28","doi-asserted-by":"crossref","unstructured":"Lepetit, V., Moreno-Noguer, F., Fua, P.: EPnP: An Accurate O(n) Solution to the PnP Problem (2009)","DOI":"10.1007\/s11263-008-0152-6"},{"key":"3900_CR29","doi-asserted-by":"crossref","unstructured":"Kehl, W., Manhardt, F., Tombari, F., Ilic, S., Navab, N.: SSD-6D: Making RGB-Based 3D Detection and 6D Pose Estimation Great Again (2017)","DOI":"10.1109\/ICCV.2017.169"},{"key":"3900_CR30","doi-asserted-by":"crossref","unstructured":"Sundermeyer, M., Marton, Z.-C., Durner, M., Brucker, M., Triebel, R.: Implicit 3D Orientation Learning for 6D Object Detection from RGB Images (2018)","DOI":"10.1007\/978-3-030-01231-1_43"},{"key":"3900_CR31","doi-asserted-by":"publisher","DOI":"10.1007\/s00371-023-03113-4","author":"F Ullah","year":"2023","unstructured":"Ullah, F., Wei, W., Fan, Z., Yu, Q.: 6D object pose estimation based on dense convolutional object center voting with improved accuracy and efficiency. Vis. Comput. (2023). https:\/\/doi.org\/10.1007\/s00371-023-03113-4","journal-title":"Vis. Comput."},{"key":"3900_CR32","doi-asserted-by":"publisher","first-page":"876","DOI":"10.1109\/TPAMI.2011.206","volume":"34","author":"S Hinterstoisser","year":"2012","unstructured":"Hinterstoisser, S., Cagniart, C., Ilic, S., Sturm, P., Navab, N., Fua, P., Lepetit, V.: Gradient response maps for real-time detection of textureless objects. IEEE Trans. Pattern Anal. Mach. Intell. 34, 876\u2013888 (2012). https:\/\/doi.org\/10.1109\/TPAMI.2011.206","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3900_CR33","doi-asserted-by":"crossref","unstructured":"Hinterstoisser, S., Holzer, S., Cagniart, C., Ilic, S., Lepetit, V.: Multimodal templates for real-time detection of texture-less objects in heavily cluttered scenes. In: 2011 international conference on computer vision. pp. 858\u2013865. IEEE (2011)","DOI":"10.1109\/ICCV.2011.6126326"},{"key":"3900_CR34","doi-asserted-by":"crossref","unstructured":"Rios-Cabrera, R., Tuytelaars, T.: Discriminatively Trained Templates for 3D Object Detection: A Real Time Scalable Approach. In: IEEE International Conference on Computer Vision (2013)","DOI":"10.1109\/ICCV.2013.256"},{"key":"3900_CR35","doi-asserted-by":"publisher","unstructured":"Kehl, W., Tombari, F., Navab, N., Ilic, S., Lepetit, V.: Hashmod: A Hashing Method for Scalable 3D Object Detection (2016). https:\/\/doi.org\/10.48550\/arXiv.1607.06062.","DOI":"10.48550\/arXiv.1607.06062"},{"key":"3900_CR36","doi-asserted-by":"crossref","unstructured":"Hoda\u0148, T., Zabulis, X., Lourakis, M., Obdr\u017e\u00e1lek, \u0160., Matas, J.: Detection and fine 3D pose estimation of texture-less objects in RGB-D images (2015)","DOI":"10.1109\/IROS.2015.7354005"},{"key":"3900_CR37","doi-asserted-by":"publisher","first-page":"834","DOI":"10.1007\/978-3-319-46487-9_51","volume-title":"Computer Vision\u2014ECCV 2016: 14th European Conference, Amsterdam, The Netherlands, October 11\u201314, 2016, Proceedings, Part III","author":"S Hinterstoisser","year":"2016","unstructured":"Hinterstoisser, S., Lepetit, V., Rajkumar, N., Konolige, K.: Going Further with Point Pair Features. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) Computer Vision\u2014ECCV 2016: 14th European Conference, Amsterdam, The Netherlands, October 11\u201314, 2016, Proceedings, Part III, pp. 834\u2013848. Springer International Publishing, Cham (2016)"},{"key":"3900_CR38","doi-asserted-by":"crossref","unstructured":"Buch, A.G., Kiforenko, L., Kraft, D.: Rotational Subgroup Voting and Pose Clustering for Robust 3D Object Recognition (2017)","DOI":"10.1109\/ICCV.2017.443"},{"key":"3900_CR39","doi-asserted-by":"publisher","first-page":"1045","DOI":"10.3390\/s18041045","volume":"18","author":"L Mingyu","year":"2018","unstructured":"Mingyu, L., Koichi, H.: Accurate object pose estimation using depth only. Sensors 18, 1045 (2018). https:\/\/doi.org\/10.3390\/s18041045","journal-title":"Sensors"},{"key":"3900_CR40","doi-asserted-by":"publisher","first-page":"2678","DOI":"10.3390\/s18082678","volume":"18","author":"J Vidal","year":"2018","unstructured":"Vidal, J., Lin, C.Y., Llad\u00f3, X., Mart\u00ed, R.: A method for 6D pose estimation of free-form rigid objects using point pair features on range data. Sensors 18, 2678 (2018). https:\/\/doi.org\/10.3390\/s18082678","journal-title":"Sensors"},{"key":"3900_CR41","doi-asserted-by":"crossref","unstructured":"Sahin, C., Kouskouridas, R., Kim, T.-K.: Iterative Hough Forest with Histogram of Control Points for 6 DoF Object Registration from Depth Images (2016)","DOI":"10.1109\/IROS.2016.7759605"},{"key":"3900_CR42","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1016\/j.imavis.2017.05.005","volume":"63","author":"C Sahin","year":"2017","unstructured":"Sahin, C., Kouskouridas, R., Kim, T.K.: A learning-based variable size part extraction architecture for 6D object pose recovery in depth images. Image Vis. Comput. 63, 38\u201350 (2017). https:\/\/doi.org\/10.1016\/j.imavis.2017.05.005","journal-title":"Image Vis. Comput."},{"key":"3900_CR43","doi-asserted-by":"crossref","unstructured":"Krull, A., Brachmann, E., Michel, F., Yang, M.Y., Gumhold, S., Rother, C.: Learning Analysis-by-Synthesis for 6D Pose Estimation in RGB-D Images. In: 2015 IEEE International Conference on Computer Vision (ICCV) (2016)","DOI":"10.1109\/ICCV.2015.115"},{"key":"3900_CR44","doi-asserted-by":"publisher","first-page":"536","DOI":"10.1007\/978-3-319-10605-2_35","volume-title":"Computer Vision \u2013 ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part II","author":"E Brachmann","year":"2014","unstructured":"Brachmann, E., Krull, A., Michel, F., Gumhold, S., Shotton, J., Rother, C.: Learning 6D Object Pose Estimation Using 3D Object Coordinates. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) Computer Vision \u2013 ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part II, pp. 536\u2013551. Springer International Publishing, Cham (2014)"},{"key":"3900_CR45","doi-asserted-by":"publisher","first-page":"119","DOI":"10.1109\/TPAMI.2017.2665623","volume":"40","author":"A Tejani","year":"2018","unstructured":"Tejani, A., Kouskouridas, R., Doumanoglou, A., Tang, D., Kim, T.-K.: Latent-class hough forests for 6 DoF object pose estimation. IEEE T Pattern Anal. 40, 119\u2013132 (2018). https:\/\/doi.org\/10.1109\/TPAMI.2017.2665623","journal-title":"IEEE T Pattern Anal."},{"key":"3900_CR46","doi-asserted-by":"publisher","first-page":"205","DOI":"10.1007\/978-3-319-46487-9_13","volume-title":"Computer Vision\u2014ECCV 2016: 14th European Conference, Amsterdam, The Netherlands, October 11\u201314, 2016, Proceedings, Part III","author":"W Kehl","year":"2016","unstructured":"Kehl, W., Milletari, F., Tombari, F., Ilic, S., Navab, N.: Deep Learning of Local RGB-D Patches for 3D\u00a0Object Detection and 6D Pose Estimation. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) Computer Vision\u2014ECCV 2016: 14th European Conference, Amsterdam, The Netherlands, October 11\u201314, 2016, Proceedings, Part III, pp. 205\u2013220. Springer International Publishing, Cham (2016)"},{"key":"3900_CR47","doi-asserted-by":"crossref","unstructured":"Boubou, S., Narikiyo, T., Kawanishi, M.: Differential Histogram of Normal Vectors for Object Recognition with Depth Sensors (2016)","DOI":"10.1109\/ICARSC.2016.35"},{"key":"3900_CR48","doi-asserted-by":"publisher","first-page":"2481","DOI":"10.1109\/TPAMI.2016.2644615","volume":"39","author":"V Badrinarayanan","year":"2017","unstructured":"Badrinarayanan, V., Kendall, A., Cipolla, R.: Segnet: a deep convolutional encoder-decoder architecture for image segmentation. IEEE Trans. Pattern Anal. Mach. Intell. 39, 2481\u20132495 (2017). https:\/\/doi.org\/10.1109\/TPAMI.2016.2644615","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3900_CR49","doi-asserted-by":"publisher","first-page":"432","DOI":"10.1007\/978-3-030-01228-1_26","volume-title":"Computer Vision\u2014ECCV 2018","author":"T Xiao","year":"2018","unstructured":"Xiao, T., Liu, Y., Zhou, B., Jiang, Y., Sun, J.: Unified perceptual parsing for scene understanding. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) Computer Vision\u2014ECCV 2018, pp. 432\u2013448. Springer International Publishing, Cham (2018)"},{"key":"3900_CR50","doi-asserted-by":"crossref","unstructured":"Hu, Q., Yang, B., Xie, L., Rosa, S., Guo, Y., Wang, Z., Trigoni, N., Markham, A.: Randla-net: Efficient semantic segmentation of large-scale point clouds. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 11105\u201311114. IEEE, Seattle, WA, USA (2020)","DOI":"10.1109\/CVPR42600.2020.01112"},{"key":"3900_CR51","doi-asserted-by":"crossref","unstructured":"He, Y., Huang, H., Fan, H., Chen, Q., Sun, J.: Ffb6d: A full flow bidirectional fusion network for 6d pose estimation. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition. pp. 3003\u20133013 (2021)","DOI":"10.1109\/CVPR46437.2021.00302"},{"key":"3900_CR52","unstructured":"Sun, M., Zheng, Y., Bao, T., Chen, J., Jin, G., Wu, L., Zhao, R., Jiang, X.: Uni6Dv2: Noise elimination for 6D pose estimation. In: International Conference on Artificial Intelligence and Statistics. pp. 1832\u20131844. PMLR (2023)"},{"key":"3900_CR53","doi-asserted-by":"crossref","unstructured":"Petitjean, T., Wu, Z., Demonceaux, C., Laligant, O.: OLF: RGB-D adaptive late fusion for robust 6D pose estimation. In: Sixteenth International Conference on Quality Control by Artificial Vision. pp. 132\u2013140. SPIE (2023)","DOI":"10.1117\/12.2690943"},{"key":"3900_CR54","doi-asserted-by":"crossref","unstructured":"Li, Z., Stamos, I.: Depth-based 6DoF Object Pose Estimation using Swin Transformer (2023)","DOI":"10.1109\/IROS55552.2023.10342215"},{"issue":"10","key":"3900_CR55","doi-asserted-by":"publisher","first-page":"230","DOI":"10.3390\/machines9100230","volume":"9","author":"H Liu","year":"2021","unstructured":"Liu, H., Liu, G., Zhang, Y., Lei, L., Xie, H., Li, Y., Sun, S.: A 3D keypoints voting network for 6DoF pose estimation in indoor scene. Machines 9(10), 230 (2021). https:\/\/doi.org\/10.3390\/machines9100230","journal-title":"Machines"},{"key":"3900_CR56","doi-asserted-by":"publisher","first-page":"603","DOI":"10.1109\/34.1000236","volume":"24","author":"D Comaniciu","year":"2002","unstructured":"Comaniciu, D., Meer, P.: Mean shift: a robust approach toward feature space analysis. IEEE Trans. Pattern Anal. Mach. Intell. 24, 603\u2013619 (2002). https:\/\/doi.org\/10.1109\/34.1000236","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"5","key":"3900_CR57","doi-asserted-by":"publisher","first-page":"698","DOI":"10.1109\/TPAMI.1987.4767965","volume":"PAMI-9","author":"KS Arun","year":"1987","unstructured":"Arun, K.S., Huang, T.S., Blostein, S.D.: Least-squares fitting of two 3-D point sets. IEEE Trans. Pattern Anal. Mach. Intell. PAMI-9(5), 698\u2013700 (1987). https:\/\/doi.org\/10.1109\/TPAMI.1987.4767965","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3900_CR58","doi-asserted-by":"crossref","unstructured":"Kang, J., Liu, W., Tu, W., Yang, L.: YOLO-6D+: Single Shot 6D Pose Estimation Using Privileged Silhouette Information (2020)","DOI":"10.1109\/ICIP48927.2020.9367354"},{"issue":"6","key":"3900_CR59","doi-asserted-by":"publisher","first-page":"3212","DOI":"10.1109\/TPAMI.2020.3047388","volume":"44","author":"S Peng","year":"2022","unstructured":"Peng, S., Zhou, X., Liu, Y., Lin, H., Huang, Q., Bao, H.: PVNet: pixel-wise voting network for 6DoF object pose estimation. IEEE Trans. Pattern Anal. Mach. Intell. 44(6), 3212\u20133223 (2022). https:\/\/doi.org\/10.1109\/TPAMI.2020.3047388","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3900_CR60","doi-asserted-by":"crossref","unstructured":"Park, K., Patten, T., Vincze, M.: Pix2Pose: Pixel-Wise Coordinate Regression of Objects for 6D Pose Estimation (2019)","DOI":"10.1109\/ICCV.2019.00776"},{"key":"3900_CR61","doi-asserted-by":"crossref","unstructured":"Xu, Y., Lin, K.-Y., Zhang, G., Wang, X., Li, H.: RNNPose: Recurrent 6-DoF Object Pose Refinement with Robust Correspondence Field Estimation and Pose Optimization (2022)","DOI":"10.1109\/CVPR52688.2022.01446"},{"key":"3900_CR62","doi-asserted-by":"publisher","first-page":"112","DOI":"10.1007\/978-3-031-25085-9_7","volume-title":"Computer Vision\u2014ECCV 2022 Workshops: Tel Aviv, Israel, October 23\u201327, 2022, Proceedings, Part VIII","author":"Z Zhang","year":"2023","unstructured":"Zhang, Z., Chen, W., Zheng, L., Leonardis, A., Chang, H.J.: Trans6D: Transformer-Based 6D Object Pose Estimation and\u00a0Refinement. In: Karlinsky, L., Michaeli, T., Nishino, Ko. (eds.) Computer Vision\u2014ECCV 2022 Workshops: Tel Aviv, Israel, October 23\u201327, 2022, Proceedings, Part VIII, pp. 112\u2013128. Springer Nature Switzerland, Cham (2023)"},{"key":"3900_CR63","doi-asserted-by":"crossref","unstructured":"Xu, D., Anguelov, D., Jain, A.: PointFusion: Deep Sensor Fusion for 3D Bounding Box Estimation (2018)","DOI":"10.1109\/CVPR.2018.00033"},{"key":"3900_CR64","doi-asserted-by":"publisher","first-page":"663","DOI":"10.1007\/978-3-030-01270-0_39","volume-title":"Computer Vision\u2014ECCV 2018: 15th European Conference, Munich, Germany, September 8-14, 2018, Proceedings, Part XVI","author":"M Liang","year":"2018","unstructured":"Liang, M., Yang, B., Wang, S., Urtasun, R.: Deep Continuous Fusion for Multi-sensor 3D Object Detection. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) Computer Vision\u2014ECCV 2018: 15th European Conference, Munich, Germany, September 8-14, 2018, Proceedings, Part XVI, pp. 663\u2013678. Springer International Publishing, Cham (2018)"}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-025-03900-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00371-025-03900-1\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-025-03900-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,6]],"date-time":"2025-09-06T10:54:58Z","timestamp":1757156098000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00371-025-03900-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,12]]},"references-count":64,"journal-issue":{"issue":"11","published-print":{"date-parts":[[2025,9]]}},"alternative-id":["3900"],"URL":"https:\/\/doi.org\/10.1007\/s00371-025-03900-1","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"type":"print","value":"0178-2789"},{"type":"electronic","value":"1432-2315"}],"subject":[],"published":{"date-parts":[[2025,4,12]]},"assertion":[{"value":"24 March 2025","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 April 2025","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}