{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T17:31:33Z","timestamp":1782408693472,"version":"3.54.5"},"publisher-location":"Cham","reference-count":86,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031733963","type":"print"},{"value":"9783031733970","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,3]],"date-time":"2024-11-03T00:00:00Z","timestamp":1730592000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,3]],"date-time":"2024-11-03T00:00:00Z","timestamp":1730592000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-73397-0_22","type":"book-chapter","created":{"date-parts":[[2024,11,2]],"date-time":"2024-11-02T19:05:13Z","timestamp":1730574313000},"page":"376-394","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["D-SCo: Dual-Stream Conditional Diffusion for\u00a0Monocular Hand-Held Object Reconstruction"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0002-1165","authenticated-orcid":false,"given":"Bowen","family":"Fu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0759-0782","authenticated-orcid":false,"given":"Gu","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-7852-4124","authenticated-orcid":false,"given":"Chenyangguang","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0671-8323","authenticated-orcid":false,"given":"Yan","family":"Di","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-3104-2146","authenticated-orcid":false,"given":"Ziqin","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8773-6939","authenticated-orcid":false,"given":"Zhiying","family":"Leng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4577-4590","authenticated-orcid":false,"given":"Fabian","family":"Manhardt","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7333-9975","authenticated-orcid":false,"given":"Xiangyang","family":"Ji","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5598-5212","authenticated-orcid":false,"given":"Federico","family":"Tombari","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,11,3]]},"reference":[{"key":"22_CR1","doi-asserted-by":"crossref","unstructured":"Boukhayma, A., Bem, R., Torr, P.H.: 3D hand shape and pose from images in the wild. In: CVPR, pp. 10843\u201310852 (2019)","DOI":"10.1109\/CVPR.2019.01110"},{"key":"22_CR2","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"361","DOI":"10.1007\/978-3-030-58601-0_22","volume-title":"Computer Vision \u2013 ECCV 2020","author":"S Brahmbhatt","year":"2020","unstructured":"Brahmbhatt, S., Tang, C., Twigg, C.D., Kemp, C.C., Hays, J.: ContactPose: a dataset of grasps with object contact and hand pose. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12358, pp. 361\u2013378. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58601-0_22"},{"key":"22_CR3","doi-asserted-by":"crossref","unstructured":"Calli, B., Singh, A., Walsman, A., Srinivasa, S., Abbeel, P., Dollar, A.M.: The YCB object and model set: towards common benchmarks for manipulation research. In: 2015 International Conference on Advanced Robotics (ICAR), pp. 510\u2013517. IEEE (2015)","DOI":"10.1109\/ICAR.2015.7251504"},{"key":"22_CR4","doi-asserted-by":"crossref","unstructured":"Cao, Z., Radosavovic, I., Kanazawa, A., Malik, J.: Reconstructing hand-object interactions in the wild. In: ICCV, pp. 12417\u201312426 (2021)","DOI":"10.1109\/ICCV48922.2021.01219"},{"key":"22_CR5","unstructured":"Chang, A.X., et\u00a0al.: ShapeNet: an information-rich 3D model repository. arXiv preprint arXiv:1512.03012 (2015)"},{"key":"22_CR6","doi-asserted-by":"crossref","unstructured":"Chao, Y.W., et al.: DexYCB: a benchmark for capturing hand grasping of objects. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00893"},{"key":"22_CR7","first-page":"4008","volume":"30","author":"Y Chen","year":"2021","unstructured":"Chen, Y., et al.: Joint hand-object 3d reconstruction from a single image with cross-branch feature fusion. IEEE TIP 30, 4008\u20134021 (2021)","journal-title":"IEEE TIP"},{"key":"22_CR8","doi-asserted-by":"crossref","unstructured":"Chen, Z., Chen, S., Schmid, C., Laptev, I.: gSDF: geometry-driven signed distance functions for 3D hand-object reconstruction. In: CVPR, pp. 12890\u201312900 (2023)","DOI":"10.1109\/CVPR52729.2023.01239"},{"key":"22_CR9","doi-asserted-by":"publisher","unstructured":"Chen, Z., Hasson, Y., Schmid, C., Laptev, I.: AlignSDF: pose-aligned signed distance fields for hand-object reconstruction. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Computer Vision, ECCV 2022. LNCS, vol. 13661, pp. 231\u2013248. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19769-7_14","DOI":"10.1007\/978-3-031-19769-7_14"},{"key":"22_CR10","doi-asserted-by":"crossref","unstructured":"Chen, Z., Zhang, H.: Learning implicit fields for generative shape modeling. In: CVPR, pp. 5939\u20135948 (2019)","DOI":"10.1109\/CVPR.2019.00609"},{"key":"22_CR11","unstructured":"Choe, J., Joung, B., Rameau, F., Park, J., Kweon, I.S.: Deep point cloud reconstruction. In: ICLR (2021)"},{"key":"22_CR12","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"628","DOI":"10.1007\/978-3-319-46484-8_38","volume-title":"Computer Vision \u2013 ECCV 2016","author":"CB Choy","year":"2016","unstructured":"Choy, C.B., Xu, D., Gwak, J.Y., Chen, K., Savarese, S.: 3D-R2N2: a unified approach for single and multi-view 3D object reconstruction. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9912, pp. 628\u2013644. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46484-8_38"},{"key":"22_CR13","doi-asserted-by":"crossref","unstructured":"Corona, E., Pumarola, A., Alenya, G., Moreno-Noguer, F., Rogez, G.: GanHand: predicting human grasp affordances in multi-object scenes. In: CVPR, pp. 5031\u20135041 (2020)","DOI":"10.1109\/CVPR42600.2020.00508"},{"issue":"11","key":"22_CR14","doi-asserted-by":"publisher","first-page":"4125","DOI":"10.1109\/TPAMI.2020.2991965","volume":"43","author":"D Damen","year":"2021","unstructured":"Damen, D., et al.: The epic-kitchens dataset: collection, challenges and baselines. IEEE TPAMI 43(11), 4125\u20134141 (2021). https:\/\/doi.org\/10.1109\/TPAMI.2020.2991965","journal-title":"IEEE TPAMI"},{"key":"22_CR15","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"753","DOI":"10.1007\/978-3-030-01225-0_44","volume-title":"Computer Vision \u2013 ECCV 2018","author":"D Damen","year":"2018","unstructured":"Damen, D., et al.: Scaling egocentric vision: the dataset. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) ECCV 2018. LNCS, vol. 11208, pp. 753\u2013771. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01225-0_44"},{"key":"22_CR16","unstructured":"Di, Y., et al.: CCD-3DR: consistent conditioning in diffusion for single-image 3D reconstruction. arXiv preprint arXiv:2308.07837 (2023)"},{"key":"22_CR17","doi-asserted-by":"crossref","unstructured":"Doosti, B., Naha, S., Mirbagheri, M., Crandall, D.J.: HOPE-Net: a graph-based model for hand-object pose estimation. In: CVPR, pp. 6608\u20136617 (2020)","DOI":"10.1109\/CVPR42600.2020.00664"},{"key":"22_CR18","unstructured":"Dosovitskiy, A., et al.: An image is worth 16$$\\times $$16 words: transformers for image recognition at scale. In: ICLR (2021)"},{"issue":"4","key":"22_CR19","doi-asserted-by":"publisher","first-page":"551","DOI":"10.1109\/TIT.1983.1056714","volume":"29","author":"H Edelsbrunner","year":"1983","unstructured":"Edelsbrunner, H., Kirkpatrick, D., Seidel, R.: On the shape of a set of points in the plane. IEEE Trans. Inf. Theor. 29(4), 551\u2013559 (1983)","journal-title":"IEEE Trans. Inf. Theor."},{"key":"22_CR20","doi-asserted-by":"crossref","unstructured":"Edsinger, A., Kemp, C.C.: Human-robot interaction for cooperative manipulation: handing objects to one another. In: The 16th IEEE International Symposium on Robot and Human Interactive Communication, RO-MAN 2007, pp. 1167\u20131172. IEEE (2007)","DOI":"10.1109\/ROMAN.2007.4415256"},{"key":"22_CR21","doi-asserted-by":"crossref","unstructured":"Fan, H., Su, H., Guibas, L.J.: A point set generation network for 3D object reconstruction from a single image. In: CVPR, pp. 605\u2013613 (2017)","DOI":"10.1109\/CVPR.2017.264"},{"key":"22_CR22","unstructured":"Gao, H., Ji, S.: Graph U-Nets. In: ICML, pp. 2083\u20132092. PMLR (2019)"},{"issue":"18","key":"22_CR23","doi-asserted-by":"publisher","first-page":"17421","DOI":"10.1109\/JSEN.2021.3059685","volume":"22","author":"Q Gao","year":"2021","unstructured":"Gao, Q., Chen, Y., Ju, Z., Liang, Y.: Dynamic hand gesture recognition based on 3D hand pose estimation for human-robot interaction. IEEE Sens. J. 22(18), 17421\u201317430 (2021)","journal-title":"IEEE Sens. J."},{"key":"22_CR24","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"484","DOI":"10.1007\/978-3-319-46466-4_29","volume-title":"Computer Vision \u2013 ECCV 2016","author":"R Girdhar","year":"2016","unstructured":"Girdhar, R., Fouhey, D.F., Rodriguez, M., Gupta, A.: Learning a predictable and generative vector representation for objects. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9910, pp. 484\u2013499. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46466-4_29"},{"key":"22_CR25","doi-asserted-by":"crossref","unstructured":"Gkioxari, G., Malik, J., Johnson, J.: Mesh R-CNN. In: ICCV, pp. 9785\u20139795 (2019)","DOI":"10.1109\/ICCV.2019.00988"},{"key":"22_CR26","doi-asserted-by":"crossref","unstructured":"Grady, P., Tang, C., Twigg, C.D., Vo, M., Brahmbhatt, S., Kemp, C.C.: ContactOpt: optimizing contact to improve grasps. In: CVPR, pp. 1471\u20131481 (2021)","DOI":"10.1109\/CVPR46437.2021.00152"},{"key":"22_CR27","doi-asserted-by":"crossref","unstructured":"Groueix, T., Fisher, M., Kim, V.G., Russell, B.C., Aubry, M.: A papier-m\u00e2ch\u00e9 approach to learning 3D surface generation. In: CVPR, pp. 216\u2013224 (2018)","DOI":"10.1109\/CVPR.2018.00030"},{"key":"22_CR28","doi-asserted-by":"crossref","unstructured":"Hampali, S., Rad, M., Oberweger, M., Lepetit, V.: HOnnotate: a method for 3D annotation of hand and object poses. In: CVPR, pp. 3196\u20133206 (2020)","DOI":"10.1109\/CVPR42600.2020.00326"},{"key":"22_CR29","doi-asserted-by":"crossref","unstructured":"Hartley, R., Zisserman, A.: Multiple View Geometry in Computer Vision. Cambridge University Press (2003)","DOI":"10.1017\/CBO9780511811685"},{"key":"22_CR30","doi-asserted-by":"crossref","unstructured":"Hasson, Y., Tekin, B., Bogo, F., Laptev, I., Pollefeys, M., Schmid, C.: Leveraging photometric consistency over time for sparsely supervised hand-object reconstruction. In: CVPR, pp. 571\u2013580 (2020)","DOI":"10.1109\/CVPR42600.2020.00065"},{"key":"22_CR31","doi-asserted-by":"crossref","unstructured":"Hasson, Y., et al.: Learning joint reconstruction of hands and manipulated objects. In: CVPR, pp. 11807\u201311816 (2019)","DOI":"10.1109\/CVPR.2019.01208"},{"key":"22_CR32","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"22_CR33","unstructured":"Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. In: NeurIPS, vol. 33, pp. 6840\u20136851 (2020)"},{"key":"22_CR34","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"125","DOI":"10.1007\/978-3-030-01252-6_8","volume-title":"Computer Vision \u2013 ECCV 2018","author":"U Iqbal","year":"2018","unstructured":"Iqbal, U., Molchanov, P., Breuel, T., Gall, J., Kautz, J.: Hand pose estimation via latent 2.5D heatmap regression. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) ECCV 2018. LNCS, vol. 11215, pp. 125\u2013143. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01252-6_8"},{"key":"22_CR35","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"386","DOI":"10.1007\/978-3-030-01267-0_23","volume-title":"Computer Vision \u2013 ECCV 2018","author":"A Kanazawa","year":"2018","unstructured":"Kanazawa, A., Tulsiani, S., Efros, A.A., Malik, J.: Learning category-specific mesh reconstruction from image collections. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) ECCV 2018. LNCS, vol. 11219, pp. 386\u2013402. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01267-0_23"},{"key":"22_CR36","doi-asserted-by":"crossref","unstructured":"Kar, A., Tulsiani, S., Carreira, J., Malik, J.: Category-specific object reconstruction from a single image. In: CVPR, pp. 1966\u20131974 (2015)","DOI":"10.1109\/CVPR.2015.7298807"},{"key":"22_CR37","doi-asserted-by":"crossref","unstructured":"Karunratanakul, K., Yang, J., Zhang, Y., Black, M.J., Muandet, K., Tang, S.: Grasping field: learning implicit representations for human grasps. In: 3DV, pp. 333\u2013344. IEEE (2020)","DOI":"10.1109\/3DV50981.2020.00043"},{"key":"22_CR38","doi-asserted-by":"crossref","unstructured":"Leng, Z., Chen, J., Shum, H.P., Li, F.W., Liang, X.: Stable hand pose estimation under tremor via graph neural network. In: 2021 IEEE Virtual Reality and 3D User Interfaces (VR), pp. 226\u2013234. IEEE (2021)","DOI":"10.1109\/VR50410.2021.00044"},{"key":"22_CR39","doi-asserted-by":"crossref","unstructured":"Lin, C.H., Kong, C., Lucey, S.: Learning efficient point cloud generation for dense 3D object reconstruction. In: AAAI, vol.\u00a032 (2018)","DOI":"10.1609\/aaai.v32i1.12278"},{"key":"22_CR40","doi-asserted-by":"crossref","unstructured":"Liu, S., Jiang, H., Xu, J., Liu, S., Wang, X.: Semi-supervised 3D hand-object poses estimation with interactions in time. In: CVPR, pp. 14687\u201314697 (2021)","DOI":"10.1109\/CVPR46437.2021.01445"},{"key":"22_CR41","unstructured":"Liu, Z., Tang, H., Lin, Y., Han, S.: Point-voxel CNN for efficient 3D deep learning. In: NeurIPS, vol. 32 (2019)"},{"key":"22_CR42","doi-asserted-by":"crossref","unstructured":"Luo, S., Hu, W.: Diffusion probabilistic models for 3D point cloud generation. In: CVPR, pp. 2837\u20132845 (2021)","DOI":"10.1109\/CVPR46437.2021.00286"},{"key":"22_CR43","doi-asserted-by":"crossref","unstructured":"Luo, S., Hu, W.: Diffusion probabilistic models for 3D point cloud generation. In: CVPR, June 2021, pp. 2837\u20132845 (2021)","DOI":"10.1109\/CVPR46437.2021.00286"},{"key":"22_CR44","doi-asserted-by":"crossref","unstructured":"Melas-Kyriazi, L., Rupprecht, C., Vedaldi, A.: PC$$^2$$: projection-conditioned point cloud diffusion for single-image 3D reconstruction. In: CVPR, June 2023, pp. 12923\u201312932 ()","DOI":"10.1109\/CVPR52729.2023.01242"},{"key":"22_CR45","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"405","DOI":"10.1007\/978-3-030-58452-8_24","volume-title":"Computer Vision \u2013 ECCV 2020","author":"B Mildenhall","year":"2020","unstructured":"Mildenhall, B., Srinivasan, P.P., Tancik, M., Barron, J.T., Ramamoorthi, R., Ng, R.: NeRF: representing scenes as neural radiance fields for view synthesis. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12346, pp. 405\u2013421. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58452-8_24"},{"issue":"4","key":"22_CR46","doi-asserted-by":"publisher","first-page":"110","DOI":"10.1109\/MRA.2004.1371616","volume":"11","author":"AT Miller","year":"2004","unstructured":"Miller, A.T., Allen, P.K.: Graspit! a versatile simulator for robotic grasping. IEEE Robot. Autom. Mag. 11(4), 110\u2013122 (2004)","journal-title":"IEEE Robot. Autom. Mag."},{"key":"22_CR47","doi-asserted-by":"crossref","unstructured":"Mueller, F., et al.: GANerated hands for real-time 3D hand tracking from monocular RGB. In: CVPR, pp. 49\u201359 (2018)","DOI":"10.1109\/CVPR.2018.00013"},{"issue":"4","key":"22_CR48","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3306346.3322958","volume":"38","author":"F Mueller","year":"2019","unstructured":"Mueller, F., et al.: Real-time pose and shape reconstruction of two interacting hands with a single depth camera. ACM TOG 38(4), 1\u201313 (2019)","journal-title":"ACM TOG"},{"key":"22_CR49","unstructured":"Nichol, A.Q., Dhariwal, P.: Improved denoising diffusion probabilistic models. In: ICML, pp. 8162\u20138171. PMLR (2021)"},{"issue":"6","key":"22_CR50","doi-asserted-by":"publisher","first-page":"1855","DOI":"10.1109\/TRO.2021.3075365","volume":"37","author":"V Ortenzi","year":"2021","unstructured":"Ortenzi, V., Cosgun, A., Pardi, T., Chan, W.P., Croft, E., Kuli\u0107, D.: Object handovers: a review for robotics. IEEE Trans. Rob. 37(6), 1855\u20131873 (2021)","journal-title":"IEEE Trans. Rob."},{"key":"22_CR51","doi-asserted-by":"crossref","unstructured":"Panteleris, P., Oikonomidis, I., Argyros, A.: Using a single RGB frame for real time 3D hand pose estimation in the wild. In: WACV, pp. 436\u2013445. IEEE (2018)","DOI":"10.1109\/WACV.2018.00054"},{"key":"22_CR52","doi-asserted-by":"crossref","unstructured":"Park, J.J., Florence, P., Straub, J., Newcombe, R., Lovegrove, S.: DeepSDF: learning continuous signed distance functions for shape representation. In: CVPR, pp. 165\u2013174 (2019)","DOI":"10.1109\/CVPR.2019.00025"},{"issue":"12","key":"22_CR53","doi-asserted-by":"publisher","first-page":"2883","DOI":"10.1109\/TPAMI.2017.2759736","volume":"40","author":"TH Pham","year":"2017","unstructured":"Pham, T.H., Kyriazis, N., Argyros, A.A., Kheddar, A.: Hand-object contact force estimation from markerless visual tracking. IEEE TPAMI 40(12), 2883\u20132896 (2017)","journal-title":"IEEE TPAMI"},{"key":"22_CR54","unstructured":"Qi, C.R., Su, H., Mo, K., Guibas, L.J.: PointNet: deep learning on point sets for 3D classification and segmentation. In: CVPR, pp. 652\u2013660 (2017)"},{"key":"22_CR55","doi-asserted-by":"crossref","unstructured":"Qian, X., He, F., Hu, X., Wang, T., Ramani, K.: ARnnotate: an augmented reality interface for collecting custom dataset of 3D hand-object interaction pose estimation. In: Proceedings of the 35th Annual ACM Symposium on User Interface Software and Technology, pp. 1\u201314 (2022)","DOI":"10.1145\/3526113.3545663"},{"issue":"4","key":"22_CR56","doi-asserted-by":"publisher","first-page":"2251","DOI":"10.3390\/app13042251","volume":"13","author":"HR Rantamaa","year":"2023","unstructured":"Rantamaa, H.R., Kangas, J., Kumar, S.K., Mehtonen, H., J\u00e4rnstedt, J., Raisamo, R.: Comparison of a VR stylus with a controller, hand tracking, and a mouse for object manipulation and medical marking tasks in virtual reality. Appl. Sci. 13(4), 2251 (2023)","journal-title":"Appl. Sci."},{"key":"22_CR57","unstructured":"Ravi, N., et al.: Accelerating 3d deep learning with PyTorch3D. arXiv preprint arXiv:2007.08501 (2020)"},{"key":"22_CR58","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"356","DOI":"10.1007\/978-3-319-16178-5_25","volume-title":"Computer Vision - ECCV 2014 Workshops","author":"G Rogez","year":"2015","unstructured":"Rogez, G., Khademi, M., Supan\u010di\u010d III, J.S., Montiel, J.M.M., Ramanan, D.: 3D hand pose detection in egocentric RGB-D images. In: Agapito, L., Bronstein, M.M., Rother, C. (eds.) ECCV 2014. LNCS, vol. 8925, pp. 356\u2013371. Springer, Cham (2015). https:\/\/doi.org\/10.1007\/978-3-319-16178-5_25"},{"key":"22_CR59","doi-asserted-by":"crossref","unstructured":"Rogez, G., Supancic, J.S., Ramanan, D.: Understanding everyday hands in action from RGB-D images. In: ICCV, pp. 3889\u20133897 (2015)","DOI":"10.1109\/ICCV.2015.443"},{"key":"22_CR60","doi-asserted-by":"crossref","unstructured":"Romero, J., Tzionas, D., Black, M.J.: Embodied hands: modeling and capturing hands and bodies together. ACM TOG 36(6) (2017)","DOI":"10.1145\/3130800.3130883"},{"key":"22_CR61","doi-asserted-by":"crossref","unstructured":"Rong, Y., Shiratori, T., Joo, H.: FrankMocap: a monocular 3D whole-body pose estimation system via regression and integration. In: ICCVW (2021)","DOI":"10.1109\/ICCVW54120.2021.00201"},{"key":"22_CR62","doi-asserted-by":"crossref","unstructured":"Sch\u00f6nberger, J.L., Frahm, J.M.: Structure-from-motion revisited. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.445"},{"key":"22_CR63","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"501","DOI":"10.1007\/978-3-319-46487-9_31","volume-title":"Computer Vision \u2013 ECCV 2016","author":"JL Sch\u00f6nberger","year":"2016","unstructured":"Sch\u00f6nberger, J.L., Zheng, E., Frahm, J.-M., Pollefeys, M.: Pixelwise view selection for unstructured multi-view stereo. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9907, pp. 501\u2013518. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46487-9_31"},{"key":"22_CR64","doi-asserted-by":"crossref","unstructured":"Seitz, S.M., Curless, B., Diebel, J., Scharstein, D., Szeliski, R.: A comparison and evaluation of multi-view stereo reconstruction algorithms. In: CVPR, vol.\u00a01, pp. 519\u2013528. IEEE (2006)","DOI":"10.1109\/CVPR.2006.19"},{"key":"22_CR65","doi-asserted-by":"crossref","unstructured":"Shan, D., Geng, J., Shu, M., Fouhey, D.F.: Understanding human hands in contact at internet scale. In: CVPR, pp. 9869\u20139878 (2020)","DOI":"10.1109\/CVPR42600.2020.00989"},{"key":"22_CR66","doi-asserted-by":"crossref","unstructured":"Sridhar, S., Mueller, F., Oulasvirta, A., Theobalt, C.: Fast and robust hand tracking using detection-guided optimization. In: CVPR, pp. 3213\u20133221 (2015)","DOI":"10.1109\/CVPR.2015.7298941"},{"key":"22_CR67","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"294","DOI":"10.1007\/978-3-319-46475-6_19","volume-title":"Computer Vision \u2013 ECCV 2016","author":"S Sridhar","year":"2016","unstructured":"Sridhar, S., Mueller, F., Zollh\u00f6fer, M., Casas, D., Oulasvirta, A., Theobalt, C.: Real-time joint tracking of a hand manipulating an object from RGB-D input. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9906, pp. 294\u2013310. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46475-6_19"},{"key":"22_CR68","doi-asserted-by":"crossref","unstructured":"Tatarchenko, M., Richter, S.R., Ranftl, R., Li, Z., Koltun, V., Brox, T.: What do single-view 3D reconstruction networks learn? In: CVPR, pp. 3405\u20133414 (2019)","DOI":"10.1109\/CVPR.2019.00352"},{"key":"22_CR69","doi-asserted-by":"crossref","unstructured":"Tekin, B., Bogo, F., Pollefeys, M.: H+O: unified egocentric recognition of 3D hand-object poses and interactions. In: CVPR, June 2019 (2019)","DOI":"10.1109\/CVPR.2019.00464"},{"issue":"4","key":"22_CR70","doi-asserted-by":"publisher","first-page":"719","DOI":"10.1109\/TPAMI.2016.2574713","volume":"39","author":"S Tulsiani","year":"2016","unstructured":"Tulsiani, S., Kar, A., Carreira, J., Malik, J.: Learning category-specific deformable 3D models for object reconstruction. IEEE TPAMI 39(4), 719\u2013731 (2016)","journal-title":"IEEE TPAMI"},{"key":"22_CR71","doi-asserted-by":"publisher","first-page":"172","DOI":"10.1007\/s11263-016-0895-4","volume":"118","author":"D Tzionas","year":"2016","unstructured":"Tzionas, D., Ballan, L., Srikantha, A., Aponte, P., Pollefeys, M., Gall, J.: Capturing hands in action using discriminative salient points and physics simulation. IJCV 118, 172\u2013193 (2016). https:\/\/doi.org\/10.1007\/s11263-016-0895-4","journal-title":"IJCV"},{"key":"22_CR72","doi-asserted-by":"crossref","unstructured":"Tzionas, D., Gall, J.: 3D object reconstruction from hand-object interactions. In: ICCV, pp. 729\u2013737 (2015)","DOI":"10.1109\/ICCV.2015.90"},{"key":"22_CR73","unstructured":"Wu, J., Zhang, C., Xue, T., Freeman, B., Tenenbaum, J.: Learning a probabilistic latent space of object shapes via 3D generative-adversarial modeling. In: NeurIPS, vol. 29 (2016)"},{"key":"22_CR74","doi-asserted-by":"crossref","unstructured":"Xie, H., Yao, H., Sun, X., Zhou, S., Zhang, S.: Pix2Vox: context-aware 3D reconstruction from single and multi-view images. In: ICCV, pp. 2690\u20132698 (2019)","DOI":"10.1109\/ICCV.2019.00278"},{"issue":"12","key":"22_CR75","doi-asserted-by":"publisher","first-page":"2919","DOI":"10.1007\/s11263-020-01347-6","volume":"128","author":"H Xie","year":"2020","unstructured":"Xie, H., Yao, H., Zhang, S., Zhou, S., Sun, W.: Pix2Vox++: multi-scale context-aware 3D object reconstruction from single and multiple images. IJCV 128(12), 2919\u20132935 (2020). https:\/\/doi.org\/10.1007\/s11263-020-01347-6","journal-title":"IJCV"},{"key":"22_CR76","doi-asserted-by":"crossref","unstructured":"Yang, L., et al.: ArtiBoost: boosting articulated 3D hand-object pose estimation via online exploration and synthesis. In: CVPR, pp. 2750\u20132760 (2022)","DOI":"10.1109\/CVPR52688.2022.00277"},{"key":"22_CR77","doi-asserted-by":"crossref","unstructured":"Yang, L., Zhan, X., Li, K., Xu, W., Li, J., Lu, C.: CPF: learning a contact potential field to model the hand-object interaction. In: ICCV, pp. 11097\u201311106 (2021)","DOI":"10.1109\/ICCV48922.2021.01091"},{"key":"22_CR78","doi-asserted-by":"crossref","unstructured":"Ye, Y., Gupta, A., Tulsiani, S.: What\u2019s in your hands? 3D reconstruction of generic objects in hands. In: CVPR, June 2022, pp. 3895\u20133905 (2022)","DOI":"10.1109\/CVPR52688.2022.00387"},{"key":"22_CR79","unstructured":"Zeng, X., et al.: LION: latent point diffusion models for 3D shape generation. In: NeurIPS (2022)"},{"key":"22_CR80","unstructured":"Zhang, C., et al.: DDF-HO: hand-held object reconstruction via conditional directed distance field. In: NeurIPS, vol. 36 (2024)"},{"key":"22_CR81","doi-asserted-by":"crossref","unstructured":"Zhang, C., et al.: MOHO: learning single-view hand-held object reconstruction with multi-view occlusion-aware supervision. arXiv preprint arXiv:2310.11696 (2024)","DOI":"10.1109\/CVPR52733.2024.00953"},{"key":"22_CR82","doi-asserted-by":"crossref","unstructured":"Zhang, X., Li, Q., Mo, H., Zhang, W., Zheng, W.: End-to-end hand mesh recovery from a monocular RGB image. In: ICCV, pp. 2354\u20132364 (2019)","DOI":"10.1109\/ICCV.2019.00244"},{"key":"22_CR83","doi-asserted-by":"crossref","unstructured":"Zhou, L., Du, Y., Wu, J.: 3D shape generation and completion through point-voxel diffusion. In: ICCV, October 2021, pp. 5826\u20135835 (2021)","DOI":"10.1109\/ICCV48922.2021.00577"},{"key":"22_CR84","unstructured":"Zhou, Q.Y., Park, J., Koltun, V.: Open3D: a modern library for 3D data processing. arXiv preprint arXiv:1801.09847 (2018)"},{"key":"22_CR85","doi-asserted-by":"crossref","unstructured":"Zhou, Y., Habermann, M., Xu, W., Habibie, I., Theobalt, C., Xu, F.: Monocular real-time hand shape and motion capture using multi-modal data. In: CVPR, pp. 5346\u20135355 (2020)","DOI":"10.1109\/CVPR42600.2020.00539"},{"key":"22_CR86","doi-asserted-by":"crossref","unstructured":"Zimmermann, C., Brox, T.: Learning to estimate 3d hand pose from single RGB images. In: ICCV, pp. 4903\u20134911 (2017)","DOI":"10.1109\/ICCV.2017.525"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-73397-0_22","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,2]],"date-time":"2024-11-02T19:20:57Z","timestamp":1730575257000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-73397-0_22"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,3]]},"ISBN":["9783031733963","9783031733970"],"references-count":86,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-73397-0_22","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,3]]},"assertion":[{"value":"3 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}