{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,26]],"date-time":"2026-07-26T05:31:00Z","timestamp":1785043860348,"version":"3.55.0"},"reference-count":57,"publisher":"Springer Science and Business Media LLC","issue":"12","license":[{"start":{"date-parts":[[2020,7,15]],"date-time":"2020-07-15T00:00:00Z","timestamp":1594771200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,7,15]],"date-time":"2020-07-15T00:00:00Z","timestamp":1594771200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61772158"],"award-info":[{"award-number":["61772158"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61702136"],"award-info":[{"award-number":["61702136"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61872112"],"award-info":[{"award-number":["61872112"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2020,12]]},"DOI":"10.1007\/s11263-020-01347-6","type":"journal-article","created":{"date-parts":[[2020,7,15]],"date-time":"2020-07-15T05:37:48Z","timestamp":1594791468000},"page":"2919-2935","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":190,"title":["Pix2Vox++: Multi-scale Context-aware 3D Object Reconstruction from Single and Multiple Images"],"prefix":"10.1007","volume":"128","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-9596-5179","authenticated-orcid":false,"given":"Haozhe","family":"Xie","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3298-2574","authenticated-orcid":false,"given":"Hongxun","family":"Yao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5200-3420","authenticated-orcid":false,"given":"Shengping","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8201-8877","authenticated-orcid":false,"given":"Shangchen","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5026-8820","authenticated-orcid":false,"given":"Wenxiu","family":"Sun","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2020,7,15]]},"reference":[{"issue":"8","key":"1347_CR1","doi-asserted-by":"publisher","first-page":"1670","DOI":"10.1109\/TPAMI.2014.2377712","volume":"37","author":"JT Barron","year":"2015","unstructured":"Barron, J. T., & Malik, J. (2015). Shape, illumination, and reflectance from shading. TPAMI, 37(8), 1670\u20131687.","journal-title":"TPAMI"},{"issue":"6","key":"1347_CR2","doi-asserted-by":"publisher","first-page":"1309","DOI":"10.1109\/TRO.2016.2624754","volume":"32","author":"C Cadena","year":"2016","unstructured":"Cadena, C., Carlone, L., Carrillo, H., Latif, Y., Scaramuzza, D., Neira, J., et al. (2016). Past, present, and future of simultaneous localization and mapping: Toward the robust-perception age. IEEE Transactions on Robotics, 32(6), 1309\u20131332.","journal-title":"IEEE Transactions on Robotics"},{"key":"1347_CR3","unstructured":"Chang, A. X., Funkhouser, T. A., Guibas, L. J., Hanrahan, P., Huang, Q., Li, Z., Savarese, S., Savva, M., Song, S., Su, H., Xiao, J., Yi, L., & Yu, F. (2015). ShapeNet: An information-rich 3D model repository. arXiv:1512.03012"},{"key":"1347_CR4","doi-asserted-by":"crossref","unstructured":"Chen, Z., & Zhang, H. (2019). Learning implicit fields for generative shape modeling. In CVPR","DOI":"10.1109\/CVPR.2019.00609"},{"key":"1347_CR5","doi-asserted-by":"crossref","unstructured":"Choy, C. B., Xu, D., Gwak, J., Chen, K., & Savarese, S. (2016). 3D-R2N2: A unified approach for single and multi-view 3D object reconstruction. In ECCV","DOI":"10.1007\/978-3-319-46484-8_38"},{"key":"1347_CR6","doi-asserted-by":"crossref","unstructured":"Dibra, E., Jain, H., \u00d6ztireli, A. C., Ziegler, R., & Gross, M. H. (2017). Human shape from silhouettes using generative HKS descriptors and cross-modal neural networks. In CVPR","DOI":"10.1109\/CVPR.2017.584"},{"key":"1347_CR7","doi-asserted-by":"crossref","unstructured":"Fan, H., Su, H., & Guibas, L. J. (2017). A point set generation network for 3D object reconstruction from a single image. In CVPR","DOI":"10.1109\/CVPR.2017.264"},{"issue":"1","key":"1347_CR8","doi-asserted-by":"publisher","first-page":"55","DOI":"10.1007\/s10462-012-9365-8","volume":"43","author":"J Fuentes-Pacheco","year":"2015","unstructured":"Fuentes-Pacheco, J., Ascencio, J. R., & Rend\u00f3n-Mancha, J. M. (2015). Visual simultaneous localization and mapping: A survey. Artificial Intelligence Review, 43(1), 55\u201381.","journal-title":"Artificial Intelligence Review"},{"key":"1347_CR9","unstructured":"Goodfellow, I. J., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A. C., & Bengio, Y. (2014). Generative adversarial nets. In NIPS"},{"key":"1347_CR10","doi-asserted-by":"crossref","unstructured":"Groueix, T., Fisher, M., Kim, V. G., Russell, B. C., & Aubry, M. (2018). A papier-m\u00e2ch\u00e9 approach to learning 3D surface generation. In CVPR","DOI":"10.1109\/CVPR.2018.00030"},{"key":"1347_CR11","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2019.2954885","author":"X Han","year":"2019","unstructured":"Han, X., Laga, H., & Bennamoun, M. (2019). Image-based 3D object reconstruction: State-of-the-art and trends in the deep learning era. TPAMI,. https:\/\/doi.org\/10.1109\/TPAMI.2019.2954885.","journal-title":"TPAMI"},{"key":"1347_CR12","volume-title":"Multiple view geometry in computer vision","author":"A Harltey","year":"2006","unstructured":"Harltey, A., & Zisserman, A. (2006). Multiple view geometry in computer vision (2nd ed.). Cambridge: Cambridge University Press.","edition":"2"},{"key":"1347_CR13","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In CVPR","DOI":"10.1109\/CVPR.2016.90"},{"key":"1347_CR14","doi-asserted-by":"crossref","unstructured":"Huang, G., Liu, Z., van\u00a0der Maaten, L., & Weinberger, K. Q. (2017). Densely connected convolutional networks. In CVPR","DOI":"10.1109\/CVPR.2017.243"},{"key":"1347_CR15","doi-asserted-by":"crossref","unstructured":"Huang, P., Matzen, K., Kopf, J., Ahuja, N., & Huang, J. (2018). Deepmvs: Learning multi-view stereopsis. In CVPR","DOI":"10.1109\/CVPR.2018.00298"},{"key":"1347_CR16","doi-asserted-by":"crossref","unstructured":"Hwang, K., & Sung, W. (2015). Single stream parallelization of generalized LSTM-like RNNs on a GPU. In ICASSP","DOI":"10.1109\/ICASSP.2015.7178129"},{"key":"1347_CR17","unstructured":"Kar, A., H\u00e4ne, C., & Malik, J. (2017). Learning a multi-view stereo machine. In NIPS"},{"key":"1347_CR18","doi-asserted-by":"crossref","unstructured":"Kato, H., & Harada, T. (2019). Learning view priors for single-view 3D reconstruction. In CVPR","DOI":"10.1109\/CVPR.2019.01001"},{"key":"1347_CR19","unstructured":"Kingma, D. P., & Ba, J. (2015). Adam: A method for stochastic optimization. In ICLR"},{"key":"1347_CR20","unstructured":"Kingma, D. P., & Welling, M. (2014). Auto-encoding variational bayes. In ICLR"},{"key":"1347_CR21","doi-asserted-by":"crossref","unstructured":"Lin, C., Kong, C., & Lucey, S. (2018). Learning efficient point cloud generation for dense 3D object reconstruction. In AAAI","DOI":"10.1609\/aaai.v32i1.12278"},{"key":"1347_CR22","doi-asserted-by":"crossref","unstructured":"Lin, C., Wang, O., Russell, B. C., Shechtman, E., Kim, V. G., Fisher, M., & Lucey, S. (2019) . Hotometric mesh optimization for video-aligned 3D object reconstruction. In CVPR","DOI":"10.1109\/CVPR.2019.00106"},{"key":"1347_CR23","doi-asserted-by":"crossref","unstructured":"Lorensen, W. E., & Cline, H. E. (1987). Marching cubes: A high resolution 3D surface construction algorithm. In SIGGRAPH","DOI":"10.1145\/37401.37422"},{"key":"1347_CR24","doi-asserted-by":"crossref","unstructured":"Mescheder, L. M., Oechsle, M., Niemeyer, M., Nowozin, S., & Geiger, A.(2019). Occupancy networks: Learning 3D reconstruction in function space. In CVPR","DOI":"10.1109\/CVPR.2019.00459"},{"issue":"6","key":"1347_CR25","first-page":"38","volume":"242:19","author":"K Mo","year":"2019","unstructured":"Mo, K., Guerrero, P., Yi, L., Su, H., Wonka, P., Mitra, N. J., et al. (2019). StructureNet: Hierarchical graph networks for 3D shape generation. ACM Transactions on Graphics, 242:19(6), 38\u2013242:1.","journal-title":"ACM Transactions on Graphics"},{"key":"1347_CR26","doi-asserted-by":"crossref","unstructured":"Mo, K., Zhu, S., Chang, A. X., Yi, L., Tripathi, S., Guibas, L. J., & Su, H. (2019b). PartNet: A large-scale benchmark for fine-grained and hierarchical part-level 3D object understanding. In CVPR","DOI":"10.1109\/CVPR.2019.00100"},{"key":"1347_CR27","doi-asserted-by":"publisher","first-page":"305","DOI":"10.1017\/S096249291700006X","volume":"26","author":"O \u00d6zyeil","year":"2017","unstructured":"\u00d6zyeil, O., Voroninski, V., Basri, R., & Singer, A. (2017). A survey of structure from motion. Acta Numerica, 26, 305\u2013364.","journal-title":"Acta Numerica"},{"key":"1347_CR28","unstructured":"Pascanu, R., Mikolov, T., & Bengio, Y. (2013). On the difficulty of training recurrent neural networks. In ICML"},{"key":"1347_CR29","doi-asserted-by":"crossref","unstructured":"Paschalidou, D., Ulusoy, A. O., Schmitt, C., Gool, L. V., & Geiger, A. (2018). Raynet: Learning volumetric 3D reconstruction with ray potentials. In CVPR","DOI":"10.1109\/CVPR.2018.00410"},{"key":"1347_CR30","doi-asserted-by":"crossref","unstructured":"Paschalidou, D., Gool, L. V., & Geiger, A. (2020). Learning unsupervised hierarchical part decomposition of 3D objects from a single RGB image. In CVPR","DOI":"10.1109\/CVPR42600.2020.00114"},{"key":"1347_CR31","unstructured":"Paszke, A., Gross, S., Massa, F., Lerer, A., Bradbury, J., Chanan, G., Killeen, T., Lin, Z., Gimelshein, N., Antiga, L., Desmaison, A., Kopf, A., Yang, E., DeVito, Z., Raison, M., Tejani, A., Chilamkurthy, S., Steiner, B., Fang, L., Bai, J., & Chintala, S. (2019). PyTorch: An imperative style, high-performance deep learning library. In NeurIPS"},{"key":"1347_CR32","doi-asserted-by":"crossref","unstructured":"Richter, S. R., & Roth, S. (2015). Discriminative shape from shading in uncalibrated illumination. In CVPR","DOI":"10.1016\/j.cag.2015.09.001"},{"key":"1347_CR33","unstructured":"Richter, S. R., & Roth, S. (2018). Matryoshka networks: Predicting 3D geometry via nested shape layers. In CVPR"},{"key":"1347_CR34","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P., & Brox, T. (2015). U-net: Convolutional networks for biomedical image segmentation. In MICCAI","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"1347_CR35","doi-asserted-by":"crossref","unstructured":"Shin, D., Fowlkes, C. C., & Hoiem, D. (2018). Pixels, voxels, and views: A study of shape representations for single view 3D object shape prediction. In CVPR","DOI":"10.1109\/CVPR.2018.00323"},{"key":"1347_CR36","unstructured":"Simonyan, K., & Zisserman, A. (2015). Very deep convolutional networks for large-scale image recognition. In ICLR"},{"key":"1347_CR37","doi-asserted-by":"crossref","unstructured":"Song, S., Yu, F., Zeng, A., Chang, A. X., Savva, M., & Funkhouser, T. A. (2017). Semantic scene completion from a single depth image. In CVPR","DOI":"10.1109\/CVPR.2017.28"},{"key":"1347_CR38","doi-asserted-by":"crossref","unstructured":"Su, H., Qi, C. R., Li, Y., & Guibas, L. J.(2015). Render for CNN: Viewpoint stimation in images using cnns trained with rendered 3D model views. In ICCV","DOI":"10.1109\/ICCV.2015.308"},{"key":"1347_CR39","doi-asserted-by":"crossref","unstructured":"Sun, X., Wu, J., Zhang, X., Zhang, Z., Zhang, C., Xue, T., Tenenbaum, J. B., & Freeman, W. T. (2018). Pix3D: Dataset and methods for single-image 3D shape modeling. In CVPR","DOI":"10.1109\/CVPR.2018.00314"},{"key":"1347_CR40","doi-asserted-by":"crossref","unstructured":"Tatarchenko, M., Dosovitskiy, A., & Brox, T. (2017). Octree generating networks: Efficient convolutional architectures for high-resolution 3D outputs. In ICCV","DOI":"10.1109\/ICCV.2017.230"},{"key":"1347_CR41","doi-asserted-by":"crossref","unstructured":"Tatarchenko, M., Richter, S. R., Ranftl, R., Li, Z., Koltun, V., & Brox, T. (2019). What do single-view 3D reconstruction networks learn? In CVPR","DOI":"10.1109\/CVPR.2019.00352"},{"key":"1347_CR42","unstructured":"Vinyals, O., Bengio, S., & Kudlur, M. (2016). Order matters: Sequence to sequence for sets. In ICLR"},{"key":"1347_CR43","doi-asserted-by":"crossref","unstructured":"Wang, N., Zhang, Y., Li, Z., Fu, Y., Liu, W., & Jiang, Y. (2018). Pixel2Mesh: Generating 3D mesh models from single RGB images. In ECCV","DOI":"10.1007\/978-3-030-01252-6_4"},{"key":"1347_CR44","doi-asserted-by":"crossref","unstructured":"Wen, C., Zhang, Y., Li, Z., & Fu, Y. (2019). Pixel2Mesh++: Multi-view 3D mesh generation via deformation. In ICCV","DOI":"10.1109\/ICCV.2019.00113"},{"issue":"1\u20133","key":"1347_CR45","doi-asserted-by":"publisher","first-page":"17","DOI":"10.1016\/0004-3702(81)90019-9","volume":"17","author":"AP Witkin","year":"1981","unstructured":"Witkin, A. P. (1981). Recovering surface shape and orientation from texture. Artificial intelligence, 17(1\u20133), 17\u201345.","journal-title":"Artificial intelligence"},{"key":"1347_CR46","unstructured":"Wu, J., Zhang, C., Xue, T., Freeman, B., & Tenenbaum, J. (2016). Learning a probabilistic latent space of object shapes via 3D generative-adversarial modeling. In NIPS"},{"key":"1347_CR47","unstructured":"Wu, J., Wang, Y., Xue, T., Sun, X., Freeman, B., & Tenenbaum, J. (2017). MarrNet: 3D shape reconstruction via 2.5D sketches. In NIPS"},{"key":"1347_CR48","doi-asserted-by":"crossref","unstructured":"Wu, J., Zhang, C., Zhang, X., Zhang, Z., Freeman, W. T., & Tenenbaum, J. B. (2018). Learning shape priors for single-view 3D completion and reconstruction. In ECCV","DOI":"10.1007\/978-3-030-01252-6_40"},{"key":"1347_CR49","unstructured":"Wu, Z., Song, S., Khosla, A., Yu, F., Zhang, L., Tang, X., & Xiao, J. (2015). 3D ShapeNets: A deep representation for volumetric shapes. In CVPR"},{"key":"1347_CR50","doi-asserted-by":"crossref","unstructured":"Xiao, J., Hays, J., Ehinger, K. A., Oliva, A., & Torralba, A. (2010). SUN database: Large-scale scene recognition from abbey to zoo. In CVPR","DOI":"10.1109\/CVPR.2010.5539970"},{"key":"1347_CR51","unstructured":"Xiao, J., Ehinger, K. A., Oliva, A., & Torralba, A. (2012). Recognizing scene viewpoint using panoramic place representation. In CVPR"},{"key":"1347_CR52","doi-asserted-by":"crossref","unstructured":"Xie, H., Yao, H., Sun, X., Zhou, S., & Zhang, S. (2019). Pix2Vox: Context-aware 3D reconstruction from single and multi-view images. In ICCV","DOI":"10.1109\/ICCV.2019.00278"},{"key":"1347_CR53","unstructured":"Xu, Q., Wang, W., Ceylan, D., Mech, R., & Neumann, U. (2019). DISN: Deep implicit surface network for high-quality single-view 3D reconstruction. In NeurIPS"},{"issue":"12","key":"1347_CR54","doi-asserted-by":"publisher","first-page":"2820","DOI":"10.1109\/TPAMI.2018.2868195","volume":"41","author":"B Yang","year":"2019","unstructured":"Yang, B., Rosa, S., Markham, A., Trigoni, N., & Wen, H. (2019). Dense 3D object reconstruction from a single depth view. TPAMI, 41(12), 2820\u20132834.","journal-title":"TPAMI"},{"issue":"1","key":"1347_CR55","doi-asserted-by":"publisher","first-page":"53","DOI":"10.1007\/s11263-019-01217-w","volume":"128","author":"B Yang","year":"2020","unstructured":"Yang, B., Wang, S., Markham, A., & Trigoni, N. (2020). Attentional aggregation of deep feature sets for multi-view 3D reconstruction. IJCV, 128(1), 53\u201373.","journal-title":"IJCV"},{"key":"1347_CR56","doi-asserted-by":"publisher","first-page":"57,539","DOI":"10.1109\/ACCESS.2019.2914150","volume":"7","author":"Y Zhang","year":"2019","unstructured":"Zhang, Y., Liu, Z., Liu, T., Peng, B., & Li, X. (2019). RealPoint3D: An efficient generation network for 3D object reconstruction from a single image. IEEE Access, 7, 57,539\u201357,549.","journal-title":"IEEE Access"},{"issue":"6","key":"1347_CR57","first-page":"211:1","volume":"37","author":"C Zhu","year":"2018","unstructured":"Zhu, C., Xu, K., Chaudhuri, S., Yi, R., & Zhang, H. (2018). SCORES: Shape composition with recursive substructure priors. ACM Transactions on Graphics, 37(6), 211:1\u2013211:14.","journal-title":"ACM Transactions on Graphics"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-020-01347-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-020-01347-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-020-01347-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,2]],"date-time":"2022-11-02T20:21:24Z","timestamp":1667420484000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-020-01347-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,7,15]]},"references-count":57,"journal-issue":{"issue":"12","published-print":{"date-parts":[[2020,12]]}},"alternative-id":["1347"],"URL":"https:\/\/doi.org\/10.1007\/s11263-020-01347-6","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,7,15]]},"assertion":[{"value":"24 December 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 June 2020","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 July 2020","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}