{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T14:10:01Z","timestamp":1785852601318,"version":"3.56.0"},"reference-count":75,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2015,6]]},"DOI":"10.1109\/cvpr.2015.7298655","type":"proceedings-article","created":{"date-parts":[[2015,10,15]],"date-time":"2015-10-15T18:42:06Z","timestamp":1444934526000},"page":"567-576","source":"Crossref","is-referenced-by-count":1509,"title":["SUN RGB-D: A RGB-D scene understanding benchmark suite"],"prefix":"10.1109","author":[{"given":"Shuran","family":"Song","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Samuel P.","family":"Lichtenberg","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jianxiong","family":"Xiao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.349"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.458"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.3389\/fpsyg.2013.00506"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5539970"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.161"},{"key":"ref39","article-title":"Nonparametric scene parsing: Label transfer via dense scene alignment","author":"liu","year":"2009","journal-title":"CVPR"},{"key":"ref75","article-title":"Learning deep features for scene recognition using places database","author":"zhou","year":"2014","journal-title":"NIPS"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.179"},{"key":"ref33","article-title":"Fall detection using ceiling-mounted 3d depth camera","author":"kepski","year":"0"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.282"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10578-9_38"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.8"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2011.5980382"},{"key":"ref36","article-title":"Imagenet classification with deep convolutional neural networks","author":"krizhevsky","year":"2012","journal-title":"NIPS"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1177\/0278364913478446"},{"key":"ref34","article-title":"Semantic labeling of 3d point clouds for indoor scenes","author":"koppula","year":"2011","journal-title":"NIPS"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2011.6130298"},{"key":"ref62","article-title":"Sliding Shapes for 3D object detection in RGB-D images","author":"song","year":"2014","journal-title":"ECCV"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2014.6906903"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2011.6095074"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2011.6130382"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1145\/2493432.2493482"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/2047196.2047270"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1145\/2506023.2506031"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6385773"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4471-4640-7_8"},{"key":"ref67","article-title":"Human activity detection from rgbd images","author":"sung","year":"2011","journal-title":"Plan Activity and Intent Recognition"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2011.5995347"},{"key":"ref69","article-title":"3D ShapeNets: A deep representation for volumetric shape modeling","author":"wu","year":"2015","journal-title":"CVPR"},{"key":"ref2","article-title":"Contextually guided semantic labeling and search for three-dimensional point clouds","author":"anand","year":"2012","journal-title":"IIRR"},{"key":"ref1","article-title":"A global hypotheses verification method for 3d object recognition","author":"aldorna","year":"2012","journal-title":"ECCV"},{"key":"ref20","article-title":"Learning rich features from RGB-D images for object detection and segmentation","author":"gupta","year":"2014","journal-title":"ECCV"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2009.5459411"},{"key":"ref21","article-title":"A benchmark for RGB-D visval odometry, 3D reconstruction and SLAM","author":"handa","year":"2014","journal-title":"ICRA"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6248005"},{"key":"ref23","article-title":"Thinking inside the box: Using appearance models and context based on room geometry","author":"hedau","year":"2010","journal-title":"ECCV"},{"key":"ref26","doi-asserted-by":"crossref","DOI":"10.1109\/TPAMI.2013.248","article-title":"Hu-man3.6m: Large scale datasets and predictive methods for 3d human sensing in natural environments","author":"ionescu","year":"2014","journal-title":"PAMI"},{"key":"ref25","article-title":"Model based training, detection and pose estimation of texture-less 3d objects in heavily cluttered scenes","author":"hintcrstoisser","year":"2013","journal-title":"ACCV"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2011.6130379"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1023\/A:1011139631724"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.219"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1145\/2398356.2398381"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.377"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2012.241"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-007-0090-8"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6385661"},{"key":"ref53","article-title":"Rgb-(d) scene labeling: Features and algorithms","author":"ren","year":"2012","journal-title":"CVPR"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2011.6094861"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-012-0549-0"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2009.167"},{"key":"ref40","article-title":"Sift flow: Dense correspondence across scenes and its applications","author":"liu","year":"2011","journal-title":"PAMI"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/2207676.2208303"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.421"},{"key":"ref14","article-title":"Unfolding an indoor origami world","author":"fouhey","year":"2014","journal-title":"ECCV"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.81"},{"key":"ref16","article-title":"Distinctive texture features from perspective-invariant keypoints","author":"gossow","year":"2012","journal-title":"ICPR"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.266"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.266"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.79"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.10"},{"key":"ref3","article-title":"Re-identification with rgb-d sensors","author":"barbosa","year":"2012","journal-title":"First International Workshop on Re-Identification"},{"key":"ref6","article-title":"Latent structured models for human pose estimation","author":"catalin ionescu","year":"2011","journal-title":"ICCV"},{"key":"ref5","author":"bouguet","year":"2004","journal-title":"Camera Calibration Toolbox for MATLAB"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/BTAS.2013.6712688"},{"key":"ref7","article-title":"Imagenet: A large-scale hierarchical image database","author":"deng","year":"2009","journal-title":"CVPR"},{"key":"ref49","article-title":"Indoor segmentation and support inference from rgbd images","author":"nathan silberman","year":"2012","journal-title":"ECCV"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-009-0275-4"},{"key":"ref46","article-title":"When can we use kinectfusion for ground truth acquisition","author":"meister","year":"2012","journal-title":"Proc Workshop on Color-Depth Camera Fusion in Robotics"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1111\/cgf.12286"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.2014.2331215"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-009-0296-z"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2011.6095075"},{"key":"ref41","article-title":"Learning discriminative representations from rgb-d video data","author":"liu","year":"2013","journal-title":"IJCAI"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386219"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2011.6126229"}],"event":{"name":"2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","location":"Boston, MA, USA","start":{"date-parts":[[2015,6,7]]},"end":{"date-parts":[[2015,6,12]]}},"container-title":["2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7293313\/7298593\/07298655.pdf?arnumber=7298655","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,8,31]],"date-time":"2019-08-31T12:15:49Z","timestamp":1567253749000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7298655\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015,6]]},"references-count":75,"URL":"https:\/\/doi.org\/10.1109\/cvpr.2015.7298655","relation":{},"subject":[],"published":{"date-parts":[[2015,6]]}}}