{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,14]],"date-time":"2025-10-14T01:09:13Z","timestamp":1760404153586,"version":"3.37.3"},"reference-count":50,"publisher":"Springer Science and Business Media LLC","issue":"11","license":[{"start":{"date-parts":[[2018,5,29]],"date-time":"2018-05-29T00:00:00Z","timestamp":1527552000000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"name":"MSRA CCRP","award":["FY16-RES-THEME-039"],"award-info":[{"award-number":["FY16-RES-THEME-039"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2019,11]]},"DOI":"10.1007\/s00371-018-1559-x","type":"journal-article","created":{"date-parts":[[2018,5,29]],"date-time":"2018-05-29T08:09:54Z","timestamp":1527581394000},"page":"1583-1594","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":14,"title":["MSANet: multimodal self-augmentation and adversarial network for RGB-D object recognition"],"prefix":"10.1007","volume":"35","author":[{"given":"Feng","family":"Zhou","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yong","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8509-9393","authenticated-orcid":false,"given":"Xukun","family":"Shen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,5,29]]},"reference":[{"key":"1559_CR1","doi-asserted-by":"crossref","unstructured":"Bai, J., Wu, Y.: SAE-RNN deep learning for RGB-d based object recognition. In: International Conference on Intelligent Computing, Springer, pp. 235\u2013240 (2014)","DOI":"10.1007\/978-3-319-09333-8_25"},{"key":"1559_CR2","doi-asserted-by":"crossref","unstructured":"Blum, M., Springenberg, J.T., W\u00fclfing, J., Riedmiller, M.: A learned feature descriptor for object recognition in RGB-d data. In: 2012 IEEE International Conference on Robotics and Automation (ICRA), IEEE, pp. 1298\u20131303 (2012)","DOI":"10.1109\/ICRA.2012.6225188"},{"key":"1559_CR3","doi-asserted-by":"crossref","unstructured":"Bo, L., Ren, X., Fox, D.: Depth kernel descriptors for object recognition. In: 2011 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS), IEEE, pp. 821\u2013826 (2011)","DOI":"10.1109\/IROS.2011.6095119"},{"key":"1559_CR4","unstructured":"Bo, L., Ren, X., Fox, D.: Hierarchical matching pursuit for image classification: architecture and fast algorithms. In: Advances in Neural Information Processing Systems, pp. 2115\u20132123 (2011)"},{"key":"1559_CR5","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-00065-7_27","volume-title":"Unsupervised Feature Learning for RGB-D Based Object Recognition","author":"L Bo","year":"2013","unstructured":"Bo, L., Ren, X., Fox, D.: Unsupervised Feature Learning for RGB-D Based Object Recognition. Springer, Berlin (2013)"},{"key":"1559_CR6","doi-asserted-by":"crossref","unstructured":"Browatzki, B., Fischer, J., Graf, B., B\u00fclthoff, H.H., Wallraven, C.: Going into depth: Evaluating 2d and 3d cues for object classification on a new, large-scale object dataset. In: 2011 IEEE International Conference on Computer Vision Workshops (ICCV Workshops), IEEE, pp. 1189\u20131195 (2011)","DOI":"10.1109\/ICCVW.2011.6130385"},{"key":"1559_CR7","doi-asserted-by":"crossref","unstructured":"Cheng, Y., Cai, R., Zhang, C., Li, Z., Zhao, X., Huang, K., Rui, Y.: Query adaptive similarity measure for RGB-d object recognition. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 145\u2013153 (2015)","DOI":"10.1109\/ICCV.2015.25"},{"key":"1559_CR8","doi-asserted-by":"crossref","unstructured":"Cheng, Y., Cai, R., Zhao, X., Huang, K.: Convolutional fisher kernels for RGB-d object recognition. In: 2015 International Conference on 3D Vision (3DV), IEEE, pp. 135\u2013143 (2015)","DOI":"10.1109\/3DV.2015.23"},{"key":"1559_CR9","unstructured":"Cheng, Y., Zhao, X., Cai, R., Li, Z., Huang, K., Rui, Y.: Semi-supervised multimodal deep learning for RGB-d object recognition. In: International Joint Conference on Artificial Intelligence, pp. 3345\u20133351 (2016)"},{"key":"1559_CR10","doi-asserted-by":"crossref","unstructured":"Cheng, Y., Zhao, X., Huang, K., Tan, T.: Semi-supervised learning for RGB-d object recognition. In: 2014 22nd International Conference on Pattern Recognition (ICPR), IEEE, pp. 2377\u20132382 (2014)","DOI":"10.1109\/ICPR.2014.412"},{"key":"1559_CR11","doi-asserted-by":"publisher","first-page":"149","DOI":"10.1016\/j.cviu.2015.05.007","volume":"139","author":"Y Cheng","year":"2015","unstructured":"Cheng, Y., Zhao, X., Huang, K., Tan, T.: Semi-supervised learning and feature evaluation for RGB-D object recognition. Comput. Vis. Image Underst. 139, 149\u2013160 (2015)","journal-title":"Comput. Vis. Image Underst."},{"key":"1559_CR12","doi-asserted-by":"crossref","unstructured":"Ciregan, D., Meier, U., Schmidhuber, J.: Multi-column deep neural networks for image classification. In: 2012 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), IEEE, pp. 3642\u20133649 (2012)","DOI":"10.1109\/CVPR.2012.6248110"},{"key":"1559_CR13","unstructured":"Cire\u015fan, D.C., Meier, U., Masci, J., Gambardella, L.M., Schmidhuber, J.: High-performance neural networks for visual object classification. arXiv preprint arXiv:1102.0183 (2011)"},{"key":"1559_CR14","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., Fei-Fei, L.: Imagenet: A large-scale hierarchical image database. In: IEEE Conference on Computer Vision and Pattern Recognition, 2009. CVPR 2009, IEEE, pp. 248\u2013255 (2009)"},{"key":"1559_CR15","unstructured":"Denton, E.L., Chintala, S., Fergus, R., et\u00a0al.: Deep generative image models using a laplacian pyramid of adversarial networks. In: Advances in neural information processing systems, pp. 1486\u20131494 (2015)"},{"issue":"9","key":"1559_CR16","doi-asserted-by":"publisher","first-page":"1734","DOI":"10.1109\/TPAMI.2015.2496141","volume":"38","author":"A Dosovitskiy","year":"2016","unstructured":"Dosovitskiy, A., Fischer, P., Springenberg, J.T., Riedmiller, M., Brox, T.: Discriminative unsupervised feature learning with exemplar convolutional neural networks. IEEE Trans. Pattern Anal. Mach. Intell. 38(9), 1734\u20131747 (2016)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1559_CR17","doi-asserted-by":"crossref","unstructured":"Eitel, A., Springenberg, J.T., Spinello, L., Riedmiller, M., Burgard, W.: Multimodal deep learning for robust rgb-d object recognition. In: 2015 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS), IEEE, pp. 681\u2013687 (2015)","DOI":"10.1109\/IROS.2015.7353446"},{"key":"1559_CR18","unstructured":"Goodfellow, I.: Nips 2016 tutorial: Generative adversarial networks. arXiv preprint arXiv:1701.00160 (2016)"},{"key":"1559_CR19","unstructured":"Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A., Bengio, Y.: Generative adversarial nets. In: Advances in Neural Information Processing Systems, pp. 2672\u20132680 (2014)"},{"key":"1559_CR20","doi-asserted-by":"crossref","unstructured":"Gupta, S., Girshick, R., Arbel\u00e1ez, P., Malik, J.: Learning rich features from RGB-D images for object detection and segmentation. In: European Conference on Computer Vision, Springer, pp. 345\u2013360 (2014)","DOI":"10.1007\/978-3-319-10584-0_23"},{"key":"1559_CR21","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"1559_CR22","doi-asserted-by":"crossref","unstructured":"Huang, G., Liu, Z., van\u00a0der Maaten, L., Weinberger, K.Q.: Densely connected convolutional networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2017)","DOI":"10.1109\/CVPR.2017.243"},{"key":"1559_CR23","doi-asserted-by":"crossref","unstructured":"Jhuo, I.H., Gao, S., Zhuang, L., Lee, D., Ma, Y.: Unsupervised feature learning for RGB-D image classification. In: Asian Conference on Computer Vision, Springer, pp. 276\u2013289 (2014)","DOI":"10.1007\/978-3-319-16865-4_18"},{"key":"1559_CR24","doi-asserted-by":"crossref","unstructured":"Jia, Y., Shelhamer, E., Donahue, J., Karayev, S., Long, J., Girshick, R., Guadarrama, S., Darrell, T.: Caffe: Convolutional architecture for fast feature embedding. In: Proceedings of the 22nd ACM International Conference on Multimedia, ACM, pp. 675\u2013678 (2014)","DOI":"10.1145\/2647868.2654889"},{"issue":"5","key":"1559_CR25","doi-asserted-by":"publisher","first-page":"433","DOI":"10.1109\/34.765655","volume":"21","author":"AE Johnson","year":"1999","unstructured":"Johnson, A.E., Hebert, M.: Using spin images for efficient object recognition in cluttered 3d scenes. IEEE Trans. Pattern Anal. Mach. Intell. 21(5), 433\u2013449 (1999)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1559_CR26","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: International Conference on Neural Information Processing Systems, pp. 1097\u20131105 (2012)"},{"key":"1559_CR27","doi-asserted-by":"crossref","unstructured":"Lai, K., Bo, L., Ren, X., Fox, D.: A large-scale hierarchical multi-view RGB-D object dataset. In: 2011 IEEE International Conference on Robotics and Automation (ICRA), IEEE, pp. 1817\u20131824 (2011)","DOI":"10.1109\/ICRA.2011.5980382"},{"key":"1559_CR28","doi-asserted-by":"crossref","unstructured":"Lai, K., Bo, L., Ren, X., Fox, D.: Sparse distance learning for object recognition combining rgb and depth information. In: 2011 IEEE International Conference on Robotics and Automation (ICRA), IEEE, pp. 4007\u20134013 (2011)","DOI":"10.1109\/ICRA.2011.5980377"},{"issue":"11","key":"1559_CR29","doi-asserted-by":"publisher","first-page":"2278","DOI":"10.1109\/5.726791","volume":"86","author":"Y LeCun","year":"1998","unstructured":"LeCun, Y., Bottou, L., Bengio, Y., Haffner, P.: Gradient-based learning applied to document recognition. Proc. IEEE 86(11), 2278\u20132324 (1998)","journal-title":"Proc. IEEE"},{"issue":"6\u20138","key":"1559_CR30","doi-asserted-by":"publisher","first-page":"681","DOI":"10.1007\/s00371-016-1245-9","volume":"32","author":"S Lin","year":"2016","unstructured":"Lin, S., Chen, Y., Lai, Y.K., Martin, R.R., Cheng, Z.Q.: Fast capture of textured full-body avatar with RGB-D cameras. Vis. Comput. 32(6\u20138), 681\u2013691 (2016)","journal-title":"Vis. Comput."},{"key":"1559_CR31","unstructured":"Loshchilov, I., Hutter, F.: Online batch selection for faster training of neural networks. arXiv preprint arXiv:1511.06343 (2015)"},{"issue":"2","key":"1559_CR32","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","volume":"60","author":"DG Lowe","year":"2004","unstructured":"Lowe, D.G.: Distinctive image features from scale-invariant keypoints. Int. J. Comput. Vis. 60(2), 91\u2013110 (2004)","journal-title":"Int. J. Comput. Vis."},{"key":"1559_CR33","first-page":"2672","volume":"3","author":"M Mirza","year":"2014","unstructured":"Mirza, M., Osindero, S.: Conditional generative adversarial nets. Comput. Sci. 3, 2672\u20132680 (2014)","journal-title":"Comput. Sci."},{"key":"1559_CR34","unstructured":"Radford, A., Metz, L., Chintala, S.: Unsupervised representation learning with deep convolutional generative adversarial networks. arXiv preprint arXiv:1511.06434 (2015)"},{"issue":"10","key":"1559_CR35","doi-asserted-by":"publisher","first-page":"1311","DOI":"10.1007\/s00371-016-1224-1","volume":"32","author":"S Rasool","year":"2016","unstructured":"Rasool, S., Sourin, A.: Real-time haptic interaction with rgbd video streams. Vis. Comput. 32(10), 1311\u20131321 (2016)","journal-title":"Vis. Comput."},{"key":"1559_CR36","doi-asserted-by":"crossref","unstructured":"Redondo-Cabrera, C., L\u00f3pez-Sastre, R.J., Acevedo-Rodriguez, J., Maldonado-Basc\u00f3n, S.: Surfing the point clouds: Selective 3d spatial pyramids for category-level object recognition. In: 2012 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), IEEE, pp. 3458\u20133465 (2012)","DOI":"10.1109\/CVPR.2012.6248087"},{"key":"1559_CR37","unstructured":"Salimans, T., Goodfellow, I., Zaremba, W., Cheung, V., Radford, A., Chen, X.: Improved techniques for training gans. In: Advances in Neural Information Processing Systems, pp. 2234\u20132242 (2016)"},{"key":"1559_CR38","doi-asserted-by":"crossref","unstructured":"Schwarz, M., Schulz, H., Behnke, S.: Rgb-d object recognition and pose estimation based on pre-trained convolutional neural network features. In: 2015 IEEE International Conference on Robotics and Automation (ICRA), IEEE, pp. 1329\u20131335 (2015)","DOI":"10.1109\/ICRA.2015.7139363"},{"key":"1559_CR39","doi-asserted-by":"crossref","unstructured":"Shrivastava, A., Gupta, A., Girshick, R.: Training region-based object detectors with online hard example mining. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 761\u2013769 (2016)","DOI":"10.1109\/CVPR.2016.89"},{"key":"1559_CR40","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556 (2014)"},{"key":"1559_CR41","unstructured":"Socher, R., Huval, B., Bath, B., Manning, C.D., Ng, A.Y.: Convolutional-recursive deep learning for 3d object classification. In: Advances in Neural Information Processing Systems, pp. 656\u2013664 (2012)"},{"issue":"6\u20138","key":"1559_CR42","doi-asserted-by":"publisher","first-page":"855","DOI":"10.1007\/s00371-014-0965-y","volume":"30","author":"X Song","year":"2014","unstructured":"Song, X., Zhong, F., Wang, Y., Qin, X.: Estimation of kinect depth confidence through self-training. Vis. Comput. 30(6\u20138), 855\u2013865 (2014)","journal-title":"Vis. Comput."},{"key":"1559_CR43","unstructured":"Srivastava, R.K., Greff, K., Schmidhuber, J.: Training very deep networks. In: Advances in Neural Information Processing Systems, pp. 2377\u20132385 (2015)"},{"key":"1559_CR44","unstructured":"Tak\u00e1c, M., Bijral, A.S., Richt\u00e1rik, P., Srebro, N.: Mini-batch primal and dual methods for SVMS. In: ICML, vol. 3, pp. 1022\u20131030 (2013)"},{"issue":"1","key":"1559_CR45","doi-asserted-by":"publisher","first-page":"111","DOI":"10.1007\/s00371-014-1059-6","volume":"32","author":"Y Tang","year":"2016","unstructured":"Tang, Y., Tong, R., Tang, M., Zhang, Y.: Depth incorporating with color improves salient object detection. Vis. Comput. 32(1), 111\u2013121 (2016)","journal-title":"Vis. Comput."},{"key":"1559_CR46","doi-asserted-by":"crossref","unstructured":"Wang, A., Cai, J., Lu, J., Cham, T.J.: Mmss: Multi-modal sharable and specific feature learning for RGB-D object recognition. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 1125\u20131133 (2015)","DOI":"10.1109\/ICCV.2015.134"},{"key":"1559_CR47","doi-asserted-by":"crossref","unstructured":"Wang, X., Gupta, A.: Unsupervised learning of visual representations using videos. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2794\u20132802 (2015)","DOI":"10.1109\/ICCV.2015.320"},{"key":"1559_CR48","doi-asserted-by":"crossref","unstructured":"Wang, X., Shrivastava, A., Gupta, A.: A-fast-rcnn: Hard positive generation via adversary for object detection. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.324"},{"key":"1559_CR49","doi-asserted-by":"crossref","unstructured":"Wei, Y., Feng, J., Liang, X., Cheng, M.M., Zhao, Y., Yan, S.: Object region mining with adversarial erasing: a simple classification to semantic segmentation approach. In: IEEE CVPR (2017)","DOI":"10.1109\/CVPR.2017.687"},{"key":"1559_CR50","doi-asserted-by":"crossref","unstructured":"Yu, L., Zhang, W., Wang, J., Yu, Y.: Seqgan: sequence generative adversarial nets with policy gradient. In: AAAI, pp. 2852\u20132858 (2017)","DOI":"10.1609\/aaai.v31i1.10804"}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-018-1559-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s00371-018-1559-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-018-1559-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,8,24]],"date-time":"2022-08-24T13:51:40Z","timestamp":1661349100000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s00371-018-1559-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,5,29]]},"references-count":50,"journal-issue":{"issue":"11","published-print":{"date-parts":[[2019,11]]}},"alternative-id":["1559"],"URL":"https:\/\/doi.org\/10.1007\/s00371-018-1559-x","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"type":"print","value":"0178-2789"},{"type":"electronic","value":"1432-2315"}],"subject":[],"published":{"date-parts":[[2018,5,29]]},"assertion":[{"value":"29 May 2018","order":1,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}