{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T06:07:19Z","timestamp":1784268439400,"version":"3.55.0"},"publisher-location":"Cham","reference-count":54,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030012489","type":"print"},{"value":"9783030012496","type":"electronic"}],"license":[{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018]]},"DOI":"10.1007\/978-3-030-01249-6_15","type":"book-chapter","created":{"date-parts":[[2018,10,5]],"date-time":"2018-10-05T15:35:46Z","timestamp":1538753746000},"page":"238-255","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":163,"title":["Joint Task-Recursive Learning for Semantic Segmentation and Depth Estimation"],"prefix":"10.1007","author":[{"given":"Zhenyu","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhen","family":"Cui","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chunyan","family":"Xu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zequn","family":"Jie","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiang","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jian","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2018,10,6]]},"reference":[{"key":"15_CR1","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"746","DOI":"10.1007\/978-3-642-33715-4_54","volume-title":"Computer Vision \u2013 ECCV 2012","author":"N Silberman","year":"2012","unstructured":"Silberman, N., Hoiem, D., Kohli, P., Fergus, R.: Indoor segmentation and support inference from RGBD images. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012. LNCS, vol. 7576, pp. 746\u2013760. Springer, Heidelberg (2012). https:\/\/doi.org\/10.1007\/978-3-642-33715-4_54"},{"key":"15_CR2","doi-asserted-by":"crossref","unstructured":"Michels, J., Saxena, A., Ng, A.Y.: High speed obstacle avoidance using monocular vision and reinforcement learning. In: ICML, pp. 593\u2013600 (2005)","DOI":"10.1145\/1102351.1102426"},{"issue":"2","key":"15_CR3","doi-asserted-by":"publisher","first-page":"120","DOI":"10.1002\/rob.20276","volume":"26","author":"R Hadsell","year":"2009","unstructured":"Hadsell, R., et al.: Learning long-range vision for autonomous off-road driving. J. Field Robot. 26(2), 120\u2013144 (2009)","journal-title":"J. Field Robot."},{"key":"15_CR4","doi-asserted-by":"crossref","unstructured":"Tateno, K., Tombari, F., Laina, I., Navab, N.: CNN-SLAM: real-time dense monocular SLAM with learned depth prediction. In: CVPR, vol. 2, pp. 6565\u20136574 (2017)","DOI":"10.1109\/CVPR.2017.695"},{"key":"15_CR5","unstructured":"Eigen, D., Puhrsch, C., Fergus, R.: Depth map prediction from a single image using a multi-scale deep network. In: NIPS, pp. 2366\u20132374 (2014)"},{"key":"15_CR6","doi-asserted-by":"crossref","unstructured":"Xu, D., Ricci, E., Ouyang, W., Wang, X., Sebe, N.: Multi-scale continuous CRFs as sequential deep networks for monocular depth estimation. In: CVPR, vol. 1, pp. 161\u2013169 (2017)","DOI":"10.1109\/CVPR.2017.25"},{"key":"15_CR7","doi-asserted-by":"crossref","unstructured":"Laina, I., Rupprecht, C., Belagiannis, V., Tombari, F., Navab, N.: Deeper depth prediction with fully convolutional residual networks. In: 3DV, pp. 239\u2013248 (2016)","DOI":"10.1109\/3DV.2016.32"},{"issue":"8","key":"15_CR8","doi-asserted-by":"publisher","first-page":"3691","DOI":"10.1109\/TIP.2018.2821979","volume":"27","author":"Z Zhang","year":"2018","unstructured":"Zhang, Z., Xu, C., Yang, J., Gao, J., Cui, Z.: Progressive hard-mining network for monocular depth estimation. IEEE Trans. Image Process. 27(8), 3691\u20133702 (2018)","journal-title":"IEEE Trans. Image Process."},{"key":"15_CR9","doi-asserted-by":"publisher","first-page":"430","DOI":"10.1016\/j.patcog.2018.05.016","volume":"83","author":"Z Zhang","year":"2018","unstructured":"Zhang, Z., Xu, C., Yang, J., Tai, Y., Chen, L.: Deep hierarchical guidance and regularization learning for end-to-end depth estimation. Pattern Recognit. 83, 430\u2013442 (2018)","journal-title":"Pattern Recognit."},{"issue":"4","key":"15_CR10","doi-asserted-by":"publisher","first-page":"640","DOI":"10.1109\/TPAMI.2016.2572683","volume":"39","author":"J Long","year":"2017","unstructured":"Long, J., Shelhamer, E., Darrell, T.: Fully convolutional networks for semantic segmentation. IEEE Trans. Pattern Anal. Mach. Intell. 39(4), 640\u2013651 (2017)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"15_CR11","doi-asserted-by":"crossref","unstructured":"Noh, H., Hong, S., Han, B.: Learning deconvolution network for semantic segmentation. In: ICCV, pp. 1520\u20131528 (2015)","DOI":"10.1109\/ICCV.2015.178"},{"key":"15_CR12","doi-asserted-by":"crossref","unstructured":"Li, X., et al.: FoveaNet: perspective-aware urban scene parsing. In: ICCV, pp. 784\u2013792 (2017)","DOI":"10.1109\/ICCV.2017.91"},{"key":"15_CR13","doi-asserted-by":"publisher","first-page":"234","DOI":"10.1016\/j.patcog.2016.01.015","volume":"59","author":"Y Wei","year":"2016","unstructured":"Wei, Y., et al.: Learning to segment with image-level annotations. Pattern Recognit. 59, 234\u2013244 (2016)","journal-title":"Pattern Recognit."},{"key":"15_CR14","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"664","DOI":"10.1007\/978-3-319-46454-1_40","volume-title":"Computer Vision \u2013 ECCV 2016","author":"J Wang","year":"2016","unstructured":"Wang, J., Wang, Z., Tao, D., See, S., Wang, G.: Learning common and specific features for RGB-D semantic segmentation with deconvolutional networks. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9909, pp. 664\u2013679. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46454-1_40"},{"issue":"1","key":"15_CR15","doi-asserted-by":"publisher","first-page":"41","DOI":"10.1023\/A:1007379606734","volume":"28","author":"R Caruana","year":"1997","unstructured":"Caruana, R.: Multitask learning. Mach. Learn. 28(1), 41\u201375 (1997)","journal-title":"Mach. Learn."},{"key":"15_CR16","doi-asserted-by":"crossref","unstructured":"Girshick, R.: Fast R-CNN. In: ICCV, pp. 1440\u20131448 (2015)","DOI":"10.1109\/ICCV.2015.169"},{"key":"15_CR17","doi-asserted-by":"crossref","unstructured":"He, K., Gkioxari, G., Dollr, P., Girshick, R.: Mask R-CNN. In: IEEE International Conference on Computer Vision (2017)","DOI":"10.1109\/ICCV.2017.322"},{"key":"15_CR18","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"143","DOI":"10.1007\/978-3-319-46484-8_9","volume-title":"Computer Vision \u2013 ECCV 2016","author":"S Kim","year":"2016","unstructured":"Kim, S., Park, K., Sohn, K., Lin, S.: Unified depth prediction and intrinsic image decomposition from a single image via joint convolutional neural fields. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9912, pp. 143\u2013159. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46484-8_9"},{"key":"15_CR19","doi-asserted-by":"crossref","unstructured":"Misra, I., Shrivastava, A., Gupta, A., Hebert, M.: Cross-stitch networks for multi-task learning. In: CVPR, pp. 3994\u20134003 (2016)","DOI":"10.1109\/CVPR.2016.433"},{"key":"15_CR20","unstructured":"Shi, J., Pollefeys, M.: Pulling things out of perspective. In: CVPR, pp. 89\u201396 (2014)"},{"key":"15_CR21","unstructured":"Wang, P., Shen, X., Lin, Z., Cohen, S.: Towards unified depth and semantic prediction from a single image. In: CVPR, pp. 2800\u20132809 (2015)"},{"key":"15_CR22","unstructured":"Kendall, A., Gal, Y., Cipolla, R.: Multi-task learning using uncertainty to weigh losses for scene geometry and semantics. arXiv:1705.07115 (2017)"},{"issue":"2","key":"15_CR23","doi-asserted-by":"publisher","first-page":"363","DOI":"10.1037\/a0018106","volume":"36","author":"JP Borst","year":"2010","unstructured":"Borst, J.P., Taatgen, N.A., Van Rijn, H.: The problem state: a cognitive bottleneck in multitasking. J. Exp. Psychol. Learn. Mem. Cogn. 36(2), 363 (2010)","journal-title":"J. Exp. Psychol. Learn. Mem. Cogn."},{"key":"15_CR24","doi-asserted-by":"crossref","unstructured":"Eigen, D., Fergus, R.: Predicting depth, surface normals and semantic labels with a common multi-scale convolutional architecture. In: ICCV, pp. 2650\u20132658 (2015)","DOI":"10.1109\/ICCV.2015.304"},{"issue":"10","key":"15_CR25","doi-asserted-by":"publisher","first-page":"2024","DOI":"10.1109\/TPAMI.2015.2505283","volume":"38","author":"F Liu","year":"2016","unstructured":"Liu, F., Shen, C., Lin, G., Reid, I.: Learning depth from single monocular images using deep convolutional neural fields. IEEE Trans. Pattern Anal. Mach. Intell. 38(10), 2024\u20132039 (2016)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"15_CR26","unstructured":"Li, B., Shen, C., Dai, Y., van den Hengel, A., He, M.: Depth and surface normal estimation from monocular images using regression on deep features and hierarchical CRFs. In: CVPR, pp. 1119\u20131127 (2015)"},{"key":"15_CR27","unstructured":"Kendall, A., Badrinarayanan, V., Cipolla, R.: Bayesian SegNet: model uncertainty in deep convolutional encoder-decoder architectures for scene understanding. arXiv preprint arXiv:1511.02680 (2015)"},{"key":"15_CR28","doi-asserted-by":"crossref","unstructured":"Wei, Y., Xiao, H., Shi, H., Jie, Z., Feng, J., Huang, T.S.: Revisiting dilated convolution: a simple approach for weakly-and semi-supervised semantic segmentation. In: CVPR, pp. 7268\u20137277 (2018)","DOI":"10.1109\/CVPR.2018.00759"},{"key":"15_CR29","doi-asserted-by":"crossref","unstructured":"Jin, X., Chen, Y., Jie, Z., Feng, J., Yan, S.: Multi-path feedback recurrent neural networks for scene parsing. In: AAAI, vol. 3, p. 8 (2017)","DOI":"10.1609\/aaai.v31i1.11199"},{"key":"15_CR30","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"345","DOI":"10.1007\/978-3-319-10584-0_23","volume-title":"Computer Vision \u2013 ECCV 2014","author":"S Gupta","year":"2014","unstructured":"Gupta, S., Girshick, R., Arbel\u00e1ez, P., Malik, J.: Learning rich features from RGB-D images for object detection and segmentation. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8695, pp. 345\u2013360. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10584-0_23"},{"key":"15_CR31","doi-asserted-by":"crossref","unstructured":"He, Y., Chiu, W.C., Keuper, M., Fritz, M.: STD2P: RGBD semantic segmentation using spatio-temporal data-driven pooling. arXiv preprint arXiv:1604.02388 (2016)","DOI":"10.1109\/CVPR.2017.757"},{"key":"15_CR32","doi-asserted-by":"crossref","unstructured":"Cheng, Y., Cai, R., Li, Z., Zhao, X., Huang, K.: Locality-sensitive deconvolution networks with gated fusion for RGB-D indoor semantic segmentation. In: CVPR, vol. 3, pp. 1475\u20131483 (2017)","DOI":"10.1109\/CVPR.2017.161"},{"key":"15_CR33","doi-asserted-by":"crossref","unstructured":"Amit, Y., Fink, M., Srebro, N., Ullman, S.: Uncovering shared structures in multiclass classification. In: Proceedings of the Twenty-Fourth International Conference on Machine Learning, pp. 17\u201324 (2007)","DOI":"10.1145\/1273496.1273499"},{"key":"15_CR34","doi-asserted-by":"crossref","unstructured":"Evgeniou, T., Pontil, M.: Regularized multi-task learning. In: Tenth ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, pp. 109\u2013117 (2004)","DOI":"10.1145\/1014052.1014067"},{"key":"15_CR35","unstructured":"Jalali, A., Ravikumar, P.D., Sanghavi, S., Chao, R.: A dirty model for multi-task learning. In: NIPS, pp. 964\u2013972 (2010)"},{"key":"15_CR36","doi-asserted-by":"crossref","unstructured":"Razavian, A.S., Azizpour, H., Sullivan, J., Carlsson, S.: CNN features off-the-shelf: an astounding baseline for recognition. In: CVPR Workshops, pp. 512\u2013519 (2014)","DOI":"10.1109\/CVPRW.2014.131"},{"key":"15_CR37","unstructured":"Yosinski, J., Clune, J., Bengio, Y., Lipson, H.: How transferable are features in deep neural networks? In: NIPS, pp. 3320\u20133328 (2014)"},{"key":"15_CR38","doi-asserted-by":"crossref","unstructured":"Wang, X., Fouhey, D.F., Gupta, A.: Designing deep networks for surface normal estimation. In: CVPR, pp. 539\u2013547 (2014)","DOI":"10.1109\/CVPR.2015.7298652"},{"key":"15_CR39","doi-asserted-by":"crossref","unstructured":"Gebru, T., Hoffman, J., Li, F.F.: Fine-grained recognition in the wild: a multi-task domain adaptation approach. arXiv:1709.02476 (2017)","DOI":"10.1109\/ICCV.2017.151"},{"key":"15_CR40","doi-asserted-by":"crossref","unstructured":"Kokkinos, I.: UberNet: training a \u2018universal\u2019 convolutional neural network for low-, mid-, and high-level vision using diverse datasets and limited memory. In: CVPR, pp. 5454\u20135463 (2017)","DOI":"10.1109\/CVPR.2017.579"},{"key":"15_CR41","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"15_CR42","doi-asserted-by":"crossref","unstructured":"Wang, F., et al.: Residual attention network for image classification. In: CVPR, pp. 6450\u20136458 (2017)","DOI":"10.1109\/CVPR.2017.683"},{"key":"15_CR43","doi-asserted-by":"crossref","unstructured":"Shi, W., et al.: Real-time single image and video super-resolution using an efficient sub-pixel convolutional neural network. In: CVPR, pp. 1874\u20131883 (2016)","DOI":"10.1109\/CVPR.2016.207"},{"key":"15_CR44","doi-asserted-by":"crossref","unstructured":"Song, S., Lichtenberg, S.P., Xiao, J.: Sun RGB-D: a RGB-D scene understanding benchmark suite. In: CVPR, pp. 567\u2013576 (2015)","DOI":"10.1109\/CVPR.2015.7298655"},{"key":"15_CR45","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., Fei-Fei, L.: ImageNet: a large-scale hierarchical image database. In: CVPR, pp. 248\u2013255 (2009)","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"15_CR46","doi-asserted-by":"crossref","unstructured":"Lin, G., Milan, A., Shen, C., Reid, I.: RefineNet: multi-path refinement networks for high-resolution semantic segmentation. In: CVPR, vol. 1, pp. 5168\u20135177 (2017)","DOI":"10.1109\/CVPR.2017.549"},{"key":"15_CR47","doi-asserted-by":"crossref","unstructured":"Roy, A., Todorovic, S.: Monocular depth estimation using neural regression forest. In: CVPR, pp. 5506\u20135514 (2016)","DOI":"10.1109\/CVPR.2016.594"},{"key":"15_CR48","doi-asserted-by":"crossref","unstructured":"Cao, Y., Wu, Z., Shen, C.: Estimating depth from monocular images as classification using deep fully convolutional residual networks. In: IEEE Transactions on Circuits and Systems for Video Technology (2017)","DOI":"10.1109\/TCSVT.2017.2740321"},{"key":"15_CR49","doi-asserted-by":"crossref","unstructured":"Lin, G., Shen, C., van den Hengel, A., Reid, I.: Efficient piecewise training of deep structured models for semantic segmentation. In: CVPR, pp. 3194\u20133203 (2016)","DOI":"10.1109\/CVPR.2016.348"},{"key":"15_CR50","doi-asserted-by":"crossref","unstructured":"Deng, Z., Todorovic, S., Latecki, L.J.: Semantic segmentation of RGBD images with mutex constraints. In: ICCV, pp. 1733\u20131741 (2015)","DOI":"10.1109\/ICCV.2015.202"},{"key":"15_CR51","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"541","DOI":"10.1007\/978-3-319-46475-6_34","volume-title":"Computer Vision \u2013 ECCV 2016","author":"Z Li","year":"2016","unstructured":"Li, Z., Gan, Y., Liang, X., Yu, Y., Cheng, H., Lin, L.: LSTM-CF: unifying context modeling and fusion with LSTMs for RGB-D scene labeling. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9906, pp. 541\u2013557. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46475-6_34"},{"key":"15_CR52","unstructured":"Xiaojuan, Q., Renjie, L., Jiaya, J., Sanya, F., Raquel, U.: 3D graph neural networks for RGBD semantic segmentation. In: ICCV, pp. 5209\u20135218 (2017)"},{"key":"15_CR53","unstructured":"Seong-Jin, P., Ki-Sang, H., Seungyong, L.: RDFNet: RGB-D multi-level residual feature fusion for indoor semantic segmentation. In: ICCV, pp. 4990\u20134999 (2017)"},{"key":"15_CR54","unstructured":"Di, L., Guangyong, C., Daniel, C.O., Pheng-Ann, H., Hui, H.: Cascaded feature network for semantic segmentation of RGB-D images. In: ICCV, pp. 1320\u20131328 (2017)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2018"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-01249-6_15","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,10,5]],"date-time":"2022-10-05T00:52:58Z","timestamp":1664931178000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-030-01249-6_15"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018]]},"ISBN":["9783030012489","9783030012496"],"references-count":54,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-01249-6_15","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018]]},"assertion":[{"value":"6 October 2018","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Munich","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Germany","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2018","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 September 2018","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14 September 2018","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"15","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2018","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2018.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}]}}