{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,20]],"date-time":"2025-10-20T10:21:45Z","timestamp":1760955705618,"version":"3.41.0"},"publisher-location":"Cham","reference-count":48,"publisher":"Springer International Publishing","isbn-type":[{"type":"print","value":"9783319544069"},{"type":"electronic","value":"9783319544076"}],"license":[{"start":{"date-parts":[[2017,1,1]],"date-time":"2017-01-01T00:00:00Z","timestamp":1483228800000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2017]]},"DOI":"10.1007\/978-3-319-54407-6_33","type":"book-chapter","created":{"date-parts":[[2017,3,14]],"date-time":"2017-03-14T02:04:07Z","timestamp":1489457047000},"page":"493-509","source":"Crossref","is-referenced-by-count":22,"title":["STFCN: Spatio-Temporal Fully Convolutional Neural Network for Semantic Segmentation of Street Scenes"],"prefix":"10.1007","author":[{"given":"Mohsen","family":"Fayyaz","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mohammad Hajizadeh","family":"Saffar","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mohammad","family":"Sabokrou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mahmood","family":"Fathy","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fay","family":"Huang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Reinhard","family":"Klette","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,3,15]]},"reference":[{"key":"33_CR1","unstructured":"Badrinarayanan, V., Kendall, A., Cipolla, R.: SegNet: a deep convolutional encoder-decoder architecture for image segmentation. arXiv preprint arXiv:1511.00561 (2015)"},{"key":"33_CR2","unstructured":"Bittel, S., Kaiser, V., Teichmann, M., Thoma, M.: Pixel-wise segmentation of street with neural networks. arXiv preprint arXiv:1511.00513 (2015)"},{"key":"33_CR3","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"44","DOI":"10.1007\/978-3-540-88682-2_5","volume-title":"Computer Vision \u2013 ECCV 2008","author":"GJ Brostow","year":"2008","unstructured":"Brostow, G.J., Shotton, J., Fauqueur, J., Cipolla, R.: Segmentation and recognition using structure from motion point clouds. In: Forsyth, D., Torr, P., Zisserman, A. (eds.) ECCV 2008. LNCS, vol. 5302, pp. 44\u201357. Springer, Heidelberg (2008). doi: 10.1007\/978-3-540-88682-2_5"},{"key":"33_CR4","doi-asserted-by":"crossref","unstructured":"Carreira, J., Sminchisescu, C.: Constrained parametric min-cuts for automatic object segmentation. In: CVPR, pp. 3241\u20133248 (2010)","DOI":"10.1109\/CVPR.2010.5540063"},{"key":"33_CR5","doi-asserted-by":"crossref","unstructured":"Chang, F.J., Lin, Y.Y., Hsu, K.J.: Multiple structured-instance learning for semantic segmentation with uncertain training data. In: CVPR, pp. 360\u2013367 (2014)","DOI":"10.1109\/CVPR.2014.53"},{"key":"33_CR6","doi-asserted-by":"crossref","unstructured":"Chen, A.Y., Corso, J.J.: Propagating multi-class pixel labels throughout video frames. In: Image Processing Workshop (WNYIPW), pp. 14\u201317 (2010)","DOI":"10.1109\/WNYIPW.2010.5649773"},{"key":"33_CR7","doi-asserted-by":"crossref","unstructured":"Chen, L.C., Yang, Y., Wang, J., Xu, W., Yuille, A.L.: Attention to scale: Scale-aware semantic image segmentation. arXiv preprint arXiv:1511.03339 (2015)","DOI":"10.1109\/CVPR.2016.396"},{"key":"33_CR8","doi-asserted-by":"crossref","unstructured":"Donahue, J., Anne Hendricks, L., Guadarrama, S., Rohrbach, M., Venugopalan, S., Saenko, K., Darrell, T.: Long-term recurrent convolutional networks for visual recognition and description. In: CVPR, pp. 2625\u20132634 (2015)","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"33_CR9","unstructured":"Everingham, M., Van Gool, L., Williams, C.K.I., Winn, J., Zisserman, A.: The PASCAL visual object classes challenge 2011 (2011). www.pascal-network.org\/challenges\/VOC\/voc2011\/workshop\/index.html"},{"key":"33_CR10","doi-asserted-by":"crossref","unstructured":"Fischer, P., Dosovitskiy, A., Ilg, E., H\u00e4usser, P., Hazirbas, C., Golkov, V., van der Smagt, P., Cremers, D., Brox, T.: Flownet: Learning optical flow with convolutional networks. arXiv preprint arXiv:1504.06852 (2015)","DOI":"10.1109\/ICCV.2015.316"},{"key":"33_CR11","doi-asserted-by":"crossref","unstructured":"Galasso, F., Keuper, M., Brox, T., Schiele, B.: Spectral graph reduction for efficient image and streaming video segmentation. In: CVPR, pp. 49\u201356 (2014)","DOI":"10.1109\/CVPR.2014.14"},{"key":"33_CR12","doi-asserted-by":"crossref","unstructured":"Gers, F.A., Schmidhuber, J., Cummins, F.: Learning to forget: continual prediction with LSTM. In: Neural computation, pp. 2451\u20132471 (2000)","DOI":"10.1162\/089976600300015015"},{"key":"33_CR13","doi-asserted-by":"crossref","unstructured":"Girshick, R., Donahue, J., Darrell, T., Malik, J.: Rich feature hierarchies for accurate object detection and semantic segmentation. In: CVPR, pp. 580\u2013587 (2014)","DOI":"10.1109\/CVPR.2014.81"},{"key":"33_CR14","doi-asserted-by":"crossref","unstructured":"Gupta, S., Arbelaez, P., Malik, J.: Perceptual organization and recognition of indoor scenes from RGB-D images. In: CVPR, pp. 564\u2013571 (2013)","DOI":"10.1109\/CVPR.2013.79"},{"key":"33_CR15","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"345","DOI":"10.1007\/978-3-319-10584-0_23","volume-title":"Computer Vision \u2013 ECCV 2014","author":"S Gupta","year":"2014","unstructured":"Gupta, S., Girshick, R., Arbel\u00e1ez, P., Malik, J.: Learning rich features from RGB-D images for object detection and segmentation. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8695, pp. 345\u2013360. Springer, Cham (2014). doi: 10.1007\/978-3-319-10584-0_23"},{"key":"33_CR16","doi-asserted-by":"crossref","unstructured":"He, Y., Chiu, W.C., Keuper, M., Fritz, M.: RGBD semantic segmentation using spatio-temporal data-driven pooling. arXiv preprint arXiv:1604.02388 (2016)","DOI":"10.1109\/CVPR.2017.757"},{"key":"33_CR17","doi-asserted-by":"crossref","unstructured":"Hickson, S., Birchfield, S., Essa, I., Christensen, H.: Efficient hierarchical graph-based segmentation of RGBD videos. In: CVPR, pp. 344\u2013351 (2014)","DOI":"10.1109\/CVPR.2014.51"},{"key":"33_CR18","doi-asserted-by":"crossref","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"12","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 12, 1735\u20131780 (1997)","journal-title":"Neural Comput."},{"key":"33_CR19","unstructured":"Hong, S., Noh, H., Han, B.: Decoupled deep neural network for semi-supervised semantic segmentation. In: NIPS, pp. 1495\u20131503 (2015)"},{"key":"33_CR20","doi-asserted-by":"crossref","unstructured":"Jia, Y., Shelhamer, E., Donahue, J., Karayev, S., Long, J., Girshick, R., Guadarrama, S., Darrell, T.: Caffe: convolutional architecture for fast feature embedding. In: Proceedings of the ACM International Conference Multimedia, pp. 675\u2013678 (2014)","DOI":"10.1145\/2647868.2654889"},{"key":"33_CR21","doi-asserted-by":"crossref","unstructured":"Khoreva, A., Galasso, F., Hein, M., Schiele, B.: Classifier based graph construction for video segmentation. In: CVPR, pp. 951\u2013960 (2015)","DOI":"10.1109\/CVPR.2015.7298697"},{"key":"33_CR22","volume-title":"Digital Geometry","author":"R Klette","year":"2004","unstructured":"Klette, R., Rosenfeld, A.: Digital Geometry. Morgan Kaufmann, San Francisco (2004)"},{"key":"33_CR23","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: ImageNet classification with deep convolutional neural networks. In: Advances Neural Information Processing Systems, pp. 1097\u20131105 (2012)"},{"key":"33_CR24","doi-asserted-by":"crossref","unstructured":"Kundu, A., Vineet, V., Koltun, V.: Feature space optimization for semantic video segmentation. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.345"},{"key":"33_CR25","unstructured":"Russell, C., Kohli, P., Torr, P.H.: Associative hierarchical CRFs for object class image segmentation. In: ICCV, pp. 739\u2013746 (2009)"},{"key":"33_CR26","doi-asserted-by":"crossref","unstructured":"Liu, B., He, X.: Multiclass semantic video segmentation with object-level active inference. In: CVPR, pp. 4286\u20134294 (2015)","DOI":"10.1109\/CVPR.2015.7299057"},{"key":"33_CR27","doi-asserted-by":"crossref","unstructured":"Liu, X., Tao, D., Song, M., Ruan, Y., Chen, C., Bu, J.: Weakly supervised multiclass video segmentation. In: CVPR, pp. 57\u201364 (2014)","DOI":"10.1109\/CVPR.2014.15"},{"key":"33_CR28","doi-asserted-by":"crossref","unstructured":"Liu, Y., Liu, J., Li, Z., Tang, J., Lu, H.: Weakly-supervised dual clustering for image semantic segmentation. In: CVPR, pp. 2075\u20132082 (2013)","DOI":"10.1109\/CVPR.2013.270"},{"key":"33_CR29","doi-asserted-by":"crossref","unstructured":"Long, J., Shelhamer, E., Darrell, T.: Fully convolutional networks for semantic segmentation. In: CVPR, pp. 3431\u20133440 (2015)","DOI":"10.1109\/CVPR.2015.7298965"},{"key":"33_CR30","doi-asserted-by":"crossref","unstructured":"Martinovic, A., Knopp, J., Riemenschneider, H., Van Gool, L.: 3D all the way: semantic segmentation of urban scenes from start to end in 3D. In: CVPR, pp. 4456\u20134465 (2015)","DOI":"10.1109\/CVPR.2015.7299075"},{"key":"33_CR31","unstructured":"Matan, O., Burges, C.J., LeCun, Y., Denker, J.S.: Multi-digit recognition using a space displacement neural network. In: NIPS, pp. 488\u2013495 (1991)"},{"key":"33_CR32","doi-asserted-by":"crossref","unstructured":"Mottaghi, R., Fidler, S., Yao, J., Urtasun, R., Parikh, D.: Analyzing semantic segmentation using hybrid human-machine CRFs. In: CVPR, pp. 3143\u20133150 (2013)","DOI":"10.1109\/CVPR.2013.404"},{"key":"33_CR33","unstructured":"Richmond, D.L., Kainmueller, D., Yang, M.Y., Myers, E.W., Rother, C.: Relating cascaded random forests to deep convolutional neural networks for semantic segmentation. arXiv preprint arXiv:1507.07583 (2015)"},{"key":"33_CR34","doi-asserted-by":"crossref","unstructured":"Sabokrou, M., Fathy, M., Hoseini, M., Klette, R.: Real-time anomaly detection and localization in crowded scenes. In: CVPR, Workshops, pp. 56\u201362 (2015)","DOI":"10.1109\/CVPRW.2015.7301284"},{"key":"33_CR35","doi-asserted-by":"crossref","first-page":"1122","DOI":"10.1049\/el.2016.0440","volume":"52","author":"M Sabokrou","year":"2016","unstructured":"Sabokrou, M., Fathy, M., Hoseini, M.: Video anomaly detection and localisation based on the sparsity and reconstruction error of auto-encoder. Electron. Lett. 52, 1122\u20131124 (2016)","journal-title":"Electron. Lett."},{"key":"33_CR36","doi-asserted-by":"crossref","unstructured":"Sharma, A., Tuzel, O., Jacobs, D.W.: Deep hierarchical parsing for semantic segmentation. In: CVPR, pp. 530\u2013538 (2015)","DOI":"10.1109\/CVPR.2015.7298651"},{"key":"33_CR37","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"746","DOI":"10.1007\/978-3-642-33715-4_54","volume-title":"Computer Vision \u2013 ECCV 2012","author":"N Silberman","year":"2012","unstructured":"Silberman, N., Hoiem, D., Kohli, P., Fergus, R.: Indoor segmentation and support inference from RGBD images. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012. LNCS, vol. 7576, pp. 746\u2013760. Springer, Heidelberg (2012). doi: 10.1007\/978-3-642-33715-4_54"},{"key":"33_CR38","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. In: Advances Neural Information Processing Systems, pp. 68\u2013576 (2014)"},{"key":"33_CR39","unstructured":"Sturgess, P., Alahari, K., Ladicky, L., Torr, P.H.: Combining appearance and structure from motion features for road scene understanding. In: BMVC (2012)"},{"key":"33_CR40","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"352","DOI":"10.1007\/978-3-642-15555-0_26","volume-title":"Computer Vision \u2013 ECCV 2010","author":"J Tighe","year":"2010","unstructured":"Tighe, J., Lazebnik, S.: SuperParsing: scalable nonparametric image parsing with superpixels. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010. LNCS, vol. 6315, pp. 352\u2013365. Springer, Heidelberg (2010). doi: 10.1007\/978-3-642-15555-0_26"},{"key":"33_CR41","doi-asserted-by":"crossref","unstructured":"Volpi, M., Ferrari, V.: Semantic segmentation of urban scenes by learning local class interactions. In: CVPR, pp. 1\u20139 (2015)","DOI":"10.1109\/CVPRW.2015.7301377"},{"key":"33_CR42","unstructured":"Wolf, R., Platt, J.C.: Postal address block location using a convolutional locator network. In: NIPS, pp. 745\u2013745 (1994)"},{"key":"33_CR43","doi-asserted-by":"crossref","first-page":"1731","DOI":"10.1109\/TPAMI.2011.208","volume":"34","author":"Y Yang","year":"2012","unstructured":"Yang, Y., Hallman, S., Ramanan, D., Fowlkes, C.C.: Layered object models for image segmentation. IEEE Trans. PAMI 34, 1731\u20131743 (2012)","journal-title":"IEEE Trans. PAMI"},{"key":"33_CR44","doi-asserted-by":"crossref","first-page":"1924","DOI":"10.1109\/JSTARS.2014.2361756","volume":"8","author":"C Zheng","year":"2015","unstructured":"Zheng, C., Wang, L.: Semantic segmentation of remote sensing imagery using object-based Markov random field model with regional penalties. IEEE J. Sel. Top. Appl. Earth Observations Remote Sens. 8, 1924\u20131935 (2015)","journal-title":"IEEE J. Sel. Top. Appl. Earth Observations Remote Sens."},{"key":"33_CR45","doi-asserted-by":"crossref","unstructured":"Zhang, L., Song, M., Liu, Z., Liu, X., Bu, J., Chen, C.: Probabilistic graphlet cut: exploiting spatial structure cue for weakly supervised image segmentation. In: CVPR, pp. 1908\u20131915 (2013)","DOI":"10.1109\/CVPR.2013.249"},{"key":"33_CR46","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Chen, X., Li, J., Wang, C., Xia, C.: Semantic object segmentation via detection in weakly labeled video. In: CVPR, pp. 3641\u20133649 (2015)","DOI":"10.1109\/CVPR.2015.7298987"},{"key":"33_CR47","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Urtasun, R., Salakhutdinov, R., Fidler, S.: Segdeepm: exploiting segmentation and context in deep neural networks for object detection. In: CVPR, pp. 4703\u20134711 (2015)","DOI":"10.1109\/CVPR.2015.7299102"},{"key":"33_CR48","unstructured":"Yu, F., Koltun, V.: Multi-scale context aggregation by dilated convolutions. In: ICLR (2016)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ACCV 2016 Workshops"],"original-title":[],"link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-54407-6_33","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,16]],"date-time":"2025-06-16T19:48:10Z","timestamp":1750103290000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-54407-6_33"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017]]},"ISBN":["9783319544069","9783319544076"],"references-count":48,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-54407-6_33","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2017]]}}}