{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,22]],"date-time":"2026-07-22T16:06:41Z","timestamp":1784736401424,"version":"3.55.0"},"publisher-location":"Cham","reference-count":43,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783319464862","type":"print"},{"value":"9783319464879","type":"electronic"}],"license":[{"start":{"date-parts":[[2016,1,1]],"date-time":"2016-01-01T00:00:00Z","timestamp":1451606400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2016,1,1]],"date-time":"2016-01-01T00:00:00Z","timestamp":1451606400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2016]]},"DOI":"10.1007\/978-3-319-46487-9_3","type":"book-chapter","created":{"date-parts":[[2016,9,16]],"date-time":"2016-09-16T14:50:47Z","timestamp":1474037447000},"page":"36-52","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":147,"title":["Segmental Spatiotemporal CNNs for Fine-Grained Action Segmentation"],"prefix":"10.1007","author":[{"given":"Colin","family":"Lea","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Austin","family":"Reiter","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ren\u00e9","family":"Vidal","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gregory D.","family":"Hager","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2016,9,17]]},"reference":[{"key":"3_CR1","doi-asserted-by":"crossref","unstructured":"Wang, H., Schmid, C.: Action recognition with improved trajectories. In: IEEE International Conference on Computer Vision (ICCV) (2013)","DOI":"10.1109\/ICCV.2013.441"},{"key":"3_CR2","doi-asserted-by":"crossref","unstructured":"Sun, L., Jia, K., Yeung, D.Y., Shi, B.: Human action recognition using factorized spatio-temporal convolutional networks. In: IEEE International Conference on Computer Vision (ICCV) (2015)","DOI":"10.1109\/ICCV.2015.522"},{"key":"3_CR3","doi-asserted-by":"crossref","unstructured":"Caba Heilbron, F., Escorcia, V., Ghanem, B., Carlos Niebles, J.: ActivityNet: a large-scale video benchmark for human activity understanding. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015)","DOI":"10.1109\/CVPR.2015.7298698"},{"key":"3_CR4","doi-asserted-by":"publisher","first-page":"346","DOI":"10.1007\/s11263-015-0851-8","volume":"119","author":"M Rohrbach","year":"2015","unstructured":"Rohrbach, M., Rohrbach, A., Regneri, M., Amin, S., Andriluka, M., Pinkal, M., Schiele, B.: Recognizing fine-grained and composite activities using hand-centric features and script data. Int. J. Comput. Vis. (IJCV) 119, 346\u2013373 (2015)","journal-title":"Int. J. Comput. Vis. (IJCV)"},{"key":"3_CR5","doi-asserted-by":"crossref","unstructured":"Fathi, A., Rehg, J.M.: Modeling actions through state changes. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2013)","DOI":"10.1109\/CVPR.2013.333"},{"key":"3_CR6","doi-asserted-by":"crossref","unstructured":"Li, Y., Ye, Z., Rehg, J.M.: Delving into egocentric actions. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015)","DOI":"10.1109\/CVPR.2015.7298625"},{"key":"3_CR7","doi-asserted-by":"crossref","unstructured":"Cheron, G., Laptev, I., Schmid, C.: P-CNN: pose-based CNN features for action recognition. In: IEEE International Conference on Computer Vision (ICCV) (2015)","DOI":"10.1109\/ICCV.2015.368"},{"key":"3_CR8","doi-asserted-by":"crossref","unstructured":"Ni, B., Paramathayalan, V.R., Moulin, P.: Multiple granularity analysis for fine-grained action detection. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2014)","DOI":"10.1109\/CVPR.2014.102"},{"key":"3_CR9","doi-asserted-by":"crossref","unstructured":"Vo, N.N., Bobick, A.F.: From stochastic grammar to Bayes network: probabilistic parsing of complex activity. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2014)","DOI":"10.1109\/CVPR.2014.338"},{"key":"3_CR10","doi-asserted-by":"crossref","unstructured":"Hawkins, K.P., Bansal, S., Vo, N.N., Bobick, A.F.: Anticipating human actions for collaboration in the presence of task and sensor uncertainty. In: IEEE International Conference on Robotics and Automation (ICRA) (2014)","DOI":"10.1109\/ICRA.2014.6907165"},{"key":"3_CR11","unstructured":"Gao, Y., Vedula, S.S., Reiley, C.E., Ahmidi, N., Varadarajan, B., Lin, H.C., Tao, L., Zappella, L., B\u00e9jar, B., Yuh, D.D., et al.: JHU-ISI gesture and skill assessment working set (JIGSAWS): a surgical activity dataset for human motion modeling. In: MICCAI Workshop: Modeling and Monitoring of Computer Assisted Interventions (M2CAI) (2014)"},{"key":"3_CR12","doi-asserted-by":"publisher","first-page":"732","DOI":"10.1016\/j.media.2013.04.007","volume":"17","author":"L Zappella","year":"2013","unstructured":"Zappella, L., Haro, B.B., Hager, G.D., Vidal, R.: Surgical gesture classification from video and kinematic data. Med. Image Anal. 17, 732\u2013745 (2013)","journal-title":"Med. Image Anal."},{"key":"3_CR13","first-page":"339","volume-title":"Medical Image Computing and Computer-Assisted Intervention \u2013 MICCAI 2013","author":"Lingling Tao","year":"2013","unstructured":"Tao, L., Zappella, L., Hager, G.D., Vidal, R.: Surgical gesture segmentation and recognition. In: Medical Image Computing and Computer Assisted Intervention (MICCAI), pp. 339\u2013346 (2013)"},{"key":"3_CR14","doi-asserted-by":"crossref","unstructured":"Lei, J., Ren, X., Fox, D.: Fine-grained kitchen activity recognition using RGB-D. In: ACM Conference on Ubiquitous Computing (UbiComp) (2012)","DOI":"10.1145\/2370216.2370248"},{"key":"3_CR15","doi-asserted-by":"crossref","unstructured":"Morariu, V.I., Davis, L.S.: Multi-agent event recognition in structured scenarios. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2011)","DOI":"10.1109\/CVPR.2011.5995386"},{"issue":"8","key":"3_CR16","doi-asserted-by":"publisher","first-page":"951","DOI":"10.1177\/0278364913478446","volume":"32","author":"HS Koppula","year":"2013","unstructured":"Koppula, H.S., Gupta, R., Saxena, A.: Learning human activities and object affordances from RGB-D videos. Intl. J. Robot. Res. (IJRR) 32(8), 951\u2013970 (2013)","journal-title":"Intl. J. Robot. Res. (IJRR)"},{"key":"3_CR17","doi-asserted-by":"crossref","first-page":"311","DOI":"10.3233\/AIS-2010-0070","volume":"2","author":"T van Kasteren","year":"2010","unstructured":"van Kasteren, T., Englebienne, G., Kr\u00f6se, B.J.: Activity recognition using semi-Markov models on real world smart home datasets. J. Ambient Intell. Smart Environ. 2, 311\u2013325 (2010)","journal-title":"J. Ambient Intell. Smart Environ."},{"key":"3_CR18","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. In: International Conference Learning Representations (ICLR) (2015)"},{"key":"3_CR19","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: ImageNet classification with deep convolutional neural networks. In: Pereira, F., Burges, C., Bottou, L., Weinberger, K. (eds.) Advances in Neural Information Processing Systems (NIPS) (2012)"},{"key":"3_CR20","unstructured":"Sarawagi, S., Cohen, W.W.: Semi-Markov conditional random fields for information extraction. In: Advances in Neural Information Processing Systems (NIPS) (2004)"},{"key":"3_CR21","doi-asserted-by":"crossref","unstructured":"Stein, S., McKenna, S.J.: Combining embedded accelerometers with computer vision for recognizing food preparation activities. In: ACM Conference on Ubiquitous Computing (UbiComp) (2013)","DOI":"10.1145\/2493432.2493482"},{"key":"3_CR22","doi-asserted-by":"crossref","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., Liu, C.L.: Action recognition by dense trajectories. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2011)","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"3_CR23","doi-asserted-by":"crossref","unstructured":"Pirsiavash, H., Ramanan, D.: Parsing videos of actions with segmental grammars. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2014)","DOI":"10.1109\/CVPR.2014.85"},{"key":"3_CR24","doi-asserted-by":"crossref","unstructured":"Jain, M., van Gemert, J.C., Snoek, C.G.M.: What do 15,000 object categories tell us about classifying and localizing actions? In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015)","DOI":"10.1109\/CVPR.2015.7298599"},{"key":"3_CR25","doi-asserted-by":"crossref","unstructured":"Pishchulin, L., Andriluka, M., Schiele, B.: Fine-grained activity recognition with holistic and pose based features. In: German Conference on Pattern Recognition (GCPR) (2014)","DOI":"10.1007\/978-3-319-11752-2_56"},{"key":"3_CR26","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., Fei-Fei, L.: Large-scale video classification with convolutional neural networks. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2014)","DOI":"10.1109\/CVPR.2014.223"},{"key":"3_CR27","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. In: Advances in Neural Information Processing Systems (NIPS), pp. 568\u2013576 (2014)"},{"key":"3_CR28","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., Paluri, M.: Learning spatiotemporal features with 3D convolutional networks. In: The IEEE International Conference on Computer Vision (ICCV) (2015)","DOI":"10.1109\/ICCV.2015.510"},{"key":"3_CR29","unstructured":"Peng, X., Schmid, C.: Encoding feature maps of cnns for action recognition. In: CVPR, THUMOS Challenge 2015 Workshop (2015)"},{"key":"3_CR30","unstructured":"Ng, J.Y., Hausknecht, M.J., Vijayanarasimhan, S., Vinyals, O., Monga, R., Toderici, G.: Beyond short snippets: deep networks for video classification. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015)"},{"key":"3_CR31","doi-asserted-by":"publisher","first-page":"22","DOI":"10.1007\/s11263-010-0384-0","volume":"93","author":"Q Shi","year":"2011","unstructured":"Shi, Q., Cheng, L., Wang, L., Smola, A.: Human action segmentation and recognition using discriminative semi-Markov models. Intl. J. Comput. Vis. (IJCV) 93, 22\u201332 (2011)","journal-title":"Intl. J. Comput. Vis. (IJCV)"},{"key":"3_CR32","doi-asserted-by":"crossref","unstructured":"Tang, K., Fei-Fei, L., Koller, D.: Learning latent temporal structure for complex event detection. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2012)","DOI":"10.1109\/CVPR.2012.6247808"},{"key":"3_CR33","doi-asserted-by":"crossref","unstructured":"Vinyals, O., Toshev, A., Bengio, S., Erhan, D.: Show and tell: a neural image caption generator. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015)","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"3_CR34","doi-asserted-by":"crossref","unstructured":"Donahue, J., Hendricks, L.A., Guadarrama, S., Rohrbach, M., Venugopalan, S., Saenko, K., Darrell, T.: Long-term recurrent convolutional networks for visual recognition and description. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015)","DOI":"10.21236\/ADA623249"},{"key":"3_CR35","unstructured":"Hannun, A.Y., Case, C., Casper, J., Catanzaro, B.C., Diamos, G., Elsen, E., Prenger, R., Satheesh, S., Sengupta, S., Coates, A., Ng, A.Y.: Deep speech: scaling up end-to-end speech recognition. CoRR abs\/1412.5567 (2014)"},{"key":"3_CR36","doi-asserted-by":"crossref","unstructured":"Abdel-Hamid, O., Deng, L., Yu, D.: Exploring convolutional neural network structures and optimization techniques for speech recognition. In: INTERSPEECH International Speech Communication Association (2013)","DOI":"10.21437\/Interspeech.2013-744"},{"key":"3_CR37","doi-asserted-by":"crossref","unstructured":"Lea, C., Vidal, R., Hager, G.D.: Learning convolutional action primitives for fine-grained action recognition. In: IEEE International Conference on Robotics and Automation (ICRA) (2016)","DOI":"10.1109\/ICRA.2016.7487305"},{"key":"3_CR38","unstructured":"Ian Goodfellow, Y.B., Courville, A.: Deep Learning. MIT Press (2016, in preparation). http:\/\/www.deeplearningbook.org\/"},{"key":"3_CR39","doi-asserted-by":"crossref","unstructured":"Davis, J., Bobick, A.: The representation and recognition of action using temporal templates. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (1997)","DOI":"10.1007\/978-94-015-8935-2_6"},{"key":"3_CR40","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. In: International Conference Learning Representations (ICLR) (2014)"},{"key":"3_CR41","unstructured":"Chollet, F.: Keras (2015). https:\/\/github.com\/fchollet\/keras"},{"key":"3_CR42","doi-asserted-by":"crossref","unstructured":"Fathi, A., Farhadi, A., Rehg, J.M.: Understanding egocentric activities. In: IEEE International Conference on Computer Vision (ICCV) (2011)","DOI":"10.1109\/ICCV.2011.6126269"},{"key":"3_CR43","doi-asserted-by":"publisher","first-page":"31","DOI":"10.1145\/375360.375365","volume":"33","author":"G Navarro","year":"2001","unstructured":"Navarro, G.: A guided tour to approximate string matching. ACM Comput. Surv. 33, 31\u201388 (2001)","journal-title":"ACM Comput. Surv."}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2016"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-46487-9_3","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,7,8]],"date-time":"2022-07-08T17:11:14Z","timestamp":1657300274000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-46487-9_3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016]]},"ISBN":["9783319464862","9783319464879"],"references-count":43,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-46487-9_3","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2016]]},"assertion":[{"value":"17 September 2016","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Amsterdam","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"The Netherlands","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2016","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 October 2016","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"16 October 2016","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2016","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/www.eccv2016.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}]}}