{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,27]],"date-time":"2025-10-27T16:07:02Z","timestamp":1761581222372,"version":"3.40.4"},"publisher-location":"Cham","reference-count":40,"publisher":"Springer International Publishing","isbn-type":[{"type":"print","value":"9783319105895"},{"type":"electronic","value":"9783319105901"}],"license":[{"start":{"date-parts":[[2014,1,1]],"date-time":"2014-01-01T00:00:00Z","timestamp":1388534400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2014]]},"DOI":"10.1007\/978-3-319-10590-1_47","type":"book-chapter","created":{"date-parts":[[2014,8,13]],"date-time":"2014-08-13T21:50:08Z","timestamp":1407966608000},"page":"725-740","source":"Crossref","is-referenced-by-count":12,"title":["Motion Words for Videos"],"prefix":"10.1007","author":[{"given":"Ekaterina H.","family":"Taralova","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fernando","family":"De la Torre","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Martial","family":"Hebert","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","reference":[{"key":"47_CR1","doi-asserted-by":"crossref","unstructured":"Bettadapura, V., Schindler, G., Ploetz, T., Essa, I.: Augmenting bag-of-words: Data-driven discovery of temporal and structural information for activity recognition. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.338"},{"key":"47_CR2","doi-asserted-by":"crossref","unstructured":"Boureau, Y.L., Le Roux, N., Bach, F., Ponce, J., LeCun, Y.: Ask the locals: Multi-way local pooling for image recognition. In: ICCV, pp. 2651\u20132658 (2011)","DOI":"10.1109\/ICCV.2011.6126555"},{"key":"47_CR3","doi-asserted-by":"crossref","unstructured":"Brendel, W., Todorovic, S.: Video object segmentation by tracking regions. In: ICCV, pp. 833\u2013840 (2009)","DOI":"10.1109\/ICCV.2009.5459242"},{"key":"47_CR4","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"282","DOI":"10.1007\/978-3-642-15555-0_21","volume-title":"Computer Vision \u2013 ECCV 2010","author":"T. Brox","year":"2010","unstructured":"Brox, T., Malik, J.: Object segmentation by long term analysis of point trajectories. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part V. LNCS, vol.\u00a06315, pp. 282\u2013295. Springer, Heidelberg (2010)"},{"key":"47_CR5","doi-asserted-by":"crossref","unstructured":"Buades, A., Coll, B., Morel, J.M.: A non-local algorithm for image denoising. In: CVPR, pp. 60\u201365 (2005)","DOI":"10.1109\/CVPR.2005.38"},{"key":"47_CR6","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"430","DOI":"10.1007\/978-3-642-33786-4_32","volume-title":"Computer Vision \u2013 ECCV 2012","author":"J. Carreira","year":"2012","unstructured":"Carreira, J., Caseiro, R., Batista, J., Sminchisescu, C.: Semantic Segmentation with Second-Order Pooling. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012, Part VII. LNCS, vol.\u00a07578, pp. 430\u2013443. Springer, Heidelberg (2012)"},{"key":"47_CR7","doi-asserted-by":"crossref","unstructured":"Dabov, K., Foi, A., Katkovnik, V., Egiazarian, K.: Image denoising with block-matching and 3D filtering. In: Electronic Imaging (2006)","DOI":"10.1117\/12.643267"},{"key":"47_CR8","unstructured":"Dollar, P., Rabaud, V., Cottrell, G., Belongie, S.: Behavior recognition via sparse spatio-temporal features. In: International Workshop on Visual Surveillance and Performance Evaluation of Tracking and Surveillance (2005)"},{"key":"47_CR9","doi-asserted-by":"crossref","unstructured":"Everts, I., van Gemert, J.C., Gevers, T.: Evaluation of color STIPs for human action recognition. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.367"},{"key":"47_CR10","doi-asserted-by":"crossref","unstructured":"Felzenszwalb, P.F., Huttenlocher, D.P.: Efficient graph-based image segmentation. IJCV\u00a0(2), 167\u2013181 (2004)","DOI":"10.1023\/B:VISI.0000022288.19776.77"},{"key":"47_CR11","doi-asserted-by":"crossref","unstructured":"Gaidon, A., Harchaoui, Z., Schmid, C.: Actom Sequence Models for Efficient Action Detection. In: CVPR, pp. 3201\u20133208 (2011)","DOI":"10.1109\/CVPR.2011.5995646"},{"key":"47_CR12","doi-asserted-by":"crossref","unstructured":"Gould, S., Fulton, R., Koller, D.: Decomposing a scene into geometric and semantically consistent regions. In: ICCV, pp. 1\u20138 (2009)","DOI":"10.1109\/ICCV.2009.5459211"},{"key":"47_CR13","doi-asserted-by":"crossref","unstructured":"Grundmann, M., Kwatra, V., Han, M., Essa, I.: Efficient hierarchical graph-based video segmentation, In: CVPR (2010)","DOI":"10.1109\/CVPR.2010.5539893"},{"key":"47_CR14","unstructured":"Hsu, C.W., Chang, C.C., Lin, C.J.: A practical guide to support vector classification. Tech. rep., National Taiwan University (2005)"},{"key":"47_CR15","doi-asserted-by":"crossref","unstructured":"Jain, A., Gupta, A., Rodriguez, M., Davis, L.S.: Representing Videos using Mid-level Discriminative Patches. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.332"},{"key":"47_CR16","doi-asserted-by":"crossref","unstructured":"J\u00e9gou, H., Douze, M., Schmid, C., P\u00e9rez, P.: Aggregating local descriptors into a compact image representation. In: CVPR, pp. 3304\u20133311 (2010)","DOI":"10.1109\/CVPR.2010.5540039"},{"key":"47_CR17","doi-asserted-by":"crossref","unstructured":"Kuehne, H., Jhuang, H., Garrote, E., Poggio, T., Serre, T.: HMDB: a large video database for human motion recognition. In: ICCV (2011)","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"47_CR18","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1007\/11676959_8","volume-title":"Spatial Coherence for Visual Motion Analysis","author":"I. Laptev","year":"2006","unstructured":"Laptev, I., Lindeberg, T.: Local descriptors for spatio-temporal recognition. In: MacLean, W.J. (ed.) SCVMA 2004. LNCS, vol.\u00a03667, pp. 91\u2013103. Springer, Heidelberg (2006)"},{"key":"47_CR19","doi-asserted-by":"crossref","unstructured":"Le, Q.V., Zou, W.Y., Yeung, S.Y., Ng, A.Y.: Learning hierarchical invariant spatio-temporal features for action recognition with independent subspace analysis. In: CVPR (2011)","DOI":"10.1109\/CVPR.2011.5995496"},{"key":"47_CR20","doi-asserted-by":"crossref","unstructured":"Lee, Y.J., Kim, J., Grauman, K.: Key-segments for video object segmentation. In: ICCV (2011)","DOI":"10.1109\/ICCV.2011.6126471"},{"key":"47_CR21","doi-asserted-by":"crossref","unstructured":"Lezama, J., Alahari, K., Sivic, J., Laptev, I.: Track to the future: Spatio-temporal video segmentation with long-range motion cues. In: CVPR (2011)","DOI":"10.1109\/CVPR.2011.6044588"},{"key":"47_CR22","doi-asserted-by":"crossref","unstructured":"Liu, J., Kuipers, B., Savarese, S.: Recognizing human actions by attributes. In: CVPR (2011)","DOI":"10.1109\/CVPR.2011.5995353"},{"key":"47_CR23","doi-asserted-by":"crossref","unstructured":"Liu, J., Luo, J., Shah, M.: Recognizing realistic actions from videos \u201cin the wild\u201d. In: CVPR (2009)","DOI":"10.1109\/CVPR.2009.5206744"},{"key":"47_CR24","doi-asserted-by":"crossref","unstructured":"Mairal, J., Bach, F., Ponce, J., Sapiro, G., Zisserman, A.: Non-local sparse models for image restoration. In: ICCV, pp. 2272\u20132279 (2009)","DOI":"10.1109\/ICCV.2009.5459452"},{"key":"47_CR25","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"842","DOI":"10.1007\/978-3-642-33709-3_60","volume-title":"Computer Vision \u2013 ECCV 2012","author":"S. Mathe","year":"2012","unstructured":"Mathe, S., Sminchisescu, C.: Dynamic Eye Movement Datasets and Learnt Saliency Models for Visual Action Recognition. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012, Part II. LNCS, vol.\u00a07573, pp. 842\u2013856. Springer, Heidelberg (2012)"},{"key":"47_CR26","doi-asserted-by":"crossref","unstructured":"Moore, A., Prince, S., Warrell, J., Mohammed, U., Jones, G.: Superpixel lattices. In: CVPR (2008)","DOI":"10.1109\/CVPR.2008.4587471"},{"key":"47_CR27","doi-asserted-by":"crossref","unstructured":"Nguyen, M.H., Torresani, L., De la Torre, F., Rother, C.: Weakly supervised discriminative localization and classification: a joint learning process. Tech. rep., Carnegie Mellon University (2009)","DOI":"10.21236\/ADA507101"},{"key":"47_CR28","doi-asserted-by":"crossref","unstructured":"Oneata, D., Verbeek, J., Schmid, C.: Action and Event Recognition with Fisher Vectors on a Compact Feature Set. In: ICCV, pp. 1817\u20131824 (2013)","DOI":"10.1109\/ICCV.2013.228"},{"key":"47_CR29","doi-asserted-by":"crossref","unstructured":"Raptis, M., Kokkinos, I., Soatto, S.: Discovering discriminative action parts from mid-level video representations. In: CVPR (2012)","DOI":"10.1109\/CVPR.2012.6247807"},{"key":"47_CR30","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"55","DOI":"10.1007\/978-3-642-33786-4_5","volume-title":"Computer Vision \u2013 ECCV 2012","author":"N. Shapovalova","year":"2012","unstructured":"Shapovalova, N., Vahdat, A., Cannons, K., Lan, T., Mori, G.: Similarity constrained latent support vector machine: An application to weakly supervised action classification. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012, Part VII. LNCS, vol.\u00a07578, pp. 55\u201368. Springer, Heidelberg (2012)"},{"key":"47_CR31","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"352","DOI":"10.1007\/978-3-642-15555-0_26","volume-title":"Computer Vision \u2013 ECCV 2010","author":"J. Tighe","year":"2010","unstructured":"Tighe, J., Lazebnik, S.: Superparsing: Scalable nonparametric image parsing with superpixels. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part V. LNCS, vol.\u00a06315, pp. 352\u2013365. Springer, Heidelberg (2010)"},{"key":"47_CR32","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"268","DOI":"10.1007\/978-3-642-15555-0_20","volume-title":"Computer Vision \u2013 ECCV 2010","author":"A. Vazquez-Reina","year":"2010","unstructured":"Vazquez-Reina, A., Avidan, S., Pfister, H., Miller, E.: Multiple hypothesis video segmentation from superpixel flows. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part V. LNCS, vol.\u00a06315, pp. 268\u2013281. Springer, Heidelberg (2010)"},{"key":"47_CR33","doi-asserted-by":"crossref","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., Cheng-Lin, L.: Action Recognition by Dense Trajectories. In: CVPR (2011)","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"47_CR34","doi-asserted-by":"crossref","unstructured":"Wang, H., Schmid, C.: Action Recognition with Improved Trajectories. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.441"},{"key":"47_CR35","doi-asserted-by":"crossref","unstructured":"Wang, L., Qiao, Y., Tang, X.: Motionlets: Mid-level 3D parts for human motion recognition. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.345"},{"key":"47_CR36","doi-asserted-by":"crossref","unstructured":"Xu, C., Whitt, S., Corso, J.: Flattening supervoxel hierarchies by the uniform entropy slice. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.279"},{"key":"47_CR37","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"626","DOI":"10.1007\/978-3-642-33783-3_45","volume-title":"Computer Vision \u2013 ECCV 2012","author":"C. Xu","year":"2012","unstructured":"Xu, C., Xiong, C., Corso, J.J.: Streaming hierarchical video segmentation. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012, Part VI. LNCS, vol.\u00a07577, pp. 626\u2013639. Springer, Heidelberg (2012)"},{"key":"47_CR38","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"707","DOI":"10.1007\/978-3-642-33712-3_51","volume-title":"Computer Vision \u2013 ECCV 2012","author":"Y. Zhang","year":"2012","unstructured":"Zhang, Y., Liu, X., Chang, M.-C., Ge, W., Chen, T.: Spatio-temporal phrases for activity recognition. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012, Part III. LNCS, vol.\u00a07574, pp. 707\u2013721. Springer, Heidelberg (2012)"},{"key":"47_CR39","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"141","DOI":"10.1007\/978-3-642-15555-0_11","volume-title":"Computer Vision \u2013 ECCV 2010","author":"X. Zhou","year":"2010","unstructured":"Zhou, X., Yu, K., Zhang, T., Huang, T.S.: Image classification using super-vector coding of local image descriptors. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part V. LNCS, vol.\u00a06315, pp. 141\u2013154. Springer, Heidelberg (2010)"},{"key":"47_CR40","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Nayak, N.M., Roy-Chowdhury, A.K.: Context-aware modeling and recognition of activities in video. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.322"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2014"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-10590-1_47","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,4]],"date-time":"2025-05-04T05:26:20Z","timestamp":1746336380000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-10590-1_47"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2014]]},"ISBN":["9783319105895","9783319105901"],"references-count":40,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-10590-1_47","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2014]]}}}