{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:39:20Z","timestamp":1740123560858,"version":"3.37.3"},"reference-count":64,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2016,3,1]],"date-time":"2016-03-01T00:00:00Z","timestamp":1456790400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2016,10]]},"DOI":"10.1007\/s11263-016-0891-8","type":"journal-article","created":{"date-parts":[[2016,3,1]],"date-time":"2016-03-01T06:40:49Z","timestamp":1456814449000},"page":"28-43","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":8,"title":["Multiple Granularity Modeling: A Coarse-to-Fine Framework for Fine-grained Action Analysis"],"prefix":"10.1007","volume":"120","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-5582-577X","authenticated-orcid":false,"given":"Bingbing","family":"Ni","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Vignesh R.","family":"Paramathayalan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Teng","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pierre","family":"Moulin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2016,3,1]]},"reference":[{"issue":"11","key":"891_CR1","doi-asserted-by":"crossref","first-page":"2274","DOI":"10.1109\/TPAMI.2012.120","volume":"34","author":"R Achanta","year":"2012","unstructured":"Achanta, R., Shaji, A., Smith, K., Lucchi, A., Fua, P., & S\u00fcsstrunk, S. (2012). Slic superpixels compared to state-of-the-art superpixel methods. IEEE Transactions on Pattern Analysis and Machine Intelligence, 34(11), 2274\u20132282.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"9","key":"891_CR2","doi-asserted-by":"crossref","first-page":"1806","DOI":"10.1109\/TPAMI.2011.21","volume":"33","author":"J Berclaz","year":"2011","unstructured":"Berclaz, J., Fleuret, F., Turetken, E., & Fua, P. (2011). Multiple object tracking using k-shortest paths optimization. IEEE Transactions on Pattern Analysis and Machine Intelligence, 33(9), 1806\u20131819.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"1","key":"891_CR3","doi-asserted-by":"crossref","first-page":"5","DOI":"10.1109\/MAES.2004.1263228","volume":"19","author":"S Blackman","year":"2004","unstructured":"Blackman, S. (2004). Multiple hypothesis tracking for multiple target tracking. IEEE Aerospace and Electronic Systems Magazine, 19(1), 5\u201318.","journal-title":"IEEE Aerospace and Electronic Systems Magazine"},{"key":"891_CR4","doi-asserted-by":"crossref","unstructured":"Brand, M., Oliver, N., & Pentland, A. (1997). Coupled hidden markov models for complex action recognition. In IEEE conference on computer vision and pattern recognition (pp. 994\u2013999).","DOI":"10.1109\/CVPR.1997.609450"},{"key":"891_CR5","first-page":"566","volume":"1","author":"C Chang","year":"2005","unstructured":"Chang, C., Ansari, R., & Khokhar, A. (2005). Multiple object tracking with kernel particle filter. IEEE Conference on Computer Vision and Pattern Recognition, 1, 566\u2013573.","journal-title":"IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"891_CR6","first-page":"210","volume":"2","author":"HT Chen","year":"2001","unstructured":"Chen, H. T., Lin, H. H., & Liu, T. L. (2001). Multi-object tracking using dynamical graph matching. IEEE Conference on Computer Vision and Pattern Recognition, 2, 210\u2013217.","journal-title":"IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"891_CR7","doi-asserted-by":"crossref","unstructured":"Dalal, N., & Triggs, B. (2005). Histograms of oriented gradients for human detection. In IEEE conference on computer vision and pattern recognition (pp. 886\u2013893).","DOI":"10.1109\/CVPR.2005.177"},{"key":"891_CR8","doi-asserted-by":"crossref","unstructured":"de\u00a0La\u00a0Gorce, M., Paragios, N., & Fleet, D. (2008). Model-based hand tracking with texture, shading and self-occlusions. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2008.4587752"},{"key":"891_CR9","doi-asserted-by":"crossref","unstructured":"Dollar, P., Rabaud, V., Cottrell, G., & Belongie, S. (2005). Behavior recognition via sparse spatio-temporal features. In IEEE international workshop on visual surveillance and performance evaluation of tracking and surveillance.","DOI":"10.1109\/VSPETS.2005.1570899"},{"key":"891_CR10","doi-asserted-by":"crossref","unstructured":"Escorcia, V., & Niebles, J. (2013). Spatio-temporal human-object interactions for action recognition in videos. In IEEE international conference on computer vision workshops (ICCVW) (pp. 508\u2013514).","DOI":"10.1109\/ICCVW.2013.72"},{"key":"891_CR11","doi-asserted-by":"crossref","unstructured":"Fathi, A., Farhadi, A., & Rehg, J. M. (2011). Understanding egocentric activities. In International conference on computer vision (pp. 407\u2013414).","DOI":"10.1109\/ICCV.2011.6126269"},{"key":"891_CR12","unstructured":"Grabner H, Grabner, M., & Bischof, H. (2006). Real-time tracking via online boosting. In British machine vision conference (pp. 47\u201356)."},{"key":"891_CR13","doi-asserted-by":"crossref","unstructured":"Gupta, A., & Davis, L. (2007). Objects in action: An approach for combining action understanding and object perception. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2007.383331"},{"key":"891_CR14","first-page":"864","volume":"1","author":"M Han","year":"2004","unstructured":"Han, M., Xu, W., Tao, H., & Gong, Y. (2004). An algorithm for multiple object trajectory tracking. IEEE Conference on Computer Vision and Pattern Recognition, 1, 864\u2013871.","journal-title":"IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"891_CR15","doi-asserted-by":"crossref","unstructured":"Iwase, S., & Saito, H. (2004). Parallel tracking of all soccer players by integrating detected positions in multiple view images. In International conference on pattern recognition (pp. 751\u2013754).","DOI":"10.1109\/ICPR.2004.1333881"},{"issue":"1","key":"891_CR16","doi-asserted-by":"crossref","first-page":"27","DOI":"10.1007\/s10994-009-5108-8","volume":"77","author":"T Joachims","year":"2009","unstructured":"Joachims, T., Finley, T., & Yu, C. N. J. (2009). Cutting-plane training of structural svms. Machine Learning, 77(1), 27\u201359.","journal-title":"Machine Learning"},{"key":"891_CR17","doi-asserted-by":"crossref","unstructured":"Kalal, Z., Matas, J., & Mikolajczyk, K. (2010). P-n learning: Bootstrapping binary classifiers by structural constraints. In IEEE conference on computer vision and pattern recognition (pp. 49\u201356).","DOI":"10.1109\/CVPR.2010.5540231"},{"key":"891_CR18","doi-asserted-by":"crossref","unstructured":"Kjellstr\u00f6m, H., Romero, J., Mart\u00ednez, D., & Kragi\u0107, D. (2008). Simultaneous visual recognition of manipulation actions and manipulated objects. In European conference on computer vision (pp. 336\u2013349).","DOI":"10.1007\/978-3-540-88688-4_25"},{"key":"891_CR19","doi-asserted-by":"crossref","unstructured":"Klaser, A., Marszalek, M., & Schmid, C. (2008). A spatio-temporal descriptor based on 3d gradients. In British machine vision conference.","DOI":"10.5244\/C.22.99"},{"key":"891_CR20","unstructured":"Koppula, H. S., Gupta, R., & Saxena, A. (2012). Learning human activities and object affordances from rgb-d videos. CoRR."},{"key":"891_CR21","doi-asserted-by":"crossref","unstructured":"Kuehne, H., Arslan, A., & Serre, T. (2014). The language of actions: Recovering the syntax and semantics of goal-directed human activities. In IEEE Conference on computer vision and pattern recognition (pp. 780\u2013787).","DOI":"10.1109\/CVPR.2014.105"},{"key":"891_CR22","doi-asserted-by":"crossref","unstructured":"Kyriazis, N., & Argyros, A. (2014). Scalable 3d tracking of multiple interacting objects. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2014.438"},{"key":"891_CR23","unstructured":"Lafferty, J., McCallum, A., & Pereira, F. (2001). Conditional random fields: Probabilistic models for segmenting and labeling sequence data. In International conference on machine learning (pp. 282\u2013289)."},{"key":"891_CR24","unstructured":"Lan, T., Wang, Y., Yang, W., & Mori, G. (2010). Beyond actions: Discriminative models for contextual group activities. In Advances in neural information processing systems (pp. 1216\u20131224)."},{"key":"891_CR25","doi-asserted-by":"crossref","unstructured":"Laptev, I., & Lindeberg, T. (2003). Space-time interest points. In IEEE international conference on computer vision.","DOI":"10.1109\/ICCV.2003.1238378"},{"key":"891_CR26","doi-asserted-by":"crossref","unstructured":"Lei, J., Ren, X., & Fox, D. (2012). Fine-grained kitchen activity recognition using rgb-d. In ACM conference on ubiquitous computing (pp. 208\u2013211).","DOI":"10.1145\/2370216.2370248"},{"key":"891_CR27","doi-asserted-by":"crossref","unstructured":"Li, C., & Kitani, K. M. (2013). Pixel-level hand detection in ego-centric videos. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2013.458"},{"issue":"12","key":"891_CR28","doi-asserted-by":"crossref","first-page":"2368","DOI":"10.1109\/TPAMI.2011.131","volume":"33","author":"C Liu","year":"2011","unstructured":"Liu, C., Yuen, J., & Torralba, A. (2011). Nonparametric scene parsing via label transfer. IEEE Transactions on Pattern Analysis and Machine Intelligence, 33(12), 2368\u20132382.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"891_CR29","doi-asserted-by":"crossref","unstructured":"Liu, J., Carr, P., Collins, R. T., & Liu, Y. (2013). Tracking sports players with context-conditioned motion models. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2013.239"},{"key":"891_CR30","doi-asserted-by":"crossref","unstructured":"Lv, F., & Nevatia, R. (2007). Single view human action recognition using key pose matching and viterbi path searching. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2007.383131"},{"key":"891_CR31","first-page":"572","volume":"1","author":"J MacCormick","year":"1999","unstructured":"MacCormick, J., & Blake, A. (1999). A probabilistic exclusion principle for tracking multiple objects. IEEE International Conference on Computer Vision, 1, 572\u2013578.","journal-title":"IEEE International Conference on Computer Vision"},{"key":"891_CR32","doi-asserted-by":"crossref","unstructured":"Malisiewicz, T., Gupta, A., & Efros, A. A. (2011). Ensemble of exemplar-svms for object detection and beyond. In IEEE international conference on computer vision.","DOI":"10.1109\/ICCV.2011.6126229"},{"key":"891_CR33","doi-asserted-by":"crossref","unstructured":"Marsza\u0142ek, M., Laptev, I., & Schmid, C. (2009). Actions in context. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2009.5206557"},{"key":"891_CR34","doi-asserted-by":"crossref","unstructured":"Moore, D., Essa, I., & Hayes, M. (1999). Exploiting human actions and object context for recognition tasks. In IEEE international conference on computer vision.","DOI":"10.1109\/ICCV.1999.791201"},{"key":"891_CR35","unstructured":"Murphy, K. P., Weiss, Y., & Jordan, M. I. (1999). Loopy belief propagation for approximate inference: An empirical study. In Conference on uncertainty in artificial intelligence (pp. 467\u2013475)."},{"key":"891_CR36","doi-asserted-by":"crossref","unstructured":"Ni, B., Paramathayalan, V., & Moulin, P. (2014). Multiple granularity analysis for fine-grained action detection. In IEEE Conference on computer vision and pattern recognition (pp. 756\u2013763).","DOI":"10.1109\/CVPR.2014.102"},{"issue":"2","key":"891_CR37","doi-asserted-by":"crossref","first-page":"229","DOI":"10.1007\/s11263-014-0742-4","volume":"111","author":"B Ni","year":"2015","unstructured":"Ni, B., Moulin, P., & Yan, S. (2015). Pose adaptive motion feature pooling for human action analysis. International Journal of Computer Vision, 111(2), 229\u2013248.","journal-title":"International Journal of Computer Vision"},{"key":"891_CR38","doi-asserted-by":"crossref","unstructured":"Niebles, J. C., Wang, H., & Fei-fei, L. (2006). Unsupervised learning of human action categories using spatial-temporal words. In British machine vision conference.","DOI":"10.5244\/C.20.127"},{"key":"891_CR39","doi-asserted-by":"crossref","unstructured":"Packer, B., & Koller, D. (2012). A combined pose, object, and feature model for action understanding. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2012.6247824"},{"key":"891_CR40","unstructured":"Patron-Perez, A., Marszalek, M., Zisserman, A., & Reid, I. (2010). High five: Recognising human interactions in tv shows. In The British machine vision conference."},{"key":"891_CR41","doi-asserted-by":"crossref","unstructured":"Patterson, D. J., Fox, D., Kautz, H., & Philipose, M. (2005). Fine-grained activity recognition by aggregating abstract object usage. In IEEE international symposium on wearable computers (pp. 44\u201351).","DOI":"10.1109\/ISWC.2005.22"},{"issue":"4","key":"891_CR42","doi-asserted-by":"crossref","first-page":"835","DOI":"10.1109\/TPAMI.2012.175","volume":"35","author":"A Prest","year":"2013","unstructured":"Prest, A., Ferrari, V., & Schmid, C. (2013). Explicit modeling of human-object interactions in realistic videos. IEEE Transactions on Pattern Analysis and Machine Intelligence, 35(4), 835\u2013848.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"891_CR43","doi-asserted-by":"crossref","unstructured":"Raptis, M., & Sigal, L. (2013). Poselet key-framing: A model for human activity recognition. In IEEE conference on computer vision and pattern recognition (pp. 2650\u20132657).","DOI":"10.1109\/CVPR.2013.342"},{"key":"891_CR44","doi-asserted-by":"crossref","unstructured":"Raptis, M., Kokkinos, I., & Soatto, S. (2012). Discovering discriminative action parts from mid-level video representations. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2012.6247807"},{"key":"891_CR45","doi-asserted-by":"crossref","unstructured":"Rohrbach, M., Amin, S., Andriluka, M., & Schiele, B. (2012). A database for fine grained activity detection of cooking activities. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2012.6247801"},{"key":"891_CR46","doi-asserted-by":"crossref","unstructured":"Rohrbach, M., Qiu, W., Titov, I., Thater, S., Pinkal, M., & Schiele, B. (2013). Translating video content to natural language descriptions. In International conference on computer vision (pp. 433\u2013440).","DOI":"10.1109\/ICCV.2013.61"},{"key":"891_CR47","doi-asserted-by":"crossref","unstructured":"Ryoo, M. S., & Aggarwal, J. (2009). Spatio-temporal relationship match: Video structure comparison for recognition of complex human activities. In IEEE international conference on computer vision (pp. 1593\u20131600).","DOI":"10.1109\/ICCV.2009.5459361"},{"key":"891_CR48","unstructured":"Shimada, A., Kondo, K., Deguchi, D., Morin, G., & Stern, H. (2013). Kitchen scene context based gesture recognition: A contest in icpr2012. In Advances in depth image analysis and applications, vol 7854 (pp. 168\u2013185), http:\/\/www.murase.m.is.nagoya-u.ac.jp\/KSCGR\/index.html ."},{"key":"891_CR49","doi-asserted-by":"crossref","unstructured":"Trinh, H., Fan, Q., Gabbur, P., & Pankanti, S. (2012) Hand tracking by binary quadratic programming and its application to retail activity recognition. In IEEE conference on computer vision and pattern recognition (pp. 1902\u20131909).","DOI":"10.1109\/CVPR.2012.6247890"},{"key":"891_CR50","doi-asserted-by":"crossref","unstructured":"Vahdat, A., Gao, B., Ranjbar, M., & Mori, G. (2011). A discriminative key pose sequence model for recognizing human interactions. In ICCV workshop (pp. 1729\u20131736).","DOI":"10.1109\/ICCVW.2011.6130458"},{"key":"891_CR51","doi-asserted-by":"crossref","unstructured":"Wang, H., & Schmid, C. (2013). Action recognition with improved trajectories. In IEEE international conference on computer vision.","DOI":"10.1109\/ICCV.2013.441"},{"key":"891_CR52","doi-asserted-by":"crossref","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., & Cheng-Lin, L. (2011). Action recognition by dense trajectories. In IEEE conference on computer vision and pattern recognition (pp. 3169\u20133176).","DOI":"10.1109\/CVPR.2011.5995407"},{"issue":"1","key":"891_CR53","doi-asserted-by":"crossref","first-page":"60","DOI":"10.1007\/s11263-012-0594-8","volume":"103","author":"H Wang","year":"2013","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., & Liu, C. L. (2013). Dense trajectories and motion boundary descriptors for action recognition. International Journal of Computer Vision, 103(1), 60\u201379.","journal-title":"International Journal of Computer Vision"},{"issue":"7","key":"891_CR54","doi-asserted-by":"crossref","first-page":"1310","DOI":"10.1109\/TPAMI.2010.214","volume":"33","author":"Y Wang","year":"2011","unstructured":"Wang, Y., & Mori, G. (2011). Hidden part models for human action recognition: Probabilistic versus max margin. IEEE Transactions on Pattern Analysis and Machine Intelligence, 33(7), 1310\u20131323.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"891_CR55","doi-asserted-by":"crossref","unstructured":"Wesierski, D., & Horain, P. (2013). Pose-configurable generic tracking of elongated objects. In IEEE international conference on computer vision (pp. 2920\u20132927).","DOI":"10.1109\/ICCV.2013.363"},{"key":"891_CR56","doi-asserted-by":"crossref","unstructured":"Wu, J., Osuntogun, A., Choudhury, T., Philipose, M., & Rehg, J. (2007). A scalable approach to activity recognition based on object use. In IEEE international conference on computer vision.","DOI":"10.1109\/ICCV.2007.4408865"},{"key":"891_CR57","first-page":"2909","volume":"5","author":"M Xu","year":"2004","unstructured":"Xu, M., Orwell, J., & Jones, G. (2004). Tracking football players with multiple cameras. Internaltional Conference on Image Processing, 5, 2909\u20132912.","journal-title":"Internaltional Conference on Image Processing"},{"key":"891_CR58","first-page":"212","volume":"1","author":"C Yang","year":"2005","unstructured":"Yang, C., Duraiswami, R., & Davis, L. (2005). Fast multiple object tracking via a hierarchical particle filter. IEEE International Conference on Computer Vision, 1, 212\u2013219.","journal-title":"IEEE International Conference on Computer Vision"},{"issue":"7","key":"891_CR59","doi-asserted-by":"crossref","first-page":"1195","DOI":"10.1109\/TPAMI.2008.146","volume":"31","author":"M Yang","year":"2009","unstructured":"Yang, M., Wu, Y., & Hua, G. (2009). Context-aware visual tracking. IEEE Transactions on Pattern Analysis and Machine Intelligence, 31(7), 1195\u20131209.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"891_CR60","doi-asserted-by":"crossref","unstructured":"Yang, Y., Fermuller, C., & Aloimonos, Y. (2013). Detection of manipulation action consequences (mac). In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2013.331"},{"key":"891_CR61","unstructured":"Yao, B., Khosla, A., & Fei-fei, L. (2011). Classifying actions and measuring action similarity by modeling the mutual context of objects and human poses. In International conference on machine learning."},{"issue":"9","key":"891_CR62","doi-asserted-by":"crossref","first-page":"1728","DOI":"10.1109\/TPAMI.2011.38","volume":"33","author":"J Yuan","year":"2011","unstructured":"Yuan, J., Liu, Z., & Wu, Y. (2011). Discriminative video pattern search for efficient action detection. IEEE Transactions on Pattern Analysis and Machine Intelligence, 33(9), 1728\u20131743.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"891_CR63","first-page":"406","volume":"2","author":"T Zhao","year":"2004","unstructured":"Zhao, T., & Nevatia, R. (2004). Tracking multiple humans in crowded environment. IEEE Conference on Computer Vision and Pattern Recognition, 2, 406\u2013413.","journal-title":"IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"891_CR64","doi-asserted-by":"crossref","unstructured":"Zhou, Y., Ni, B., Yan, S., Moulin, P., & Tian, Q. (2014). Pipelining localized semantic features for fine-grained action recognition. In European conference on computer vision (pp. 481\u2013496).","DOI":"10.1007\/978-3-319-10593-2_32"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-016-0891-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-016-0891-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-016-0891-8","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,6,1]],"date-time":"2019-06-01T08:19:19Z","timestamp":1559377159000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-016-0891-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,3,1]]},"references-count":64,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2016,10]]}},"alternative-id":["891"],"URL":"https:\/\/doi.org\/10.1007\/s11263-016-0891-8","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"type":"print","value":"0920-5691"},{"type":"electronic","value":"1573-1405"}],"subject":[],"published":{"date-parts":[[2016,3,1]]}}}