{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,6]],"date-time":"2026-08-06T15:39:06Z","timestamp":1786030746875,"version":"3.56.0"},"reference-count":27,"publisher":"IEEE","license":[{"start":{"date-parts":[[2011,6,1]],"date-time":"2011-06-01T00:00:00Z","timestamp":1306886400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2011,6,1]],"date-time":"2011-06-01T00:00:00Z","timestamp":1306886400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2011,6]]},"DOI":"10.1109\/cvprw.2011.5981713","type":"proceedings-article","created":{"date-parts":[[2011,9,8]],"date-time":"2011-09-08T17:39:02Z","timestamp":1315503542000},"page":"9-16","source":"Crossref","is-referenced-by-count":13,"title":["Human action recognition in crowded surveillance video sequences by using features taken from key-point trajectories"],"prefix":"10.1109","author":[{"given":"Masaki","family":"Takahashi","sequence":"first","affiliation":[{"name":"Japan Broadcasting Corporation, Science &amp; Technology Research Laboratories, 1-10-11 Kinuta, Setagaya-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Masahide","family":"Naemura","sequence":"additional","affiliation":[{"name":"Japan Broadcasting Corporation, Science &amp; Technology Research Laboratories, 1-10-11 Kinuta, Setagaya-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mahito","family":"Fujii","sequence":"additional","affiliation":[{"name":"Japan Broadcasting Corporation, Science &amp; Technology Research Laboratories, 1-10-11 Kinuta, Setagaya-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shin'ichi","family":"Satoh","sequence":"additional","affiliation":[{"name":"National Institute of Informatics 2-1-2 Hitotsubashi, Chiyoda-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref10","year":"0","journal-title":"National Institute of Standards and Technology"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/1178677.1178722"},{"key":"ref12","first-page":"1","article-title":"Visual categorization with bags of keypoints","author":"csurka","year":"2004","journal-title":"Workshop on Statistical Learning in Computer Vision"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-005-1838-7"},{"key":"ref14","article-title":"MoSIFT: Recognizing Human Actions in Surveillance Videos","author":"chen","year":"2009","journal-title":"CMU-CS-09&#x2013;161"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.5244\/C.22.103"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1145\/1459359.1459456"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2005.177"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2009.5457659"},{"key":"ref19","article-title":"Local invariant feature tracks for high-level video feature extraction","author":"mezaris","year":"2010","journal-title":"Proc 11 th International Workshop on Image Analysis for Multimedia Interactive Services (WIAMIS 2010)"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2004.1334462"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.1999.790410"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2008.4587628"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2005.28"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2007.383132"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2006.841"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1155\/2008\/253039"},{"key":"ref2","first-page":"58","article-title":"Action Recognition via Local Descriptors and Holistic Features","author":"sun","year":"2009","journal-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR) for Human Communicative Behaviour Analysis"},{"key":"ref9","first-page":"1","article-title":"Learning motion patterns in crowded scenes using action flow field","author":"hu","year":"2008","journal-title":"Proc of ICPR"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2008.4587735"},{"key":"ref20","article-title":"Hierarchical spatio-temporal context modeling for action recognition","author":"sun","year":"2009","journal-title":"Proc of CVPR 2004&#x2013;2011"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.5244\/C.24.8"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2009.5459154"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2007.09.014"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1016\/0306-4573(88)90021-0"},{"key":"ref26","first-page":"593","article-title":"Good features to track","author":"shi","year":"1994","journal-title":"IEEE Conference on Computer Vision and Pattern Recognition (CVPR)"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1162\/089976601750264965"}],"event":{"name":"2011 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops (CVPR Workshops)","location":"Colorado Springs, CO, USA","start":{"date-parts":[[2011,6,20]]},"end":{"date-parts":[[2011,6,25]]}},"container-title":["CVPR 2011 WORKSHOPS"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/5966640\/5981671\/05981713.pdf?arnumber=5981713","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,3]],"date-time":"2025-09-03T17:50:55Z","timestamp":1756921855000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/5981713\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2011,6]]},"references-count":27,"URL":"https:\/\/doi.org\/10.1109\/cvprw.2011.5981713","relation":{},"subject":[],"published":{"date-parts":[[2011,6]]}}}