{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,30]],"date-time":"2024-10-30T00:10:28Z","timestamp":1730247028427,"version":"3.28.0"},"reference-count":23,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,10,27]],"date-time":"2024-10-27T00:00:00Z","timestamp":1729987200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,10,27]],"date-time":"2024-10-27T00:00:00Z","timestamp":1729987200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,10,27]]},"DOI":"10.1109\/icip51287.2024.10647484","type":"proceedings-article","created":{"date-parts":[[2024,9,27]],"date-time":"2024-09-27T18:34:45Z","timestamp":1727462085000},"page":"2473-2479","source":"Crossref","is-referenced-by-count":0,"title":["Learning Temporal Cues for Fine-Grained Action Recognition"],"prefix":"10.1109","author":[{"given":"Zhihao","family":"Liu","sequence":"first","affiliation":[{"name":"China Mobile Research Institute"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yi","family":"Zhang","sequence":"additional","affiliation":[{"name":"China Mobile Research Institute"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wenhui","family":"Huang","sequence":"additional","affiliation":[{"name":"China Mobile Research Institute"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yan","family":"Liu","sequence":"additional","affiliation":[{"name":"China Mobile Research Institute"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mengyang","family":"Pu","sequence":"additional","affiliation":[{"name":"North China Electric Power University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chao","family":"Deng","sequence":"additional","affiliation":[{"name":"China Mobile Research Institute"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junlan","family":"Feng","sequence":"additional","affiliation":[{"name":"China Mobile Research Institute"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00298"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1038\/s41467-021-25420-x"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01267-0_19"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00446"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19772-7_23"},{"article-title":"Aim: Adapting image models for efficient video action recognition","volume-title":"Int. Conf. Learn. Represent.","author":"Yang","key":"ref6"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00219"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00037"},{"key":"ref9","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Int. Conf. Mach. Learn. PMLR","author":"Radford"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00146"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01231-1_32"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01432"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00269"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2102.05095"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00320"},{"key":"ref16","first-page":"35946","article-title":"Masked autoencoders as spatiotemporal learners","volume":"35","author":"Feichtenhofer","year":"2022","journal-title":"Adv. Neural Inform. Process. Syst."},{"article-title":"Can an image classifier suffice for action recognition?","volume-title":"Int. Conf. Learn. Represent.","author":"Fan","key":"ref17"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00315"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00718"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2019.00561"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01282"},{"key":"ref22","article-title":"Combined cnn transformer encoder for enhanced fine-grained human action recognition","author":"Leong","year":"2022","journal-title":"arXiv preprint arXiv:2208.01897"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TIT.1967.1053964"}],"event":{"name":"2024 IEEE International Conference on Image Processing (ICIP)","start":{"date-parts":[[2024,10,27]]},"location":"Abu Dhabi, United Arab Emirates","end":{"date-parts":[[2024,10,30]]}},"container-title":["2024 IEEE International Conference on Image Processing (ICIP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10647221\/10647122\/10647484.pdf?arnumber=10647484","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,28]],"date-time":"2024-09-28T05:46:37Z","timestamp":1727502397000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10647484\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,27]]},"references-count":23,"URL":"https:\/\/doi.org\/10.1109\/icip51287.2024.10647484","relation":{},"subject":[],"published":{"date-parts":[[2024,10,27]]}}}