{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,29]],"date-time":"2026-05-29T11:28:41Z","timestamp":1780054121855,"version":"3.54.0"},"reference-count":39,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,6,30]],"date-time":"2024-06-30T00:00:00Z","timestamp":1719705600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,6,30]],"date-time":"2024-06-30T00:00:00Z","timestamp":1719705600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,6,30]]},"DOI":"10.1109\/ijcnn60899.2024.10650436","type":"proceedings-article","created":{"date-parts":[[2024,9,9]],"date-time":"2024-09-09T17:35:05Z","timestamp":1725903305000},"page":"1-8","source":"Crossref","is-referenced-by-count":2,"title":["DTA: Deformable Temporal Attention for Video Recognition"],"prefix":"10.1109","author":[{"given":"Xiaohan","family":"Lei","sequence":"first","affiliation":[{"name":"Beijing University of Posts and Telecommunications,State Key Laboratory of Networking and Switching Technology,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mengyu","family":"Yang","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications,State Key Laboratory of Networking and Switching Technology,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gongli","family":"Xi","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications,State Key Laboratory of Networking and Switching Technology,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yang","family":"Liu","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications,State Key Laboratory of Networking and Switching Technology,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiulin","family":"Li","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications,State Key Laboratory of Networking and Switching Technology,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lanshan","family":"Zhang","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications,Beijing Key Laboratory of Network System and Network Culture,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ye","family":"Tian","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications,State Key Laboratory of Networking and Switching Technology,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.73"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00676"},{"key":"ref3","article-title":"Neural machine translation by jointly learning to align and translate","author":"Bahdanau","year":"2014"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2102.05095"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.502"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICICML60161.2023.10424753"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475467"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2017.89"},{"key":"ref9","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2021","journal-title":"ICLR"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00675"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00630"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.622"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref14","article-title":"Mobilenets: Efficient convolutional neural networks for mobile vision applications","author":"Howard","year":"2017"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN54540.2023.10191650"},{"key":"ref16","article-title":"Supervised contrastive learning with hard negative samples","author":"Jiang","year":"2022"},{"key":"ref17","first-page":"97","article-title":"A fuzzy error based fine-tune method for spatio-temporal recognition model","volume-title":"Chinese Conference on Pattern Recognition and Computer Vision (PRCV)","author":"Li"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3282631"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN54540.2023.10191544"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.00320"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19833-5_10"},{"key":"ref23","article-title":"Keeping your eye on the ball: Trajectory attention in video transformers","author":"Patrick","year":"2021","journal-title":"Neural Information Processing Systems"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6872"},{"key":"ref25","article-title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","author":"Soomro","year":"2012"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.5555\/3298023.3298188"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612035"},{"key":"ref28","article-title":"C3d: Generic features for video analysis","author":"Tran","year":"2014"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2019.00565"},{"key":"ref30","article-title":"Attention is all you need","author":"Vaswani","year":"2017"},{"key":"ref31","first-page":"69","article-title":"Efficient Video Transformers with Spatial-Temporal Token Selection","author":"Wang","year":"2022"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"ref33","article-title":"Video mobile-former: Video recognition with efficient global spatial-temporal modeling","author":"Wang","year":"2022"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00475"},{"key":"ref35","article-title":"Dat++: Spatially dynamic vision transformer with deformable attention","author":"Xia","year":"2023"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00676"},{"key":"ref37","first-page":"831","article-title":"Temporal Relational Reasoning in Videos","author":"Zhou","year":"2018"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.00953"},{"key":"ref39","article-title":"Deformable detr: Deformable transformers for end-to-end object detection","author":"Zhu","year":"2020"}],"event":{"name":"2024 International Joint Conference on Neural Networks (IJCNN)","location":"Yokohama, Japan","start":{"date-parts":[[2024,6,30]]},"end":{"date-parts":[[2024,7,5]]}},"container-title":["2024 International Joint Conference on Neural Networks (IJCNN)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10649807\/10649898\/10650436.pdf?arnumber=10650436","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,10]],"date-time":"2024-09-10T04:33:02Z","timestamp":1725942782000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10650436\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,6,30]]},"references-count":39,"URL":"https:\/\/doi.org\/10.1109\/ijcnn60899.2024.10650436","relation":{},"subject":[],"published":{"date-parts":[[2024,6,30]]}}}