{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,19]],"date-time":"2025-11-19T17:17:46Z","timestamp":1763572666220},"reference-count":34,"publisher":"IEEE","license":[{"start":{"date-parts":[[2022,9,26]],"date-time":"2022-09-26T00:00:00Z","timestamp":1664150400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2022,9,26]],"date-time":"2022-09-26T00:00:00Z","timestamp":1664150400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022,9,26]]},"DOI":"10.1109\/mmsp55362.2022.9948888","type":"proceedings-article","created":{"date-parts":[[2022,11,22]],"date-time":"2022-11-22T21:39:16Z","timestamp":1669153156000},"page":"1-6","source":"Crossref","is-referenced-by-count":7,"title":["SpotFormer: A Transformer-based Framework for Precise Soccer Action Spotting"],"prefix":"10.1109","author":[{"given":"Mengqi","family":"Cao","sequence":"first","affiliation":[{"name":"Nanjing University,State Key Laboratory for Novel Software Technology,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Min","family":"Yang","sequence":"additional","affiliation":[{"name":"Nanjing University,State Key Laboratory for Novel Software Technology,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Guozhen","family":"Zhang","sequence":"additional","affiliation":[{"name":"Nanjing University,State Key Laboratory for Novel Software Technology,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaotian","family":"Li","sequence":"additional","affiliation":[{"name":"Nanjing University,State Key Laboratory for Novel Software Technology,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yilu","family":"Wu","sequence":"additional","affiliation":[{"name":"Nanjing University,State Key Laboratory for Novel Software Technology,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gangshan","family":"Wu","sequence":"additional","affiliation":[{"name":"Nanjing University,State Key Laboratory for Novel Software Technology,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Limin","family":"Wang","sequence":"additional","affiliation":[{"name":"Nanjing University,State Key Laboratory for Novel Software Technology,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref33","first-page":"20","article-title":"Temporal segment networks: Towards good practices for deep action recognition","author":"wang","year":"0","journal-title":"European Conference on Computer Vision"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00193"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01328"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW50498.2020.00456"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00033"},{"key":"ref11","article-title":"End-to-end temporal action detection with transformer","author":"liu","year":"2021","journal-title":"ArXiv Preprint"},{"key":"ref12","first-page":"32","article-title":"Stand-alone self-attention in vision models","author":"ramachandran","year":"0","journal-title":"Advances in neural information processing systems"},{"key":"ref13","article-title":"An image is worth 16&#x00D7;16 words: Transformers for image recognition at scale","author":"dosovitskiy","year":"2020","journal-title":"ArXiv Preprint"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01625"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/2964284.2964286"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2010.03.009"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.337"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.593"},{"key":"ref4","first-page":"30","article-title":"Attention is all you need","author":"vaswani","year":"0","journal-title":"Advances in neural information processing systems"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"ref3","article-title":"Feature Combination Meets Attention: Baidu Soccer Embeddings and Transformer based Temporal Detection","author":"zhou","year":"2021","journal-title":"ArXiv Preprint"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.572"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP46576.2022.9897256"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5540039"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR48806.2021.9412268"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW53098.2021.00506"},{"key":"ref2","article-title":"SoccerNet-v2: A Dataset and Benchmarks for Holistic Understanding of Broadcast Soccer Videos","author":"deli\u00e8ge","year":"2020","journal-title":"ArXiv Preprint"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01314"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2018.00223"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00067"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW54120.2021.00355"},{"key":"ref21","article-title":"Gta: Global temporal attention for video action understanding","author":"he","year":"2020","journal-title":"ArXiv Preprint"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00630"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00565"},{"key":"ref26","article-title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pretraining","author":"tong","year":"2022","journal-title":"ArXiv Preprint"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00320"}],"event":{"name":"2022 IEEE 24th International Workshop on Multimedia Signal Processing (MMSP)","start":{"date-parts":[[2022,9,26]]},"location":"Shanghai, China","end":{"date-parts":[[2022,9,28]]}},"container-title":["2022 IEEE 24th International Workshop on Multimedia Signal Processing (MMSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9948698\/9948704\/09948888.pdf?arnumber=9948888","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,12]],"date-time":"2022-12-12T19:54:44Z","timestamp":1670874884000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9948888\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,9,26]]},"references-count":34,"URL":"https:\/\/doi.org\/10.1109\/mmsp55362.2022.9948888","relation":{},"subject":[],"published":{"date-parts":[[2022,9,26]]}}}