{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T18:22:25Z","timestamp":1784658145731,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":71,"publisher":"ACM","license":[{"start":{"date-parts":[[2023,10,26]],"date-time":"2023-10-26T00:00:00Z","timestamp":1698278400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2023,10,26]]},"DOI":"10.1145\/3581783.3611842","type":"proceedings-article","created":{"date-parts":[[2023,10,27]],"date-time":"2023-10-27T07:27:12Z","timestamp":1698391632000},"page":"5474-5483","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":5,"title":["Diffused Fourier Network for Video Action Segmentation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-8666-7178","authenticated-orcid":false,"given":"Borui","family":"Jiang","sequence":"first","affiliation":[{"name":"Peking University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7815-3750","authenticated-orcid":false,"given":"Yadong","family":"MU","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2023,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Refining Action Segmentation with Hierarchical Video Representations. In 2021 IEEE\/CVF International Conference on Computer Vision. IEEE, 16282--16290","author":"Ahn Hyemin","year":"2021","unstructured":"Hyemin Ahn and Dongheui Lee. 2021. Refining Action Segmentation with Hierarchical Video Representations. In 2021 IEEE\/CVF International Conference on Computer Vision. IEEE, 16282--16290."},{"key":"e_1_3_2_1_2_1","volume-title":"SegDiff: Image Segmentation with Diffusion Probabilistic Models. CoRR abs\/2112.00390","author":"Amit Tomer","year":"2021","unstructured":"Tomer Amit, Eliya Nachmani, Tal Shaharabany, and Lior Wolf. 2021. SegDiff: Image Segmentation with Diffusion Probabilistic Models. CoRR abs\/2112.00390 (2021)."},{"key":"e_1_3_2_1_3_1","volume-title":"Proceedings of the 33nd International Conference on Machine Learning (JMLR Workshop and Conference Proceedings","volume":"1128","author":"Arjovsky Mart\u00edn","year":"2016","unstructured":"Mart\u00edn Arjovsky, Amar Shah, and Yoshua Bengio. 2016. Unitary Evolution Recurrent Neural Networks. In Proceedings of the 33nd International Conference on Machine Learning (JMLR Workshop and Conference Proceedings, Vol. 48), Maria-Florina Balcan and Kilian Q. Weinberger (Eds.). JMLR.org, 1120--1128."},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19833-5_4"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/34.868685"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.502"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2699184"},{"key":"e_1_3_2_1_8_1","volume-title":"DiffusionDet: Diffusion Model for Object Detection. CoRR abs\/2211.09788","author":"Chen Shoufa","year":"2022","unstructured":"Shoufa Chen, Peize Sun, Yibing Song, and Ping Luo. 2022. DiffusionDet: Diffusion Model for Object Detection. CoRR abs\/2211.09788 (2022)."},{"key":"e_1_3_2_1_9_1","volume-title":"Fleet","author":"Chen Ting","year":"2022","unstructured":"Ting Chen, Lala Li, Saurabh Saxena, Geoffrey E. Hinton, and David J. Fleet. 2022. A Generalist Framework for Panoptic Segmentation of Images and Videos. CoRR abs\/2210.06366 (2022)."},{"key":"e_1_3_2_1_10_1","volume-title":"Fast Fourier Convolution. In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems","volume":"33","author":"Chi Lu","year":"2020","unstructured":"Lu Chi, Borui Jiang, and Yadong Mu. 2020. Fast Fourier Convolution. In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020, Hugo Larochelle, Marc'Aurelio Ranzato, Raia Hadsell, Maria-Florina Balcan, and Hsuan-Tien Lin (Eds.), Vol. 33. 4479--4488."},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2000.868676"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.1993.341109"},{"key":"e_1_3_2_1_13_1","volume-title":"9th International Conference on Learning Representations. OpenReview.net.","author":"Dosovitskiy Alexey","year":"2021","unstructured":"Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. In 9th International Conference on Learning Representations. OpenReview.net."},{"key":"e_1_3_2_1_14_1","volume-title":"Do we really need temporal convolutions in action segmentation. arXiv preprint arXiv:2205.13425 2","author":"Du Dazhao","year":"2022","unstructured":"Dazhao Du, Bing Su, Yu Li, Zhongang Qi, Lingyu Si, and Ying Shan. 2022. Do we really need temporal convolutions in action segmentation. arXiv preprint arXiv:2205.13425 2 (2022), 13."},{"key":"e_1_3_2_1_15_1","volume-title":"MS-TCN: Multi-Stage Temporal Convolutional Network for Action Segmentation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019","author":"Farha Yazan Abu","year":"2019","unstructured":"Yazan Abu Farha and J\u00fcrgen Gall. 2019. MS-TCN: Multi-Stage Temporal Convolutional Network for Action Segmentation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019, Long Beach, CA, USA, June 16--20, 2019. Computer Vision Foundation \/ IEEE, 3575--3584."},{"key":"e_1_3_2_1_16_1","volume-title":"IEEE Conference on Computer Vision and Pattern Recognition. 3281--3288","author":"Fathi Alireza","unstructured":"Alireza Fathi, Xiaofeng Ren, and James M. Rehg. 2011. Learning to recognize objects in egocentric activities. In IEEE Conference on Computer Vision and Pattern Recognition. 3281--3288."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01653"},{"key":"e_1_3_2_1_18_1","volume-title":"Stacked Spatio-Temporal Graph Convolutional Networks for Action Segmentation. In IEEE Winter Conference on Applications of Computer Vision. IEEE, 565--574","author":"Ghosh Pallabi","year":"2020","unstructured":"Pallabi Ghosh, Yi Yao, Larry S. Davis, and Ajay Divakaran. 2020. Stacked Spatio-Temporal Graph Convolutional Networks for Action Segmentation. In IEEE Winter Conference on Applications of Computer Vision. IEEE, 565--574."},{"key":"e_1_3_2_1_19_1","volume-title":"DiffusionInst: Diffusion Model for Instance Segmentation. CoRR abs\/2212.02773","author":"Gu Zhangxuan","year":"2022","unstructured":"Zhangxuan Gu, Haoxing Chen, Zhuoer Xu, Jun Lan, Changhua Meng, and Weiqiang Wang. 2022. DiffusionInst: Diffusion Model for Instance Segmentation. CoRR abs\/2212.02773 (2022)."},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2015.2477242"},{"key":"e_1_3_2_1_21_1","volume-title":"Deep Residual Learning for Image Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 770--778","author":"He Kaiming","year":"2016","unstructured":"Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 770--778."},{"key":"e_1_3_2_1_22_1","volume-title":"Gaussian error linear units (gelus). arXiv preprint arXiv:1606.08415","author":"Hendrycks Dan","year":"2016","unstructured":"Dan Hendrycks and Kevin Gimpel. 2016. Gaussian error linear units (gelus). arXiv preprint arXiv:1606.08415 (2016)."},{"key":"e_1_3_2_1_23_1","volume-title":"Denoising Diffusion Probabilistic Models. In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems","author":"Ho Jonathan","year":"2020","unstructured":"Jonathan Ho, Ajay Jain, and Pieter Abbeel. 2020. Denoising Diffusion Probabilistic Models. In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020, Hugo Larochelle, Marc'Aurelio Ranzato, Raia Hadsell, Maria-Florina Balcan, and Hsuan-Tien Lin (Eds.)."},{"key":"e_1_3_2_1_24_1","article-title":"Cascaded Diffusion Models for High Fidelity Image Generation","volume":"23","author":"Ho Jonathan","year":"2022","unstructured":"Jonathan Ho, Chitwan Saharia, William Chan, David J. Fleet, Mohammad Norouzi, and Tim Salimans. 2022. Cascaded Diffusion Models for High Fidelity Image Generation. J. Mach. Learn. Res. 23 (2022), 47:1--47:33.","journal-title":"J. Mach. Learn. Res."},{"key":"e_1_3_2_1_25_1","volume-title":"Fleet","author":"Ho Jonathan","year":"2022","unstructured":"Jonathan Ho, Tim Salimans, Alexey A. Gritsenko, William Chan, Mohammad Norouzi, and David J. Fleet. 2022. Video Diffusion Models. CoRR abs\/2204.03458 (2022)."},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01404"},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00237"},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2003.1184347"},{"key":"e_1_3_2_1_29_1","volume-title":"An introduction to harmonic analysis","author":"Katznelson Yitzhak","unstructured":"Yitzhak Katznelson. 2004. An introduction to harmonic analysis. Cambridge University Press."},{"key":"e_1_3_2_1_30_1","volume-title":"Adam: A Method for Stochastic Optimization. In 3rd International Conference on Learning Representations, Yoshua Bengio and Yann LeCun (Eds.).","author":"Diederik","unstructured":"Diederik P. Kingma and Jimmy Ba. 2015. Adam: A Method for Stochastic Optimization. In 3rd International Conference on Learning Representations, Yoshua Bengio and Yann LeCun (Eds.)."},{"key":"e_1_3_2_1_31_1","volume-title":"The Language of Actions: Recovering the Syntax and Semantics of Goal-Directed Human Activities. In IEEE Conference on Computer Vision and Pattern Recognition. 780--787","author":"Kuehne Hilde","year":"2014","unstructured":"Hilde Kuehne, Ali Bilgin Arslan, and Thomas Serre. 2014. The Language of Actions: Recovering the Syntax and Semantics of Goal-Directed Human Activities. In IEEE Conference on Computer Vision and Pattern Recognition. 780--787."},{"key":"e_1_3_2_1_32_1","volume-title":"Temporal Convolutional Networks for Action Segmentation and Detection. In IEEE Conference on Computer Vision and Pattern Recognition. 1003--1012","author":"Lea Colin","unstructured":"Colin Lea, Michael D. Flynn, Ren\u00e9 Vidal, Austin Reiter, and Gregory D. Hager. 2017. Temporal Convolutional Networks for Action Segmentation and Detection. In IEEE Conference on Computer Vision and Pattern Recognition. 1003--1012."},{"key":"e_1_3_2_1_33_1","volume-title":"Segmental Spa-tiotemporal CNNs for Fine-Grained Action Segmentation. In European Conference on Computer Vision","volume":"9907","author":"Lea Colin","unstructured":"Colin Lea, Austin Reiter, Ren\u00e9 Vidal, and Gregory D. Hager. 2016. Segmental Spa-tiotemporal CNNs for Fine-Grained Action Segmentation. In European Conference on Computer Vision, Vol. 9907. 36--52."},{"key":"e_1_3_2_1_34_1","volume-title":"Proceedings of the 2022 Conference of the North American","author":"Lee-Thorp James","unstructured":"James Lee-Thorp, Joshua Ainslie, Ilya Eckstein, and Santiago Onta\u00f1\u00f3n. 2022. FNet: Mixing Tokens with Fourier Transforms. In Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Marine Carpuat, Marie-Catherine de Marneffe, and Iv\u00e1n Vladimir Meza Ru\u00edz (Eds.). Association for Computational Linguistics, 4296--4313."},{"key":"e_1_3_2_1_35_1","volume-title":"Temporal Deformable Residual Networks for Action Segmentation in Videos. In IEEE Conference on Computer Vision and Pattern Recognition. 6742--6751","author":"Lei Peng","year":"2018","unstructured":"Peng Lei and Sinisa Todorovic. 2018. Temporal Deformable Residual Networks for Action Segmentation in Videos. In IEEE Conference on Computer Vision and Pattern Recognition. 6742--6751."},{"key":"e_1_3_2_1_36_1","volume-title":"Bridge-Prompt: Towards Ordinal Action Understanding in Instructional Videos. CoRR abs\/2203.14104","author":"Li Muheng","year":"2022","unstructured":"Muheng Li, Lei Chen, Yueqi Duan, Zhilan Hu, Jianjiang Feng, Jie Zhou, and Jiwen Lu. 2022. Bridge-Prompt: Towards Ordinal Action Understanding in Instructional Videos. CoRR abs\/2203.14104 (2022)."},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.3021756"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2021.04.121"},{"key":"e_1_3_2_1_39_1","first-page":"12934","article-title":"Efficientformer: Vision transformers at mobilenet speed","volume":"35","author":"Li Yanyu","year":"2022","unstructured":"Yanyu Li, Geng Yuan, Yang Wen, Ju Hu, Georgios Evangelidis, Sergey Tulyakov, Yanzhi Wang, and Jian Ren. 2022. Efficientformer: Vision transformers at mobilenet speed. Advances in Neural Information Processing Systems 35 (2022), 12934--12949.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"publisher","DOI":"10.1007\/11744085_28"},{"key":"e_1_3_2_1_42_1","volume-title":"Proceedings of the Royal Society of London. Series B, Biological Sciences 214","author":"Marr D.","year":"1982","unstructured":"D. Marr and Lucia Vaina. 1982. Representation and Recognition of the Movements of Shapes. Proceedings of the Royal Society of London. Series B, Biological Sciences 214, 1197 (1982), 501--524."},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2010-343"},{"key":"e_1_3_2_1_44_1","volume-title":"Latent-Dynamic Discriminative Models for Continuous Gesture Recognition. In 2007 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR 2007)","author":"Morency Louis-Philippe","year":"2007","unstructured":"Louis-Philippe Morency, Ariadna Quattoni, and Trevor Darrell. 2007. Latent-Dynamic Discriminative Models for Continuous Gesture Recognition. In 2007 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR 2007), 18-23 June 2007, Minneapolis, Minnesota, USA. IEEE Computer Society."},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2022.108764"},{"key":"e_1_3_2_1_46_1","unstructured":"Adam Paszke Sam Gross Soumith Chintala Gregory Chanan Edward Yang Zachary DeVito Zeming Lin Alban Desmaison Luca Antiga and Adam Lerer. 2017. Automatic differentiation in PyTorch. (2017)."},{"key":"e_1_3_2_1_47_1","volume-title":"Proceedings of the 35th International Conference on Machine Learning, Jennifer G. Dy and Andreas Krause (Eds.). 4168--4176","author":"Qi Siyuan","year":"2018","unstructured":"Siyuan Qi, Baoxiong Jia, and Song-Chun Zhu. 2018. Generalized Earley Parser: Bridging Symbolic Grammars and Sequence Data for Future Prediction. In Proceedings of the 35th International Conference on Machine Learning, Jennifer G. Dy and Andreas Krause (Eds.). 4168--4176."},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"publisher","DOI":"10.1109\/5.18626"},{"key":"e_1_3_2_1_49_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"e_1_3_2_1_50_1","volume-title":"Segmenting Visual Actions Based on Spatio-Temporal Motion Patterns. In IEEE Conference on Computer Vision and Pattern Recognition. IEEE Computer Society, 1111--1118","author":"Rui Yong","unstructured":"Yong Rui and P. Anandan. 2000. Segmenting Visual Actions Based on Spatio-Temporal Motion Patterns. In IEEE Conference on Computer Vision and Pattern Recognition. IEEE Computer Society, 1111--1118."},{"key":"e_1_3_2_1_51_1","volume-title":"Burcu Karagol Ayan, S. Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J. Fleet, and Mohammad Norouzi.","author":"Saharia Chitwan","year":"2022","unstructured":"Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily Denton, Seyed Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, S. Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J. Fleet, and Mohammad Norouzi. 2022. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding. CoRR abs\/2205.11487 (2022)."},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3204461"},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2014-80"},{"key":"e_1_3_2_1_54_1","volume-title":"Coarse to Fine Multi-Resolution Temporal Convolutional Network. CoRR abs\/2105.10859","author":"Singhania Dipika","year":"2021","unstructured":"Dipika Singhania, Rahul Rahaman, and Angela Yao. 2021. Coarse to Fine Multi-Resolution Temporal Convolutional Network. CoRR abs\/2105.10859 (2021)."},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2006.07.014"},{"key":"e_1_3_2_1_56_1","volume-title":"Denoising Diffusion Implicit Models. In 9th International Conference on Learning Representations. OpenReview.net.","author":"Song Jiaming","year":"2021","unstructured":"Jiaming Song, Chenlin Meng, and Stefano Ermon. 2021. Denoising Diffusion Implicit Models. In 9th International Conference on Learning Representations. OpenReview.net."},{"key":"e_1_3_2_1_57_1","volume-title":"Advances in Neural Information Processing Systems 32: Annual Conference on Neural Information Processing Systems 2019","author":"Song Yang","year":"2019","unstructured":"Yang Song and Stefano Ermon. 2019. Generative Modeling by Estimating Gradients of the Data Distribution. In Advances in Neural Information Processing Systems 32: Annual Conference on Neural Information Processing Systems 2019, Hanna M. Wallach, Hugo Larochelle, Alina Beygelzimer, Florence d'Alch\u00e9-Buc, Emily B. Fox, and Roman Garnett (Eds.). 11895--11907."},{"key":"e_1_3_2_1_58_1","volume-title":"ACM International Joint Conference on Pervasive and Ubiquitous Computing. 729--738","author":"Stein Sebastian","unstructured":"Sebastian Stein and Stephen J. McKenna. 2013. Combining embedded accelerometers with computer vision for recognizing food preparation activities. In ACM International Joint Conference on Pervasive and Ubiquitous Computing. 729--738."},{"key":"e_1_3_2_1_59_1","doi-asserted-by":"publisher","DOI":"10.1561\/2200000013"},{"key":"e_1_3_2_1_60_1","volume-title":"Lempitsky","author":"Ulyanov Dmitry","year":"2016","unstructured":"Dmitry Ulyanov, Andrea Vedaldi, and Victor S. Lempitsky. 2016. Instance Nor- malization: The Missing Ingredient for Fast Stylization. CoRR abs\/1607.08022 (2016). arXiv:1607.08022 http:\/\/arxiv.org\/abs\/1607.08022"},{"key":"e_1_3_2_1_61_1","volume-title":"2014 IEEE Conference on Computer Vision and Pattern Recognition. IEEE Computer Society.","author":"Nam","unstructured":"Nam N. Vo and Aaron F. Bobick. 2014. From Stochastic Grammar to Bayes Network: Probabilistic Parsing of Complex Activity. In 2014 IEEE Conference on Computer Vision and Pattern Recognition. IEEE Computer Society."},{"key":"e_1_3_2_1_62_1","volume-title":"Cross-Enhancement Transformer for Action Segmentation. CoRR abs\/2205.09445","author":"Wang Jiahui","year":"2022","unstructured":"Jiahui Wang, Zhenyou Wang, Shanna Zhuang, and Hui Wang. 2022. Cross-Enhancement Transformer for Action Segmentation. CoRR abs\/2205.09445 (2022)."},{"key":"e_1_3_2_1_63_1","volume-title":"Boundary-Aware Cascade Networks for Temporal Action Segmentation. In European Conference on Computer Vision","volume":"12370","author":"Wang Zhenzhi","year":"2020","unstructured":"Zhenzhi Wang, Ziteng Gao, Limin Wang, Zhifeng Li, and Gangshan Wu. 2020. Boundary-Aware Cascade Networks for Temporal Action Segmentation. In European Conference on Computer Vision, Vol. 12370. 34--51."},{"key":"e_1_3_2_1_64_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2010.10.002"},{"key":"e_1_3_2_1_65_1","volume-title":"TimesNet: Temporal 2D-Variation Modeling for General Time Series Analysis. CoRR abs\/2210.02186","author":"Wu Haixu","year":"2022","unstructured":"Haixu Wu, Tengge Hu, Yong Liu, Hang Zhou, Jianmin Wang, and Mingsheng Long. 2022. TimesNet: Temporal 2D-Variation Modeling for General Time Series Analysis. CoRR abs\/2210.02186 (2022)."},{"key":"e_1_3_2_1_66_1","unstructured":"Haixu Wu Jiehui Xu Jianmin Wang and Mingsheng Long. 2021. Autoformer: Decomposition Transformers with Auto-Correlation for Long-Term Series Forecasting. In Advances in Neural Information Processing Systems 34: Annual Conference on Neural Information Processing Systems 2021 Marc'Aurelio Ranzato Alina Beygelzimer Yann N. Dauphin Percy Liang and Jennifer Wortman Vaughan (Eds.). 22419--22430."},{"key":"e_1_3_2_1_67_1","volume-title":"ASFormer: Transformer for Action Segmentation. CoRR abs\/2110.08568","author":"Yi Fangqiu","year":"2021","unstructured":"Fangqiu Yi, Hongyu Wen, and Tingting Jiang. 2021. ASFormer: Transformer for Action Segmentation. CoRR abs\/2110.08568 (2021)."},{"key":"e_1_3_2_1_68_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01055"},{"key":"e_1_3_2_1_69_1","volume-title":"Event-Based Analysis of Video. In IEEE Conference on Computer Vision and Pattern Recognition. IEEE Computer Society, 123--130","author":"Zelnik-Manor Lihi","year":"2001","unstructured":"Lihi Zelnik-Manor and Michal Irani. 2001. Event-Based Analysis of Video. In IEEE Conference on Computer Vision and Pattern Recognition. IEEE Computer Society, 123--130."},{"key":"e_1_3_2_1_70_1","volume-title":"Semantic2Graph: Graph-based Multi-modal Feature for Action Segmentation in Videos. CoRR abs\/2209.05653","author":"Zhang Junbin","year":"2022","unstructured":"Junbin Zhang, Pei-Hsuan Tsai, and Meng-Hsun Tsai. 2022. Semantic2Graph: Graph-based Multi-modal Feature for Action Segmentation in Videos. CoRR abs\/2209.05653 (2022)."},{"key":"e_1_3_2_1_71_1","volume-title":"Klindt","author":"Zimmermann Roland S.","year":"2021","unstructured":"Roland S. Zimmermann, Lukas Schott, Yang Song, Benjamin A. Dunn, and David A. Klindt. 2021. Score-Based Generative Classifiers. CoRR abs\/2110.00473 (2021)."}],"event":{"name":"MM '23: The 31st ACM International Conference on Multimedia","location":"Ottawa ON Canada","acronym":"MM '23","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 31st ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3611842","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3581783.3611842","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,21]],"date-time":"2025-08-21T23:57:16Z","timestamp":1755820636000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3611842"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,26]]},"references-count":71,"alternative-id":["10.1145\/3581783.3611842","10.1145\/3581783"],"URL":"https:\/\/doi.org\/10.1145\/3581783.3611842","relation":{},"subject":[],"published":{"date-parts":[[2023,10,26]]},"assertion":[{"value":"2023-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}