{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,24]],"date-time":"2026-01-24T02:36:55Z","timestamp":1769222215859,"version":"3.49.0"},"publisher-location":"New York, NY, USA","reference-count":53,"publisher":"ACM","funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62272227"],"award-info":[{"award-number":["62272227"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,12,9]]},"DOI":"10.1145\/3769748.3773341","type":"proceedings-article","created":{"date-parts":[[2025,12,8]],"date-time":"2025-12-08T10:33:15Z","timestamp":1765189995000},"page":"1-8","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Point Long-Term Locality-Aware Transformer for Point Cloud Video Understanding"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-5518-6275","authenticated-orcid":false,"given":"Zhi","family":"Zuo","sequence":"first","affiliation":[{"name":"College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4492-5430","authenticated-orcid":false,"given":"Pan","family":"Gao","sequence":"additional","affiliation":[{"name":"College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6870-5056","authenticated-orcid":false,"given":"Manoranjan","family":"Paul","sequence":"additional","affiliation":[{"name":"Charles Sturt University, Bathurst, NSW, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,12,8]]},"reference":[{"key":"e_1_3_3_1_2_2","unstructured":"Jimmy\u00a0Lei Ba Jamie\u00a0Ryan Kiros and Geoffrey\u00a0E Hinton. 2016. Layer normalization. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/1607.06450 (2016)."},{"key":"e_1_3_3_1_3_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00939"},{"key":"e_1_3_3_1_4_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01888"},{"key":"e_1_3_3_1_5_2","doi-asserted-by":"publisher","DOI":"10.1111\/cgf.12802"},{"key":"e_1_3_3_1_6_2","unstructured":"Gedas Bertasius Heng Wang and Lorenzo Torresani. 2021. Is Space-Time Attention All You Need for Video Understanding? (2021)."},{"key":"e_1_3_3_1_7_2","unstructured":"Angel\u00a0X Chang Thomas Funkhouser Leonidas Guibas Pat Hanrahan Qixing Huang Zimo Li Silvio Savarese Manolis Savva Shuran Song Hao Su et\u00a0al. 2015. Shapenet: An information-rich 3d model repository. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/1512.03012 (2015)."},{"key":"e_1_3_3_1_8_2","doi-asserted-by":"publisher","unstructured":"Jiazhong Chen Furui Liu Dakai Ren Lu Guo and Ziyi Liu. 2024. Point Cloud Completion via Relative Point Position Encoding and Regional Attention. IEEE Transactions on Emerging Topics in Computational Intelligence 8 6 (2024) 3807\u20133820. 10.1109\/TETCI.2024.3375614","DOI":"10.1109\/TETCI.2024.3375614"},{"key":"e_1_3_3_1_9_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.691"},{"key":"e_1_3_3_1_10_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00319"},{"key":"e_1_3_3_1_11_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.261"},{"key":"e_1_3_3_1_12_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01249-6_28"},{"key":"e_1_3_3_1_13_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i21.30434"},{"key":"e_1_3_3_1_14_2","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly et\u00a0al. 2020. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2010.11929 (2020)."},{"key":"e_1_3_3_1_15_2","unstructured":"Hehe Fan and Yi Yang. 2019. PointRNN: Point recurrent neural network for moving point cloud processing. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/1910.08287 (2019)."},{"key":"e_1_3_3_1_16_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01398"},{"key":"e_1_3_3_1_17_2","doi-asserted-by":"crossref","unstructured":"Hehe Fan Yi Yang and Mohan Kankanhalli. 2022. Point spatio-temporal transformer networks for point cloud video modeling. IEEE Transactions on Pattern Analysis and Machine Intelligence 45 2 (2022) 2181\u20132192.","DOI":"10.1109\/TPAMI.2022.3161735"},{"key":"e_1_3_3_1_18_2","volume-title":"International Conference on Learning Representations","author":"Fan Hehe","year":"2021","unstructured":"Hehe Fan, Xin Yu, Yuhang Ding, Yi Yang, and Mohan Kankanhalli. 2021. PSTNet: Point Spatio-Temporal Convolution on Point Cloud Sequences. In International Conference on Learning Representations."},{"key":"e_1_3_3_1_19_2","doi-asserted-by":"crossref","unstructured":"Hehe Fan Xin Yu Yi Yang and Mohan Kankanhalli. 2021. Deep hierarchical representation of point cloud videos via spatio-temporal decomposition. IEEE Transactions on Pattern Analysis and Machine Intelligence 44 12 (2021) 9918\u20139930.","DOI":"10.1109\/TPAMI.2021.3135117"},{"key":"e_1_3_3_1_20_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00961"},{"key":"e_1_3_3_1_21_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"e_1_3_3_1_22_2","doi-asserted-by":"crossref","unstructured":"Pan He Patrick Emami S. Ranka and A. Rangarajan. 2021. Learning Scene Dynamics from Point Cloud Sequences. International Journal of Computer Vision 130 (2021) 669 \u2013 695.","DOI":"10.1007\/s11263-021-01551-y"},{"key":"e_1_3_3_1_23_2","unstructured":"Qingyong Hu Bo Yang Linhai Xie Stefano Rosa Yulan Guo Zhihua Wang Niki Trigoni and Andrew Markham. 2021. Learning semantic segmentation of large-scale point clouds with random sampling. IEEE Transactions on Pattern Analysis and Machine Intelligence 44 11 (2021) 8338\u20138354."},{"key":"e_1_3_3_1_24_2","doi-asserted-by":"publisher","unstructured":"Zhuoxu Huang Zhiyou Zhao Banghuai Li and Jungong Han. 2023. LCPFormer: Towards Effective 3D Point Cloud Analysis via Local Context Propagation in Transformers. IEEE Transactions on Circuits and Systems for Video Technology 33 9 (2023) 4985\u20134996. 10.1109\/TCSVT.2023.3247506","DOI":"10.1109\/TCSVT.2023.3247506"},{"key":"e_1_3_3_1_25_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2010.5543273"},{"key":"e_1_3_3_1_26_2","unstructured":"Yangyan Li Rui Bu Mingchao Sun Wei Wu Xinhan Di and Baoquan Chen. 2018. Pointcnn: Convolution on x-transformed points. Advances in neural information processing systems 31 (2018)."},{"key":"e_1_3_3_1_27_2","doi-asserted-by":"publisher","unstructured":"Chengxing Lin Wenju Xu Jian Zhu Yongwei Nie Ruichu Cai and Xuemiao Xu. 2024. PatchMixing Masked Autoencoders for 3D Point Cloud Self-Supervised Learning. IEEE Transactions on Circuits and Systems for Video Technology 34 10 (2024) 9882\u20139897. 10.1109\/TCSVT.2024.3405069","DOI":"10.1109\/TCSVT.2024.3405069"},{"key":"e_1_3_3_1_28_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.12278"},{"key":"e_1_3_3_1_29_2","unstructured":"Jiuming Liu Jinru Han Lihao Liu Angelica\u00a0I. Aviles-Rivero Chaokang Jiang Zhe Liu and Hesheng Wang. 2024. MAMBA4D: Efficient Long-Sequence Point Cloud Video Understanding with Disentangled Spatial-Temporal State Space Models. arxiv:https:\/\/arXiv.org\/abs\/2405.14338\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2405.14338"},{"key":"e_1_3_3_1_30_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00062"},{"key":"e_1_3_3_1_31_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00934"},{"key":"e_1_3_3_1_32_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00376"},{"key":"e_1_3_3_1_33_2","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2015.7353481"},{"key":"e_1_3_3_1_34_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00580"},{"key":"e_1_3_3_1_35_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00100"},{"key":"e_1_3_3_1_36_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00937"},{"key":"e_1_3_3_1_37_2","first-page":"652","volume-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","author":"Qi Charles\u00a0R","year":"2017","unstructured":"Charles\u00a0R Qi, Hao Su, Kaichun Mo, and Leonidas\u00a0J Guibas. 2017. Pointnet: Deep learning on point sets for 3d classification and segmentation. In Proceedings of the IEEE conference on computer vision and pattern recognition. 652\u2013660."},{"key":"e_1_3_3_1_38_2","unstructured":"Charles\u00a0Ruizhongtai Qi Li Yi Hao Su and Leonidas\u00a0J Guibas. 2017. Pointnet++: Deep hierarchical feature learning on point sets in a metric space. Advances in neural information processing systems 30 (2017)."},{"key":"e_1_3_3_1_39_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.352"},{"key":"e_1_3_3_1_40_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.115"},{"key":"e_1_3_3_1_41_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01520"},{"key":"e_1_3_3_1_42_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00123"},{"key":"e_1_3_3_1_43_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01514"},{"key":"e_1_3_3_1_44_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.114"},{"key":"e_1_3_3_1_45_2","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones AidanN. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. Neural Information Processing Systems Neural Information Processing Systems (Jun 2017)."},{"key":"e_1_3_3_1_46_2","doi-asserted-by":"crossref","unstructured":"Yue Wang Yongbin Sun Ziwei Liu Sanjay\u00a0E Sarma Michael\u00a0M Bronstein and Justin\u00a0M Solomon. 2019. Dynamic graph cnn for learning on point clouds. ACM Transactions on Graphics (tog) 38 5 (2019) 1\u201312.","DOI":"10.1145\/3326362"},{"key":"e_1_3_3_1_47_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00059"},{"key":"e_1_3_3_1_48_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19818-2_2"},{"key":"e_1_3_3_1_49_2","doi-asserted-by":"crossref","unstructured":"Hao Wen Yunze Liu Jingwei Huang Bo Duan and Li Yi. 2022. Point Primitive Transformer for Long-Term 4D Point Cloud Video Understanding. Springer Cham (2022).","DOI":"10.1007\/978-3-031-19818-2_2"},{"key":"e_1_3_3_1_50_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01237-3_6"},{"key":"e_1_3_3_1_51_2","doi-asserted-by":"publisher","unstructured":"Fukun Yin Zilong Huang Tao Chen Guozhong Luo Gang Yu and Bin Fu. 2023. DCNet: Large-Scale Point Cloud Semantic Segmentation With Discriminative and Efficient Feature Aggregation. IEEE Transactions on Circuits and Systems for Video Technology 33 8 (2023) 4083\u20134095. 10.1109\/TCSVT.2023.3239541","DOI":"10.1109\/TCSVT.2023.3239541"},{"key":"e_1_3_3_1_52_2","doi-asserted-by":"publisher","unstructured":"Zhiyuan Zhang Jiadai Sun Yuchao Dai Bin Fan and Mingyi He. 2022. VRNet: Learning the Rectified Virtual Corresponding Points for 3D Point Cloud Registration. IEEE Transactions on Circuits and Systems for Video Technology 32 8 (2022) 4997\u20135010. 10.1109\/TCSVT.2022.3143151","DOI":"10.1109\/TCSVT.2022.3143151"},{"key":"e_1_3_3_1_53_2","doi-asserted-by":"crossref","unstructured":"Lili Zhao Kai-Kuang Ma Zhili Liu Qian Yin and Jianwen Chen. 2022. Real-time scene-aware LiDAR point cloud compression using semantic prior representation. IEEE Transactions on Circuits and Systems for Video Technology 32 8 (2022) 5623\u20135637.","DOI":"10.1109\/TCSVT.2022.3145513"},{"key":"e_1_3_3_1_54_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00832"}],"event":{"name":"MMAsia '25 Workshops: ACM Multimedia Asia Workshops","location":"Kuala Lumpur Malaysia","acronym":"MMAsia '25 Workshops","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 7th ACM International Conference on Multimedia in Asia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3769748.3773341","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,1,23]],"date-time":"2026-01-23T22:04:11Z","timestamp":1769205851000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3769748.3773341"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12,8]]},"references-count":53,"alternative-id":["10.1145\/3769748.3773341","10.1145\/3769748"],"URL":"https:\/\/doi.org\/10.1145\/3769748.3773341","relation":{},"subject":[],"published":{"date-parts":[[2025,12,8]]},"assertion":[{"value":"2025-12-08","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}