{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,27]],"date-time":"2026-02-27T15:26:55Z","timestamp":1772206015813,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":67,"publisher":"ACM","funder":[{"name":"National Natural Science Foundation of China","award":["Grants No. 62472139, U23B2031"],"award-info":[{"award-number":["Grants No. 62472139, U23B2031"]}]},{"name":"Anhui Provincial Natural Science Foundation","award":["Grant No. 2408085QF191"],"award-info":[{"award-number":["Grant No. 2408085QF191"]}]},{"name":"Fundamental Research Funds for the Central Universities","award":["Grants No. PA2025IISL0112, JZ2024HGTA0178"],"award-info":[{"award-number":["Grants No. PA2025IISL0112, JZ2024HGTA0178"]}]},{"name":"Major Project of Anhui Province","award":["Grant No. 202423k09020001"],"award-info":[{"award-number":["Grant No. 202423k09020001"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746266.3762157","type":"proceedings-article","created":{"date-parts":[[2025,10,21]],"date-time":"2025-10-21T15:19:13Z","timestamp":1761059953000},"page":"11-20","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["StgcDiff: Spatial-Temporal Graph Condition Diffusion for Sign Language Transition Generation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0007-2616-5718","authenticated-orcid":false,"given":"Jiashu","family":"He","sequence":"first","affiliation":[{"name":"Hefei University of Technology, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-7373-0423","authenticated-orcid":false,"given":"Jiayi","family":"He","sequence":"additional","affiliation":[{"name":"Hefei University of Technology, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6313-2543","authenticated-orcid":false,"given":"Shengeng","family":"Tang","sequence":"additional","affiliation":[{"name":"Hefei University of Technology, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7946-8199","authenticated-orcid":false,"given":"Huixia","family":"Ben","sequence":"additional","affiliation":[{"name":"Anhui University of Science and Technology, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7546-9052","authenticated-orcid":false,"given":"Lechao","family":"Cheng","sequence":"additional","affiliation":[{"name":"Hefei University of Technology, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5461-3986","authenticated-orcid":false,"given":"Richang","family":"Hong","sequence":"additional","affiliation":[{"name":"Hefei University of Technology, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,10,26]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Development of Arabic Sign Language Dictionary using 3D Avatar Technologies. Indonesian Journal of Electrical Engineering and Computer Science","author":"Aliwy Ahmed H","year":"2021","unstructured":"Ahmed H Aliwy and A Alethary Ahmed. 2021. Development of Arabic Sign Language Dictionary using 3D Avatar Technologies. Indonesian Journal of Electrical Engineering and Computer Science (2021), 609-616."},{"key":"e_1_3_2_1_2_1","volume-title":"SignFormer-GCN: Continuous Sign Language Translation using Spatio-temporal Graph Convolutional Networks. PloS one","author":"Arib Safaeid Hossain","year":"2025","unstructured":"Safaeid Hossain Arib, Rabeya Akter, Sejuti Rahman, and Shafin Rahman. 2025. SignFormer-GCN: Continuous Sign Language Translation using Spatio-temporal Graph Convolutional Networks. PloS one (2025), e0316298."},{"key":"e_1_3_2_1_3_1","volume-title":"Neural Sign Language Translation. In IEEE Conference on Computer Vision and Pattern Recognition. 7784-7793","author":"Camgoz Necati Cihan","year":"2018","unstructured":"Necati Cihan Camgoz, Simon Hadfield, Oscar Koller, Hermann Ney, and Richard Bowden. 2018. Neural Sign Language Translation. In IEEE Conference on Computer Vision and Pattern Recognition. 7784-7793."},{"key":"e_1_3_2_1_4_1","volume-title":"Technical report","author":"Chai Xiujuan","unstructured":"Xiujuan Chai, Hanjie Wang, and Xilin Chen. 2014. The DEVISIGN Large Vocabulary of Chinese Sign Language Database and Baseline Evaluations. In Technical report, Key Lab of Intelligent Information Processing of CAS. Institute of Computing Technology."},{"key":"e_1_3_2_1_5_1","volume-title":"IEEE Conference on Computer Vision and Pattern Recognition. 5120-5130","author":"Chen Yutong","year":"2022","unstructured":"Yutong Chen, Fangyun Wei, Xiao Sun, Zhirong Wu, and Stephen Lin. 2022. A Simple Multi-modality Transfer Learning Baseline for Sign Language Translation. In IEEE Conference on Computer Vision and Pattern Recognition. 5120-5130."},{"key":"e_1_3_2_1_6_1","volume-title":"Channel-Wise Topology Refinement Graph Convolution for Skeleton-Based Action Recognition. In International Conference on Computer Vision. 13359-13368","author":"Chen Yuxin","year":"2021","unstructured":"Yuxin Chen, Ziqi Zhang, Chunfeng Yuan, Bing Li, Ying Deng, and Weiming Hu. 2021. Channel-Wise Topology Refinement Graph Convolution for Skeleton-Based Action Recognition. In International Conference on Computer Vision. 13359-13368."},{"key":"e_1_3_2_1_7_1","volume-title":"IEEE International Conference on Acoustics, Speech, and Signal Processing Workshops. 1-5.","author":"Coster Mathieu De","year":"2023","unstructured":"Mathieu De Coster and Joni Dambre. 2023. Querying a Sign Language Dictionary with Videos using Dense Vector Search. In IEEE International Conference on Acoustics, Speech, and Signal Processing Workshops. 1-5."},{"key":"e_1_3_2_1_8_1","volume-title":"Dual Graph Convolutional Networks with Transformer and Curriculum Learning for Image Captioning. In ACM International Conference on Multimedia. 2615-2624","author":"Dong Xinzhi","year":"2021","unstructured":"Xinzhi Dong, Chengjiang Long, Wenju Xu, and Chunxia Xiao. 2021. Dual Graph Convolutional Networks with Transformer and Curriculum Learning for Image Captioning. In ACM International Conference on Multimedia. 2615-2624."},{"key":"e_1_3_2_1_9_1","volume-title":"Benchmark Databases for Video-Based Automatic Sign Language Recognition. In International Conference on Language Resources and Evaluation.","author":"Dreuw Philippe","year":"2008","unstructured":"Philippe Dreuw, Carol Neidle, Vassilis Athitsos, Stan Sclaroff, and Hermann Ney. 2008. Benchmark Databases for Video-Based Automatic Sign Language Recognition. In International Conference on Language Resources and Evaluation."},{"key":"e_1_3_2_1_10_1","volume-title":"Llms Are Good Sign Language Translators. In IEEE Conference on Computer Vision and Pattern Recognition. 18362-18372","author":"Gong Jia","year":"2024","unstructured":"Jia Gong, Lin Geng Foo, Yixuan He, Hossein Rahmani, and Jun Liu. 2024. Llms Are Good Sign Language Translators. In IEEE Conference on Computer Vision and Pattern Recognition. 18362-18372."},{"key":"e_1_3_2_1_11_1","volume-title":"Hierarchical LSTM for Sign Language Translation. In AAAI Conference on Artificial Intelligence. 6845-6852","author":"Guo Dan","year":"2018","unstructured":"Dan Guo, Wengang Zhou, Houqiang Li, and Meng Wang. 2018. Hierarchical LSTM for Sign Language Translation. In AAAI Conference on Artificial Intelligence. 6845-6852."},{"key":"e_1_3_2_1_12_1","volume-title":"Interactive Attention and Improved GCN for Continuous Sign Language Recognition. Biomedical Signal Processing and Control","author":"Guo Qi","year":"2023","unstructured":"Qi Guo, Shujun Zhang, Liwei Tan, Ke Fang, and Yinghao Du. 2023. Interactive Attention and Improved GCN for Continuous Sign Language Recognition. Biomedical Signal Processing and Control (2023), 104931."},{"key":"e_1_3_2_1_13_1","unstructured":"Jiayi He Xu Wang Shengeng Tang Yaxiong Wang Lechao Cheng and Dan Guo. 2025. Motion is the Choreographer: Learning Latent Pose Dynamics for Seamless Sign Language Generation. arXiv:2508.04049 [cs.CV] https:\/\/arxiv.org\/abs\/2508.04049"},{"key":"e_1_3_2_1_14_1","volume-title":"Denoising Diffusion Probabilistic Models. Neural Information Processing Systems","author":"Ho Jonathan","year":"2020","unstructured":"Jonathan Ho, Ajay Jain, and Pieter Abbeel. 2020. Denoising Diffusion Probabilistic Models. Neural Information Processing Systems (2020), 6840-6851."},{"key":"e_1_3_2_1_15_1","volume-title":"Graph Convolutional Networks for Hyperspectral Image Classification","author":"Hong Danfeng","year":"2020","unstructured":"Danfeng Hong, Lianru Gao, Jing Yao, Bing Zhang, Antonio Plaza, and Jocelyn Chanussot. 2020. Graph Convolutional Networks for Hyperspectral Image Classification. IEEE Transactions on Geoscience and Remote Sensing (2020), 5966-5978."},{"key":"e_1_3_2_1_16_1","volume-title":"A Novel Visual Representation on Text using Diverse Conditional GAN for Visual Recognition","author":"Hu Tao","year":"2021","unstructured":"Tao Hu, Chengjiang Long, and Chunxia Xiao. 2021. A Novel Visual Representation on Text using Diverse Conditional GAN for Visual Recognition. IEEE Transactions on Image Processing (2021), 3499-3512."},{"key":"e_1_3_2_1_17_1","volume-title":"Frontiers of Computer Science (2024)","author":"Hu Tao","year":"2024","unstructured":"Tao Hu, Chengjiang Long, and Chunxia Xiao. 2024. CRD-CGAN: Category-Consistent and Relativistic Constraints for Diverse Text-to-Image Generation. Frontiers of Computer Science (2024), 181304."},{"key":"e_1_3_2_1_18_1","volume-title":"International Conference on Computer Vision. 1209-1216","author":"Hua Gang","year":"2013","unstructured":"Gang Hua, Chengjiang Long, Ming Yang, and Yan Gao. 2013. Collaborative Active Learning of a Kernel Machine Ensemble for Recognition. In International Conference on Computer Vision. 1209-1216."},{"key":"e_1_3_2_1_19_1","volume-title":"Attention-Based 3D-CNNs for Large-Vocabulary Sign Language Recognition","author":"Huang Jie","year":"2018","unstructured":"Jie Huang, Wengang Zhou, Houqiang Li, and Weiping Li. 2018a. Attention-Based 3D-CNNs for Large-Vocabulary Sign Language Recognition. IEEE Transactions on Circuits and Systems for Video Technology (2018), 2822-2832."},{"key":"e_1_3_2_1_20_1","volume-title":"AAAI Conference on Artificial Intelligence. 2257-2264","author":"Huang Jie","year":"2018","unstructured":"Jie Huang, Wengang Zhou, Qilin Zhang, Houqiang Li, and Weiping Li. 2018b. Video-based Sign Language Recognition without Temporal Segmentation. In AAAI Conference on Artificial Intelligence. 2257-2264."},{"key":"e_1_3_2_1_21_1","volume-title":"Towards Fast and High-Quality Sign Language Production. In ACM International Conference on Multimedia. 3172-3181","author":"Huang Wencan","year":"2021","unstructured":"Wencan Huang, Wenwen Pan, Zhou Zhao, and Qi Tian. 2021. Towards Fast and High-Quality Sign Language Production. In ACM International Conference on Multimedia. 3172-3181."},{"key":"e_1_3_2_1_22_1","volume-title":"DOA-GAN: Dual-Order Attentive Generative Adversarial Network for Image Copy-move Forgery Detection and Localization. In IEEE Conference on Computer Vision and Pattern Recognition. 4676-4685","author":"Islam Ashraful","year":"2020","unstructured":"Ashraful Islam, Chengjiang Long, Arslan Basharat, and Anthony Hoogs. 2020. DOA-GAN: Dual-Order Attentive Generative Adversarial Network for Image Copy-move Forgery Detection and Localization. In IEEE Conference on Computer Vision and Pattern Recognition. 4676-4685."},{"key":"e_1_3_2_1_23_1","volume-title":"AAAI Conference on Artificial Intelligence. 1637-1645","author":"Islam Ashraful","year":"2021","unstructured":"Ashraful Islam, Chengjiang Long, and Richard Radke. 2021. A Hybrid Attention Mechanism for Weakly-Supervised Temporal Action Localization. In AAAI Conference on Artificial Intelligence. 1637-1645."},{"key":"e_1_3_2_1_24_1","volume-title":"Skeleton Aware Multi-modal Sign Language Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 3413-3423","author":"Jiang Songyao","year":"2021","unstructured":"Songyao Jiang, Bin Sun, Lichen Wang, Yue Bai, Kunpeng Li, and Yun Fu. 2021. Skeleton Aware Multi-modal Sign Language Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 3413-3423."},{"key":"e_1_3_2_1_25_1","volume-title":"Developing a Bilingual Mobile Dictionary for Indian Sign Language and Gathering Users Experience with SignDict. Assistive Technology","author":"Joy Jestin","year":"2020","unstructured":"Jestin Joy, Kannan Balakrishnan, and Sreeraj Madhavankutty. 2020. Developing a Bilingual Mobile Dictionary for Indian Sign Language and Gathering Users Experience with SignDict. Assistive Technology (2020), 153-160."},{"key":"e_1_3_2_1_26_1","volume-title":"Sign Language Translation with Hierarchical Spatio-temporal Graph Neural Network. In IEEE Winter Conference on Applications of Computer Vision. 3367-3376","author":"Kan Jichao","year":"2022","unstructured":"Jichao Kan, Kun Hu, Markus Hagenbuchner, Ah Chung Tsoi, Mohammed Bennamoun, and Zhiyong Wang. 2022. Sign Language Translation with Hierarchical Spatio-temporal Graph Neural Network. In IEEE Winter Conference on Applications of Computer Vision. 3367-3376."},{"key":"e_1_3_2_1_27_1","volume-title":"Adam: A Method for Stochastic Optimization. In International Conference on Learning Representations. 1-15","author":"Kingma Diederik P","year":"2015","unstructured":"Diederik P Kingma and Jimmy Ba. 2015. Adam: A Method for Stochastic Optimization. In International Conference on Learning Representations. 1-15."},{"key":"e_1_3_2_1_28_1","volume-title":"Semi-Supervised Classification with Graph Convolutional Networks. arXiv e-prints","author":"Kipf Thomas N","year":"2016","unstructured":"Thomas N Kipf and Max Welling. 2016. Semi-Supervised Classification with Graph Convolutional Networks. arXiv e-prints (2016), arXiv-1609."},{"key":"e_1_3_2_1_29_1","volume-title":"Quantitative Survey of the State of the Art in Sign Language Recognition. ArXiv Preprint ArXiv:2008.09918","author":"Koller Oscar","year":"2020","unstructured":"Oscar Koller. 2020. Quantitative Survey of the State of the Art in Sign Language Recognition. ArXiv Preprint ArXiv:2008.09918 (2020), ArXiv-2008."},{"key":"e_1_3_2_1_30_1","volume-title":"Grid Diffusion Models for Text-to-Video Generation. In IEEE Conference on Computer Vision and Pattern Recognition. 8734-8743","author":"Lee Taegyeong","year":"2024","unstructured":"Taegyeong Lee, Soyeong Kwon, and Taehwan Kim. 2024. Grid Diffusion Models for Text-to-Video Generation. In IEEE Conference on Computer Vision and Pattern Recognition. 8734-8743."},{"key":"e_1_3_2_1_31_1","volume-title":"IEEE Winter Conference on Applications of Computer Vision. 1459-1469","author":"Li Dongxu","year":"2020","unstructured":"Dongxu Li, Cristian Rodriguez, Xin Yu, and Hongdong Li. 2020. Word-Level Deep Sign Language Recognition from Video: A New Large-scale Dataset and Methods Comparison. In IEEE Winter Conference on Applications of Computer Vision. 1459-1469."},{"key":"e_1_3_2_1_32_1","first-page":"74","article-title":"Rouge","author":"Lin Chin-Yew","year":"2004","unstructured":"Chin-Yew Lin. 2004. Rouge: A Package for Automatic Evaluation of Summaries. In Text Summarization Branches Out. 74-81.","journal-title":"A Package for Automatic Evaluation of Summaries. In Text Summarization Branches Out."},{"key":"e_1_3_2_1_33_1","volume-title":"Disentangling and Unifying Graph Convolutions for Skeleton-Based Action Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 143-152","author":"Liu Ziyu","year":"2020","unstructured":"Ziyu Liu, Hongwen Zhang, Zhenghao Chen, Zhiyong Wang, and Wanli Ouyang. 2020. Disentangling and Unifying Graph Convolutions for Skeleton-Based Action Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 143-152."},{"key":"e_1_3_2_1_34_1","volume-title":"Multi-Class Multi-Annotator Active Learning with Robust Gaussian Process for Visual Recognition. In International Conference on Computer Vision. 2839-2847","author":"Long Chengjiang","year":"2015","unstructured":"Chengjiang Long and Gang Hua. 2015. Multi-Class Multi-Annotator Active Learning with Robust Gaussian Process for Visual Recognition. In International Conference on Computer Vision. 2839-2847."},{"key":"e_1_3_2_1_35_1","first-page":"311","article-title":"Bleu: a Method for Automatic Evaluation of Machine Translation","author":"Papineni Kishore","year":"2002","unstructured":"Kishore Papineni, Salim Roukos, Todd Ward, and Wei-Jing Zhu. 2002. Bleu: a Method for Automatic Evaluation of Machine Translation. In Association for Computational Linguistics. 311-318.","journal-title":"Association for Computational Linguistics."},{"key":"e_1_3_2_1_36_1","volume-title":"Spatio-temporal Graph Convolutional Networks for Continuous Sign Language Recognition. In IEEE International Conference on Acoustics, Speech and Signal Processing. 8457-8461","author":"Parelli Maria","year":"2022","unstructured":"Maria Parelli, Katerina Papadimitriou, Gerasimos Potamianos, Georgios Pavlakos, and Petros Maragos. 2022. Spatio-temporal Graph Convolutional Networks for Continuous Sign Language Recognition. In IEEE International Conference on Acoustics, Speech and Signal Processing. 8457-8461."},{"key":"e_1_3_2_1_37_1","volume-title":"High-Resolution Image Synthesis with Latent Diffusion Models. In IEEE Conference on Computer Vision and Pattern Recognition. 10684-10695","author":"Rombach Robin","year":"2022","unstructured":"Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Bj\u00f6rn Ommer. 2022. High-Resolution Image Synthesis with Latent Diffusion Models. In IEEE Conference on Computer Vision and Pattern Recognition. 10684-10695."},{"key":"e_1_3_2_1_38_1","volume-title":"ACM International Conference on Multimedia. 137-145","author":"Sagawa Hirohiko","year":"2002","unstructured":"Hirohiko Sagawa and Masaru Takeuchi. 2002. A Teaching System of Japanese Sign Language Using Sign Language Recognition and Generation. In ACM International Conference on Multimedia. 137-145."},{"key":"e_1_3_2_1_39_1","volume-title":"Progressive Transformers for End-to-End Sign Language Production. In European Conference on Computer Vision. 687-705","author":"Saunders Ben","year":"2020","unstructured":"Ben Saunders, Necati Cihan Camgoz, and Richard Bowden. 2020. Progressive Transformers for End-to-End Sign Language Production. In European Conference on Computer Vision. 687-705."},{"key":"e_1_3_2_1_40_1","volume-title":"Mixed Signals: Sign Language Production Via A Mixture of Motion Primitives. In International Conference on Computer Vision. 1919-1929","author":"Saunders Ben","year":"2021","unstructured":"Ben Saunders, Necati Cihan Camgoz, and Richard Bowden. 2021. Mixed Signals: Sign Language Production Via A Mixture of Motion Primitives. In International Conference on Computer Vision. 1919-1929."},{"key":"e_1_3_2_1_41_1","volume-title":"SGCN: Sparse Graph Convolution Network for Pedestrian Trajectory Prediction. In IEEE Conference on Computer Vision and Pattern Recognition. 8994-9003","author":"Shi Liushuai","year":"2021","unstructured":"Liushuai Shi, Le Wang, Chengjiang Long, Sanping Zhou, Mo Zhou, Zhenxing Niu, and Gang Hua. 2021. SGCN: Sparse Graph Convolution Network for Pedestrian Trajectory Prediction. In IEEE Conference on Computer Vision and Pattern Recognition. 8994-9003."},{"key":"e_1_3_2_1_42_1","volume-title":"Two-Stream Adaptive Graph Convolutional Networks for Skeleton-Based Action Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 12026-12035","author":"Shi Lei","year":"2019","unstructured":"Lei Shi, Yifan Zhang, Jian Cheng, and Hanqing Lu. 2019. Two-Stream Adaptive Graph Convolutional Networks for Skeleton-Based Action Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 12026-12035."},{"key":"e_1_3_2_1_43_1","volume-title":"Deep Unsupervised Learning Using Nonequilibrium Thermodynamics. In International Conference on Machine Learning. 2256-2265","author":"Sohl-Dickstein Jascha","year":"2015","unstructured":"Jascha Sohl-Dickstein, Eric Weiss, Niru Maheswaranathan, and Surya Ganguli. 2015. Deep Unsupervised Learning Using Nonequilibrium Thermodynamics. In International Conference on Machine Learning. 2256-2265."},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3117124"},{"key":"e_1_3_2_1_45_1","volume-title":"IEEE Conference on Computer Vision and Pattern Recognition. 3481-3491","author":"Tang Shengeng","year":"2025","unstructured":"Shengeng Tang, Jiayi He, Lechao Cheng, Jingjing Wu, Dan Guo, and Richang Hong. 2025a. Discrete to Continuous: Generating Smooth Transition Poses from Sign Language Observations. In IEEE Conference on Computer Vision and Pattern Recognition. 3481-3491."},{"key":"e_1_3_2_1_46_1","volume-title":"Sign-IDD: Iconicity Disentangled Diffusion for Sign Language Production. In AAAI Conference on Artificial Intelligence. 7266-7274","author":"Tang Shengeng","year":"2025","unstructured":"Shengeng Tang, Jiayi He, Dan Guo, Yanyan Wei, Feng Li, and Richang Hong. 2025b. Sign-IDD: Iconicity Disentangled Diffusion for Sign Language Production. In AAAI Conference on Artificial Intelligence. 7266-7274."},{"key":"e_1_3_2_1_47_1","volume-title":"Gloss-Driven Conditional Diffusion Models for Sign Language Production. ACM Transactions on Multimedia Computing, Communications and Applications","author":"Tang Shengeng","year":"2025","unstructured":"Shengeng Tang, Feng Xue, Jingjing Wu, Shuo Wang, and Richang Hong. 2025c. Gloss-Driven Conditional Diffusion Models for Sign Language Production. ACM Transactions on Multimedia Computing, Communications and Applications (2025), 1-17."},{"key":"e_1_3_2_1_48_1","volume-title":"Deep Progressive Reinforcement Learning for Skeleton-based Action Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 5323-5332","author":"Tang Yansong","year":"2018","unstructured":"Yansong Tang, Yi Tian, Jiwen Lu, Peiyang Li, and Jie Zhou. 2018. Deep Progressive Reinforcement Learning for Skeleton-based Action Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 5323-5332."},{"key":"e_1_3_2_1_49_1","volume-title":"IEEE Winter Conference on Applications of Computer Vision. 31-40","author":"Tunga Anirudh","year":"2021","unstructured":"Anirudh Tunga, Sai Vidyaranya Nuthalapati, and Juan Wachs. 2021. Pose-Based Sign Language Recognition using GCN and BERT. In IEEE Winter Conference on Applications of Computer Vision. 31-40."},{"key":"e_1_3_2_1_50_1","volume-title":"Lion: Latent Point Diffusion Models for 3D Shape Generation. Neural Information Processing Systems","author":"Vahdat Arash","year":"2022","unstructured":"Arash Vahdat, Francis Williams, Zan Gojcic, Or Litany, Sanja Fidler, Karsten Kreis, et al., 2022. Lion: Latent Point Diffusion Models for 3D Shape Generation. Neural Information Processing Systems (2022), 10021-10039."},{"key":"e_1_3_2_1_51_1","volume-title":"Isolated Sign Language Recognition with Multi-scale Spatial-temporal Graph Convolutional Networks. In IEEE Conference on Computer Vision and Pattern Recognition. 3462-3471","author":"V\u00e1zquez-Enr\u00edquez Manuel","year":"2021","unstructured":"Manuel V\u00e1zquez-Enr\u00edquez, Jose L Alba-Castro, Laura Doc\u00edo-Fern\u00e1ndez, and Eduardo Rodr\u00edguez-Banga. 2021. Isolated Sign Language Recognition with Multi-scale Spatial-temporal Graph Convolutional Networks. In IEEE Conference on Computer Vision and Pattern Recognition. 3462-3471."},{"key":"e_1_3_2_1_52_1","volume-title":"Joint Object Detection and Multi-Object Tracking with Graph Neural Networks. In International Conference on Robotics and Automation. 13708-13715","author":"Wang Yongxin","year":"2021","unstructured":"Yongxin Wang, Kris Kitani, and Xinshuo Weng. 2021. Joint Object Detection and Multi-Object Tracking with Graph Neural Networks. In International Conference on Robotics and Automation. 13708-13715."},{"key":"e_1_3_2_1_53_1","volume-title":"Journal of Software (2002)","author":"Wang ZHAO-QI","year":"2002","unstructured":"ZHAO-QI Wang. 2002. A Method to Synthesize Chinese Sign Language Based on Virtual Human Technologics. Journal of Software (2002), 2051-2056."},{"key":"e_1_3_2_1_54_1","volume-title":"AAAI Conference on Artificial Intelligence. 6234-6242","author":"Xie Pan","year":"2024","unstructured":"Pan Xie, Qipeng Zhang, Peng Taiying, Hao Tang, Yao Du, and Zexian Li. 2024. G2P-DDM: Generating Sign Pose Sequence from Gloss Sequence with Discrete Diffusion Model. In AAAI Conference on Artificial Intelligence. 6234-6242."},{"key":"e_1_3_2_1_55_1","volume-title":"Spatial Temporal Graph Convolutional Networks for Skeleton-Based Action Recognition. In AAAI Conference on Artificial Intelligence.","author":"Yan Sijie","year":"2018","unstructured":"Sijie Yan, Yuanjun Xiong, and Dahua Lin. 2018. Spatial Temporal Graph Convolutional Networks for Skeleton-Based Action Recognition. In AAAI Conference on Artificial Intelligence."},{"key":"e_1_3_2_1_56_1","volume-title":"FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation. In IEEE Conference on Computer Vision and Pattern Recognition. 8703-8712","author":"Yang Shuai","year":"2024","unstructured":"Shuai Yang, Yifan Zhou, Ziwei Liu, and Chen Change Loy. 2024. FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation. In IEEE Conference on Computer Vision and Pattern Recognition. 8703-8712."},{"key":"e_1_3_2_1_57_1","volume-title":"Dynamic GCN: Context-Enriched Topology Learning for Skeleton-Based Action Recognition. In ACM International Conference on Multimedia. 55-63","author":"Ye Fanfan","year":"2020","unstructured":"Fanfan Ye, Shiliang Pu, Qiaoyong Zhong, Chao Li, Di Xie, and Huiming Tang. 2020. Dynamic GCN: Context-Enriched Topology Learning for Skeleton-Based Action Recognition. In ACM International Conference on Multimedia. 55-63."},{"key":"e_1_3_2_1_58_1","volume-title":"Graph Adversarial Network with Bottleneck Adapter Tuning for Sign Language Production. In Computer Graphics International Conference. 92-103","author":"Yu Chunpeng","year":"2022","unstructured":"Chunpeng Yu, Jiajia Liang, Yihui Liao, Zhifeng Xie, and Bin Sheng. 2022. Graph Adversarial Network with Bottleneck Adapter Tuning for Sign Language Production. In Computer Graphics International Conference. 92-103."},{"key":"e_1_3_2_1_59_1","volume-title":"Highly Fluent Sign Language Synthesis Based on Variable Motion Frame Interpolation. In IEEE International Conference on Systems, Man, and Cybernetics. 1772-1777","author":"Zeng Ni","year":"2020","unstructured":"Ni Zeng, Yiqiang Chen, Yang Gu, Dongdong Liu, and Yunbing Xing. 2020. Highly Fluent Sign Language Synthesis Based on Variable Motion Frame Interpolation. In IEEE International Conference on Systems, Man, and Cybernetics. 1772-1777."},{"key":"e_1_3_2_1_60_1","volume-title":"Graph Convolutional Networks for Temporal Action Localization. In International Conference on Computer Vision. 7094-7103","author":"Zeng Runhao","year":"2019","unstructured":"Runhao Zeng, Wenbing Huang, Mingkui Tan, Yu Rong, Peilin Zhao, Junzhou Huang, and Chuang Gan. 2019. Graph Convolutional Networks for Temporal Action Localization. In International Conference on Computer Vision. 7094-7103."},{"key":"e_1_3_2_1_61_1","volume-title":"Chinese Sign Language Recognition with Adaptive HMM. In IEEE International Conference on Multimedia and Expo. IEEE, 1-6.","author":"Zhang Jihai","year":"2016","unstructured":"Jihai Zhang, Wengang Zhou, Chao Xie, Junfu Pu, and Houqiang Li. 2016. Chinese Sign Language Recognition with Adaptive HMM. In IEEE International Conference on Multimedia and Expo. IEEE, 1-6."},{"key":"e_1_3_2_1_62_1","volume-title":"Motiondiffuse: Text-Driven Human Motion Generation with Diffusion Model","author":"Zhang Mingyuan","year":"2024","unstructured":"Mingyuan Zhang, Zhongang Cai, Liang Pan, Fangzhou Hong, Xinying Guo, Lei Yang, and Ziwei Liu. 2024. Motiondiffuse: Text-Driven Human Motion Generation with Diffusion Model. IEEE Transactions on Pattern Analysis and Machine Intelligence (2024), 4115-4128."},{"key":"e_1_3_2_1_63_1","volume-title":"Conditional Variational Autoencoder for Sign Language Translation with Cross-modal Alignment. In AAAI Conference on Artificial Intelligence. 19643-19651","author":"Zhao Rui","year":"2024","unstructured":"Rui Zhao, Liang Zhang, Biao Fu, Cong Hu, Jinsong Su, and Yidong Chen. 2024b. Conditional Variational Autoencoder for Sign Language Translation with Cross-modal Alignment. In AAAI Conference on Artificial Intelligence. 19643-19651."},{"key":"e_1_3_2_1_64_1","volume-title":"Masa: Motion-Aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition","author":"Zhao Weichao","year":"2024","unstructured":"Weichao Zhao, Hezhen Hu, Wengang Zhou, Yunyao Mao, Min Wang, and Houqiang Li. 2024a. Masa: Motion-Aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition. IEEE Transactions on Circuits and Systems for Video Technology (2024)."},{"key":"e_1_3_2_1_65_1","volume-title":"BEST: BERT Pre-Training for Sign Language Recognition with Coupling Tokenization. In AAAI Conference on Artificial Intelligence. 3597-3605","author":"Zhao Weichao","year":"2023","unstructured":"Weichao Zhao, Hezhen Hu, Wengang Zhou, Jiaxin Shi, and Houqiang Li. 2023. BEST: BERT Pre-Training for Sign Language Recognition with Coupling Tokenization. In AAAI Conference on Artificial Intelligence. 3597-3605."},{"key":"e_1_3_2_1_66_1","volume-title":"Emdm: Efficient Motion Diffusion Model for Fast and High-Quality Motion Generation. In European Conference on Computer Vision. 18-38","author":"Zhou Wenyang","year":"2024","unstructured":"Wenyang Zhou, Zhiyang Dou, Zeyu Cao, Zhouyingcheng Liao, Jingbo Wang, Wenjia Wang, Yuan Liu, Taku Komura, Wenping Wang, and Lingjie Liu. 2024. Emdm: Efficient Motion Diffusion Model for Fast and High-Quality Motion Generation. In European Conference on Computer Vision. 18-38."},{"key":"e_1_3_2_1_67_1","volume-title":"Natural Language-Assisted Sign Language Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 14890-14900","author":"Zuo Ronglai","year":"2023","unstructured":"Ronglai Zuo, Fangyun Wei, and Brian Mak. 2023. Natural Language-Assisted Sign Language Recognition. In IEEE Conference on Computer Vision and Pattern Recognition. 14890-14900."}],"event":{"name":"MM '25:The 33rd ACM International Conference on Multimedia","location":"Dublin Ireland","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 3rd International Workshop on Deep Multimodal Generation and Retrieval"],"original-title":[],"deposited":{"date-parts":[[2025,10,21]],"date-time":"2025-10-21T15:19:29Z","timestamp":1761059969000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746266.3762157"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,26]]},"references-count":67,"alternative-id":["10.1145\/3746266.3762157","10.1145\/3746266"],"URL":"https:\/\/doi.org\/10.1145\/3746266.3762157","relation":{},"subject":[],"published":{"date-parts":[[2025,10,26]]},"assertion":[{"value":"2025-10-26","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}