{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,4]],"date-time":"2026-05-04T09:32:11Z","timestamp":1777887131817,"version":"3.51.4"},"reference-count":84,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,1,29]],"date-time":"2026-01-29T00:00:00Z","timestamp":1769644800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100000923","name":"Australian Research Council","doi-asserted-by":"publisher","award":["DP220100800"],"award-info":[{"award-number":["DP220100800"]}],"id":[{"id":"10.13039\/501100000923","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100000923","name":"Australian Research Council","doi-asserted-by":"publisher","award":["DE230100477"],"award-info":[{"award-number":["DE230100477"]}],"id":[{"id":"10.13039\/501100000923","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Computer Vision and Image Understanding"],"published-print":{"date-parts":[[2026,3]]},"DOI":"10.1016\/j.cviu.2026.104646","type":"journal-article","created":{"date-parts":[[2026,2,3]],"date-time":"2026-02-03T16:41:14Z","timestamp":1770136874000},"page":"104646","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Mobile Auslan: A multimodal dialogue-centered sign language learning system"],"prefix":"10.1016","volume":"265","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8990-2235","authenticated-orcid":false,"given":"Hongwei","family":"Sheng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xin","family":"Shen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Heming","family":"Du","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xin","family":"Yu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"key":"10.1016\/j.cviu.2026.104646_b1","series-title":"Llama 3 model card","author":"AI@Meta","year":"2024"},{"key":"10.1016\/j.cviu.2026.104646_b2","series-title":"European Conference on Computer Vision","first-page":"35","article-title":"BSL-1K: Scaling up co-articulated sign language recognition using mouthing cues","author":"Albanie","year":"2020"},{"key":"10.1016\/j.cviu.2026.104646_b3","series-title":"BBC-oxford british sign language dataset","author":"Albanie","year":"2021"},{"key":"10.1016\/j.cviu.2026.104646_b4","series-title":"Findings of the Association for Computational Linguistics: EMNLP","first-page":"11127","article-title":"Steering large language models for machine translation with finetuning and in-context learning","author":"Alves","year":"2023"},{"key":"10.1016\/j.cviu.2026.104646_b5","series-title":"ASL-kids","author":"ASL-Kids","year":"2024"},{"key":"10.1016\/j.cviu.2026.104646_b6","series-title":"IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops","first-page":"1","article-title":"The american sign language lexicon video dataset","author":"Athitsos","year":"2008"},{"key":"10.1016\/j.cviu.2026.104646_b7","first-page":"379","article-title":"Can LLMs really learn to translate a low-resource language from one grammar book?","volume":"vol. 42","author":"Aycock","year":"2024"},{"key":"10.1016\/j.cviu.2026.104646_b8","series-title":"Qwen technical report","author":"Bai","year":"2023"},{"key":"10.1016\/j.cviu.2026.104646_b9","series-title":"Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision (WACV) Workshops","first-page":"182","article-title":"Sign pose-based transformer for word-level sign language recognition","author":"Boh\u00e1\u010dek","year":"2022"},{"key":"10.1016\/j.cviu.2026.104646_b10","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"11552","article-title":"Aligning subtitles in sign language videos","author":"Bull","year":"2021"},{"key":"10.1016\/j.cviu.2026.104646_b11","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"7784","article-title":"Neural sign language translation","author":"Camgoz","year":"2018"},{"key":"10.1016\/j.cviu.2026.104646_b12","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"10023","article-title":"Sign language transformers: Joint end-to-end sign language recognition and translation","author":"Camgoz","year":"2020"},{"key":"10.1016\/j.cviu.2026.104646_b13","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"6299","article-title":"Quo vadis, action recognition? a new model and the kinetics dataset","author":"Carreira","year":"2017"},{"key":"10.1016\/j.cviu.2026.104646_b14","unstructured":"Cassidy,\u00a0S., Crasborn,\u00a0O., Nieminen,\u00a0H., Stoop,\u00a0W., Hulsbosch,\u00a0M., Even,\u00a0S., Komen,\u00a0E., Johnston,\u00a0T., 2018. Signbank: Software to support web based dictionaries of sign language. In: Proceedings of the Eleventh International Conference on Language Resources and Evaluation. LREC, pp. 2359\u20132364."},{"key":"10.1016\/j.cviu.2026.104646_b15","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"5120","article-title":"A simple multi-modality transfer learning baseline for sign language translation","author":"Chen","year":"2022"},{"key":"10.1016\/j.cviu.2026.104646_b16","series-title":"Proceedings of the Joint International Conference on Computational Linguistics, Language Resources and Evaluation","first-page":"7071","article-title":"Factorized learning assisted with large language model for gloss-free sign language translation","author":"Chen","year":"2024"},{"key":"10.1016\/j.cviu.2026.104646_b17","doi-asserted-by":"crossref","first-page":"17043","DOI":"10.52202\/068431-1240","article-title":"Two-stream network for sign language recognition and translation","volume":"35","author":"Chen","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.cviu.2026.104646_b18","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"7361","article-title":"Recurrent convolutional neural networks for continuous sign language recognition by staged optimization","author":"Cui","year":"2017"},{"issue":"7","key":"10.1016\/j.cviu.2026.104646_b19","doi-asserted-by":"crossref","first-page":"1880","DOI":"10.1109\/TMM.2018.2889563","article-title":"A deep neural framework for continuous sign language recognition by iterative training","volume":"21","author":"Cui","year":"2019","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.cviu.2026.104646_b20","first-page":"76893","article-title":"ASL citizen: a community-sourced dataset for advancing isolated sign language recognition","volume":"36","author":"Desai","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.cviu.2026.104646_b21","series-title":"IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"7887","article-title":"Sign language recognition: A large-scale multi-view dataset and comprehensive evaluation","author":"Dinh","year":"2025"},{"key":"10.1016\/j.cviu.2026.104646_b22","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"2735","article-title":"How2sign: a large-scale multimodal dataset for continuous american sign language","author":"Duarte","year":"2021"},{"key":"10.1016\/j.cviu.2026.104646_b23","series-title":"Proceedings of the 18th ACM SIGGRAPH International Conference on Virtual-Reality Continuum and Its Applications in Industry","first-page":"1","article-title":"Multi-view fusion for sign language recognition through knowledge transfer learning","author":"Gao","year":"2022"},{"key":"10.1016\/j.cviu.2026.104646_b24","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"18362","article-title":"Llms are good sign language translators","author":"Gong","year":"2024"},{"key":"10.1016\/j.cviu.2026.104646_b25","series-title":"HandTalk app","author":"HandTalk","year":"2024"},{"key":"10.1016\/j.cviu.2026.104646_b26","series-title":"Proceedings of the LREC 9th Workshop on the Representation and Processing of Sign Languages: Sign Language Resources in the Service of the Language Community, Technological Challenges and Application Perspectives","first-page":"75","article-title":"Extending the public DGS corpus in size and depth","author":"Hanke","year":"2020"},{"key":"10.1016\/j.cviu.2026.104646_b27","series-title":"Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"3429","article-title":"Hand pose guided 3d pooling for word-level sign language recognition","author":"Hosain","year":"2021"},{"key":"10.1016\/j.cviu.2026.104646_b28","first-page":"5450","article-title":"Dynamic spatial-temporal aggregation for skeleton-aware sign language recognition","volume":"vol. 8","author":"Hu","year":"2024"},{"key":"10.1016\/j.cviu.2026.104646_b29","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"11087","article-title":"Signbert: pre-training of hand-model-aware representation for sign language recognition","author":"Hu","year":"2021"},{"issue":"9","key":"10.1016\/j.cviu.2026.104646_b30","doi-asserted-by":"crossref","first-page":"2822","DOI":"10.1109\/TCSVT.2018.2870740","article-title":"Attention-based 3D-CNNs for large-vocabulary sign language recognition","volume":"29","author":"Huang","year":"2018","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.cviu.2026.104646_b31","first-page":"675","article-title":"Caffe: Convolutional architecture for fast feature embedding","volume":"vol. 11","author":"Jia","year":"2014"},{"key":"10.1016\/j.cviu.2026.104646_b32","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"3413","article-title":"Skeleton aware multi-modal sign language recognition","author":"Jiang","year":"2021"},{"key":"10.1016\/j.cviu.2026.104646_b33","series-title":"30th British Machine Vision Conference","first-page":"100","article-title":"MS-ASL: A large-scale data set and benchmark for understanding American sign language","author":"Joze","year":"2019"},{"key":"10.1016\/j.cviu.2026.104646_b34","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"1725","article-title":"Large-scale video classification with convolutional neural networks","author":"Karpathy","year":"2014"},{"issue":"13","key":"10.1016\/j.cviu.2026.104646_b35","doi-asserted-by":"crossref","first-page":"2683","DOI":"10.3390\/app9132683","article-title":"Neural sign language translation based on human keypoint estimation","volume":"9","author":"Ko","year":"2019","journal-title":"Appl. Sci."},{"issue":"9","key":"10.1016\/j.cviu.2026.104646_b36","doi-asserted-by":"crossref","first-page":"2306","DOI":"10.1109\/TPAMI.2019.2911077","article-title":"Weakly supervised learning with multi-stream CNN-LSTM-HMMs to discover sequential parallelism in sign language videos","volume":"42","author":"Koller","year":"2019","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.cviu.2026.104646_b37","doi-asserted-by":"crossref","DOI":"10.1016\/j.ijcci.2022.100542","article-title":"YoungDeafDesign: Participatory design with young deaf children","volume":"34","author":"Korte","year":"2022","journal-title":"Int. J. Child-Computer Interact."},{"key":"10.1016\/j.cviu.2026.104646_b38","series-title":"European Conference on Computer Vision","first-page":"264","article-title":"A plan for developing an auslan communication technologies pipeline","author":"Korte","year":"2020"},{"key":"10.1016\/j.cviu.2026.104646_b39","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"20740","article-title":"Human part-wise 3d motion context learning for sign language recognition","author":"Lee","year":"2023"},{"key":"10.1016\/j.cviu.2026.104646_b40","series-title":"The IEEE Winter Conference on Applications of Computer Vision","first-page":"1459","article-title":"Word-level deep sign language recognition from video: A new large-scale dataset and methods comparison","author":"Li","year":"2020"},{"key":"10.1016\/j.cviu.2026.104646_b41","first-page":"12034","article-title":"Tspnet: Hierarchical feature learning via temporal semantic pyramid for sign language translation","volume":"33","author":"Li","year":"2020","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.cviu.2026.104646_b42","series-title":"Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing","first-page":"1412","article-title":"Effective approaches to attention-based neural machine translation","author":"Luong","year":"2015"},{"key":"10.1016\/j.cviu.2026.104646_b43","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2022.118993","article-title":"A survey on sign language machine translation","volume":"213","author":"N\u00fa\u00f1ez Marcos","year":"2023","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.cviu.2026.104646_b44","series-title":"Proceedings. Fourth IEEE International Conference on Multimodal Interfaces","first-page":"167","article-title":"Purdue RVL-SLLL ASL database for automatic recognition of American sign language","author":"Mart\u00ednez","year":"2002"},{"key":"10.1016\/j.cviu.2026.104646_b45","series-title":"European Conference on Computer Vision","first-page":"237","article-title":"Real-time sign language detection using human pose estimation","author":"Moryossef","year":"2020"},{"key":"10.1016\/j.cviu.2026.104646_b46","series-title":"ChatGPT","author":"OpenAI","year":"2023"},{"key":"10.1016\/j.cviu.2026.104646_b47","series-title":"Pocket sign","author":"Pocket Sign","year":"2024"},{"key":"10.1016\/j.cviu.2026.104646_b48","series-title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"29920","article-title":"Grammamt: Improving machine translation with grammar-informed in-context learning","author":"Ramos","year":"2025"},{"key":"10.1016\/j.cviu.2026.104646_b49","series-title":"Proceedings of the ACM on Web Conference","first-page":"5212","article-title":"AuslanWeb: A scalable web-based Australian sign language communication system for deaf and hearing individuals","author":"Shen","year":"2025"},{"key":"10.1016\/j.cviu.2026.104646_b50","first-page":"69700","article-title":"MM-WLAuslan: Multi-view multi-modal word-level Australian sign language recognition dataset","volume":"37","author":"Shen","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.cviu.2026.104646_b51","series-title":"Diverse sign language translation","first-page":"1","author":"Shen","year":"2024"},{"key":"10.1016\/j.cviu.2026.104646_b52","first-page":"80455","article-title":"Auslan-daily: Australian sign language translation for daily communication and news","volume":"36","author":"Shen","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.cviu.2026.104646_b53","series-title":"ICASSP IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"7438","article-title":"Learning to select context in a hierarchical and global perspective for open-domain dialogue generation","author":"Shen","year":"2021"},{"key":"10.1016\/j.cviu.2026.104646_b54","series-title":"Proceedings of the 29th ACM International Conference on Multimedia","first-page":"4287","article-title":"Text is not enough: Integrating visual impressions into open-domain dialogue generation","author":"Shen","year":"2021"},{"key":"10.1016\/j.cviu.2026.104646_b55","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/s43681-024-00457-y","article-title":"AI empowered auslan learning for parents of deaf children and children of deaf adults","volume":"4","author":"Sheng","year":"2024","journal-title":"AI Ethics"},{"key":"10.1016\/j.cviu.2026.104646_b56","series-title":"Open-domain sign language translation learned from online video","author":"Shi","year":"2022"},{"key":"10.1016\/j.cviu.2026.104646_b57","series-title":"Proceedings of the European Conference on Computer Vision","first-page":"103","article-title":"Skeleton-based action recognition with spatial reasoning and temporal stack learning","author":"Si","year":"2018"},{"key":"10.1016\/j.cviu.2026.104646_b58","doi-asserted-by":"crossref","first-page":"181340","DOI":"10.1109\/ACCESS.2020.3028072","article-title":"AUTSL: A large scale multi-modal turkish sign language dataset and baseline methods","volume":"8","author":"Sincan","year":"2020","journal-title":"IEEE Access"},{"key":"10.1016\/j.cviu.2026.104646_b59","unstructured":"Smith,\u00a0R.T., Willoughby,\u00a0L., Johnston,\u00a0T., 2022. Integrating Auslan resources into the language data commons of Australia. In: Proceedings of the LREC2022 10th Workshop on the Representation and Processing of Sign Languages: Multilingual Sign Language Resources. pp. 181\u2013186."},{"key":"10.1016\/j.cviu.2026.104646_b60","first-page":"184","article-title":"Popsign ASL v1. 0: An isolated american sign language dataset collected via smartphones","volume":"36","author":"Starner","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.cviu.2026.104646_b61","series-title":"YouTube-SL-25: A large-scale, open-domain multilingual sign language parallel corpus","author":"Tanzer","year":"2024"},{"key":"10.1016\/j.cviu.2026.104646_b62","series-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023"},{"key":"10.1016\/j.cviu.2026.104646_b63","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"4489","article-title":"Learning spatiotemporal features with 3d convolutional networks","author":"Tran","year":"2015"},{"key":"10.1016\/j.cviu.2026.104646_b64","series-title":"Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"31","article-title":"Pose-based sign language recognition using GCN and BERT","author":"Tunga","year":"2021"},{"key":"10.1016\/j.cviu.2026.104646_b65","first-page":"29029","article-title":"Youtube-asl: A large-scale, open-domain american sign language-english parallel corpus","volume":"36","author":"Uthus","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.cviu.2026.104646_b66","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.cviu.2026.104646_b67","series-title":"8th IEEE International Conference on Automatic Face & Gesture Recognition","first-page":"1","article-title":"The significance of facial features for automatic sign language recognition","author":"Von Agris","year":"2008"},{"key":"10.1016\/j.cviu.2026.104646_b68","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2023.126523","article-title":"MPP-net: Multi-perspective perception network for dense video captioning","volume":"552","author":"Wei","year":"2023","journal-title":"Neurocomputing"},{"key":"10.1016\/j.cviu.2026.104646_b69","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"3164","article-title":"Learning to track for spatio-temporal action localization","author":"Weinzaepfel","year":"2015"},{"key":"10.1016\/j.cviu.2026.104646_b70","series-title":"Sign2GPT: Leveraging large language models for gloss-free sign language translation","first-page":"1","author":"Wong","year":"2024"},{"key":"10.1016\/j.cviu.2026.104646_b71","series-title":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics: System Demonstrations","first-page":"83","article-title":"Automatic gloss dictionary for sign language learners","author":"Xu","year":"2022"},{"key":"10.1016\/j.cviu.2026.104646_b72","first-page":"7444","article-title":"Spatial temporal graph convolutional networks for skeleton-based action recognition","volume":"vol. 32","author":"Yan","year":"2018"},{"key":"10.1016\/j.cviu.2026.104646_b73","series-title":"Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers)","first-page":"7347","article-title":"Including signed languages in natural language processing","author":"Yin","year":"2021"},{"key":"10.1016\/j.cviu.2026.104646_b74","series-title":"Proceedings of the 28th International Conference on Computational Linguistics","first-page":"5975","article-title":"Better sign language translation with STMC-transformer","author":"Yin","year":"2020"},{"key":"10.1016\/j.cviu.2026.104646_b75","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"2551","article-title":"Gloss attention for gloss-free sign language translation","author":"Yin","year":"2023"},{"key":"10.1016\/j.cviu.2026.104646_b76","series-title":"SIGGRAPH Asia 2023 Emerging Technologies","first-page":"1","article-title":"Visual-gestural interface for auslan virtual assistant","author":"Zelenskaya","year":"2023"},{"key":"10.1016\/j.cviu.2026.104646_b77","unstructured":"Zeng,\u00a0A., Liu,\u00a0X., Du,\u00a0Z., Wang,\u00a0Z., Lai,\u00a0H., Ding,\u00a0M., Yang,\u00a0Z., Xu,\u00a0Y., Zheng,\u00a0W., Xia,\u00a0X., Tam,\u00a0W.L., Ma,\u00a0Z., Xue,\u00a0Y., Zhai,\u00a0J., Chen,\u00a0W., Liu,\u00a0Z., Zhang,\u00a0P., Dong,\u00a0Y., Tang,\u00a0J., 2023. GLM-130B: An Open Bilingual Pre-trained Model. In: The Eleventh International Conference on Learning Representations. ICLR."},{"issue":"3","key":"10.1016\/j.cviu.2026.104646_b78","doi-asserted-by":"crossref","first-page":"248","DOI":"10.1016\/j.vrih.2021.05.004","article-title":"Teaching Chinese sign language with a smartphone","volume":"3","author":"Zhang","year":"2021","journal-title":"Virtual Real. Intell. Hardw."},{"key":"10.1016\/j.cviu.2026.104646_b79","doi-asserted-by":"crossref","first-page":"2662","DOI":"10.1109\/TMM.2021.3087006","article-title":"Conditional sentence generation and cross-modal reranking for sign language translation","volume":"24","author":"Zhao","year":"2021","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.cviu.2026.104646_b80","doi-asserted-by":"crossref","first-page":"4188","DOI":"10.1109\/TIP.2024.3416881","article-title":"Self-supervised representation learning with spatial-temporal consistency for sign language recognition","volume":"33","author":"Zhao","year":"2024","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.cviu.2026.104646_b81","doi-asserted-by":"crossref","first-page":"462","DOI":"10.1016\/j.neucom.2021.08.079","article-title":"Enhancing neural sign language translation by highlighting the facial expression information","volume":"464","author":"Zheng","year":"2021","journal-title":"Neurocomputing"},{"key":"10.1016\/j.cviu.2026.104646_b82","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"1316","article-title":"Improving sign language translation with monolingual data by sign back-translation","author":"Zhou","year":"2021"},{"key":"10.1016\/j.cviu.2026.104646_b83","doi-asserted-by":"crossref","first-page":"768","DOI":"10.1109\/TMM.2021.3059098","article-title":"Spatial-temporal multi-cue network for sign language recognition and translation","volume":"24","author":"Zhou","year":"2021","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.cviu.2026.104646_b84","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"14890","article-title":"Natural language-assisted sign language recognition","author":"Zuo","year":"2023"}],"container-title":["Computer Vision and Image Understanding"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1077314226000135?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1077314226000135?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T04:02:04Z","timestamp":1777608124000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1077314226000135"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,3]]},"references-count":84,"alternative-id":["S1077314226000135"],"URL":"https:\/\/doi.org\/10.1016\/j.cviu.2026.104646","relation":{},"ISSN":["1077-3142"],"issn-type":[{"value":"1077-3142","type":"print"}],"subject":[],"published":{"date-parts":[[2026,3]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Mobile Auslan: A multimodal dialogue-centered sign language learning system","name":"articletitle","label":"Article Title"},{"value":"Computer Vision and Image Understanding","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.cviu.2026.104646","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Author(s). Published by Elsevier Inc.","name":"copyright","label":"Copyright"}],"article-number":"104646"}}