{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,7]],"date-time":"2025-06-07T04:03:20Z","timestamp":1749269000287,"version":"3.41.0"},"publisher-location":"Cham","reference-count":109,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031915772","type":"print"},{"value":"9783031915789","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-91578-9_1","type":"book-chapter","created":{"date-parts":[[2025,6,6]],"date-time":"2025-06-06T09:22:48Z","timestamp":1749201768000},"page":"1-32","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Electron microscopy image showing a detailed view of a surface with a textured, uneven pattern. The image highlights the fine structural details and variations in the surface morphology, typical of high-resolution electron microscopy. The grayscale tones emphasize the contrast between different areas, revealing intricate features and potential material composition differences. AirLetters A simple black and white symbol depicting a hand with three horizontal lines extending from the palm, representing a gesture or motion. The design is minimalistic and stylized. : An Open Vide A blue and white road sign with a red border, featuring a symbol of a bridge. The bridge icon is depicted in light blue against a white background, enclosed within a circular red border. The sign indicates the presence of a bridge or overpass. Dataset of\u00a0Characters Drawn in\u00a0the\u00a0Air"],"prefix":"10.1007","author":[{"given":"Rishit","family":"Dagli","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Guillaume","family":"Berger","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Joanna","family":"Materzynska","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ingo","family":"Bax","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Roland","family":"Memisevic","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,5,12]]},"reference":[{"key":"1_CR1","unstructured":"Abu-El-Haija, S., et al.: YouTube-8M: a large-scale video classification benchmark. In: arXiv:1609.08675 (2016). https:\/\/arxiv.org\/pdf\/1609.08675v1.pdf"},{"key":"1_CR2","doi-asserted-by":"crossref","unstructured":"Adelson, E.H., Bergen, J.R.: Spatiotemporal energy models for the perception of motion. J. Opt. Soc. Am. A Opt. Image Sci. 2(2), 284\u201399 (1985). https:\/\/api.semanticscholar.org\/CorpusID:5248006","DOI":"10.1364\/JOSAA.2.000284"},{"key":"1_CR3","unstructured":"Albanie, S., et al.: BBC-Oxford British sign language dataset (2021)"},{"key":"1_CR4","doi-asserted-by":"publisher","unstructured":"Athitsos, V., et al.: The American sign language lexicon video dataset. In: 2008 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, pp.\u00a01\u20138 (2008). https:\/\/doi.org\/10.1109\/CVPRW.2008.4563181","DOI":"10.1109\/CVPRW.2008.4563181"},{"key":"1_CR5","doi-asserted-by":"crossref","unstructured":"Bambach, S., Lee, S., Crandall, D.J., Yu, C.: Lending a hand: detecting hands and recognizing activities in complex egocentric interactions. In: Proceedings of the IEEE International Conference on Computer Vision (ICCV) (2015)","DOI":"10.1109\/ICCV.2015.226"},{"key":"1_CR6","doi-asserted-by":"crossref","unstructured":"Baraldi, L., Paci, F., Serra, G., Benini, L., Cucchiara, R.: Gesture recognition in ego-centric videos using dense trajectories and hand segmentation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) Workshops (2014)","DOI":"10.1109\/CVPRW.2014.107"},{"key":"1_CR7","doi-asserted-by":"crossref","unstructured":"Benitez-Garcia, G., Olivares-Mercado, J., Sanchez-Perez, G., Yanai, K.: IPN hand: a video dataset and benchmark for real-time continuous hand gesture recognition. In: 25th International Conference on Pattern Recognition, ICPR 2020, Milan, Italy, 10\u201315 January 2021, pp. 4340\u20134347. IEEE (2021)","DOI":"10.1109\/ICPR48806.2021.9412317"},{"key":"1_CR8","doi-asserted-by":"crossref","unstructured":"Boh\u00e1\u010dek, M., Hr\u00faz, M.: Sign pose-based transformer for word-level sign language recognition. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision (WACV) Workshops, pp. 182\u2013191 (2022)","DOI":"10.1109\/WACVW54805.2022.00024"},{"key":"1_CR9","doi-asserted-by":"crossref","unstructured":"Caba\u00a0Heilbron, F., Escorcia, V., Ghanem, B., Carlos\u00a0Niebles, J.: ActivityNet: a large-scale video benchmark for human activity understanding. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015)","DOI":"10.1109\/CVPR.2015.7298698"},{"key":"1_CR10","doi-asserted-by":"crossref","unstructured":"Camgoz, N.C., Hadfield, S., Koller, O., Ney, H., Bowden, R.: Neural sign language translation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2018)","DOI":"10.1109\/CVPR.2018.00812"},{"key":"1_CR11","doi-asserted-by":"publisher","unstructured":"Camgoz, N.C., Hadfield, S., Koller, O., Ney, H., Bowden, R.: Neural sign language translation. In: 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 7784\u20137793 (2018). https:\/\/doi.org\/10.1109\/CVPR.2018.00812","DOI":"10.1109\/CVPR.2018.00812"},{"key":"1_CR12","unstructured":"Camgoz, N.C., Koller, O., Hadfield, S., Bowden, R.: Sign language transformers: joint end-to-end sign language recognition and translation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2020)"},{"key":"1_CR13","doi-asserted-by":"crossref","unstructured":"Camgoz, N.C., et al.: Content4All open research sign language translation datasets (2021)","DOI":"10.1109\/FG52635.2021.9667087"},{"key":"1_CR14","doi-asserted-by":"publisher","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition? A new model and the kinetics dataset. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4724\u20134733 (2017). https:\/\/doi.org\/10.1109\/CVPR.2017.502","DOI":"10.1109\/CVPR.2017.502"},{"key":"1_CR15","unstructured":"Chai, X., Wanga, H., Zhoub, M., Wub, G., Lic, H., Chena, X.: DeviSign: dataset and evaluation for 3D sign language recognition. Technical report, Technical report, Beijing (2015)"},{"key":"1_CR16","unstructured":"Cheng, Z., et al.: VideoLLaMA 2: advancing spatial-temporal modeling and audio understanding in video-LLMs (2024). https:\/\/arxiv.org\/abs\/2406.07476"},{"key":"1_CR17","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"88","DOI":"10.1007\/978-3-540-75773-3_10","volume-title":"Human\u2013Computer Interaction","author":"H Cooper","year":"2007","unstructured":"Cooper, H., Bowden, R.: Large lexicon detection of sign language. In: Lew, M., Sebe, N., Huang, T.S., Bakker, E.M. (eds.) HCI 2007. LNCS, vol. 4796, pp. 88\u201397. Springer, Heidelberg (2007). https:\/\/doi.org\/10.1007\/978-3-540-75773-3_10"},{"key":"1_CR18","doi-asserted-by":"publisher","unstructured":"Cox, S., et al.: Tessa, a system to aid communication with deaf people. In: Proceedings of the Fifth International ACM Conference on Assistive Technologies, Assets 2002, pp. 205\u2013212. Association for Computing Machinery, New York (2002). https:\/\/doi.org\/10.1145\/638249.638287","DOI":"10.1145\/638249.638287"},{"issue":"8","key":"1_CR19","doi-asserted-by":"publisher","first-page":"1598","DOI":"10.1109\/TPAMI.2016.2537323","volume":"38","author":"CF Crispim-Junior","year":"2016","unstructured":"Crispim-Junior, C.F., et al.: Semantic event fusion of different visual modality concepts for activity recognition. IEEE Trans. Pattern Anal. Mach. Intell. 38(8), 1598\u20131611 (2016). https:\/\/doi.org\/10.1109\/TPAMI.2016.2537323","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1_CR20","doi-asserted-by":"crossref","unstructured":"Cui, R., Liu, H., Zhang, C.: Recurrent convolutional neural networks for continuous sign language recognition by staged optimization. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.175"},{"key":"1_CR21","doi-asserted-by":"publisher","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., Fei-Fei, L.: ImageNet: a large-scale hierarchical image database. In: 2009 IEEE Conference on Computer Vision and Pattern Recognition, pp. 248\u2013255 (2009). https:\/\/doi.org\/10.1109\/CVPR.2009.5206848","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"1_CR22","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"593","DOI":"10.1007\/978-3-030-58558-7_35","volume-title":"Computer Vision \u2013 ECCV 2020","author":"A Diba","year":"2020","unstructured":"Diba, A., et al.: Large scale holistic video understanding. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12350, pp. 593\u2013610. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58558-7_35"},{"key":"1_CR23","unstructured":"Dosovitskiy, A., et al.: An image is worth 16$$\\times $$16 words: transformers for image recognition at scale. In: International Conference on Learning Representations (2021). https:\/\/openreview.net\/forum?id=YicbFdNTTy"},{"key":"1_CR24","unstructured":"Dreuw, P., Deselaers, T., Keysers, D., Ney, H.: Modeling image variability in appearance-based gesture recognition. In: ECCV Workshop on Statistical Methods in Multi-image and Video Processing, pp. 7\u201318 (2006)"},{"key":"1_CR25","doi-asserted-by":"crossref","unstructured":"Duarte, A., et al.: How2Sign: a large-scale multimodal dataset for continuous American sign language. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2021)","DOI":"10.1109\/CVPR46437.2021.00276"},{"key":"1_CR26","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"657","DOI":"10.1007\/978-3-540-73279-2_73","volume-title":"Universal Acess in Human Computer Interaction. Coping with Diversity","author":"E Efthimiou","year":"2007","unstructured":"Efthimiou, E., Fotinea, S.-E.: GSLC: creation and annotation of a Greek sign language corpus for HCI. In: Stephanidis, C. (ed.) UAHCI 2007. LNCS, vol. 4554, pp. 657\u2013666. Springer, Heidelberg (2007). https:\/\/doi.org\/10.1007\/978-3-540-73279-2_73"},{"key":"1_CR27","doi-asserted-by":"publisher","unstructured":"Escalera, S., et al.: Chalearn multi-modal gesture recognition 2013: grand challenge and workshop summary. In: Proceedings of the 15th ACM on International Conference on Multimodal Interaction, ICMI 2013, pp. 365\u2013368. Association for Computing Machinery, New York (2013). https:\/\/doi.org\/10.1145\/2522848.2532597","DOI":"10.1145\/2522848.2532597"},{"key":"1_CR28","unstructured":"Fang, S., Wang, L., Zheng, C., Tian, Y., Chen, C.: SignLLM: sign languages production large language models (2024)"},{"key":"1_CR29","doi-asserted-by":"publisher","unstructured":"Fink, J., Fr\u00e9nay, B., Meurant, L., Cleve, A.: LSFB-CONT and LSFB-ISOL: two new datasets for vision-based sign language recognition. In: 2021 International Joint Conference on Neural Networks (IJCNN), pp.\u00a01\u20138 (2021). https:\/\/doi.org\/10.1109\/IJCNN52387.2021.9534336","DOI":"10.1109\/IJCNN52387.2021.9534336"},{"key":"1_CR30","unstructured":"Forster, J., et al.: RWTH-PHOENIX-weather: a large vocabulary sign language recognition and translation corpus. In: LREC, vol.\u00a09, pp. 3785\u20133789 (2012)"},{"key":"1_CR31","doi-asserted-by":"crossref","unstructured":"Garcia-Hernando, G., Yuan, S., Baek, S., Kim, T.K.: First-person hand action benchmark with RGB-D videos and 3D hand pose annotations. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2018)","DOI":"10.1109\/CVPR.2018.00050"},{"issue":"12","key":"1_CR32","doi-asserted-by":"publisher","first-page":"86","DOI":"10.1145\/3458723","volume":"64","author":"T Gebru","year":"2021","unstructured":"Gebru, T., et al.: Datasheets for datasets. Commun. ACM 64(12), 86\u201392 (2021)","journal-title":"Commun. ACM"},{"key":"1_CR33","doi-asserted-by":"crossref","unstructured":"Goyal, R., et al.: The \u201csomething something\u201d video database for learning and evaluating visual common sense. In: Proceedings of the IEEE International Conference on Computer Vision (ICCV) (2017)","DOI":"10.1109\/ICCV.2017.622"},{"key":"1_CR34","doi-asserted-by":"publisher","unstructured":"Grobel, K., Assan, M.: Isolated sign language recognition using hidden Markov models. In: 1997 IEEE International Conference on Systems, Man, and Cybernetics. Computational Cybernetics and Simulation, vol.\u00a01, pp. 162\u2013167 (1997). https:\/\/doi.org\/10.1109\/ICSMC.1997.625742","DOI":"10.1109\/ICSMC.1997.625742"},{"key":"1_CR35","doi-asserted-by":"crossref","unstructured":"Gu, C., et al.: AVA: a video dataset of spatio-temporally localized atomic visual actions. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2018)","DOI":"10.1109\/CVPR.2018.00633"},{"key":"1_CR36","unstructured":"Gueuwou, S., Takyi, K., M\u00fcller, M., Nyarko, M.S., Adade, R., Gyening, R.M.O.M.: AfriSign: machine translation for african sign languages. In: 4th Workshop on African Natural Language Processing (2023). https:\/\/openreview.net\/forum?id=EHldk3J2xk"},{"key":"1_CR37","unstructured":"Gugger, S., et al.: Accelerate: training and inference at scale made simple, efficient and adaptable. https:\/\/github.com\/huggingface\/accelerate (2022)"},{"key":"1_CR38","doi-asserted-by":"publisher","first-page":"123","DOI":"10.3758\/s13428-014-0560-1","volume":"48","author":"E Gutierrez-Sigut","year":"2016","unstructured":"Gutierrez-Sigut, E., Costello, B., Baus, C., Carreiras, M.: LSE-sign: a lexical database for Spanish sign language. Behav. Res. Methods 48, 123\u2013137 (2016)","journal-title":"Behav. Res. Methods"},{"key":"1_CR39","unstructured":"Hanke, T., Schulder, M., Konrad, R., Jahn, E.: Extending the public DGS corpus in size and depth. In: Sign-lang@ LREC 2020, pp. 75\u201382. European Language Resources Association (ELRA) (2020)"},{"key":"1_CR40","doi-asserted-by":"crossref","unstructured":"He, K., Chen, X., Xie, S., Li, Y., Doll\u2019ar, P., Girshick, R.: Masked autoencoders are scalable vision learners. arXiv:2111.06377 (2021)","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"1_CR41","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition (2015). https:\/\/arxiv.org\/abs\/1512.03385","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"1_CR42","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 9(8), 1735\u20131780 (1997). https:\/\/doi.org\/10.1162\/neco.1997.9.8.1735","journal-title":"Neural Comput."},{"key":"1_CR43","doi-asserted-by":"crossref","unstructured":"Huang, Y., Liu, X., Zhang, X., Jin, L.: A pointing gesture based egocentric interaction system: dataset, approach and application. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) Workshops (2016)","DOI":"10.1109\/CVPRW.2016.53"},{"key":"1_CR44","doi-asserted-by":"crossref","unstructured":"Joshi, A., Bhat, A., Pradeep, S., Gole, P., Gupta, S., Agarwal, S., Modi, A.: CISLR: corpus for Indian sign language recognition. In: Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing, pp. 10357\u201310366 (2022)","DOI":"10.18653\/v1\/2022.emnlp-main.707"},{"key":"1_CR45","unstructured":"Joze, H.R.V., Koller, O.: MS-ASL: a large-scale data set and benchmark for understanding American sign language (2019)"},{"key":"1_CR46","doi-asserted-by":"crossref","unstructured":"Kadir, T., Bowden, R., Ong, E.J., Zisserman, A.: Minimal training, large lexicon, unconstrained sign language recognition. In: BMVC, pp. 1\u201310 (2004)","DOI":"10.5244\/C.18.96"},{"key":"1_CR47","doi-asserted-by":"publisher","unstructured":"Kapuscinski, T., Oszust, M., Wysocki, M., Warchol, D.: Recognition of hand gestures observed by depth cameras. Int. J. Adv. Robot. Syst. 12(4), 36 (2015). https:\/\/doi.org\/10.5772\/60091","DOI":"10.5772\/60091"},{"key":"1_CR48","doi-asserted-by":"publisher","first-page":"743","DOI":"10.1007\/s11042-012-1117-x","volume":"69","author":"S Karaman","year":"2014","unstructured":"Karaman, S., et al.: Hierarchical hidden Markov model in detecting activities of daily living in wearable videos for studies of dementia. Multimed. Tools Appl. 69, 743\u2013771 (2014)","journal-title":"Multimed. Tools Appl."},{"key":"1_CR49","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., Fei-Fei, L.: Large-scale video classification with convolutional neural networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2014)","DOI":"10.1109\/CVPR.2014.223"},{"key":"1_CR50","doi-asserted-by":"publisher","unstructured":"Karpouzis, K., Caridakis, G., Fotinea, S.E., Efthimiou, E.: Educational resources and implementation of a Greek sign language synthesis architecture. Comput. Educ. 49(1), 54\u201374 (2007). https:\/\/doi.org\/10.1016\/j.compedu.2005.06.004, https:\/\/www.sciencedirect.com\/science\/article\/pii\/S0360131505000849. Web3D Technologies in Learning, Education and Training","DOI":"10.1016\/j.compedu.2005.06.004"},{"issue":"8","key":"1_CR51","doi-asserted-by":"publisher","first-page":"1415","DOI":"10.1109\/TPAMI.2008.167","volume":"31","author":"TK Kim","year":"2009","unstructured":"Kim, T.K., Cipolla, R.: Canonical correlation analysis of video volume tensors for action categorization and detection. IEEE Trans. Pattern Anal. Mach. Intell. 31(8), 1415\u20131428 (2009). https:\/\/doi.org\/10.1109\/TPAMI.2008.167","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1_CR52","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization (2017). https:\/\/arxiv.org\/abs\/1412.6980"},{"issue":"13","key":"1_CR53","doi-asserted-by":"publisher","first-page":"2683","DOI":"10.3390\/app9132683","volume":"9","author":"SK Ko","year":"2019","unstructured":"Ko, S.K., Kim, C.J., Jung, H., Cho, C.: Neural sign language translation based on human keypoint estimation. Appl. Sci. 9(13), 2683 (2019)","journal-title":"Appl. Sci."},{"key":"1_CR54","doi-asserted-by":"publisher","first-page":"108","DOI":"10.1016\/j.cviu.2015.09.013","volume":"141","author":"O Koller","year":"2015","unstructured":"Koller, O., Forster, J., Ney, H.: Continuous sign language recognition: towards large vocabulary statistical recognition systems handling multiple signers. Comput. Vis. Image Underst. 141, 108\u2013125 (2015)","journal-title":"Comput. Vis. Image Underst."},{"key":"1_CR55","doi-asserted-by":"publisher","unstructured":"Kuehne, H., Jhuang, H., Garrote, E., Poggio, T., Serre, T.: HMDB: a large video database for human motion recognition. In: 2011 International Conference on Computer Vision, pp. 2556\u20132563 (2011). https:\/\/doi.org\/10.1109\/ICCV.2011.6126543","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"1_CR56","doi-asserted-by":"crossref","unstructured":"Kumar, P., Vadakkepat, P., Loh, A.: Hand posture and face recognition using a fuzzy-rough approach (2010)","DOI":"10.1142\/S0219843610002180"},{"key":"1_CR57","unstructured":"Kurakin, A., Zhang, Z., Liu, Z.: A real time system for dynamic hand gesture recognition with a depth sensor. In: 2012 Proceedings of the 20th European Signal Processing Conference (EUSIPCO), pp. 1975\u20131979 (2012)"},{"key":"1_CR58","doi-asserted-by":"publisher","unstructured":"Laptev, I., Marszalek, M., Schmid, C., Rozenfeld, B.: Learning realistic human actions from movies. In: 2008 IEEE Conference on Computer Vision and Pattern Recognition, pp.\u00a01\u20138 (2008). https:\/\/doi.org\/10.1109\/CVPR.2008.4587756","DOI":"10.1109\/CVPR.2008.4587756"},{"key":"1_CR59","doi-asserted-by":"publisher","unstructured":"Li, D., Opazo, C.R., Yu, X., Li, H.: Word-level deep sign language recognition from video: a new large-scale dataset and methods comparison. In: 2020 IEEE Winter Conference on Applications of Computer Vision (WACV), pp. 1448\u20131458 (2020). https:\/\/doi.org\/10.1109\/WACV45572.2020.9093512","DOI":"10.1109\/WACV45572.2020.9093512"},{"key":"1_CR60","doi-asserted-by":"crossref","unstructured":"Lin, B., Ye, Y., Zhu, B., Cui, J., Ning, M., Jin, P., Yuan, L.: Video-LLaVA: learning united visual representation by alignment before projection (2023)","DOI":"10.18653\/v1\/2024.emnlp-main.342"},{"key":"1_CR61","doi-asserted-by":"crossref","unstructured":"Liu, D., Zhang, L., Wu, Y.: LD-ConGR: a large RGB-D video dataset for long-distance continuous gesture recognition. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00330"},{"key":"1_CR62","unstructured":"Liu, L., Shao, L.: Learning discriminative representations from RGB-D video data. In: Proceedings of the Twenty-Third International Joint Conference on Artificial Intelligence, IJCAI 2013, pp. 1493\u20131500. AAAI Press (2013)"},{"key":"1_CR63","unstructured":"Loshchilov, I., Hutter, F.: Decoupled weight decay regularization. In: International Conference on Learning Representations (2019). https:\/\/openreview.net\/forum?id=Bkg6RiCqY7"},{"key":"1_CR64","doi-asserted-by":"publisher","unstructured":"Lu, P., Huenerfauth, M.: Collecting and evaluating the CUNY ASL corpus for research on american sign language animation. Comput. Speech Lang. 28(3), 812\u2013831 (2014). https:\/\/doi.org\/10.1016\/j.csl.2013.10.004, https:\/\/www.sciencedirect.com\/science\/article\/pii\/S0885230813000879","DOI":"10.1016\/j.csl.2013.10.004"},{"key":"1_CR65","doi-asserted-by":"crossref","unstructured":"Materzynska, J., Berger, G., Bax, I., Memisevic, R.: The jester dataset: a large-scale video dataset of human gestures. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV) Workshops (2019)","DOI":"10.1109\/ICCVW.2019.00349"},{"key":"1_CR66","doi-asserted-by":"publisher","unstructured":"Mazumder, S., Mukhopadhyay, R., Namboodiri, V.P., Jawahar, C.V.: Translating sign language videos to talking faces. In: Proceedings of the Twelfth Indian Conference on Computer Vision, Graphics and Image Processing, ICVGIP 2021. Association for Computing Machinery, New York (2021). https:\/\/doi.org\/10.1145\/3490035.3490286","DOI":"10.1145\/3490035.3490286"},{"key":"1_CR67","doi-asserted-by":"publisher","first-page":"551","DOI":"10.1007\/s10209-015-0407-2","volume":"15","author":"J McDonald","year":"2016","unstructured":"McDonald, J., Wolfe, R., Schnepp, J., Hochgesang, J., Jamrozik, D.G., Stumbo, M., Berke, L., Bialek, M., Thomas, F.: An automated technique for real-time production of lifelike animations of American sign language. Univ. Access Inf. Soc. 15, 551\u2013566 (2016)","journal-title":"Univ. Access Inf. Soc."},{"key":"1_CR68","doi-asserted-by":"publisher","first-page":"27","DOI":"10.1007\/s11042-016-4223-3","volume":"77","author":"A Memo","year":"2018","unstructured":"Memo, A., Zanuttigh, P.: Head-mounted gesture controlled interface for human-computer interaction. Multimed. Tools Appl. 77, 27\u201353 (2018)","journal-title":"Multimed. Tools Appl."},{"key":"1_CR69","unstructured":"Mercier, A., et al.: Is end-to-end learning enough for fitness activity recognition? arXiv preprint arXiv:2305.08191 (2023)"},{"key":"1_CR70","doi-asserted-by":"crossref","unstructured":"Molchanov, P., Yang, X., Gupta, S., Kim, K., Tyree, S., Kautz, J.: Online detection and classification of dynamic hand gestures with recurrent 3D convolutional neural network. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2016)","DOI":"10.1109\/CVPR.2016.456"},{"key":"1_CR71","series-title":"Lecture Notes in Computer Science (Lecture Notes in Artificial Intelligence)","doi-asserted-by":"publisher","first-page":"602","DOI":"10.1007\/978-3-030-29859-3_51","volume-title":"Hybrid Artificial Intelligent Systems","author":"NT Nguen","year":"2019","unstructured":"Nguen, N.T., Sako, S., Kwolek, B.: Deep CNN-based recognition of JSL finger spelling. In: P\u00e9rez Garc\u00eda, H., S\u00e1nchez Gonz\u00e1lez, L., Castej\u00f3n Limas, M., Quinti\u00e1n Pardo, H., Corchado Rodr\u00edguez, E. (eds.) HAIS 2019. LNCS (LNAI), vol. 11734, pp. 602\u2013613. Springer, Cham (2019). https:\/\/doi.org\/10.1007\/978-3-030-29859-3_51"},{"issue":"6","key":"1_CR72","doi-asserted-by":"publisher","first-page":"2368","DOI":"10.1109\/TITS.2014.2337331","volume":"15","author":"E Ohn-Bar","year":"2014","unstructured":"Ohn-Bar, E., Trivedi, M.M.: Hand gesture recognition in real time for automotive interfaces: a multimodal vision-based approach and evaluations. IEEE Trans. Intell. Transp. Syst. 15(6), 2368\u20132377 (2014). https:\/\/doi.org\/10.1109\/TITS.2014.2337331","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"key":"1_CR73","unstructured":"Paszke, A., et al.: PyTorch: an imperative style, high-performance deep learning library. In: Wallach, H., Larochelle, H., Beygelzimer, A., d\u2019Alch\u00e9-Buc, F., Fox, E., Garnett, R. (eds.) Advances in Neural Information Processing Systems, vol.\u00a032. Curran Associates, Inc. (2019). https:\/\/proceedings.neurips.cc\/paper_files\/paper\/2019\/file\/bdbca288fee7f92f2bfa9f7012727740-Paper.pdf"},{"key":"1_CR74","doi-asserted-by":"publisher","unstructured":"Pugeault, N., Bowden, R.: Spelling it out: real-time ASL fingerspelling recognition. In: 2011 IEEE International Conference on Computer Vision Workshops (ICCV Workshops), pp. 1114\u20131119 (2011). https:\/\/doi.org\/10.1109\/ICCVW.2011.6130290","DOI":"10.1109\/ICCVW.2011.6130290"},{"key":"1_CR75","unstructured":"Qian, Y., et al.: Advancing human action recognition with foundation models trained on unlabeled public videos (2024)"},{"key":"1_CR76","unstructured":"Quiroga, F., Corbal\u00e1n, L.C.: A novel competitive neural classifier for gesture recognition with small training sets. In: XVIII Congreso Argentino de Ciencias de la Computaci\u00f3n (CACIC) (2013)"},{"key":"1_CR77","doi-asserted-by":"crossref","unstructured":"Rogez, G., Supancic, III, J.S., Ramanan, D.: Understanding everyday hands in action from RGB-D images. In: Proceedings of the IEEE International Conference on Computer Vision (ICCV) (2015)","DOI":"10.1109\/ICCV.2015.443"},{"key":"1_CR78","unstructured":"Ronchetti, F., Quiroga, F.M., Estrebou, C., Lanzarini, L., Rosete, A.: LSA64: an Argentinian sign language dataset (2023)"},{"key":"1_CR79","doi-asserted-by":"publisher","unstructured":"Ruffieux, S., Lalanne, D., Mugellini, E.: ChAirGest: a challenge for multimodal mid-air gesture recognition for close HCI. In: Proceedings of the 15th ACM on International Conference on Multimodal Interaction, ICMI 2013, pp. 483\u2013488. Association for Computing Machinery, New York (2013). https:\/\/doi.org\/10.1145\/2522848.2532590","DOI":"10.1145\/2522848.2532590"},{"key":"1_CR80","doi-asserted-by":"publisher","unstructured":"Schuldt, C., Laptev, I., Caputo, B.: Recognizing human actions: a local SVM approach. In: 2004 Proceedings of the 17th International Conference on Pattern Recognition, ICPR 2004, vol.\u00a03, pp. 32\u201336 (2004). https:\/\/doi.org\/10.1109\/ICPR.2004.1334462","DOI":"10.1109\/ICPR.2004.1334462"},{"key":"1_CR81","doi-asserted-by":"publisher","unstructured":"Segouat, J.: A study of sign language coarticulation. SIGACCESS Access. Comput. (93), 31\u201338 (2009). https:\/\/doi.org\/10.1145\/1531930.1531935","DOI":"10.1145\/1531930.1531935"},{"key":"1_CR82","doi-asserted-by":"crossref","unstructured":"Selvaraj, P., NC, G., Kumar, P., Khapra, M.: Openhands: making sign language recognition accessible with pose-based pretrained models across languages (2021)","DOI":"10.18653\/v1\/2022.acl-long.150"},{"key":"1_CR83","doi-asserted-by":"crossref","unstructured":"Shi, B., Brentari, D., Shakhnarovich, G., Livescu, K.: Open-domain sign language translation learned from online video (2022)","DOI":"10.18653\/v1\/2022.emnlp-main.427"},{"key":"1_CR84","doi-asserted-by":"publisher","unstructured":"Shi, B., et al.: American sign language fingerspelling recognition in the wild. In: 2018 IEEE Spoken Language Technology Workshop (SLT), pp. 145\u2013152 (2018). https:\/\/doi.org\/10.1109\/SLT.2018.8639639","DOI":"10.1109\/SLT.2018.8639639"},{"key":"1_CR85","doi-asserted-by":"publisher","unstructured":"Shi, B., Rio, A.M.D., Keane, J., Brentari, D., Shakhnarovich, G., Livescu, K.: Fingerspelling recognition in the wild with iterative visual attention. In: 2019 IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 5399\u20135408 (2019). https:\/\/doi.org\/10.1109\/ICCV.2019.00550","DOI":"10.1109\/ICCV.2019.00550"},{"key":"1_CR86","doi-asserted-by":"publisher","unstructured":"Shohieb, S.M., Elminir, H.K., Riad, A.: Signsworld atlas; a benchmark Arabic sign language database. J. King Saud Univ. - Comput. Inf. Sci. 27(1), 68\u201376 (2015). https:\/\/doi.org\/10.1016\/j.jksuci.2014.03.011, https:\/\/www.sciencedirect.com\/science\/article\/pii\/S1319157814000548","DOI":"10.1016\/j.jksuci.2014.03.011"},{"key":"1_CR87","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"510","DOI":"10.1007\/978-3-319-46448-0_31","volume-title":"Computer Vision \u2013 ECCV 2016","author":"GA Sigurdsson","year":"2016","unstructured":"Sigurdsson, G.A., Varol, G., Wang, X., Farhadi, A., Laptev, I., Gupta, A.: Hollywood in homes: crowdsourcing data collection for activity understanding. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9905, pp. 510\u2013526. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46448-0_31"},{"key":"1_CR88","doi-asserted-by":"publisher","unstructured":"Song, Y., Demirdjian, D., Davis, R.: Tracking body and hands for gesture recognition: Natops aircraft handling signals database. In: 2011 IEEE International Conference on Automatic Face & Gesture Recognition (FG), pp. 500\u2013506 (2011). https:\/\/doi.org\/10.1109\/FG.2011.5771448","DOI":"10.1109\/FG.2011.5771448"},{"key":"1_CR89","unstructured":"Soomro, K., Zamir, A.R., Shah, M.: UCF101: a dataset of 101 human actions classes from videos in the wild (2012)"},{"key":"1_CR90","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Vanhoucke, V., Ioffe, S., Shlens, J., Wojna, Z.: Rethinking the inception architecture for computer vision. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2016)","DOI":"10.1109\/CVPR.2016.308"},{"key":"1_CR91","doi-asserted-by":"crossref","unstructured":"Tang, Y., et al.: COIN: a large-scale dataset for comprehensive instructional video analysis. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2019)","DOI":"10.1109\/CVPR.2019.00130"},{"key":"1_CR92","unstructured":"Tong, Z., Song, Y., Wang, J., Wang, L.: VideoMAE: masked autoencoders are data-efficient learners for self-supervised video pre-training. In: Koyejo, S., Mohamed, S., Agarwal, A., Belgrave, D., Cho, K., Oh, A. (eds.) Advances in Neural Information Processing Systems, vol.\u00a035, pp. 10078\u201310093. Curran Associates, Inc. (2022). https:\/\/proceedings.neurips.cc\/paper_files\/paper\/2022\/file\/416f9cb3276121c42eebb86352a4354a-Paper-Conference.pdf"},{"key":"1_CR93","doi-asserted-by":"publisher","unstructured":"Tu, Z., et al.: MaxViT: multi-axis vision transformer. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022, Part XXIV. LNCS, vol. 13684, pp. 459\u2013479. Springer, Heidelberg (2022). https:\/\/doi.org\/10.1007\/978-3-031-20053-3_27","DOI":"10.1007\/978-3-031-20053-3_27"},{"key":"1_CR94","unstructured":"Uthus, D., Tanzer, G., Georg, M.: YouTube-ASL: a large-scale, open-domain American sign language-English parallel corpus (2023)"},{"key":"1_CR95","unstructured":"Von\u00a0Agris, U., Kraiss, K.F.: Towards a video corpus for signer-independent continuous sign language recognition. In: Gesture in Human-Computer Interaction and Simulation, Lisbon, Portugal, vol. 11, no. 2 (2007)"},{"key":"1_CR96","doi-asserted-by":"crossref","unstructured":"Voskou, A., Panousis, K.P., Partaourides, H., Tolias, K., Chatzis, S.: A new dataset for end-to-end sign language translation: the Greek elementary school dataset. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV) Workshops, pp. 1966\u20131975 (2023)","DOI":"10.1109\/ICCVW60793.2023.00211"},{"key":"1_CR97","doi-asserted-by":"crossref","unstructured":"Wan, J., Zhao, Y., Zhou, S., Guyon, I., Escalera, S., Li, S.Z.: Chalearn looking at people RGB-D isolated and continuous datasets for gesture recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) Workshops (2016)","DOI":"10.1109\/CVPRW.2016.100"},{"key":"1_CR98","doi-asserted-by":"publisher","unstructured":"Wightman, R.: PyTorch image models (2019). https:\/\/github.com\/rwightman\/pytorch-image-models, https:\/\/doi.org\/10.5281\/zenodo.4414861","DOI":"10.5281\/zenodo.4414861"},{"key":"1_CR99","unstructured":"Wightman, R., Touvron, H., Jegou, H.: ResNet strikes back: an improved training procedure in timm. In: NeurIPS 2021 Workshop on ImageNet: Past, Present, and Future (2021). https:\/\/openreview.net\/forum?id=NG6MJnVl6M5"},{"key":"1_CR100","unstructured":"Wilbur, R., Kak, A.C.: Purdue RVL-SLLL American sign language database (2006)"},{"key":"1_CR101","unstructured":"Wolf, T., et al.: Transformers: state-of-the-art natural language processing, pp. 38\u201345. Association for Computational Linguistics (2020). https:\/\/www.aclweb.org\/anthology\/2020.emnlp-demos.6"},{"key":"1_CR102","doi-asserted-by":"crossref","unstructured":"Xie, S., Girshick, R., Dollar, P., Tu, Z., He, K.: Aggregated residual transformations for deep neural networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.634"},{"key":"1_CR103","doi-asserted-by":"publisher","unstructured":"Yin, A., Zhao, Z., Jin, W., Zhang, M., Zeng, X., He, X.: MLSLT: towards multilingual sign language translation. In: 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 5099\u20135109 (2022). https:\/\/doi.org\/10.1109\/CVPR52688.2022.00505","DOI":"10.1109\/CVPR52688.2022.00505"},{"key":"1_CR104","doi-asserted-by":"crossref","unstructured":"Yuan, S., Ye, Q., Stenger, B., Jain, S., Kim, T.K.: BigHand2.2M benchmark: hand pose dataset and state of the art analysis. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.279"},{"key":"1_CR105","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"401","DOI":"10.1007\/11550518_50","volume-title":"Pattern Recognition","author":"M Zahedi","year":"2005","unstructured":"Zahedi, M., Keysers, D., Deselaers, T., Ney, H.: Combination of tangent distance and an image distortion model for appearance-based sign language recognition. In: Kropatsch, W.G., Sablatnig, R., Hanbury, A. (eds.) DAGM 2005. LNCS, vol. 3663, pp. 401\u2013408. Springer, Heidelberg (2005). https:\/\/doi.org\/10.1007\/11550518_50"},{"key":"1_CR106","doi-asserted-by":"crossref","unstructured":"Zhang, X., et al.: VideoLT: large-scale long-tailed video recognition (2021)","DOI":"10.1109\/ICCV48922.2021.00786"},{"issue":"5","key":"1_CR107","doi-asserted-by":"publisher","first-page":"1038","DOI":"10.1109\/TMM.2018.2808769","volume":"20","author":"Y Zhang","year":"2018","unstructured":"Zhang, Y., Cao, C., Cheng, J., Lu, H.: EgoGesture: a new dataset and benchmark for egocentric hand gesture recognition. IEEE Trans. Multimedia 20(5), 1038\u20131050 (2018). https:\/\/doi.org\/10.1109\/TMM.2018.2808769","journal-title":"IEEE Trans. Multimedia"},{"key":"1_CR108","doi-asserted-by":"crossref","unstructured":"Zhou, H., Zhou, W., Qi, W., Pu, J., Li, H.: Improving sign language translation with monolingual data by sign back-translation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1316\u20131325 (2021)","DOI":"10.1109\/CVPR46437.2021.00137"},{"key":"1_CR109","unstructured":"Zisserman, A., et al.: The kinetics human action video dataset (2017)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024 Workshops"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-91578-9_1","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,6]],"date-time":"2025-06-06T09:23:12Z","timestamp":1749201792000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-91578-9_1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9783031915772","9783031915789"],"references-count":109,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-91578-9_1","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"12 May 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}