{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,20]],"date-time":"2026-02-20T07:09:47Z","timestamp":1771571387263,"version":"3.50.1"},"reference-count":43,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,11,25]],"date-time":"2025-11-25T00:00:00Z","timestamp":1764028800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,11,25]],"date-time":"2025-11-25T00:00:00Z","timestamp":1764028800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,11,25]]},"DOI":"10.1109\/fllm67465.2025.11390966","type":"proceedings-article","created":{"date-parts":[[2026,2,19]],"date-time":"2026-02-19T20:55:46Z","timestamp":1771534546000},"page":"976-981","source":"Crossref","is-referenced-by-count":0,"title":["GestOS: Advanced Hand Gesture Interpretation via Large Language Models to control Any Type of Robot"],"prefix":"10.1109","author":[{"given":"Artem","family":"Lykov","sequence":"first","affiliation":[{"name":"Skoltech,ISR Lab,Moscow,Russia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Oleg","family":"Kobzarev","sequence":"additional","affiliation":[{"name":"Skoltech,ISR Lab,Moscow,Russia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dzmitry","family":"Tsetserukou","sequence":"additional","affiliation":[{"name":"Skoltech,ISR Lab,Moscow,Russia"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/tcyb.2021.3129119"},{"key":"ref2","article-title":"Gesture-based Human-Machine Interaction: Taxonomy, Problem Definition, and Analysis","author":"Robinson","year":"2023","journal-title":"ACM Transactions on Human-Robot Interaction"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.54254\/2755-2721\/36\/20230429"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2023.3321337"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1016\/S1364-6613(99)01397-2"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1016\/j.ergon.2017.02.004"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1145\/3577190.3614158"},{"key":"ref8","article-title":"Hand Gesture Recognition Using Haar Cascade Algorithm in MediaPipe for Sign Language and Gesture Control","author":"Arokia Renjith","year":"2014","journal-title":"Journal of Emerging Technologies and Innovative Research."},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/5.18626"},{"key":"ref10","article-title":"Visual Recognition of American Sign Language Using Hidden Markov Models","volume-title":"Proc. Int. Symp. Comput. Vis","author":"Starner"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/s00530-013-0332-2"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/IADCC.2010.5423024"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01370"},{"key":"ref14","article-title":"MediaPipe: A Framework for Building Perception Pipelines","author":"Lugaresi"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/icra55743.2025.11128224"},{"key":"ref16","article-title":"GPT-4 Technical Report"},{"key":"ref17","article-title":"PaLM: Scaling Language Modeling with Pathways","author":"Chowdhery","year":"2022"},{"key":"ref18","article-title":"LLaMA: Open and Efficient Foundation Language Models","author":"Touvron"},{"key":"ref19","article-title":"OpenAI o1 System Card"},{"key":"ref20","article-title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","author":"Huang","year":"2022"},{"key":"ref21","article-title":"Swarm-GPT: Combining Large Language Models with Safe Motion Planning for Robot Choreography Design","author":"Jiao","year":"2023"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ISMAR-Adjunct64951.2024.00141"},{"key":"ref23","article-title":"Flamingo: A Visual Language Model for Few-Shot Learning","author":"Alayrac","year":"2022"},{"key":"ref24","article-title":"Visual Instruction Tuning","author":"Liu","year":"2023","journal-title":"NeurIPS"},{"key":"ref25","article-title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","author":"Bai","year":"2023"},{"key":"ref26","article-title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","author":"Lu","year":"2024"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/3610978.3641080"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1145\/3698145"},{"key":"ref29","article-title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","volume-title":"7th Annual Conference on Robot Learning","author":"Zitkovich"},{"key":"ref30","article-title":"Openvla: An open-source vision-language-action model","author":"Kim","year":"2024"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01710"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00167"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.494"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/MRA.2010.936947"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2023.3236952"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/IROS58592.2024.10801907"},{"key":"ref37","article-title":"OPEN TEACH: A Versatile Teleoperation System for Robotic Manipulation","author":"Iyer","year":"2024"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/icra57147.2024.10610216"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48891.2023.10160390"},{"key":"ref40","article-title":"HaGRID \u2013 HAnd Gesture Recognition Image Dataset","author":"Kapitanov"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2010.5543273"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01075"},{"key":"ref43","article-title":"Keyframe Extraction Techniques: A Review","volume":"19","author":"Sadiq","year":"2020","journal-title":"ELEKTRIKA- Journal of Electrical Engineering"}],"event":{"name":"2025 3rd International Conference on Foundation and Large Language Models (FLLM)","location":"Vienna, Austria","start":{"date-parts":[[2025,11,25]]},"end":{"date-parts":[[2025,11,28]]}},"container-title":["2025 3rd International Conference on Foundation and Large Language Models (FLLM)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11390736\/11390873\/11390966.pdf?arnumber=11390966","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,20]],"date-time":"2026-02-20T06:42:15Z","timestamp":1771569735000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11390966\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,11,25]]},"references-count":43,"URL":"https:\/\/doi.org\/10.1109\/fllm67465.2025.11390966","relation":{},"subject":[],"published":{"date-parts":[[2025,11,25]]}}}