{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,2]],"date-time":"2026-01-02T16:56:34Z","timestamp":1767372994847,"version":"3.28.0"},"reference-count":59,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,5,13]],"date-time":"2024-05-13T00:00:00Z","timestamp":1715558400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,5,13]],"date-time":"2024-05-13T00:00:00Z","timestamp":1715558400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,5,13]]},"DOI":"10.1109\/icra57147.2024.10611726","type":"proceedings-article","created":{"date-parts":[[2024,8,8]],"date-time":"2024-08-08T17:51:05Z","timestamp":1723139465000},"page":"4916-4923","source":"Crossref","is-referenced-by-count":9,"title":["Zero-Shot Open-Vocabulary Tracking with Large Pre-Trained Models"],"prefix":"10.1109","author":[{"given":"Wen-Hsuan","family":"Chu","sequence":"first","affiliation":[{"name":"Carnegie Mellon University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Adam W.","family":"Harley","sequence":"additional","affiliation":[{"name":"Stanford University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pavel","family":"Tokmakov","sequence":"additional","affiliation":[{"name":"Toyota Research Institute"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Achal","family":"Dave","sequence":"additional","affiliation":[{"name":"Toyota Research Institute"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Leonidas","family":"Guibas","sequence":"additional","affiliation":[{"name":"Stanford University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Katerina","family":"Fragkiadaki","sequence":"additional","affiliation":[{"name":"Carnegie Mellon University"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2008.4587583"},{"article-title":"A baseline for 3d multi-object tracking","year":"2019","author":"Weng","key":"ref2"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20077-9_21"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00795"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00103"},{"article-title":"The 2017 DAVIS challenge on video object segmentation","year":"2017","author":"Pont-Tuset","key":"ref7"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01228-1_36"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01060"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/WACV56688.2023.00172"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/icra57147.2024.10611409"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2010.232"},{"key":"ref13","doi-asserted-by":"crossref","DOI":"10.1109\/TPAMI.2016.2577031","article-title":"Faster R\u2013CNN: Towards real-time object detection with region proposal networks","volume-title":"NeurIPS","author":"Ren"},{"key":"ref14","article-title":"Trackformer: Multi-object tracking with transformers","author":"Meinhardt","year":"2021","journal-title":"CoRR"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00303"},{"key":"ref16","article-title":"Transtrack: Multiple-object tracking with transformer","author":"Sun","year":"2020","journal-title":"CoRR"},{"article-title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","year":"2023","author":"Liu","key":"ref17"},{"article-title":"Glipv2: Unifying localization and vision-language understanding","year":"2022","author":"Zhang","key":"ref18"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58548-8_28"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.2016.7533003"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.2017.8296962"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.394"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-021-01513-4"},{"key":"ref24","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"International conference on machine learning","author":"Radford"},{"article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","volume-title":"ICML","author":"Jia","key":"ref25"},{"article-title":"Bert: Pre-training of deep bidirectional transformers for language understanding","volume-title":"NAACL","author":"Devlin","key":"ref26"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/D14-1162"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01416"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01246-5_24"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6868"},{"article-title":"Open-vocabulary object detection via vision and language knowledge distillation","volume-title":"ICLR","author":"Gu","key":"ref31"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20080-9_42"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.1998.710861"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5539893"},{"issue":"6","key":"ref35","doi-asserted-by":"crossref","DOI":"10.1109\/TPAMI.2013.242","article-title":"Segmentation of moving objects by long term video analysis","volume":"36","author":"Ochs","year":"2013","journal-title":"TPAMI"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299035"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00060"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01846"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20047-2_29"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/icra.2018.8460975"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"article-title":"Attention is all you need","volume-title":"NeurIPS","author":"Vaswani","key":"ref42"},{"key":"ref43","article-title":"Recurrent tracking using multifold consistency","volume-title":"Proceedings of the Eleventh IEEE International Workshop on Performance Evaluation of Tracking and Surveillance","volume":"3","author":"Pan"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-15549-9_32"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58558-7_26"},{"key":"ref46","article-title":"Microsoft COCO: common objects in context","volume-title":"CoRR","volume":"abs\/1405.0312","author":"Lin","year":"2014"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00550"},{"article-title":"Rethinking space-time networks with improved memory coverage for efficient video object segmentation","volume-title":"NeurIPS","author":"Cheng","key":"ref48"},{"key":"ref49","article-title":"Mask2former for video instance segmentation","author":"Cheng","year":"2021","journal-title":"CoRR"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00529"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19815-1_34"},{"key":"ref52","article-title":"Track anything: Segment anything meets videos","author":"Yang","year":"2023","journal-title":"CoRR"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19815-1_37"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00932"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00142"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19803-8_43"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00661"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01471"},{"article-title":"Segment anything in high quality","year":"2023","author":"Ke","key":"ref59"}],"event":{"name":"2024 IEEE International Conference on Robotics and Automation (ICRA)","start":{"date-parts":[[2024,5,13]]},"location":"Yokohama, Japan","end":{"date-parts":[[2024,5,17]]}},"container-title":["2024 IEEE International Conference on Robotics and Automation (ICRA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10609961\/10609862\/10611726.pdf?arnumber=10611726","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,8,11]],"date-time":"2024-08-11T04:08:49Z","timestamp":1723349329000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10611726\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,5,13]]},"references-count":59,"URL":"https:\/\/doi.org\/10.1109\/icra57147.2024.10611726","relation":{},"subject":[],"published":{"date-parts":[[2024,5,13]]}}}