{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,9]],"date-time":"2026-03-09T05:20:19Z","timestamp":1773033619049,"version":"3.50.1"},"reference-count":66,"publisher":"IEEE","license":[{"start":{"date-parts":[[2020,5,1]],"date-time":"2020-05-01T00:00:00Z","timestamp":1588291200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2020,5,1]],"date-time":"2020-05-01T00:00:00Z","timestamp":1588291200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2020,5,1]],"date-time":"2020-05-01T00:00:00Z","timestamp":1588291200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2020,5]]},"DOI":"10.1109\/icra40945.2020.9197528","type":"proceedings-article","created":{"date-parts":[[2020,9,15]],"date-time":"2020-09-15T21:25:46Z","timestamp":1600205146000},"page":"10045-10051","source":"Crossref","is-referenced-by-count":17,"title":["AVOT: Audio-Visual Object Tracking of Multiple Objects for Robotics"],"prefix":"10.1109","author":[{"given":"Justin","family":"Wilson","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ming C.","family":"Lin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","article-title":"SSD: Single Shot MultiBox Detector","author":"liu","year":"2015","journal-title":"CoRR"},{"key":"ref38","article-title":"Looking Fast and Slow: Memory-Guided Mobile Video Object Detection","author":"liu","year":"2019","journal-title":"CoRR"},{"key":"ref33","first-page":"1097","article-title":"ImageNet Classification with Deep Convolutional Neural Networks","volume":"25","author":"krizhevsky","year":"2012","journal-title":"Advances in neural information processing systems"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2516982"},{"key":"ref31","article-title":"Adam: A method for stochastic optimization","author":"kingma","year":"2015","journal-title":"International Conference on Learning Representations (ICLR)"},{"key":"ref30","article-title":"Comparison of time-frequency representations for environmental sound classification using convolutional neural networks","author":"huzaifah","year":"2017","journal-title":"CoRR"},{"key":"ref37","article-title":"Microsoft COCO: Common Objects in Context","author":"lin","year":"2014","journal-title":"CoRR"},{"key":"ref36","article-title":"TSM: Temporal Shift Module for Efficient Video Understanding","author":"lin","year":"2018","journal-title":"CoRR"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00935"},{"key":"ref34","first-page":"255","author":"lecun","year":"1998","journal-title":"Convolutional networks for images speech and time series The handbook of brain theory and neural networks"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2014.2388226"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01240-3_10"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01228-1_36"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.141"},{"key":"ref28","article-title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","author":"howard","year":"2017","journal-title":"CoRR"},{"key":"ref64","first-page":"1278","article-title":"Shape and Material from Sound","author":"zhang","year":"2017","journal-title":"Advances in Neural Information Processing Systems (NIPS)"},{"key":"ref27","article-title":"Object detection and tracking with audio and optical signals","author":"holz","year":"0","journal-title":"United States Patent"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.52"},{"key":"ref66","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-030-01240-3_7","article-title":"Distractor-aware siamese networks for visual object tracking","author":"zhu","year":"2018"},{"key":"ref29","article-title":"Densely Connected Convolutional Networks","author":"huang","year":"2016","journal-title":"CoRR"},{"key":"ref2","author":"anusha","year":"2015","journal-title":"Object Tracking from Audio and Video data using Linear Prediction method"},{"key":"ref1","article-title":"TensorFlow: Large-Scale Machine Learning on Heterogeneous Systems","author":"abadi","year":"2015","journal-title":"Software"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2006.215"},{"key":"ref22","article-title":"Towards a better match in siamese network based visual object tracker","author":"he","year":"2018","journal-title":"European Conf on Comp Vision Workshop"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.123"},{"key":"ref24","author":"he","year":"2018","journal-title":"Rethinking imagenet pre-training"},{"key":"ref23","article-title":"Deep Residual Learning for Image Recognition","author":"he","year":"2015","journal-title":"CoRR"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2014.2345390"},{"key":"ref25","article-title":"Learning to Track at 100 FPS with Deep Regression Networks","author":"held","year":"2016","journal-title":"Proceedings of the European Conference on Computer Vision (ECCV)"},{"key":"ref50","first-page":"91","article-title":"Faster R-CNN: Towards Real-time Object Detection with Region Proposal Networks","author":"ren","year":"2015","journal-title":"Proceedings of the 28th International Conference on Neural Information Processing Systems - Volume 1"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"ref59","author":"wang","year":"2018","journal-title":"Fast online object tracking and segmentation A unifying approach"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00813"},{"key":"ref57","first-page":"2805","author":"valmadre","year":"2017","journal-title":"End-to-end representation learning for correlation filter based tracking"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01267-0_34"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.2001.959036"},{"key":"ref54","article-title":"Visual tracking: An experimental survey","author":"smeulders","year":"2014","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"ref53","article-title":"Very deep convolutional networks for large-scale image recognition","author":"simonyan","year":"2015","journal-title":"NIPS"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2001.990499"},{"key":"ref10","article-title":"The 2019 DAVIS Challenge on VOS: Unsupervised Multi-Object Segmentation","author":"caelles","year":"2019","journal-title":"CoRR"},{"key":"ref11","article-title":"Person tracking using audio-video sensor fusion","volume":"2002","author":"checka","year":"2001","journal-title":"MIT Artificial Intelligence Laboratory"},{"key":"ref40","article-title":"Discriminative Correlation Filter with Channel and Spatial Reliability","volume":"126","author":"lukezic","year":"2016","journal-title":"International Journal of Computer Vision"},{"key":"ref12","author":"chen","year":"2018","journal-title":"Optimizing Video Object Detection via a Scale-Time Lattice"},{"key":"ref13","author":"chollet","year":"2015","journal-title":"Keras"},{"key":"ref14","article-title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","author":"ephrat","year":"2018","journal-title":"CoRR"},{"key":"ref15","author":"everingham","year":"0","journal-title":"The PASCAL Visual Object Classes Challenge 2012 (VOC2012) Results"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-014-0733-5"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6248074"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"ref19","first-page":"47","article-title":"Real-time Tracking via Online Boosting","volume":"1","author":"grabner","year":"2006","journal-title":"Proceedings British Machine Vision Conference (BMVC)"},{"key":"ref4","article-title":"Objects that Sound","author":"arandjelovic","year":"2017","journal-title":"CoRR"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.73"},{"key":"ref6","article-title":"Visual tracking with online Mulitple Instance Learning","author":"babenko","year":"2009","journal-title":"IEEE Conference on Computer Vision and Pattern Recognition (CVPR)"},{"key":"ref5","first-page":"892","article-title":"Soundnet: Learning sound representations from unlabeled video","author":"aytar","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5539960"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-48881-3_56"},{"key":"ref49","article-title":"You Only Look Once: Unified, Real-Time Object Detection","author":"redmon","year":"2015","journal-title":"CoRR"},{"key":"ref9","article-title":"The OpenCV Library","author":"bradski","year":"2000","journal-title":"Dr Dobb? Journal of Software Tools"},{"key":"ref46","article-title":"A benchmark dataset and evaluation methodology for video object segmentation","author":"perazzi","year":"2017","journal-title":"IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01219-9_35"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2019.2902489"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2014.2355207"},{"key":"ref42","article-title":"MOT16: A Benchmark for Multi-Object Tracking","author":"milan","year":"2016","journal-title":"CVPR"},{"key":"ref41","article-title":"Detect or Track: Towards Cost-Effective Video Object Detection\/Tracking","author":"luo","year":"2018","journal-title":"CoRR"},{"key":"ref44","article-title":"Multimodal Deep Learning","author":"ngiam","year":"2011","journal-title":"Proceedings of the 28th International Conference on Machine Learning"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2006.479"}],"event":{"name":"2020 IEEE International Conference on Robotics and Automation (ICRA)","location":"Paris, France","start":{"date-parts":[[2020,5,31]]},"end":{"date-parts":[[2020,8,31]]}},"container-title":["2020 IEEE International Conference on Robotics and Automation (ICRA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9187508\/9196508\/09197528.pdf?arnumber=9197528","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,6,28]],"date-time":"2022-06-28T00:11:53Z","timestamp":1656375113000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9197528\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,5]]},"references-count":66,"URL":"https:\/\/doi.org\/10.1109\/icra40945.2020.9197528","relation":{},"subject":[],"published":{"date-parts":[[2020,5]]}}}