{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,4]],"date-time":"2026-02-04T17:57:51Z","timestamp":1770227871274,"version":"3.49.0"},"publisher-location":"Cham","reference-count":112,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031198359","type":"print"},{"value":"9783031198366","type":"electronic"}],"license":[{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022]]},"DOI":"10.1007\/978-3-031-19836-6_16","type":"book-chapter","created":{"date-parts":[[2022,10,21]],"date-time":"2022-10-21T09:04:58Z","timestamp":1666343098000},"page":"271-291","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":7,"title":["Camera Pose Estimation and\u00a0Localization with\u00a0Active Audio Sensing"],"prefix":"10.1007","author":[{"given":"Karren","family":"Yang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Michael","family":"Firman","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Eric","family":"Brachmann","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Cl\u00e9ment","family":"Godard","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,10,22]]},"reference":[{"key":"16_CR1","doi-asserted-by":"crossref","unstructured":"Arandjelovic, R., Gronat, P., Torii, A., Pajdla, T., Sivic, J.: NetVLAD: CNN architecture for weakly supervised place recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.572"},{"key":"16_CR2","doi-asserted-by":"crossref","unstructured":"Arandjelovic, R., Zisserman, A.: Look, listen and learn. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.73"},{"key":"16_CR3","unstructured":"Babenko, A., Lempitsky, V.: Aggregating local deep features for image retrieval. In: ICCV (2015)"},{"key":"16_CR4","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"782","DOI":"10.1007\/978-3-030-01264-9_46","volume-title":"Computer Vision \u2013 ECCV 2018","author":"V Balntas","year":"2018","unstructured":"Balntas, V., Li, S., Prisacariu, V.: RelocNet: continuous metric learning relocalisation using neural nets. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) Computer Vision \u2013 ECCV 2018. LNCS, vol. 11218, pp. 782\u2013799. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01264-9_46"},{"key":"16_CR5","doi-asserted-by":"crossref","unstructured":"Balntas, V., Riba, E., Ponsa, D., Mikolajczyk, K.: Learning local feature descriptors with triplets and shallow convolutional neural networks. In: BMVC (2016)","DOI":"10.5244\/C.30.119"},{"key":"16_CR6","doi-asserted-by":"crossref","unstructured":"Bhowmik, A., Gumhold, S., Rother, C., Brachmann, E.: Reinforced feature points: optimizing feature detection and description for a high-level task. In: CVPR, June 2020","DOI":"10.1109\/CVPR42600.2020.00500"},{"key":"16_CR7","doi-asserted-by":"crossref","unstructured":"Brachmann, E., et al.: DSAC - differentiable RANSAC for camera localization. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.267"},{"key":"16_CR8","doi-asserted-by":"crossref","unstructured":"Brachmann, E., Michel, F., Krull, A., Yang, M.Y., Gumhold, S., Rother, C.: Uncertainty-driven 6d pose estimation of objects and scenes from a single RGB image. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.366"},{"key":"16_CR9","doi-asserted-by":"crossref","unstructured":"Brachmann, E., Rother, C.: Learning less is more - 6D camera localization via 3D surface regression. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00489"},{"key":"16_CR10","doi-asserted-by":"crossref","unstructured":"Brachmann, E., Rother, C.: Expert sample consensus applied to camera re-localization. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00762"},{"key":"16_CR11","doi-asserted-by":"crossref","unstructured":"Brachmann, E., Rother, C.: Neural-guided RANSAC: learning where to sample model hypotheses. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00442"},{"key":"16_CR12","doi-asserted-by":"crossref","unstructured":"Brachmann, E., Rother, C.: Visual camera re-localization from RGB and RGB-D images using DSAC. TPAMI (2021)","DOI":"10.1109\/TPAMI.2021.3070754"},{"key":"16_CR13","doi-asserted-by":"crossref","unstructured":"Brahmbhatt, S., Gu, J., Kim, K., Hays, J., Kautz, J.: Geometry-aware learning of maps for camera localization. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00277"},{"key":"16_CR14","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"139","DOI":"10.1007\/978-3-030-58523-5_9","volume-title":"Computer Vision \u2013 ECCV 2020","author":"M Bui","year":"2020","unstructured":"Bui, M., et al.: 6D camera relocalization in ambiguous scenes via continuous multimodal inference. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12363, pp. 139\u2013157. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58523-5_9"},{"key":"16_CR15","doi-asserted-by":"crossref","unstructured":"Cai, R., Hariharan, B., Snavely, N., Averbuch-Elor, H.: Extreme rotation estimation using dense correlation volumes. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.01433"},{"key":"16_CR16","doi-asserted-by":"crossref","unstructured":"Castle, R., Klein, G., Murray, D.W.: Video-rate localization in multiple maps for wearable augmented reality. In: 2008 12th IEEE International Symposium on Wearable Computers, pp. 15\u201322. IEEE (2008)","DOI":"10.1109\/ISWC.2008.4911577"},{"key":"16_CR17","doi-asserted-by":"crossref","unstructured":"Chang, A., et al.: Matterport3D: learning from RGB-D data in indoor environments. In: 3DV (2017)","DOI":"10.1109\/3DV.2017.00081"},{"key":"16_CR18","doi-asserted-by":"crossref","unstructured":"Chen, C., Al-Halah, Z., Grauman, K.: Semantic audio-visual navigation. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.01526"},{"key":"16_CR19","first-page":"103","volume":"97","author":"C Chen","year":"2019","unstructured":"Chen, C., et al.: Audio-visual embodied navigation. Environment 97, 103 (2019)","journal-title":"Environment"},{"key":"16_CR20","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"17","DOI":"10.1007\/978-3-030-58539-6_2","volume-title":"Computer Vision \u2013 ECCV 2020","author":"C Chen","year":"2020","unstructured":"Chen, C., et al.: SoundSpaces: audio-visual navigation in\u00a03D\u00a0environments. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12351, pp. 17\u201336. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58539-6_2"},{"key":"16_CR21","doi-asserted-by":"crossref","unstructured":"Chen, C., Majumder, S., Al-Halah, Z., Gao, R., Ramakrishnan, S.K., Grauman, K.: Learning to set waypoints for audio-visual navigation. arXiv preprint arXiv:2008.09622 (2020)","DOI":"10.1109\/CVPR46437.2021.01526"},{"key":"16_CR22","doi-asserted-by":"crossref","unstructured":"Chen, K., Snavely, N., Makadia, A.: Wide-baseline relative camera pose estimation with directional learning. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00327"},{"key":"16_CR23","unstructured":"Chen, Z., Hu, X., Owens, A.: Structure from silence: learning scene structure from ambient sound. arXiv preprint arXiv:2111.05846 (2021)"},{"key":"16_CR24","doi-asserted-by":"crossref","unstructured":"Christensen, J.H., Hornauer, S., Stella, X.Y.: Batvision: learning to see 3D spatial layout with two ears. In: ICRA (2020)","DOI":"10.1109\/ICRA40945.2020.9196934"},{"key":"16_CR25","doi-asserted-by":"publisher","first-page":"139","DOI":"10.1016\/j.procs.2015.12.327","volume":"76","author":"A Debski","year":"2015","unstructured":"Debski, A., Grajewski, W., Zaborowski, W., Turek, W.: Open-source localization device for indoor mobile robots. Procedia Comput. Sci. 76, 139\u2013146 (2015)","journal-title":"Procedia Comput. Sci."},{"issue":"30","key":"16_CR26","doi-asserted-by":"publisher","first-page":"12186","DOI":"10.1073\/pnas.1221464110","volume":"110","author":"I Dokmani\u0107","year":"2013","unstructured":"Dokmani\u0107, I., Parhizkar, R., Walther, A., Lu, Y.M., Vetterli, M.: Acoustic echoes reveal room shape. Proc. Natl. Acad. Sci. 110(30), 12186\u201312191 (2013)","journal-title":"Proc. Natl. Acad. Sci."},{"key":"16_CR27","doi-asserted-by":"crossref","unstructured":"Dusmanu, M., et al.: D2-net: a trainable CNN for joint detection and description of local features. arXiv preprint arXiv:1905.03561 (2019)","DOI":"10.1109\/CVPR.2019.00828"},{"issue":"9","key":"16_CR28","doi-asserted-by":"publisher","DOI":"10.1371\/journal.pcbi.1006406","volume":"14","author":"I Eliakim","year":"2018","unstructured":"Eliakim, I., Cohen, Z., Kosa, G., Yovel, Y.: A fully autonomous terrestrial bat-like acoustic robot. PLoS Comput. Biol. 14(9), e1006406 (2018)","journal-title":"PLoS Comput. Biol."},{"key":"16_CR29","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"738","DOI":"10.1007\/978-3-030-11009-3_46","volume-title":"Computer Vision \u2013 ECCV 2018 Workshops","author":"S En","year":"2019","unstructured":"En, S., Lechervy, A., Jurie, F.: RPNet: an end-to-end network for relative camera pose estimation. In: Leal-Taix\u00e9, L., Roth, S. (eds.) ECCV 2018. LNCS, vol. 11129, pp. 738\u2013745. Springer, Cham (2019). https:\/\/doi.org\/10.1007\/978-3-030-11009-3_46"},{"issue":"6","key":"16_CR30","doi-asserted-by":"publisher","first-page":"381","DOI":"10.1145\/358669.358692","volume":"24","author":"MA Fischler","year":"1981","unstructured":"Fischler, M.A., Bolles, R.C.: Random sample consensus: a paradigm for model fitting with applications to image analysis and automated cartography. Commun. ACM 24(6), 381\u2013395 (1981)","journal-title":"Commun. ACM"},{"key":"16_CR31","unstructured":"Fisher III, J.W., Darrell, T., Freeman, W., Viola, P.: Learning joint statistical models for audio-visual fusion and segregation. In: NeurIPS (2000)"},{"key":"16_CR32","doi-asserted-by":"crossref","unstructured":"Gan, C., Zhao, H., Chen, P., Cox, D., Torralba, A.: Self-supervised moving vehicle tracking with stereo sound. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00715"},{"key":"16_CR33","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"658","DOI":"10.1007\/978-3-030-58545-7_38","volume-title":"Computer Vision \u2013 ECCV 2020","author":"R Gao","year":"2020","unstructured":"Gao, R., Chen, C., Al-Halah, Z., Schissler, C., Grauman, K.: VisualEchoes: spatial image representation learning through echolocation. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12354, pp. 658\u2013676. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58545-7_38"},{"key":"16_CR34","doi-asserted-by":"crossref","unstructured":"Gao, R., Grauman, K.: 2.5D visual sound. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00041"},{"key":"16_CR35","doi-asserted-by":"crossref","unstructured":"Gao, R., Oh, T.H., Grauman, K., Torresani, L.: Listen to look: action recognition by previewing audio. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.01047"},{"key":"16_CR36","doi-asserted-by":"crossref","unstructured":"Garg, S., Fischer, T., Milford, M.: Where is your place, visual place recognition? IJCAI (2021)","DOI":"10.24963\/ijcai.2021\/603"},{"issue":"11","key":"16_CR37","doi-asserted-by":"publisher","first-page":"21","DOI":"10.1109\/MCG.1986.276658","volume":"6","author":"N Greene","year":"1986","unstructured":"Greene, N.: Environment mapping and other applications of world projections. IEEE Comput. Graphics Appl. 6(11), 21\u201329 (1986)","journal-title":"IEEE Comput. Graphics Appl."},{"key":"16_CR38","doi-asserted-by":"crossref","unstructured":"Hausler, S., Garg, S., Xu, M., Milford, M., Fischer, T.: Patch-NetVLAD: multi-scale fusion of locally-global descriptors for place recognition. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.01392"},{"key":"16_CR39","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"16_CR40","unstructured":"Hershey, J., Movellan, J.: Audio vision: using audio-visual synchrony to locate sounds. In: NeurIPS (1999)"},{"key":"16_CR41","doi-asserted-by":"crossref","unstructured":"Hu, J., Ozay, M., Zhang, Y., Okatani, T.: Revisiting single image depth estimation: toward higher resolution maps with accurate object boundaries. In: WACV (2019)","DOI":"10.1109\/WACV.2019.00116"},{"key":"16_CR42","unstructured":"Humenberger, M., et al.: Robust image retrieval-based visual localization using Kapture. arXiv:2007.13867 (2020)"},{"key":"16_CR43","doi-asserted-by":"crossref","unstructured":"J\u00e9gou, H., Douze, M., Schmid, C., P\u00e9rez, P.: Aggregating local descriptors into a compact image representation. In: CVPR (2010)","DOI":"10.1109\/CVPR.2010.5540039"},{"key":"16_CR44","doi-asserted-by":"crossref","unstructured":"Kazakos, E., Nagrani, A., Zisserman, A., Damen, D.: Epic-fusion: audio-visual temporal binding for egocentric action recognition. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00559"},{"key":"16_CR45","doi-asserted-by":"crossref","unstructured":"Kendall, A., Cipolla, R.: Geometric loss functions for camera pose regression with deep learning. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.694"},{"key":"16_CR46","doi-asserted-by":"crossref","unstructured":"Kendall, A., Grimes, M., Cipolla, R.: PoseNet: a convolutional network for real-time 6-DOF camera relocalization. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.336"},{"key":"16_CR47","unstructured":"Kidron, E., Schechner, Y.Y., Elad, M.: Pixels that sound. In: CVPR (2005)"},{"key":"16_CR48","doi-asserted-by":"crossref","unstructured":"Laskar, Z., Melekhov, I., Kalia, S., Kannala, J.: Camera relocalization by computing pairwise relative poses using convolutional neural network. In: ICCV Workshops (2017)","DOI":"10.1109\/ICCVW.2017.113"},{"key":"16_CR49","doi-asserted-by":"crossref","unstructured":"Li, X., Wang, S., Zhao, Y., Verbeek, J., Kannala, J.: Hierarchical scene coordinate classification and regression for visual localization. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.01200"},{"key":"16_CR50","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"791","DOI":"10.1007\/978-3-642-15552-9_57","volume-title":"Computer Vision \u2013 ECCV 2010","author":"Y Li","year":"2010","unstructured":"Li, Y., Snavely, N., Huttenlocher, D.P.: Location recognition using prioritized feature matching. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010. LNCS, vol. 6312, pp. 791\u2013804. Springer, Heidelberg (2010). https:\/\/doi.org\/10.1007\/978-3-642-15552-9_57"},{"key":"16_CR51","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"15","DOI":"10.1007\/978-3-642-33718-5_2","volume-title":"Computer Vision \u2013 ECCV 2012","author":"Y Li","year":"2012","unstructured":"Li, Y., Snavely, N., Huttenlocher, D., Fua, P.: Worldwide pose estimation using 3D point clouds. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012. LNCS, vol. 7572, pp. 15\u201329. Springer, Heidelberg (2012). https:\/\/doi.org\/10.1007\/978-3-642-33718-5_2"},{"key":"16_CR52","unstructured":"Lim, H., Sinha, S.N., Cohen, M.F., Uyttendaele, M.: Real-time image-based 6-dof localization in large-scale environments. In: CVPR (2012)"},{"key":"16_CR53","doi-asserted-by":"crossref","unstructured":"Lindell, D.B., Wetzstein, G., Koltun, V.: Acoustic non-line-of-sight imaging. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00694"},{"key":"16_CR54","doi-asserted-by":"crossref","unstructured":"Liu, D., Cui, Y., Yan, L., Mousas, C., Yang, B., Chen, Y.: Densernet: weakly supervised visual localization using multi-scale feature aggregation. In: Proceedings of the AAAI Conference on Artificial Intelligence (2021)","DOI":"10.1609\/aaai.v35i7.16760"},{"key":"16_CR55","doi-asserted-by":"crossref","unstructured":"Long, X., Gan, C., De Melo, G., Wu, J., Liu, X., Wen, S.: Attention clusters: purely attention based local feature integration for video classification. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00817"},{"key":"16_CR56","doi-asserted-by":"publisher","first-page":"19516","DOI":"10.1109\/ACCESS.2021.3054937","volume":"9","author":"C Masone","year":"2021","unstructured":"Masone, C., Caputo, B.: A survey on deep visual place recognition. IEEE Access 9, 19516\u201319547 (2021)","journal-title":"IEEE Access"},{"key":"16_CR57","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"675","DOI":"10.1007\/978-3-319-70353-4_57","volume-title":"Advanced Concepts for Intelligent Vision Systems","author":"I Melekhov","year":"2017","unstructured":"Melekhov, I., Ylioinas, J., Kannala, J., Rahtu, E.: Relative camera pose estimation using convolutional neural networks. In: Blanc-Talon, J., Penne, R., Philips, W., Popescu, D., Scheunders, P. (eds.) ACIVS 2017. LNCS, vol. 10617, pp. 675\u2013687. Springer, Cham (2017). https:\/\/doi.org\/10.1007\/978-3-319-70353-4_57"},{"key":"16_CR58","unstructured":"Morgado, P., Li, Y., Nvasconcelos, N.: Learning representations from audio-visual spatial alignment. In: NeurIPS, vol. 33, 4733\u20134744 (2020)"},{"key":"16_CR59","unstructured":"Morgado, P., Nvasconcelos, N., Langlois, T., Wang, O.: Self-supervised generation of spatial audio for 360 video. In: NeurIPS, vol. 31 (2018)"},{"key":"16_CR60","doi-asserted-by":"crossref","unstructured":"Morgado, P., Vasconcelos, N., Misra, I.: Audio-visual instance discrimination with cross-modal agreement. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.01229"},{"key":"16_CR61","unstructured":"Ngiam, J., Khosla, A., Kim, M., Nam, J., Lee, H., Ng, A.Y.: Multimodal deep learning. In: ICML (2011)"},{"key":"16_CR62","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"639","DOI":"10.1007\/978-3-030-01231-1_39","volume-title":"Computer Vision \u2013 ECCV 2018","author":"A Owens","year":"2018","unstructured":"Owens, A., Efros, A.A.: Audio-visual scene analysis with self-supervised multisensory features. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) ECCV 2018. LNCS, vol. 11210, pp. 639\u2013658. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01231-1_39"},{"key":"16_CR63","doi-asserted-by":"crossref","unstructured":"Owens, A., Isola, P., McDermott, J., Torralba, A., Adelson, E.H., Freeman, W.T.: Visually indicated sounds. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.264"},{"key":"16_CR64","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"801","DOI":"10.1007\/978-3-319-46448-0_48","volume-title":"Computer Vision \u2013 ECCV 2016","author":"A Owens","year":"2016","unstructured":"Owens, A., Wu, J., McDermott, J.H., Freeman, W.T., Torralba, A.: Ambient sound provides supervision for visual learning. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9905, pp. 801\u2013816. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46448-0_48"},{"key":"16_CR65","doi-asserted-by":"crossref","unstructured":"Parida, K.K., Srivastava, S., Sharma, G.: Beyond image to depth: improving depth prediction using echoes. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00817"},{"key":"16_CR66","doi-asserted-by":"publisher","first-page":"684","DOI":"10.1109\/TASLP.2020.3047233","volume":"29","author":"A Politis","year":"2020","unstructured":"Politis, A., Mesaros, A., Adavanne, S., Heittola, T., Virtanen, T.: Overview and evaluation of sound event localization and detection in dcase 2019. IEEE\/ACM Trans. Audio Speech Language Process. 29, 684\u2013698 (2020)","journal-title":"IEEE\/ACM Trans. Audio Speech Language Process."},{"key":"16_CR67","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"485","DOI":"10.1007\/978-3-030-11015-4_35","volume-title":"Computer Vision \u2013 ECCV 2018 Workshops","author":"O Poursaeed","year":"2019","unstructured":"Poursaeed, O., et al.: Deep fundamental matrix estimation without correspondences. In: Leal-Taix\u00e9, L., Roth, S. (eds.) ECCV 2018. LNCS, vol. 11131, pp. 485\u2013497. Springer, Cham (2019). https:\/\/doi.org\/10.1007\/978-3-030-11015-4_35"},{"key":"16_CR68","doi-asserted-by":"crossref","unstructured":"Purushwalkam, S., et al.: Audio-visual floorplan reconstruction. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00122"},{"key":"16_CR69","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"500","DOI":"10.1007\/978-3-540-88688-4_37","volume-title":"Computer Vision \u2013 ECCV 2008","author":"R Raguram","year":"2008","unstructured":"Raguram, R., Frahm, J.-M., Pollefeys, M.: A comparative analysis of RANSAC techniques leading to adaptive real-time random sample consensus. In: Forsyth, D., Torr, P., Zisserman, A. (eds.) ECCV 2008. LNCS, vol. 5303, pp. 500\u2013513. Springer, Heidelberg (2008). https:\/\/doi.org\/10.1007\/978-3-540-88688-4_37"},{"key":"16_CR70","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"292","DOI":"10.1007\/978-3-030-01246-5_18","volume-title":"Computer Vision \u2013 ECCV 2018","author":"R Ranftl","year":"2018","unstructured":"Ranftl, R., Koltun, V.: Deep fundamental matrix estimation. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) ECCV 2018. LNCS, vol. 11205, pp. 292\u2013309. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01246-5_18"},{"key":"16_CR71","unstructured":"Revaud, J., Weinzaepfel, P., de Souza, C.R., Humenberger, M.: R2D2: repeatable and reliable detector and descriptor. In: NeurIPS (2019)"},{"key":"16_CR72","unstructured":"de Sa, V.R.: Learning classification with unlabeled data. In: NeurIPS (1994)"},{"key":"16_CR73","doi-asserted-by":"crossref","unstructured":"Sarlin, P.E., Cadena, C., Siegwart, R., Dymczyk, M.: From coarse to fine: robust hierarchical localization at large scale. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.01300"},{"key":"16_CR74","doi-asserted-by":"crossref","unstructured":"Sarlin, P.E., DeTone, D., Malisiewicz, T., Rabinovich, A.: Superglue: learning feature matching with graph neural networks. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00499"},{"key":"16_CR75","doi-asserted-by":"crossref","unstructured":"Sarlin, P.E., et al.: Back to the feature: learning robust camera localization from pixels to pose. In: CVPR (2021). arxiv.org\/abs\/2103.09213","DOI":"10.1109\/CVPR46437.2021.00326"},{"key":"16_CR76","doi-asserted-by":"crossref","unstructured":"Sattler, T., Havlena, M., Radenovic, F., Schindler, K., Pollefeys, M.: Hyperpoints and fine vocabularies for large-scale location recognition. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.243"},{"key":"16_CR77","doi-asserted-by":"publisher","unstructured":"Sattler, T., Leibe, B., Kobbelt, L.: Improving image-based localization by active correspondence search. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012. LNCS, vol. 7572, pp. 752\u2013765. Springer, Heidelberg (2012). https:\/\/doi.org\/10.1007\/978-3-642-33718-5_54","DOI":"10.1007\/978-3-642-33718-5_54"},{"key":"16_CR78","doi-asserted-by":"crossref","unstructured":"Sattler, T., Leibe, B., Kobbelt, L.: Efficient & effective prioritized matching for large-scale image-based localization. In: PAMI (2017)","DOI":"10.1109\/TPAMI.2016.2611662"},{"key":"16_CR79","doi-asserted-by":"crossref","unstructured":"Sattler, T., et al..: Are large-scale 3D models really necessary for accurate visual localization? In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.654"},{"key":"16_CR80","doi-asserted-by":"crossref","unstructured":"Savva, M., et al.: Habitat: a platform for embodied AI research. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00943"},{"key":"16_CR81","doi-asserted-by":"crossref","unstructured":"Shavit, Y., Ferens, R., Keller, Y.: Learning multi-scene absolute pose regression with transformers. In: ICCV, pp. 2733\u20132742, October 2021","DOI":"10.1109\/ICCV48922.2021.00273"},{"key":"16_CR82","doi-asserted-by":"crossref","unstructured":"Shotton, J., Glocker, B., Zach, C., Izadi, S., Criminisi, A., Fitzgibbon, A.: Scene coordinate regression forests for camera relocalization in RGB-D images. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.377"},{"key":"16_CR83","doi-asserted-by":"crossref","unstructured":"Singh, N., Mentch, J., Ng, J., Beveridge, M., Drori, I.: Image2reverb: cross-modal reverb impulse response synthesis. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00035"},{"issue":"6","key":"16_CR84","doi-asserted-by":"publisher","first-page":"1526","DOI":"10.1109\/TBME.2015.2393371","volume":"62","author":"J Sohl-Dickstein","year":"2015","unstructured":"Sohl-Dickstein, J., et al.: A device for human ultrasonic echolocation. IEEE Trans. Biomed. Eng. 62(6), 1526\u20131534 (2015)","journal-title":"IEEE Trans. Biomed. Eng."},{"key":"16_CR85","unstructured":"Straub, J., et al.: The replica dataset: a digital replica of indoor spaces. arXiv preprint arXiv:1906.05797 (2019)"},{"key":"16_CR86","doi-asserted-by":"crossref","unstructured":"Sun, J., Shen, Z., Wang, Y., Bao, H., Zhou, X.: LoFTR: detector-free local feature matching with transformers. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00881"},{"key":"16_CR87","doi-asserted-by":"crossref","unstructured":"Sun, W., Jiang, W., Trulls, E., Tagliasacchi, A., Yi, K.M.: ACNe: attentive context normalization for robust permutation-equivariant learning. In: CVPR, June 2020","DOI":"10.1109\/CVPR42600.2020.01130"},{"key":"16_CR88","doi-asserted-by":"crossref","unstructured":"Svarm, L., Enqvist, O., Oskarsson, M., Kahl, F.: Accurate localization and pose estimation for large 3D models. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.75"},{"key":"16_CR89","doi-asserted-by":"crossref","unstructured":"Sv\u00e4rm, L., Enqvist, O., Kahl, F., Oskarsson, M.: City-scale localization for cameras with known vertical direction. TPAMI (2017)","DOI":"10.1109\/TPAMI.2016.2598331"},{"key":"16_CR90","doi-asserted-by":"crossref","unstructured":"Taira, H., et aal.: InLoc: indoor visual localization with dense matching and view synthesis. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00752"},{"key":"16_CR91","doi-asserted-by":"crossref","unstructured":"Taira, H., et al.: InLoc: indoor visual localization with dense matching and view synthesis. In: TPAMI (2021)","DOI":"10.1109\/TPAMI.2019.2952114"},{"key":"16_CR92","doi-asserted-by":"crossref","unstructured":"Taubner, F., Tschopp, F., Novkovic, T., Siegwart, R., Furrer, F.: LCD-line clustering and description for place recognition. In: 2020 International Conference on 3D Vision (3DV) (2020)","DOI":"10.1109\/3DV50981.2020.00101"},{"key":"16_CR93","unstructured":"Thrun, S.: Affine structure from sound. In: NeurIPS (2005)"},{"key":"16_CR94","doi-asserted-by":"crossref","unstructured":"Torii, A., Arandjelovic, R., Sivic, J., Okutomi, M., Pajdla, T.: 24\/7 place recognition by view synthesis. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298790"},{"key":"16_CR95","doi-asserted-by":"crossref","unstructured":"T\u00fcrko\u011flu, M.\u00d6., Brachmann, E., Schindler, K., Brostow, G., Monszpart, A.: Visual camera re-localization using graph neural networks and relative pose supervision. In: 3DV. IEEE (2021)","DOI":"10.1109\/3DV53792.2021.00025"},{"key":"16_CR96","unstructured":"Tyszkiewicz, M., Fua, P., Trulls, E.: Disk: learning local features with policy gradient. In: NeurIPS (2020)"},{"key":"16_CR97","doi-asserted-by":"crossref","unstructured":"Valentin, J., Nie\u00dfner, M., Shotton, J., Fitzgibbon, A., Izadi, S., Torr, P.: Exploiting uncertainty in regression forests for accurate camera relocalization. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7299069"},{"key":"16_CR98","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"638","DOI":"10.1007\/978-3-030-58548-8_37","volume-title":"Computer Vision \u2013 ECCV 2020","author":"AB Vasudevan","year":"2020","unstructured":"Vasudevan, A.B., Dai, D., Van Gool, L.: Semantic object prediction and spatial sound super-resolution with binaural sounds. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12349, pp. 638\u2013655. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58548-8_37"},{"key":"16_CR99","unstructured":"Vaswani, A., et al.: Attention is all you need. In: NeurIPS, vol. 30 (2017)"},{"key":"16_CR100","doi-asserted-by":"crossref","unstructured":"Villalpando, A.P., Schillaci, G., Hafner, V.V., Guzm\u00e1n, B.L.: Ego-noise predictions for echolocation in wheeled robots. In: ALIFE 2019: The 2019 Conference on Artificial Life, pp. 567\u2013573. MIT Press (2019)","DOI":"10.1162\/isal_a_00222.xml"},{"issue":"3","key":"16_CR101","doi-asserted-by":"publisher","first-page":"355","DOI":"10.1109\/TVCG.2009.99","volume":"16","author":"D Wagner","year":"2009","unstructured":"Wagner, D., Reitmayr, G., Mulloni, A., Drummond, T., Schmalstieg, D.: Real-time detection and tracking for augmented reality on mobile phones. IEEE Trans. Visual Comput. Graphics 16(3), 355\u2013368 (2009)","journal-title":"IEEE Trans. Visual Comput. Graphics"},{"key":"16_CR102","doi-asserted-by":"crossref","unstructured":"Walch, F., Hazirbas, C., Leal-Taix\u00e9, L., Sattler, T., Hilsenbeck, S., Cremers, D.: Image-Based Localization Using LSTMs for Structured Feature Correlation. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.75"},{"key":"16_CR103","doi-asserted-by":"crossref","unstructured":"Wang, W., Tran, D., Feiszli, M.: What makes training multi-modal classification networks hard? In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.01271"},{"key":"16_CR104","doi-asserted-by":"crossref","unstructured":"Winkelbauer, D., Denninger, M., Triebel, R.: Learning to localize in new environments from synthetic training data. In: ICRA (2021)","DOI":"10.1109\/ICRA48506.2021.9560872"},{"key":"16_CR105","doi-asserted-by":"crossref","unstructured":"Wu, Z., Jiang, Y.G., Wang, X., Ye, H., Xue, X.: Multi-stream multi-class fusion of deep networks for video classification. In: Proceedings of the 24th ACM international conference on Multimedia, pp. 791\u2013800 (2016)","DOI":"10.1145\/2964284.2964328"},{"key":"16_CR106","doi-asserted-by":"crossref","unstructured":"Yang, K., Lin, W.Y., Barman, M., Condessa, F., Kolter, Z.: Defending multimodal fusion models against single-source adversaries. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00335"},{"key":"16_CR107","doi-asserted-by":"crossref","unstructured":"Yang, K., Russell, B., Salamon, J.: Telling left from right: learning spatial correspondence of sight and sound. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00995"},{"key":"16_CR108","doi-asserted-by":"crossref","unstructured":"Yi, K.M., Trulls, E., Ono, Y., Lepetit, V., Salzmann, M., Fua, P.: Learning to find good correspondences. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00282"},{"key":"16_CR109","doi-asserted-by":"crossref","unstructured":"Yue, H., Miao, J., Yu, Y., Chen, W., Wen, C.: Robust loop closure detection based on bag of superpoints and graph verification. In: IROS (2019)","DOI":"10.1109\/IROS40897.2019.8967726"},{"key":"16_CR110","doi-asserted-by":"crossref","unstructured":"Zhang, Z., et al.: Generative modeling of audible shapes for object perception. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.141"},{"key":"16_CR111","doi-asserted-by":"crossref","unstructured":"Zhou, Q., Sattler, T., Pollefeys, M., Leal-Taix\u00e9, L.: To learn or not to learn: visual localization from essential matrices. In: ICRA (2019)","DOI":"10.1109\/ICRA40945.2020.9196607"},{"key":"16_CR112","doi-asserted-by":"crossref","unstructured":"Zhou, Y., Barnes, C., Lu, J., Yang, J., Li, H.: On the continuity of rotation representations in neural networks. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00589"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2022"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-19836-6_16","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,11,29]],"date-time":"2023-11-29T09:42:36Z","timestamp":1701250956000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-19836-6_16"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022]]},"ISBN":["9783031198359","9783031198366"],"references-count":112,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-19836-6_16","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022]]},"assertion":[{"value":"22 October 2022","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Tel Aviv","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Israel","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2022","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 October 2022","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27 October 2022","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2022","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2022.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Double-blind","order":1,"name":"type","label":"Type","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"CMT","order":2,"name":"conference_management_system","label":"Conference Management System","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"5804","order":3,"name":"number_of_submissions_sent_for_review","label":"Number of Submissions Sent for Review","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"1645","order":4,"name":"number_of_full_papers_accepted","label":"Number of Full Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"0","order":5,"name":"number_of_short_papers_accepted","label":"Number of Short Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"28% - The value is computed by the equation \"Number of Full Papers Accepted \/ Number of Submissions Sent for Review * 100\" and then rounded to a whole number.","order":6,"name":"acceptance_rate_of_full_papers","label":"Acceptance Rate of Full Papers","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.21","order":7,"name":"average_number_of_reviews_per_paper","label":"Average Number of Reviews per Paper","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.91","order":8,"name":"average_number_of_papers_per_reviewer","label":"Average Number of Papers per Reviewer","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"Yes","order":9,"name":"external_reviewers_involved","label":"External Reviewers Involved","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}}]}}