{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,8]],"date-time":"2026-05-08T05:58:23Z","timestamp":1778219903057,"version":"3.51.4"},"publisher-location":"Cham","reference-count":81,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031726903","type":"print"},{"value":"9783031726910","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,3]],"date-time":"2024-11-03T00:00:00Z","timestamp":1730592000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,3]],"date-time":"2024-11-03T00:00:00Z","timestamp":1730592000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-72691-0_15","type":"book-chapter","created":{"date-parts":[[2024,11,2]],"date-time":"2024-11-02T18:07:00Z","timestamp":1730570820000},"page":"256-274","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["Spherical World-Locking for\u00a0Audio-Visual Localization in\u00a0Egocentric Videos"],"prefix":"10.1007","author":[{"given":"Heeseung","family":"Yun","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ruohan","family":"Gao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ishwarya","family":"Ananthabhotla","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Anurag","family":"Kumar","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jacob","family":"Donley","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chao","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gunhee","family":"Kim","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Vamsi Krishna","family":"Ithapu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Calvin","family":"Murdock","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,11,3]]},"reference":[{"key":"15_CR1","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"208","DOI":"10.1007\/978-3-030-58523-5_13","volume-title":"Computer Vision \u2013 ECCV 2020","author":"T Afouras","year":"2020","unstructured":"Afouras, T., Owens, A., Chung, J.S., Zisserman, A.: Self-supervised learning of audio-visual objects from video. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12363, pp. 208\u2013224. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58523-5_13"},{"key":"15_CR2","unstructured":"Ahonen, J., Kallinger, M., K\u00fcch, F., Pulkki, V., Schultz-Amling, R.: Directional analysis of sound field with linear microphone array and applications in sound reproduction. In: Audio Engineering Society Convention (2008)"},{"key":"15_CR3","doi-asserted-by":"crossref","unstructured":"Arandjelovic, R., Zisserman, A.: Objects that sound. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01246-5_27"},{"key":"15_CR4","unstructured":"Ba, J.L., Kiros, J.R., Hinton, G.E.: Layer normalization. arXiv:1607.06450 (2016)"},{"key":"15_CR5","doi-asserted-by":"publisher","unstructured":"Bansal, S., Arora, C., Jawahar, C.V.: My view is the best view: procedure learning from egocentric videos. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Computer Vision \u2013 ECCV 2022. ECCV 2022. LNCS, vol. 13673, pp. 657\u2013675. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19778-9_38","DOI":"10.1007\/978-3-031-19778-9_38"},{"key":"15_CR6","doi-asserted-by":"crossref","unstructured":"Bottini, G., et al.: Cerebral representations for egocentric space: functional\u2013anatomical evidence from caloric vestibular stimulation and neck vibration. Brain (2001)","DOI":"10.1016\/S1053-8119(01)92457-7"},{"key":"15_CR7","doi-asserted-by":"crossref","unstructured":"Brimijoin, W.O., Boyd, A.W., Akeroyd, M.A.: The contribution of head movement to the externalization and internalization of sounds. PloS one (2013)","DOI":"10.1371\/journal.pone.0083068"},{"key":"15_CR8","doi-asserted-by":"crossref","unstructured":"Chang, H.S., Sun, R.Y., Ricci, K., McCallum, A.: Multi-CLS BERT: an efficient alternative to traditional ensembling. In: ACL (2023)","DOI":"10.18653\/v1\/2023.acl-long.48"},{"key":"15_CR9","doi-asserted-by":"crossref","unstructured":"Chen, Z., Qian, S., Owens, A.: Sound localization from motion: jointly learning sound direction and camera rotation. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00726"},{"key":"15_CR10","doi-asserted-by":"crossref","unstructured":"Choi, C., Kim, S.M., Kim, Y.M.: Balanced spherical grid for egocentric view synthesis. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01592"},{"key":"15_CR11","unstructured":"Cohen, T.S., Geiger, M., K\u00f6hler, J., Welling, M.: Spherical CNNs. In: ICLR (2018)"},{"key":"15_CR12","doi-asserted-by":"crossref","unstructured":"Damen, D., et\u00a0al.: Scaling egocentric vision: the EPIC-KITCHENS dataset. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01225-0_44"},{"key":"15_CR13","unstructured":"Donley, J., et al.: EasyCom: an augmented reality dataset to support algorithms for easy communication in noisy environments. arXiv:2107.04174 (2021)"},{"key":"15_CR14","unstructured":"Dosovitskiy, A., et\u00a0al.: An image is worth 16 $$\\times $$ 16 words: transformers for image recognition at scale. In: ICLR (2021)"},{"key":"15_CR15","doi-asserted-by":"crossref","unstructured":"Eder, M., Shvets, M., Lim, J., Frahm, J.M.: Tangent images for mitigating spherical distortion. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.01244"},{"key":"15_CR16","doi-asserted-by":"crossref","unstructured":"Esteves, C., Allen-Blanchette, C., Makadia, A., Daniilidis, K.: Learning SO(3) equivariant representations with spherical CNNs. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01261-8_4"},{"key":"15_CR17","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"658","DOI":"10.1007\/978-3-030-58545-7_38","volume-title":"Computer Vision \u2013 ECCV 2020","author":"R Gao","year":"2020","unstructured":"Gao, R., Chen, C., Al-Halah, Z., Schissler, C., Grauman, K.: VisualEchoes: spatial image representation learning through echolocation. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12354, pp. 658\u2013676. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58545-7_38"},{"key":"15_CR18","doi-asserted-by":"crossref","unstructured":"Gao, R., Grauman, K.: 2.5D visual sound. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00041"},{"key":"15_CR19","unstructured":"Gardner, J., Pleiss, G., Weinberger, K.Q., Bindel, D., Wilson, A.G.: GPyTorch: blackbox matrix-matrix gaussian process inference with gpu acceleration. In: NeurIPS (2018)"},{"key":"15_CR20","doi-asserted-by":"crossref","unstructured":"Gauthier, G.M., Vercher, J.L., Blouin, J.: Egocentric visual target position and velocity coding: role of ocular muscle proprioception. Ann. Biomed. Eng. (1995)","DOI":"10.1007\/978-1-4615-1935-5_121"},{"key":"15_CR21","doi-asserted-by":"crossref","unstructured":"Gong, Y., Chung, Y.A., Glass, J.: AST: audio spectrogram transformer. In: InterSpeech (2021)","DOI":"10.21437\/Interspeech.2021-698"},{"key":"15_CR22","unstructured":"Grauman, K., et\u00a0al.: Ego4D: around the world in 3,000 hours of egocentric video. In: CVPR (2022)"},{"key":"15_CR23","unstructured":"Grauman, K., et\u00a0al.: Ego-Exo4D: understanding skilled human activity from first-and third-person perspectives. arXiv:2311.18259 (2023)"},{"key":"15_CR24","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"15_CR25","doi-asserted-by":"crossref","unstructured":"Hu, D., Nie, F., Li, X.: Deep multimodal clustering for unsupervised audiovisual learning. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00947"},{"key":"15_CR26","doi-asserted-by":"crossref","unstructured":"Huang, C., Tian, Y., Kumar, A., Xu, C.: Egocentric audio-visual object localization. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.02194"},{"key":"15_CR27","unstructured":"Jaderberg, M., Simonyan, K., Zisserman, A., et\u00a0al.: Spatial transformer networks. NIPS (2015)"},{"key":"15_CR28","doi-asserted-by":"crossref","unstructured":"Jang, H., Meuleman, A., Kang, D., Kim, D., Richardt, C., Kim, M.H.: Egocentric scene reconstruction from an omnidirectional video. Trans. Graph. (2022)","DOI":"10.1145\/3528223.3530074"},{"key":"15_CR29","doi-asserted-by":"crossref","unstructured":"Jia, W., et al.: The audio-visual conversational graph: from an egocentric-exocentric perspective. In: CVPR (2024)","DOI":"10.1109\/CVPR52733.2024.02493"},{"key":"15_CR30","doi-asserted-by":"publisher","unstructured":"Jia, W., Liu, M., Rehg, J.M.: Generative adversarial network for future hand segmentation from egocentric video. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Computer Vision \u2013 ECCV 2022. ECCV 2022. LNCS, vol. 13673, pp. 639\u2013656. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19778-9_37","DOI":"10.1007\/978-3-031-19778-9_37"},{"key":"15_CR31","doi-asserted-by":"crossref","unstructured":"Jiang, H., Grauman, K.: Seeing invisible poses: estimating 3D body pose from egocentric video. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.373"},{"key":"15_CR32","doi-asserted-by":"crossref","unstructured":"Jiang, H., Ithapu, V.K.: Egocentric pose estimation from human vision span. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.01082"},{"key":"15_CR33","doi-asserted-by":"crossref","unstructured":"Jiang, H., Murdock, C., Ithapu, V.K.: Egocentric deep multi-channel audio-visual active speaker localization. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01029"},{"key":"15_CR34","unstructured":"Kazakos, E., Huh, J., Nagrani, A., Zisserman, A., Damen, D.: With a little help from my temporal context: multimodal egocentric action recognition. In: BMVC (2021)"},{"key":"15_CR35","doi-asserted-by":"crossref","unstructured":"Kazakos, E., Nagrani, A., Zisserman, A., Damen, D.: Epic-Fusion: audio-visual temporal binding for egocentric action recognition. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00559"},{"key":"15_CR36","doi-asserted-by":"crossref","unstructured":"Kim, Y.J., et al.: Look who\u2019s talking: active speaker detection in the wild. In: InterSpeech (2021)","DOI":"10.21437\/Interspeech.2021-2041"},{"key":"15_CR37","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. In: ICLR (2014)"},{"key":"15_CR38","doi-asserted-by":"crossref","unstructured":"Lai, B., Liu, M., Ryan, F., Rehg, J.M.: In the eye of transformer: global\u2013local correlation for egocentric gaze estimation and beyond. In: IJCV (2023)","DOI":"10.1007\/s11263-023-01879-7"},{"key":"15_CR39","doi-asserted-by":"crossref","unstructured":"Lee, S., Sung, J., Yu, Y., Kim, G.: A memory network approach for story-based temporal summarization of 360 videos. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00153"},{"key":"15_CR40","doi-asserted-by":"crossref","unstructured":"Li, Y., Nagarajan, T., Xiong, B., Grauman, K.: Ego-Exo: transferring visual representations from third-person to first-person videos. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00687"},{"key":"15_CR41","doi-asserted-by":"crossref","unstructured":"Lin, Y.B., Sung, Y.L., Lei, J., Bansal, M., Bertasius, G.: Vision transformers are parameter-efficient audio-visual learners. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00228"},{"key":"15_CR42","doi-asserted-by":"publisher","unstructured":"Liu, M., et al.: Egocentric activity recognition and localization on a 3D map. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Computer Vision \u2013 ECCV 2022. ECCV 2022. LNCS, vol. 13673, pp. 621\u2013638. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19778-9_36","DOI":"10.1007\/978-3-031-19778-9_36"},{"key":"15_CR43","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"704","DOI":"10.1007\/978-3-030-58452-8_41","volume-title":"Computer Vision \u2013 ECCV 2020","author":"M Liu","year":"2020","unstructured":"Liu, M., Tang, S., Li, Y., Rehg, J.M.: Forecasting human-object interaction: joint prediction of motor attention and\u00a0actions in first person video. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12346, pp. 704\u2013721. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58452-8_41"},{"key":"15_CR44","unstructured":"Luo, Z., Hachiuma, R., Yuan, Y., Kitani, K.: Dynamics-regulated kinematic policy for egocentric pose estimation. In: NeurIPS (2021)"},{"key":"15_CR45","unstructured":"Lv, Z., et al.: Aria everyday activities dataset. arXiv:2402.13349 (2024)"},{"key":"15_CR46","doi-asserted-by":"crossref","unstructured":"Mai, J., Hamdi, A., Giancola, S., Zhao, C., Ghanem, B.: EgoLoc: revisiting 3D object localization from egocentric videos with visual queries. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00011"},{"key":"15_CR47","doi-asserted-by":"crossref","unstructured":"Mo, S., Tian, Y.: Audio-visual grouping network for sound localization from mixtures. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01018"},{"key":"15_CR48","unstructured":"Moon, S., et al.: IMU2CLIP: multimodal contrastive learning for imu motion sensors from egocentric videos and text. In: EMNLP Findings (2023)"},{"key":"15_CR49","unstructured":"Mudigonda, M., et al.: Segmenting and tracking extreme climate events using neural networks. In: Deep Learning for Physical Sciences (DLPS) Workshop, held with NIPS Conference (2017)"},{"key":"15_CR50","doi-asserted-by":"crossref","unstructured":"Murdock, C., Ananthabhotle, I., Lu, H., Ithapu, V.K.: Self-motion as supervision for egocentric audiovisual localization. In: ICASSP (2024)","DOI":"10.1109\/ICASSP48485.2024.10447683"},{"key":"15_CR51","doi-asserted-by":"crossref","unstructured":"Nagarajan, T., Li, Y., Feichtenhofer, C., Grauman, K.: EGO-TOPO: environment affordances from egocentric video. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00024"},{"key":"15_CR52","unstructured":"Nagarajan, T., Ramakrishnan, S.K., Desai, R., Hillis, J., Grauman, K.: EgoEnv: human-centric environment representations from egocentric video. In: NeurIPS (2023)"},{"key":"15_CR53","doi-asserted-by":"crossref","unstructured":"Ohmi, M.: Egocentric perception through interaction among many sensory systems. Cogn. Brain Res. (1996)","DOI":"10.1016\/S0926-6410(96)00044-4"},{"key":"15_CR54","doi-asserted-by":"crossref","unstructured":"Owens, A., Efros, A.A.: Audio-visual scene analysis with self-supervised multisensory features. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01231-1_39"},{"key":"15_CR55","unstructured":"Pulkki, V.: Directional audio coding in spatial sound reproduction and stereo upmixing. In: Audio Engineering Society Conference (2006)"},{"key":"15_CR56","doi-asserted-by":"crossref","unstructured":"Ranftl, R., Bochkovskiy, A., Koltun, V.: Vision transformers for dense prediction. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.01196"},{"key":"15_CR57","doi-asserted-by":"crossref","unstructured":"Roth, J., et\u00a0al.: AVA active speaker: an audio-visual dataset for active speaker detection. In: ICASSP (2020)","DOI":"10.1109\/ICASSP40776.2020.9053900"},{"key":"15_CR58","doi-asserted-by":"crossref","unstructured":"Ryan, F., Jiang, H., Shukla, A., Rehg, J.M., Ithapu, V.K.: Egocentric auditory attention localization in conversations. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01409"},{"key":"15_CR59","doi-asserted-by":"crossref","unstructured":"Su, Y.C., Grauman, K.: Learning spherical convolution for 360$$^\\circ $$ recognition. IEEE TPAMI (2021)","DOI":"10.1109\/TPAMI.2021.3113612"},{"key":"15_CR60","doi-asserted-by":"crossref","unstructured":"Su, Y.C., Jayaraman, D., Grauman, K.: Pano2Vid: automatic cinematography for watching 360 videos. In: ACCV (2016)","DOI":"10.1007\/978-3-319-54190-7_10"},{"key":"15_CR61","doi-asserted-by":"crossref","unstructured":"Sun, W., et al.: Learning audio-visual source localization via false negative aware contrastive learning. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00621"},{"key":"15_CR62","doi-asserted-by":"crossref","unstructured":"Tan, R., et al.: Language-guided audio-visual source separation via trimodal consistency. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01019"},{"key":"15_CR63","unstructured":"Tan, S., Nagarajan, T., Grauman, K.: EgoDistill: egocentric head motion distillation for efficient video understanding. In: NeurIPS (2023)"},{"key":"15_CR64","doi-asserted-by":"crossref","unstructured":"Tao, R., Pan, Z., Das, R.K., Qian, X., Shou, M.Z., Li, H.: Is someone speaking? Exploring long-term temporal features for audio-visual active speaker detection. In: ACM MM (2021)","DOI":"10.1145\/3474085.3475587"},{"key":"15_CR65","doi-asserted-by":"crossref","unstructured":"Thurlow, W.R., Mangels, J.W., Runge, P.S.: Head movements during sound localization. J. Acoust. Soc. Am. (1967)","DOI":"10.1121\/1.1910605"},{"key":"15_CR66","doi-asserted-by":"crossref","unstructured":"Tourbabin, V., Donley, J., Rafaely, B., Mehra, R.: Direction of arrival estimation in highly reverberant environments using soft time-frequency mask. In: WASPAA (2019)","DOI":"10.1109\/WASPAA.2019.8937233"},{"key":"15_CR67","unstructured":"Touvron, H., Cord, M., Douze, M., Massa, F., Sablayrolles, A., J\u00e9gou, H.: Training data-efficient image transformers & distillation through attention. In: ICML (2021)"},{"key":"15_CR68","doi-asserted-by":"crossref","unstructured":"Truong, T.D., et\u00a0al.: The right to talk: an audio-visual transformer approach. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00114"},{"key":"15_CR69","unstructured":"Vaswani, A., et al.: Attention is all you need. In: NeurIPS (2017)"},{"key":"15_CR70","doi-asserted-by":"crossref","unstructured":"Wallach, H.: The role of head movements and vestibular and visual cues in sound localization. J. Exp. Psychol. (1940)","DOI":"10.1037\/h0054629"},{"key":"15_CR71","doi-asserted-by":"crossref","unstructured":"Wang, X., Zhu, L., Wang, H., Yang, Y.: Interactive prototype learning for egocentric action recognition. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00806"},{"key":"15_CR72","doi-asserted-by":"crossref","unstructured":"Wu, X., Wu, Z., Ju, L., Wang, S.: Binaural audio-visual localization. In: AAAI (2021)","DOI":"10.1609\/aaai.v35i4.16403"},{"key":"15_CR73","doi-asserted-by":"crossref","unstructured":"Xiong, J., Wang, G., Zhang, P., Huang, W., Zha, Y., Zhai, G.: CASP-Net: rethinking video saliency prediction from an audio-visual consistency perceptual perspective. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00623"},{"key":"15_CR74","doi-asserted-by":"crossref","unstructured":"Xu, L., Ouyang, W., Bennamoun, M., Boussaid, F., Xu, D.: Multi-class token transformer for weakly supervised semantic segmentation. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00427"},{"key":"15_CR75","unstructured":"Xue, Z.S., Grauman, K.: Learning fine-grained view-invariant representations from unpaired ego-exo videos via temporal alignment. In: NeurIPS (2023)"},{"key":"15_CR76","doi-asserted-by":"crossref","unstructured":"Yin, Y., Ananthabhotla, I., Ithapu, V.K., Petridis, S., Wu, Y.H., Miller, C.: Hearing loss detection from facial expressions in one-on-one conversations. In: ICASSP (2024)","DOI":"10.1109\/ICASSP48485.2024.10446324"},{"key":"15_CR77","doi-asserted-by":"publisher","unstructured":"Yun, H., Lee, S., Kim, G.: Panoramic vision transformer for saliency detection in 360$$^\\circ $$ videos. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Computer Vision \u2013 ECCV 2022. ECCV 2022. LNCS, vol. 13695, pp. 422\u2013439. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19833-5_25","DOI":"10.1007\/978-3-031-19833-5_25"},{"key":"15_CR78","doi-asserted-by":"crossref","unstructured":"Yun, H., Na, J., Kim, G.: Dense 2D-3D indoor prediction with sound via aligned cross-modal distillation. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00723"},{"key":"15_CR79","doi-asserted-by":"crossref","unstructured":"Yun, H., Yu, Y., Yang, W., Lee, K., Kim, G.: Pano-AVQA: grounded audio-visual question answering on 360deg videos. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00204"},{"key":"15_CR80","doi-asserted-by":"crossref","unstructured":"Zhao, H., Gan, C., Ma, W.C., Torralba, A.: The sound of motions. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00182"},{"key":"15_CR81","doi-asserted-by":"crossref","unstructured":"Zhao, H., Gan, C., Rouditchenko, A., Vondrick, C., McDermott, J., Torralba, A.: The sound of pixels. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01246-5_35"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-72691-0_15","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,2]],"date-time":"2024-11-02T18:07:43Z","timestamp":1730570863000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-72691-0_15"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,3]]},"ISBN":["9783031726903","9783031726910"],"references-count":81,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-72691-0_15","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,3]]},"assertion":[{"value":"3 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}