{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T11:12:07Z","timestamp":1783768327571,"version":"3.55.0"},"reference-count":48,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T00:00:00Z","timestamp":1778025600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T00:00:00Z","timestamp":1778025600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["62176009, 62472012"],"award-info":[{"award-number":["62176009, 62472012"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"name":"National Science and Technology Innovation 2030 Major Program of China","award":["2022ZD0205005"],"award-info":[{"award-number":["2022ZD0205005"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1007\/s00530-026-02363-1","type":"journal-article","created":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T06:16:10Z","timestamp":1778048170000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["DSSNav: dual-stream slot-based fusion via Soft Actor-Critic for audio\u2013visual navigation"],"prefix":"10.1007","volume":"32","author":[{"given":"Lei","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lijuan","family":"Duan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kai","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bailu","family":"Si","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,5,6]]},"reference":[{"key":"2363_CR1","doi-asserted-by":"publisher","unstructured":"Gupta, S., Davidson, J., Levine, S.: Cognitive mapping and planning for visual navigation. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2017, Honolulu, HI, USA, July 21-26, 2017, pp. 7272\u20137281 (2017). https:\/\/doi.org\/10.1109\/CVPR.2017.769","DOI":"10.1109\/CVPR.2017.769"},{"key":"2363_CR2","unstructured":"Wijmans, E., Kadian, A., Morcos, A.: DD-PPO: learning near-perfect pointgoal navigators from 2.5 billion frames. In: 8th International Conference on Learning Representations, ICLR 2020, Addis Ababa, Ethiopia, April 26-30, 2020 (2020). https:\/\/openreview.net\/forum?id=H1gX8C4YPr"},{"key":"2363_CR3","doi-asserted-by":"publisher","unstructured":"Chen, C., Jain, U., Schissler, C.: Soundspaces: Audio-visual navigation in 3d environments. In: Vedaldi, A., Bischof, H., Brox, T. (eds.) Computer Vision - ECCV 2020 - 16th European Conference, Glasgow, UK, August 23-28, 2020, Proceedings, Part VI. Lecture Notes in Computer Science, vol. 12351, pp. 17\u201336 (2020). https:\/\/doi.org\/10.1007\/978-3-030-58539-6_2","DOI":"10.1007\/978-3-030-58539-6_2"},{"key":"2363_CR4","unstructured":"Straub, J., Whelan, T., Ma, L.: The replica dataset: a digital replica of indoor spaces (2019). arXiv:1906.05797"},{"key":"2363_CR5","doi-asserted-by":"crossref","unstructured":"Majumder, S., Al-Halah, Z., Grauman, K.: Move2Hear: Active audio-visual source separation (2021). arXiv:2105.07142","DOI":"10.1109\/ICCV48922.2021.00034"},{"key":"2363_CR6","doi-asserted-by":"publisher","unstructured":"Gan, C., Zhang, Y., Wu, J.: Look, listen, and act: towards audio-visual embodied navigation. In: 2020 IEEE International Conference on Robotics and Automation, ICRA 2020, Paris, France, May 31 - August 31, 2020, pp. 9701\u20139707 (2020). https:\/\/doi.org\/10.1109\/ICRA40945.2020.9197008","DOI":"10.1109\/ICRA40945.2020.9197008"},{"key":"2363_CR7","doi-asserted-by":"crossref","unstructured":"Chen, C., Al-Halah, Z., Grauman, K.: Semantic audio-visual navigation. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2021, Virtual, June 19-25, 2021, pp. 15516\u201315525 (2021). https:\/\/doi.org\/10.1109\/CVPR46437.2021.01526 . https:\/\/openaccess.thecvf.com\/content\/CVPR2021\/html\/Chen_Semantic_Audio-Visual_Navigation_CVPR_2021_paper.html","DOI":"10.1109\/CVPR46437.2021.01526"},{"key":"2363_CR8","unstructured":"Chen, C., Sun, W., Harwath, D., Grauman, K.: Learning audio-visual dereverberation. CoRR arXiv:2106.07732 (2021)"},{"key":"2363_CR9","doi-asserted-by":"publisher","unstructured":"Valverde, F.R., Hurtado, J.V., Valada, A.: There is more than meets the eye: self-supervised multi-object detection and tracking with sound by distilling multimodal knowledge. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2021, Virtual, June 19-25, 2021, pp. 11612\u201311621 (2021). https:\/\/doi.org\/10.1109\/CVPR46437.2021.01144","DOI":"10.1109\/CVPR46437.2021.01144"},{"key":"2363_CR10","doi-asserted-by":"publisher","unstructured":"Purushwalkam, S., Ithapu, V.K., Schissler, C.: Audio-visual floorplan reconstruction. In: 2021 IEEE\/CVF International Conference on Computer Vision, ICCV 2021, Montreal, QC, Canada, October 10-17, 2021, pp. 1163\u20131172 (2021). https:\/\/doi.org\/10.1109\/ICCV48922.2021.00122","DOI":"10.1109\/ICCV48922.2021.00122"},{"key":"2363_CR11","doi-asserted-by":"crossref","unstructured":"Tian, Y., Shi, J., Li, B., Duan, Z., Xu, C.: Audio-visual event localization in unconstrained videos (2018). arXiv:1803.08842","DOI":"10.1007\/978-3-030-01216-8_16"},{"key":"2363_CR12","unstructured":"Fried, D., Hu, R., Cirik, V., Rohrbach, A., Andreas, J., Morency, L.-P., Berg-Kirkpatrick, T., Saenko, K., Klein, D., Darrell, T.: Speaker-Follower Models for Vision-and-Language Navigation (2018). arXiv:1806.02724"},{"key":"2363_CR13","doi-asserted-by":"crossref","unstructured":"Anderson, P., Wu, Q., Teney, D., Bruce, J., Johnson, M., S\u00fcnderhauf, N., Reid, I., Gould, S., Hengel, A.: Vision-and-language navigation: interpreting visually-grounded navigation instructions in real environments (2018). arXiv:1711.07280","DOI":"10.1109\/CVPR.2018.00387"},{"key":"2363_CR14","unstructured":"Locatello, F., Weissenborn, D., Unterthiner, T.: Object-centric learning with slot attention. In: Larochelle, H., Ranzato, M., Hadsell, R. (eds.) Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020, NeurIPS 2020, December 6-12, 2020, Virtual (2020). https:\/\/proceedings.neurips.cc\/paper\/2020\/hash\/8511df98c02ab60aea1b2356c013bc0f-Abstract.html"},{"key":"2363_CR15","doi-asserted-by":"publisher","unstructured":"Boniardi, F., Valada, A., Mohan, R.: Robot localization in floor plans using a room layout edge extraction network. In: 2019 IEEE\/RSJ International Conference on Intelligent Robots and Systems, IROS 2019, Macau, SAR, China, November 3-8, 2019, pp. 5291\u20135297 (2019). https:\/\/doi.org\/10.1109\/IROS40897.2019.8967847","DOI":"10.1109\/IROS40897.2019.8967847"},{"key":"2363_CR16","doi-asserted-by":"publisher","unstructured":"Al-Halah, Z., Ramakrishnan, S.K., Grauman, K.: Zero experience required: Plug & play modular transfer learning for semantic visual navigation. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2022, New Orleans, LA, USA, June 18-24, 2022, pp. 17010\u201317020 (2022). https:\/\/doi.org\/10.1109\/CVPR52688.2022.01652","DOI":"10.1109\/CVPR52688.2022.01652"},{"key":"2363_CR17","doi-asserted-by":"publisher","unstructured":"Chaplot, D.S., Salakhutdinov, R., Gupta, A.: Neural topological SLAM for visual navigation. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2020, Seattle, WA, USA, June 13-19, 2020, pp. 12872\u201312881 (2020). https:\/\/doi.org\/10.1109\/CVPR42600.2020.01289","DOI":"10.1109\/CVPR42600.2020.01289"},{"key":"2363_CR18","doi-asserted-by":"crossref","unstructured":"Yu, Y., Huang, W., Sun, F.: Sound adversarial audio-visual navigation. In: The Tenth International Conference on Learning Representations, ICLR 2022, Virtual Event, April 25-29, 2022 (2022). https:\/\/openreview.net\/forum?id=NkZq4OEYN-","DOI":"10.1007\/s10772-022-09992-7"},{"key":"2363_CR19","doi-asserted-by":"publisher","unstructured":"Wu, J., Duan, B., Kang, W.: Token transformation matters: Towards faithful post-hoc explanation for vision transformer. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2024, Seattle, WA, USA, June 16-22, 2024, pp. 10926\u201310935 (2024). https:\/\/doi.org\/10.1109\/CVPR52733.2024.01039","DOI":"10.1109\/CVPR52733.2024.01039"},{"issue":"2","key":"2363_CR20","doi-asserted-by":"publisher","first-page":"2634","DOI":"10.1109\/lra.2021.3062303","volume":"6","author":"J Truong","year":"2021","unstructured":"Truong, J., Chernova, S., Batra, D.: Bi-directional domain adaptation for sim2real transfer of embodied navigation agents. IEEE Robot. Autom. Lett. 6(2), 2634\u20132641 (2021). https:\/\/doi.org\/10.1109\/lra.2021.3062303","journal-title":"IEEE Robot. Autom. Lett."},{"key":"2363_CR21","doi-asserted-by":"publisher","unstructured":"Savva, M., Malik, J., Parikh, D.: Habitat: A platform for embodied AI research. In: 2019 IEEE\/CVF International Conference on Computer Vision, ICCV 2019, Seoul, Korea (South), October 27 - November 2, 2019, pp. 9338\u20139346 (2019). https:\/\/doi.org\/10.1109\/ICCV.2019.00943","DOI":"10.1109\/ICCV.2019.00943"},{"key":"2363_CR22","unstructured":"Szot, A., Clegg, A., Undersander, E., Wijmans, E.: Habitat 2.0: Training Home Assistants to Rearrange their Habitat (2022). arXiv:2106.14405"},{"key":"2363_CR23","doi-asserted-by":"publisher","unstructured":"Chang, A.X., Dai, A., Funkhouser, T.A.: Matterport3d: Learning from RGB-D data in indoor environments. In: 2017 International Conference on 3D Vision, 3DV 2017, Qingdao, China, October 10-12, 2017, pp. 667\u2013676 (2017). https:\/\/doi.org\/10.1109\/3DV.2017.00081","DOI":"10.1109\/3DV.2017.00081"},{"key":"2363_CR24","doi-asserted-by":"publisher","unstructured":"Shang, Y., Xu, D., Liu, G.: Efficient multitask dense predictor via binarization. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2024, Seattle, WA, USA, June 16-22, 2024, pp. 15899\u201315908 (2024). https:\/\/doi.org\/10.1109\/CVPR52733.2024.01505","DOI":"10.1109\/CVPR52733.2024.01505"},{"key":"2363_CR25","doi-asserted-by":"publisher","unstructured":"Wu, W., Dai, T., Chen, Z., Huang, X., Xiao, J., Ma, F., Ouyang, R.: Adaptive patch contrast for weakly supervised semantic segmentation. Eng. Appl. Artif. Intell. 139, 109626 (2025) https:\/\/doi.org\/10.1016\/J.ENGAPPAI.2024.109626","DOI":"10.1016\/J.ENGAPPAI.2024.109626"},{"key":"2363_CR26","unstructured":"Anderson, P., Chang, A.X., Chaplot, D.S.: On evaluation of embodied navigation agents. CoRR arXiv:1807.06757 (2018)"},{"key":"2363_CR27","unstructured":"Yang, W., Wang, X., Farhadi, A., Gupta, A., Mottaghi, R.: Visual semantic navigation using scene priors (2018). arXiv:1810.06543"},{"key":"2363_CR28","unstructured":"Du, H., Yu, X., Zheng, L.: Vtnet: Visual transformer network for object goal navigation. In: 9th International Conference on Learning Representations, ICLR 2021, Virtual Event, Austria, May 3-7, 2021 (2021). https:\/\/openreview.net\/forum?id=DILxQP08O3B"},{"key":"2363_CR29","doi-asserted-by":"crossref","unstructured":"Hong, Y., Wu, Q., Qi, Y., Rodriguez-Opazo, C., Gould, S.: A recurrent vision-and-language BERT for navigation (2021). arXiv:2011.13922","DOI":"10.1109\/CVPR46437.2021.00169"},{"key":"2363_CR30","doi-asserted-by":"publisher","unstructured":"Liu, Z., Lin, Y., Cao, Y.: Swin transformer: Hierarchical vision transformer using shifted windows. In: 2021 IEEE\/CVF International Conference on Computer Vision, ICCV 2021, Montreal, QC, Canada, October 10-17, 2021, pp. 9992\u201310002 (2021). https:\/\/doi.org\/10.1109\/ICCV48922.2021.00986","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"2363_CR31","doi-asserted-by":"publisher","unstructured":"Chen, K., Chen, J.K., Chuang, J.: Topological planning with transformers for vision-and-language navigation. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2021, Virtual, June 19-25, 2021, pp. 11276\u201311286 (2021). https:\/\/doi.org\/10.1109\/CVPR46437.2021.01112","DOI":"10.1109\/CVPR46437.2021.01112"},{"key":"2363_CR32","unstructured":"Zhong, F., Sun, P., Luo, W.: Towards distraction-robust active visual tracking. In: Meila, M., Zhang, T. (eds.) Proceedings of the 38th International Conference on Machine Learning, ICML 2021, 18-24 July 2021, Virtual Event. Proceedings of Machine Learning Research, vol. 139, pp. 12782\u201312792 (2021). http:\/\/proceedings.mlr.press\/v139\/zhong21b.html"},{"key":"2363_CR33","unstructured":"Hurtado, J.V., Mohan, R., Burgard, W., Valada, A.: MOPT: multi-object panoptic tracking (2020). arXiv:2004.08189"},{"key":"2363_CR34","doi-asserted-by":"crossref","unstructured":"Chen, C., Schissler, C., Garg, S.: Soundspaces 2.0: a simulation platform for visual-acoustic learning. In: Koyejo, S., Mohamed, S., Agarwal, A. (eds.) Advances in Neural Information Processing Systems 35: Annual Conference on Neural Information Processing Systems 2022, NeurIPS 2022, New Orleans, LA, USA, November 28 - December 9, 2022 (2022)","DOI":"10.52202\/068431-0647"},{"key":"2363_CR35","unstructured":"Chen, C., Majumder, S., Al-Halah, Z., Gao, R., Ramakrishnan, S.K., Grauman, K.: Learning to set waypoints for audio-visual navigation. In: 9th International Conference on Learning Representations, ICLR 2021, Virtual Event, Austria, May 3-7, 2021. OpenReview.net, ??? (2021). https:\/\/openreview.net\/forum?id=cR91FAodFMe"},{"key":"2363_CR36","unstructured":"Schulman, J., Wolski, F., Dhariwal, P.: Proximal policy optimization algorithms. CoRR arXiv:1707.06347 (2017)"},{"key":"2363_CR37","doi-asserted-by":"publisher","first-page":"285","DOI":"10.1007\/978-981-96-6951-6_20","volume-title":"Neural Information Processing","author":"H Cai","year":"2026","unstructured":"Cai, H., Wu, W., Chai, B., Zhang, Y.: Relation-fused attention in knowledge graphs for recommendation. In: Mahmud, M., Doborjeh, M., Wong, K., Leung, A.C.S., Doborjeh, Z., Tanveer, M. (eds.) Neural Information Processing, pp. 285\u2013299. Springer, Singapore (2026)"},{"key":"2363_CR38","doi-asserted-by":"publisher","unstructured":"Wu, W., Chen, X., Chen, Z., Jiang, J., Tsang, K., Huang, X., Ma, F., Xiao, J.: Tag-enriched multi-attention with large language models for cross-domain sequential recommendation. CoRR arXiv:2510.09224 (2025) https:\/\/doi.org\/10.48550\/ARXIV.2510.09224","DOI":"10.48550\/ARXIV.2510.09224"},{"key":"2363_CR39","doi-asserted-by":"crossref","unstructured":"Younes, A., Honerkamp, D., Welschehold, T., Valada, A.: Catch me if you hear me: audio-visual navigation in complex unmapped environments with moving sounds (2023). arXiv:2111.14843","DOI":"10.1109\/LRA.2023.3234766"},{"key":"2363_CR40","doi-asserted-by":"crossref","unstructured":"Gordon, D., Kadian, A., Parikh, D., Hoffman, J., Batra, D.: SplitNet: Sim2Sim and Task2Task transfer for embodied visual navigation (2019). arXiv:1905.07512","DOI":"10.1109\/ICCV.2019.00111"},{"key":"2363_CR41","doi-asserted-by":"crossref","unstructured":"Hao, W., Li, C., Li, X., Carin, L., Gao, J.: Towards learning a generic agent for vision-and-language navigation via pre-training (2020). arXiv:2002.10638","DOI":"10.1109\/CVPR42600.2020.01315"},{"key":"2363_CR42","unstructured":"James, S., Davison, A.J., Johns, E.: Transferring end-to-end visuomotor control from simulation to real world for a multi-stage task (2017). arXiv:1707.02267"},{"key":"2363_CR43","doi-asserted-by":"publisher","unstructured":"Wu, W., Dai, T., Huang, X., Ma, F., Xiao, J.: Image augmentation with controlled diffusion for weakly-supervised semantic segmentation. In: IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP 2024, Seoul, Republic of Korea, April 14-19, 2024, pp. 6175\u20136179. IEEE. https:\/\/doi.org\/10.1109\/ICASSP48485.2024.10447893","DOI":"10.1109\/ICASSP48485.2024.10447893"},{"key":"2363_CR44","unstructured":"Chung, J., Kastner, K., Dinh, L., Goel, K., Courville, A., Bengio, Y.: a recurrent latent variable model for sequential data (2016). arXiv:1506.02216"},{"key":"2363_CR45","doi-asserted-by":"publisher","unstructured":"Ngo, B.H., Kim, J.H., Jeong, Y.: Multi-view collaborative learning for semi-supervised domain adaptation. IEEE Access 9, 166488\u2013166501 (2021) https:\/\/doi.org\/10.1109\/ACCESS.2021.3136567","DOI":"10.1109\/ACCESS.2021.3136567"},{"key":"2363_CR46","doi-asserted-by":"publisher","unstructured":"Ngo, B.H., Do-Tran, N., Nguyen, T., Jeon, H., Choi, T.J.: Learning CNN on vit: A hybrid model to explicitly class-specific boundaries for domain adaptation. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2024, Seattle, WA, USA, June 16-22, 2024, pp. 28545\u201328554. IEEE, ??? (2024). https:\/\/doi.org\/10.1109\/CVPR52733.2024.02697","DOI":"10.1109\/CVPR52733.2024.02697"},{"key":"2363_CR47","doi-asserted-by":"publisher","unstructured":"Ngo, B.H., Choi, T.J.: Cross-domain knowledge distillation for domain adaptation with GCN-driven MLP generalization. Appl. Soft Comput. 184, 113771 (2025) https:\/\/doi.org\/10.1016\/J.ASOC.2025.113771","DOI":"10.1016\/J.ASOC.2025.113771"},{"key":"2363_CR48","doi-asserted-by":"publisher","unstructured":"Wang, Y., Yu, Y., Sun, F., Wang, L., Zheng, W.: Audio-guided visual perception for audio-visual navigation. CoRR arXiv:2510.11760 (2025) https:\/\/doi.org\/10.48550\/ARXIV.2510.11760","DOI":"10.48550\/ARXIV.2510.11760"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-026-02363-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-026-02363-1","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-026-02363-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T10:19:07Z","timestamp":1783765147000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-026-02363-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5,6]]},"references-count":48,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2026,6]]}},"alternative-id":["2363"],"URL":"https:\/\/doi.org\/10.1007\/s00530-026-02363-1","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,5,6]]},"assertion":[{"value":"23 August 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 March 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 May 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}},{"value":"Not applicable. This study involves audio\u2013visual navigation experiments in a simulated indoor environment and does not involve human participants, human tissue, or animals.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical approval and consent to participate"}},{"value":"Not applicable. No personally identifiable information of individuals is included in the manuscript.","order":4,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent for publication"}}],"article-number":"302"}}