{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,21]],"date-time":"2026-03-21T20:17:03Z","timestamp":1774124223717,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":42,"publisher":"ACM","license":[{"start":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T00:00:00Z","timestamp":1665360000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"the National Key R&D Program of China","award":["2020AAA0105702"],"award-info":[{"award-number":["2020AAA0105702"]}]},{"name":"the National Natural Science Foundation of China (NSFC)","award":["U19B2038 and 61901433"],"award-info":[{"award-number":["U19B2038 and 61901433"]}]},{"name":"the University Synergy Innovation Program of Anhui Province","award":["GXXT-2019-025"],"award-info":[{"award-number":["GXXT-2019-025"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2022,10,10]]},"DOI":"10.1145\/3503161.3548283","type":"proceedings-article","created":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T15:42:46Z","timestamp":1665416566000},"page":"4233-4241","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":9,"title":["Cross-modal Semantic Alignment Pre-training for Vision-and-Language Navigation"],"prefix":"10.1145","author":[{"given":"Siying","family":"Wu","sequence":"first","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xueyang","family":"Fu","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Feng","family":"Wu","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zheng-Jun","family":"Zha","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2022,10,10]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475282"},{"key":"e_1_3_2_2_2_1","volume-title":"Alexey Dosovitskiy, Saurabh Gupta, Vladlen Koltun, Jana Kosecka, Jitendra Malik, Roozbeh Mottaghi, Manolis Savva, and Amir Roshan Zamir.","author":"Anderson Peter","year":"2018","unstructured":"Peter Anderson , Angel X. Chang , Devendra Singh Chaplot , Alexey Dosovitskiy, Saurabh Gupta, Vladlen Koltun, Jana Kosecka, Jitendra Malik, Roozbeh Mottaghi, Manolis Savva, and Amir Roshan Zamir. 2018 a. On Evaluation of Embodied Navigation Agents. CoRR , Vol. abs\/ 1807 .06757 (2018). Peter Anderson, Angel X. Chang, Devendra Singh Chaplot, Alexey Dosovitskiy, Saurabh Gupta, Vladlen Koltun, Jana Kosecka, Jitendra Malik, Roozbeh Mottaghi, Manolis Savva, and Amir Roshan Zamir. 2018a. On Evaluation of Embodied Navigation Agents. CoRR, Vol. abs\/1807.06757 (2018)."},{"key":"e_1_3_2_2_3_1","volume-title":"Vision-and-Language Navigation: Interpreting Visually-Grounded Navigation Instructions in Real Environments. In 2018 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2018","author":"Anderson Peter","year":"2018","unstructured":"Peter Anderson , Qi Wu , Damien Teney , Jake Bruce , Mark Johnson , Niko S\u00fc nderhauf, Ian D. Reid , Stephen Gould , and Anton van den Hengel. 2018b . Vision-and-Language Navigation: Interpreting Visually-Grounded Navigation Instructions in Real Environments. In 2018 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2018 , Salt Lake City, UT, USA, June 18--22 , 2018 . IEEE Computer Society, 3674--3683. Peter Anderson, Qi Wu, Damien Teney, Jake Bruce, Mark Johnson, Niko S\u00fc nderhauf, Ian D. Reid, Stephen Gould, and Anton van den Hengel. 2018b. Vision-and-Language Navigation: Interpreting Visually-Grounded Navigation Instructions in Real Environments. In 2018 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2018, Salt Lake City, UT, USA, June 18--22, 2018. IEEE Computer Society, 3674--3683."},{"key":"e_1_3_2_2_4_1","volume-title":"Jamie Ryan Kiros, and Geoffrey E Hinton","author":"Ba Jimmy Lei","year":"2016","unstructured":"Jimmy Lei Ba , Jamie Ryan Kiros, and Geoffrey E Hinton . 2016 . Layer normalization. arXiv preprint arXiv:1607.06450 (2016). Jimmy Lei Ba, Jamie Ryan Kiros, and Geoffrey E Hinton. 2016. Layer normalization. arXiv preprint arXiv:1607.06450 (2016)."},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"crossref","unstructured":"Angel Chang Angela Dai Thomas Funkhouser Maciej Halber Matthias Nie\u00dfner Manolis Savva Shuran Song Andy Zeng and Yinda Zhang. 2017. Matterport3D: Learning from RGB-D Data in Indoor Environments.  Angel Chang Angela Dai Thomas Funkhouser Maciej Halber Matthias Nie\u00dfner Manolis Savva Shuran Song Andy Zeng and Yinda Zhang. 2017. Matterport3D: Learning from RGB-D Data in Indoor Environments.","DOI":"10.1109\/3DV.2017.00081"},{"key":"e_1_3_2_2_6_1","volume-title":"Advances in Neural Information Processing Systems","volume":"34","author":"Chen Shizhe","year":"2021","unstructured":"Shizhe Chen , Pierre-Louis Guhur , Cordelia Schmid , and Ivan Laptev . 2021 . History aware multimodal transformer for vision-and-language navigation . Advances in Neural Information Processing Systems , Vol. 34 (2021). Shizhe Chen, Pierre-Louis Guhur, Cordelia Schmid, and Ivan Laptev. 2021. History aware multimodal transformer for vision-and-language navigation. Advances in Neural Information Processing Systems, Vol. 34 (2021)."},{"key":"e_1_3_2_2_7_1","unstructured":"Federico Landi Lorenzo Baraldi Marcella Cornia and Massimiliano Corsini Rita Cucchiara. 2019. Perceive transform and act: Multi-modal attention networks for vision-and-language navigation. (2019).  Federico Landi Lorenzo Baraldi Marcella Cornia and Massimiliano Corsini Rita Cucchiara. 2019. Perceive transform and act: Multi-modal attention networks for vision-and-language navigation. (2019)."},{"key":"e_1_3_2_2_8_1","first-page":"20660","article-title":"Evolving graphical planner: Contextual global planning for vision-and-language navigation","volume":"33","author":"Deng Zhiwei","year":"2020","unstructured":"Zhiwei Deng , Karthik Narasimhan , and Olga Russakovsky . 2020 . Evolving graphical planner: Contextual global planning for vision-and-language navigation . Advances in Neural Information Processing Systems , Vol. 33 (2020), 20660 -- 20672 . Zhiwei Deng, Karthik Narasimhan, and Olga Russakovsky. 2020. Evolving graphical planner: Contextual global planning for vision-and-language navigation. Advances in Neural Information Processing Systems, Vol. 33 (2020), 20660--20672.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_2_9_1","volume-title":"Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805","author":"Devlin Jacob","year":"2018","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2018 . Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805 (2018). Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2018. Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805 (2018)."},{"key":"e_1_3_2_2_10_1","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly etal 2020. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:2010.11929 (2020).  Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly et al. 2020. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:2010.11929 (2020)."},{"key":"e_1_3_2_2_11_1","unstructured":"Daniel Fried Ronghang Hu Volkan Cirik Anna Rohrbach Jacob Andreas Louis-Philippe Morency Taylor Berg-Kirkpatrick Kate Saenko Dan Klein and Trevor Darrell. 2018. Speaker-Follower Models for Vision-and-Language Navigation.. In NeurIPS. 3318--3329.  Daniel Fried Ronghang Hu Volkan Cirik Anna Rohrbach Jacob Andreas Louis-Philippe Morency Taylor Berg-Kirkpatrick Kate Saenko Dan Klein and Trevor Darrell. 2018. Speaker-Follower Models for Vision-and-Language Navigation.. In NeurIPS. 3318--3329."},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00166"},{"key":"e_1_3_2_2_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.769"},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01315"},{"key":"e_1_3_2_2_15_1","first-page":"7685","article-title":"Language and visual entity relationship graph for agent navigation","volume":"33","author":"Hong Yicong","year":"2020","unstructured":"Yicong Hong , Cristian Rodriguez , Yuankai Qi , Qi Wu , and Stephen Gould . 2020 . Language and visual entity relationship graph for agent navigation . Advances in Neural Information Processing Systems , Vol. 33 (2020), 7685 -- 7696 . Yicong Hong, Cristian Rodriguez, Yuankai Qi, Qi Wu, and Stephen Gould. 2020. Language and visual entity relationship graph for agent navigation. Advances in Neural Information Processing Systems, Vol. 33 (2020), 7685--7696.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00169"},{"key":"e_1_3_2_2_17_1","volume-title":"General evaluation for instruction conditioned navigation using dynamic time warping. arXiv preprint arXiv:1907.05446","author":"Ilharco Gabriel","year":"2019","unstructured":"Gabriel Ilharco , Vihan Jain , Alexander Ku , Eugene Ie , and Jason Baldridge . 2019. General evaluation for instruction conditioned navigation using dynamic time warping. arXiv preprint arXiv:1907.05446 ( 2019 ). Gabriel Ilharco, Vihan Jain, Alexander Ku, Eugene Ie, and Jason Baldridge. 2019. General evaluation for instruction conditioned navigation using dynamic time warping. arXiv preprint arXiv:1907.05446 (2019)."},{"key":"e_1_3_2_2_18_1","volume-title":"Stay on the path: Instruction fidelity in vision-and-language navigation. arXiv preprint arXiv:1905.12255","author":"Jain Vihan","year":"2019","unstructured":"Vihan Jain , Gabriel Magalhaes , Alexander Ku , Ashish Vaswani , Eugene Ie , and Jason Baldridge . 2019. Stay on the path: Instruction fidelity in vision-and-language navigation. arXiv preprint arXiv:1905.12255 ( 2019 ). Vihan Jain, Gabriel Magalhaes, Alexander Ku, Ashish Vaswani, Eugene Ie, and Jason Baldridge. 2019. Stay on the path: Instruction fidelity in vision-and-language navigation. arXiv preprint arXiv:1905.12255 (2019)."},{"key":"e_1_3_2_2_19_1","volume-title":"International Conference on Machine Learning. PMLR, 5583--5594","author":"Kim Wonjae","year":"2021","unstructured":"Wonjae Kim , Bokyung Son , and Ildoo Kim . 2021 . Vilt: Vision-and-language transformer without convolution or region supervision . In International Conference on Machine Learning. PMLR, 5583--5594 . Wonjae Kim, Bokyung Son, and Ildoo Kim. 2021. Vilt: Vision-and-language transformer without convolution or region supervision. In International Conference on Machine Learning. PMLR, 5583--5594."},{"key":"e_1_3_2_2_20_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6795"},{"key":"e_1_3_2_2_21_1","volume-title":"Robust navigation with language pretraining and stochastic sampling. arXiv preprint arXiv:1909.02244","author":"Li Xiujun","year":"2019","unstructured":"Xiujun Li , Chunyuan Li , Qiaolin Xia , Yonatan Bisk , Asli Celikyilmaz , Jianfeng Gao , Noah Smith , and Yejin Choi . 2019. Robust navigation with language pretraining and stochastic sampling. arXiv preprint arXiv:1909.02244 ( 2019 ). Xiujun Li, Chunyuan Li, Qiaolin Xia, Yonatan Bisk, Asli Celikyilmaz, Jianfeng Gao, Noah Smith, and Yejin Choi. 2019. Robust navigation with language pretraining and stochastic sampling. arXiv preprint arXiv:1909.02244 (2019)."},{"key":"e_1_3_2_2_22_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58577-8_8"},{"key":"e_1_3_2_2_23_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00696"},{"key":"e_1_3_2_2_24_1","volume-title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. Advances in neural information processing systems","author":"Lu Jiasen","year":"2019","unstructured":"Jiasen Lu , Dhruv Batra , Devi Parikh , and Stefan Lee . 2019 . Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. Advances in neural information processing systems , Vol. 32 (2019). Jiasen Lu, Dhruv Batra, Devi Parikh, and Stefan Lee. 2019. Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. Advances in neural information processing systems, Vol. 32 (2019)."},{"key":"e_1_3_2_2_25_1","volume-title":"7th International Conference on Learning Representations, ICLR 2019","author":"Ma Chih-Yao","year":"2019","unstructured":"Chih-Yao Ma , Jiasen Lu , Zuxuan Wu , Ghassan AlRegib , Zsolt Kira , Richard Socher , and Caiming Xiong . 2019 a. Self-Monitoring Navigation Agent via Auxiliary Progress Estimation . In 7th International Conference on Learning Representations, ICLR 2019 , New Orleans, LA, USA, May 6--9 , 2019. OpenReview.net. Chih-Yao Ma, Jiasen Lu, Zuxuan Wu, Ghassan AlRegib, Zsolt Kira, Richard Socher, and Caiming Xiong. 2019a. Self-Monitoring Navigation Agent via Auxiliary Progress Estimation. In 7th International Conference on Learning Representations, ICLR 2019, New Orleans, LA, USA, May 6--9, 2019. OpenReview.net."},{"key":"e_1_3_2_2_26_1","volume-title":"The Regretful Agent: Heuristic-Aided Navigation Through Progress Estimation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019","author":"Ma Chih-Yao","year":"2019","unstructured":"Chih-Yao Ma , Zuxuan Wu , Ghassan AlRegib , Caiming Xiong , and Zsolt Kira . 2019 b. The Regretful Agent: Heuristic-Aided Navigation Through Progress Estimation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019 , Long Beach, CA, USA, June 16--20 , 2019. Computer Vision Foundation \/ IEEE, 6732--6740. Chih-Yao Ma, Zuxuan Wu, Ghassan AlRegib, Caiming Xiong, and Zsolt Kira. 2019b. The Regretful Agent: Heuristic-Aided Navigation Through Progress Estimation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019, Long Beach, CA, USA, June 16--20, 2019. Computer Vision Foundation \/ IEEE, 6732--6740."},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58539-6_16"},{"key":"e_1_3_2_2_28_1","volume-title":"International conference on machine learning. PMLR","author":"Mnih Volodymyr","year":"2016","unstructured":"Volodymyr Mnih , Adria Puigdomenech Badia , Mehdi Mirza , Alex Graves , Timothy Lillicrap , Tim Harley , David Silver , and Koray Kavukcuoglu . 2016 . Asynchronous methods for deep reinforcement learning . In International conference on machine learning. PMLR , 1928--1937. Volodymyr Mnih, Adria Puigdomenech Badia, Mehdi Mirza, Alex Graves, Timothy Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu. 2016. Asynchronous methods for deep reinforcement learning. In International conference on machine learning. PMLR, 1928--1937."},{"key":"e_1_3_2_2_29_1","volume-title":"European Conference on Computer Vision. Springer, 303--317","author":"Qi Yuankai","unstructured":"Yuankai Qi , Zizheng Pan , Shengping Zhang , Anton van den Hengel, and Qi Wu. 2020. Object-and-action aware model for visual language navigation . In European Conference on Computer Vision. Springer, 303--317 . Yuankai Qi, Zizheng Pan, Shengping Zhang, Anton van den Hengel, and Qi Wu. 2020. Object-and-action aware model for visual language navigation. In European Conference on Computer Vision. Springer, 303--317."},{"key":"e_1_3_2_2_30_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i3.16353"},{"key":"e_1_3_2_2_31_1","volume-title":"Semi-parametric topological memory for navigation. arXiv preprint arXiv:1803.00653","author":"Savinov Nikolay","year":"2018","unstructured":"Nikolay Savinov , Alexey Dosovitskiy , and Vladlen Koltun . 2018. Semi-parametric topological memory for navigation. arXiv preprint arXiv:1803.00653 ( 2018 ). Nikolay Savinov, Alexey Dosovitskiy, and Vladlen Koltun. 2018. Semi-parametric topological memory for navigation. arXiv preprint arXiv:1803.00653 (2018)."},{"key":"e_1_3_2_2_32_1","volume-title":"Mass: Masked sequence to sequence pre-training for language generation. arXiv preprint arXiv:1905.02450","author":"Song Kaitao","year":"2019","unstructured":"Kaitao Song , Xu Tan , Tao Qin , Jianfeng Lu , and Tie-Yan Liu . 2019 . Mass: Masked sequence to sequence pre-training for language generation. arXiv preprint arXiv:1905.02450 (2019). Kaitao Song, Xu Tan, Tao Qin, Jianfeng Lu, and Tie-Yan Liu. 2019. Mass: Masked sequence to sequence pre-training for language generation. arXiv preprint arXiv:1905.02450 (2019)."},{"key":"e_1_3_2_2_33_1","volume-title":"Vl-bert: Pre-training of generic visual-linguistic representations. arXiv preprint arXiv:1908.08530","author":"Su Weijie","year":"2019","unstructured":"Weijie Su , Xizhou Zhu , Yue Cao , Bin Li , Lewei Lu , Furu Wei , and Jifeng Dai . 2019 . Vl-bert: Pre-training of generic visual-linguistic representations. arXiv preprint arXiv:1908.08530 (2019). Weijie Su, Xizhou Zhu, Yue Cao, Bin Li, Lewei Lu, Furu Wei, and Jifeng Dai. 2019. Vl-bert: Pre-training of generic visual-linguistic representations. arXiv preprint arXiv:1908.08530 (2019)."},{"key":"e_1_3_2_2_34_1","volume-title":"Lxmert: Learning cross-modality encoder representations from transformers. arXiv preprint arXiv:1908.07490","author":"Tan Hao","year":"2019","unstructured":"Hao Tan and Mohit Bansal . 2019 . Lxmert: Learning cross-modality encoder representations from transformers. arXiv preprint arXiv:1908.07490 (2019). Hao Tan and Mohit Bansal. 2019. Lxmert: Learning cross-modality encoder representations from transformers. arXiv preprint arXiv:1908.07490 (2019)."},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N19-1268"},{"key":"e_1_3_2_2_36_1","volume-title":"NAACL-HLT (1)","author":"Tan Hao","unstructured":"Hao Tan , Licheng Yu , and Mohit Bansal . 2019b. Learning to Navigate Unseen Environments: Back Translation with Environmental Dropout .. In NAACL-HLT (1) . Association for Computational Linguistics , 2610--2621. Hao Tan, Licheng Yu, and Mohit Bansal. 2019b. Learning to Navigate Unseen Environments: Back Translation with Environmental Dropout.. In NAACL-HLT (1). Association for Computational Linguistics, 2610--2621."},{"key":"e_1_3_2_2_37_1","volume-title":"Advances in Neural Information Processing Systems 30. Curran Associates","author":"Vaswani Ashish","unstructured":"Ashish Vaswani , Noam Shazeer , Niki Parmar , Jakob Uszkoreit , Llion Jones , Aidan N. Gomez , Lukasz Kaiser , and Illia Polosukhin . 2017. Attention is All you Need . In Advances in Neural Information Processing Systems 30. Curran Associates , Inc ., 5998--6008. Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin. 2017. Attention is All you Need. In Advances in Neural Information Processing Systems 30. Curran Associates, Inc., 5998--6008."},{"key":"e_1_3_2_2_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00835"},{"key":"e_1_3_2_2_39_1","volume-title":"Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019","author":"Wang Xin","year":"2019","unstructured":"Xin Wang , Qiuyuan Huang , Asli cC elikyilmaz, Jianfeng Gao , Dinghan Shen , Yuan-Fang Wang , William Yang Wang , and Lei Zhang . 2019 . Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019 , Long Beach, CA, USA, June 16--20 , 2019. Computer Vision Foundation \/ IEEE, 6629--6638. Xin Wang, Qiuyuan Huang, Asli cC elikyilmaz, Jianfeng Gao, Dinghan Shen, Yuan-Fang Wang, William Yang Wang, and Lei Zhang. 2019. Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019, Long Beach, CA, USA, June 16--20, 2019. Computer Vision Foundation \/ IEEE, 6629--6638."},{"key":"e_1_3_2_2_40_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-88480-2_63"},{"key":"e_1_3_2_2_41_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.7005"},{"key":"e_1_3_2_2_42_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01003"}],"event":{"name":"MM '22: The 30th ACM International Conference on Multimedia","location":"Lisboa Portugal","acronym":"MM '22","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 30th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3548283","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3503161.3548283","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T19:00:43Z","timestamp":1750186843000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3548283"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,10,10]]},"references-count":42,"alternative-id":["10.1145\/3503161.3548283","10.1145\/3503161"],"URL":"https:\/\/doi.org\/10.1145\/3503161.3548283","relation":{},"subject":[],"published":{"date-parts":[[2022,10,10]]},"assertion":[{"value":"2022-10-10","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}