{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T15:41:48Z","timestamp":1783438908982,"version":"3.54.6"},"reference-count":58,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2023]]},"DOI":"10.1109\/tpami.2023.3234243","type":"journal-article","created":{"date-parts":[[2023,1,4]],"date-time":"2023-01-04T18:36:35Z","timestamp":1672857395000},"page":"1-14","source":"Crossref","is-referenced-by-count":41,"title":["HOP+: History-Enhanced and Order-Aware Pre-Training for Vision-and-Language Navigation"],"prefix":"10.1109","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5606-0702","authenticated-orcid":false,"given":"Yanyuan","family":"Qiao","sequence":"first","affiliation":[{"name":"Australian Institute for Machine Learning (AIML), School of Computer Science, The University of Adelaide, Adelaide, SA, Australia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4312-5682","authenticated-orcid":false,"given":"Yuankai","family":"Qi","sequence":"additional","affiliation":[{"name":"Australian Institute for Machine Learning (AIML), School of Computer Science, The University of Adelaide, Adelaide, SA, Australia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5068-1508","authenticated-orcid":false,"given":"Yicong","family":"Hong","sequence":"additional","affiliation":[{"name":"Australian National University, Canberra, Australia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4307-4320","authenticated-orcid":false,"given":"Zheng","family":"Yu","sequence":"additional","affiliation":[{"name":"Australian Institute for Machine Learning (AIML), School of Computer Science, The University of Adelaide, Adelaide, SA, Australia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9218-9132","authenticated-orcid":false,"given":"Peng","family":"Wang","sequence":"additional","affiliation":[{"name":"Northwestern Polytechnical University, Xi&#x0027;an, Shaanxi, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3631-256X","authenticated-orcid":false,"given":"Qi","family":"Wu","sequence":"additional","affiliation":[{"name":"Australian Institute for Machine Learning (AIML), School of Computer Science, The University of Adelaide, Adelaide, SA, Australia"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref13","first-page":"1643","article-title":"A recurrent vision-and-language BERT for navigation","author":"hong","year":"2021","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref57","article-title":"General evaluation for instruction conditioned navigation using dynamic time warping","author":"ilharco","year":"2019","journal-title":"Proc Adv Neural Inf Process Syst Workshop"},{"key":"ref12","first-page":"347","article-title":"Variational context: Exploiting visual and textual context for grounding referring expressions","volume":"43","author":"niu","year":"2021","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"ref56","article-title":"On evaluation of embodied navigation agents","author":"anderson","year":"2018"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00166"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01315"},{"key":"ref58","first-page":"4171","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"devlin","year":"2019","journal-title":"Proc North Amer Chapter Associat Comput Linguist Hum Languag Technol"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.naacl-main.82"},{"key":"ref52","first-page":"7357","article-title":"SOAT: A scene-and object-aware transformer for vision-and-language navigation","volume":"34","author":"moudgil","year":"2021","journal-title":"Adv Neural Inf Process Syst"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46475-6_5"},{"key":"ref55","first-page":"1928","article-title":"Asynchronous methods for deep reinforcement learning","author":"mnih","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref10","first-page":"212","article-title":"Stacked cross attention for image-text matching","author":"lee","year":"2018","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref54","article-title":"Decoupled weight decay regularization","author":"loshchilov","year":"2019","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref17","first-page":"15418","article-title":"HOP: History-and-order aware pre-training for vision-and-language navigation","author":"qiao","year":"2022","journal-title":"Proc Conf Comput Vis Pattern Recognit"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58539-6_16"},{"key":"ref19","article-title":"Self-monitoring navigation agent via auxiliary progress estimation","author":"ma","year":"2019","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1238"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00167"},{"key":"ref50","first-page":"1643","article-title":"VLN $\\circlearrowright$? BERT: A recurrent vision-and-language BERT for navigation","author":"hong","year":"2021","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00689"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58542-6_19"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00690"},{"key":"ref42","article-title":"Memory networks","author":"jason","year":"2014"},{"key":"ref41","article-title":"Neural turing machines","author":"graves","year":"2014"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00065"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3097435"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01250"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.356"},{"key":"ref9","first-page":"394","article-title":"Vision-and-dialog navigation","author":"thomason","year":"2019","journal-title":"Proc Conf Robot Learn"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01000"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1063"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01281"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58604-1_7"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01074"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00750"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1159"},{"key":"ref37","first-page":"1378","article-title":"Ask me anything: Dynamic memory networks for natural language processing","author":"kumar","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref36","first-page":"2440","article-title":"End-to-end memory networks","author":"sukhbaatar","year":"2015","journal-title":"Proc Adv Neural Inf Process Syst Annu Conf Neural Inf Process Syst"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1514"},{"key":"ref30","first-page":"13","article-title":"VilBERT: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","author":"lu","year":"2019","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58577-8_8"},{"key":"ref32","first-page":"104","article-title":"UNITER: Universal image-text representation learning","author":"chen","year":"2020","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01282"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00387"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00729"},{"key":"ref38","first-page":"2397","article-title":"Dynamic memory networks for visual and textual question answering","author":"xiong","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N19-1268"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475282"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58545-7_8"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00679"},{"key":"ref20","first-page":"3318","article-title":"Speaker-follower models for vision-and-language navigation","author":"fried","year":"2018","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref22","first-page":"7685","article-title":"Language and visual entity relationship graph for agent navigation","author":"hong","year":"2020","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58607-2_18"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01564"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00168"},{"key":"ref29","first-page":"5834","article-title":"History aware multimodal transformer for vision-and-language navigation","author":"chen","year":"2021","journal-title":"Proc Adv Neural Inf Process Syst"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/4359286\/10006384.pdf?arnumber=10006384","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,6,6]],"date-time":"2023-06-06T22:33:20Z","timestamp":1686090800000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10006384\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023]]},"references-count":58,"URL":"https:\/\/doi.org\/10.1109\/tpami.2023.3234243","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023]]}}}