{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T15:41:12Z","timestamp":1783611672236,"version":"3.55.0"},"reference-count":206,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"12","license":[{"start":{"date-parts":[[2024,12,1]],"date-time":"2024-12-01T00:00:00Z","timestamp":1733011200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2024,12,1]],"date-time":"2024-12-01T00:00:00Z","timestamp":1733011200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,12,1]],"date-time":"2024-12-01T00:00:00Z","timestamp":1733011200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2024,12]]},"DOI":"10.1109\/tpami.2024.3408271","type":"journal-article","created":{"date-parts":[[2024,6,3]],"date-time":"2024-06-03T17:36:36Z","timestamp":1717436196000},"page":"8580-8599","source":"Crossref","is-referenced-by-count":62,"title":["On Transforming Reinforcement Learning With Transformers: The Development Trajectory"],"prefix":"10.1109","volume":"46","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6860-2222","authenticated-orcid":false,"given":"Shengchao","family":"Hu","sequence":"first","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5659-3464","authenticated-orcid":false,"given":"Li","family":"Shen","sequence":"additional","affiliation":[{"name":"Sun Yat-sen University, Guangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5390-9053","authenticated-orcid":false,"given":"Ya","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3704-4432","authenticated-orcid":false,"given":"Yixin","family":"Chen","sequence":"additional","affiliation":[{"name":"Washington University in St Louis, St. Louis, MO, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7225-5449","authenticated-orcid":false,"given":"Dacheng","family":"Tao","sequence":"additional","affiliation":[{"name":"Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1136\/amiajnl-2011-000464"},{"key":"ref2","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Brown","year":"2020"},{"key":"ref3","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018"},{"key":"ref4","first-page":"1691","article-title":"Generative pretraining from pixels","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Chen","year":"2020"},{"key":"ref5","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref7","article-title":"Neural machine translation by jointly learning to align and translate","author":"Bahdanau","year":"2014"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D16-1244"},{"key":"ref9","first-page":"8821","article-title":"Zero-shot text-to-image generation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Ramesh","year":"2021"},{"key":"ref10","article-title":"Flamingo: A visual language model for few-shot learning","author":"Alayrac","year":"2022"},{"key":"ref11","article-title":"A generalist agent","author":"Reed","year":"2022"},{"key":"ref12","volume-title":"Reinforcement Learning: An Introduction","author":"Sutton","year":"2018"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-021-09997-9"},{"key":"ref14","article-title":"Reinforcement learning for education: Opportunities and challenges","author":"Singla","year":"2021"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.2196\/18477"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2021.3054625"},{"key":"ref17","article-title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","author":"Levine","year":"2020"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/tnnls.2023.3250269"},{"key":"ref19","first-page":"7487","article-title":"Stabilizing transformers for reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Parisotto","year":"2020"},{"key":"ref20","article-title":"How crucial is transformer in decision transformer?","author":"Siebenborn","year":"2022"},{"key":"ref21","article-title":"A simple neural attentive meta-learner","author":"Mishra","year":"2017"},{"key":"ref22","first-page":"7703","article-title":"Going beyond linear transformers with recurrent fast weight programmers","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Irie","year":"2021"},{"key":"ref23","article-title":"Compressive transformers for long-range sequence modelling","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Rae","year":"2020"},{"key":"ref24","first-page":"15084","article-title":"Decision transformer: Reinforcement learning via sequence modeling","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Chen","year":"2021"},{"key":"ref25","first-page":"1273","article-title":"Offline reinforcement learning as one big sequence modeling problem","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Janner","year":"2021"},{"key":"ref26","article-title":"Transformers in reinforcement learning: A survey","author":"Agarwal","year":"2023"},{"key":"ref27","article-title":"A survey on transformers in reinforcement learning","author":"Li","year":"2023"},{"key":"ref28","first-page":"6404","article-title":"Working memory graphs","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Loynd","year":"2020"},{"key":"ref29","article-title":"CoBERL: Contrastive BERT for reinforcement learning","author":"Banino","year":"2021"},{"key":"ref30","article-title":"TransDreamer: Reinforcement learning with transformer world models","author":"Chen","year":"2022"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3150855"},{"key":"ref32","article-title":"Transformers are sample efficient world models","author":"Micheli","year":"2022"},{"key":"ref33","article-title":"MineDojo: Building open-ended embodied agents with internet-scale knowledge","author":"Fan","year":"2022"},{"key":"ref34","article-title":"You can\u2019t count on luck: Why decision transformers fail in stochastic environments","author":"Paster","year":"2022"},{"key":"ref35","article-title":"When does return-conditioned supervised learning work for offline reinforcement learning?","author":"Brandfonbrener","year":"2022"},{"key":"ref36","article-title":"Online decision transformer","author":"Zheng","year":"2022"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19842-7_27"},{"key":"ref38","article-title":"Q-learning decision transformer: Leveraging dynamic programming for conditional sequence modelling in offline RL","author":"Yamagata","year":"2022"},{"key":"ref39","article-title":"Critic-guided decision transformer for offline reinforcement learning","author":"Wang","year":"2023"},{"key":"ref40","article-title":"Can wikipedia help offline reinforcement learning?","author":"Reid","year":"2022"},{"key":"ref41","article-title":"Pre-trained language models for interactive decision-making","author":"Li","year":"2022"},{"key":"ref42","first-page":"12608","article-title":"Masked autoencoding for scalable and generalizable decision making","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Liu","year":"2022"},{"key":"ref43","article-title":"Masked trajectory models for prediction, representation, and control","author":"Wu","year":"2023"},{"key":"ref44","article-title":"Multi-game decision transformers","author":"Lee","year":"2022"},{"key":"ref45","article-title":"Generalized decision transformer for offline hindsight information matching","author":"Furuta","year":"2021"},{"key":"ref46","first-page":"24631","article-title":"Prompting decision transformer for few-shot policy generalization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Xu","year":"2022"},{"key":"ref47","article-title":"Offline pre-trained multi-agent decision transformer: One big sequence model conquers all starcraftii tasks","author":"Meng","year":"2021"},{"key":"ref48","first-page":"16509","article-title":"Multi-agent reinforcement learning is a sequence modeling problem","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Wen","year":"2022"},{"key":"ref49","article-title":"Learning multi-agent communication from graph modeling perspective","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Hu","year":"2024"},{"key":"ref50","article-title":"MaskMA: Towards zero-shot multi-agent decision making with mask-based collaborative learning","author":"Liu","year":"2024"},{"key":"ref51","first-page":"2071","article-title":"Transformers for one-shot visual imitation","volume-title":"Proc. 4th Conf. Robot Learn.","author":"Dasari","year":"2021"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/icra48891.2023.10161068"},{"key":"ref53","article-title":"Transformers are adaptable task planners","author":"Jain","year":"2022"},{"key":"ref54","article-title":"How to avoid being eaten by a grue: Structured exploration strategies for textual worlds","author":"Ammanabrolu","year":"2020"},{"key":"ref55","first-page":"3045","article-title":"Learning dynamic belief graphs to generalize on text-based games","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Adhikari","year":"2020"},{"key":"ref56","article-title":"Learning object-oriented dynamics for planning from text","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Liu","year":"2022"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01315"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00169"},{"key":"ref59","first-page":"5834","article-title":"History aware multimodal transformer for vision-and-language navigation","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Chen","year":"2021"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00700"},{"key":"ref61","article-title":"Safety-enhanced autonomous driving using interpretable sensor fusion transformer","author":"Shao","year":"2022"},{"key":"ref62","first-page":"22270","article-title":"Addressing optimism bias in sequence modeling for reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Villaflor","year":"2022"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CCECE53047.2021.9569056"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1561\/2200000086"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i12.17276"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.32657\/10356\/90191"},{"key":"ref67","article-title":"Playing Atari with deep reinforcement learning","author":"Mnih","year":"2013"},{"key":"ref68","article-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.3389\/frobt.2021.738113"},{"key":"ref70","article-title":"Understanding the pathologies of approximate policy evaluation when combined with greedification in reinforcement learning","author":"Young","year":"2020"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref72","first-page":"2052","article-title":"Off-policy deep reinforcement learning without exploration","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Fujimoto","year":"2019"},{"key":"ref73","first-page":"1179","article-title":"Conservative Q-learning for offline reinforcement learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Kumar","year":"2020"},{"key":"ref74","article-title":"Offline reinforcement learning with implicit Q-learning","author":"Kostrikov","year":"2021"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3152247"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1145\/3505244"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/tnnls.2022.3227717"},{"key":"ref79","article-title":"A structured self-attentive sentence embedding","author":"Lin","year":"2017"},{"key":"ref80","article-title":"Gaussian error linear units (GELUs)","author":"Hendrycks","year":"2016"},{"key":"ref81","article-title":"Deep learning using rectified linear units (ReLU)","author":"Agarap","year":"2018"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1016\/S0004-3702(98)00023-X"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"ref84","article-title":"Empirical evaluation of gated recurrent neural networks on sequence modeling","author":"Chung","year":"2014"},{"key":"ref85","first-page":"1406","article-title":"IMPALA: Scalable distributed deep-RL with importance weighted actor-learner architectures","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Espeholt","year":"2018"},{"key":"ref86","article-title":"Recurrent experience replay in distributed reinforcement learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Kapturowski","year":"2018"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P19-1285"},{"key":"ref88","first-page":"5754","article-title":"XLNet: Generalized autoregressive pretraining for language understanding","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Yang","year":"2019"},{"key":"ref89","article-title":"Transformers without tears: Improving the normalization of self-attention","author":"Nguyen","year":"2019"},{"key":"ref90","first-page":"10524","article-title":"On layer normalization in the transformer architecture","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Xiong","year":"2020"},{"key":"ref91","article-title":"Highway networks","author":"Srivastava","year":"2015"},{"key":"ref92","first-page":"4790","article-title":"Conditional image generation with pixelcnn decoders","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Van den Oord","year":"2016"},{"key":"ref93","article-title":"Deepmind lab","author":"Beattie","year":"2016"},{"key":"ref94","article-title":"V-MPO: On-policy maximum a posteriori policy optimization for discrete and continuous control","author":"Song","year":"2019"},{"key":"ref95","first-page":"9355","article-title":"Linear transformers are secretly fast weight programmers","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Schlag","year":"2021"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v30i1.10303"},{"key":"ref97","article-title":"Transformer in transformer as backbone for deep reinforcement learning","author":"Mao","year":"2022"},{"key":"ref98","article-title":"The uncanny similarity of recurrence and depth","author":"Schwarzschild","year":"2021"},{"key":"ref99","article-title":"Deepmind control suite","author":"Tassa","year":"2018"},{"key":"ref100","article-title":"Data-efficient reinforcement learning with self-predictive representations","author":"Schwarzer","year":"2020"},{"key":"ref101","first-page":"25476","article-title":"Mastering Atari games with limited data","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ye","year":"2021"},{"key":"ref102","article-title":"Dream to control: Learning behaviors by latent imagination","author":"Hafner","year":"2019"},{"key":"ref103","article-title":"Mastering Atari with discrete world models","author":"Hafner","year":"2020"},{"key":"ref104","article-title":"Model-based reinforcement learning for Atari","author":"Kaiser","year":"2019"},{"key":"ref105","first-page":"8302","article-title":"Vector quantized models for planning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Ozair","year":"2021"},{"key":"ref106","article-title":"Efficient selectivity and backup operators in Monte-Carlo tree search","volume-title":"Proc. Int. Conf. Comput. Games","author":"Coulom","year":"2006"},{"key":"ref107","article-title":"Speech understanding systems. summary of results of the five-year research effort at Carnegie-Mellon University","author":"Reddy","year":"1977"},{"key":"ref108","article-title":"Towards flexible inference in sequential decision problems via bidirectional transformers","author":"Carroll","year":"2022"},{"key":"ref109","article-title":"Switch trajectory transformer with distributional value approximation for multi-task reinforcement learning","author":"Lin","year":"2022"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"ref111","article-title":"Training agents using upside-down reinforcement learning","author":"Srivastava","year":"2019"},{"key":"ref112","article-title":"Reward-conditioned policies","author":"Kumar","year":"2019"},{"key":"ref113","article-title":"Rethinking decision transformer via hierarchical reinforcement learning","author":"Ma","year":"2024"},{"key":"ref114","article-title":"Graph decision transformer","author":"Hu","year":"2023"},{"key":"ref115","article-title":"Multi-objective decision transformers for offline reinforcement learning","author":"Ghanem","year":"2023"},{"key":"ref116","article-title":"Bootstrapped transformer for offline reinforcement learning","author":"Wang","year":"2022"},{"key":"ref117","article-title":"Decision convformer: Local filtering in metaformer is sufficient for decision making","author":"Kim","year":"2023"},{"key":"ref118","article-title":"Accelerating online reinforcement learning with offline datasets","author":"Nair","year":"2020"},{"key":"ref119","article-title":"Reinforcement learning and control as probabilistic inference: Tutorial and review","author":"Levine","year":"2018"},{"key":"ref120","article-title":"Soft actor-critic algorithms and applications","author":"Haarnoja","year":"2018"},{"key":"ref121","article-title":"D4RL: Datasets for deep data-driven reinforcement learning","author":"Fu","year":"2020"},{"key":"ref122","article-title":"ALBERT: A lite BERT for self-supervised learning of language representations","author":"Lan","year":"2019"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1145\/3404835.3463036"},{"key":"ref124","article-title":"Dichotomy of control: Separating what you can control from what you cannot","author":"Yang","year":"2022"},{"key":"ref125","article-title":"Elastic decision transformer","author":"Wu","year":"2023"},{"key":"ref126","first-page":"2048","article-title":"Leveraging procedural generation to benchmark reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Cobbe","year":"2020"},{"key":"ref127","first-page":"1094","article-title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","volume-title":"Proc. 3rd Annu. Conf. Robot Learn.","author":"Yu","year":"2020"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386109"},{"key":"ref129","article-title":"BabyAI 1.1","author":"Hui","year":"2020"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00886"},{"key":"ref131","first-page":"11784","article-title":"Representation matters: Offline pretraining for sequential decision making","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Yang","year":"2021"},{"key":"ref132","article-title":"Behavior regularized offline reinforcement learning","author":"Wu","year":"2019"},{"key":"ref133","article-title":"Playing Atari with six neurons","author":"Cuccu","year":"2018"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1613\/jair.3912"},{"key":"ref135","first-page":"1928","article-title":"Asynchronous methods for deep reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Mnih","year":"2016"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.1287\/opre.36.4.589"},{"key":"ref137","article-title":"Multitask prompted training enables zero-shot task generalization","author":"Sanh","year":"2021"},{"key":"ref138","article-title":"Finetuned language models are zero-shot learners","author":"Wei","year":"2021"},{"key":"ref139","first-page":"7754","article-title":"Generalized hindsight for reinforcement learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Li","year":"2020"},{"key":"ref140","first-page":"1126","article-title":"Model-agnostic meta-learning for fast adaptation of deep networks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Finn","year":"2017"},{"key":"ref141","first-page":"7780","article-title":"Offline meta-reinforcement learning with advantage weighting","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Mitchell","year":"2021"},{"key":"ref142","article-title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing","author":"Liu","year":"2021"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01075"},{"key":"ref144","article-title":"Prompt-tuning decision transformer with preference ranking","author":"Hu","year":"2023"},{"key":"ref145","first-page":"21677","article-title":"AnyMorph: Learning transferable polices by inferring agent morphology","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Trabucco","year":"2022"},{"key":"ref146","first-page":"22574","article-title":"The sensory neuron as a transformer: Permutation-invariant neural networks for reinforcement learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Tang","year":"2021"},{"key":"ref147","article-title":"Transfer learning with causal counterfactual reasoning in decision transformers","author":"Boustati","year":"2021"},{"key":"ref148","article-title":"An overview of multi-agent reinforcement learning from game theoretical perspective","author":"Yang","year":"2020"},{"key":"ref149","article-title":"The surprising effectiveness of PPO in cooperative, multi-agent games","author":"Yu","year":"2021"},{"key":"ref150","article-title":"The starcraft multi-agent challenge","author":"Samvelyan","year":"2019"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.3390\/a15050152"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.23860\/diss-li-hepfeng-2023"},{"key":"ref153","first-page":"13458","article-title":"Settling the variance of multi-agent policy gradients","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Kuba","year":"2021"},{"key":"ref154","article-title":"Deep multi-agent reinforcement learning for decentralized continuous cooperative control","author":"de Witt","year":"2020"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i04.5878"},{"key":"ref156","first-page":"34874","article-title":"Transformer-based working memory for multiagent reinforcement learning with action parsing","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Yang","year":"2022"},{"key":"ref157","article-title":"UPDeT: Universal multi-agent reinforcement learning via policy decoupling with transformers","author":"Hu","year":"2021"},{"issue":"14","key":"ref158","first-page":"1","article-title":"Task and context determine where you look","volume":"7","author":"Rothkopf","year":"2007","journal-title":"J. Vis."},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01252-6_41"},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9812450"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.1109\/IROS47612.2022.9981810"},{"key":"ref162","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Radford","year":"2021"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2022.XVIII.065"},{"key":"ref164","article-title":"Instruction-driven history-aware policies for robotic manipulations","author":"Guhur","year":"2022"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1109\/tmech.2024.3400789"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3144512"},{"key":"ref167","article-title":"Learning vision-guided quadrupedal locomotion end-to-end with cross-modal transformers","author":"Yang","year":"2021"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1109\/IROS51168.2021.9636301"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-24337-1_3"},{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1062"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i05.6297"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1280"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/n19-1358"},{"key":"ref174","article-title":"Graph constrained reinforcement learning for natural language action spaces","author":"Ammanabrolu","year":"2020"},{"key":"ref175","article-title":"Learning to follow instructions in text-based games","author":"Tuli","year":"2022"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00387"},{"key":"ref177","article-title":"Mind the error! detection and localization of instruction errors in vision-and-language navigation","author":"Taioli","year":"2024"},{"key":"ref178","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01282"},{"key":"ref179","first-page":"394","article-title":"Vision-and-dialog navigation","volume-title":"Proc. 3rd Annu. Conf. Robot Learn.","author":"Thomason","year":"2020"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01281"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1063"},{"key":"ref182","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01000"},{"key":"ref183","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D17-1106"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1514"},{"key":"ref185","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1159"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58539-6_16"},{"key":"ref187","first-page":"13","article-title":"ViLBERT: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Lu","year":"2019"},{"key":"ref188","first-page":"2737","article-title":"BEVBert: Multimodal map pre-training for language-guided navigation","volume-title":"Proc. IEEE Int. Conf. Comput. Vis.","author":"An","year":"2023"},{"key":"ref189","article-title":"AVLEN: Audio-visual-language embodied navigation in 3D environments","author":"Paul","year":"2022"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01604"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01564"},{"key":"ref192","first-page":"1","article-title":"Carla: An open urban driving simulator","volume-title":"Proc. 1st Annu. Conf. Robot Learn.","author":"Dosovitskiy","year":"2017"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00942"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01164"},{"key":"ref195","first-page":"156","article-title":"SAM: Squeeze-and-mimic networks for conditional visual driving policy learning","volume-title":"Proc. 1st Annu. Conf. Robot Learn.","author":"Zhao","year":"2021"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19839-7_31"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01712"},{"key":"ref198","article-title":"Behavior transformers: Cloning $ k$k modes with one stone","author":"Shafiullah","year":"2022"},{"key":"ref199","first-page":"5244","article-title":"Enhancing the locality and breaking the memory bottleneck of transformer on time series forecasting","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Li","year":"2019"},{"key":"ref200","doi-asserted-by":"publisher","DOI":"10.1109\/JBHI.2023.3266977"},{"key":"ref201","article-title":"Efficient transformers in reinforcement learning using actor-learner distillation","author":"Parisotto","year":"2021"},{"key":"ref202","article-title":"In-context reinforcement learning with algorithm distillation","author":"Laskin","year":"2022"},{"key":"ref203","article-title":"A generalist dynamics model for control","author":"Schubert","year":"2023"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-naacl.181"},{"key":"ref205","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.naacl-main.332"},{"key":"ref206","article-title":"Training language models to follow instructions with human feedback","author":"Ouyang","year":"2022"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/34\/10746266\/10546317.pdf?arnumber=10546317","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,27]],"date-time":"2024-11-27T00:24:53Z","timestamp":1732667093000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10546317\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12]]},"references-count":206,"journal-issue":{"issue":"12"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2024.3408271","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12]]}}}