{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T18:02:54Z","timestamp":1784311374488,"version":"3.55.0"},"reference-count":50,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Sciences"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.ins.2026.123774","type":"journal-article","created":{"date-parts":[[2026,6,11]],"date-time":"2026-06-11T06:25:07Z","timestamp":1781159107000},"page":"123774","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Temporal difference learning with constrained initial representations"],"prefix":"10.1016","volume":"755","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-6616-417X","authenticated-orcid":false,"given":"Jiafei","family":"Lyu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-4430-4129","authenticated-orcid":false,"given":"Jingwen","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhongjian","family":"Qiao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-4784-5333","authenticated-orcid":false,"given":"Runze","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zeyuan","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Deheng","family":"Ye","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zongqing","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiu","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.ins.2026.123774_bib0005","series-title":"International Conference on Machine Learning","first-page":"1587","article-title":"Addressing function approximation error in actor-critic methods","author":"Fujimoto","year":"2018"},{"key":"10.1016\/j.ins.2026.123774_bib0010","series-title":"International Conference on Machine Learning","first-page":"5556","article-title":"Controlling overestimation bias with truncated mixture of continuous distributional quantile critics","author":"Kuznetsov","year":"2020"},{"key":"10.1016\/j.ins.2026.123774_bib0015","author":"Haarnoja"},{"key":"10.1016\/j.ins.2026.123774_bib0020","series-title":"International Conference on Learning Representations","article-title":"Randomized ensembled double Q-learning: learning fast without a model","author":"Chen","year":"2021"},{"key":"10.1016\/j.ins.2026.123774_bib0025","series-title":"The Eleventh International Conference on Learning Representations","article-title":"Sample-efficient reinforcement learning by breaking the replay ratio barrier","author":"D\u2019Oro","year":"2023"},{"key":"10.1016\/j.ins.2026.123774_bib0030","series-title":"International Conference on Machine Learning","article-title":"The primacy bias in deep reinforcement learning","author":"Nikishin","year":"2022"},{"key":"10.1016\/j.ins.2026.123774_bib0035","article-title":"Sample-efficient reinforcement learning with stochastic ensemble value expansion","volume":"31","author":"Buckman","year":"2018","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.ins.2026.123774_bib0040","series-title":"International Conference on Machine Learning","first-page":"8387","article-title":"Temporal difference learning for model predictive control","author":"Hansen","year":"2022"},{"key":"10.1016\/j.ins.2026.123774_bib0045","series-title":"The Thirteenth International Conference on Learning Representations","article-title":"MAD-TD: model-augmented data stabilizes high update ratio RL","author":"Voelcker","year":"2025"},{"key":"10.1016\/j.ins.2026.123774_bib0050","author":"Andrychowicz"},{"key":"10.1016\/j.ins.2026.123774_bib0055","series-title":"The Thirty-Eighth Annual Conference on Neural Information Processing Systems","article-title":"Bigger, regularized, optimistic: scaling for compute and sample efficient continuous control","author":"Nauman","year":"2024"},{"key":"10.1016\/j.ins.2026.123774_bib0060","series-title":"International Conference on Machine Learning","first-page":"449","article-title":"A distributional perspective on reinforcement learning","author":"Bellemare","year":"2017"},{"key":"10.1016\/j.ins.2026.123774_bib0065","series-title":"The Thirteenth International Conference on Learning Representations","article-title":"SimBa: simplicity bias for scaling up parameters in deep reinforcement learning","author":"Lee","year":"2025"},{"key":"10.1016\/j.ins.2026.123774_bib0070","author":"Ba"},{"key":"10.1016\/j.ins.2026.123774_bib0075","author":"Tassa"},{"key":"10.1016\/j.ins.2026.123774_bib0080","author":"Sferrazza"},{"key":"10.1016\/j.ins.2026.123774_bib0085","series-title":"The Thirty-Eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track","article-title":"ODRL: a benchmark for off-dynamics reinforcement learning","author":"Lyu","year":"2024"},{"key":"10.1016\/j.ins.2026.123774_bib0090","series-title":"Proceedings of the European Conference on Computer Vision (ECCV)","first-page":"507","article-title":"On regularized losses for weakly-supervised CNN segmentation","author":"Tang","year":"2018"},{"issue":"12","key":"10.1016\/j.ins.2026.123774_bib0095","doi-asserted-by":"crossref","first-page":"2273","DOI":"10.1109\/TCSVT.2015.2477937","article-title":"Multi-loss regularized deep neural network","volume":"26","author":"Xu","year":"2015","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.ins.2026.123774_bib0100","doi-asserted-by":"crossref","first-page":"1467","DOI":"10.1007\/s10994-019-05788-0","article-title":"TD-regularized actor-critic methods","volume":"108","author":"Parisi","year":"2018","journal-title":"Mach. Learn."},{"key":"10.1016\/j.ins.2026.123774_bib0105","series-title":"International Conference on Machine Learning","article-title":"Offline reinforcement learning with fisher divergence critic regularization","author":"Kostrikov","year":"2021"},{"key":"10.1016\/j.ins.2026.123774_bib0110","series-title":"International Conference on Machine Learning","article-title":"Divergence-regularized multi-agent actor-critic","author":"Su","year":"2021"},{"key":"10.1016\/j.ins.2026.123774_bib0115","series-title":"Conference on Robot Learning","article-title":"Mutual-information regularization in Markov decision processes and actor-critic learning","author":"Leibfried","year":"2019"},{"key":"10.1016\/j.ins.2026.123774_bib0120","series-title":"Neural Information Processing Systems","article-title":"Towards deeper deep reinforcement learning","author":"Bjorck","year":"2021"},{"key":"10.1016\/j.ins.2026.123774_bib0125","first-page":"1929","article-title":"Dropout: a simple way to prevent neural networks from overfitting","volume":"15","author":"Srivastava","year":"2014","journal-title":"J. Mach. Learn. Res."},{"key":"10.1016\/j.ins.2026.123774_bib0130","author":"Farebrother"},{"key":"10.1016\/j.ins.2026.123774_bib0135","series-title":"International Conference on Machine Learning","article-title":"The dormant neuron phenomenon in deep reinforcement learning","author":"Sokar","year":"2023"},{"key":"10.1016\/j.ins.2026.123774_bib0140","series-title":"International Conference on Machine Learning","article-title":"Bigger, better, faster: human-level atari with human-level efficiency","author":"Schwarzer","year":"2023"},{"key":"10.1016\/j.ins.2026.123774_bib0145","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/j.inffus.2022.03.003","article-title":"Exploration in deep reinforcement learning: a survey","volume":"85","author":"Ladosz","year":"2022","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.ins.2026.123774_bib0150","first-page":"12849","article-title":"Tactical optimism and pessimism for deep reinforcement learning","volume":"34","author":"Moskovitz","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.ins.2026.123774_bib0155","first-page":"14219","article-title":"An equivalence between loss functions and non-uniform sampling in experience replay","volume":"33","author":"Fujimoto","year":"2020","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.ins.2026.123774_bib0160","doi-asserted-by":"crossref","DOI":"10.1016\/j.ins.2024.120371","article-title":"Off-policy RL algorithms can be sample-efficient for continuous control via sample multiple reuse","volume":"666","author":"Lyu","year":"2024","journal-title":"Inf. Sci."},{"key":"10.1016\/j.ins.2026.123774_bib0165","series-title":"International Conference on Machine Learning","first-page":"7424","article-title":"Can increasing input dimensionality improve deep reinforcement learning?","author":"Ota","year":"2020"},{"key":"10.1016\/j.ins.2026.123774_bib0170","series-title":"Thirty-Seventh Conference on Neural Information Processing Systems","article-title":"For SALE: state-action representation learning for deep reinforcement learning","author":"Fujimoto","year":"2023"},{"key":"10.1016\/j.ins.2026.123774_bib0175","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.112487","article-title":"Enhancing visual reinforcement learning with state\u2013action representation","volume":"304","author":"Yan","year":"2024","journal-title":"Knowl.-based Syst."},{"key":"10.1016\/j.ins.2026.123774_bib0180","series-title":"The Thirteenth International Conference on Learning Representations","article-title":"Towards general-purpose model-free reinforcement learning","author":"Fujimoto","year":"2025"},{"key":"10.1016\/j.ins.2026.123774_bib0185","series-title":"The Twelfth International Conference on Learning Representations","article-title":"TD-MPC2: scalable, robust world models for continuous control","author":"Hansen","year":"2024"},{"key":"10.1016\/j.ins.2026.123774_bib0190","series-title":"Conference on Learning Theory","first-page":"2137","article-title":"Provably efficient reinforcement learning with linear function approximation","author":"Jin","year":"2020"},{"key":"10.1016\/j.ins.2026.123774_bib0195","series-title":"Medical Image Computing and Computer-Assisted intervention\u2013MICCAI 2015: 18th International Conference, Munich, Germany, October 5\u20139, 2015, Proceedings, Part III 18","first-page":"234","article-title":"U-Net: convolutional networks for biomedical image segmentation","author":"Ronneberger","year":"2015"},{"key":"10.1016\/j.ins.2026.123774_bib0200","series-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"770","article-title":"Deep residual learning for image recognition","author":"He","year":"2015"},{"key":"10.1016\/j.ins.2026.123774_bib0205","article-title":"Better exploration with optimistic actor critic","volume":"32","author":"Ciosek","year":"2019","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.ins.2026.123774_bib0210","author":"Hafner"},{"key":"10.1016\/j.ins.2026.123774_bib0215","series-title":"International Conference on Learning Representations","article-title":"Off-dynamics reinforcement learning: training for transfer with domain classifiers","author":"Eysenbach","year":"2021"},{"key":"10.1016\/j.ins.2026.123774_bib0220","series-title":"Forty-First International Conference on Machine Learning","article-title":"Cross-domain policy adaptation by capturing representation mismatch","author":"Lyu","year":"2024"},{"key":"10.1016\/j.ins.2026.123774_bib0225","series-title":"The Thirteenth International Conference on Learning Representations","article-title":"Simplifying deep temporal difference learning","author":"Gallici","year":"2025"},{"key":"10.1016\/j.ins.2026.123774_bib0230","article-title":"Analysis of temporal-diffference learning with function approximation","volume":"9","author":"Tsitsiklis","year":"1996","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.ins.2026.123774_bib0235","series-title":"Introductory Lectures on Convex Optimization: A Basic Course","volume":"vol. 87","author":"Nesterov","year":"2013"},{"key":"10.1016\/j.ins.2026.123774_bib0240","series-title":"Joint European Conference on Machine Learning and Knowledge Discovery in Databases","first-page":"795","article-title":"Linear convergence of gradient and proximal-gradient methods under the polyak-\u0142ojasiewicz condition","author":"Karimi","year":"2016"},{"key":"10.1016\/j.ins.2026.123774_bib0245","author":"Kingma"},{"key":"10.1016\/j.ins.2026.123774_bib0250","first-page":"29304","article-title":"Deep reinforcement learning at the edge of the statistical precipice","volume":"34","author":"Agarwal","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."}],"container-title":["Information Sciences"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S002002552600705X?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S002002552600705X?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T17:05:49Z","timestamp":1784307949000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S002002552600705X"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":50,"alternative-id":["S002002552600705X"],"URL":"https:\/\/doi.org\/10.1016\/j.ins.2026.123774","relation":{},"ISSN":["0020-0255"],"issn-type":[{"value":"0020-0255","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Temporal difference learning with constrained initial representations","name":"articletitle","label":"Article Title"},{"value":"Information Sciences","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.ins.2026.123774","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Inc. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"123774"}}