{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,27]],"date-time":"2026-03-27T15:45:26Z","timestamp":1774626326299,"version":"3.50.1"},"reference-count":29,"publisher":"Frontiers Media SA","license":[{"start":{"date-parts":[[2026,3,24]],"date-time":"2026-03-24T00:00:00Z","timestamp":1774310400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["frontiersin.org"],"crossmark-restriction":true},"short-container-title":["Front. Comput. Neurosci."],"abstract":"<jats:p>The ability to anticipate future events continuously is a hallmark of biological vision, yet standard deep learning models often struggle with long-term coherence due to the rigid discretization of time. In this paper, we propose NeuralVisionNet, a probabilistic framework that models visual anticipation as a continuous generative process, drawing inspiration from the predictive coding mechanisms of the hippocampal-entorhinal circuit. Our architecture synergizes hierarchical Video Swin Transformers with Attentive Neural Processes, employing a novel grid-like coding scheme to represent spatiotemporal dynamics as a continuous function rather than a fixed sequence of frames. Furthermore, we introduce a variational global latent variable to encode the \u201cevent gist,\u201d ensuring semantic consistency over extended horizons. Extensive evaluations on KTH, Human 3.6M, and UCF 101 benchmarks demonstrate that NeuralVisionNet significantly outperforms state-of-the-art stochastic baselines in perceptual quality (FVD) and structural fidelity (SSIM), offering a robust computational proof-of-concept for continuous, bio-inspired visual forecasting.<\/jats:p>","DOI":"10.3389\/fncom.2026.1781080","type":"journal-article","created":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T18:31:55Z","timestamp":1774463515000},"update-policy":"https:\/\/doi.org\/10.3389\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["NeuralVisionNet: a probabilistic neural process model for continuous visual anticipation"],"prefix":"10.3389","volume":"20","author":[{"given":"Han","family":"He","sequence":"first","affiliation":[{"name":"Faculty of Data Science, City University of Macau","place":["Taipa, Macao SAR, China"]}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ruinan","family":"Chen","sequence":"additional","affiliation":[{"name":"Faculty of Data Science, City University of Macau","place":["Taipa, Macao SAR, China"]}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yixiang","family":"Wang","sequence":"additional","affiliation":[{"name":"Faculty of Data Science, City University of Macau","place":["Taipa, Macao SAR, China"]}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xia","family":"Chen","sequence":"additional","affiliation":[{"name":"University of Wisconsin \u2013 Milwaukee","place":["Milwaukee, WI, United States"]}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"1965","published-online":{"date-parts":[[2026,3,24]]},"reference":[{"key":"B1","unstructured":"Bardes\n              A.\n            \n            \n              Garrido\n              Q.\n            \n            \n              Ponce\n              J.\n            \n            \n              Chen\n              X.\n            \n            \n              Rabbat\n              M.\n            \n            \n              LeCun\n              Y.\n            \n          \n          V-JEPA: Latent Video Prediction for Visual Representation Learning.\n          \n          2024"},{"key":"B2","doi-asserted-by":"crossref","unstructured":"Bar-Tal\n              O.\n            \n            \n              Chefer\n              H.\n            \n            \n              Tov\n              O.\n            \n            \n              Herrmann\n              C.\n            \n            \n              Paiss\n              R.\n            \n            \n              Zada\n              S.\n            \n          \n          10.1145\/3680528.3687614\n          Lumiere: A Space-Time Diffusion Model for Video Generation.\n          \n          2024","DOI":"10.1145\/3680528.3687614"},{"key":"B3","doi-asserted-by":"publisher","first-page":"eaat6766","DOI":"10.1126\/science.aat6766","article-title":"Navigating cognition: Spatial codes for human thinking","volume":"362","author":"Bellmund","year":"2018","journal-title":"Science"},{"key":"B4","doi-asserted-by":"crossref","DOI":"10.1109\/CVPR52729.2023.02161","article-title":"\u201cAlign Your Latents: High-Resolution Video Synthesis with Latent Diffusion Models,\u201d","volume-title":"2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR).","author":"Blattmann","year":"2023"},{"key":"B5","unstructured":"Brooks\n              T.\n            \n            \n              Peebles\n              B.\n            \n            \n              Holmes\n              C.\n            \n            \n              DePue\n              W.\n            \n            \n              Guo\n              Y.\n            \n            \n              Jing\n              L.\n            \n          \n          Video Generation Models as World Simulators.\n          \n          2024"},{"key":"B6","unstructured":"Bruce\n              J.\n            \n            \n              Dennis\n              M.\n            \n            \n              Edwards\n              A.\n            \n            \n              Parker-Holder\n              J.\n            \n            \n              Shi\n              Y.\n            \n            \n              Hughes\n              E.\n            \n          \n          Genie: Generative Interactive Environments\n          \n          2024"},{"key":"B7","first-page":"21557","article-title":"NeRV: neural representations for videos","volume":"34","author":"Chen","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"B8","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02126","article-title":"\u201cEfficient Video Prediction via Sparsely Conditioned Flow Matching,\u201d","author":"Davtyan","year":"2023","journal-title":"2023 IEEE\/CVF International Conference on Computer Vision (ICCV)"},{"key":"B9","unstructured":"Franceschi\n              J.-Y.\n            \n            \n              Delasalles\n              E.\n            \n            \n              Chen\n              M.\n            \n            \n              Lamprier\n              S.\n            \n            \n              Gallinari\n              P.\n            \n          \n          Stochastic Latent Residual Video Prediction\n          \n          2020"},{"key":"B10","doi-asserted-by":"publisher","first-page":"127","DOI":"10.1038\/nrn2787","article-title":"The free-energy principle: a unified brain theory?","volume":"11","author":"Friston","year":"2010","journal-title":"Nat. Rev. Neurosci."},{"key":"B11","unstructured":"H\u00f6ppe\n              T.\n            \n            \n              Mehrjou\n              A.\n            \n            \n              Bauer\n              S.\n            \n            \n              Nielsen\n              D.\n            \n            \n              Dittadi\n              A.\n            \n          \n          Diffusion Models for Video Prediction and Infilling.\n          \n          2022"},{"key":"B12","doi-asserted-by":"crossref","DOI":"10.1109\/ICCV.2011.6126500","article-title":"\u201cLatent structured models for human pose estimation,\u201d","volume-title":"2011 International Conference on Computer Vision.","author":"Ionescu","year":"2011"},{"key":"B13","article-title":"\u201cAttentive neural processes,\u201d","author":"Kim","year":"2019","journal-title":"International Conference on Learning Representations (ICLR)."},{"key":"B14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00320","article-title":"\u201cVideo Swin Transformer,\u201d","author":"Liu","year":"2022","journal-title":"2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)"},{"key":"B15","article-title":"Deep multi-scale video prediction beyond mean square error","author":"Mathieu","year":"2015","journal-title":"arXiv [Preprint]"},{"key":"B16","unstructured":"Millidge\n              B.\n            \n            \n              Seth\n              A.\n            \n            \n              Buckley\n              C. L.\n            \n          \n          Predictive Coding: a Theoretical and Experimental Review.\n          \n          2022"},{"key":"B17","doi-asserted-by":"publisher","first-page":"69","DOI":"10.1146\/annurev.neuro.31.061307.090723","article-title":"Place cells, grid cells, and the brain's spatial representation system","volume":"31","author":"Moser","year":"2008","journal-title":"Annu. Rev. Neurosci."},{"key":"B18","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2004.1334462","article-title":"\u201cRecognizing human actions: a local SVM approach,\u201d","author":"Schuldt","year":"2004"},{"key":"B19","first-page":"802","article-title":"\u201cConvolutional LSTM Network: a machine learning approach for precipitation nowcasting,\u201d","author":"Shi","year":"2015","journal-title":"Proceedings of the 29th International Conference on Neural Information Processing Systems - Volume 1"},{"key":"B20","unstructured":"Shrivastava\n              G.\n            \n            \n              Shrivastava\n              A.\n            \n          \n          Diverse Video Generation using a Gaussian Process Trigger.\n          \n          2021"},{"key":"B21","volume-title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in the Wild","author":"Soomro","year":"2012"},{"key":"B22","doi-asserted-by":"publisher","DOI":"10.52202\/068431-0732","article-title":"\u201cVideoMAE: masked autoencoders are data-efficient learners for self-supervised video pre-training,\u201d","author":"Tong","year":"2022","journal-title":"Proceedings of the 36th International Conference on Neural Information Processing Systems"},{"key":"B23","unstructured":"Unterthiner\n              T.\n            \n            \n              van Steenkiste\n              S.\n            \n            \n              Kurach\n              K.\n            \n            \n              Marinier\n              R.\n            \n            \n              Michalski\n              M.\n            \n            \n              Gelly\n              S.\n            \n          \n          FVD: A new Metric for Video Generation, in DGS@ICLR\n          \n          2019"},{"key":"B24","doi-asserted-by":"crossref","unstructured":"Voleti\n              V. S.\n            \n            \n              Jolicoeur-Martineau\n              A.\n            \n            \n              Pal\n              C. J.\n            \n          \n          10.52202\/068431-1698\n          MCVD: Masked Conditional Video Diffusion for Prediction, Generation, and Interpolation\n          \n          2022","DOI":"10.52202\/068431-1698"},{"key":"B25","doi-asserted-by":"publisher","author":"Wang","year":"2023","DOI":"10.1109\/CVPR52729.2023.01398"},{"key":"B26","doi-asserted-by":"publisher","first-page":"1249","DOI":"10.1016\/j.cell.2020.10.024","article-title":"The tolman-eichenbaum machine: unifying space and relational memory through generalization in the hippocampal formation","volume":"183","author":"Whittington","year":"2020","journal-title":"Cell"},{"key":"B27","doi-asserted-by":"publisher","author":"Wu","year":"2024","DOI":"10.1109\/CVPR52733.2024.01920"},{"key":"B28","article-title":"Video prediction by efficient transformers","author":"Ye","year":"2022","journal-title":"arXiv [Preprint]"},{"key":"B29","doi-asserted-by":"publisher","first-page":"1597","DOI":"10.1038\/s41467-023-37180-x","article-title":"Catalyzing next-generation artificial intelligence through NeuroAI","volume":"14","author":"Zador","year":"2023","journal-title":"Nat. Commun."}],"container-title":["Frontiers in Computational Neuroscience"],"original-title":[],"link":[{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/fncom.2026.1781080\/full","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,27]],"date-time":"2026-03-27T14:24:11Z","timestamp":1774621451000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/fncom.2026.1781080\/full"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,3,24]]},"references-count":29,"alternative-id":["10.3389\/fncom.2026.1781080"],"URL":"https:\/\/doi.org\/10.3389\/fncom.2026.1781080","relation":{},"ISSN":["1662-5188"],"issn-type":[{"value":"1662-5188","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,3,24]]},"article-number":"1781080"}}