{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,30]],"date-time":"2024-10-30T00:13:03Z","timestamp":1730247183519,"version":"3.28.0"},"reference-count":35,"publisher":"IEEE","license":[{"start":{"date-parts":[[2021,9,19]],"date-time":"2021-09-19T00:00:00Z","timestamp":1632009600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,9,19]],"date-time":"2021-09-19T00:00:00Z","timestamp":1632009600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,9,19]]},"DOI":"10.1109\/icip42928.2021.9506062","type":"proceedings-article","created":{"date-parts":[[2021,8,23]],"date-time":"2021-08-23T21:08:41Z","timestamp":1629752921000},"page":"1509-1513","source":"Crossref","is-referenced-by-count":2,"title":["Self-Supervision By Prediction For Object Discovery In Videos"],"prefix":"10.1109","author":[{"given":"Beril","family":"Besbinar","sequence":"first","affiliation":[{"name":"Signal Processing Laboratory (LTS4) &#x00C9;cole Polytechnique F&#x00E9;d&#x00E9;rale de Lausanne (EPFL)"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pascal","family":"Frossard","sequence":"additional","affiliation":[{"name":"Signal Processing Laboratory (LTS4) &#x00C9;cole Polytechnique F&#x00E9;d&#x00E9;rale de Lausanne (EPFL)"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref33","first-page":"1439","article-title":"Entity abstraction in visual model-based reinforcement learning","author":"veerapaneni","year":"2020","journal-title":"Conference on Robot Learning"},{"key":"ref32","article-title":"Learning latent permutations with gumbel-sinkhorn networks","author":"mena","year":"2018","journal-title":"arXiv preprint arXiv 1802 08908"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref30","first-page":"802","article-title":"Convolutional lstm network: A machine learning approach for precipitation nowcasting","author":"xingjian","year":"2015","journal-title":"Advances in neural information processing systems"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00096"},{"key":"ref34","article-title":"Adam: A method for stochastic optimization","author":"kingma","year":"2014","journal-title":"arXiv preprint arXiv 1412 6980"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.478"},{"key":"ref11","article-title":"Decomposing motion and content for natural video sequence prediction","author":"villegas","year":"2017","journal-title":"arXiv preprint arXiv 1706 08033"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.319"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.194"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.230"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00158"},{"key":"ref16","first-page":"517","article-title":"Learning to decompose and disentangle representations for video prediction","author":"hsieh","year":"2018","journal-title":"Advances in neural information processing systems"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00165"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00910"},{"key":"ref19","first-page":"81","article-title":"High fidelity video prediction with large stochastic recurrent neural networks","author":"villegas","year":"2019","journal-title":"Advances in neural information processing systems"},{"key":"ref4","article-title":"Video (language) modeling: a baseline for generative models of natural videos","author":"ranzato","year":"2014","journal-title":"arXiv preprint arXiv 1412 6604"},{"key":"ref28","article-title":"Multi-object representation learning with iterative variational inference","author":"greff","year":"2019","journal-title":"arXiv preprint arXiv 1903 00066"},{"key":"ref3","article-title":"Perceiving objects and scenes: the gestalt approach to object perception","author":"bruce goldstein","year":"2009","journal-title":"Sensation and Perception"},{"key":"ref27","article-title":"Relational neural expectation maximization: Unsupervised discovery of objects and their interactions","author":"steenkiste","year":"2018","journal-title":"arXiv preprint arXiv 1802 10363"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46478-7_51"},{"key":"ref5","article-title":"Deep multiscale video prediction beyond mean square error","author":"mathieu","year":"2015","journal-title":"arXiv preprint arXiv 1511 05271"},{"key":"ref29","article-title":"Object-centric learning with slot attention","author":"locatello","year":"2020","journal-title":"arXiv preprint arXiv 2006 15055"},{"key":"ref8","first-page":"64","article-title":"Unsupervised learning for physical interaction through video prediction","author":"finn","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref7","article-title":"Deep predictive coding networks for video prediction and unsupervised learning","author":"lotter","year":"2016","journal-title":"arXiv preprint arXiv 1605 08104"},{"journal-title":"The scientist in the crib Minds brains and how children learn","year":"1999","author":"gopnik","key":"ref2"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1111\/j.0963-7214.2004.00281.x"},{"key":"ref9","first-page":"1771","article-title":"Video pixel networks","author":"kalchbrenner","year":"2017","journal-title":"International Conference on Machine Learning"},{"key":"ref20","article-title":"Scaling autoregressive video models","author":"weissenborn","year":"2019","journal-title":"arXiv preprint arXiv 1906 02916"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.01045"},{"key":"ref21","article-title":"Videoflow: A flow based generative model for video","volume":"2","author":"kumar","year":"2019","journal-title":"arXiv preprint arXiv 1903 01350"},{"key":"ref24","article-title":"Unsupervised video decomposition using spatio-temporal iterative inference","author":"zablotskaia","year":"2020","journal-title":"arXiv preprint arXiv 2006 14727"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00558"},{"key":"ref26","first-page":"6691","article-title":"Neural expectation maximization","author":"greff","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref25","first-page":"2017","article-title":"Spatial transformer networks","author":"jaderberg","year":"2015","journal-title":"Advances in neural information processing systems"}],"event":{"name":"2021 IEEE International Conference on Image Processing (ICIP)","start":{"date-parts":[[2021,9,19]]},"location":"Anchorage, AK, USA","end":{"date-parts":[[2021,9,22]]}},"container-title":["2021 IEEE International Conference on Image Processing (ICIP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9506008\/9506009\/09506062.pdf?arnumber=9506062","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,6]],"date-time":"2022-12-06T23:48:08Z","timestamp":1670370488000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9506062\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,9,19]]},"references-count":35,"URL":"https:\/\/doi.org\/10.1109\/icip42928.2021.9506062","relation":{},"subject":[],"published":{"date-parts":[[2021,9,19]]}}}