{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,8,20]],"date-time":"2024-08-20T06:36:03Z","timestamp":1724135763189},"reference-count":62,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2020,10,22]],"date-time":"2020-10-22T00:00:00Z","timestamp":1603324800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,10,22]],"date-time":"2020-10-22T00:00:00Z","timestamp":1603324800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2021,3]]},"DOI":"10.1007\/s11263-020-01389-w","type":"journal-article","created":{"date-parts":[[2020,10,22]],"date-time":"2020-10-22T08:02:41Z","timestamp":1603353761000},"page":"601-618","update-policy":"http:\/\/dx.doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["Progressive Multi-granularity Analysis for Video Prediction"],"prefix":"10.1007","volume":"129","author":[{"given":"Jingwei","family":"Xu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bingbing","family":"Ni","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaokang","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,10,22]]},"reference":[{"key":"1389_CR1","unstructured":"Babaeizadeh, M., Finn, C., Erhan, D., Campbell, R.\u00a0H., & Levine, S. (2017). Stochastic variational video prediction."},{"key":"1389_CR2","unstructured":"Bradski, G. (2000). The OpenCV Library. Dr. Dobb\u2019s Journal of Software Tools."},{"key":"1389_CR3","doi-asserted-by":"crossref","unstructured":"Carreira, J., & Zisserman, A. (2017). Quo vadis, action recognition? A new model and the kinetics dataset. In CVPR (pp. 4724\u20134733).","DOI":"10.1109\/CVPR.2017.502"},{"key":"1389_CR4","doi-asserted-by":"crossref","unstructured":"Cho, K., van Merrienboer, B., G\u00fcl\u00e7ehre, \u00c7., Bahdanau, D., Bougares, F., Schwenk, H., & Bengio, Y. (2014). Learning phrase representations using RNN encoder-decoder for statistical machine translation. In EMNLP.","DOI":"10.3115\/v1\/D14-1179"},{"key":"1389_CR5","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.-J., Li, K., & Fei-Fei, L. (2009). ImageNet: A large-scale hierarchical image database. In CVPR.","DOI":"10.1109\/CVPR.2009.5206848"},{"issue":"4","key":"1389_CR6","doi-asserted-by":"publisher","first-page":"666","DOI":"10.1109\/TPAMI.2015.2439285","volume":"38","author":"J Deng","year":"2016","unstructured":"Deng, J., Krause, J., Stark, M., & Li, F. (2016). Leveraging the wisdom of the crowd for fine-grained recognition. TPAMI, 38(4), 666\u2013676.","journal-title":"TPAMI"},{"key":"1389_CR7","unstructured":"Denton, E., & Fergus, R. (2018). Stochastic video generation with a learned prior. In ICML."},{"key":"1389_CR8","unstructured":"Denton, E.\u00a0L., & Birodkar, V. (2017). Unsupervised learning of disentangled representations from video. In NeurIPS."},{"key":"1389_CR9","unstructured":"Finn, C., Goodfellow, I.\u00a0J., & Levine, S. (2016). Unsupervised learning for physical interaction through video prediction. In NeurIPS."},{"issue":"2","key":"1389_CR10","doi-asserted-by":"publisher","first-page":"191","DOI":"10.1007\/s11263-014-0741-5","volume":"111","author":"E Gavves","year":"2015","unstructured":"Gavves, E., Fernando, B., Snoek, C. G. M., Smeulders, A. W. M., & Tuytelaars, T. (2015). Local alignments for fine-grained categorization. IJCV., 111(2), 191\u2013212.","journal-title":"IJCV."},{"key":"1389_CR11","unstructured":"Goodfellow, I.\u00a0J., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A.\u00a0C., & Bengio, Y. (2014). Generative adversarial nets. In NeurIPS."},{"issue":"4","key":"1389_CR12","doi-asserted-by":"publisher","first-page":"627","DOI":"10.1109\/TPAMI.2016.2578328","volume":"39","author":"B Hariharan","year":"2017","unstructured":"Hariharan, B., Arbelaez, P., Girshick, R. B., & Malik, J. (2017). Object instance segmentation and fine-grained localization using hypercolumns. TPAMI, 39(4), 627\u2013639.","journal-title":"TPAMI"},{"issue":"8","key":"1389_CR13","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735\u20131780.","journal-title":"Neural Computation"},{"key":"1389_CR14","unstructured":"Hsieh, J., Liu, B., Huang, D., Li, F., & Niebles, J.\u00a0C. (2018). Learning to decompose and disentangle representations for video prediction. In NeurIPS."},{"key":"1389_CR15","doi-asserted-by":"crossref","unstructured":"Huang, Z., Xu, J., & Ni, B. (2018). Human motion generation via cross-space constrained sampling. In IJCAI (pp. 757\u2013763).","DOI":"10.24963\/ijcai.2018\/105"},{"key":"1389_CR16","doi-asserted-by":"crossref","unstructured":"Ilg, E., Mayer, N., Saikia, T., Keuper, M., Dosovitskiy, A., & Brox, T. (2017). Flownet 2.0: Evolution of optical flow estimation with deep networks. In CVPR (pp. 1647\u20131655).","DOI":"10.1109\/CVPR.2017.179"},{"key":"1389_CR17","unstructured":"Ioffe, S., & Szegedy, C. (2015). Batch normalization: Accelerating deep network training by reducing internal covariate shift. In ICML."},{"issue":"7","key":"1389_CR18","doi-asserted-by":"publisher","first-page":"1325","DOI":"10.1109\/TPAMI.2013.248","volume":"36","author":"C Ionescu","year":"2014","unstructured":"Ionescu, C., Papava, D., Olaru, V., & Sminchisescu, C. (2014). Human3.6m: Large scale datasets and predictive methods for 3D human sensing in natural environments. TPAMI, 36(7), 1325\u20131339.","journal-title":"TPAMI"},{"key":"1389_CR19","doi-asserted-by":"crossref","unstructured":"Isola, P., Zhu, J., Zhou, T., & Efros, A.\u00a0A. (2017). Image-to-image translation with conditional adversarial networks. In CVPR.","DOI":"10.1109\/CVPR.2017.632"},{"key":"1389_CR20","unstructured":"Jang, Y., Kim, G., & Song, Y. (2018). Video prediction with appearance and motion conditions. In ICML."},{"key":"1389_CR21","unstructured":"Jia, X., Brabandere, B.\u00a0D., Tuytelaars, T., & Gool, L.\u00a0V. (2016). Dynamic filter networks. In NeurIPS."},{"issue":"7","key":"1389_CR22","doi-asserted-by":"publisher","first-page":"881","DOI":"10.1109\/TPAMI.2002.1017616","volume":"24","author":"T Kanungo","year":"2002","unstructured":"Kanungo, T., Mount, D. M., Netanyahu, N. S., Piatko, C. D., Silverman, R., & Wu, A. Y. (2002). An efficient k-means clustering algorithm: Analysis and implementation. TPAMI, 24(7), 881\u2013892.","journal-title":"TPAMI"},{"key":"1389_CR23","unstructured":"Kingma, D.\u00a0P., & Ba, J. (2015). Adam: A method for stochastic optimization. In ICLR."},{"key":"1389_CR24","unstructured":"Kurutach, T., Tamar, A., Yang, G., Russell, S.\u00a0J., & Abbeel, P. (2018). Learning plannable representations with causal infogan. In NeurIPS."},{"key":"1389_CR25","unstructured":"Lee, A.\u00a0X., Zhang, R., Ebert, F., Abbeel, P., Finn, C., & Levine, S. (2018). Stochastic adversarial video prediction. CoRR."},{"key":"1389_CR26","unstructured":"Lee, S., Purushwalkam, S., Cogswell, M., Ranjan, V., Crandall, D.\u00a0J., & Batra, D. (2016). Stochastic multiple choice learning for training diverse deep ensembles. In NeurIPS."},{"issue":"2","key":"1389_CR27","doi-asserted-by":"publisher","first-page":"128","DOI":"10.1007\/s11263-014-0785-6","volume":"113","author":"H Li","year":"2015","unstructured":"Li, H., Huang, D., Morvan, J., Wang, Y., & Chen, L. (2015). Towards 3D face recognition in the real: A registration-free approach using fine-grained matching of 3D keypoint descriptors. IJCV, 113(2), 128\u2013142.","journal-title":"IJCV"},{"key":"1389_CR28","doi-asserted-by":"crossref","unstructured":"Li, Y., Fang, C., Yang, J., Wang, Z., Lu, X., & Yang, M. (2018). Flow-grounded spatial-temporal video prediction from still images. In ECCV.","DOI":"10.1007\/978-3-030-01240-3_37"},{"key":"1389_CR29","doi-asserted-by":"crossref","unstructured":"Liang, X., Lee, L., Dai, W., & Xing, E.\u00a0P. (2017). Dual motion GAN for future-flow embedded video prediction. In ICCV.","DOI":"10.1109\/ICCV.2017.194"},{"issue":"6","key":"1389_CR30","doi-asserted-by":"publisher","first-page":"1309","DOI":"10.1109\/TPAMI.2017.2723400","volume":"40","author":"T Lin","year":"2018","unstructured":"Lin, T., Roy Chowdhury, A., & Maji, S. (2018). Bilinear convolutional neural networks for fine-grained visual recognition. TPAMI, 40(6), 1309\u20131322.","journal-title":"TPAMI"},{"key":"1389_CR31","doi-asserted-by":"crossref","unstructured":"Luc, P., Neverova, N., Couprie, C., Verbeek, J., & LeCun, Y. (2017). Predicting deeper into the future of semantic segmentation. In ICCV.","DOI":"10.1109\/ICCV.2017.77"},{"issue":"11","key":"1389_CR32","first-page":"2579","volume":"9","author":"LVD Maaten","year":"2008","unstructured":"Maaten, L. V. D., & Hinton, G. (2008). Visualizing data using t-sne. JMLR, 9(11), 2579\u20132605.","journal-title":"JMLR"},{"key":"1389_CR33","unstructured":"Nair, A., Pong, V., Dalal, M., Bahl, S., Lin, S., & Levine, S. (2018). Visual reinforcement learning with imagined goals. In NeurIPS."},{"issue":"1","key":"1389_CR34","doi-asserted-by":"publisher","first-page":"28","DOI":"10.1007\/s11263-016-0891-8","volume":"120","author":"B Ni","year":"2016","unstructured":"Ni, B., Paramathayalan, V. R., Li, T., & Moulin, P. (2016). Multiple granularity modeling: A coarse-to-fine framework for fine-grained action analysis. IJCV, 120(1), 28\u201343.","journal-title":"IJCV"},{"key":"1389_CR35","doi-asserted-by":"crossref","unstructured":"Pathak, D., Agrawal, P., Efros, A.\u00a0A., & Darrell, T. (2017). Curiosity-driven exploration by self-supervised prediction. In ICML.","DOI":"10.1109\/CVPRW.2017.70"},{"key":"1389_CR36","doi-asserted-by":"crossref","unstructured":"Rohrbach, M., Rohrbach, A., Regneri, M., Amin, S., Andriluka, M., Pinkal, M., & Schiele, B. (xxxx) Recognizing fine-grained and composite activities using hand-centric features and script data. IJCV, 119 (3):346\u2013373 (16).","DOI":"10.1007\/s11263-015-0851-8"},{"key":"1389_CR37","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P., & Brox, T. (2015). U-net: Convolutional networks for biomedical image segmentation. In MICCAI.","DOI":"10.1007\/978-3-319-24574-4_28"},{"issue":"11","key":"1389_CR38","doi-asserted-by":"publisher","first-page":"1199","DOI":"10.1007\/s11263-018-1089-z","volume":"126","author":"M Ruder","year":"2018","unstructured":"Ruder, M., Dosovitskiy, A., & Brox, T. (2018). Artistic style transfer for videos and spherical images. IJCV, 126(11), 1199\u20131219.","journal-title":"IJCV"},{"issue":"3","key":"1389_CR39","doi-asserted-by":"publisher","first-page":"307","DOI":"10.1007\/s11263-015-0847-4","volume":"119","author":"MS Ryoo","year":"2016","unstructured":"Ryoo, M. S., & Matthies, L. H. (2016). First-person activity recognition: Feature, temporal structure, and prediction. IJCV, 119(3), 307\u2013328.","journal-title":"IJCV"},{"key":"1389_CR40","unstructured":"Salimans, T., Goodfellow, I.\u00a0J., Zaremba, W., Cheung, V., Radford, A., & Chen, X. (2016). Improved techniques for training gans. In NeurIPS."},{"key":"1389_CR41","doi-asserted-by":"crossref","unstructured":"Sch\u00fcldt, C., Laptev, I., & Caputo, B. (2004). Recognizing human actions: A local SVM approach. In ICPR.","DOI":"10.1109\/ICPR.2004.1334462"},{"key":"1389_CR42","doi-asserted-by":"crossref","unstructured":"Shen, F., Yan, S., & Zeng, G. (2018). Neural style transfer via meta networks. In CVPR (pp. 8061\u20138069).","DOI":"10.1109\/CVPR.2018.00841"},{"key":"1389_CR43","unstructured":"Shi, X., Chen, Z., Wang, H., Yeung, D., Wong, W., & Woo, W. (2015). Convolutional LSTM network: A machine learning approach for precipitation nowcasting. In NeurIPS."},{"key":"1389_CR44","unstructured":"Simonyan, K., & Zisserman, A. (2015). Very deep convolutional networks for large-scale image recognition. In ICLR."},{"key":"1389_CR45","unstructured":"Srivastava, N., Mansimov, E., & Salakhutdinov, R. (2015). Unsupervised learning of video representations using lstms. In ICML."},{"issue":"2","key":"1389_CR46","doi-asserted-by":"publisher","first-page":"153","DOI":"10.1007\/s11263-014-0737-1","volume":"111","author":"Y Tian","year":"2015","unstructured":"Tian, Y., Li, J., Yu, S., & Huang, T. (2015). Learning complementary saliency priors for foreground object segmentation in complex scenes. IJCV, 111(2), 153\u2013170.","journal-title":"IJCV"},{"key":"1389_CR47","doi-asserted-by":"crossref","unstructured":"Tulyakov, S., Liu, M., Yang, X., & Kautz, J. (2018). Mocogan: Decomposing motion and content for video generation. In CVPR.","DOI":"10.1109\/CVPR.2018.00165"},{"key":"1389_CR48","unstructured":"Villegas, R., Yang, J., Hong, S., Lin, X., & Lee, H. (2017a). Decomposing motion and content for natural video sequence prediction."},{"key":"1389_CR49","unstructured":"Villegas, R., Yang, J., Zou, Y., Sohn, S., Lin, X., & Lee, H. (2017b). Learning to generate long-term future via hierarchical prediction. In ICML."},{"key":"1389_CR50","unstructured":"Wichers, N., Villegas, R., Erhan, D., & Lee, H. (2018). Hierarchical long-term video prediction without supervision. In ICML."},{"issue":"7","key":"1389_CR51","doi-asserted-by":"publisher","first-page":"689","DOI":"10.1007\/s11263-018-1063-9","volume":"126","author":"X Wu","year":"2018","unstructured":"Wu, X., Hiramatsu, K., & Kashino, K. (2018). Label propagation with ensemble of pairwise geometric relations: Towards robust large-scale retrieval of object instances. IJCV, 126(7), 689\u2013713.","journal-title":"IJCV"},{"issue":"4","key":"1389_CR52","doi-asserted-by":"publisher","first-page":"1191","DOI":"10.1145\/2766999","volume":"34","author":"S Xia","year":"2015","unstructured":"Xia, S., Wang, C., Chai, J., & Hodgins, J. K. (2015). Realtime style transfer for unlabeled heterogeneous human motion. ACM Transactions on Graphics, 34(4), 1191\u201311910.","journal-title":"ACM Transactions on Graphics"},{"key":"1389_CR53","unstructured":"Xu, B., Wang, N., Chen, T., & Li, M. (2015). Empirical evaluation of rectified activations in convolutional network. CoRR."},{"key":"1389_CR54","doi-asserted-by":"crossref","unstructured":"Xu, J., Ni, B., Li, Z., Cheng, S., & Yang, X. (2018a). Structure preserving video prediction. In CVPR (pp. 1460\u20131469).","DOI":"10.1109\/CVPR.2018.00158"},{"key":"1389_CR55","unstructured":"Xu, J., Ni, B., & Yang, X. (2018b). Video prediction via selective sampling. In NeurIPS."},{"key":"1389_CR56","unstructured":"Xu, J., Xu, H., Ni, B., Yang, X., & Darrell, T. (2020a). Video prediction via example guidance. CoRR, arXiv:2007.01738."},{"key":"1389_CR57","doi-asserted-by":"crossref","unstructured":"Xu, J., Xu, H., Ni, B., Yang, X., Wang, X., & Darrell, T. (2020). Hierarchical style-based networks for motion synthesis. CoRR, arXiv:2008.10162.","DOI":"10.1007\/978-3-030-58621-8_11"},{"key":"1389_CR58","doi-asserted-by":"crossref","unstructured":"Xu, Z., Tao, D., Huang, S., & Zhang, Y. (xxxx). Friend or foe: Fine-grained categorization with weak supervision. TIP, 26 (1):135\u2013146.","DOI":"10.1109\/TIP.2016.2621661"},{"key":"1389_CR59","unstructured":"Xue, T., Wu, J., Bouman, K.\u00a0L., & Freeman, B. (2016). Visual dynamics: Probabilistic future frame synthesis via cross convolutional networks. In NeurIPS."},{"key":"1389_CR60","doi-asserted-by":"crossref","unstructured":"Yan, Y., Xu, J., Ni, B., Zhang, W., & Yang, X. (2017). Skeleton-aided articulated motion generation. In ACM MM (pp. 199\u2013207).","DOI":"10.1145\/3123266.3123277"},{"key":"1389_CR61","doi-asserted-by":"crossref","unstructured":"Yang, R., Ni, B., Ma, C., Xu, Y., & Yang, X. (2017). Video segmentation via multiple granularity analysis. In CVPR.","DOI":"10.1109\/CVPR.2017.676"},{"key":"1389_CR62","first-page":"119","volume":"14","author":"B Zhao","year":"2017","unstructured":"Zhao, B., Feng, J., Wu, X., & Yan, S. (2017). A survey on deep learning-based fine-grained object classification and semantic segmentation. IJAC, 14, 119\u2013135.","journal-title":"IJAC"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-020-01389-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-020-01389-w\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-020-01389-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,10,21]],"date-time":"2021-10-21T23:17:50Z","timestamp":1634858270000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-020-01389-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,22]]},"references-count":62,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2021,3]]}},"alternative-id":["1389"],"URL":"https:\/\/doi.org\/10.1007\/s11263-020-01389-w","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,10,22]]},"assertion":[{"value":"6 June 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"26 September 2020","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 October 2020","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}