{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:39:13Z","timestamp":1740123553799,"version":"3.37.3"},"reference-count":40,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2022,12,14]],"date-time":"2022-12-14T00:00:00Z","timestamp":1670976000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2022,12,14]],"date-time":"2022-12-14T00:00:00Z","timestamp":1670976000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001691","name":"Japan Society for the Promotion of Science","doi-asserted-by":"publisher","award":["17K20143"],"award-info":[{"award-number":["17K20143"]}],"id":[{"id":"10.13039\/501100001691","id-type":"DOI","asserted-by":"publisher"}]},{"name":"SenseTime Japan"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2023,3]]},"DOI":"10.1007\/s11263-022-01719-0","type":"journal-article","created":{"date-parts":[[2022,12,14]],"date-time":"2022-12-14T05:02:51Z","timestamp":1670994171000},"page":"717-731","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Video Region Annotation with Sparse Bounding Boxes"],"prefix":"10.1007","volume":"131","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-9715-9565","authenticated-orcid":false,"given":"Yuzheng","family":"Xu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8010-6857","authenticated-orcid":false,"given":"Yang","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Nur Sabrina","family":"binti Zuraimi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3204-8696","authenticated-orcid":false,"given":"Shohei","family":"Nobuhara","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3534-3447","authenticated-orcid":false,"given":"Ko","family":"Nishino","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,12,14]]},"reference":[{"key":"1719_CR1","doi-asserted-by":"crossref","unstructured":"Acuna, D., Ling, H., Kar, A., & Fidler, S. (2018). Efficient interactive annotation of segmentation datasets with polygon-rnn++. In: Proceedings CVPR (pp. 859\u2013868).","DOI":"10.1109\/CVPR.2018.00096"},{"key":"1719_CR2","unstructured":"Bengar, J. Z., Gonzalez-Garcia, A., Villalonga, G., Raducanu, B., Aghdam, H. H., Mozerov, M., Lopez, A. M., & van\u00a0de Weijer, J. (2019). Temporal coherence for active learning in videos. In IEEE\/CVF international conference on computer vision workshop (ICCVW) (pp. 914\u2013923)."},{"key":"1719_CR3","doi-asserted-by":"crossref","unstructured":"Bertasius, G., & Torresani, L. (2020). Classifying, segmenting, and tracking object instances in video with mask propagation. In Proceedings CVPR (pp. 9739\u20139748).","DOI":"10.1109\/CVPR42600.2020.00976"},{"key":"1719_CR4","first-page":"88","volume":"131","author":"S Bianco","year":"2015","unstructured":"Bianco, S., Ciocca, G., Napoletano, P., & Schettini, R. (2015). An interactive tool for manual, semi-automatic and automatic video annotation. CVIU, 131, 88\u201399.","journal-title":"CVIU"},{"key":"1719_CR5","doi-asserted-by":"crossref","unstructured":"Castrejon, L., Kundu, K., Urtasun, & R., Fidler, S. (2017). Annotating object instances with a polygon-rnn. In Proceedings CVPR (pp. 5230\u20135238).","DOI":"10.1109\/CVPR.2017.477"},{"key":"1719_CR6","doi-asserted-by":"crossref","unstructured":"Chen, B., Ling, H., Zeng, X., Gao, J., Xu, Z., & Fidler, S. (2020). Scribblebox: interactive annotation framework for video object segmentation. In Proceedings (pp. 293\u2013310). ECCV Springer.","DOI":"10.1007\/978-3-030-58601-0_18"},{"key":"1719_CR7","doi-asserted-by":"crossref","unstructured":"Cho, M., Kwak, S., Schmid, C., Ponce, J. (2015). Unsupervised object discovery and localization in the wild: Part-based matching with bottom-up region proposals. In Proceedigs CVPR (pp. 1201\u20131210).","DOI":"10.1109\/CVPR.2015.7298724"},{"key":"1719_CR8","doi-asserted-by":"crossref","unstructured":"Ding, M., Wang, Z., Zhou, B., Shi, J., Lu, Z., & Luo, P. (2020) Every frame counts: Joint learning of video segmentation and optical flow. In Proceedings AAAI (pp 10713\u201310720).","DOI":"10.1609\/aaai.v34i07.6699"},{"issue":"1","key":"1719_CR9","doi-asserted-by":"publisher","first-page":"98","DOI":"10.1007\/s11263-014-0733-5","volume":"111","author":"M Everingham","year":"2015","unstructured":"Everingham, M., Eslami, S. A., Van Gool, L., Williams, C. K., Winn, J., & Zisserman, A. (2015). The pascal visual object classes challenge: A retrospective. IJCV, 111(1), 98\u2013136.","journal-title":"IJCV"},{"key":"1719_CR10","first-page":"108","volume-title":"Proc","author":"J Gao","year":"2020","unstructured":"Gao, J., Wang, Z., Xuan, J., & Fidler, S. (2020). Beyond fixed grid: Learning geometric image representation with a deformable grid. Proc (pp. 108\u2013125). ECCV: Springer."},{"issue":"2\u20133","key":"1719_CR11","doi-asserted-by":"publisher","first-page":"155","DOI":"10.1007\/s11042-009-0389-2","volume":"46","author":"X Giro-i Nieto","year":"2010","unstructured":"Giro-i Nieto, X., Camps, N., & Marques, F. (2010). Gat: A graphical annotation tool for semantic regions. Multimedia Tools and Applications, 46(2\u20133), 155\u2013174.","journal-title":"Multimedia Tools and Applications"},{"key":"1719_CR12","doi-asserted-by":"crossref","unstructured":"He, K., Gkioxari, G., Doll\u00e1r, P., & Girshick, R. (2017) Mask r-cnn. In Proceedings ICCV (pp. 2961\u20132969).","DOI":"10.1109\/ICCV.2017.322"},{"key":"1719_CR13","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In Proceedings CVPR (pp. 770\u2013778).","DOI":"10.1109\/CVPR.2016.90"},{"key":"1719_CR14","doi-asserted-by":"crossref","unstructured":"Ilg, E., Mayer, N., Saikia, T., Keuper, M., Dosovitskiy, A., & Brox, T. (2017) Flownet 2.0: Evolution of optical flow estimation with deep networks. In Proceedings CVPR (pp. 2462\u20132470).","DOI":"10.1109\/CVPR.2017.179"},{"key":"1719_CR15","doi-asserted-by":"crossref","unstructured":"Jain, SD., Xiong, B., & Grauman, K. (2017). Fusionseg: Learning to combine motion and appearance for fully automatic segmentation of generic objects in videos. In Proceedings CVPR (pp. 2117\u20132126).","DOI":"10.1109\/CVPR.2017.228"},{"key":"1719_CR16","unstructured":"Kingma, D. P., & Ba, J. (2015). Adam: A method for stochastic optimization. In 3rd international conference on learning representations, ICLR 2015 2015, Conference Track Proceedings. arXiv:1412.6980"},{"key":"1719_CR17","doi-asserted-by":"crossref","unstructured":"Lee, H. Y., Huang, J. B., Singh, M., & Yang, M. H. (2017). Unsupervised representation learning by sorting sequences. In Proceeding ICCV (pp. 667\u2013676).","DOI":"10.1109\/ICCV.2017.79"},{"key":"1719_CR18","doi-asserted-by":"crossref","unstructured":"Liang, J., Homayounfar, N., Ma, W. C., Xiong, Y., Hu, R., & Urtasun, R. (2020). Polytransform: Deep polygon transformer for instance segmentation. In Proceedings CVPR (pp. 9131\u20139140).","DOI":"10.1109\/CVPR42600.2020.00915"},{"key":"1719_CR19","doi-asserted-by":"crossref","unstructured":"Lin, T. Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C. L. (2014). Microsoft coco: Common objects in context. In Proceedings ECCV (pp. 740\u2013755).","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"1719_CR20","doi-asserted-by":"crossref","unstructured":"Ling, H., Gao, J., Kar, A., Chen, W., & Fidler, S. (2019). Fast interactive object annotation with curve-gcn. In Proceedings CVPR, (pp. 5257\u20135266).","DOI":"10.1109\/CVPR.2019.00540"},{"key":"1719_CR21","doi-asserted-by":"publisher","unstructured":"Lipton, A., Fujiyoshi, H., & Patil, R. (1998). Moving target classification and tracking from real-time video. In Proceedings fourth IEEE workshop on applications of computer vision. WACV\u201998 (Cat. No.98EX201) (pp. 8\u201314), https:\/\/doi.org\/10.1109\/ACV.1998.732851.","DOI":"10.1109\/ACV.1998.732851"},{"key":"1719_CR22","doi-asserted-by":"publisher","first-page":"140680","DOI":"10.1109\/ACCESS.2019.2943365","volume":"7","author":"J Li","year":"2019","unstructured":"Li, J., Zhao, Y., Fu, J., Wu, J., & Liu, J. (2019). Attention-guided network for semantic video segmentation. IEEE Access, 7, 140680\u2013140689.","journal-title":"IEEE Access"},{"key":"1719_CR23","doi-asserted-by":"crossref","unstructured":"Meinhardt, T., Kirillov, A., Leal-Taixe, L., Feichtenhofer, C. (2021). Trackformer: Multi-object tracking with transformers. In Proc CVPR.","DOI":"10.1109\/CVPR52688.2022.00864"},{"key":"1719_CR24","unstructured":"Nabavi, S. S., Rochan, M., & Wang, Y. (2018). Future semantic segmentation with convolutional LSTM. In Procceedings BMVC (p 137)."},{"key":"1719_CR25","unstructured":"Paszke, A., Gross, S., Massa, F., Lerer, A., Bradbury, J., Chanan, G., Killeen, T., Lin, Z., Gimelshein, N., Antiga, L., Desmaison, A., Kopf, A., Yang, E., DeVito, Z., Raison, M., Tejani, A., Chilamkurthy, S., Steiner, B., Fang, L., Bai, J., & Chintala, S. (2019). Pytorch: An imperative style, high-performance deep learning library. In H. Wallach, H. Larochelle, A. Beygelzimer, F. d\u2019Alch\u00e9-Buc, E. Fox, R. Garnett (Eds.) Advances in neural information processing systems 32 (Curran Associates, Inc., pp. 8024\u20138035). http:\/\/papers.neurips.cc\/paper\/9015-pytorch-an-imperative-style-high-performance-deep-learning-library.pdf."},{"key":"1719_CR26","doi-asserted-by":"crossref","unstructured":"Paul, M., Mayer, C., Gool, L. V., Timofte, R. (2020). Efficient video semantic segmentation with labels propagation and refinement. In Proceedings WACV (pp. 2873\u20132882).","DOI":"10.1109\/WACV45572.2020.9093520"},{"key":"1719_CR27","doi-asserted-by":"crossref","unstructured":"Peng, S., Jiang, W., Pi, H., Li, X., Bao, H., & Zhou, X. (2020). Deep snake for real-time instance segmentation. In Proceedings CVPR (pp. 8533\u20138542).","DOI":"10.1109\/CVPR42600.2020.00856"},{"key":"1719_CR28","doi-asserted-by":"crossref","unstructured":"Porzi, L., Hofinger, M., Ruiz, I., Serrat, J., Bulo, S. R., & Kontschieder, P. (2020). Learning multi-object tracking and segmentation from automatic annotations. In Proceeding CVPR (pp. 6846\u20136855).","DOI":"10.1109\/CVPR42600.2020.00688"},{"issue":"3","key":"1719_CR29","doi-asserted-by":"publisher","first-page":"309","DOI":"10.1145\/1015706.1015720","volume":"23","author":"C Rother","year":"2004","unstructured":"Rother, C., Kolmogorov, V., & Blake, A. (2004). \u201cgrabcut\u2019\u2019 interactive foreground extraction using iterated graph cuts. ACM Transactions on Graphics (TOG), 23(3), 309\u2013314.","journal-title":"ACM Transactions on Graphics (TOG)"},{"key":"1719_CR30","doi-asserted-by":"crossref","unstructured":"Voigtlaender, P., Krause, M., Osep, A., Luiten, J., Sekar, B. B. G., Geiger, A., & Leibe, B. (2019a) Mots: Multi-object tracking and segmentation. In Proceeding CVPR (pp. 7942\u20137951).","DOI":"10.1109\/CVPR.2019.00813"},{"key":"1719_CR31","doi-asserted-by":"crossref","unstructured":"Voigtlaender, P., Krause, M., Osep, A., Luiten, J., Sekar, B. B. G., Geiger, A., Leibe, B. (2019b) Mots: Multi-object tracking and segmentation. In Proceeding CVPR (pp. 7942\u20137951).","DOI":"10.1109\/CVPR.2019.00813"},{"issue":"1","key":"1719_CR32","doi-asserted-by":"publisher","first-page":"184","DOI":"10.1007\/s11263-012-0564-1","volume":"101","author":"C Vondrick","year":"2013","unstructured":"Vondrick, C., Patterson, D., & Ramanan, D. (2013). Efficiently scaling up crowdsourced video annotation. IJCV, 101(1), 184\u2013204.","journal-title":"IJCV"},{"key":"1719_CR33","doi-asserted-by":"crossref","unstructured":"Wang, X., & Gupta, A. (2015). Unsupervised learning of visual representations using videos. In Proceeding ICCV (pp. 2794\u20132802).","DOI":"10.1109\/ICCV.2015.320"},{"key":"1719_CR34","doi-asserted-by":"crossref","unstructured":"Wang, Y., Xu, Z., Wang, X., Shen, C., Cheng, B., Shen, H., Xia, H. (2021). End-to-end video instance segmentation with transformers. In Proceedings CVPR (pp. 8741\u20138750).","DOI":"10.1109\/CVPR46437.2021.00863"},{"key":"1719_CR35","doi-asserted-by":"crossref","unstructured":"Wang, T., Han, B., & Collomosse, J. (2014). Touchcut: Fast image and video segmentation using single-touch interaction. CVIU, 120, 14\u201330.","DOI":"10.1016\/j.cviu.2013.10.013"},{"key":"1719_CR36","unstructured":"Xu, Y., Wu, Y., binti Zuraimi, N. S., Nobuhara, S., Nishino, K. (2020). Video region annotation with sparse bounding boxes. In 31st British Machine Vision Conference 2020, BMVC 2020, Virtual Event 2020, BMVA Press."},{"key":"1719_CR37","doi-asserted-by":"crossref","unstructured":"Yang, L., Fan, Y., & Xu, N. (2019a). Video instance segmentation. In Proceeeding ICCV (pp. 5188\u20135197).","DOI":"10.1109\/ICCV.2019.00529"},{"key":"1719_CR38","doi-asserted-by":"crossref","unstructured":"Yang, L., Fan, Y., & Xu, N. (2019b). Video instance segmentation. In Proceeding ICCV (pp. 5188\u20135197).","DOI":"10.1109\/ICCV.2019.00529"},{"key":"1719_CR39","doi-asserted-by":"crossref","unstructured":"Yu, F., Chen, H., Wang, X., Xian, W., Chen, Y., Liu, F., Madhavan, V., Darrell. T. (2020). Bdd100k: A diverse driving dataset for heterogeneous multitask learning. In Proceeding CVPR (pp. 2636\u20132645).","DOI":"10.1109\/CVPR42600.2020.00271"},{"issue":"3","key":"1719_CR40","doi-asserted-by":"publisher","first-page":"302","DOI":"10.1007\/s11263-018-1140-0","volume":"127","author":"B Zhou","year":"2019","unstructured":"Zhou, B., Zhao, H., Puig, X., Xiao, T., Fidler, S., Barriuso, A., & Torralba, A. (2019). Semantic understanding of scenes through the ade20k dataset. IJCV, 127(3), 302\u2013321.","journal-title":"IJCV"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-022-01719-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-022-01719-0\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-022-01719-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,2,17]],"date-time":"2023-02-17T07:00:52Z","timestamp":1676617252000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-022-01719-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,12,14]]},"references-count":40,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2023,3]]}},"alternative-id":["1719"],"URL":"https:\/\/doi.org\/10.1007\/s11263-022-01719-0","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"type":"print","value":"0920-5691"},{"type":"electronic","value":"1573-1405"}],"subject":[],"published":{"date-parts":[[2022,12,14]]},"assertion":[{"value":"3 September 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 November 2022","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 December 2022","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}