{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,21]],"date-time":"2026-01-21T05:52:20Z","timestamp":1768974740598,"version":"3.49.0"},"reference-count":59,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2020,2,3]],"date-time":"2020-02-03T00:00:00Z","timestamp":1580688000000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,2,3]],"date-time":"2020-02-03T00:00:00Z","timestamp":1580688000000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"name":"Ministry of Science and Technology","award":["107-2628-E-001-005-MY3"],"award-info":[{"award-number":["107-2628-E-001-005-MY3"]}]},{"name":"Ministry of Science and Technology","award":["108-2634-F-007-009"],"award-info":[{"award-number":["108-2634-F-007-009"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2020,4]]},"DOI":"10.1007\/s11263-019-01224-x","type":"journal-article","created":{"date-parts":[[2020,2,3]],"date-time":"2020-02-03T13:03:26Z","timestamp":1580735006000},"page":"931-949","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":10,"title":["VOSTR: Video Object Segmentation via Transferable Representations"],"prefix":"10.1007","volume":"128","author":[{"given":"Yi-Wen","family":"Chen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yi-Hsuan","family":"Tsai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7183-6070","authenticated-orcid":false,"given":"Yen-Yu","family":"Lin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ming-Hsuan","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,2,3]]},"reference":[{"key":"1224_CR1","doi-asserted-by":"crossref","unstructured":"Caelles, S., Maninis, K. K., Pont-Tuset, J., Leal-Taix\u00e9, L., Cremers, D., & Gool, L. V. (2017). One-shot video object segmentation. In CVPR.","DOI":"10.1109\/CVPR.2017.565"},{"key":"1224_CR2","unstructured":"Chen, L. C., Papandreou, G., Kokkinos, I., Murphy, K., & Yuille, A. L. (2016). Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs. arXiv:1606.00915."},{"key":"1224_CR3","doi-asserted-by":"crossref","unstructured":"Chen, Y., Pont-Tuset, J., Montes, A., & Gool, L. V. (2018a). Blazingly fast video object segmentation with pixel-wise metric learning. In CVPR.","DOI":"10.1109\/CVPR.2018.00130"},{"key":"1224_CR4","unstructured":"Chen, Y. W., Tsai, Y. H., Yang, C. Y., Lin, Y. Y., & Yang, M. H. (2018b). Unseen object segmentation in videos via transferable representations. In ACCV."},{"key":"1224_CR5","doi-asserted-by":"crossref","unstructured":"Cheng, J., Tsai, Y. H., Wang, S., & Yang, M. H. (2017). Segflow: Joint learning for video object segmentation and optical flow. In ICCV.","DOI":"10.1109\/ICCV.2017.81"},{"key":"1224_CR6","doi-asserted-by":"crossref","unstructured":"Cheng, J., Tsai, Y. H., Hung, W. C., Wang, S., & Yang, M. H. (2018). Fast and accurate online video object segmentation via tracking parts. In CVPR.","DOI":"10.1109\/CVPR.2018.00774"},{"issue":"2","key":"1224_CR7","doi-asserted-by":"publisher","first-page":"303","DOI":"10.1007\/s11263-009-0275-4","volume":"88","author":"M Everingham","year":"2010","unstructured":"Everingham, M., Gool, L. J. V., Williams, C. K. I., Winn, J. M., & Zisserman, A. (2010). The pascal visual object classes (VOC) challenge. IJCV, 88(2), 303\u2013338.","journal-title":"IJCV"},{"key":"1224_CR8","doi-asserted-by":"crossref","unstructured":"Faktor, A., & Irani, M. (2014). Video segmentation by non-local consensus voting. In BMVC.","DOI":"10.5244\/C.28.21"},{"key":"1224_CR9","unstructured":"Ganin, Y., & Lempitsky, V. (2015). Unsupervised domain adaptation by backpropagation. In ICML."},{"key":"1224_CR10","doi-asserted-by":"crossref","unstructured":"Gopalan, R., Li, R., & Chellappa, R. (2011). Domain adaptation for object recognition: An unsupervised approach. In ICCV.","DOI":"10.1109\/ICCV.2011.6126344"},{"key":"1224_CR11","doi-asserted-by":"crossref","unstructured":"Grundmann, M., Kwatra, V., Han, M., & Essa, I. (2010). Efficient hierarchical graph-based video segmentation. In CVPR.","DOI":"10.1109\/CVPR.2010.5539893"},{"key":"1224_CR12","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In CVPR.","DOI":"10.1109\/CVPR.2016.90"},{"key":"1224_CR13","unstructured":"Hoffman, J., Guadarrama, S., Tzeng, E. S., Hu, R., Donahue, J., Girshick, R., Darrell, T., & Saenko, K. (2014). LSDA: Large scale detection through adaptation. In NIPS."},{"key":"1224_CR14","doi-asserted-by":"crossref","unstructured":"Hong, S., Oh, J., Lee, H., Han, B. (2016). Learning transferrable knowledge for semantic segmentation with deep convolutional neural network. In CVPR.","DOI":"10.1109\/CVPR.2016.349"},{"key":"1224_CR15","doi-asserted-by":"crossref","unstructured":"Hu, R., Doll\u00e1r, P., He, K., Darrell, T., & Girshick, R. (2018). Learning to segment every thing. In CVPR.","DOI":"10.1109\/CVPR.2018.00445"},{"key":"1224_CR16","doi-asserted-by":"crossref","unstructured":"Jain, S., Xiong, B., & Grauman, K. (2017). Fusionseg: Learning to combine motion and appearance for fully automatic segmention of generic objects in videos. In CVPR.","DOI":"10.1109\/CVPR.2017.228"},{"key":"1224_CR17","doi-asserted-by":"crossref","unstructured":"Jain, S. D., & Grauman, K. (2014). Supervoxel-consistent foreground propagation in video. In ECCV.","DOI":"10.1007\/978-3-319-10593-2_43"},{"key":"1224_CR18","unstructured":"Khoreva, A., Perazzi, F., Benenson, R., Schiele, B., & Sorkine-Hornung, A. (2017). Learning video object segmentation from static images. In CVPR."},{"key":"1224_CR19","doi-asserted-by":"crossref","unstructured":"Koh, Y. J., & Kim, C. S. (2017). Primary object segmentation in videos based on region augmentation and reduction. In CVPR.","DOI":"10.1109\/CVPR.2017.784"},{"key":"1224_CR20","unstructured":"Kr\u00e4henb\u00fchl, P., & Koltun, V. (2011). Efficient inference in fully connected CRFs with Gaussian edge potentials. In NIPS."},{"key":"1224_CR21","doi-asserted-by":"crossref","unstructured":"Lazic, N., Givoni, I., Frey, B., & Aarabi, P. (2009). Floss: Facility location for subspace segmentation. In ICCV.","DOI":"10.1109\/ICCV.2009.5459302"},{"key":"1224_CR22","doi-asserted-by":"crossref","unstructured":"Lee, Y. J., Kim, J., & Grauman, K. (2011). Key-segments for video object segmentation. In ICCV.","DOI":"10.1109\/ICCV.2011.6126471"},{"key":"1224_CR23","doi-asserted-by":"crossref","unstructured":"Li, F., Kim, T., Humayun, A., Tsai, D., & Rehg, J. M. (2013). Video segmentation by tracking many figure-ground segments. In ICCV.","DOI":"10.1109\/ICCV.2013.273"},{"key":"1224_CR24","doi-asserted-by":"crossref","unstructured":"Li, S., Seybold, B., Vorobyov, A., Lei, X., & Kuo, C. C. J. (2018). Unsupervised video object segmentation with motion-based bilateral networks. In ECCV.","DOI":"10.1007\/978-3-030-01219-9_13"},{"key":"1224_CR25","unstructured":"Lim, J. J., Salakhutdinov, R., & Torralba A. (2011). Transfer learning by borrowing examples for multiclass object detection. In NIPS."},{"key":"1224_CR26","unstructured":"Liu, C. (2009). Beyond pixels: Exploring new representations and applications for motion analysis. PhD thesis, MIT."},{"key":"1224_CR27","doi-asserted-by":"crossref","unstructured":"Long, J., Shelhamer, E., & Darrell, T. (2015). Fully convolutional networks for semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR.2015.7298965"},{"key":"1224_CR28","unstructured":"Luo, Z., Zou, Y., Hoffman, J., & Fei-Fei, L. (2017). Label efficient learning of transferable representations across domains and tasks. In NIPS."},{"key":"1224_CR29","doi-asserted-by":"crossref","unstructured":"M\u00e4rki, N., Perazzi, F., & Wang, O., & Sorkine-Hornung, A. (2016). Bilateral space video segmentation. In CVPR.","DOI":"10.1109\/CVPR.2016.87"},{"key":"1224_CR30","doi-asserted-by":"crossref","unstructured":"Ochs, P., & Brox, T. (2011). Object segmentation in video: A hierarchical variational approach for turning point trajectories into dense regions. In ICCV.","DOI":"10.1109\/ICCV.2011.6126418"},{"key":"1224_CR31","doi-asserted-by":"crossref","unstructured":"Oh, S. W., Lee, J. Y., Sunkavalli, K., & Kim, S. J. (2018). Fast video object segmentation by reference-guided mask propagation. In CVPR.","DOI":"10.1109\/CVPR.2018.00770"},{"key":"1224_CR32","doi-asserted-by":"crossref","unstructured":"Papazoglou, A., & Ferrari, V. (2013). Fast object segmentation in unconstrained video. In ICCV.","DOI":"10.1109\/ICCV.2013.223"},{"key":"1224_CR33","doi-asserted-by":"crossref","unstructured":"Patricia, N., & Caputo, B. (2014). Learning to learn, from transfer learning to domain adaptation: A unifying perspective. In CVPR.","DOI":"10.1109\/CVPR.2014.187"},{"key":"1224_CR34","doi-asserted-by":"crossref","unstructured":"Pennington, J., Socher, R., & Manning, C. D. (2014). Glove: Global vectors for word representation. In EMNLP (pp. 1532\u20131543).","DOI":"10.3115\/v1\/D14-1162"},{"key":"1224_CR35","doi-asserted-by":"crossref","unstructured":"Perazzi, F., Pont-Tuset, J., McWilliams, B., Gool L. V., Gross M., & Sorkine-Hornung, A. (2016). A benchmark dataset and evaluation methodology for video object segmentation. In CVPR.","DOI":"10.1109\/CVPR.2016.85"},{"key":"1224_CR36","doi-asserted-by":"crossref","unstructured":"Perazzi, F., Wang, O., Gross, M., & Sorkine-Hornung, A. (2015). Fully connected object proposals for video segmentation. In CVPR.","DOI":"10.1109\/ICCV.2015.369"},{"key":"1224_CR37","doi-asserted-by":"crossref","unstructured":"Prest, A., Leistner, C., Civera, J., Schmid, C., & Ferrari, V. (2012). Learning object class detectors from weakly annotated video. In CVPR.","DOI":"10.1109\/CVPR.2012.6248065"},{"key":"1224_CR38","doi-asserted-by":"crossref","unstructured":"Rochan, M., & Wang, Y. (2015). Weakly supervised localization of novel objects using appearance transfer. In CVPR.","DOI":"10.1109\/CVPR.2015.7299060"},{"issue":"3","key":"1224_CR39","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky, O., Deng, J., Su, H., Krause, J., Satheesh, S., Ma, S., et al. (2015). Imagenet large scale visual recognition challenge. IJCV, 115(3), 211\u2013252.","journal-title":"IJCV"},{"key":"1224_CR40","doi-asserted-by":"crossref","unstructured":"Saenko, K., Kulis, B., Fritz, M., & Darrell, T. (2010). Adapting visual category models to new domains. In ECCV.","DOI":"10.1007\/978-3-642-15561-1_16"},{"key":"1224_CR41","doi-asserted-by":"crossref","unstructured":"Saleh, F. S., Aliakbarian, M. S., Salzmann, M., Petersson, L., & Alvarez, J. M. (2017). Bringing background into the foreground: Making all classes equal in weakly-supervised video semantic segmentation. In ICCV.","DOI":"10.1109\/ICCV.2017.232"},{"issue":"12","key":"1224_CR42","doi-asserted-by":"publisher","first-page":"2525","DOI":"10.1109\/TPAMI.2016.2645157","volume":"39","author":"Z Shi","year":"2017","unstructured":"Shi, Z., Yang, Y., Hospedales, T. M., & Xiang, T. (2017). Weakly-supervised image annotation and segmentation with objects and attributes. PAMI, 39(12), 2525\u20132538.","journal-title":"PAMI"},{"key":"1224_CR43","unstructured":"Simonyan, K., & Zisserman, A. (2014). Very deep convolutional networks for large-scale image recognition. CoRR. abs\/1409.1556:1187\u20131200."},{"issue":"4","key":"1224_CR44","first-page":"429","volume":"117","author":"R Strand","year":"2013","unstructured":"Strand, R., Ciesielski, K. C., Malmberg, F., & Saha, P. K. (2013). The minimum barrier distance. CVIU, 117(4), 429\u2013437.","journal-title":"CVIU"},{"key":"1224_CR45","doi-asserted-by":"crossref","unstructured":"Tang, K., Sukthankar, R., Yagnik, J., & Fei-Fei, L. (2013). Discriminative segment annotation in weakly labeled video. In CVPR.","DOI":"10.1109\/CVPR.2013.321"},{"key":"1224_CR46","doi-asserted-by":"crossref","unstructured":"Taylor, B., Karasev, V., & Soatto, S. (2015). Causal video object segmentation from persistence of occlusions. In CVPR.","DOI":"10.1109\/CVPR.2015.7299055"},{"key":"1224_CR47","doi-asserted-by":"crossref","unstructured":"Tokmakov, P., Alahari, K., & Schmid, C. (2017a). Learning motion patterns in videos. In CVPR.","DOI":"10.1109\/CVPR.2017.64"},{"key":"1224_CR48","doi-asserted-by":"crossref","unstructured":"Tokmakov, P., Alahari, K., & Schmid, C. (2017b). Learning video object segmentation with visual memory. In ICCV.","DOI":"10.1109\/ICCV.2017.480"},{"key":"1224_CR49","doi-asserted-by":"publisher","first-page":"928","DOI":"10.1109\/TPAMI.2013.197","volume":"36","author":"T Tommasi","year":"2014","unstructured":"Tommasi, T., Orabona, F., & Caputo, B. (2014). Learning categories from few examples with multi model knowledge transfer. PAMI, 36, 928\u2013941.","journal-title":"PAMI"},{"key":"1224_CR50","doi-asserted-by":"crossref","unstructured":"Tsai, Y. H., Hung, W. C., Schulter, S., Sohn, K., Yang, M. H., & Chandraker, M. (2018). Learning to adapt structured output space for semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR.2018.00780"},{"key":"1224_CR51","doi-asserted-by":"crossref","unstructured":"Tsai, Y. H., Yang, M. H., & Black, M. J. (2016a). Video segmentation via object flow. In CVPR.","DOI":"10.1109\/CVPR.2016.423"},{"key":"1224_CR52","doi-asserted-by":"crossref","unstructured":"Tsai, Y. H., Zhong, G., & Yang, M. H. (2016b). Semantic co-segmentation in videos. In ECCV.","DOI":"10.1007\/978-3-319-46493-0_46"},{"key":"1224_CR53","doi-asserted-by":"crossref","unstructured":"Yan, Y., Xu, C., Cai, D., & Corso, J. J. (2017). Weakly supervised actor-action segmentation via robust multi-task ranking. In CVPR.","DOI":"10.1109\/CVPR.2017.115"},{"key":"1224_CR54","doi-asserted-by":"crossref","unstructured":"Yang, L., Wang, Y., Xiong, X., Yang, J., & Katsaggelos, A. K. (2018). Efficient video object segmentation via network modulation. In CVPR.","DOI":"10.1109\/CVPR.2018.00680"},{"key":"1224_CR55","doi-asserted-by":"crossref","unstructured":"Zhang, D., Yang, L., Meng, D., Xu, D., & Han, J. (2017). SPFTN: A self-paced fine-tuning network for segmenting objects in weakly labelled videos. In CVPR.","DOI":"10.1109\/CVPR.2017.567"},{"key":"1224_CR56","doi-asserted-by":"crossref","unstructured":"Zhang, J., Sclaroff, S., Lin, Z., Shen, X., Price, B., & Mech, R. (2015a). Minimum barrier salient object detection at 80 fps. In ICCV.","DOI":"10.1109\/ICCV.2015.165"},{"key":"1224_CR57","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Chen, X., Li, J., Wang, C., & Xia, C. (2015b). Semantic object segmentation via detection in weakly labeled video. In CVPR.","DOI":"10.1109\/CVPR.2015.7298987"},{"key":"1224_CR58","unstructured":"Zhong, G., Tsai, Y. H., & Yang, M. H. (2016). Weakly-supervised video scene co-parsing. In ACCV."},{"key":"1224_CR59","doi-asserted-by":"crossref","unstructured":"Zhu, F., Jiang, Z., & Shao, L. (2014). Submodular object recognition. In CVPR.","DOI":"10.1109\/CVPR.2014.315"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-019-01224-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-019-01224-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-019-01224-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,2,2]],"date-time":"2021-02-02T00:16:22Z","timestamp":1612224982000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-019-01224-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,2,3]]},"references-count":59,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2020,4]]}},"alternative-id":["1224"],"URL":"https:\/\/doi.org\/10.1007\/s11263-019-01224-x","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,2,3]]},"assertion":[{"value":"5 April 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 August 2019","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"3 February 2020","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}