{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,14]],"date-time":"2026-01-14T21:00:08Z","timestamp":1768424408644,"version":"3.49.0"},"publisher-location":"Singapore","reference-count":38,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819549863","type":"print"},{"value":"9789819549870","type":"electronic"}],"license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-981-95-4987-0_32","type":"book-chapter","created":{"date-parts":[[2026,1,14]],"date-time":"2026-01-14T12:29:45Z","timestamp":1768393785000},"page":"455-469","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Referent-Aligned Training for\u00a0Unsupervised Interactive Segmentation"],"prefix":"10.1007","author":[{"given":"Luna","family":"Wang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yian","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kehan","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jie","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,1,15]]},"reference":[{"key":"32_CR1","doi-asserted-by":"publisher","unstructured":"Bai, J., Wu, X.: Error-tolerant scribbles based interactive image segmentation. In: 2014 IEEE Conference on Computer Vision and Pattern Recognition, pp. 392\u2013399 (2014). https:\/\/doi.org\/10.1109\/CVPR.2014.57","DOI":"10.1109\/CVPR.2014.57"},{"key":"32_CR2","doi-asserted-by":"crossref","unstructured":"Bai, X., Sapiro, G.: A geodesic framework for fast interactive image and video segmentation and matting. 2007 IEEE 11th International Conference on Computer Vision, pp.\u00a01\u20138 (2007). https:\/\/api.semanticscholar.org\/CorpusID:206769520","DOI":"10.1109\/ICCV.2007.4408931"},{"key":"32_CR3","doi-asserted-by":"crossref","unstructured":"Boykov, Y., Jolly, M.P.: Interactive graph cuts for optimal boundary and region segmentation of objects in n-d images. In: Proceedings Eighth IEEE International Conference on Computer Vision. ICCV 2001, vol. 1, pp. 105\u2013112 (2001). https:\/\/api.semanticscholar.org\/CorpusID:2245438","DOI":"10.1109\/ICCV.2001.937505"},{"key":"32_CR4","doi-asserted-by":"publisher","unstructured":"Caron, M., Touvron, H., Misra, I., Jegou, H., Mairal, J., Bojanowski, P., Joulin, A.: Emerging properties in self-supervised vision transformers. In: 2021 IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 9630\u20139640 (2021). https:\/\/doi.org\/10.1109\/ICCV48922.2021.00951","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"32_CR5","doi-asserted-by":"publisher","unstructured":"Chen, X., Zhao, Z., Yu, F., Zhang, Y., Duan, M.: Conditional diffusion for interactive segmentation. In: 2021 IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 7325\u20137334 (2021). https:\/\/doi.org\/10.1109\/ICCV48922.2021.00725","DOI":"10.1109\/ICCV48922.2021.00725"},{"key":"32_CR6","unstructured":"Chen, X., et al.: Focalclick: towards practical interactive image segmentation (2022). https:\/\/arxiv.org\/abs\/2204.02574"},{"key":"32_CR7","unstructured":"Dosovitskiy, A., et al.: An image is worth 16x16 words: transformers for image recognition at scale (2021). https:\/\/arxiv.org\/abs\/2010.11929"},{"issue":"11","key":"32_CR8","doi-asserted-by":"publisher","first-page":"1768","DOI":"10.1109\/TPAMI.2006.233","volume":"28","author":"L Grady","year":"2006","unstructured":"Grady, L.: Random walks for image segmentation. IEEE Trans. Pattern Anal. Mach. Intell. 28(11), 1768\u20131783 (2006). https:\/\/doi.org\/10.1109\/TPAMI.2006.233","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"32_CR9","doi-asserted-by":"publisher","unstructured":"Gulshan, V., Rother, C., Criminisi, A., Blake, A., Zisserman, A.: Geodesic star convexity for interactive image segmentation. In: 2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition, pp. 3129\u20133136 (2010). https:\/\/doi.org\/10.1109\/CVPR.2010.5540073","DOI":"10.1109\/CVPR.2010.5540073"},{"key":"32_CR10","doi-asserted-by":"publisher","unstructured":"Hao, Y., et al.: Edgeflow: achieving practical interactive segmentation with edge-guided flow. In: 2021 IEEE\/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 1551\u20131560 (2021). https:\/\/doi.org\/10.1109\/ICCVW54120.2021.00180","DOI":"10.1109\/ICCVW54120.2021.00180"},{"key":"32_CR11","doi-asserted-by":"publisher","unstructured":"Hariharan, B., Arbel\u00e1ez, P., Bourdev, L., Maji, S., Malik, J.: Semantic contours from inverse detectors. In: 2011 International Conference on Computer Vision, pp. 991\u2013998 (2011). https:\/\/doi.org\/10.1109\/ICCV.2011.6126343","DOI":"10.1109\/ICCV.2011.6126343"},{"key":"32_CR12","doi-asserted-by":"publisher","unstructured":"Huang, Y., et al.: InterFormer real-time interactive image segmentation . In: 2023 IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 22244\u201322254. IEEE Computer Society, Los Alamitos, CA, USA (2023). https:\/\/doi.org\/10.1109\/ICCV51070.2023.02038","DOI":"10.1109\/ICCV51070.2023.02038"},{"key":"32_CR13","doi-asserted-by":"crossref","unstructured":"Jang, W.D., Kim, C.S.: Interactive image segmentation via backpropagating refinement scheme. In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 5292\u20135301 (2019). https:\/\/api.semanticscholar.org\/CorpusID:195482029","DOI":"10.1109\/CVPR.2019.00544"},{"key":"32_CR14","doi-asserted-by":"crossref","unstructured":"Karmann, M., Urfalioglu, O.: Repurposing stable diffusion attention for training-free unsupervised interactive segmentation (2025)","DOI":"10.1109\/CVPR52734.2025.02283"},{"key":"32_CR15","doi-asserted-by":"crossref","unstructured":"Kontogianni, T., Gygli, M., Uijlings, J., Ferrari, V.: Continuous adaptation for interactive object segmentation by learning from corrections (2020). https:\/\/arxiv.org\/abs\/1911.12709","DOI":"10.1007\/978-3-030-58517-4_34"},{"key":"32_CR16","doi-asserted-by":"crossref","unstructured":"Lee, C., Lee, S.H., Kim, C.S.: Mfp: Making full use of probability maps for interactive image segmentation (2024). https:\/\/arxiv.org\/abs\/2404.18448","DOI":"10.1109\/CVPR52733.2024.00388"},{"key":"32_CR17","doi-asserted-by":"publisher","unstructured":"Lempitsky, V., Kohli, P., Rother, C., Sharp, T.: Image segmentation with a bounding box prior. In: 2009 IEEE 12th International Conference on Computer Vision, pp. 277\u2013284 (2009). https:\/\/doi.org\/10.1109\/ICCV.2009.5459262","DOI":"10.1109\/ICCV.2009.5459262"},{"key":"32_CR18","unstructured":"Li, K., et al.: Multi-granularity interaction simulation for unsupervised interactive segmentation (2023). https:\/\/arxiv.org\/abs\/2303.13399"},{"key":"32_CR19","doi-asserted-by":"publisher","unstructured":"Li, Y., Sun, J., Tang, C.K., Shum, H.Y.: Lazy snapping. ACM Trans. Graph. 23(3), 303\u2013308 (2004). https:\/\/doi.org\/10.1145\/1015706.1015719","DOI":"10.1145\/1015706.1015719"},{"key":"32_CR20","doi-asserted-by":"publisher","unstructured":"Lin, Z., Duan, Z.P., Zhang, Z., Guo, C.L., Cheng, M.M.: Focuscut: diving into a focus view in interactive segmentation. In: 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2627\u20132636 (2022). https:\/\/doi.org\/10.1109\/CVPR52688.2022.00266","DOI":"10.1109\/CVPR52688.2022.00266"},{"key":"32_CR21","doi-asserted-by":"publisher","unstructured":"Lin, Z., Zhang, Z., Chen, L.Z., Cheng, M.M., Lu, S.P.: Interactive image segmentation with first click attention. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 13336\u201313345 (2020). https:\/\/doi.org\/10.1109\/CVPR42600.2020.01335","DOI":"10.1109\/CVPR42600.2020.01335"},{"key":"32_CR22","doi-asserted-by":"publisher","unstructured":"Liu, J., Wang, H., Yin, W., Sonke, J., Gavves, E.: Click prompt learning with optimal transport for interactive segmentation. In: Leonardis, A., Ricci, E., Roth, S., Russakovsky, O., Sattler, T., Varol, G. (eds.) Computer Vision - ECCV 2024 - 18th European Conference, Milan, Italy, September 29-October 4, 2024, Proceedings, Part XXXIII. Lecture Notes in Computer Science, vol. 15091, pp. 93\u2013110. Springer (2024). https:\/\/doi.org\/10.1007\/978-3-031-73414-4_6","DOI":"10.1007\/978-3-031-73414-4_6"},{"key":"32_CR23","doi-asserted-by":"publisher","unstructured":"Liu, Q., Xu, Z., Bertasius, G., Niethammer, M.: Simpleclick: interactive image segmentation with simple vision transformers. In: 2023 IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 22233\u201322243 (2023). https:\/\/doi.org\/10.1109\/ICCV51070.2023.02037","DOI":"10.1109\/ICCV51070.2023.02037"},{"key":"32_CR24","doi-asserted-by":"crossref","unstructured":"Liu, Q., et al.: Pseudoclick: interactive image segmentation with click imitation (2022). https:\/\/arxiv.org\/abs\/2207.05282","DOI":"10.1007\/978-3-031-20068-7_42"},{"key":"32_CR25","doi-asserted-by":"crossref","unstructured":"McGuinness, K., O\u2019Connor, N.E.: A comparative evaluation of interactive segmentation algorithms. Pattern Recogn. 43, 434\u2013444 (2010). https:\/\/api.semanticscholar.org\/CorpusID:8899812","DOI":"10.1016\/j.patcog.2009.03.008"},{"key":"32_CR26","doi-asserted-by":"crossref","unstructured":"Melas-Kyriazi, L., Rupprecht, C., Laina, I., Vedaldi, A.: Deep spectral methods: a surprisingly strong baseline for unsupervised semantic segmentation and localization (2022). https:\/\/arxiv.org\/abs\/2205.07839","DOI":"10.1109\/CVPR52688.2022.00818"},{"key":"32_CR27","unstructured":"Oquab, M., et al.: Dinov2: learning robust visual features without supervision (2024). https:\/\/arxiv.org\/abs\/2304.07193"},{"key":"32_CR28","doi-asserted-by":"publisher","unstructured":"Perazzi, F., et al.: A benchmark dataset and evaluation methodology for video object segmentation. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 724\u2013732 (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.85","DOI":"10.1109\/CVPR.2016.85"},{"key":"32_CR29","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-resolution image synthesis with latent diffusion models (2022). https:\/\/arxiv.org\/abs\/2112.10752","DOI":"10.1109\/CVPR52688.2022.01042"},{"issue":"3","key":"32_CR30","doi-asserted-by":"publisher","first-page":"309","DOI":"10.1145\/1015706.1015720","volume":"23","author":"C Rother","year":"2004","unstructured":"Rother, C., Kolmogorov, V., Blake, A.: \u201cGrabCut\u2019\u2019: interactive foreground extraction using iterated graph cuts. ACM Trans. Graph. 23(3), 309\u2013314 (2004). https:\/\/doi.org\/10.1145\/1015706.1015720","journal-title":"ACM Trans. Graph."},{"key":"32_CR31","doi-asserted-by":"crossref","unstructured":"Sofiiuk, K., Petrov, I., Barinova, O., Konushin, A.: F-BRS: rethinking backpropagating refinement for interactive segmentation (2020). https:\/\/arxiv.org\/abs\/2001.10331","DOI":"10.1109\/CVPR42600.2020.00865"},{"key":"32_CR32","doi-asserted-by":"crossref","unstructured":"Sofiiuk, K., Petrov, I.A., Konushin, A.: Reviving iterative training with mask guidance for interactive segmentation (2021). https:\/\/arxiv.org\/abs\/2102.06583","DOI":"10.1109\/ICIP46576.2022.9897365"},{"key":"32_CR33","doi-asserted-by":"crossref","unstructured":"Sun, S., Xian, M., Xu, F., Capriotti, L., Yao, T.: CFR-ICL: cascade-forward refinement with iterative click loss for interactive image segmentation (2024). https:\/\/arxiv.org\/abs\/2303.05620","DOI":"10.1609\/aaai.v38i5.28306"},{"key":"32_CR34","unstructured":"Wang, B., et al.: Order-aware interactive segmentation (2025). https:\/\/arxiv.org\/abs\/2410.12214"},{"key":"32_CR35","unstructured":"Wang, X., et al.: Freesolo: learning to segment objects without annotations (2022). https:\/\/arxiv.org\/abs\/2202.12181"},{"key":"32_CR36","doi-asserted-by":"crossref","unstructured":"Wang, Y., et al.: Self-supervised transformers for unsupervised object discovery using normalized cut (2022). https:\/\/arxiv.org\/abs\/2202.11539","DOI":"10.1109\/CVPR52688.2022.01414"},{"key":"32_CR37","doi-asserted-by":"publisher","unstructured":"Wu, J., Zhao, Y., Zhu, J.Y., Luo, S., Tu, Z.: Milcut: A sweeping line multiple instance learning paradigm for interactive image segmentation. In: 2014 IEEE Conference on Computer Vision and Pattern Recognition, pp. 256\u2013263 (2014). https:\/\/doi.org\/10.1109\/CVPR.2014.40","DOI":"10.1109\/CVPR.2014.40"},{"key":"32_CR38","doi-asserted-by":"crossref","unstructured":"Xu, N., Price, B., Cohen, S., Yang, J., Huang, T.: Deep interactive object selection (2016). https:\/\/arxiv.org\/abs\/1603.04042","DOI":"10.1109\/CVPR.2016.47"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition and Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-95-4987-0_32","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,1,14]],"date-time":"2026-01-14T12:29:47Z","timestamp":1768393787000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-95-4987-0_32"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"ISBN":["9789819549863","9789819549870"],"references-count":38,"URL":"https:\/\/doi.org\/10.1007\/978-981-95-4987-0_32","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]},"assertion":[{"value":"15 January 2026","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"PRCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Chinese Conference on Pattern Recognition and Computer Vision  (PRCV)","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Shanghai","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"15 October 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18 October 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"ccprcv2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/2025.prcv.cn\/index.asp","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}