{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,10]],"date-time":"2026-03-10T07:12:53Z","timestamp":1773126773451,"version":"3.50.1"},"reference-count":32,"publisher":"Institute of Electronics, Information and Communications Engineers (IEICE)","issue":"7","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEICE Trans. Inf. &amp; Syst."],"published-print":{"date-parts":[[2025,7,1]]},"DOI":"10.1587\/transinf.2024edp7125","type":"journal-article","created":{"date-parts":[[2024,12,24]],"date-time":"2024-12-24T22:11:39Z","timestamp":1735078299000},"page":"752-759","source":"Crossref","is-referenced-by-count":2,"title":["Structural Relation Multi-Class Token Transformer for Weakly Supervised Semantic Segmentation"],"prefix":"10.1587","volume":"E108.D","author":[{"given":"Dingjie","family":"PENG","sequence":"first","affiliation":[{"name":"Graduate School of Fundamental Science and Engineering, Waseda University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wataru","family":"KAMEYAMA","sequence":"additional","affiliation":[{"name":"Faculty of Science and Engineering, Waseda University"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"532","reference":[{"key":"1","doi-asserted-by":"publisher","unstructured":"[1] M. Zhang, Y. Zhou, J. Zhao, Y. Man, B. Liu, and R. Yao, \u201cA survey of semi-and weakly supervised semantic segmentation of images,\u201d Artificial Intelligence Review, vol.53, pp.4259-4288, 2020. 10.1007\/s10462-019-09792-7","DOI":"10.1007\/s10462-019-09792-7"},{"key":"2","doi-asserted-by":"crossref","unstructured":"[2] B. Zhou, A. Khosla, A. Lapedriza, A. Oliva, and A. Torralba, \u201cLearning deep features for discriminative localization,\u201d 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.2921-2929, 2016. 10.1109\/cvpr.2016.319","DOI":"10.1109\/CVPR.2016.319"},{"key":"3","doi-asserted-by":"crossref","unstructured":"[3] J. Ahn and S. Kwak, \u201cLearning pixel-level semantic affinity with image-level supervision for weakly supervised semantic segmentation,\u201d 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp.4981-4990, 2018. 10.1109\/cvpr.2018.00523","DOI":"10.1109\/CVPR.2018.00523"},{"key":"4","doi-asserted-by":"crossref","unstructured":"[4] L. Xu, W. Ouyang, M. Bennamoun, F. Boussaid, and D. Xu, \u201cMulti-class token transformer for weakly supervised semantic segmentation,\u201d 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp.4310-4319, 2022. 10.1109\/cvpr52688.2022.00427","DOI":"10.1109\/CVPR52688.2022.00427"},{"key":"5","unstructured":"[5] A. Dosovitskiy, L. Beyer, A. Kolesnikov, D. Weissenborn, X. Zhai, T. Unterthiner, M. Dehghani, M. Minderer, G. Heigold, S. Gelly, et al., \u201cAn image is worth 16x16 words: Transformers for image recognition at scale,\u201d arXiv preprint arXiv:2010.11929, 2020."},{"key":"6","unstructured":"[6] Z. Chen, Y. Duan, W. Wang, J. He, T. Lu, J. Dai, and Y. Qiao, \u201cVision transformer adapter for dense predictions,\u201d 11th International Conference on Learning Representations, 2022."},{"key":"7","doi-asserted-by":"crossref","unstructured":"[7] J. Ahn, S. Cho, and S. Kwak, \u201cWeakly supervised learning of instance segmentation with inter-pixel relations,\u201d 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp.2209-2218, 2019. 10.1109\/cvpr.2019.00231","DOI":"10.1109\/CVPR.2019.00231"},{"key":"8","doi-asserted-by":"crossref","unstructured":"[8] Y. Wang, J. Zhang, M. Kan, S. Shan, and X. Chen, \u201cSelf-supervised equivariant attention mechanism for weakly supervised semantic segmentation,\u201d 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp.12275-12284, 2020. 10.1109\/cvpr42600.2020.01229","DOI":"10.1109\/CVPR42600.2020.01229"},{"key":"9","doi-asserted-by":"crossref","unstructured":"[9] T. Zhang, G. Lin, W. Liu, J. Cai, and A. Kot, \u201cSplitting vs. merging: Mining object regions with discrepancy and intersection loss for weakly supervised semantic segmentation,\u201d Lecture Notes in Computer Science, pp.663-679, Springer, 2020. 10.1007\/978-3-030-58542-6_40","DOI":"10.1007\/978-3-030-58542-6_40"},{"key":"10","doi-asserted-by":"crossref","unstructured":"[10] G. Sun, W. Wang, J. Dai, and L. Van Gool, \u201cMining cross-image semantics for weakly supervised semantic segmentation,\u201d Lecture Notes in Computer Science, pp.347-365, Springer, 2020. 10.1007\/978-3-030-58536-5_21","DOI":"10.1007\/978-3-030-58536-5_21"},{"key":"11","doi-asserted-by":"crossref","unstructured":"[11] L. Ru, H. Zheng, Y. Zhan, and B. Du, \u201cToken contrast for weakly-supervised semantic segmentation,\u201d 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp.3093-3102, 2023. 10.1109\/cvpr52729.2023.00302","DOI":"10.1109\/CVPR52729.2023.00302"},{"key":"12","doi-asserted-by":"crossref","unstructured":"[12] Y. Lin, M. Chen, W. Wang, B. Wu, K. Li, B. Lin, H. Liu, and X. He, \u201cClip is also an efficient segmenter: A text-driven approach for weakly supervised semantic segmentation,\u201d 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp.15305-15314, 2023. 10.1109\/cvpr52729.2023.01469","DOI":"10.1109\/CVPR52729.2023.01469"},{"key":"13","doi-asserted-by":"crossref","unstructured":"[13] W. Wang, E. Xie, X. Li, D.-P. Fan, K. Song, D. Liang, T. Lu, P. Luo, and L. Shao, \u201cPyramid vision transformer: A versatile backbone for dense prediction without convolutions,\u201d 2021 IEEE\/CVF International Conference on Computer Vision (ICCV), pp.568-578, 2021. 10.1109\/iccv48922.2021.00061","DOI":"10.1109\/ICCV48922.2021.00061"},{"key":"14","doi-asserted-by":"crossref","unstructured":"[14] Z. Liu, Y. Lin, Y. Cao, H. Hu, Y. Wei, Z. Zhang, S. Lin, and B. Guo, \u201cSwin transformer: Hierarchical vision transformer using shifted windows,\u201d 2021 IEEE\/CVF International Conference on Computer Vision (ICCV), pp.10012-10022, 2021. 10.1109\/iccv48922.2021.00986","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"15","unstructured":"[15] E. Xie, W. Wang, Z. Yu, A. Anandkumar, J.M. Alvarez, and P. Luo, \u201cSegformer: Simple and efficient design for semantic segmentation with transformers,\u201d Advances in neural information processing systems, vol.34, pp.12077-12090, 2021."},{"key":"16","doi-asserted-by":"crossref","unstructured":"[16] S. Ren, D. Zhou, S. He, J. Feng, and X. Wang, \u201cShunted self-attention via multi-scale token aggregation,\u201d 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp.10853-10862, 2022. 10.1109\/cvpr52688.2022.01058","DOI":"10.1109\/CVPR52688.2022.01058"},{"key":"17","doi-asserted-by":"crossref","unstructured":"[17] W. Gao, F. Wan, X. Pan, Z. Peng, Q. Tian, Z. Han, B. Zhou, and Q. Ye, \u201cTS-CAM: Token semantic coupled attention map for weakly supervised object localization,\u201d 2021 IEEE\/CVF International Conference on Computer Vision (ICCV), pp.2886-2895, 2021. 10.1109\/iccv48922.2021.00288","DOI":"10.1109\/ICCV48922.2021.00288"},{"key":"18","doi-asserted-by":"crossref","unstructured":"[18] L. Ru, Y. Zhan, B. Yu, and B. Du, \u201cLearning affinity from attention: End-to-end weakly-supervised semantic segmentation with transformers,\u201d 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp.16846-16855, 2022. 10.1109\/cvpr52688.2022.01634","DOI":"10.1109\/CVPR52688.2022.01634"},{"key":"19","doi-asserted-by":"crossref","unstructured":"[19] K. He, X. Zhang, S. Ren, and J. Sun, \u201cDeep residual learning for image recognition,\u201d 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.770-778, 2016. 10.1109\/cvpr.2016.90","DOI":"10.1109\/CVPR.2016.90"},{"key":"20","unstructured":"[20] A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A.N. Gomez, \u0141. Kaiser, and I. Polosukhin, \u201cAttention is all you need,\u201d Advances in neural information processing systems, vol.30, 2017."},{"key":"21","doi-asserted-by":"publisher","unstructured":"[21] M. Everingham, L. Van Gool, C.K.I. Williams, J. Winn, and A. Zisserman, \u201cThe pascal visual object classes (VOC) challenge,\u201d International Journal of Computer Vision, vol.88, no.2, pp.303-338, 2009. 10.1007\/s11263-009-0275-4","DOI":"10.1007\/s11263-009-0275-4"},{"key":"22","doi-asserted-by":"crossref","unstructured":"[22] T.-Y. Lin, M. Maire, S. Belongie, J. Hays, P. Perona, D. Ramanan, P. Doll\u00e1r, and C.L. Zitnick, \u201cMicrosoft COCO: Common objects in context,\u201d Lecture Notes in Computer Science, pp.740-755, Springer, 2014. 10.1007\/978-3-319-10602-1_48","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"23","unstructured":"[23] D. Zhang, H. Zhang, J. Tang, X.S. Hua, and Q. Sun, \u201cCausal intervention for weakly-supervised semantic segmentation,\u201d Advances in Neural Information Processing Systems, vol.33, pp.655-666, 2020."},{"key":"24","doi-asserted-by":"crossref","unstructured":"[24] Y.-T. Chang, Q. Wang, W.-C. Hung, R. Piramuthu, Y.-H. Tsai, and M.-H. Yang, \u201cWeakly-supervised semantic segmentation via sub-category exploration,\u201d 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp.8991-9000, 2020. 10.1109\/cvpr42600.2020.00901","DOI":"10.1109\/CVPR42600.2020.00901"},{"key":"25","doi-asserted-by":"crossref","unstructured":"[25] J. Lee, E. Kim, and S. Yoon, \u201cAnti-adversarially manipulated attributions for weakly and semi-supervised semantic segmentation,\u201d 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp.4071-4080, 2021. 10.1109\/cvpr46437.2021.00406","DOI":"10.1109\/CVPR46437.2021.00406"},{"key":"26","doi-asserted-by":"crossref","unstructured":"[26] F. Zhang, C. Gu, C. Zhang, and Y. Dai, \u201cComplementary patch for weakly supervised semantic segmentation,\u201d 2021 IEEE\/CVF International Conference on Computer Vision (ICCV), pp.7242-7251, 2021. 10.1109\/iccv48922.2021.00715","DOI":"10.1109\/ICCV48922.2021.00715"},{"key":"27","unstructured":"[27] H. Touvron, M. Cord, M. Douze, F. Massa, A. Sablayrolles, and H. J\u00e9gou, \u201cTraining data-efficient image transformers &amp; distillation through attention,\u201d International conference on machine learning, pp.10347-10357, PMLR, 2021."},{"key":"28","doi-asserted-by":"crossref","unstructured":"[28] S. Rong, B. Tu, Z. Wang, and J. Li, \u201cBoundary-enhanced Co-training for weakly supervised semantic segmentation,\u201d 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp.19574-19584, 2023. 10.1109\/cvpr52729.2023.01875","DOI":"10.1109\/CVPR52729.2023.01875"},{"key":"29","doi-asserted-by":"crossref","unstructured":"[29] L.-C. Chen, Y. Zhu, G. Papandreou, F. Schroff, and H. Adam, \u201cEncoder-decoder with atrous separable convolution for semantic image segmentation,\u201d Lecture Notes in Computer Science, pp.833-851, 2018. 10.1007\/978-3-030-01234-2_49","DOI":"10.1007\/978-3-030-01234-2_49"},{"key":"30","unstructured":"[30] M. Contributors, \u201cMMSegmentation: Openmmlab semantic segmentation toolbox and benchmark.\u201d https:\/\/github.com\/open-mmlab\/mmsegmentation, 2020."},{"key":"31","doi-asserted-by":"crossref","unstructured":"[31] L. Bottou, \u201cLarge-scale machine learning with stochastic gradient descent,\u201d Proceedings of COMPSTAT\u20192010: 19th International Conference on Computational StatisticsParis France, Aug. 22-27, 2010 Keynote, Invited and Contributed Papers, pp.177-186, Springer, 2010.","DOI":"10.1007\/978-3-7908-2604-3_16"},{"key":"32","doi-asserted-by":"crossref","unstructured":"[32] M. Lee, D. Kim, and H. Shim, \u201cThreshold matters in wsss: Manipulating the activation for the robust and accurate segmentation model against thresholds,\u201d 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp.4330-4339, 2022. 10.1109\/cvpr52688.2022.00429","DOI":"10.1109\/CVPR52688.2022.00429"}],"container-title":["IEICE Transactions on Information and Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E108.D\/7\/E108.D_2024EDP7125\/_pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,5]],"date-time":"2025-07-05T03:36:07Z","timestamp":1751686567000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E108.D\/7\/E108.D_2024EDP7125\/_article"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7,1]]},"references-count":32,"journal-issue":{"issue":"7","published-print":{"date-parts":[[2025]]}},"URL":"https:\/\/doi.org\/10.1587\/transinf.2024edp7125","relation":{},"ISSN":["0916-8532","1745-1361"],"issn-type":[{"value":"0916-8532","type":"print"},{"value":"1745-1361","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,7,1]]},"article-number":"2024EDP7125"}}