{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,4]],"date-time":"2026-01-04T08:08:19Z","timestamp":1767514099282,"version":"3.41.0"},"publisher-location":"Cham","reference-count":52,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031959103","type":"print"},{"value":"9783031959110","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-95911-0_5","type":"book-chapter","created":{"date-parts":[[2025,6,21]],"date-time":"2025-06-21T10:08:08Z","timestamp":1750500488000},"page":"60-73","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Centered Self-attention Layers"],"prefix":"10.1007","author":[{"given":"Ameen","family":"Ali","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tomer","family":"Galanti","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lior","family":"Wolf","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,6,16]]},"reference":[{"key":"5_CR1","doi-asserted-by":"crossref","unstructured":"Araslanov, N., et\u00a0al.: Single-stage semantic segmentation from image labels. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00431"},{"key":"5_CR2","unstructured":"Ba, J., et\u00a0al.: Layer normalization. arXiv:1607.06450 (2016)"},{"key":"5_CR3","unstructured":"Brown, T., et\u00a0al.: Data mixing laws: optimizing data mixtures by predicting language modeling performance. In: Neurips (2020)"},{"key":"5_CR4","unstructured":"Chamberlain, B., et\u00a0al.: Grand: graph neural diffusion. In: ICLR (2021)"},{"key":"5_CR5","unstructured":"Dasoulas, G., et\u00a0al.: Lipschitz normalization for self-attention layers with application to graph neural networks. In: ICLR (2021)"},{"key":"5_CR6","unstructured":"Devlin, J., et\u00a0al.: BERT: pre-training of deep bidirectional transformers for language understanding. In: ACL (2019)"},{"key":"5_CR7","unstructured":"Dosovitskiy, A., et\u00a0al.: An image is worth 16x16 words: transformers for image recognition at scale. In: ICLR (2021)"},{"key":"5_CR8","doi-asserted-by":"crossref","unstructured":"Du, Y., et\u00a0al.: Weakly supervised semantic segmentation by pixel-to-prototype contrast. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00428"},{"key":"5_CR9","doi-asserted-by":"crossref","unstructured":"Everingham, M., et\u00a0al.: The pascal visual object classes (voc) challenge. IJCV (2010)","DOI":"10.1007\/s11263-009-0275-4"},{"key":"5_CR10","doi-asserted-by":"crossref","unstructured":"Giles, C., et\u00a0al.: Citeseer: an automatic citation indexing system. In: ACM DL (1998)","DOI":"10.1145\/276675.276685"},{"key":"5_CR11","unstructured":"Guo, X., et\u00a0al.: Contranorm: a contrastive learning perspective on oversmoothing and beyond. In: ICLR (2023)"},{"key":"5_CR12","doi-asserted-by":"crossref","unstructured":"Guo, Z., et\u00a0al.: Attention guided graph convolutional networks for relation extraction. In: ACL (2019)","DOI":"10.18653\/v1\/P19-1024"},{"key":"5_CR13","doi-asserted-by":"crossref","unstructured":"Hariharan, B., et\u00a0al.: Semantic contours from inverse detectors. In: ICCV (2011)","DOI":"10.1109\/ICCV.2011.6126343"},{"key":"5_CR14","unstructured":"Jacot, A., et\u00a0al.: Neural tangent kernel: convergence and generalization in neural networks. Neurips (2018)"},{"key":"5_CR15","doi-asserted-by":"crossref","unstructured":"Jiang, P., et\u00a0al.: L2g: a simple local-to-global knowledge transfer framework for weakly supervised semantic segmentation. In: CVBR (2022)","DOI":"10.1109\/CVPR52688.2022.01638"},{"key":"5_CR16","unstructured":"Kipf, T., et\u00a0al.: Semi-supervised classification with graph convolutional networks. In: ICLR (2017)"},{"key":"5_CR17","unstructured":"Lan, Z., et\u00a0al.: Albert: a lite bert for self-supervised learning of language representations. In: ICLR (2020)"},{"key":"5_CR18","unstructured":"Lee, J., et\u00a0al.: Deep neural networks as gaussian processes. stat (2018)"},{"key":"5_CR19","unstructured":"Lee, J., et\u00a0al.: Reducing information bottleneck for weakly supervised semantic segmentation. Neurips (2021)"},{"key":"5_CR20","doi-asserted-by":"crossref","unstructured":"Lee, J., et\u00a0al.: Weakly supervised semantic segmentation using out-of-distribution data. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01639"},{"key":"5_CR21","doi-asserted-by":"crossref","unstructured":"Lee, S., et\u00a0al.: Railroad is not a train: Saliency as pseudo-pixel supervision for weakly supervised semantic segmentation. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00545"},{"key":"5_CR22","unstructured":"Li, J., et\u00a0al.: Expansion and shrinkage of localization for weakly-supervised semantic segmentation. In: Neurips (2022)"},{"key":"5_CR23","doi-asserted-by":"crossref","unstructured":"Liu, L., et\u00a0al.: Understanding the difficulty of training transformers. In: EMNLP (2020)","DOI":"10.18653\/v1\/2020.emnlp-main.463"},{"key":"5_CR24","unstructured":"Liu, Y., et\u00a0al.: Roberta: a robustly optimized bert pretraining approach (2019)"},{"key":"5_CR25","unstructured":"Loshchilov, I., et\u00a0al.: Decoupled weight decay regularization. In: ICLR (2019)"},{"key":"5_CR26","doi-asserted-by":"crossref","unstructured":"McCallum, A., et\u00a0al.: Automating the construction of internet portals with machine learning. Inform. Retrieval (2000)","DOI":"10.1023\/A:1009953814988"},{"key":"5_CR27","unstructured":"Nguyen, T., et\u00a0al.: Transformers without tears: improving the normalization of self-attention. arXiv:1910.05895 (2019)"},{"key":"5_CR28","doi-asserted-by":"crossref","unstructured":"Pan, J., et\u00a0al.: Learning self-supervised low-rank network for single-stage weakly and semi-supervised semantic segmentation. IJCV (2022)","DOI":"10.1007\/s11263-022-01590-z"},{"key":"5_CR29","doi-asserted-by":"crossref","unstructured":"Press, O., et\u00a0al.: Improving transformer models by reordering their sublayers. In: ACL (2020)","DOI":"10.18653\/v1\/2020.acl-main.270"},{"key":"5_CR30","unstructured":"Ridnik, T., et\u00a0al.: Imagenet-21k pretraining for the masses (2021)"},{"key":"5_CR31","unstructured":"Ridnik, T., et\u00a0al.: Imagenet-21k pretraining for the masses. arXiv:2104.10972 (2021)"},{"key":"5_CR32","doi-asserted-by":"crossref","unstructured":"Rozemberczki, B., et\u00a0al.: Multi-scale attributed node embedding. Journal of Complex Networks (2021)","DOI":"10.1093\/comnet\/cnab014"},{"key":"5_CR33","doi-asserted-by":"crossref","unstructured":"Ru, L., et\u00a0al.: Learning affinity from attention: end-to-end weakly-supervised semantic segmentation with transformers. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01634"},{"key":"5_CR34","doi-asserted-by":"crossref","unstructured":"Ru, L., et\u00a0al.: Weakly-supervised semantic segmentation with visual words learning and hybrid pooling. ICCV (2022)","DOI":"10.1007\/s11263-022-01586-9"},{"key":"5_CR35","doi-asserted-by":"crossref","unstructured":"Ru, L., et\u00a0al.: Token contrast for weakly-supervised semantic segmentation. CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00302"},{"key":"5_CR36","unstructured":"Rusch, T., et\u00a0al.: A survey on oversmoothing in graph neural networks. arXiv:2303.10993 (2023)"},{"key":"5_CR37","unstructured":"Shi, H., et\u00a0al.: Revisiting over-smoothing in BERT from the perspective of graph. In: ICLR (2022)"},{"key":"5_CR38","doi-asserted-by":"crossref","unstructured":"Strudel, R., et\u00a0al.: Segmenter: transformer for semantic segmentation. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00717"},{"key":"5_CR39","doi-asserted-by":"crossref","unstructured":"Su, H., et\u00a0al.: Pixel-adaptive convolutional neural networks. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.01142"},{"key":"5_CR40","doi-asserted-by":"crossref","unstructured":"Tang, M., et\u00a0al.: On regularized losses for weakly-supervised cnn segmentation. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01270-0_31"},{"key":"5_CR41","doi-asserted-by":"crossref","unstructured":"Touvron, H., et\u00a0al.: Training data-efficient image transformers distillation through attention. In: ICML vol. 139 (2021)","DOI":"10.1109\/ICCV48922.2021.00010"},{"key":"5_CR42","unstructured":"Veli\u010dkovi\u0107, P., et\u00a0al.: Graph attention networks. In: ICLR (2018)"},{"key":"5_CR43","unstructured":"Wang, P., et\u00a0al.: Anti-oversmoothing in deep vision transformers via the fourier domain analysis: from theory to practice. In: ICLR (2022)"},{"key":"5_CR44","unstructured":"Wu, X., et\u00a0al.: A non-asymptotic analysis of oversmoothing in graph neural networks. In: ICLR (2023)"},{"key":"5_CR45","unstructured":"Xie, S., et\u00a0al.: Residual: transformer with dual residual connections (2023)"},{"key":"5_CR46","unstructured":"Xiong, R., et\u00a0al.: On layer normalization in the transformer architecture. In: ICLR (2020)"},{"key":"5_CR47","unstructured":"Xu, K., et\u00a0al.: Optimization of graph neural networks: implicit acceleration by skip connections and more depth. In: ICLR (2021)"},{"key":"5_CR48","doi-asserted-by":"crossref","unstructured":"Xu, L., et\u00a0al.: Multi-class token transformer for weakly supervised semantic segmentation. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00427"},{"key":"5_CR49","doi-asserted-by":"crossref","unstructured":"Zhang, B., et\u00a0al.: Reliability does matter: an end-to-end weakly supervised semantic segmentation approach. In: AAAI (2020)","DOI":"10.1609\/aaai.v34i07.6971"},{"key":"5_CR50","doi-asserted-by":"crossref","unstructured":"Zhang, Y., et\u00a0al.: Weakly supervised semantic segmentation for large-scale point cloud. In: AAAI (2021)","DOI":"10.1609\/aaai.v35i4.16455"},{"key":"5_CR51","unstructured":"Zhao, L., et\u00a0al.: Pairnorm: tackling oversmoothing in gnns. In: ICLR (2020)"},{"key":"5_CR52","doi-asserted-by":"crossref","unstructured":"Zhou, T., et\u00a0al.: Regional semantic contrast and aggregation for weakly supervised semantic segmentation. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00426"}],"container-title":["Lecture Notes in Computer Science","Image Analysis"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-95911-0_5","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,21]],"date-time":"2025-06-21T10:08:19Z","timestamp":1750500499000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-95911-0_5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9783031959103","9783031959110"],"references-count":52,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-95911-0_5","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"16 June 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"SCIA","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Scandinavian Conference on Image Analysis","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Reykjavik","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Iceland","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 June 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"25 June 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"scia2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/scia2025.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}