{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T21:08:02Z","timestamp":1783112882971,"version":"3.54.6"},"reference-count":63,"publisher":"MIT Press","license":[{"start":{"date-parts":[[2024,12,2]],"date-time":"2024-12-02T00:00:00Z","timestamp":1733097600000},"content-version":"vor","delay-in-days":336,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["direct.mit.edu"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,11,27]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:p>We propose a method for unsupervised abstractive opinion summarization, that combines the attributability and scalability of extractive approaches with the coherence and fluency of Large Language Models (LLMs). Our method, HIRO, learns an index structure that maps sentences to a path through a semantically organized discrete hierarchy. At inference time, we populate the index and use it to identify and retrieve clusters of sentences containing popular opinions from input reviews. Then, we use a pretrained LLM to generate a readable summary that is grounded in these extracted evidential clusters. The modularity of our approach allows us to evaluate its efficacy at each stage. We show that HIRO learns an encoding space that is more semantically structured than prior work, and generates summaries that are more representative of the opinions in the input reviews. Human evaluation confirms that HIRO generates significantly more coherent, detailed, and accurate summaries.<\/jats:p>","DOI":"10.1162\/tacl_a_00703","type":"journal-article","created":{"date-parts":[[2024,12,2]],"date-time":"2024-12-02T16:30:28Z","timestamp":1733157028000},"page":"1533-1555","update-policy":"https:\/\/doi.org\/10.1162\/mitpressjournals.corrections.policy","source":"Crossref","is-referenced-by-count":5,"title":["Hierarchical Indexing for Retrieval-Augmented Opinion\n                    Summarization"],"prefix":"10.1162","volume":"12","author":[{"given":"Tom","family":"Hosking","sequence":"first","affiliation":[{"name":"Institute for Language, Cognition and Computation, School of Informatics, University of Edinburgh, 10 Crichton Street, Edinburgh EH8 9AB, United Kingdom. tom.hosking@ed.ac.uk"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hao","family":"Tang","sequence":"additional","affiliation":[{"name":"Institute for Language, Cognition and Computation, School of Informatics, University of Edinburgh, 10 Crichton Street, Edinburgh EH8 9AB, United Kingdom. hao.tang@ed.ac.uk"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mirella","family":"Lapata","sequence":"additional","affiliation":[{"name":"Institute for Language, Cognition and Computation, School of Informatics, University of Edinburgh, 10 Crichton Street, Edinburgh EH8 9AB, United Kingdom. mlap@inf.ed.ac.uk"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"281","published-online":{"date-parts":[[2024,11,27]]},"reference":[{"key":"2024120416102020100_bib1","doi-asserted-by":"publisher","first-page":"3562","DOI":"10.18653\/v1\/2023.findings-acl.220","article-title":"Multilingual summarization with factual\n                        consistency evaluation","volume-title":"Findings of the\n                        Association for Computational Linguistics: ACL 2023","author":"Aharoni","year":"2023"},{"key":"2024120416102020100_bib2","doi-asserted-by":"publisher","first-page":"6578","DOI":"10.18653\/v1\/2021.emnlp-main.528","article-title":"Aspect-controllable opinion\n                        summarization","volume-title":"Proceedings of the 2021 Conference\n                        on Empirical Methods in Natural Language Processing","author":"Amplayo","year":"2021"},{"key":"2024120416102020100_bib3","doi-asserted-by":"publisher","first-page":"12489","DOI":"10.1609\/aaai.v35i14.17481","article-title":"Unsupervised opinion summarization with\n                        content planning","volume-title":"Thirty-Fifth AAAI Conference on\n                        Artificial Intelligence, AAAI 2021, Thirty-Third Conference on Innovative\n                        Applications of Artificial Intelligence, IAAI 2021, The Eleventh Symposium\n                        on Educational Advances in Artificial Intelligence, EAAI 2021, Virtual\n                        Event, February 2\u20139, 2021","author":"Amplayo","year":"2021"},{"key":"2024120416102020100_bib4","doi-asserted-by":"publisher","first-page":"277","DOI":"10.1162\/tacl_a_00366","article-title":"Extractive opinion summarization in\n                        quantized transformer spaces","volume":"9","author":"Angelidis","year":"2021","journal-title":"Transactions of the\n                        Association for Computational Linguistics"},{"key":"2024120416102020100_bib5","doi-asserted-by":"publisher","first-page":"1209","DOI":"10.18653\/v1\/2022.acl-long.86","article-title":"Unsupervised extractive opinion\n                        summarization using sparse coding","volume-title":"Proceedings of\n                        the 60th Annual Meeting of the Association for Computational Linguistics\n                        (Volume 1: Long Papers)","author":"Roy Chowdhury","year":"2022"},{"key":"2024120416102020100_bib6","article-title":"Longformer: The long-document\n                        transformer","author":"Iz","year":"2020","journal-title":"arXiv:2004.05150"},{"key":"2024120416102020100_bib7","doi-asserted-by":"publisher","first-page":"9282","DOI":"10.18653\/v1\/2023.findings-acl.591","article-title":"Prompted opinion summarization with\n                        GPT-3.5","volume-title":"Findings of the Association for\n                        Computational Linguistics: ACL 2023","author":"Bhaskar","year":"2023"},{"key":"2024120416102020100_bib8","doi-asserted-by":"publisher","first-page":"5151","DOI":"10.18653\/v1\/2020.acl-main.461","article-title":"Unsupervised opinion summarization as\n                        copycat-review generation","volume-title":"Proceedings of the\n                        58th Annual Meeting of the Association for Computational\n                        Linguistics","author":"Bra\u017einskas","year":"2020"},{"key":"2024120416102020100_bib9","doi-asserted-by":"publisher","first-page":"9424","DOI":"10.18653\/v1\/2021.emnlp-main.743","article-title":"Learning opinion summarizers by selecting\n                        informative reviews","volume-title":"Proceedings of the 2021\n                        Conference on Empirical Methods in Natural Language Processing","author":"Bra\u017einskas","year":"2021"},{"key":"2024120416102020100_bib10","first-page":"249","article-title":"Re-evaluating the role of Bleu in machine\n                        translation research","volume-title":"11th Conference of the\n                        European Chapter of the Association for Computational Linguistics","author":"Callison-Burch","year":"2006"},{"key":"2024120416102020100_bib11","doi-asserted-by":"publisher","first-page":"912","DOI":"10.18653\/v1\/2023.acl-long.52","article-title":"From key points to key point hierarchy:\n                        Structured and expressive opinion summarization","volume-title":"Proceedings of the 61st Annual Meeting of the Association for\n                        Computational Linguistics (Volume 1: Long Papers)","author":"Cattan","year":"2023"},{"key":"2024120416102020100_bib12","doi-asserted-by":"publisher","first-page":"11259","DOI":"10.3390\/s101211259","article-title":"Approximate nearest neighbor search by residual vector\n                        quantization","volume":"10","author":"Chen","year":"2010","journal-title":"Sensors (Basel, Switzerland)"},{"key":"2024120416102020100_bib13","doi-asserted-by":"publisher","first-page":"9397","DOI":"10.18653\/v1\/2023.emnlp-main.584","article-title":"SEAHORSE: A multilingual, multifaceted\n                        dataset for summarization evaluation","volume-title":"Proceedings\n                        of the 2023 Conference on Empirical Methods in Natural Language\n                        Processing","author":"Clark","year":"2023"},{"key":"2024120416102020100_bib14","doi-asserted-by":"publisher","first-page":"42","DOI":"10.18653\/v1\/D19-5405","article-title":"Unsupervised aspect-based multi-document\n                        abstractive summarization","volume-title":"Proceedings of the 2nd\n                        Workshop on New Frontiers in Summarization","author":"Coavoux","year":"2019"},{"key":"2024120416102020100_bib15","doi-asserted-by":"publisher","first-page":"4171","DOI":"10.18653\/v1\/N19-1423","article-title":"BERT: Pre-training of deep bidirectional\n                        transformers for language understanding","volume-title":"Proceedings of the 2019 Conference of the North American Chapter of\n                        the Association for Computational Linguistics: Human Language Technologies,\n                        Volume 1 (Long and Short Papers)","author":"Devlin","year":"2019"},{"key":"2024120416102020100_bib16","doi-asserted-by":"publisher","first-page":"457","DOI":"10.1613\/jair.1523","article-title":"LexRank: Graph-based lexical centrality as\n                        salience in text summarization","volume":"22","author":"Erkan","year":"2004","journal-title":"Journal of\n                        Artificial Intelligence Research"},{"key":"2024120416102020100_bib17","doi-asserted-by":"publisher","first-page":"391","DOI":"10.1162\/tacl_a_00373","article-title":"SummEval: Re-evaluating summarization\n                        evaluation","volume":"9","author":"Fabbri","year":"2021","journal-title":"Transactions of the Association for\n                        Computational Linguistics"},{"key":"2024120416102020100_bib18","article-title":"News summarization and evaluation in the\n                        era of GPT-3","author":"Goyal","year":"2022","journal-title":"arXiv\n                    preprint"},{"key":"2024120416102020100_bib19","article-title":"Efficiently modeling long sequences with\n                        structured state spaces","volume-title":"The Tenth International\n                        Conference on Learning Representations, ICLR 2022, Virtual Event, April\n                        25\u201329, 2022","author":"Albert","year":"2022"},{"key":"2024120416102020100_bib20","article-title":"Debertav3: Improving deberta using electra-style pre-training\n                        with gradient-disentangled embedding\n                    sharing","author":"He","year":"2021"},{"key":"2024120416102020100_bib21","article-title":"Improving efficient neural ranking models\n                        with cross-architecture knowledge\n                    distillation","author":"Hofst\u00e4tter","year":"2021"},{"key":"2024120416102020100_bib22","article-title":"Human feedback is not gold\n                        standard","author":"Hosking","year":"2023"},{"key":"2024120416102020100_bib23","doi-asserted-by":"publisher","first-page":"8488","DOI":"10.18653\/v1\/2023.acl-long.473","article-title":"Attributable and scalable opinion\n                        summarization","volume-title":"Proceedings of the 61st Annual\n                        Meeting of the Association for Computational Linguistics (Volume 1: Long\n                        Papers)","author":"Hosking","year":"2023"},{"key":"2024120416102020100_bib24","doi-asserted-by":"publisher","first-page":"168","DOI":"10.1145\/1014052.1014073","article-title":"Mining and summarizing customer reviews","volume-title":"Proceedings of the Tenth ACM SIGKDD International Conference on\n                        Knowledge Discovery and Data Mining","author":"Minqing","year":"2004"},{"issue":"1","key":"2024120416102020100_bib25","doi-asserted-by":"publisher","first-page":"193","DOI":"10.1007\/BF01908075","article-title":"Comparing partitions","volume":"2","author":"Hubert","year":"1985","journal-title":"Journal of Classification"},{"key":"2024120416102020100_bib26","doi-asserted-by":"publisher","first-page":"3885","DOI":"10.18653\/v1\/2021.findings-emnlp.328","article-title":"Convex aggregation for opinion summarization","volume-title":"Findings of the Association for Computational Linguistics: EMNLP\n                        2021","author":"Iso","year":"2021"},{"key":"2024120416102020100_bib27","article-title":"Categorical reparameterization with\n                        Gumbel-softmax","volume-title":"5th International Conference on\n                        Learning Representations, ICLR 2017, Toulon, France, April 24\u201326,\n                        2017, Conference Track Proceedings","author":"Jang","year":"2017"},{"key":"2024120416102020100_bib28","article-title":"Mistral\n                    7b","author":"Jiang","year":"2023"},{"key":"2024120416102020100_bib29","doi-asserted-by":"publisher","first-page":"11","DOI":"10.1108\/eb026526","article-title":"A statistical interpretation of term\n                        specificity and its application in retrieval","volume":"28","author":"Jones","year":"1972","journal-title":"Journal of Documentation"},{"key":"2024120416102020100_bib30","doi-asserted-by":"publisher","first-page":"1818","DOI":"10.18653\/v1\/D18-1208","article-title":"Content selection in deep learning models of\n                        summarization","volume-title":"Proceedings of the 2018 Conference\n                        on Empirical Methods in Natural Language Processing","author":"Kedzie","year":"2018"},{"key":"2024120416102020100_bib31","article-title":"Adam: A method for stochastic optimization","volume-title":"3rd International Conference on Learning Representations, ICLR 2015,\n                        San Diego, CA, USA, May 7\u20139, 2015, Conference Track\n                        Proceedings","author":"Kingma","year":"2015"},{"key":"2024120416102020100_bib32","doi-asserted-by":"publisher","first-page":"163","DOI":"10.1162\/tacl_a_00453","article-title":"SummaC: Re-visiting NLI-based models for\n                        inconsistency detection in summarization","volume":"10","author":"Laban","year":"2022","journal-title":"Transactions of the Association for Computational\n                        Linguistics"},{"key":"2024120416102020100_bib33","article-title":"ALBERT: A lite BERT for self-supervised\n                        learning of language representations","volume-title":"8th\n                        International Conference on Learning Representations, ICLR 2020, Addis\n                        Ababa, Ethiopia, April 26\u201330, 2020","author":"Lan","year":"2020"},{"key":"2024120416102020100_bib34","article-title":"Retrieval-augmented generation for\n                        knowledge-intensive nlp tasks","volume-title":"Proceedings of the\n                        34th International Conference on Neural Information Processing\n                        Systems","author":"Lewis","year":"2020"},{"key":"2024120416102020100_bib35","doi-asserted-by":"publisher","first-page":"131","DOI":"10.1145\/3539618.3591651","article-title":"Constructing tree-based index for efficient and effective\n                        dense retrieval","volume-title":"Proceedings of the 46th\n                        International ACM SIGIR Conference on Research and Development in\n                        Information Retrieval","author":"Li","year":"2023"},{"key":"2024120416102020100_bib36","first-page":"74","article-title":"ROUGE: A package for automatic evaluation of\n                        summaries","volume-title":"Text Summarization Branches\n                        Out","author":"Lin","year":"2004"},{"key":"2024120416102020100_bib37","article-title":"Lost in the middle: How language models use\n                        long contexts","author":"Liu","year":"2023"},{"key":"2024120416102020100_bib38","doi-asserted-by":"publisher","first-page":"5070","DOI":"10.18653\/v1\/P19-1500","article-title":"Hierarchical transformers for\n                        multi-document summarization","volume-title":"Proceedings of the\n                        57th Annual Meeting of the Association for Computational\n                        Linguistics","author":"Liu","year":"2019"},{"key":"2024120416102020100_bib39","doi-asserted-by":"publisher","first-page":"10774","DOI":"10.18653\/v1\/2023.findings-acl.686","article-title":"OpineSum: Entailment-based self-training\n                        for abstractive opinion summarization","volume-title":"Findings\n                        of the Association for Computational Linguistics: ACL 2023","author":"Louis","year":"2023"},{"key":"2024120416102020100_bib40","article-title":"Best worst scaling: A model for largest\n                        difference judgments [working paper]","author":"Louviere","year":"1990","journal-title":"Faculty of\n                        Business"},{"key":"2024120416102020100_bib41","article-title":"The concrete distribution: A continuous relaxation of\n                        discrete random variables","volume-title":"5th International\n                        Conference on Learning Representations, ICLR 2017, Toulon, France, April\n                        24\u201326, 2017, Conference Track Proceedings","author":"Maddison","year":"2017"},{"key":"2024120416102020100_bib42","article-title":"Automatically evaluating opinion prevalence in\n                        opinion summarization","volume-title":"The 6th Workshop on\n                        e-Commerce and NLP (KDD 2023)","author":"Malon","year":"2023"},{"key":"2024120416102020100_bib43","doi-asserted-by":"publisher","first-page":"974","DOI":"10.1162\/tacl_a_00583","article-title":"Conditional generation with a\n                        question-answering blueprint","volume":"11","author":"Narayan","year":"2023","journal-title":"Transactions of the\n                        Association for Computational Linguistics"},{"key":"2024120416102020100_bib44","doi-asserted-by":"publisher","first-page":"7544","DOI":"10.18653\/v1\/2023.emnlp-main.469","article-title":"StrAE: Autoencoding for pre-trained\n                        embeddings using explicit structure","volume-title":"Proceedings\n                        of the 2023 Conference on Empirical Methods in Natural Language\n                        Processing","author":"Opper","year":"2023"},{"key":"2024120416102020100_bib45","doi-asserted-by":"publisher","first-page":"6908","DOI":"10.1609\/aaai.v33i01.33016908","article-title":"Data-to-text generation with content\n                        selection and planning","volume-title":"The Thirty-Third AAAI\n                        Conference on Artificial Intelligence, AAAI 2019, The Thirty-First\n                        Innovative Applications of Artificial Intelligence Conference, IAAI 2019,\n                        The Ninth AAAI Symposium on Educational Advances in Artificial Intelligence,\n                        EAAI 2019, Honolulu, Hawaii, USA, January 27 \u2013 February 1,\n                        2019","author":"Puduppully","year":"2019"},{"issue":"140","key":"2024120416102020100_bib46","first-page":"1","article-title":"Exploring the limits of transfer learning with a unified\n                        text-to-text transformer","volume":"21","author":"Raffel","year":"2020","journal-title":"Journal of Machine\n                        Learning Research"},{"issue":"4","key":"2024120416102020100_bib47","doi-asserted-by":"publisher","first-page":"777","DOI":"10.1162\/coli_a_00486","article-title":"Measuring Attribution in Natural Language\n                        Generation Models","volume":"49","author":"Rashkin","year":"2023","journal-title":"Computational\n                        Linguistics"},{"key":"2024120416102020100_bib48","doi-asserted-by":"publisher","first-page":"3982","DOI":"10.18653\/v1\/D19-1410","article-title":"Sentence-BERT: Sentence embeddings using\n                        Siamese BERT-networks","volume-title":"Proceedings of the 2019\n                        Conference on Empirical Methods in Natural Language Processing and the 9th\n                        International Joint Conference on Natural Language Processing\n                        (EMNLP-IJCNLP)","author":"Reimers","year":"2019"},{"key":"2024120416102020100_bib49","article-title":"Raptor: Recursive abstractive processing\n                        for tree-organized retrieval","volume-title":"International\n                        Conference on Learning Representations (ICLR)","author":"Sarthi","year":"2024"},{"key":"2024120416102020100_bib50","doi-asserted-by":"publisher","first-page":"624","DOI":"10.18653\/v1\/2021.naacl-main.52","article-title":"Get your vitamin C! Robust fact\n                        verification with contrastive evidence","volume-title":"Proceedings of the 2021 Conference of the North American Chapter of\n                        the Association for Computational Linguistics: Human Language\n                        Technologies","author":"Schuster","year":"2021"},{"key":"2024120416102020100_bib51","article-title":"Opinsummeval: Revisiting automated evaluation for opinion\n                        summarization","author":"Shen","year":"2023"},{"key":"2024120416102020100_bib52","article-title":"Continuous relaxation training of discrete latent variable\n                        image models","volume-title":"Beysian DeepLearning workshop,\n                        NIPS","author":"S\u00f8nderby","year":"2017"},{"key":"2024120416102020100_bib53","first-page":"52","article-title":"Red-faced ROUGE: Examining the suitability of ROUGE for\n                        opinion summary evaluation","volume-title":"Proceedings of the\n                        17th Annual Workshop of the Australasian Language Technology\n                        Association","author":"Tay","year":"2019"},{"key":"2024120416102020100_bib54","article-title":"Llama 2: Open foundation and fine-tuned\n                        chat models","author":"Touvron","year":"2023"},{"key":"2024120416102020100_bib55","article-title":"Representation learning with contrastive\n                        predictive coding","volume":"abs\/1807.03748","author":"van den Oord","year":"2018","journal-title":"CoRR"},{"key":"2024120416102020100_bib56","first-page":"5998","article-title":"Attention is all you need","volume-title":"Advances in Neural Information Processing Systems 30: Annual\n                        Conference on Neural Information Processing Systems 2017, December\n                        4\u20139, 2017, Long Beach, CA, USA","author":"Vaswani","year":"2017"},{"key":"2024120416102020100_bib57","article-title":"Order-embeddings of images and\n                        language","volume-title":"4th International Conference on\n                        Learning Representations, ICLR 2016, San Juan, Puerto Rico, May 2\u20134,\n                        2016, Conference Track Proceedings","author":"Vendrov","year":"2016"},{"key":"2024120416102020100_bib58","article-title":"Learning to filter context for retrieval-\n                        augmented generation","author":"Wang","year":"2023"},{"key":"2024120416102020100_bib59","doi-asserted-by":"publisher","first-page":"2660","DOI":"10.18653\/v1\/2022.acl-long.190","article-title":"Generating data to mitigate spurious\n                        correlations in natural language inference datasets","volume-title":"Proceedings of the 60th Annual Meeting of the Association for\n                        Computational Linguistics (Volume 1: Long Papers)","author":"Yuxiang","year":"2022"},{"key":"2024120416102020100_bib60","article-title":"Retrieval meets long context large\n                        language models","author":"Peng","year":"2023"},{"key":"2024120416102020100_bib61","doi-asserted-by":"publisher","first-page":"495","DOI":"10.1109\/TASLP.2021.3129994","article-title":"Soundstream: An end-to-end neural audio\n                        codec","volume":"30","author":"Zeghidour","year":"2022","journal-title":"IEEE\/ACM Transactions on Audio, Speech and\n                        Language Processing"},{"key":"2024120416102020100_bib62","first-page":"1701","article-title":"Fine-grained natural language inference\n                        based faithfulness evaluation for diverse summarisation\n                        tasks","volume-title":"Proceedings of the 18th Conference of the\n                        European Chapter of the Association for Computational Linguistics (Volume 1:\n                        Long Papers)","author":"Zhang","year":"2024"},{"key":"2024120416102020100_bib63","doi-asserted-by":"publisher","first-page":"1066","DOI":"10.1145\/3477495.3532037","article-title":"Personalized abstractive opinion tagging","volume-title":"Proceedings of the 45th International ACM SIGIR Conference on\n                        Research and Development in Information Retrieval","author":"Zhao","year":"2022"}],"container-title":["Transactions of the Association for Computational Linguistics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/direct.mit.edu\/tacl\/article-pdf\/doi\/10.1162\/tacl_a_00703\/2482571\/tacl_a_00703.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/direct.mit.edu\/tacl\/article-pdf\/doi\/10.1162\/tacl_a_00703\/2482571\/tacl_a_00703.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,4]],"date-time":"2024-12-04T16:10:36Z","timestamp":1733328636000},"score":1,"resource":{"primary":{"URL":"https:\/\/direct.mit.edu\/tacl\/article\/doi\/10.1162\/tacl_a_00703\/125483\/Hierarchical-Indexing-for-Retrieval-Augmented"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024]]},"references-count":63,"URL":"https:\/\/doi.org\/10.1162\/tacl_a_00703","relation":{},"ISSN":["2307-387X"],"issn-type":[{"value":"2307-387X","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2024]]},"published":{"date-parts":[[2024]]}}}