{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,23]],"date-time":"2026-07-23T05:02:48Z","timestamp":1784782968140,"version":"3.55.0"},"reference-count":35,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T00:00:00Z","timestamp":1780963200000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Future Generation Computer Systems"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.future.2026.108648","type":"journal-article","created":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T15:42:22Z","timestamp":1781019742000},"page":"108648","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Speaker-attributed meeting transcription refinement with constrained open-weight language models"],"prefix":"10.1016","volume":"185","author":[{"given":"Costin-Alexandru","family":"Deonise","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Taisia-Maria","family":"Coconu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Muhammad Khurram Zahur","family":"Bajwa","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Catalin","family":"Negru","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bodgan-Costel","family":"Mocanu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Aniello","family":"Castiglione","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Florin","family":"Pop","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.future.2026.108648_b1","doi-asserted-by":"crossref","DOI":"10.1016\/j.csl.2021.101317","article-title":"A review of speaker diarization: Recent advances with deep learning","volume":"72","author":"Park","year":"2022","journal-title":"Comput. Speech Lang."},{"key":"10.1016\/j.future.2026.108648_b2","unstructured":"C. Zhang, Q. Wang, Speaker diarization: A journey from unsupervised to supervised approaches, in: Odyssey: The Speaker and Language Recognition Workshop, 2022, p. 5."},{"key":"10.1016\/j.future.2026.108648_b3","series-title":"2025 25th International Conference on Control Systems and Computer Science","first-page":"412","article-title":"Near real-time deepfake audio detection based on speaker diarization techniques","author":"Bajwa","year":"2025"},{"key":"10.1016\/j.future.2026.108648_b4","doi-asserted-by":"crossref","DOI":"10.1016\/j.specom.2025.103224","article-title":"LLM-based speaker diarization correction: A generalizable approach","volume":"170","author":"Efstathiadis","year":"2025","journal-title":"Speech Commun."},{"key":"10.1016\/j.future.2026.108648_b5","series-title":"Advanced Information Networking and Applications","first-page":"407","article-title":"Mel spectrogram-based CNN framework for explainable audio deepfake detection","author":"Bajwa","year":"2025"},{"key":"10.1016\/j.future.2026.108648_b6","doi-asserted-by":"crossref","first-page":"18","DOI":"10.25080\/Majora-7b98e3ed-003","article-title":"Librosa: Audio and music signal analysis in python","volume":"2015","author":"McFee","year":"2015","journal-title":"SciPy"},{"key":"10.1016\/j.future.2026.108648_b7","doi-asserted-by":"crossref","unstructured":"S.W. Chin, K.P. Seng, L.M. Ang, K.H. Lim, Improved voice activity detection for speech recognition system, in: 2010 International Computer Symposium, ICS2010, Tainan, Taiwan, 2010, pp. 518\u2013523.","DOI":"10.1109\/COMPSYM.2010.5685456"},{"key":"10.1016\/j.future.2026.108648_b8","series-title":"2023 22nd RoEduNet Conference: Networking in Education and Research","first-page":"1","article-title":"Improved speech activity detection model using convolutional neural networks","author":"Deonise","year":"2023"},{"key":"10.1016\/j.future.2026.108648_b9","series-title":"Information and Communication Technology for Competitive Strategies (ICTCS 2020) Intelligent Strategies for ICT","first-page":"457","article-title":"Recent developments, challenges, and future scope of voice activity detection schemes\u2014a review","author":"Sharma","year":"2021"},{"key":"10.1016\/j.future.2026.108648_b10","unstructured":"W. Kraaij, T. Hain, M. Lincoln, W. Post, The AMI meeting corpus, in: Proc. International Conference on Methods and Techniques in Behavioral Research, 2005, pp. 1\u20134."},{"key":"10.1016\/j.future.2026.108648_b11","doi-asserted-by":"crossref","unstructured":"S. S, D. Jayaram, V.R. Ajith, J. Jacob Mathew, R. Rajan, Speaker Diarization Using X-vectors-DNN Framework, in: 2023 IEEE 20th India Council International Conference, INDICON, 2023, pp. 317\u2013321.","DOI":"10.1109\/INDICON59947.2023.10440830"},{"key":"10.1016\/j.future.2026.108648_b12","doi-asserted-by":"crossref","unstructured":"A. Ayasi, J. Joshy, R. Rajan, Speaker Diarization Using BiLSTM and BiGRU with Self-Attention, in: 2022 Second International Conference on Next Generation Intelligent Systems, ICNGIS, 2022, pp. 1\u20135.","DOI":"10.1109\/ICNGIS54955.2022.10079831"},{"key":"10.1016\/j.future.2026.108648_b13","series-title":"Joint speech recognition and speaker diarization via sequence transduction","author":"Shafey","year":"2019"},{"key":"10.1016\/j.future.2026.108648_b14","doi-asserted-by":"crossref","unstructured":"T. Von Neumann, C. Boeddeker, T. Cord-Landwehr, M. Delcroix, R. Haeb-Umbach, Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization, in: 2024 IEEE International Conference on Acoustics, Speech, and Signal Processing Workshops, ICASSPW, 2024, pp. 775\u2013779.","DOI":"10.1109\/ICASSPW62465.2024.10625894"},{"key":"10.1016\/j.future.2026.108648_b15","doi-asserted-by":"crossref","DOI":"10.1016\/j.specom.2024.103081","article-title":"End-to-end integration of speech separation and voice activity detection for low-latency diarization of telephone conversations","volume":"161","author":"Morrone","year":"2024","journal-title":"Speech Commun."},{"key":"10.1016\/j.future.2026.108648_b16","doi-asserted-by":"crossref","DOI":"10.1016\/j.csl.2025.101841","article-title":"DiCoW: Diarization-conditioned whisper for target speaker automatic speech recognition","volume":"95","author":"Polok","year":"2026","journal-title":"Comput. Speech Lang."},{"issue":"1","key":"10.1016\/j.future.2026.108648_b17","doi-asserted-by":"crossref","first-page":"74","DOI":"10.1109\/TE.2023.3321155","article-title":"Analysis of oral exams with speaker diarization and speech emotion recognition: A case study","volume":"67","author":"Beccaro","year":"2024","journal-title":"IEEE Trans. Educ."},{"issue":"1","key":"10.1016\/j.future.2026.108648_b18","doi-asserted-by":"crossref","first-page":"146","DOI":"10.1007\/s44217-025-00568-6","article-title":"T3 Talk2Text - a model for near real-time voice transcription in virtual group meetings","volume":"4","author":"Kasakowskij","year":"2025","journal-title":"Discov. Educ."},{"key":"10.1016\/j.future.2026.108648_b19","series-title":"Picovoice\/porcupine: On-device wake word detection powered by deep learning","author":"Picovoice","year":"2018"},{"issue":"8","key":"10.1016\/j.future.2026.108648_b20","doi-asserted-by":"crossref","DOI":"10.1145\/3453182","article-title":"WebRTC: real-time communication for the open web platform","volume":"64","author":"Blum","year":"2021","journal-title":"Commun. ACM"},{"key":"10.1016\/j.future.2026.108648_b21","series-title":"Music Information Retrieval Evaluation Exchange","article-title":"Ina\u2019s mirex 2018 music and speech detection system","author":"Doukhan","year":"2018"},{"key":"10.1016\/j.future.2026.108648_b22","series-title":"Calm-whisper: Reduce whisper hallucination on non-speech by calming crazy heads down","author":"Wang","year":"2025"},{"key":"10.1016\/j.future.2026.108648_b23","unstructured":"S. Hernawan, Speaker diarization: Its developments, applications, and challenges, in: Proceedings Intl Conf Information System Business Competitiveness, 2012, pp. 255\u2013259."},{"key":"10.1016\/j.future.2026.108648_b24","series-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"1","article-title":"Told: A novel two-stage overlap-aware framework for speaker diarization","author":"Wang","year":"2023"},{"key":"10.1016\/j.future.2026.108648_b25","series-title":"TOLD: A novel two-stage overlap-aware framework for speaker diarization","author":"Wang","year":"2023"},{"key":"10.1016\/j.future.2026.108648_b26","doi-asserted-by":"crossref","first-page":"1493","DOI":"10.1109\/TASLP.2022.3162080","article-title":"Encoder-decoder based attractors for end-to-end neural diarization","volume":"30","author":"Horiguchi","year":"2022","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"10.1016\/j.future.2026.108648_b27","series-title":"SpeechBrain: A general-purpose speech toolkit","author":"Ravanelli","year":"2021"},{"key":"10.1016\/j.future.2026.108648_b28","series-title":"Powerset multi-class cross entropy loss for neural speaker diarization","author":"Plaquet","year":"2023"},{"key":"10.1016\/j.future.2026.108648_b29","series-title":"Qwen2. 5-coder technical report","author":"Hui","year":"2024"},{"key":"10.1016\/j.future.2026.108648_b30","series-title":"ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"7124","article-title":"Pyannote. audio: neural building blocks for speaker diarization","author":"Bredin","year":"2020"},{"key":"10.1016\/j.future.2026.108648_b31","series-title":"Robust speech recognition via large-scale weak supervision","author":"Radford","year":"2022"},{"key":"10.1016\/j.future.2026.108648_b32","series-title":"Learn Openai Whisper: Transform Your Understanding of Genai Through Robust and Accurate Speech Processing Solutions","author":"Batista","year":"2024"},{"key":"10.1016\/j.future.2026.108648_b33","series-title":"ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"1","article-title":"Data efficient child-adult speaker diarization with simulated conversations","author":"Xu","year":"2025"},{"key":"10.1016\/j.future.2026.108648_b34","doi-asserted-by":"crossref","unstructured":"L.E. Shafey, H. Soltau, I. Shafran, Joint speech recognition and speaker diarization via sequence transduction, in: Proc. Interspeech, 2019, pp. 396\u2013400.","DOI":"10.21437\/Interspeech.2019-1943"},{"key":"10.1016\/j.future.2026.108648_b35","series-title":"CHiME-6 challenge: Tackling multispeaker speech recognition for unsegmented recordings","author":"Watanabe","year":"2020"}],"container-title":["Future Generation Computer Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0167739X26002827?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0167739X26002827?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,23]],"date-time":"2026-07-23T04:22:32Z","timestamp":1784780552000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0167739X26002827"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":35,"alternative-id":["S0167739X26002827"],"URL":"https:\/\/doi.org\/10.1016\/j.future.2026.108648","relation":{},"ISSN":["0167-739X"],"issn-type":[{"value":"0167-739X","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Speaker-attributed meeting transcription refinement with constrained open-weight language models","name":"articletitle","label":"Article Title"},{"value":"Future Generation Computer Systems","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.future.2026.108648","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"108648"}}