{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,16]],"date-time":"2026-04-16T16:37:26Z","timestamp":1776357446759,"version":"3.51.2"},"publisher-location":"New York, NY, USA","reference-count":22,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,4,4]]},"DOI":"10.1145\/3798065.3798069","type":"proceedings-article","created":{"date-parts":[[2026,4,8]],"date-time":"2026-04-08T19:30:21Z","timestamp":1775676621000},"page":"22-28","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Pipelining Network and Compute for Real-Time LLM Serving"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-4773-7233","authenticated-orcid":false,"given":"Aman","family":"Sahu","sequence":"first","affiliation":[{"name":"Concordia University, Montreal, Quebec, Canada"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-6937-9373","authenticated-orcid":false,"given":"Abdechakour","family":"Mechri","sequence":"additional","affiliation":[{"name":"Concordia University, Montreal, Quebec, Canada"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5382-6530","authenticated-orcid":false,"given":"Abdelhak","family":"Bentaleb","sequence":"additional","affiliation":[{"name":"Concordia University, Montreal, Quebec, Canada"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2026,4,8]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Sarathi: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills. arXiv preprint arXiv:2308.16369","author":"Agrawal Amey","year":"2023","unstructured":"Amey Agrawal, Ashish Panwar, Jayashree Mohan, Nipun Kwatra, Bhargav S Gulavani, and Ramachandran Ramjee. 2023. Sarathi: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills. arXiv preprint arXiv:2308.16369 (2023)."},{"key":"e_1_3_2_1_2_1","volume-title":"Flamingo: A Visual Language Model for Few-Shot Learning. Advances in neural information processing systems 35","author":"Alayrac Jean-Baptiste","year":"2022","unstructured":"Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katherine Millican, Malcolm Reynolds, et al. 2022. Flamingo: A Visual Language Model for Few-Shot Learning. Advances in neural information processing systems 35 (2022), 23716\u201323736."},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"crossref","unstructured":"Harald Alvestrand. 2021. Rfc 8825: Overview: Real-time protocols for browser-based applications. (2021).","DOI":"10.17487\/RFC8825"},{"key":"e_1_3_2_1_4_1","volume-title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens. arXiv preprint arXiv:2404.03413","author":"Ataallah Kirolos","year":"2024","unstructured":"Kirolos Ataallah, Xiaoqian Shen, Eslam Abdelrahman, Essam Sleiman, Deyao Zhu, Jian Ding, and Mohamed Elhoseiny. 2024. Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens. arXiv preprint arXiv:2404.03413 (2024)."},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01742"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2019.2921977"},{"key":"e_1_3_2_1_7_1","volume-title":"Diego de Las Casas, Florian Bressand, Gianna Lengyel, Guillaume Lample, Lucile Saulnier, et al.","author":"Jiang Albert Q","year":"2023","unstructured":"Albert Q Jiang, Alexandre Sablayrolles, Arthur Mensch, Chris Bamford, Devendra Singh Chaplot, Diego de Las Casas, Florian Bressand, Gianna Lengyel, Guillaume Lample, Lucile Saulnier, et al. 2023. Mistral 7B. arXiv preprint arXiv:2310.06825 (2023). https:\/\/arxiv.org\/abs\/2310.06825"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"e_1_3_2_1_9_1","volume-title":"LLaVA-OneVision: Easy Visual Task Transfer. arXiv preprint arXiv:2408.03326","author":"Li Bo","year":"2024","unstructured":"Bo Li, Yuanhan Zhang, Dong Guo, Renrui Zhang, Feng Li, Hao Zhang, Kaichen Zhang, Peiyuan Zhang, Yanwei Li, Ziwei Liu, and Chunyuan Li. 2024. LLaVA-OneVision: Easy Visual Task Transfer. arXiv preprint arXiv:2408.03326 (2024). https:\/\/arxiv.org\/abs\/2408.03326"},{"key":"e_1_3_2_1_10_1","volume-title":"A Survey on Long Video Generation: Challenges, Methods, and Prospects. arXiv preprint arXiv:2403.16407","author":"Li Chengxuan","year":"2024","unstructured":"Chengxuan Li, Di Huang, Zeyu Lu, Yang Xiao, Qingqi Pei, and Lei Bai. 2024. A Survey on Long Video Generation: Challenges, Methods, and Prospects. arXiv preprint arXiv:2403.16407 (2024)."},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2506.19030"},{"key":"e_1_3_2_1_12_1","volume-title":"CritiPrefill: A Segment-wise Criticality-based Approach for Prefilling Acceleration in LLMs. arXiv preprint arXiv:2409.12490","author":"Lv Junlin","year":"2024","unstructured":"Junlin Lv, Yuan Feng, Xike Xie, Xin Jia, Qirong Peng, and Guiming Xie. 2024. CritiPrefill: A Segment-wise Criticality-based Approach for Prefilling Acceleration in LLMs. arXiv preprint arXiv:2409.12490 (2024)."},{"key":"e_1_3_2_1_13_1","volume-title":"Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving. arXiv preprint arXiv:2409.11182","author":"Ma Yunsheng","year":"2024","unstructured":"Yunsheng Ma, Amr Abdelraouf, Rohit Gupta, Ziran Wang, and Kyungtae Han. 2024. Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving. arXiv preprint arXiv:2409.11182 (2024)."},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1145\/3452296.3472923"},{"key":"e_1_3_2_1_15_1","volume-title":"Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. URL https:\/\/arxiv.org\/abs\/2407.00079","author":"Qin Ruoyu","year":"2024","unstructured":"Ruoyu Qin, Zheming Li, Weiran He, Mingxing Zhang, Yongwei Wu, Weimin Zheng, and Xinran Xu. 2024. Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. URL https:\/\/arxiv.org\/abs\/2407.00079 (2024)."},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01357"},{"key":"e_1_3_2_1_17_1","volume-title":"Writing in the Margins: Better Inference Pattern for Long Context Retrieval. arXiv preprint arXiv:2408.14906","author":"Russak Melisa","year":"2024","unstructured":"Melisa Russak, Umar Jamil, Christopher Bryant, Kiran Kamble, Axel Magnuson, Mateusz Russak, and Waseem AlShikh. 2024. Writing in the Margins: Better Inference Pattern for Long Context Retrieval. arXiv preprint arXiv:2408.14906 (2024). https:\/\/arxiv.org\/abs\/2408.14906"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2411.12469"},{"key":"e_1_3_2_1_19_1","unstructured":"Hugo Touvron Louis Martin Kevin R Stone Peter Albert Amjad Almahairi Yasmine Babaei Nikolay Bashlykov Soumya Batra Prajjwal Bhargava Shruti Bhosale et al. 2023. Llama 2: Open Foundation and Fine-Tuned Chat Models. arXiv preprint arXiv:2307.09288 (2023). https:\/\/arxiv.org\/abs\/2307.09288"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1109\/LCOMM.2016.2601087"},{"key":"e_1_3_2_1_21_1","unstructured":"Pan Zhang Xiaoyi Dong Yuhang Cao Yuhang Zang Rui Qian Xilin Wei Lin Chen Yifei Li Junbo Niu Shuangrui Ding et al. 2024. InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions. arXiv preprint arXiv:2412.09596 (2024)."},{"key":"e_1_3_2_1_22_1","volume-title":"BERTScore: Evaluating Text Generation with BERT CoRR","author":"Zhang Tianyi","year":"2020","unstructured":"Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, and Yoav Artzi. 2020. BERTScore: Evaluating Text Generation with BERT CoRR (2020). arXiv:1904.09675 [cs.CL] https:\/\/arxiv.org\/abs\/1904.09675"}],"event":{"name":"NOSSDAV '26: ACM Multimedia Systems Conference 2026","location":"Hong Kong Hong Kong","acronym":"NOSSDAV '26","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 36th Workshop on Network and Operating System Support for Digital Audio and Video"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3798065.3798069","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,16]],"date-time":"2026-04-16T15:33:22Z","timestamp":1776353602000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3798065.3798069"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,4]]},"references-count":22,"alternative-id":["10.1145\/3798065.3798069","10.1145\/3798065"],"URL":"https:\/\/doi.org\/10.1145\/3798065.3798069","relation":{},"subject":[],"published":{"date-parts":[[2026,4,4]]},"assertion":[{"value":"2026-04-08","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}