{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,18]],"date-time":"2026-01-18T04:06:57Z","timestamp":1768709217855,"version":"3.49.0"},"publisher-location":"New York, NY, USA","reference-count":62,"publisher":"ACM","license":[{"start":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T00:00:00Z","timestamp":1665360000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/100000183","name":"Army Research Office","doi-asserted-by":"publisher","award":["W911NF1910069 and W911NF2110026"],"award-info":[{"award-number":["W911NF1910069 and W911NF2110026"]}],"id":[{"id":"10.13039\/100000183","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2022,10,10]]},"DOI":"10.1145\/3503161.3547843","type":"proceedings-article","created":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T15:42:35Z","timestamp":1665416555000},"page":"591-600","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":3,"title":["Show Me What I Like: Detecting User-Specific Video Highlights Using Content-Based Multi-Head Attention"],"prefix":"10.1145","author":[{"given":"Uttaran","family":"Bhattacharya","sequence":"first","affiliation":[{"name":"University of Maryland, College Park, MD, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gang","family":"Wu","sequence":"additional","affiliation":[{"name":"Adobe Research, San Jose, CA, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Stefano","family":"Petrangeli","sequence":"additional","affiliation":[{"name":"Adobe Research, San Jose, CA, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Viswanathan","family":"Swaminathan","sequence":"additional","affiliation":[{"name":"Adobe Research, San Jose, CA, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dinesh","family":"Manocha","sequence":"additional","affiliation":[{"name":"University of Maryland, College Park, MD, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2022,10,10]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"publisher","DOI":"10.1145\/1345448.1345465"},{"key":"e_1_3_2_2_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00805"},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_12"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00286"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00788"},{"key":"e_1_3_2_2_6_1","volume-title":"Proceedings Ninth IEEE International Conference on Computer Vision. 104--109","volume":"1","author":"Ngo Chong-Wah","year":"2003","unstructured":"Chong-Wah Ngo , Yu-Fei Ma , and Hong-Jiang Zhang . 2003 . Automatic video summarization by graph modeling . In Proceedings Ninth IEEE International Conference on Computer Vision. 104--109 vol. 1 . https:\/\/doi.org\/10.1109\/ICCV.2003.1238320 Chong-Wah Ngo, Yu-Fei Ma, and Hong-Jiang Zhang. 2003. Automatic video summarization by graph modeling. In Proceedings Ninth IEEE International Conference on Computer Vision. 104--109 vol.1. https:\/\/doi.org\/10.1109\/ICCV.2003.1238320"},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298981"},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"publisher","DOI":"10.1145\/2959100.2959190"},{"key":"e_1_3_2_2_9_1","volume-title":"Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies","volume":"1","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2019 . BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding . In Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , Volume 1 (Long and Short Papers). Association for Computational Linguistics, Minneapolis, Minnesota, 4171--4186. https:\/\/doi.org\/10. 18653\/v1\/N19--1423 Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers). Association for Computational Linguistics, Minneapolis, Minnesota, 4171--4186. https:\/\/doi.org\/10.18653\/v1\/N19--1423"},{"key":"e_1_3_2_2_10_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v31i1.11234"},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240599"},{"key":"e_1_3_2_2_12_1","volume-title":"Weinberger (Eds.)","volume":"27","author":"Gong Boqing","year":"2014","unstructured":"Boqing Gong , Wei-Lun Chao , Kristen Grauman , and Fei Sha . 2014 . Diverse Sequential Subset Selection for Supervised Video Summarization. In Advances in Neural Information Processing Systems, Z. Ghahramani, M. Welling, C. Cortes, N. Lawrence, and K. Q . Weinberger (Eds.) , Vol. 27 . Curran Associates, Inc. , 2069--2077. https:\/\/proceedings.neurips.cc\/paper\/2014\/file\/0eec27c419d0fe24e53c90338cdc8bc6-Paper.pdf Boqing Gong, Wei-Lun Chao, Kristen Grauman, and Fei Sha. 2014. Diverse Sequential Subset Selection for Supervised Video Summarization. In Advances in Neural Information Processing Systems, Z. Ghahramani, M. Welling, C. Cortes, N. Lawrence, and K. Q. Weinberger (Eds.), Vol. 27. Curran Associates, Inc., 2069--2077. https:\/\/proceedings.neurips.cc\/paper\/2014\/file\/0eec27c419d0fe24e53c90338cdc8bc6-Paper.pdf"},{"key":"e_1_3_2_2_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2018.8486533"},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10584-0_33"},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298928"},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.114"},{"key":"e_1_3_2_2_17_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2019.2904996"},{"key":"e_1_3_2_2_18_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2018.2815998"},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"publisher","DOI":"10.1142\/S0218001419400019"},{"key":"e_1_3_2_2_20_1","unstructured":"Glenn Jocher Ayush Chaurasia Alex Stoken Jirka Borovec NanoCode012 Yonghye Kwon TaoXie Jiacong Fang imyhxy Kalen Michael Lorna Abhiram V Diego Montes Jebastin Nadar Laughing tkianai yxNONG Piotr Skalski Zhiqiang Wang Adam Hogan Cristi Fati Lorenzo Mammana AlexWang1900 Deep Patel Ding Yiwei Felix You Jan Hajek Laurentiu Diaconu and Mai Thanh Minh. 2022. ultralytics\/yolov5: v6.1 - TensorRT TensorFlow Edge TPU and Open-VINO Export and Inference. https:\/\/doi.org\/10.5281\/zenodo.6222936  Glenn Jocher Ayush Chaurasia Alex Stoken Jirka Borovec NanoCode012 Yonghye Kwon TaoXie Jiacong Fang imyhxy Kalen Michael Lorna Abhiram V Diego Montes Jebastin Nadar Laughing tkianai yxNONG Piotr Skalski Zhiqiang Wang Adam Hogan Cristi Fati Lorenzo Mammana AlexWang1900 Deep Patel Ding Yiwei Felix You Jan Hajek Laurentiu Diaconu and Mai Thanh Minh. 2022. ultralytics\/yolov5: v6.1 - TensorRT TensorFlow Edge TPU and Open-VINO Export and Inference. https:\/\/doi.org\/10.5281\/zenodo.6222936"},{"key":"e_1_3_2_2_21_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-010-0632-x"},{"key":"e_1_3_2_2_22_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.348"},{"key":"e_1_3_2_2_23_1","volume-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","author":"Kim Gunhee","unstructured":"Gunhee Kim , Leonid Sigal , and Eric P. Xing . 2014. Joint Summarization of Largescale Collections of Web Images and Videos for Storyline Reconstruction . In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Gunhee Kim, Leonid Sigal, and Eric P. Xing. 2014. Joint Summarization of Largescale Collections of Web Images and Videos for Storyline Reconstruction. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)."},{"key":"e_1_3_2_2_24_1","volume-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","author":"Kim Gunhee","unstructured":"Gunhee Kim and Eric P. Xing . 2014. Reconstructing Storyline Graphs for Image Recommendation from Web Community Photos . In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Gunhee Kim and Eric P. Xing. 2014. Reconstructing Storyline Graphs for Image Recommendation from Web Community Photos. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)."},{"key":"e_1_3_2_2_25_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2018.2806224"},{"key":"e_1_3_2_2_26_1","volume-title":"Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980","author":"Kingma Diederik P","year":"2014","unstructured":"Diederik P Kingma and Jimmy Ba . 2014 . Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980 (2014). https:\/\/arxiv.org\/pdf\/1412.6980v9.pdf Diederik P Kingma and Jimmy Ba. 2014. Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980 (2014). https:\/\/arxiv.org\/pdf\/1412.6980v9.pdf"},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/MC.2009.263"},{"key":"e_1_3_2_2_28_1","volume-title":"2012 IEEE Conference on Computer Vision and Pattern Recognition. 1346--1353","author":"Lee Y. J.","year":"2012","unstructured":"Y. J. Lee , J. Ghosh , and K. Grauman . 2012. Discovering important people and objects for egocentric video summarization . In 2012 IEEE Conference on Computer Vision and Pattern Recognition. 1346--1353 . https:\/\/doi.org\/10.1109\/CVPR. 2012 .6247820 Y. J. Lee, J. Ghosh, and K. Grauman. 2012. Discovering important people and objects for egocentric video summarization. In 2012 IEEE Conference on Computer Vision and Pattern Recognition. 1346--1353. https:\/\/doi.org\/10.1109\/CVPR.2012.6247820"},{"key":"e_1_3_2_2_29_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298994"},{"key":"e_1_3_2_2_30_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.350"},{"key":"e_1_3_2_2_31_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.318"},{"key":"e_1_3_2_2_32_1","volume-title":"Advances in Information Retrieval, Joemon M","author":"Panagiotakis Costas","unstructured":"Costas Panagiotakis , Harris Papadakis , and Paraskevi Fragopoulou . 2020. Personalized Video Summarization Based Exclusively on User Preferences . In Advances in Information Retrieval, Joemon M . Jose, Emine Yilmaz, Jo\u00e3o Magalh\u00e3es, Pablo Castells, Nicola Ferro, M\u00e1rio J. Silva, and Fl\u00e1vio Martins (Eds.). Springer International Publishing , Cham , 305--311. Costas Panagiotakis, Harris Papadakis, and Paraskevi Fragopoulou. 2020. Personalized Video Summarization Based Exclusively on User Preferences. In Advances in Information Retrieval, Joemon M. Jose, Emine Yilmaz, Jo\u00e3o Magalh\u00e3es, Pablo Castells, Nicola Ferro, M\u00e1rio J. Silva, and Fl\u00e1vio Martins (Eds.). Springer International Publishing, Cham, 305--311."},{"key":"e_1_3_2_2_33_1","volume-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","author":"Panda Rameswar","unstructured":"Rameswar Panda and Amit K . Roy-Chowdhury. 2017. Collaborative Summarization of Topic-Related Videos . In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Rameswar Panda and Amit K. Roy-Chowdhury. 2017. Collaborative Summarization of Topic-Related Videos. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)."},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10599-4_35"},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58589-1_16"},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00809"},{"key":"e_1_3_2_2_37_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01258-8_22"},{"key":"e_1_3_2_2_38_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46484-8_1"},{"key":"e_1_3_2_2_39_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v30i1.10207"},{"key":"e_1_3_2_2_40_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2818328"},{"key":"e_1_3_2_2_41_1","volume-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","author":"Song Yale","year":"2015","unstructured":"Yale Song , Jordi Vallmitjana , Amanda Stent , and Alejandro Jaimes . 2015 . TVSum: Summarizing Web Videos Using Titles . In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Yale Song, Jordi Vallmitjana, Amanda Stent, and Alejandro Jaimes. 2015. TVSum: Summarizing Web Videos Using Titles. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)."},{"key":"e_1_3_2_2_42_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10590-1_51"},{"key":"e_1_3_2_2_43_1","doi-asserted-by":"publisher","DOI":"10.1145\/1198302.1198305"},{"key":"e_1_3_2_2_44_1","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123297"},{"key":"e_1_3_2_2_45_1","volume-title":"Advances in Neural Information Processing Systems 30. Curran Associates","author":"Vaswani Ashish","unstructured":"Ashish Vaswani , Noam Shazeer , Niki Parmar , Jakob Uszkoreit , Llion Jones , Aidan N Gomez , Lukasz Kaiser , and Illia Polosukhin . 2017. Attention is All you Need . In Advances in Neural Information Processing Systems 30. Curran Associates , Inc ., 5998--6008. http:\/\/papers.nips.cc\/paper\/7181-attention-is-all-you-need.pdf Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Lukasz Kaiser, and Illia Polosukhin. 2017. Attention is All you Need. In Advances in Neural Information Processing Systems 30. Curran Associates, Inc., 5998--6008. http:\/\/papers.nips.cc\/paper\/7181-attention-is-all-you-need.pdf"},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"publisher","DOI":"10.1007\/s00521-021-06588-1"},{"key":"e_1_3_2_2_47_1","volume-title":"Garnett (Eds.)","volume":"31","author":"Wei Zijun","year":"2018","unstructured":"Zijun Wei , Boyu Wang , Minh Hoai Nguyen , Jianming Zhang , Zhe Lin , Xiaohui Shen , Radomir Mech , and Dimitris Samaras . 2018 . Sequence-to-Segment Networks for Segment Detection. In Advances in Neural Information Processing Systems, S. Bengio, H. Wallach, H. Larochelle, K. Grauman, N. Cesa-Bianchi, and R . Garnett (Eds.) , Vol. 31 . Curran Associates, Inc., 3507--3516. https:\/\/proceedings.neurips.cc\/paper\/ 2018\/file\/59e0b2658e9f2e77f8d4d83f8d07ca84-Paper.pdf Zijun Wei, Boyu Wang, Minh Hoai Nguyen, Jianming Zhang, Zhe Lin, Xiaohui Shen, Radomir Mech, and Dimitris Samaras. 2018. Sequence-to-Segment Networks for Segment Detection. In Advances in Neural Information Processing Systems, S. Bengio, H. Wallach, H. Larochelle, K. Grauman, N. Cesa-Bianchi, and R. Garnett (Eds.), Vol. 31. Curran Associates, Inc., 3507--3516. https:\/\/proceedings.neurips.cc\/paper\/2018\/file\/59e0b2658e9f2e77f8d4d83f8d07ca84-Paper.pdf"},{"key":"e_1_3_2_2_48_1","unstructured":"Yuxin Wu Alexander Kirillov Francisco Massa Wan-Yen Lo and Ross Girshick. 2019. Detectron2. https:\/\/github.com\/facebookresearch\/detectron2.  Yuxin Wu Alexander Kirillov Francisco Massa Wan-Yen Lo and Ross Girshick. 2019. Detectron2. https:\/\/github.com\/facebookresearch\/detectron2."},{"key":"e_1_3_2_2_49_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00135"},{"key":"e_1_3_2_2_50_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.514"},{"key":"e_1_3_2_2_51_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298836"},{"key":"e_1_3_2_2_52_1","doi-asserted-by":"publisher","DOI":"10.1145\/957013.957146"},{"key":"e_1_3_2_2_53_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.526"},{"key":"e_1_3_2_2_54_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.112"},{"key":"e_1_3_2_2_55_1","doi-asserted-by":"publisher","DOI":"10.1006\/cviu.1997.0628"},{"key":"e_1_3_2_2_56_1","unstructured":"Youngjae Yu Sangho Lee Joonil Na Jaeyun Kang and Gunhee Kim. 2018. A Deep Ranking Model for Spatio-Temporal Highlight Detection from a 360 Video. (2018) 7525--7533.  Youngjae Yu Sangho Lee Joonil Na Jaeyun Kang and Gunhee Kim. 2018. A Deep Ranking Model for Spatio-Temporal Highlight Detection from a 360 Video. (2018) 7525--7533."},{"key":"e_1_3_2_2_57_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00644"},{"key":"e_1_3_2_2_58_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46478-7_47"},{"key":"e_1_3_2_2_59_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01237-3_24"},{"key":"e_1_3_2_2_60_1","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123328"},{"key":"e_1_3_2_2_61_1","volume-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","author":"Zhao Bin","unstructured":"Bin Zhao and Eric P. Xing . 2014. Quasi Real-Time Summarization for Consumer Videos . In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Bin Zhao and Eric P. Xing. 2014. Quasi Real-Time Summarization for Consumer Videos. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)."},{"key":"e_1_3_2_2_62_1","unstructured":"Kaiyang Zhou Yu Qiao and Tao Xiang. 2018. Deep Reinforcement Learning for Unsupervised Video Summarization with Diversity-Representativeness Reward. (2018) 7582--7589.  Kaiyang Zhou Yu Qiao and Tao Xiang. 2018. Deep Reinforcement Learning for Unsupervised Video Summarization with Diversity-Representativeness Reward. (2018) 7582--7589."}],"event":{"name":"MM '22: The 30th ACM International Conference on Multimedia","location":"Lisboa Portugal","acronym":"MM '22","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 30th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3547843","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3503161.3547843","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3503161.3547843","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T19:02:35Z","timestamp":1750186955000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3547843"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,10,10]]},"references-count":62,"alternative-id":["10.1145\/3503161.3547843","10.1145\/3503161"],"URL":"https:\/\/doi.org\/10.1145\/3503161.3547843","relation":{},"subject":[],"published":{"date-parts":[[2022,10,10]]},"assertion":[{"value":"2022-10-10","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}