{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,17]],"date-time":"2026-06-17T06:56:09Z","timestamp":1781679369979,"version":"3.54.5"},"reference-count":37,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/100005156","name":"Alexander von Humboldt-Stiftung","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100005156","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100005711","name":"Universit\u00e4t Hamburg","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100005711","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neurocomputing"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.neucom.2026.133994","type":"journal-article","created":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T23:21:04Z","timestamp":1779232864000},"page":"133994","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Few-shot video summarization via cross-video temporal invariance"],"prefix":"10.1016","volume":"695","author":[{"given":"Tinglong","family":"Tang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Fanyuan","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shengyong","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xu","family":"Cheng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.neucom.2026.133994_bib0005","doi-asserted-by":"crossref","first-page":"3013","DOI":"10.1109\/TIP.2023.3275069","article-title":"Video summarization with spatiotemporal vision transformer","volume":"32","author":"Hsu","year":"2023","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.neucom.2026.133994_bib0010","series-title":"Proceedings 1998 International Conference on Image Processing. ICIP98 (Cat. No. 98cb36269)","first-page":"866","article-title":"Adaptive key frame extraction using unsupervised clustering","volume":"vol. 1","author":"Zhuang","year":"1998"},{"issue":"1","key":"10.1016\/j.neucom.2026.133994_bib0015","doi-asserted-by":"crossref","first-page":"66","DOI":"10.1109\/TMM.2011.2166951","article-title":"Towards scalable summarization of consumer videos via sparse dictionary selection","volume":"14","author":"Cong","year":"2011","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.neucom.2026.133994_bib0020","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"18847","article-title":"CSTA: CNN-based spatiotemporal attention for video summarization","author":"Son","year":"2024"},{"key":"10.1016\/j.neucom.2026.133994_bib0025","series-title":"Proceedings of the 28th ACM International Conference on Multimedia","first-page":"4023","article-title":"Query twice: dual mixture attention meta learning for video summarization","author":"Wang","year":"2020"},{"issue":"7","key":"10.1016\/j.neucom.2026.133994_bib0030","doi-asserted-by":"crossref","first-page":"5778","DOI":"10.1109\/TIE.2019.2931283","article-title":"Meta learning for task-driven video summarization","volume":"67","author":"Li","year":"2019","journal-title":"IEEE Trans. Ind. Electron."},{"key":"10.1016\/j.neucom.2026.133994_bib0035","doi-asserted-by":"crossref","DOI":"10.1016\/j.engappai.2024.109883","article-title":"Spatial\u2013temporal multi-scale interaction for few-shot video summarization","volume":"142","author":"Li","year":"2025","journal-title":"Eng. Appl. Artif. Intell."},{"key":"10.1016\/j.neucom.2026.133994_bib0040","series-title":"European Conference on Computer Vision","first-page":"505","article-title":"Creating summaries from user videos","author":"Gygli","year":"2014"},{"key":"10.1016\/j.neucom.2026.133994_bib0045","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"5179","article-title":"TVSum: summarizing web videos using titles","author":"Song","year":"2015"},{"key":"10.1016\/j.neucom.2026.133994_bib0050","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"10618","article-title":"Few-shot video classification via temporal alignment","author":"Cao","year":"2020"},{"key":"10.1016\/j.neucom.2026.133994_bib0055","doi-asserted-by":"crossref","DOI":"10.1016\/j.imavis.2024.105159","article-title":"FTAN: frame-to-frame temporal alignment network with contrastive learning for few-shot action recognition","volume":"149","author":"Yu","year":"2024","journal-title":"Image Vis. Comput."},{"key":"10.1016\/j.neucom.2026.133994_bib0060","doi-asserted-by":"crossref","DOI":"10.1016\/j.cviu.2025.104341","article-title":"Adversarial style mixup and improved temporal alignment for cross-domain few-shot action recognition","volume":"255","author":"Cao","year":"2025","journal-title":"Comput. Vis. Image Underst."},{"key":"10.1016\/j.neucom.2026.133994_bib0065","doi-asserted-by":"crossref","DOI":"10.1016\/j.ins.2023.119618","article-title":"Multi-level alignment for few-shot temporal action localization","volume":"650","author":"Keisham","year":"2023","journal-title":"Inf. Sci."},{"key":"10.1016\/j.neucom.2026.133994_bib0070","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","article-title":"Deep reinforcement learning for unsupervised video summarization with diversity-representativeness reward","volume":"vol. 32","author":"Zhou","year":"2018"},{"key":"10.1016\/j.neucom.2026.133994_bib0075","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"202","article-title":"Unsupervised video summarization with adversarial LSTM networks","author":"Mahasseni","year":"2017"},{"key":"10.1016\/j.neucom.2026.133994_bib0080","series-title":"International Conference on Multimedia Modeling","first-page":"492","article-title":"Unsupervised video summarization via attention-driven adversarial learning","author":"Apostolidis","year":"2019"},{"issue":"8","key":"10.1016\/j.neucom.2026.133994_bib0085","doi-asserted-by":"crossref","first-page":"3278","DOI":"10.1109\/TCSVT.2020.3037883","article-title":"AC-SUM-GAN: connecting actor-critic and generative adversarial networks for unsupervised video summarization","volume":"31","author":"Apostolidis","year":"2020","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.neucom.2026.133994_bib0090","series-title":"Proceedings of the 25th ACM International Conference on Multimedia","first-page":"863","article-title":"Hierarchical recurrent neural network for video summarization","author":"Zhao","year":"2017"},{"key":"10.1016\/j.neucom.2026.133994_bib0095","series-title":"Asian Conference on Computer Vision","first-page":"39","article-title":"Summarizing videos with attention","author":"Fajtl","year":"2018"},{"key":"10.1016\/j.neucom.2026.133994_bib0100","doi-asserted-by":"crossref","first-page":"948","DOI":"10.1109\/TIP.2020.3039886","article-title":"DSNet: a flexible detect-to-summarize network for video summarization","volume":"30","author":"Zhu","year":"2020","journal-title":"IEEE Trans. Image Process."},{"issue":"1","key":"10.1016\/j.neucom.2026.133994_bib0105","doi-asserted-by":"crossref","first-page":"77","DOI":"10.1109\/TII.2019.2929228","article-title":"Cloud-assisted multiview video summarization using CNN and bidirectional LSTM","volume":"16","author":"Hussain","year":"2019","journal-title":"IEEE Trans. Ind. Inform."},{"key":"10.1016\/j.neucom.2026.133994_bib0110","doi-asserted-by":"crossref","first-page":"19","DOI":"10.1016\/j.patrec.2020.12.016","article-title":"Self-attention binary neural tree for video summarization","volume":"143","author":"Fu","year":"2021","journal-title":"Pattern Recognit. Lett."},{"key":"10.1016\/j.neucom.2026.133994_bib0115","series-title":"2021 IEEE International Symposium on Multimedia (ISM)","first-page":"226","article-title":"Combining global and local attention with positional encoding for video summarization","author":"Apostolidis","year":"2021"},{"key":"10.1016\/j.neucom.2026.133994_bib0120","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2024.123568","article-title":"Attention-guided multi-granularity fusion model for video summarization","volume":"249","author":"Zhang","year":"2024","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.neucom.2026.133994_bib0125","series-title":"European Conference on Computer Vision","first-page":"540","article-title":"Category-specific video summarization","author":"Potapov","year":"2014"},{"key":"10.1016\/j.neucom.2026.133994_bib0130","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"14867","article-title":"Align and attend: multimodal summarization with dual contrastive losses","author":"He","year":"2023"},{"key":"10.1016\/j.neucom.2026.133994_bib0135","article-title":"Multimodal video summarization based on graph contrastive learning with fine-grained graph interaction","author":"Wu","year":"2025","journal-title":"Signal Process."},{"key":"10.1016\/j.neucom.2026.133994_bib0140","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"2980","article-title":"Focal loss for dense object detection","author":"Lin","year":"2017"},{"key":"10.1016\/j.neucom.2026.133994_bib0145","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"7596","article-title":"Rethinking the evaluation of video summaries","author":"Otani","year":"2019"},{"key":"10.1016\/j.neucom.2026.133994_bib0150","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"3143","article-title":"Multi-annotation attention model for video summarization","author":"Terbouche","year":"2023"},{"issue":"3","key":"10.1016\/j.neucom.2026.133994_bib0155","doi-asserted-by":"crossref","first-page":"239","DOI":"10.1093\/biomet\/33.3.239","article-title":"The treatment of ties in ranking problems","volume":"33","author":"Kendall","year":"1945","journal-title":"Biometrika"},{"key":"10.1016\/j.neucom.2026.133994_bib0160","series-title":"CRC Standard Probability and Statistics Tables and Formulae","author":"Zwillinger","year":"1999"},{"key":"10.1016\/j.neucom.2026.133994_bib0165","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"1","article-title":"Going deeper with convolutions","author":"Szegedy","year":"2015"},{"key":"10.1016\/j.neucom.2026.133994_bib0170","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2025.127360","article-title":"GenSumNet: a genre-specific and context-aware video summarization framework with adaptive thresholding and hybrid temporal modeling","volume":"279","author":"Gupta","year":"2025","journal-title":"Expert Syst. Appl."},{"issue":"3","key":"10.1016\/j.neucom.2026.133994_bib0175","first-page":"3904","article-title":"Video joint modelling based on hierarchical transformer for co-summarization","volume":"45","author":"Li","year":"2022","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.neucom.2026.133994_bib0180","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2022.108840","article-title":"Video summarization with a convolutional attentive adversarial network","volume":"131","author":"Liang","year":"2022","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.neucom.2026.133994_bib0185","doi-asserted-by":"crossref","first-page":"360","DOI":"10.1016\/j.neucom.2021.10.039","article-title":"Hierarchical multimodal transformer to summarize videos","volume":"468","author":"Zhao","year":"2022","journal-title":"Neurocomputing"}],"container-title":["Neurocomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226013925?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226013925?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,17]],"date-time":"2026-06-17T06:32:46Z","timestamp":1781677966000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0925231226013925"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":37,"alternative-id":["S0925231226013925"],"URL":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133994","relation":{},"ISSN":["0925-2312"],"issn-type":[{"value":"0925-2312","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Few-shot video summarization via cross-video temporal invariance","name":"articletitle","label":"Article Title"},{"value":"Neurocomputing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133994","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"133994"}}