{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,8]],"date-time":"2026-07-08T20:38:32Z","timestamp":1783543112710,"version":"3.55.0"},"reference-count":61,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2022,12,4]],"date-time":"2022-12-04T00:00:00Z","timestamp":1670112000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2022,12,4]],"date-time":"2022-12-04T00:00:00Z","timestamp":1670112000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["61971016"],"award-info":[{"award-number":["61971016"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["61531006"],"award-info":[{"award-number":["61531006"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Beijing Municipal Education Commission Cooperation Beijing Natural Science Foundation","award":["KZ201910005007"],"award-info":[{"award-number":["KZ201910005007"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2023,6]]},"DOI":"10.1007\/s00530-022-01031-4","type":"journal-article","created":{"date-parts":[[2022,12,4]],"date-time":"2022-12-04T17:02:36Z","timestamp":1670173356000},"page":"981-1000","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":8,"title":["Short video fingerprint extraction: from audio\u2013visual fingerprint fusion to multi-index hashing"],"prefix":"10.1007","volume":"29","author":[{"given":"Shuying","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jing","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yizhou","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Li","family":"Zhuo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2022,12,4]]},"reference":[{"key":"1031_CR1","unstructured":"The 49th Statistical Report on Internet Development in China. http:\/\/www.cnnic.cn\/hlwfzyj\/hlwxzbg\/hlwtjbg\/202202\/P020220407403488048001.pdf"},{"issue":"4","key":"1031_CR2","doi-asserted-by":"publisher","first-page":"785","DOI":"10.1109\/TMM.2016.2629758","volume":"19","author":"X Nie","year":"2017","unstructured":"Nie, X., Yin, Y., Sun, J., Li, J., Cui, C.: Comprehensive feature-based robust video fingerprinting using tensor model. IEEE Trans. Multimed. 19(4), 785\u2013796 (2017)","journal-title":"IEEE Trans. Multimed."},{"issue":"11","key":"1031_CR3","doi-asserted-by":"publisher","first-page":"8287","DOI":"10.1007\/s11042-019-08412-4","volume":"79","author":"A Wary","year":"2020","unstructured":"Wary, A., Neelima, A.: Ring decomposition based video copy detection using global ordinal measure features and local features. Multimed. Tools Appl. 79(11), 8287\u20138323 (2020)","journal-title":"Multimed. Tools Appl."},{"issue":"8","key":"1031_CR4","doi-asserted-by":"publisher","first-page":"10601","DOI":"10.1007\/s11042-018-6639-4","volume":"78","author":"M Liu","year":"2019","unstructured":"Liu, M., Po, L., Ur Rehman, Y.A., Xu, X., Li, Y., Feng, L.: Video copy detection by conducting fast searching of inverted files. Multimed. Tools Appl. 78(8), 10601\u201310624 (2019)","journal-title":"Multimed. Tools Appl."},{"issue":"6","key":"1031_CR5","first-page":"1238","volume":"54","author":"J Gu","year":"2017","unstructured":"Gu, J., Zhao, R., Jiang, Y.: A survey of video copy detection methods. J. Comput. Res. Dev. 54(6), 1238\u20131250 (2017)","journal-title":"J. Comput. Res. Dev."},{"key":"1031_CR6","doi-asserted-by":"crossref","unstructured":"Wray, M., Doughty, H., Damen, D.: On semantic similarity in video retrieval. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 3649\u22123659. Nashville (2021)","DOI":"10.1109\/CVPR46437.2021.00365"},{"key":"1031_CR7","doi-asserted-by":"publisher","first-page":"353","DOI":"10.1109\/TMM.2020.2978593","volume":"23","author":"Y Wu","year":"2020","unstructured":"Wu, Y., Liu, X., Qin, H., Xia, K., Hu, S., Ma, Y., Wang, M.: Boosting temporal binary coding for large-scale video search. IEEE Trans. Multimed. 23, 353\u2013364 (2020)","journal-title":"IEEE Trans. Multimed."},{"key":"1031_CR8","doi-asserted-by":"publisher","first-page":"102729","DOI":"10.1016\/j.dsp.2020.102729","volume":"102","author":"R Anuranji","year":"2020","unstructured":"Anuranji, R., Srimathi, H.J.: A supervised deep convolutional based bidirectional long short term memory video hashing for large scale video retrieval applications. Digital Signal Process. 102, 102729 (2020)","journal-title":"Digital Signal Process."},{"key":"1031_CR9","doi-asserted-by":"crossref","unstructured":"Tran, D., Wang, H., Torresani, L., Ray, J., Lecun, Y., Paluri, M.: A closer look at spatiotemporal convolutions for action recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 6450\u20126459. Salt Lake City (2018)","DOI":"10.1109\/CVPR.2018.00675"},{"key":"1031_CR10","doi-asserted-by":"crossref","unstructured":"Anguera, X., Garzon, A., Adamek, T.: MASK: robust local features for audio fingerprinting. In: IEEE International Conference on Multimedia and Expo, pp. 455\u2212460. Kobe (2012)","DOI":"10.1109\/ICME.2012.137"},{"key":"1031_CR11","doi-asserted-by":"crossref","unstructured":"Fu, X., Ch'ng, E., Aickelin, U., Simon, S.: CRNN: a joint neural network for redundancy detection. In: IEEE International Conference on Smart Computing (SMARTCOMP), pp. 1\u22128. Hong Kong (2017)","DOI":"10.1109\/SMARTCOMP.2017.7946996"},{"key":"1031_CR12","doi-asserted-by":"crossref","unstructured":"Wang, L., Bao, Y., Li, H., Xin, F., Luo, Z.: Compact CNN based video representation for efficient video copy detection. In: International Conference on Multimedia Modelingpp, pp. 576\u2012587. Reykjavik (2017)","DOI":"10.1007\/978-3-319-51811-4_47"},{"key":"1031_CR13","doi-asserted-by":"crossref","unstructured":"Li, Y., Chen, X.: Robust and compact video descriptor learned by deep neural network. In: IEEE International Conference on Acoustics, Speech and Signal Processing, pp. 2162\u20122166. Los Angeles (2017)","DOI":"10.1109\/ICASSP.2017.7952539"},{"issue":"6","key":"1031_CR14","doi-asserted-by":"publisher","first-page":"1542","DOI":"10.1109\/TMM.2019.2946096","volume":"22","author":"S Li","year":"2020","unstructured":"Li, S., Chen, Z., Li, X., Lu, J., Zhou, J.: Unsupervised variational video hashing with 1D-CNN-LSTM networks. IEEE Trans. Multimed. 22(6), 1542\u20131554 (2020)","journal-title":"IEEE Trans. Multimed."},{"key":"1031_CR15","doi-asserted-by":"crossref","unstructured":"Lou, Y., Bai, Y., Lin, J., Wang, S., Chen, J., Chandrasekhar, V., Duan, L., Huang, T., Kot, A.C., Gao, W.: Compact deep invariant descriptors for video retrieval. In: Data Compression Conference, pp. 420\u2012429. Snowbird (2017)","DOI":"10.1109\/DCC.2017.31"},{"issue":"6","key":"1031_CR16","doi-asserted-by":"publisher","first-page":"1209","DOI":"10.1109\/TMM.2016.2645404","volume":"19","author":"V Liong","year":"2016","unstructured":"Liong, V., Lu, J., Tan, Y., Zhou, J.: Deep video hashing. IEEE Trans. Multimed. 19(6), 1209\u20131219 (2016)","journal-title":"IEEE Trans. Multimed."},{"issue":"9","key":"1031_CR17","first-page":"2004","volume":"42","author":"M Wang","year":"2019","unstructured":"Wang, M., Liu, X., Sun, K., Wang, Z.: Optimal video subsets and video spatiotemporal retrieval. Chin. J. Comput. 42(9), 2004\u20132023 (2019)","journal-title":"Chin. J. Comput."},{"key":"1031_CR18","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Pinz, A., Wildes, R.P.: Convolutional two-stream network fusion for video action recognition. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 4768\u20124777. Hawaii (2017)","DOI":"10.1109\/CVPR.2017.787"},{"key":"1031_CR19","doi-asserted-by":"publisher","DOI":"10.1007\/s00371-022-02416-2","author":"K Fei","year":"2021","unstructured":"Fei, K., Wang, C., Zhang, J., Liu, Y., Xie, X., Tu, Z.: Flow-pose Net: an effective two-stream network for fall detection. Vis. Comput. (2021). https:\/\/doi.org\/10.1007\/s00371-022-02416-2","journal-title":"Vis. Comput."},{"key":"1031_CR20","doi-asserted-by":"crossref","unstructured":"Donahue, J., Hendricks, L.A., Rohrbach, M., Venugopalan, S., Guadarrama, S., Saenko, K., Darrell, T.: Long-term recurrent convolutional networks for visual recognition and description. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 677\u2012691. Hawaii (2017)","DOI":"10.1109\/TPAMI.2016.2599174"},{"key":"1031_CR21","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., Paluri, M.: Learning spatiotemporal features with 3D convolutional networks. In: IEEE International Conference on Computer Vision, pp. 4489\u20124497. Santiago (2015)","DOI":"10.1109\/ICCV.2015.510"},{"key":"1031_CR22","unstructured":"Tran, D., Ray, J., Zheng, S., Chang, S., Paluri, M.: ConvNet architecture search for spatiotemporal feature learning. arXiv preprint arXiv:1708.05038v1 (2017)"},{"key":"1031_CR23","doi-asserted-by":"crossref","unstructured":"Ali, A., Taylor, G.W.: Real-time end-to-end action detection with two-stream networks. In: Conference on Computer and Robot Vision, pp. 31\u201238. Toronto (2018)","DOI":"10.1109\/CRV.2018.00015"},{"issue":"8","key":"1031_CR24","doi-asserted-by":"publisher","first-page":"21","DOI":"10.1016\/j.jvcir.2018.05.013","volume":"55","author":"Y Hu","year":"2018","unstructured":"Hu, Y., Lu, X.: Learning spatial\u2013temporal features for video copy detection by the combination of CNN and RNN. J. Vis. Commun. Image Represent. 55(8), 21\u201329 (2018)","journal-title":"J. Vis. Commun. Image Represent."},{"key":"1031_CR25","doi-asserted-by":"publisher","first-page":"333","DOI":"10.1007\/978-981-16-7621-5_13","volume-title":"Multimedia Forensics","author":"C Long","year":"2022","unstructured":"Long, C., Basharat, A., Hoogs, A.: Video frame deletion and duplication. In: Sencar, H.T., Verdoliva, L., Memon, N. (eds.) Multimedia Forensics, pp. 333\u2013362. Springer, Singapore (2022)"},{"key":"1031_CR26","unstructured":"Hou, R., Chen, C., Sukthankar, R., Shah, M.: An efficient 3D CNN for action\/object segmentation in video. arXiv preprint arXiv:1907.08895 (2019)"},{"issue":"3","key":"1031_CR27","doi-asserted-by":"publisher","first-page":"491","DOI":"10.1109\/TCDS.2019.2963339","volume":"13","author":"Y Wang","year":"2021","unstructured":"Wang, Y., Nie, X., Shi, Y., Zhou, X., Yin, Y.: Attention-based video hashing for large-scale video retrieval. IEEE Trans. Cogn. Dev. Syst. 13(3), 491\u2013502 (2021)","journal-title":"IEEE Trans. Cogn. Dev. Syst."},{"issue":"11","key":"1031_CR28","first-page":"2562","volume":"40","author":"H Zhi","year":"2018","unstructured":"Zhi, H., Yu, H., Li, S., Gao, C., Wang, Y.: A video classification method based on deep metric learning. J. Electron. Inf. Technol. 40(11), 2562\u20132569 (2018)","journal-title":"J. Electron. Inf. Technol."},{"issue":"2","key":"1031_CR29","doi-asserted-by":"publisher","first-page":"433","DOI":"10.1109\/TCSVT.2018.2795657","volume":"29","author":"TP Nguyen","year":"2018","unstructured":"Nguyen, T.P., Pham, C.C., Ha, S.V.U., Jeon, J.W.: Change detection by training a triplet network for motion feature extraction. IEEE Trans. Circuits Syst. Video Technol. 29(2), 433\u2013446 (2018)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"issue":"28","key":"1031_CR30","doi-asserted-by":"publisher","first-page":"35973","DOI":"10.1007\/s11042-020-10160-9","volume":"80","author":"AR Bhople","year":"2021","unstructured":"Bhople, A.R., Prakash, S.: Learning similarity and dissimilarity in 3D faces with triplet network. Multimed. Tools Appl. 80(28), 35973\u201335991 (2021)","journal-title":"Multimed. Tools Appl."},{"issue":"1","key":"1031_CR31","doi-asserted-by":"publisher","first-page":"61","DOI":"10.1007\/s13735-018-0159-x","volume":"8","author":"A Wary","year":"2019","unstructured":"Wary, A., Neelima, A.: A review on robust video copy detection. Int. J. Multimed. Inf. Retrieval 8(1), 61\u201378 (2019)","journal-title":"Int. J. Multimed. Inf. Retrieval"},{"key":"1031_CR32","doi-asserted-by":"crossref","unstructured":"Pan, X., Yu, X., Deng, J., Yang, W., Wang, H.: Audio fingerprinting based on local energy centroid. In: IET International Communication Conference on Wireless Mobile and Computing, pp. 351\u2012354. Shanghai (2011)","DOI":"10.1049\/cp.2011.0907"},{"key":"1031_CR33","doi-asserted-by":"crossref","unstructured":"Jiang, T., Wu, R., Li, J., Xiang, K., Dai, F.: A real-time peak discovering method for audio fingerprinting. In: International Conference on Internet Multimedia Computing and Service, pp. 368\u2012371. Huangshan (2013)","DOI":"10.1145\/2499788.2499866"},{"key":"1031_CR34","unstructured":"Wang, A.: An industrial-strength audio search algorithm. In: International Conference on Music Information Retrieval, vol. 2, No. 2, pp. 7\u201213 (2000)"},{"issue":"21","key":"1031_CR35","doi-asserted-by":"publisher","first-page":"30011","DOI":"10.1007\/s11042-018-6802-y","volume":"78","author":"Y Jiang","year":"2019","unstructured":"Jiang, Y., Wu, C., Deng, K., Wu, Y.: An audio fingerprinting extraction algorithm based on lifting wavelet packet and improved optimal-basis selection. Multimed. Tools Appl. 78(21), 30011\u201330025 (2019)","journal-title":"Multimed. Tools Appl."},{"key":"1031_CR36","doi-asserted-by":"publisher","first-page":"1616","DOI":"10.1109\/TIFS.2019.2941773","volume":"15","author":"A Chowdhury","year":"2019","unstructured":"Chowdhury, A., Ross, A.: Fusing MFCC and LPC features using 1D triplet CNN for speaker recognition in severely degraded audio signals. IEEE Trans. Inf. Forensics Secur. 15, 1616\u20131629 (2019)","journal-title":"IEEE Trans. Inf. Forensics Secur."},{"key":"1031_CR37","doi-asserted-by":"crossref","unstructured":"Gao, Z., Song, Y., Mcloughlin, I., Li, P., Jiang, Y., Dai, L.: Improving aggregation and loss function for better embedding learning in end-to-end speaker verification system. In: Interspeech, pp. 361\u2012365. Graz (2019)","DOI":"10.21437\/Interspeech.2019-1489"},{"issue":"6","key":"1031_CR38","doi-asserted-by":"publisher","first-page":"1291","DOI":"10.1109\/TASLP.2017.2690575","volume":"25","author":"E Cakir","year":"2017","unstructured":"Cakir, E., Parascandolo, G., Heittola, T., Huttunen, H., Virtanen, T.: Convolutional recurrent neural networks for polyphonic sound event detection. IEEE\/ACM Trans. Audio Speech Lang. Process. 25(6), 1291\u20131303 (2017)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"10","key":"1031_CR39","doi-asserted-by":"publisher","first-page":"1440","DOI":"10.1109\/LSP.2018.2860246","volume":"25","author":"M Chen","year":"2018","unstructured":"Chen, M., He, X., Yang, J., Zhang, H.: 3D convolutional recurrent neural networks with attention model for speech emotion recognition. IEEE Signal Process. Lett. 25(10), 1440\u20131444 (2018)","journal-title":"IEEE Signal Process. Lett."},{"key":"1031_CR40","doi-asserted-by":"crossref","unstructured":"Ma, X., Wu, Z., Jia, J., Xu, M., Cai, L.: Emotion recognition from variable-length speech segments using deep learning on spectrograms. In: Interspeech, pp. 3683\u20123687. Hyderabad (2018)","DOI":"10.21437\/Interspeech.2018-2228"},{"key":"1031_CR41","doi-asserted-by":"crossref","unstructured":"Kao, C.C., Wang, W., Sun, M., Wang, C.: R-CRNN: region-based convolutional recurrent neural network for audio event detection. In: Interspeech, pp. 1358\u20121362. Hyderabad (2018)","DOI":"10.21437\/Interspeech.2018-2323"},{"key":"1031_CR42","doi-asserted-by":"crossref","unstructured":"Peng, H., Deng, C., An, L., Gao, X., Tao, D.: Learning to multimodal hash for robust video copy detection. In: IEEE International Conference on Image Processing, pp. 4482\u20124486. Melbourne (2013)","DOI":"10.1109\/ICIP.2013.6738923"},{"key":"1031_CR43","doi-asserted-by":"crossref","unstructured":"Lee, F., Zhao, J., Kotani, K., Chen, Q.: Video copy detection using histogram based spatio-temporal features. In: International Congress on Image and Signal Processing, pp. 1\u20125. Shanghai (2017)","DOI":"10.1109\/CISP-BMEI.2017.8301917"},{"issue":"7","key":"1031_CR44","doi-asserted-by":"publisher","first-page":"4749","DOI":"10.1007\/s11042-018-6047-9","volume":"79","author":"J Li","year":"2020","unstructured":"Li, J., Zhang, H., Wan, W., Sun, J.: Two-class 3D-CNN classifiers combination for video copy detection. Multimed. Tools Appl. 79(7), 4749\u20134761 (2020)","journal-title":"Multimed. Tools Appl."},{"issue":"1","key":"1031_CR45","doi-asserted-by":"publisher","first-page":"401","DOI":"10.1007\/s11277-018-5450-x","volume":"103","author":"X Zhang","year":"2018","unstructured":"Zhang, X., Xie, Y., Luan, X., He, J., Zhang, L., Wu, L.: Video copy detection based on deep CNN features and graph-based sequence matching. Wireless Pers. Commun. 103(1), 401\u2013416 (2018)","journal-title":"Wireless Pers. Commun."},{"key":"1031_CR46","doi-asserted-by":"publisher","DOI":"10.1109\/TCDS.2021.3051010","author":"W Zhou","year":"2021","unstructured":"Zhou, W., Liu, W., Lei, J., Luo, T., Yu, L.: Deep binocular fixation prediction using a hierarchical multimodal fusion network. IEEE Trans. Cogn. Dev. Syst. (2021). https:\/\/doi.org\/10.1109\/TCDS.2021.3051010","journal-title":"IEEE Trans. Cogn. Dev. Syst."},{"issue":"1","key":"1031_CR47","doi-asserted-by":"publisher","first-page":"29","DOI":"10.1007\/s00530-014-0387-8","volume":"22","author":"T Li","year":"2016","unstructured":"Li, T., Nian, F., Wu, X., Gao, Q., Lu, Y.: Efficient video copy detection using multi-modality and dynamic path search. Multimed. Syst. 22(1), 29\u201339 (2016)","journal-title":"Multimed. Syst."},{"key":"1031_CR48","unstructured":"Ortega, J.D.S., Senoussaoui, M., Granger, E., Pedersoli, M., Cardinal, P., Koerich, A.L.: Multimodal fusion with deep neural networks for audio\u2013video emotion recognition. arXiv preprint arXiv:1907.03196 (2019)"},{"key":"1031_CR49","doi-asserted-by":"publisher","first-page":"293","DOI":"10.1007\/978-3-030-69251-3_11","volume-title":"Fundamentals of Image Data Mining","author":"D Zhang","year":"2021","unstructured":"Zhang, D.: Image indexing. In: Zhang, D. (ed.) Fundamentals of Image Data Mining, pp. 293\u2013301. Springer, Cham (2021)"},{"key":"1031_CR50","doi-asserted-by":"publisher","first-page":"763","DOI":"10.1007\/978-3-030-62124-7_21","volume-title":"Fundamentals of Multimedia","author":"Z Li","year":"2021","unstructured":"Li, Z., Drew, M.S., Liu, J.: Content-based retrieval in digital libraries. In: Li, Z., Drew, M.S., Liu, J. (eds.) Fundamentals of Multimedia, pp. 763\u2013809. Springer, Cham (2021)"},{"key":"1031_CR51","unstructured":"Weiss, Y., Torralbaa, A., Fergus, R.: Spectral hashing. In: Advances in Neural Information Processing Systems 21, pp. 1753\u20121760. Vancouver (2008)"},{"issue":"5","key":"1031_CR52","doi-asserted-by":"publisher","first-page":"1248","DOI":"10.1109\/TMM.2018.2872898","volume":"21","author":"H Xie","year":"2018","unstructured":"Xie, H., Mao, Z., Zhang, Y., Deng, H., Yan, C., Chen, Z.: Double-bit quantization and index hashing for nearest neighbor search. IEEE Trans. Multimedia 21(5), 1248\u20131260 (2018)","journal-title":"IEEE Trans. Multimedia"},{"key":"1031_CR53","doi-asserted-by":"crossref","unstructured":"Hansen, C., Simonsen, J.G., Alstrup, S.: Unsupervised multi-index semantic hashing. In: The Web Conference, pp. 2879\u20122889. Ljubljana (2021)","DOI":"10.1145\/3442381.3450014"},{"issue":"4","key":"1031_CR54","first-page":"11","volume":"41","author":"Y Wang","year":"2022","unstructured":"Wang, Y., Zhang, J., Zhang, S., Zhuo, L.: Short video fingerprinting extraction based on R(2+1)D triplet Siamese networks. Meas. Control Technol. 41(4), 11\u201318 (2022)","journal-title":"Meas. Control Technol."},{"key":"1031_CR55","doi-asserted-by":"crossref","unstructured":"Wu, X., Hauptmann, A.G., Ngo, C.W.: Practical elimination of near-duplicates from web video search. In: ACM International Conference on Multimedia, pp. 218\u2012227. Augsburg (2007)","DOI":"10.1145\/1291233.1291280"},{"issue":"2","key":"1031_CR56","doi-asserted-by":"publisher","first-page":"502","DOI":"10.1109\/TPAMI.2019.2901464","volume":"42","author":"M Monfort","year":"2019","unstructured":"Monfort, M., Andonian, A., Zhou, B., Ramakrishnan, K., Bargal, S.A., Yan, T., Brown, L., Fan, Q., Gutfreund, D., Carl, V., Oliva, A.: Moments in time dataset: one million videos for event understanding. IEEE Trans. Pattern Anal. Mach. Intell. 42(2), 502\u2013508 (2019)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1031_CR57","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2012778. Las Vegas (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"1031_CR58","doi-asserted-by":"crossref","unstructured":"Qian, R., Meng, T., Gong, B., Yang, M., Wang, H., Belongie, S.: Spatiotemporal contrastive video representation learning. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 6964\u20126974. Nashville (2021)","DOI":"10.1109\/CVPR46437.2021.00689"},{"key":"1031_CR59","doi-asserted-by":"crossref","unstructured":"Han, Z., He, X., Tang, M., Lv, Y.: Video similarity and alignment learning on partial video copy detection. In: ACM International Conference on Multimedia, pp. 4165\u20124173. Chengdu (2021)","DOI":"10.1145\/3474085.3475549"},{"key":"1031_CR60","doi-asserted-by":"crossref","unstructured":"Pan, T., Song, Y., Yang, T., Jiang, W., Liu W.: Videomoco: contrastive video representation learning with temporally adversarial examples. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 11205\u221211214. Nashville (2021)","DOI":"10.1109\/CVPR46437.2021.01105"},{"key":"1031_CR61","doi-asserted-by":"crossref","unstructured":"Coskun, H., Zareian, A., Moore, J.L., Tombari, F., Chen, W.: GOCA: guided online cluster assignment for self-supervised video representation Learning. arXiv preprint arXiv:2207.10158 (2022)","DOI":"10.1007\/978-3-031-19821-2_1"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-022-01031-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-022-01031-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-022-01031-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,9]],"date-time":"2024-10-09T22:24:37Z","timestamp":1728512677000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-022-01031-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,12,4]]},"references-count":61,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2023,6]]}},"alternative-id":["1031"],"URL":"https:\/\/doi.org\/10.1007\/s00530-022-01031-4","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,12,4]]},"assertion":[{"value":"30 August 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 November 2022","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 December 2022","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"All authors certify that they have no affiliations with or involvement in any organization or entity with any financial interest or non-financial interest in the subject matter or materials discussed in this manuscript.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}