{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T17:47:17Z","timestamp":1777657637732,"version":"3.51.4"},"reference-count":113,"publisher":"Springer Science and Business Media LLC","issue":"7","license":[{"start":{"date-parts":[[2023,3,31]],"date-time":"2023-03-31T00:00:00Z","timestamp":1680220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,3,31]],"date-time":"2023-03-31T00:00:00Z","timestamp":1680220800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key R &D Program of China","doi-asserted-by":"crossref","award":["2020AAA0108600"],"award-info":[{"award-number":["2020AAA0108600"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2023,7]]},"DOI":"10.1007\/s11263-023-01779-w","type":"journal-article","created":{"date-parts":[[2023,3,31]],"date-time":"2023-03-31T18:03:20Z","timestamp":1680285800000},"page":"1704-1721","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":9,"title":["Bi-calibration Networks for Weakly-Supervised Video Representation Learning"],"prefix":"10.1007","volume":"131","author":[{"given":"Fuchen","family":"Long","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7587-101X","authenticated-orcid":false,"given":"Ting","family":"Yao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhaofan","family":"Qiu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xinmei","family":"Tian","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiebo","family":"Luo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tao","family":"Mei","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,3,31]]},"reference":[{"key":"1779_CR1","unstructured":"Abu-El-Haija, S., Kothari, N., Lee, J., Natsev, P., Toderici, G., Varadarajan, B., & Vijayanarasimhan, S. (2016). YouTube-8M: A Large-Scale Video Classification Benchmark. arXiv preprint arXiv:1609.08675."},{"key":"1779_CR2","doi-asserted-by":"crossref","unstructured":"Agrawal, P., Carreira, J., & Malik, J. (2015). Learning to see by moving. In ICCV.","DOI":"10.1109\/ICCV.2015.13"},{"key":"1779_CR3","unstructured":"Alwassel, H., Mahajan, D., Korbar, B., Torresani, L., Ghanem, B., & Tran, D. (2020). Self-supervised learning by cross-modal audio-video clustering. In NeurIPS."},{"key":"1779_CR4","doi-asserted-by":"crossref","unstructured":"Arnab, A., Dehghani, M., Heigold, G., Sun, C., Lucic, M., & Schmid, C. (2021). ViViT: A video vision transformer. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00676"},{"key":"1779_CR5","unstructured":"Avila, S., Thome, N., Cord, M., & Valle, E. (2013). de A Araujo A. The visual codeword point of view. Compute vision and image understanding: Pooling in image representation."},{"key":"1779_CR6","doi-asserted-by":"crossref","unstructured":"Benaim, S., Ephrat, A., Lang, O., Mosseri, I., Freeman, W. T., Rubinstein, M., Irani, M., & Dekel, T. (2020). SpeedNet: Learning the speediness in videos. In CVPR.","DOI":"10.1109\/CVPR42600.2020.00994"},{"key":"1779_CR7","doi-asserted-by":"crossref","unstructured":"Berg, T. L., & Forsyth, D. A. (2006). Animals on web. In CVPR.","DOI":"10.1109\/CVPR.2006.57"},{"key":"1779_CR8","unstructured":"Bertasius, G., Wang, H., & Torresani, L. (2021). Is space-time attention all you need for video understanding? In ICML."},{"key":"1779_CR9","unstructured":"Cai, Q., Wang, Y., Pan, Y., Yao, T., & Mei, T. (2020). Joint contrastive learning with infinite possibilities. In NeurIPS."},{"key":"1779_CR10","doi-asserted-by":"crossref","unstructured":"Carreira, J., & Zisserman, A. (2017). Quo vadis, action recognition? A new model and the kinetics dataset. In CVPR.","DOI":"10.1109\/CVPR.2017.502"},{"key":"1779_CR11","unstructured":"Carreira, J., Noland, E., Hillier, C., & Zisserman, A. (2019). A short note on the Kinetics-700 human action dataset. arXiv preprint arXiv:1907.06987."},{"key":"1779_CR12","doi-asserted-by":"crossref","unstructured":"Damen, D., Doughty, H., Farinella, G. M., Fidler, S., Furnari, A., Kazakos, E., Moltisanti, D., Munro, J., Perrett, T., Price, W., & Wray, M. (2018). Scaling egocentric vision: The EPIC-KITCHENS Dataset. In ECCV.","DOI":"10.1007\/978-3-030-01225-0_44"},{"key":"1779_CR13","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L. J., Li, K., & Fei-Fei, L. (2009). ImageNet: A large-scale hierarchical image database. In CVPR.","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"1779_CR14","unstructured":"Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2018). BERT: Pre-training of deep bidirectional transformers for language understanding. In ACL."},{"key":"1779_CR15","doi-asserted-by":"crossref","unstructured":"Diba, A., Sharma, V., & Gool, L. V. (2017). Deep temporal linear encoding networks. In CVPR.","DOI":"10.1109\/CVPR.2017.168"},{"key":"1779_CR16","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., & Houlsby, N. (2021). An image is worth 16x16 words: Transformers for image recognition at scale. In ICLR."},{"key":"1779_CR17","doi-asserted-by":"crossref","unstructured":"Duan, H., Zhao, Y., Xiong, Y., Liu, W., & Lin, D. (2020). Omni-sourced Webly-supervised learning for video recognition. In ECCV.","DOI":"10.1007\/978-3-030-58555-6_40"},{"key":"1779_CR18","doi-asserted-by":"crossref","unstructured":"Dwibedi, D., Aytar, Y., Tompson, J., Sermanet, P., & Zisserman, A. (2019). Temporal cycle-consistency learning. In CVPR.","DOI":"10.1109\/CVPR.2019.00190"},{"key":"1779_CR19","doi-asserted-by":"crossref","unstructured":"Fan, H., Xiong, B., Mangalam, K., Li, Y., Yan, Z., Malik, J., & Feichtenhofer, C. (2021). Multiscale vision transformers. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00675"},{"key":"1779_CR20","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Pinz, A., & Zisserman, A. (2016). Convolutional two-stream network fusion for video action recognition. In CVPR.","DOI":"10.1109\/CVPR.2016.213"},{"key":"1779_CR21","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Fan, H., Malik, J., & He, K. (2019). SlowFast networks for video recognition. In ICCV.","DOI":"10.1109\/ICCV.2019.00630"},{"key":"1779_CR22","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Fan, H., Xiong, B., Girshick, R., & He, K. (2021). A large-scale study on unsupervised spatiotemporal representation learning. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00331"},{"key":"1779_CR23","doi-asserted-by":"crossref","unstructured":"Fernando, B., Bilen, H., Gavves, E., & Gould, S. (2017). Self-supervised video representation learning with odd-one-out networks. In CVPR.","DOI":"10.1109\/CVPR.2017.607"},{"key":"1779_CR24","unstructured":"Finn, C., Goodfellow, I., & Levine, S. (2016). Unsupervised learning for physical interaction through video prediction. In NIPS."},{"key":"1779_CR25","doi-asserted-by":"crossref","unstructured":"Gebru, T., Morgenstern, J., Vecchione, B., Vaughan, JW., Wallach, H., III HD, & Crawford, K. (2021). Datasheets for datasets. Communications of the ACM.","DOI":"10.1145\/3458723"},{"key":"1779_CR26","doi-asserted-by":"crossref","unstructured":"Ghadiyaram, D., Feiszli, M., Tran, D., Yan, X., Wang, H., & Mahajan, D. (2019). Large-scale weakly-supervised pre-training for video action recognition. In CVPR.","DOI":"10.1109\/CVPR.2019.01232"},{"key":"1779_CR27","unstructured":"Ghanem, B., Niebles, J. C., Snoek, C., Heilbron, F. C., Alwassel, H., Escorcia, V., Krishna, R., Buch, S., & Dao, C. D. (2018). The ActivityNet large-scale activity recognition challenge 2018 summary. arXiv preprint arXiv:1808.03766."},{"key":"1779_CR28","unstructured":"Gionis, A., Indyk, P., & Motwani, R. (1999). Similarity search in high dimensions via hashing. In VLDB."},{"key":"1779_CR29","doi-asserted-by":"crossref","unstructured":"Girshick, R. (2015). Fast R-CNN. In ICCV.","DOI":"10.1109\/ICCV.2015.169"},{"key":"1779_CR30","doi-asserted-by":"crossref","unstructured":"Goyal, R., Kahou, S. E., Michalski, V., Materzynska, J., Westphal, S., Kim, H., Haenel, V., Fruend, I., Yianilos, P., Mueller-Freitag, M., Hoppe, F., Thurau, C., Bax, I., & Memisevic, R. (2017). The \u201dsomething something\u201d video database for learning and evaluating visual common sense. In ICCV.","DOI":"10.1109\/ICCV.2017.622"},{"key":"1779_CR31","unstructured":"Han, T., Xie, W., & Zisserman, A. (2020). Self-supervised co-training for video representation learning. In NeurIPS."},{"key":"1779_CR32","doi-asserted-by":"crossref","unstructured":"Hara, K., Kataoka, H., & Satoh, Y. (2018). Can spatiotemporal 3D CNNs retrace the history of 2D CNNs and ImageNet? In CVPR.","DOI":"10.1109\/CVPR.2018.00685"},{"key":"1779_CR33","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In CVPR.","DOI":"10.1109\/CVPR.2016.90"},{"key":"1779_CR34","doi-asserted-by":"crossref","unstructured":"He, K., Fan, H., Wu, Y., Xie, S., & Girshick, R. (2020). Momentum contrast for unsupervised visual representation learning. In CVPR.","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"1779_CR35","unstructured":"Huang, Z., Zhang, S., Pan, L., Qing, Z., Tang, M., Liu, Z., & Jr M. H. A. (2022). TAda! Temporally-adaptive convolutions for video understanding. In ICLR."},{"issue":"1","key":"1779_CR36","doi-asserted-by":"publisher","first-page":"221","DOI":"10.1109\/TPAMI.2012.59","volume":"35","author":"S Ji","year":"2012","unstructured":"Ji, S., Xu, W., Yang, M., & Yu, K. (2012). 3D convolutional neural networks for human action recognition. IEEE Transactions on PAMI, 35(1), 221\u2013231.","journal-title":"IEEE Transactions on PAMI"},{"key":"1779_CR37","doi-asserted-by":"crossref","unstructured":"Jia, Y., Shelhamer, E., Donahue, J., Karayev, S., Long, J., Girshick, R. B., Guadarrama, S., & Darrell, T. (2014). Caffe: Convolutional architecture for fast feature embedding. In ACM MM.","DOI":"10.1145\/2647868.2654889"},{"key":"1779_CR38","doi-asserted-by":"crossref","unstructured":"Jiang, B., Wang, M., Gan, W., Wu, W., & Yan, J. (2019) STM: SpatioTemporal and motion encoding for action recognition. In ICCV.","DOI":"10.1109\/ICCV.2019.00209"},{"key":"1779_CR39","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., & Fei-Fei, L. (2014). Large-scale video classification with convolutional neural networks. In CVPR.","DOI":"10.1109\/CVPR.2014.223"},{"key":"1779_CR40","doi-asserted-by":"publisher","first-page":"1366","DOI":"10.1007\/s11263-022-01594-9","volume":"130","author":"Y Kong","year":"2022","unstructured":"Kong, Y., & Fu, Y. (2022). Human action recognition and prediction: A survey. International Journal of Computer Vision, 130, 1366\u20131401.","journal-title":"International Journal of Computer Vision"},{"key":"1779_CR41","doi-asserted-by":"crossref","unstructured":"Kuehne, H., Jhuang, H., Garrote, E., Poggio, T., & Serre, T. (2011). HMDB: A large video database for human motion recognition. In ICCV.","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"1779_CR42","doi-asserted-by":"crossref","unstructured":"Lazebnik, S., Schmid, C., & Ponce, J. (2006). Beyond bags of features: Spatial pyramid matching for recognizing natural scene categories. In CVPR.","DOI":"10.1109\/CVPR.2006.68"},{"key":"1779_CR43","doi-asserted-by":"crossref","unstructured":"Li, D., Qiu, Z., Pan, Y., Yao, T., Li, H., & Mei, T. (2021a). Representing videos as discriminative sub-graphs for action recognition. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00332"},{"key":"1779_CR44","unstructured":"Li, J., Zhou, P., Xiong, C., & Hoi, S. (2021b). Prototypical contrastive learning of unsupervised representations. In ICLR."},{"key":"1779_CR45","doi-asserted-by":"crossref","unstructured":"Li, R., Zhang, Y., Qiu, Z., Yao, T., Liu, D., & Mei, T. (2021c). Motion-focused contrastive learning of video representations. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00211"},{"key":"1779_CR46","unstructured":"Li, T., & Wang, L. (2020) Learning spatiotemporal features via video and text pair discrimination. arXiv preprint arXiv:2001.05691."},{"key":"1779_CR47","doi-asserted-by":"crossref","unstructured":"Li, X., Wang, Y., Zhou, Z., & Qiao, Y. (2020a). SmallBigNet: Integrating core and contextual views for video classification. In CVPR.","DOI":"10.1109\/CVPR42600.2020.00117"},{"key":"1779_CR48","doi-asserted-by":"crossref","unstructured":"Li, Y., Ji, B., Shi, X., Zhang, J., Kang, B., & Wang, L. (2020b). TEA: Temporal excitation and aggregation for action recognition. In CVPR.","DOI":"10.1109\/CVPR42600.2020.00099"},{"key":"1779_CR49","unstructured":"Li, Y., Yao, T., Pan, Y., & Mei, T. (2022). Contextual transformer networks for visual recognition. IEEE Transactions on PAMI."},{"key":"1779_CR50","doi-asserted-by":"crossref","unstructured":"Lin, J., Gan, C., & Han, S. (2019). TSM: Temporal shift module for efficient video understanding. In ICCV.","DOI":"10.1109\/ICCV.2019.00718"},{"key":"1779_CR51","doi-asserted-by":"crossref","unstructured":"Lin, Y., Guo, X., & Lu, Y. (2021) Self-supervised video representation learning with meta-contrastive network. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00813"},{"key":"1779_CR52","doi-asserted-by":"crossref","unstructured":"Liu, X., Lee, J. Y., & Jin, H. (2019). Learning video representations from correspondence proposals. In CVPR.","DOI":"10.1109\/CVPR.2019.00440"},{"key":"1779_CR53","doi-asserted-by":"crossref","unstructured":"Liu, Z., Yeh, R. A., Tang, X., Liu, Y., & Agarwala, A. (2017). Video frame synthesis using deep voxel flow. In ICCV.","DOI":"10.1109\/ICCV.2017.478"},{"key":"1779_CR54","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., & Guo, B. (2021). Swin transformer: Hierarchical vision transformer using shifted windows. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"1779_CR55","doi-asserted-by":"crossref","unstructured":"Liu, Z., Ning, J., Cao, Y., Wei, Y., Zhang, Z., Lin, S., Hu, H. (2022). Video swin transformer. In ECCV.","DOI":"10.1109\/CVPR52688.2022.00320"},{"key":"1779_CR56","doi-asserted-by":"crossref","unstructured":"Long, F., Yao, T., Qiu, Z., Tian, X., Luo, J., & Mei, T. (2019). Gaussian temporal awareness networks for action localization. In CVPR.","DOI":"10.1109\/CVPR.2019.00043"},{"issue":"6","key":"1779_CR57","doi-asserted-by":"publisher","first-page":"1577","DOI":"10.1109\/TMM.2019.2943204","volume":"22","author":"F Long","year":"2020","unstructured":"Long, F., Yao, T., Qiu, Z., Tian, X., Mei, T., & Luo, J. (2020). Coarse-to-fine localization of temporal action proposals. IEEE Transactions on Multimedia, 22(6), 1577\u20131590.","journal-title":"IEEE Transactions on Multimedia"},{"key":"1779_CR58","doi-asserted-by":"crossref","unstructured":"Long, F., Qiu, Z., Pan, Y., Yao, T., Luo, J., & Mei, T. (2022a). Stand-alone inter-frame attention in video models. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00319"},{"key":"1779_CR59","doi-asserted-by":"crossref","unstructured":"Long, F., Qiu, Z., Pan, Y., Yao, T., Ngo, C. W., & Mei, T. (2022b). Dynamic temporal filtering in video models. In ECCV.","DOI":"10.1007\/978-3-031-19833-5_28"},{"key":"1779_CR60","doi-asserted-by":"crossref","unstructured":"Luo, Z., Peng, B., Huang, D. A., Alahi, A., & Fei-Fei, L. (2017) Unsupervised learning of long-term motion dynamics for videos. In CVPR.","DOI":"10.1109\/CVPR.2017.751"},{"key":"1779_CR61","unstructured":"Maaten, L., & Hinton, G. (2008). Visualizing data using t-SNE. In JMLR."},{"key":"1779_CR62","doi-asserted-by":"publisher","first-page":"1954","DOI":"10.1007\/s11263-021-01454-y","volume":"129","author":"P Mettes","year":"2021","unstructured":"Mettes, P., Thong, W., & Snoek, G. G. M. (2021). Object priors for classifying and localizing unseen actions. International Journal of Computer Vision, 129, 1954\u20131971.","journal-title":"International Journal of Computer Vision"},{"key":"1779_CR63","doi-asserted-by":"crossref","unstructured":"Miech, A., Zhukov, D., Alayrac, J. B., Tapaswi, M., Laptev, I., & Sivic, J. (2019). HowTo100M: Learning a text-video embedding by watching hundred million narrated video clips. In ICCV.","DOI":"10.1109\/ICCV.2019.00272"},{"key":"1779_CR64","doi-asserted-by":"crossref","unstructured":"Miech, A., Alayrac, J. B., Smaira, L., Laptev, I., & Sivic, J., Zisserman A. (2020). End-to-end learning of visual representations from uncurated instructional videos. In CVPR.","DOI":"10.1109\/CVPR42600.2020.00990"},{"key":"1779_CR65","doi-asserted-by":"crossref","unstructured":"Misra, I., Zitnick, C. L., & Hebert, M. (2016). Shuffle and learn: Unsupervised learning using temporal order verification. In ECCV.","DOI":"10.1007\/978-3-319-46448-0_32"},{"key":"1779_CR66","doi-asserted-by":"crossref","unstructured":"Mobahi, H., Collobert, R., & Weston, J. (2009). Deep learning from temporal coherence in video. In ICML.","DOI":"10.1145\/1553374.1553469"},{"issue":"2","key":"1779_CR67","doi-asserted-by":"publisher","first-page":"502","DOI":"10.1109\/TPAMI.2019.2901464","volume":"42","author":"M Monfort","year":"2019","unstructured":"Monfort, M., Andonian, A., Zhou, B., Ramakrishnan, K., Bargal, S. A., Yan, T., Brown, L., Fan, Q., Gutfreund, D., Vondrick, C., & Oliva, A. (2019). Moments in time dataset: One million videos for event understanding. IEEE Transactions on PAMI, 42(2), 502\u2013508.","journal-title":"IEEE Transactions on PAMI"},{"key":"1779_CR68","doi-asserted-by":"crossref","unstructured":"Neimark, D., Bar, O., Zohar, M., & Asselmann, D. (2021). Video transformer network. In ICCV workshop.","DOI":"10.1109\/ICCVW54120.2021.00355"},{"key":"1779_CR69","unstructured":"Ng, J. Y. H., Hausknecht, M., Vijayanarasimhan, S., Vinyals, O., Monga, R., & Toderici, G. (2015). Beyond short snippets: Deep networks for video classification. In CVPR."},{"key":"1779_CR70","unstructured":"Oord, A., Li, Y., & Vinyals, O. (2018). Representation learning with contrastive predictive coding. In NIPS."},{"key":"1779_CR71","doi-asserted-by":"crossref","unstructured":"Pan, Y., Li, Y., Luo, J., Xu, J., Yao, T., & Mei, T. (2022). Auto-captions on GIF: A large-scale video-sentence dataset for vision-language pre-training. In ACM multimedia.","DOI":"10.1145\/3503161.3551581"},{"key":"1779_CR72","doi-asserted-by":"crossref","unstructured":"Pathak, D., Girshick, R., Dollar, P., Darrell, T., & Hariharan, B. (2017). Learning features by watching objects move. In CVPR.","DOI":"10.1109\/CVPR.2017.638"},{"key":"1779_CR73","doi-asserted-by":"crossref","unstructured":"Qian, R., Meng, T., Gong, B., Yang, M. H., Wang, H., Belongie, S., & Cui, Y. (2021). Spatiotemporal contrastive video representation learning. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00689"},{"key":"1779_CR74","doi-asserted-by":"crossref","unstructured":"Qiu, Z., Yao, T., & Mei, T. (2017). Learning spatio-temporal representation with pseudo-3D residual networks. In ICCV.","DOI":"10.1109\/ICCV.2017.590"},{"key":"1779_CR75","doi-asserted-by":"crossref","unstructured":"Qiu, Z., Yao, T., Ngo, C. W., Tian, X., & Mei, T. (2019). Learning spatio-temporal representation with local and global diffusion. In CVPR.","DOI":"10.1109\/CVPR.2019.01233"},{"key":"1779_CR76","doi-asserted-by":"crossref","unstructured":"Qiu, Z., Yao, T., Ngo, C. W., Zhang, X. P., Wu, D., & Mei, T. (2021). Boosting video representation learning with multi-faceted integration. In CVPR.","DOI":"10.1109\/CVPR46437.2021.01381"},{"key":"1779_CR77","unstructured":"Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., & Sutskever, I. (2021). Learning transferable visual models from natural language supervision. In ICML."},{"key":"1779_CR78","unstructured":"Saenko, K., & Darrell, T. (2008). Unsupervised learning of visual sense models for polysemous words. In NIPS."},{"key":"1779_CR79","doi-asserted-by":"crossref","unstructured":"Schroff, F., Criminisi, A., & Zisserman, A. (2007). Harvesting image databases from the web. In ICCV.","DOI":"10.1109\/ICCV.2007.4409099"},{"key":"1779_CR80","unstructured":"Simonyan, K., & Zisserman, A. (2014). Two-stream convolutional networks for action recognition in videos. In NIPS."},{"key":"1779_CR81","unstructured":"Soomro, K., Zamir, A. R., & Shah, M. (2012). UCF101: A dataset of 101 human actions classes from videos in the wild. In CRCV-TR-12-01."},{"key":"1779_CR82","unstructured":"Srivastava, N., Mansimov, E., & Salakhutdinov, R. (2015). Unsupervised learning of video representations using LSTMs. In ICML."},{"key":"1779_CR83","unstructured":"Stroud, J. C., Ross, D. A., Sun, C., Deng, J., Sukthankar, R., & Schmid, C. (2020). Learning video representations from textual web supervision. arXiv preprint arXiv:2007.14937."},{"key":"1779_CR84","doi-asserted-by":"crossref","unstructured":"Sultani, W., Chen, C., & Shah, M. (2018). Real-world anomaly detection in surveillance videos. In CVPR.","DOI":"10.1109\/CVPR.2018.00678"},{"key":"1779_CR85","doi-asserted-by":"crossref","unstructured":"Tibshirani, R., Walther, G., & Hastie, T. (2001). Estimating the number of cluster in a data set via the gap statistic. Journal of the Royal Statistical Society: Series B, 411\u2013423.","DOI":"10.1111\/1467-9868.00293"},{"key":"1779_CR86","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., & Paluri, M. (2015). Learning spatiotemporal features with 3D convolutional networks. In ICCV.","DOI":"10.1109\/ICCV.2015.510"},{"key":"1779_CR87","doi-asserted-by":"crossref","unstructured":"Tran, D., Wang, H., Torresani, L., Ray, J., LeCun, Y., & Paluri, M. (2018). A closer look at spatiotemporal convolutions for action recognition. In CVPR.","DOI":"10.1109\/CVPR.2018.00675"},{"issue":"1","key":"1779_CR88","doi-asserted-by":"publisher","first-page":"60","DOI":"10.1007\/s11263-012-0594-8","volume":"103","author":"H Wang","year":"2013","unstructured":"Wang, H., Klaser, A., Schmid, C., & Liu, C. L. (2013). Dense trajectories and motion boundary descriptors for action recognition. International Journal of Computer Vision, 103(1), 60\u201379.","journal-title":"International Journal of Computer Vision"},{"key":"1779_CR89","doi-asserted-by":"crossref","unstructured":"Wang, H., Tran, D., Torresani, L., & Feiszli, M. (2020). Video modeling with correlation networks. In CVPR.","DOI":"10.1109\/CVPR42600.2020.00043"},{"key":"1779_CR90","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., & Gool L. V. (2016). Temporal segment networks: Towards good practices for deep action recognition. In ECCV.","DOI":"10.1007\/978-3-319-46484-8_2"},{"issue":"11","key":"1779_CR91","doi-asserted-by":"publisher","first-page":"2740","DOI":"10.1109\/TPAMI.2018.2868668","volume":"41","author":"L Wang","year":"2018","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., & Gool, L. (2018). Temporal segment networks for action recognition in videos. IEEE Transactions on PAMI, 41(11), 2740\u20132755.","journal-title":"IEEE Transactions on PAMI"},{"key":"1779_CR92","doi-asserted-by":"crossref","unstructured":"Wang, L., Tong, Z., Ji, B., & Wu, G. (2021a). TDN: Temporal difference networks for efficient action recognition. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00193"},{"key":"1779_CR93","unstructured":"Wang, M., Xing, J., & Liu, Y. (2021b). ActionCLIP: A new paradigm for video action recognition. arXiv preprint arXiv:2109.08472."},{"key":"1779_CR94","doi-asserted-by":"crossref","unstructured":"Wang, X., & Gupta, A. (2015). Unsupervised learning of visual representations using videos. In ICCV.","DOI":"10.1109\/ICCV.2015.320"},{"key":"1779_CR95","doi-asserted-by":"crossref","unstructured":"Wang, X., & Gupta, A. (2018). Videos as space-time region graphs. In ECCV.","DOI":"10.1007\/978-3-030-01228-1_25"},{"key":"1779_CR96","doi-asserted-by":"crossref","unstructured":"Wang, X., Girshick, R., Gupta, A., & He, K. (2018b). Non-local neural networks. In CVPR.","DOI":"10.1109\/CVPR.2018.00813"},{"key":"1779_CR97","doi-asserted-by":"crossref","unstructured":"Wang, X., Jabri, A., & Efros, A. A. (2019). Learning correspondence from the cycle-consistency of time. In CVPR.","DOI":"10.1109\/CVPR.2019.00267"},{"key":"1779_CR98","doi-asserted-by":"crossref","unstructured":"Wang, Z., She, Q., & Smolic, A. (2021c). ACTION-net: Multipath excitation for action recognition. In CVPR.","DOI":"10.1109\/CVPR46437.2021.01301"},{"key":"1779_CR99","doi-asserted-by":"crossref","unstructured":"Wei, C., Fan, H., Xie, S., Wu, C. Y., Yuille, A., & Feichtenhofer, C. (2021). Masked feature prediction for self-supervised visual pre-training. arXiv preprint arXiv:2112.09133.","DOI":"10.1109\/CVPR52688.2022.01426"},{"key":"1779_CR100","doi-asserted-by":"crossref","unstructured":"Wei, D., Lim, J., Zisserman, A., & Freeman, W. T. (2018). Learning and using the arrow of time. In CVPR.","DOI":"10.1109\/CVPR.2018.00840"},{"key":"1779_CR101","doi-asserted-by":"publisher","first-page":"1484","DOI":"10.1007\/s11263-020-01409-9","volume":"129","author":"X Wu","year":"2021","unstructured":"Wu, X., Wang, R., Hou, J., Lin, H., & Luo, J. (2021). Spatial\u2013temporal relation reasoning for action prediction in videos. International Journal of Computer Vision, 129, 1484\u20131505.","journal-title":"International Journal of Computer Vision"},{"key":"1779_CR102","doi-asserted-by":"crossref","unstructured":"Xie, S., Sun, C., Huang, J., Tu, Z., & Murphy, K. (2018). Rethinking spatiotemporal feature learning: Speed-accuracy trade-offs in video classification. In ECCV.","DOI":"10.1007\/978-3-030-01267-0_19"},{"key":"1779_CR103","doi-asserted-by":"crossref","unstructured":"Xu, D., Xiao, J., Zhao, Z., Shao, J., Xie, D., & Zhuang, Y. (2019). Self-supervised spatiotemporal learning via video clip order prediction. In CVPR.","DOI":"10.1109\/CVPR.2019.01058"},{"key":"1779_CR104","doi-asserted-by":"crossref","unstructured":"Yan, S., Xiong, X., Arnab, A., Lu, Z., Zhang, M., Sun, C., & Schmid, C. (2022). Multiview transformers for video recognition. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00333"},{"key":"1779_CR105","unstructured":"Yang, C., Xu, Y., Dai, B., & Zhou, B. (2020a). Video representation learning with visual tempo consistency. arXiv preprint arXiv:2006.15489."},{"key":"1779_CR106","doi-asserted-by":"crossref","unstructured":"Yang, C., Xu, Y., Shi, J., Dai, B., & Zhou, B. (2020b). Temporal pyramid network for action recognition. In CVPR.","DOI":"10.1109\/CVPR42600.2020.00067"},{"key":"1779_CR107","doi-asserted-by":"crossref","unstructured":"Yang, J., Feng, L., Chen, W., Yan, X., Zheng, H., Luo, P., & Zhang, W. (2020c). Webly supervised image classification with self-contained confidence. In ECCV.","DOI":"10.1007\/978-3-030-58598-3_46"},{"key":"1779_CR108","doi-asserted-by":"crossref","unstructured":"Yao, T., Zhang, Y., Qiu, Z., Pan, Y., & Mei, T. (2021). Seco: Exploring sequence supervision for unsupervised representation learning. In AAAI.","DOI":"10.1609\/aaai.v35i12.17274"},{"key":"1779_CR109","unstructured":"Yao, T., Li, Y., Pan, Y., Wang, Y., Zhang, X. P., & Mei, T. (2022a). Dual vision transformer. arXiv preprint arXiv:2207.04976."},{"key":"1779_CR110","doi-asserted-by":"crossref","unstructured":"Yao, T., Pan, Y., Li, Y., Ngo, C. W., & Mei, T. (2022b). Wave-ViT: Unifying wavelet and transformers for visual representation learning. In ECCV.","DOI":"10.1007\/978-3-031-19806-9_19"},{"key":"1779_CR111","doi-asserted-by":"crossref","unstructured":"Zabih, R., & Woodfill, J. (1994). Non-parametric local transforms for computing visual correspondence. In ECCV.","DOI":"10.1007\/BFb0028345"},{"key":"1779_CR112","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Li, X., Liu, C., Shuai, B., Zhu, Y., Brattoli, B., Chen, H., Marsic, I., & Tighe, J. (2021). VidTr: Video transformer without convolutions. In ICCV.","DOI":"10.1109\/ICCV48922.2021.01332"},{"key":"1779_CR113","doi-asserted-by":"publisher","first-page":"74","DOI":"10.1007\/s11263-019-01211-2","volume":"128","author":"Y Zhao","year":"2021","unstructured":"Zhao, Y., Xiong, Y., Wang, L., Wu, Z., Tang, X., & Lin, D. (2021). Temporal action detection with structured segment networks. International Journal of Computer Vision, 128, 74\u201395.","journal-title":"International Journal of Computer Vision"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01779-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-023-01779-w\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01779-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,6,17]],"date-time":"2023-06-17T09:07:51Z","timestamp":1686992871000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-023-01779-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,3,31]]},"references-count":113,"journal-issue":{"issue":"7","published-print":{"date-parts":[[2023,7]]}},"alternative-id":["1779"],"URL":"https:\/\/doi.org\/10.1007\/s11263-023-01779-w","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,3,31]]},"assertion":[{"value":"1 August 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 March 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 March 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}