{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,19]],"date-time":"2026-01-19T02:25:13Z","timestamp":1768789513778,"version":"3.49.0"},"publisher-location":"Cham","reference-count":60,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031197772","type":"print"},{"value":"9783031197789","type":"electronic"}],"license":[{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022]]},"DOI":"10.1007\/978-3-031-19778-9_35","type":"book-chapter","created":{"date-parts":[[2022,11,2]],"date-time":"2022-11-02T20:28:41Z","timestamp":1667420921000},"page":"604-620","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["SOS! Self-supervised Learning over\u00a0Sets of\u00a0Handled Objects in\u00a0Egocentric Action Recognition"],"prefix":"10.1007","author":[{"given":"Victor","family":"Escorcia","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ricardo","family":"Guerrero","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiatian","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Brais","family":"Martinez","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,11,3]]},"reference":[{"key":"35_CR1","doi-asserted-by":"crossref","unstructured":"Bambach, S., Lee, S., Crandall, D.J., Yu, C.: Lending a hand: detecting hands and recognizing activities in complex egocentric interactions. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.226"},{"key":"35_CR2","doi-asserted-by":"crossref","unstructured":"Baradel, F., Neverova, N., Wolf, C., Mille, J., Mori, G.: Object level visual reasoning in videos. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01261-8_7"},{"key":"35_CR3","unstructured":"Bertasius, G., Torresani, L.: COBE: contextualized object embeddings from narrated instructional video. In: NeurIPS (2020)"},{"key":"35_CR4","unstructured":"Bulat, A., Perez-Rua, J.M., Sudhakaran, S., Martinez, B., Tzimiropoulos, G.: Space-time mixing attention for video transformer. In: NeurIPS (2021)"},{"key":"35_CR5","unstructured":"Caron, M., Misra, I., Mairal, J., Goyal, P., Bojanowski, P., Joulin, A.: Unsupervised learning of visual features by contrasting cluster assignments. In: NeurIPS (2020)"},{"key":"35_CR6","doi-asserted-by":"crossref","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition? a new model and the kinetics dataset. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.502"},{"key":"35_CR7","unstructured":"Chen, T., Kornblith, S., Norouzi, M., Hinton, G.: A simple framework for contrastive learning of visual representations. In: ICML (2020)"},{"key":"35_CR8","doi-asserted-by":"crossref","unstructured":"Chen, X., He, K.: Exploring simple Siamese representation learning. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.01549"},{"key":"35_CR9","doi-asserted-by":"crossref","unstructured":"Damen, D., et al.: Scaling egocentric vision: the epic-kitchens dataset. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01225-0_44"},{"key":"35_CR10","doi-asserted-by":"crossref","unstructured":"Damen, D., et al.: Rescaling egocentric vision: collection pipeline and challenges for epic-kitchens-100. In: IJCV (2021)","DOI":"10.1007\/s11263-021-01531-2"},{"issue":"6","key":"35_CR11","doi-asserted-by":"publisher","first-page":"1367","DOI":"10.1109\/TPAMI.2018.2832629","volume":"41","author":"Q Dong","year":"2018","unstructured":"Dong, Q., Gong, S., Zhu, X.: Imbalanced deep learning by minority class incremental rectification. IEEE TPAMI 41(6), 1367\u20131381 (2018)","journal-title":"IEEE TPAMI"},{"key":"35_CR12","doi-asserted-by":"crossref","unstructured":"Escorcia, V., Carlos Niebles, J.: Spatio-temporal human-object interactions for action recognition in videos. In: ICCVW, June 2013","DOI":"10.1109\/ICCVW.2013.72"},{"key":"35_CR13","unstructured":"Escorcia, V., Soldan, M., Sivic, J., Ghanem, B., Russell, B.C.: Temporal localization of moments in video collections with natural language. CoRR abs\/1907.12763 (2019). arXiv:1907.12763"},{"key":"35_CR14","unstructured":"Falcon, W.: Pytorch lightning. https:\/\/github.com\/PytorchLightning\/pytorch-lightning (2019)"},{"key":"35_CR15","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Fan, H., Malik, J., He, K.: SlowFast networks for video recognition. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00630"},{"key":"35_CR16","doi-asserted-by":"crossref","unstructured":"Gkioxari, G., Girshick, R., Doll\u00e1r, P., He, K.: Detecting and recognizing human-object interactions. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00872"},{"key":"35_CR17","unstructured":"Goyal, P., et al.: Self-supervised pretraining of visual features in the wild. CoRR (2021). arXiv:2103.01988"},{"key":"35_CR18","unstructured":"Grill, J.B., et al.: Bootstrap your own latent: a new approach to self-supervised learning. In: NeurIPS (2020)"},{"key":"35_CR19","doi-asserted-by":"crossref","unstructured":"Harris, C.R., et al.: Array programming with NumPy. Nature 585(7825), 357\u2013362 (2020)","DOI":"10.1038\/s41586-020-2649-2"},{"key":"35_CR20","doi-asserted-by":"crossref","unstructured":"He, K., Fan, H., Wu, Y., Xie, S., Girshick, R.: Momentum contrast for unsupervised visual representation learning. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"35_CR21","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"35_CR22","doi-asserted-by":"crossref","unstructured":"Hou, Z., Peng, X., Qiao, Y., Tao, D.: Visual compositional learning for human-object interaction detection. In: ECCV (2020)","DOI":"10.1109\/CVPR46437.2021.00056"},{"key":"35_CR23","doi-asserted-by":"crossref","unstructured":"Huang, C., Li, Y., Loy, C.C., Tang, X.: Learning deep representation for imbalanced classification. In: CVPR, pp. 5375\u20135384 (2016)","DOI":"10.1109\/CVPR.2016.580"},{"key":"35_CR24","first-page":"7795","volume":"29","author":"Y Huang","year":"2020","unstructured":"Huang, Y., Cai, M., Li, Z., Lu, F., Sato, Y.: Mutual context network for jointly estimating egocentric gaze and action. IEEE TIP 29, 7795\u20137806 (2020)","journal-title":"IEEE TIP"},{"key":"35_CR25","unstructured":"Kang, B., Li, Y., Xie, S., Yuan, Z., Feng, J.: Exploring balanced feature spaces for representation learning. In: ICLR (2021)"},{"key":"35_CR26","unstructured":"Kang, B., et al.: Decoupling representation and classifier for long-tailed recognition. In: ICLR (2020)"},{"key":"35_CR27","unstructured":"Kazakos, E., Huh, J., Nagrani, A., Zisserman, A., Damen, D.: With a little help from my temporal context: multimodal egocentric action recognition. In: BMVC (2021)"},{"key":"35_CR28","doi-asserted-by":"crossref","unstructured":"Kazakos, E., Nagrani, A., Zisserman, A., Damen, D.: Epic-fusion: audio-visual temporal binding for egocentric action recognition. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00559"},{"key":"35_CR29","doi-asserted-by":"crossref","unstructured":"Kazakos, E., Nagrani, A., Zisserman, A., Damen, D.: Slow-fast auditory streams for audio recognition. In: ICASSP (2021)","DOI":"10.1109\/ICASSP39728.2021.9413376"},{"key":"35_CR30","doi-asserted-by":"crossref","unstructured":"Li, Y., Nagarajan, T., Xiong, B., Grauman, K.: Ego-Exo: Transferring visual representations from third-person to first-person videos. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00687"},{"key":"35_CR31","doi-asserted-by":"crossref","unstructured":"Li, Y., Liu, M., Rehg, J.: In the eye of the beholder: gaze and actions in first person video. IEEE TPAMI (2021)","DOI":"10.1109\/TPAMI.2021.3051319"},{"key":"35_CR32","doi-asserted-by":"crossref","unstructured":"Li, Y., Liu, M., Rehg, J.M.: In the eye of beholder: Joint learning of gaze and actions in first person video. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01228-1_38"},{"key":"35_CR33","unstructured":"Li, Y.L., Liu, X., Wu, X., Li, Y., Lu, C.: Hoi analysis: Integrating and decomposing human-object interaction. In: NeurIPS (2020)"},{"key":"35_CR34","doi-asserted-by":"crossref","unstructured":"Lin, J., Gan, C., Han, S.: Temporal shift module for efficient video understanding. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00718"},{"key":"35_CR35","doi-asserted-by":"crossref","unstructured":"Liu, M., Tang, S., Li, Y., Rehg, J.M.: Forecasting human-object interaction: joint prediction of motor attention and actions in first person video. In: ECCV (2020)","DOI":"10.1007\/978-3-030-58452-8_41"},{"key":"35_CR36","unstructured":"Menon, A.K., Jayasumana, S., Rawat, A.S., Jain, H., Veit, A., Kumar, S.: Long-tail learning via logit adjustment. In: ICLR (2021)"},{"key":"35_CR37","unstructured":"Narasimhaswamy, S., Nguyen, T., Hoai, M.: Detecting hands and recognizing physical contact in the wild. In: NeurIPS (2020)"},{"key":"35_CR38","unstructured":"Paszke, A., et al.: PyTorch: an imperative style, high-performance deep learning library. In: Wallach, H., Larochelle, H., Beygelzimer, A., d\u2019 Alch\u00e9-Buc, F., Fox, E., Garnett, R. (eds.) NIPS, pp. 8024\u20138035 (2019). https:\/\/papers.neurips.cc\/paper\/9015-pytorch-an-imperative-style-high-performance-deep-learning-library.pdf"},{"key":"35_CR39","unstructured":"Purushwalkam, S., Gupta, A.: Demystifying contrastive self-supervised learning: invariances, augmentations and dataset biases. In: NeurIPS (2020)"},{"key":"35_CR40","doi-asserted-by":"crossref","unstructured":"Qi, S., Wang, W., Jia, B., Shen, J., Zhu, S.: Learning human-object interactions by graph parsing neural networks. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01240-3_25"},{"key":"35_CR41","doi-asserted-by":"crossref","unstructured":"Reed, C.J., et al.: Self-supervised pretraining improves self-supervised pretraining. arXiv:2103.12718 (2021)","DOI":"10.1109\/WACV51458.2022.00112"},{"issue":"3","key":"35_CR42","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky, O., et al.: ImageNet large scale visual recognition challenge. IJCV 115(3), 211\u2013252 (2015)","journal-title":"IJCV"},{"key":"35_CR43","doi-asserted-by":"crossref","unstructured":"Shan, D., Geng, J., Shu, M., Fouhey, D.F.: Understanding human hands in contact at internet scale. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00989"},{"key":"35_CR44","doi-asserted-by":"crossref","unstructured":"Sigurdsson, G.A., Gupta, A., Schmid, C., Farhadi, A., Alahari, K.: Actor and observer: joint modeling of first and third-person videos. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00772"},{"key":"35_CR45","unstructured":"Soomro, K., Zamir, A.R., Shah, M.: Ucf101: a dataset of 101 human actions classes from videos in the wild. arXiv preprint arXiv:1212.0402 (2012)"},{"key":"35_CR46","doi-asserted-by":"crossref","unstructured":"Sudhakaran, S., Escalera, S., Lanz, O.: LSTA: long short-term attention for egocentric action recognition. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.01019"},{"key":"35_CR47","doi-asserted-by":"crossref","unstructured":"Sudhakaran, S., Lanz, O.: Attention is all we need: nailing down object-centric attention for egocentric activity recognition. In: BMVC (2018)","DOI":"10.1109\/CVPR.2019.01019"},{"key":"35_CR48","doi-asserted-by":"crossref","unstructured":"Sun, C., Nagrani, A., Tian, Y., Schmid, C.: Composable augmentation encoding for video representation learning. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00871"},{"key":"35_CR49","unstructured":"Umesh, P.: Image processing in python. CSI Commun. 23 (2012)"},{"key":"35_CR50","doi-asserted-by":"crossref","unstructured":"Vondrick, C., Shrivastava, A., Fathi, A., Guadarrama, S., Murphy, K.: Tracking emerges by colorizing videos. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01261-8_24"},{"issue":"11","key":"35_CR51","doi-asserted-by":"publisher","first-page":"2740","DOI":"10.1109\/TPAMI.2018.2868668","volume":"41","author":"L Wang","year":"2018","unstructured":"Wang, L., et al.: Temporal segment networks for action recognition in videos. IEEE TPAMI 41(11), 2740\u20132755 (2018)","journal-title":"IEEE TPAMI"},{"key":"35_CR52","doi-asserted-by":"crossref","unstructured":"Wang, X., Wu, Y., Zhu, L., Yang, Y.: Symbiotic attention with privileged information for egocentric action recognition. In: AAAI (2020)","DOI":"10.1609\/aaai.v34i07.6907"},{"key":"35_CR53","doi-asserted-by":"crossref","unstructured":"Wang, X., Zhu, L., Wang, H., Yang, Y.: Interactive prototype learning for egocentric action recognition. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00806"},{"key":"35_CR54","doi-asserted-by":"crossref","unstructured":"Wang, X., Gupta, A.: Videos as space-time region graphs. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01228-1_25"},{"key":"35_CR55","doi-asserted-by":"crossref","unstructured":"Wang, X., He, K., Gupta, A.: Transitive invariance for self-supervised visual representation learning. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.149"},{"key":"35_CR56","doi-asserted-by":"crossref","unstructured":"Wu, C.Y., Feichtenhofer, C., Fan, H., He, K., Krahenbuhl, P., Girshick, R.: Long-term feature banks for detailed video understanding. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00037"},{"key":"35_CR57","unstructured":"Yan, R., Xie, L., Shu, X., Tang, J.: Interactive fusion of multi-level features for compositional activity recognition. arXiv:2012.05689 (2020)"},{"key":"35_CR58","first-page":"19290","volume":"33","author":"Y Yang","year":"2020","unstructured":"Yang, Y., Xu, Z.: Rethinking the value of labels for improving class-imbalanced learning. NeurIPS 33, 19290\u201319301 (2020)","journal-title":"NeurIPS"},{"key":"35_CR59","doi-asserted-by":"crossref","unstructured":"Zhang, X., et al.: VideoLT: large-scale long-tailed video recognition. In: ICCV, pp. 7960\u20137969 (2021)","DOI":"10.1109\/ICCV48922.2021.00786"},{"key":"35_CR60","doi-asserted-by":"crossref","unstructured":"Zhou, B., Andonian, A., Oliva, A., Torralba, A.: Temporal relational reasoning in videos. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01246-5_49"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2022"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-19778-9_35","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,2]],"date-time":"2022-11-02T21:01:17Z","timestamp":1667422877000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-19778-9_35"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022]]},"ISBN":["9783031197772","9783031197789"],"references-count":60,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-19778-9_35","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022]]},"assertion":[{"value":"3 November 2022","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Tel Aviv","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Israel","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2022","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 October 2022","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27 October 2022","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2022","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2022.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Double-blind","order":1,"name":"type","label":"Type","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"CMT","order":2,"name":"conference_management_system","label":"Conference Management System","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"5804","order":3,"name":"number_of_submissions_sent_for_review","label":"Number of Submissions Sent for Review","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"1645","order":4,"name":"number_of_full_papers_accepted","label":"Number of Full Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"0","order":5,"name":"number_of_short_papers_accepted","label":"Number of Short Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"28% - The value is computed by the equation \"Number of Full Papers Accepted \/ Number of Submissions Sent for Review * 100\" and then rounded to a whole number.","order":6,"name":"acceptance_rate_of_full_papers","label":"Acceptance Rate of Full Papers","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.21","order":7,"name":"average_number_of_reviews_per_paper","label":"Average Number of Reviews per Paper","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.91","order":8,"name":"average_number_of_papers_per_reviewer","label":"Average Number of Papers per Reviewer","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"Yes","order":9,"name":"external_reviewers_involved","label":"External Reviewers Involved","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}}]}}