{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T08:18:56Z","timestamp":1772698736050,"version":"3.50.1"},"publisher-location":"Cham","reference-count":35,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783032101914","type":"print"},{"value":"9783032101921","type":"electronic"}],"license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-3-032-10192-1_21","type":"book-chapter","created":{"date-parts":[[2026,1,2]],"date-time":"2026-01-02T00:47:49Z","timestamp":1767314869000},"page":"249-260","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["T-EVO: Tracking in Egovision for Online Visual Episodic Memory"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-9770-0414","authenticated-orcid":false,"given":"Zaira","family":"Manigrasso","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Antonio","family":"Finocchiaro","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-6007-9878","authenticated-orcid":false,"given":"Davide","family":"Marana","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-2334-0307","authenticated-orcid":false,"given":"Rosario","family":"Forte","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3049-2590","authenticated-orcid":false,"given":"Moritz","family":"Nottebaum","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1672-667X","authenticated-orcid":false,"given":"Matteo","family":"Dunnhofer","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6034-0432","authenticated-orcid":false,"given":"Giovanni Maria","family":"Farinella","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6911-0302","authenticated-orcid":false,"given":"Antonino","family":"Furnari","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4503-7483","authenticated-orcid":false,"given":"Christian","family":"Micheloni","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,1,2]]},"reference":[{"key":"21_CR1","doi-asserted-by":"crossref","unstructured":"Bertinetto, L., Valmadre, J., Henriques, J.F., Vedaldi, A., Torr, P.H.: Fully-convolutional Siamese networks for object tracking. In: ECCVW (2016)","DOI":"10.1007\/978-3-319-48881-3_56"},{"key":"21_CR2","doi-asserted-by":"crossref","unstructured":"Bhat, G., Danelljan, M., Gool, L.V., Timofte, R.: Learning discriminative model prediction for tracking. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00628"},{"key":"21_CR3","doi-asserted-by":"crossref","unstructured":"Bhat, G., Danelljan, M., Van\u00a0Gool, L., Timofte, R.: Know your surroundings: exploiting scene information for object tracking. In: ECCV (2020)","DOI":"10.1007\/978-3-030-58592-1_13"},{"key":"21_CR4","doi-asserted-by":"crossref","unstructured":"Bolme, D.S., Beveridge, J.R., Draper, B.A., Lui, Y.M.: Visual object tracking using adaptive correlation filters. In: CVPR (2010)","DOI":"10.1109\/CVPR.2010.5539960"},{"key":"21_CR5","doi-asserted-by":"crossref","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., Zagoruyko, S.: End-to-end object detection with transformers. In: ECCV (2020)","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"21_CR6","unstructured":"Chen, G., et\u00a0al.: InternVideo-Ego4D: a pack of champion solutions to Ego4D challenges (2022). arXiv:2211.09529"},{"key":"21_CR7","doi-asserted-by":"crossref","unstructured":"Datta, S., et al.: Episodic memory question answering. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01853"},{"key":"21_CR8","doi-asserted-by":"crossref","unstructured":"Dunnhofer, M., Furnari, A., Farinella, G., Micheloni, C.: Is first person vision challenging for object tracking? In: ICCVW (2021)","DOI":"10.1109\/ICCVW54120.2021.00304"},{"key":"21_CR9","doi-asserted-by":"crossref","unstructured":"Dunnhofer, M., Furnari, A., Farinella, G.M., Micheloni, C.: Visual object tracking in first person vision. IJCV (2023)","DOI":"10.1007\/s11263-022-01694-6"},{"key":"21_CR10","doi-asserted-by":"crossref","unstructured":"Dunnhofer, M., Martinel, N., Micheloni, C.: Weakly-supervised domain adaptation of deep regression trackers via reinforced knowledge distillation. IEEE Robot. Autom. Lett. (2021)","DOI":"10.1109\/LRA.2021.3070816"},{"key":"21_CR11","doi-asserted-by":"crossref","unstructured":"Furnari, A., Farinella, G.M.: Rolling-unrolling LSTMs for action anticipation from first-person video. IEEE TPAMI (2020)","DOI":"10.1109\/TPAMI.2020.2992889"},{"key":"21_CR12","unstructured":"Grauman, K., et\u00a0al.: Ego4D: around the world in 3,000 hours of egocentric video. In: CVPR (2022)"},{"key":"21_CR13","unstructured":"Jiang, H., Ramakrishnan, S.K., Grauman, K.: Single-stage visual query localization in egocentric videos. NeurIPS (2023)"},{"key":"21_CR14","unstructured":"Khalil, A.A.D., et al.: Epic-kitchens visor benchmark: Video segmentations and object relations. In: NeurIPS (2022)"},{"key":"21_CR15","doi-asserted-by":"crossref","unstructured":"Khosla, S., TV, S., Schwing, A., Hoiem, D.: Relocate: a simple training-free baseline for visual query localization using region-based representations (2024). arXiv:2412.01826","DOI":"10.1109\/CVPR52734.2025.00350"},{"key":"21_CR16","unstructured":"Kristan, M., et\u00a0al.: The tenth visual object tracking VOT2022 challenge results. In: ECCVW (2022)"},{"key":"21_CR17","unstructured":"Kristan, M., et\u00a0al.: The first visual object tracking segmentation VOTS2023 challenge results. In: ICCVW (2023)"},{"key":"21_CR18","doi-asserted-by":"crossref","unstructured":"Lin, T.Y., Doll\u00e1r, P., Girshick, R., He, K., Hariharan, B., Belongie, S.: Feature pyramid networks for object detection. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.106"},{"key":"21_CR19","doi-asserted-by":"crossref","unstructured":"Meinhardt, T., Kirillov, A., Leal-Taixe, L., Feichtenhofer, C.: Trackformer: multi-object tracking with transformers. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00864"},{"key":"21_CR20","unstructured":"Pei, B., et\u00a0al.: EgoVideo: exploring egocentric foundation model and downstream adaptation (2024). arXiv:2406.18070"},{"key":"21_CR21","doi-asserted-by":"crossref","unstructured":"Plizzari, C., et al.: An outlook into the future of egocentric vision. IJCV (2024)","DOI":"10.1007\/s11263-024-02095-7"},{"key":"21_CR22","doi-asserted-by":"crossref","unstructured":"Redmon, J., Divvala, S., Girshick, R., Farhadi, A.: You only look once: unified, real-time object detection. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.91"},{"key":"21_CR23","doi-asserted-by":"crossref","unstructured":"Ren, S., He, K., Girshick, R., Sun, J.: Faster R-CNN: towards real-time object detection with region proposal networks. IEEE TPAMI (2016)","DOI":"10.1109\/TPAMI.2016.2577031"},{"key":"21_CR24","doi-asserted-by":"crossref","unstructured":"Shan, D., Geng, J., Shu, M., Fouhey, D.F.: Understanding human hands in contact at internet scale. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00989"},{"key":"21_CR25","unstructured":"Tang, H., Liang, K.J., Grauman, K., Feiszli, M., Wang, W.: EgoTracks: a long-term egocentric visual object tracking dataset. NeurIPS (2023)"},{"key":"21_CR26","doi-asserted-by":"crossref","unstructured":"Tulving, E.: Episodic memory: from mind to brain. Annu. Rev. Psychol. (2002)","DOI":"10.1146\/annurev.psych.53.100901.135114"},{"key":"21_CR27","doi-asserted-by":"crossref","unstructured":"Voigtlaender, P., Luiten, J., Torr, P.H., Leibe, B.: Siam R-CNN: visual tracking by re-detection. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00661"},{"key":"21_CR28","unstructured":"Wang, A., Chen, H., Liu, L., Chen, K., Lin, Z., Han, J., et\u00a0al.: YOLOv10: real-time end-to-end object detection. NeurIPS (2024)"},{"key":"21_CR29","doi-asserted-by":"crossref","unstructured":"Wang, X., Wu, Y., Zhu, L., Yang, Y.: Symbiotic attention with privileged information for egocentric action recognition. In: AAAI (2020)","DOI":"10.1609\/aaai.v34i07.6907"},{"key":"21_CR30","doi-asserted-by":"crossref","unstructured":"Wojke, N., Bewley, A., Paulus, D.: Simple online and realtime tracking with a deep association metric. In: ICIP (2017)","DOI":"10.1109\/ICIP.2017.8296962"},{"key":"21_CR31","unstructured":"Xu, M., Fu, C.Y., Li, Y., Ghanem, B., Perez-Rua, J.M., Xiang, T.: Negative frames matter in egocentric visual query 2d localization (2022). arXiv:2208.01949"},{"key":"21_CR32","doi-asserted-by":"crossref","unstructured":"Xu, M., Li, Y., Fu, C.Y., Ghanem, B., Xiang, T., P\u00e9rez-R\u00faa, J.M.: Where is my wallet? Modeling object proposal sets for egocentric visual query localization. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00255"},{"key":"21_CR33","doi-asserted-by":"crossref","unstructured":"Yan, B., Peng, H., Fu, J., Wang, D., Lu, H.: Learning spatio-temporal transformer for visual tracking. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.01028"},{"key":"21_CR34","doi-asserted-by":"crossref","unstructured":"Zhang, C.L., Wu, J., Li, Y.: ActionFormer: localizing moments of actions with transformers. In: ECCV (2022)","DOI":"10.1007\/978-3-031-19772-7_29"},{"key":"21_CR35","doi-asserted-by":"crossref","unstructured":"Zhou, P., Chi, M.: Relation parsing neural network for human-object interaction detection. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00093"}],"container-title":["Lecture Notes in Computer Science","Image Analysis and Processing \u2013 ICIAP 2025"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-032-10192-1_21","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T07:37:34Z","timestamp":1772696254000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-032-10192-1_21"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"ISBN":["9783032101914","9783032101921"],"references-count":35,"URL":"https:\/\/doi.org\/10.1007\/978-3-032-10192-1_21","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]},"assertion":[{"value":"2 January 2026","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICIAP","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Image Analysis and Processing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Rome","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"15 September 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"19 September 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"iciap2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/www.iciap.org\/home","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}