{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:28:30Z","timestamp":1740122910531,"version":"3.37.3"},"reference-count":58,"publisher":"Springer Science and Business Media LLC","issue":"15","license":[{"start":{"date-parts":[[2020,9,29]],"date-time":"2020-09-29T00:00:00Z","timestamp":1601337600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,9,29]],"date-time":"2020-09-29T00:00:00Z","timestamp":1601337600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2021,6]]},"DOI":"10.1007\/s11042-020-09902-6","type":"journal-article","created":{"date-parts":[[2020,9,29]],"date-time":"2020-09-29T17:52:38Z","timestamp":1601401958000},"page":"22487-22507","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["First-person activity recognition from micro-action representations using convolutional neural networks and object flow histograms"],"prefix":"10.1007","volume":"80","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3774-3161","authenticated-orcid":false,"given":"Panagiotis","family":"Giannakeris","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Panagiotis C.","family":"Petrantonakis","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Konstantinos","family":"Avgerinakis","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Stefanos","family":"Vrochidis","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ioannis","family":"Kompatsiaris","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,9,29]]},"reference":[{"key":"9902_CR1","doi-asserted-by":"publisher","first-page":"46","DOI":"10.1016\/j.cviu.2015.10.013","volume":"144","author":"K Avgerinakis","year":"2016","unstructured":"Avgerinakis K, Briassouli A, Kompatsiaris Y (2016) Activity detection using sequential statistical boundary detection (ssbd). Comput Vis Image Underst 144:46\u201361","journal-title":"Comput Vis Image Underst"},{"key":"9902_CR2","doi-asserted-by":"crossref","unstructured":"Bambach S, Crandall DJ, Yu C (2015) Viewpoint integration for hand-based recognition of social interactions from a first-person view. In: Proceedings of the 2015 ACM on International Conference on Multimodal Interaction. ACM, pp 351\u2013354","DOI":"10.1145\/2818346.2820771"},{"key":"9902_CR3","doi-asserted-by":"crossref","unstructured":"Bambach S, Lee S, Crandall DJ, Yu C (2015) Lending a hand: Detecting hands and recognizing activities in complex egocentric interactions. In: 2015 IEEE international conference on Computer vision (ICCV). IEEE, pp 1949\u20131957","DOI":"10.1109\/ICCV.2015.226"},{"key":"9902_CR4","doi-asserted-by":"crossref","unstructured":"Ch\u00e9ron G, Laptev I, Schmid C (2015) P-cnn: Pose-based cnn features for action recognition. In: Proceedings of the IEEE international conference on computer vision, pp 3218\u20133226","DOI":"10.1109\/ICCV.2015.368"},{"issue":"8","key":"9902_CR5","doi-asserted-by":"publisher","first-page":"1598","DOI":"10.1109\/TPAMI.2016.2537323","volume":"38","author":"CF Crispim-Junior","year":"2016","unstructured":"Crispim-Junior CF, Buso V, Avgerinakis K, Meditskos G, Briassouli A, Benois-Pineau J, Kompatsiaris I, Bremond F (2016) Semantic event fusion of different visual modality concepts for activity recognition. IEEE Trans Pattern Anal Mach Intell 38(8):1598\u20131611","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"7","key":"9902_CR6","doi-asserted-by":"publisher","first-page":"1528","DOI":"10.3390\/s17071528","volume":"17","author":"CF Crispim-Junior","year":"2017","unstructured":"Crispim-Junior CF, G\u00f3mez ur\u00eda A, Strumia C, Koperski M, K\u00f6nig A, Negin F, Cosar S, Nghiem AT, Chau DP, Charpiat G et al (2017) Online recognition of daily activities by color-depth sensing and knowledge models. Sensors 17(7):1528","journal-title":"Sensors"},{"key":"9902_CR7","unstructured":"Dai J, Li Y, He K, Sun J (2016) R-fcn: Object detection via region-based fully convolutional networks. In: Advances in neural information processing systems, pp 379\u2013387"},{"key":"9902_CR8","doi-asserted-by":"crossref","unstructured":"Dalal N, Triggs B, Schmid C (2006) Human detection using oriented histograms of flow and appearance. In: European conference on computer vision. Springer, pp 428\u2013441","DOI":"10.1007\/11744047_33"},{"key":"9902_CR9","doi-asserted-by":"crossref","unstructured":"Damen D, Doughty H, Maria Farinella G, Fidler S, Furnari A, Kazakos E, Moltisanti D, Munro J, Perrett T, Price W et al (2018) Scaling egocentric vision: The epic-kitchens dataset. In: Proceedings of the European Conference on Computer Vision (ECCV), pp 720\u2013736","DOI":"10.1007\/978-3-030-01225-0_44"},{"key":"9902_CR10","doi-asserted-by":"crossref","unstructured":"Deng J, Dong W, Socher R, Li LJ, Li K, Fei-fei L (2009) Imagenet: A large-scale hierarchical image database","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"9902_CR11","doi-asserted-by":"crossref","unstructured":"Du W, Wang Y, Qiao Y (2017) Rpan: an end-to-end recurrent pose-attention network for action recognition in videos. In: Proceedings of the IEEE International Conference on Computer Vision, pp 3725\u20133734","DOI":"10.1109\/ICCV.2017.402"},{"issue":"2","key":"9902_CR12","doi-asserted-by":"publisher","first-page":"303","DOI":"10.1007\/s11263-009-0275-4","volume":"88","author":"M Everingham","year":"2010","unstructured":"Everingham M, Van Gool L, Williams CK, Winn J, Zisserman A (2010) The pascal visual object classes (voc) challenge. Int J Comput Vis 88 (2):303\u2013338","journal-title":"Int J Comput Vis"},{"key":"9902_CR13","doi-asserted-by":"crossref","unstructured":"Fathi A, Farhadi A, Rehg JM (2011) Understanding egocentric activities. In: 2011 IEEE international conference on Computer vision (ICCV). IEEE, pp 407\u2013414","DOI":"10.1109\/ICCV.2011.6126269"},{"key":"9902_CR14","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C, Pinz A, Wildes R (2016) Spatiotemporal residual networks for video action recognition. In: Advances in neural information processing systems, pp 3468\u20133476","DOI":"10.1109\/CVPR.2017.787"},{"key":"9902_CR15","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C, Pinz A, Zisserman A (2016) Convolutional two-stream network fusion for video action recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1933\u20131941","DOI":"10.1109\/CVPR.2016.213"},{"issue":"3","key":"9902_CR16","doi-asserted-by":"publisher","first-page":"355","DOI":"10.1016\/0095-8956(88)90043-3","volume":"44","author":"P Frankl","year":"1988","unstructured":"Frankl P, Maehara H (1988) The johnson-lindenstrauss lemma and the sphericity of some graphs. J Comb Theory Ser B 44(3):355\u2013362","journal-title":"J Comb Theory Ser B"},{"key":"9902_CR17","doi-asserted-by":"crossref","unstructured":"Gaidon A, Harchaoui Z, Schmid C (2011) Actom sequence models for efficient action detection. In: CVPR 2011. IEEE, pp 3201\u20133208","DOI":"10.1109\/CVPR.2011.5995646"},{"key":"9902_CR18","doi-asserted-by":"crossref","unstructured":"Giannakeris P, Avgerinakis K, Vrochidis S, Kompatsiaris I (2018) Activity recognition from wearable cameras. In: 2018 International conference on content-based multimedia indexing (CBMI). IEEE, pp 1\u20136","DOI":"10.1109\/CBMI.2018.8516553"},{"key":"9902_CR19","doi-asserted-by":"crossref","unstructured":"Girshick R (2015) Fast r-cnn. In: Proceedings of the IEEE international conference on computer vision, pp 1440\u20131448","DOI":"10.1109\/ICCV.2015.169"},{"key":"9902_CR20","doi-asserted-by":"crossref","unstructured":"Gonz\u00e1lez-D\u00edaz I, Benois-Pineau J, Domenger JP, Cattaert D, de Rugy A (2019) Perceptually-guided deep neural networks for ego-action prediction: Object grasping. Pattern Recogn 88:223\u2013235","DOI":"10.1016\/j.patcog.2018.11.013"},{"key":"9902_CR21","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"issue":"3","key":"9902_CR22","doi-asserted-by":"publisher","first-page":"583","DOI":"10.1109\/TPAMI.2014.2345390","volume":"37","author":"JF Henriques","year":"2015","unstructured":"Henriques JF, Caseiro R, Martins P, Batista J (2015) High-speed tracking with kernelized correlation filters. IEEE Trans Pattern Anal Mach Intell 37(3):583\u2013596","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"9902_CR23","doi-asserted-by":"crossref","unstructured":"Huang J, Rathod V, Sun C, Zhu M, Korattikara A, Fathi A, Fischer I, Wojna Z, Song Y, Guadarrama S et al (2017) Speed\/accuracy trade-offs for modern convolutional object detectors. In: IEEE CVPR","DOI":"10.1109\/CVPR.2017.351"},{"key":"9902_CR24","doi-asserted-by":"crossref","unstructured":"Jain M, Jegou H, Bouthemy P (2013) Better exploiting motion for better action recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2555\u20132562","DOI":"10.1109\/CVPR.2013.330"},{"key":"9902_CR25","doi-asserted-by":"crossref","unstructured":"Jhuang H, Gall J, Zuffi S, Schmid C, Black MJ (2013) Towards understanding action recognition. In: Proceedings of the IEEE international conference on computer vision, pp 3192\u20133199","DOI":"10.1109\/ICCV.2013.396"},{"key":"9902_CR26","unstructured":"Jin P, Rathod V, Zhu X (2018) Pooling pyramid network for object detection. arXiv:1807.03284"},{"issue":"189-206","key":"9902_CR27","first-page":"1","volume":"26","author":"WB Johnson","year":"1984","unstructured":"Johnson WB, Lindenstrauss J (1984) Extensions of lipschitz mappings into a hilbert space. Contemp Math 26(189-206):1","journal-title":"Contemp Math"},{"key":"9902_CR28","doi-asserted-by":"crossref","unstructured":"Kong T, Sun F, Yao A, Liu H, Lu M, Chen Y (2017) Ron: Reverse connection with objectness prior networks for object detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 5936\u20135944","DOI":"10.1109\/CVPR.2017.557"},{"key":"9902_CR29","doi-asserted-by":"crossref","unstructured":"Kroeger T, Timofte R, Dai D, Van Gool L (2016) Fast optical flow using dense inverse search. In: European conference on computer vision. Springer, pp 471\u2013488","DOI":"10.1007\/978-3-319-46493-0_29"},{"key":"9902_CR30","unstructured":"Kuznetsova A, Rom H, Alldrin N, Uijlings J, Krasin I, Pont-Tuset J, Kamali S, Popov S, Malloci M, Duerig T et al (2018) The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale. arXiv:1811.00982"},{"key":"9902_CR31","doi-asserted-by":"crossref","unstructured":"Li Y, Liu M, Rehg JM (2018) In the eye of beholder: Joint learning of gaze and actions in first person video. In: Proceedings of the European Conference on Computer Vision (ECCV), pp 619\u2013635","DOI":"10.1007\/978-3-030-01228-1_38"},{"key":"9902_CR32","doi-asserted-by":"crossref","unstructured":"Lin TY, Maire M, Belongie S, Hays J, Perona P, Ramanan D, Doll\u00e1r P, Zitnick CL (2014) Microsoft coco: Common objects in context. In: European conference on computer vision. Springer, pp 740\u2013755","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"9902_CR33","doi-asserted-by":"crossref","unstructured":"Liu W, Anguelov D, Erhan D, Szegedy C, Reed S, Fu CY, Berg AC (2016) Ssd: Single shot multibox detector. In: European conference on computer vision. Springer, pp 21\u201337","DOI":"10.1007\/978-3-319-46448-0_2"},{"key":"9902_CR34","doi-asserted-by":"crossref","unstructured":"McCandless T, Grauman K (2013) Object-centric spatio-temporal pyramids for egocentric activity recognition. In: BMVC, vol 2, pp 3","DOI":"10.5244\/C.27.30"},{"key":"9902_CR35","doi-asserted-by":"publisher","first-page":"169","DOI":"10.1016\/j.jvcir.2018.01.009","volume":"51","author":"G Meditskos","year":"2018","unstructured":"Meditskos G, Plans PM, Stavropoulos TG, Benois-Pineau J, Buso V, Kompatsiaris I (2018) Multi-modal activity recognition from egocentric vision, semantic enrichment and lifelogging applications for the care of dementia. J Vis Commun Image Represent 51:169\u2013190","journal-title":"J Vis Commun Image Represent"},{"key":"9902_CR36","doi-asserted-by":"crossref","unstructured":"Ohnishi K, Kanehira A, Kanezaki A, Harada T (2016) Recognizing activities of daily living with a wrist-mounted camera. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 3103\u20133111","DOI":"10.1109\/CVPR.2016.338"},{"issue":"2","key":"9902_CR37","doi-asserted-by":"publisher","first-page":"217","DOI":"10.1006\/jcss.2000.1711","volume":"61","author":"CH Papadimitriou","year":"2000","unstructured":"Papadimitriou CH, Raghavan P, Tamaki H, Vempala S (2000) Latent semantic indexing: a probabilistic analysis. J Comput Syst Sci 61(2):217\u2013235","journal-title":"J Comput Syst Sci"},{"key":"9902_CR38","doi-asserted-by":"crossref","unstructured":"Pirsiavash H, Ramanan D (2012) Detecting activities of daily living in first-person camera views. In: 2012 IEEE conference on Computer vision and pattern recognition (CVPR). IEEE, pp 2847\u20132854","DOI":"10.1109\/CVPR.2012.6248010"},{"key":"9902_CR39","doi-asserted-by":"crossref","unstructured":"Pirsiavash H, Ramanan D (2014) Parsing videos of actions with segmental grammars. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 612\u2013619","DOI":"10.1109\/CVPR.2014.85"},{"key":"9902_CR40","doi-asserted-by":"crossref","unstructured":"Redmon J, Divvala S, Girshick R, Farhadi A (2016) You only look once: Unified, real-time object detection. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 779\u2013788","DOI":"10.1109\/CVPR.2016.91"},{"key":"9902_CR41","unstructured":"Ren S, He K, Girshick R, Sun J (2015) Faster r-cnn: Towards real-time object detection with region proposal networks. In: Advances in neural information processing systems, pp 91\u201399"},{"key":"9902_CR42","unstructured":"Sharma S, Kiros R, Salakhutdinov R (2015) Action recognition using visual attention. arXiv:1511.04119"},{"key":"9902_CR43","unstructured":"Singh B, Najibi M, Davis LS (2018) Sniper: Efficient multi-scale training. In: Advances in neural information processing systems, pp 9333\u20139343"},{"key":"9902_CR44","doi-asserted-by":"crossref","unstructured":"Sun S, Kuang Z, Sheng L, Ouyang W, Zhang W (2018) Optical flow guided feature: a fast and robust motion representation for video action recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1390\u20131399","DOI":"10.1109\/CVPR.2018.00151"},{"key":"9902_CR45","doi-asserted-by":"crossref","unstructured":"Tran A, Cheong LF (2017) Two-stream flow-guided convolutional attention networks for action recognition. In: Proceedings of the IEEE International Conference on Computer Vision, pp 3110\u20133119","DOI":"10.1109\/ICCVW.2017.368"},{"key":"9902_CR46","doi-asserted-by":"crossref","unstructured":"Uijlings JR, Van De Sande KE, Gevers T, Smeulders AW (2013) Selective search for object recognition. Int J Comput Vis 104(2):154\u2013171","DOI":"10.1007\/s11263-013-0620-5"},{"key":"9902_CR47","doi-asserted-by":"publisher","first-page":"92","DOI":"10.1016\/j.cviu.2016.10.016","volume":"156","author":"G Vaca-Castano","year":"2017","unstructured":"Vaca-Castano G, Das S, Sousa JP, Lobo ND, Shah M (2017) Improved scene identification and object detection on egocentric vision of daily activities. Comput Vis Image Underst 156:92\u2013103","journal-title":"Comput Vis Image Underst"},{"key":"9902_CR48","doi-asserted-by":"crossref","unstructured":"Wang H, Kl\u00e4ser A, Schmid C, Liu CL (2011) Action recognition by dense trajectories. In: 2011 IEEE conference on Computer vision and pattern recognition (CVPR). IEEE, pp 3169\u20133176","DOI":"10.1109\/CVPR.2011.5995407"},{"issue":"1","key":"9902_CR49","doi-asserted-by":"publisher","first-page":"60","DOI":"10.1007\/s11263-012-0594-8","volume":"103","author":"H Wang","year":"2013","unstructured":"Wang H, Kl\u00e4ser A, Schmid C, Liu CL (2013) Dense trajectories and motion boundary descriptors for action recognition. Int J Comput Vis 103 (1):60\u201379","journal-title":"Int J Comput Vis"},{"key":"9902_CR50","doi-asserted-by":"crossref","unstructured":"Wang H, Schmid C (2013) Action recognition with improved trajectories. In: Proceedings of the IEEE international conference on computer vision, pp 3551\u20133558","DOI":"10.1109\/ICCV.2013.441"},{"key":"9902_CR51","unstructured":"Wang L, Xiong Y, Wang Z, Qiao Y (2015) Towards good practices for very deep two-stream convnets. arXiv:1507.02159"},{"key":"9902_CR52","doi-asserted-by":"crossref","unstructured":"Wang L, Xiong Y, Wang Z, Qiao Y, Lin D, Tang X, Van Gool L (2018) Temporal segment networks for action recognition in videos IEEE transactions on pattern analysis and machine intelligence","DOI":"10.1109\/TPAMI.2018.2868668"},{"key":"9902_CR53","doi-asserted-by":"publisher","first-page":"438","DOI":"10.1016\/j.neucom.2017.08.063","volume":"275","author":"X Wang","year":"2018","unstructured":"Wang X, Gao L, Song J, Zhen X, Sebe N, Shen HT (2018) Deep appearance and motion learning for egocentric activity recognition. Neurocomputing 275:438\u2013447","journal-title":"Neurocomputing"},{"issue":"10","key":"9902_CR54","doi-asserted-by":"publisher","first-page":"2984","DOI":"10.1109\/TIP.2015.2438540","volume":"24","author":"Y Yan","year":"2015","unstructured":"Yan Y, Ricci E, Liu G, Sebe N (2015) Egocentric daily activity recognition via multitask clustering. IEEE Trans Image Process 24(10):2984\u20132995","journal-title":"IEEE Trans Image Process"},{"key":"9902_CR55","doi-asserted-by":"crossref","unstructured":"Zhang S, Wen L, Bian X, Lei Z, Li SZ (2018) Single-shot refinement neural network for object detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 4203\u20134212","DOI":"10.1109\/CVPR.2018.00442"},{"key":"9902_CR56","doi-asserted-by":"crossref","unstructured":"Zhao Q, Sheng T, Wang Y, Tang Z, Chen Y, Cai L, Ling H (2018) M2det: A single-shot object detector based on multi-level feature pyramid network. arXiv:1811.04533","DOI":"10.1609\/aaai.v33i01.33019259"},{"key":"9902_CR57","doi-asserted-by":"crossref","unstructured":"Zhou Y, Ni B, Hong R, Yang X, Tian Q (2016) Cascaded interactional targeting network for egocentric video analysis. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 1904\u20131913","DOI":"10.1109\/CVPR.2016.210"},{"key":"9902_CR58","doi-asserted-by":"crossref","unstructured":"Zhu Y, Zhao C, Wang J, Zhao X, Wu Y, Lu H (2017) Couplenet: Coupling global structure with local parts for object detection. In: Proceedings of the IEEE International Conference on Computer Vision, pp 4126\u20134134","DOI":"10.1109\/ICCV.2017.444"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09902-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-020-09902-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09902-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,9,29]],"date-time":"2021-09-29T01:49:23Z","timestamp":1632880163000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-020-09902-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,9,29]]},"references-count":58,"journal-issue":{"issue":"15","published-print":{"date-parts":[[2021,6]]}},"alternative-id":["9902"],"URL":"https:\/\/doi.org\/10.1007\/s11042-020-09902-6","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"type":"print","value":"1380-7501"},{"type":"electronic","value":"1573-7721"}],"subject":[],"published":{"date-parts":[[2020,9,29]]},"assertion":[{"value":"20 March 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 August 2020","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 September 2020","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 September 2020","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}