{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,4,22]],"date-time":"2025-04-22T01:32:50Z","timestamp":1745285570332},"reference-count":56,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2021,2,17]],"date-time":"2021-02-17T00:00:00Z","timestamp":1613520000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,2,17]],"date-time":"2021-02-17T00:00:00Z","timestamp":1613520000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Ambient Intell Human Comput"],"published-print":{"date-parts":[[2022,2]]},"DOI":"10.1007\/s12652-021-02940-4","type":"journal-article","created":{"date-parts":[[2021,2,19]],"date-time":"2021-02-19T02:34:53Z","timestamp":1613702093000},"page":"1137-1152","update-policy":"http:\/\/dx.doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Three-stream spatio-temporal attention network for first-person action and interaction recognition"],"prefix":"10.1007","volume":"13","author":[{"given":"Javed","family":"Imran","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Balasubramanian","family":"Raman","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2021,2,17]]},"reference":[{"key":"2940_CR1","doi-asserted-by":"publisher","first-page":"229","DOI":"10.1016\/j.cviu.2015.10.015","volume":"149","author":"G Abebe","year":"2016","unstructured":"Abebe G, Cavallaro A, Parra X (2016) Robust multi-dimensional motion features for first-person vision activity recognition. Comput Vis Image Underst 149:229\u2013248","journal-title":"Comput Vis Image Underst"},{"key":"2940_CR2","unstructured":"Bahdanau D, Cho K, Bengio Y (2014) Neural machine translation by jointly learning to align and translate. arXiv preprint arXiv:1409.0473"},{"issue":"7","key":"2940_CR3","doi-asserted-by":"publisher","first-page":"2631","DOI":"10.1109\/TCYB.2018.2831447","volume":"49","author":"Y Bin","year":"2018","unstructured":"Bin Y, Yang Y, Shen F, Xie N, Shen HT, Li X (2018) Describing video with attention-based bidirectional lstm. IEEE Trans Cybern 49(7):2631\u20132641","journal-title":"IEEE Trans Cybern"},{"key":"2940_CR4","doi-asserted-by":"crossref","unstructured":"Brox T, Bruhn A, Papenberg N, Weickert J (2004) High accuracy optical flow estimation based on a theory for warping. In: European conference on computer vision, pp 25\u201336","DOI":"10.1007\/978-3-540-24673-2_3"},{"key":"2940_CR5","doi-asserted-by":"crossref","unstructured":"Caetano CA, De Melo VHC, dos Santos JA, Schwartz WR (2017) Activity recognition based on a magnitude-orientation stream network. In: IEEE conference on graphics, patterns and images, pp 47\u201354","DOI":"10.1109\/SIBGRAPI.2017.13"},{"key":"2940_CR6","doi-asserted-by":"crossref","unstructured":"Carreira J, Zisserman A (2017) Quo vadis, action recognition? A new model and the kinetics dataset. In: IEEE conference on computer vision and pattern recognition, pp 6299\u20136308","DOI":"10.1109\/CVPR.2017.502"},{"key":"2940_CR7","unstructured":"Chorowski JK, Bahdanau D, Serdyuk D, Cho K, Bengio Y (2015) Attention-based models for speech recognition. In: Advances in neural information processing systems, pp 577\u2013585"},{"key":"2940_CR8","unstructured":"Cui Z, Ke R, Pu Z, Wang Y (2018) Deep bidirectional and unidirectional lstm recurrent neural network for network-wide traffic speed prediction. arXiv preprint arXiv:1801.02143"},{"key":"2940_CR9","doi-asserted-by":"crossref","unstructured":"Donahue J, Anne\u00a0Hendricks L, Guadarrama S, Rohrbach M, Venugopalan S, Saenko K, Darrell T (2015) Long-term recurrent convolutional networks for visual recognition and description. In: IEEE conference on computer vision and pattern recognition, pp 2625\u20132634","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"2940_CR10","doi-asserted-by":"publisher","DOI":"10.1007\/s12652-019-01399-8","author":"DC Edara","year":"2019","unstructured":"Edara DC, Vanukuri LP, Sistla V, Kolli VKK (2019) Sentiment analysis and text categorization of cancer medical records with LSTM. J Ambient Intell Human Comput. https:\/\/doi.org\/10.1007\/s12652-019-01399-8","journal-title":"J Ambient Intell Human Comput"},{"key":"2940_CR11","doi-asserted-by":"crossref","unstructured":"Fa L, Song Y, Shu X (2018) Global and local c3d ensemble system for first person interactive action recognition. In: Springer International Conference on Multimedia Modeling, pp. 153\u2013164","DOI":"10.1007\/978-3-319-73600-6_14"},{"key":"2940_CR12","doi-asserted-by":"crossref","unstructured":"Farneb\u00e4ck G (2003) Two-frame motion estimation based on polynomial expansion. In: Springer scandinavian conference on image analysis, pp 363\u2013370","DOI":"10.1007\/3-540-45103-X_50"},{"issue":"4","key":"2940_CR13","doi-asserted-by":"publisher","first-page":"773","DOI":"10.1109\/TPAMI.2016.2558148","volume":"39","author":"B Fernando","year":"2016","unstructured":"Fernando B, Gavves E, Oramas J, Ghodrati A, Tuytelaars T (2016) Rank pooling for action recognition. IEEE Trans Pattern Anal Mach Intell 39(4):773\u2013787","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2940_CR14","doi-asserted-by":"crossref","unstructured":"Girshick R, Donahue J, Darrell T, Malik J (2014) Rich feature hierarchies for accurate object detection and semantic segmentation. In: IEEE conference on computer vision and pattern recognition, pp 580\u2013587","DOI":"10.1109\/CVPR.2014.81"},{"key":"2940_CR15","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"2940_CR16","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"issue":"1","key":"2940_CR17","doi-asserted-by":"publisher","first-page":"189","DOI":"10.1007\/s12652-019-01239-9","volume":"11","author":"J Imran","year":"2020","unstructured":"Imran J, Raman B (2020) Evaluating fusion of rgb-d and inertial sensors for multimodal human action recognition. J Ambient Intell Humaniz Comput 11(1):189\u2013208","journal-title":"J Ambient Intell Humaniz Comput"},{"key":"2940_CR18","unstructured":"Ioffe S, Szegedy C (2015) Batch normalization: Accelerating deep network training by reducing internal covariate shift. arXiv preprint arXiv:1502.03167"},{"key":"2940_CR19","doi-asserted-by":"crossref","unstructured":"Iwashita Y, Takamine A, Kurazume R, Ryoo MS (2014) First-person animal activity recognition from egocentric videos. In: IEEE international conference on pattern recognition, pp 4310\u20134315","DOI":"10.1109\/ICPR.2014.739"},{"key":"2940_CR20","doi-asserted-by":"crossref","unstructured":"Jia Y, Shelhamer E, Donahue J, Karayev S, Long J, Girshick R, Guadarrama S, Darrell T (2014) Caffe: convolutional architecture for fast feature embedding. In: ACM international conference on multimedia, pp 675\u2013678","DOI":"10.1145\/2647868.2654889"},{"issue":"15","key":"2940_CR21","doi-asserted-by":"publisher","first-page":"21673","DOI":"10.1007\/s11042-019-7429-3","volume":"78","author":"R Kahani","year":"2019","unstructured":"Kahani R, Talebpour A, Mahmoudi-Aznaveh A (2019) A correlation based feature representation for first-person activity recognition. Multimed Tools Appl 78(15):21673\u201321694","journal-title":"Multimed Tools Appl"},{"key":"2940_CR22","doi-asserted-by":"crossref","unstructured":"Karpathy A, Toderici G, Shetty S, Leung T, Sukthankar R, Fei-Fei L (2014) Large-scale video classification with convolutional neural networks. In: IEEE conference on computer vision and pattern recognition, pp 1725\u20131732","DOI":"10.1109\/CVPR.2014.223"},{"key":"2940_CR23","unstructured":"Kay W, Carreira J, Simonyan K, Zhang B, Hillier C, Vijayanarasimhan S, Viola F, Green T, Back T, Natsev P et\u00a0al (2017) The kinetics human action video dataset. arXiv preprint arXiv:1705.06950"},{"key":"2940_CR24","doi-asserted-by":"publisher","first-page":"107279","DOI":"10.1016\/j.patcog.2020.107279","volume":"103","author":"YJ Kim","year":"2020","unstructured":"Kim YJ, Lee DG, Lee SW (2020) Three-stream fusion network for first-person interaction recognition. Pattern Recogn 103:107279","journal-title":"Pattern Recogn"},{"key":"2940_CR25","unstructured":"Krizhevsky A, Sutskever I, Hinton GE (2012) Imagenet classification with deep convolutional neural networks. In: Advances in neural information processing systems, pp 1097\u20131105"},{"key":"2940_CR26","doi-asserted-by":"publisher","first-page":"161","DOI":"10.1016\/j.patrec.2018.07.011","volume":"112","author":"H Kwon","year":"2018","unstructured":"Kwon H, Kim Y, Lee JS, Cho M (2018) First person action recognition via two-stream convnet with long-term fusion pooling. Pattern Recogn Lett 112:161\u2013167","journal-title":"Pattern Recogn Lett"},{"issue":"2\u20133","key":"2940_CR27","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1007\/s11263-005-1838-7","volume":"64","author":"I Laptev","year":"2005","unstructured":"Laptev I (2005) On space-time interest points. Int J Comput Vis 64(2\u20133):107\u2013123","journal-title":"Int J Comput Vis"},{"key":"2940_CR28","doi-asserted-by":"crossref","unstructured":"Li H, Cai Y, Zheng WS (2019) Deep dual relation modeling for egocentric interaction recognition. In: IEEE conference on computer vision and pattern recognition, pp 7932\u20137941","DOI":"10.1109\/CVPR.2019.00812"},{"key":"2940_CR29","doi-asserted-by":"crossref","unstructured":"Monteiro J, Aires JP, Granada R, Barros RC, Meneguzzi F (2017) Virtual guide dog: An application to support visually-impaired people through deep convolutional neural networks. In: IEEE international joint conference on neural networks, pp 2267\u20132274","DOI":"10.1109\/IJCNN.2017.7966130"},{"key":"2940_CR30","doi-asserted-by":"crossref","unstructured":"Monteiro J, Granada R, Barros RC et\u00a0al (2018) Evaluating the feasibility of deep learning for action recognition in small datasets. In: IEEE international joint conference on neural networks, pp 1\u20138","DOI":"10.1109\/IJCNN.2018.8489297"},{"key":"2940_CR31","doi-asserted-by":"crossref","unstructured":"Moreira TP, Menotti D, Pedrini H (2017) First-person action recognition through visual rhythm texture description. In: IEEE international conference on acoustics, speech and signal processing, pp 2627\u20132631","DOI":"10.1109\/ICASSP.2017.7952632"},{"key":"2940_CR32","doi-asserted-by":"publisher","first-page":"102771","DOI":"10.1016\/j.jvcir.2020.102771","volume":"71","author":"TP Moreira","year":"2020","unstructured":"Moreira TP, Menotti D, Pedrini H (2020) Video action recognition based on visual rhythm representation. J Vis Commun Image Represent 71:102771. https:\/\/doi.org\/10.1016\/j.jvcir.2020.102771","journal-title":"J Vis Commun Image Represent"},{"key":"2940_CR33","doi-asserted-by":"crossref","unstructured":"Narayan S, Kankanhalli MS, Ramakrishnan KR (2014) Action and interaction recognition in first-person videos. In: IEEE conference on computer vision and pattern recognition workshops, pp 512\u2013518","DOI":"10.1109\/CVPRW.2014.82"},{"issue":"7","key":"2940_CR34","doi-asserted-by":"publisher","first-page":"971","DOI":"10.1109\/TPAMI.2002.1017623","volume":"24","author":"T Ojala","year":"2002","unstructured":"Ojala T, Pietikainen M, Maenpaa T (2002) Multiresolution gray-scale and rotation invariant texture classification with local binary patterns. IEEE Trans Pattern Anal Mach Intell 24(7):971\u2013987","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2940_CR35","doi-asserted-by":"crossref","unstructured":"\u00d6zkan F, Arabaci MA, Surer E, Temizel A (2017) Boosted multiple kernel learning for first-person activity recognition. In: IEEE European signal processing conference, pp 1050\u20131054","DOI":"10.23919\/EUSIPCO.2017.8081368"},{"issue":"2","key":"2940_CR36","doi-asserted-by":"publisher","first-page":"675","DOI":"10.1007\/s12652-019-01325-y","volume":"11","author":"V Passricha","year":"2020","unstructured":"Passricha V, Aggarwal RK (2020) A comparative analysis of pooling strategies for convolutional neural network based hindi asr. J Ambient Intell Humaniz Comput 11(2):675\u2013691","journal-title":"J Ambient Intell Humaniz Comput"},{"key":"2940_CR37","doi-asserted-by":"crossref","unstructured":"Piergiovanni A, Fan C, Ryoo MS (2017) Learning latent subevents in activity videos using temporal attention filters. In: AAAI conference on artificial intelligence","DOI":"10.1609\/aaai.v31i1.11240"},{"issue":"12","key":"2940_CR38","doi-asserted-by":"publisher","first-page":"3122","DOI":"10.1109\/TMM.2019.2919434","volume":"21","author":"D Purwanto","year":"2019","unstructured":"Purwanto D, Chen YT, Fang WH (2019) First-person action recognition with temporal pooling and Hilbert\u2013Huang transform. IEEE Trans Multimed 21(12):3122\u20133135","journal-title":"IEEE Trans Multimed"},{"key":"2940_CR39","doi-asserted-by":"crossref","unstructured":"Ryoo MS, Matthies L (2013) First-person activity recognition: what are they doing to me? In: IEEE conference on computer vision and pattern recognition, pp 2730\u20132737","DOI":"10.1109\/CVPR.2013.352"},{"key":"2940_CR40","doi-asserted-by":"crossref","unstructured":"Ryoo MS, Rothrock B, Matthies L (2015) Pooled motion features for first-person videos. In: IEEE conference on computer vision and pattern recognition, pp 896\u2013904","DOI":"10.1109\/CVPR.2015.7298691"},{"issue":"11","key":"2940_CR41","doi-asserted-by":"publisher","first-page":"2673","DOI":"10.1109\/78.650093","volume":"45","author":"M Schuster","year":"1997","unstructured":"Schuster M, Paliwal KK (1997) Bidirectional recurrent neural networks. IEEE Trans Signal Process 45(11):2673\u20132681","journal-title":"IEEE Trans Signal Process"},{"key":"2940_CR42","unstructured":"Sharma S, Kiros R, Salakhutdinov R (2015) Action recognition using visual attention. arXiv preprint arXiv:1511.04119"},{"key":"2940_CR43","unstructured":"Simonyan K, Zisserman A (2014) Two-stream convolutional networks for action recognition in videos. In: Advances in neural information processing systems, pp 568\u2013576"},{"key":"2940_CR44","doi-asserted-by":"crossref","unstructured":"Sudhakaran S, Lanz O (2017) Convolutional long short-term memory networks for recognizing first person interactions. In: IEEE international conference on computer vision workshops, pp 2339\u20132346","DOI":"10.1109\/ICCVW.2017.276"},{"key":"2940_CR45","doi-asserted-by":"crossref","unstructured":"Szegedy C, Liu W, Jia Y, Sermanet P, Reed S, Anguelov D, Erhan D, Vanhoucke V, Rabinovich A (2015) Going deeper with convolutions. In: IEEE conference on computer vision and pattern recognition, pp 1\u20139","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"2940_CR46","doi-asserted-by":"crossref","unstructured":"Tran D, Bourdev L, Fergus R, Torresani L, Paluri M (2015) Learning spatiotemporal features with 3d convolutional networks. In: IEEE international conference on computer vision, pp 4489\u20134497","DOI":"10.1109\/ICCV.2015.510"},{"issue":"6","key":"2940_CR47","doi-asserted-by":"publisher","first-page":"1510","DOI":"10.1109\/TPAMI.2017.2712608","volume":"40","author":"G Varol","year":"2017","unstructured":"Varol G, Laptev I, Schmid C (2017) Long-term temporal convolutions for action recognition. IEEE Trans Pattern Anal Mach Intell 40(6):1510\u20131517","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2940_CR48","doi-asserted-by":"crossref","unstructured":"Vinyals O, Toshev A, Bengio S, Erhan D (2015) Show and tell: a neural image caption generator. In: IEEE conference on computer vision and pattern recognition, pp 3156\u20133164","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"2940_CR49","doi-asserted-by":"crossref","unstructured":"Wang H, Schmid C (2013) Action recognition with improved trajectories. In: IEEE International conference on computer vision, pp 3551\u20133558","DOI":"10.1109\/ICCV.2013.441"},{"key":"2940_CR50","doi-asserted-by":"crossref","unstructured":"Wang L, Qiao Y, Tang X (2015) Action recognition with trajectory-pooled deep-convolutional descriptors. In: IEEE conference on computer vision and pattern recognition, pp 4305\u20134314","DOI":"10.1109\/CVPR.2015.7299059"},{"key":"2940_CR51","doi-asserted-by":"crossref","unstructured":"Wang L, Xiong Y, Wang Z, Qiao Y, Lin D, Tang X, Van\u00a0Gool L (2016) Temporal segment networks: Towards good practices for deep action recognition. In: European conference on computer vision, pp 20\u201336","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"2940_CR52","doi-asserted-by":"crossref","unstructured":"Xia L, Gori I, Aggarwal JK, Ryoo MS (2015) Robot-centric activity recognition from first-person rgb-d videos. In: IEEE winter conference on applications of computer vision, pp 357\u2013364","DOI":"10.1109\/WACV.2015.54"},{"key":"2940_CR53","unstructured":"Xu K, Ba J, Kiros R, Cho K, Courville A, Salakhudinov R, Zemel R, Bengio Y (2015) Show, attend and tell: neural image caption generation with visual attention. In: International conference on machine learning, pp 2048\u20132057"},{"key":"2940_CR54","doi-asserted-by":"crossref","unstructured":"Zach C, Pock T, Bischof H (2007) A duality based approach for realtime tv-l 1 optical flow. In: Springer joint pattern recognition symposium, pp 214\u2013223","DOI":"10.1007\/978-3-540-74936-3_22"},{"key":"2940_CR55","doi-asserted-by":"crossref","unstructured":"Zaki HF, Shafait F, Mian A (2017) Modeling sub-event dynamics in first-person action recognition. In: IEEE conference on computer vision and pattern recognition, pp 7253\u20137262","DOI":"10.1109\/CVPR.2017.176"},{"key":"2940_CR56","doi-asserted-by":"crossref","unstructured":"Zhou B, Andonian A, Oliva A, Torralba A (2018) Temporal relational reasoning in videos. In: European conference on computer vision, pp 803\u2013818","DOI":"10.1007\/978-3-030-01246-5_49"}],"container-title":["Journal of Ambient Intelligence and Humanized Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s12652-021-02940-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s12652-021-02940-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s12652-021-02940-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,18]],"date-time":"2022-12-18T04:00:23Z","timestamp":1671336023000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s12652-021-02940-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,2,17]]},"references-count":56,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2022,2]]}},"alternative-id":["2940"],"URL":"https:\/\/doi.org\/10.1007\/s12652-021-02940-4","relation":{},"ISSN":["1868-5137","1868-5145"],"issn-type":[{"value":"1868-5137","type":"print"},{"value":"1868-5145","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,2,17]]},"assertion":[{"value":"12 August 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 January 2021","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 February 2021","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Compliance with ethical standards"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}},{"value":"No funding source available.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Funding"}}]}}