{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,6]],"date-time":"2025-11-06T20:05:39Z","timestamp":1762459539607,"version":"3.41.0"},"reference-count":27,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2017,12,1]],"date-time":"2017-12-01T00:00:00Z","timestamp":1512086400000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"name":"KAKENHI","award":["16K00239"],"award-info":[{"award-number":["16K00239"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Image Video Proc."],"published-print":{"date-parts":[[2017,12]]},"DOI":"10.1186\/s13640-017-0235-9","type":"journal-article","created":{"date-parts":[[2017,12,15]],"date-time":"2017-12-15T13:45:18Z","timestamp":1513345518000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":20,"title":["Gated spatio and temporal convolutional neural network for activity recognition: towards gated multimodal deep learning"],"prefix":"10.1186","volume":"2017","author":[{"given":"Novanto","family":"Yudistira","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Takio","family":"Kurita","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,12,15]]},"reference":[{"key":"235_CR1","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/j.cviu.2014.01.002","volume":"123","author":"G Somasundaram","year":"2014","unstructured":"G Somasundaram, et al, Action recognition using global spatio-temporal features derived from sparse representations. Comput. Vis. Image Underst. 123:, 1\u201313 (2014).","journal-title":"Comput. Vis. Image Underst"},{"unstructured":"L Sun, K Jia, TH Chan, Y Fang, G Wang, S Yan, in Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. DL-SFA: deeply-learned slow feature analysis for action recognition, (2014), pp. 2625\u20132632.","key":"235_CR2"},{"doi-asserted-by":"crossref","unstructured":"E Ahmed, M Jones, TK Marks, An improved deep learning architecture for person re-identification, (2015).","key":"235_CR3","DOI":"10.1109\/CVPR.2015.7299016"},{"doi-asserted-by":"crossref","unstructured":"FA Gers, J Schmidhuber, F Cummins, Learning to forget: Continual prediction with LSTM (IET, 1999).","key":"235_CR4","DOI":"10.1049\/cp:19991218"},{"doi-asserted-by":"crossref","unstructured":"R Hadsell, S Chopra, Y LeCun, in Computer vision and pattern recognition, 2006 IEEE computer society conference on, 2. Dimensionality reduction by learning an invariant mapping (IEEE, 2006), pp. 1735\u20131742.","key":"235_CR5","DOI":"10.1109\/CVPR.2006.100"},{"unstructured":"K He, et al, Deep residual learning for image recognition. CoRR. abs\/1512.03385: (2015). http:\/\/arxiv.org\/abs\/1512.03385.","key":"235_CR6"},{"issue":"8","key":"235_CR7","doi-asserted-by":"crossref","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"S Hochreiter, J Schmidhuber, Long short-term memory. Neural Comput. 9(8), 1735\u201380 (1997).","journal-title":"Neural Comput"},{"unstructured":"A Karpathy, G Toderici, S Shetty, T Leung, R Sukthankar, L Fei-Fei, in Proceedings of the IEEE conference on Computer Vision and Pattern Recognition. Large-scale video classification with convolutional neural networks, (2014), pp. 1725\u20131732.","key":"235_CR8"},{"key":"235_CR9","doi-asserted-by":"crossref","first-page":"60","DOI":"10.1007\/s11263-012-0594-8","volume":"103.1","author":"H Wang","year":"2013","unstructured":"H Wang, et al, Dense trajectories and motion boundary descriptors for action recognition. Int. J. Comput. Vis.103.1:, 60\u201379 (2013).","journal-title":"Int. J. Comput. Vis."},{"unstructured":"K Simonyan, et al, Very deep convolutional networks for large-scale image recognition. CoRR. abs\/1409.1556: (2014). http:\/\/arxiv.org\/abs\/1409.1556.","key":"235_CR10"},{"unstructured":"K Simonyan, A Zisserman, in Advances in neural information processing systems. Two-stream convolutional networks for action recognition in videos, (2014), pp. 568\u2013576.","key":"235_CR11"},{"doi-asserted-by":"crossref","unstructured":"L Wang, Y Xiong, Z Wang, Y Qiao, D Lin, X Tang, L Van Gool, in European Conference on Computer Vision. Temporal segment networks: Towards good practices for deep action recognition (Springer International Publishing, 2016), pp. 20\u201336.","key":"235_CR12","DOI":"10.1007\/978-3-319-46484-8_2"},{"unstructured":"Chainer, A Flexible Framework for Deep Learning (2016). http:\/\/chainer.org . Accessed 07 Dec 2017.","key":"235_CR13"},{"key":"235_CR14","doi-asserted-by":"crossref","first-page":"4","DOI":"10.1016\/j.heares.2009.03.012","volume":"258.1","author":"BE Stein","year":"2009","unstructured":"BE Stein, TR Stanford, BA Rowland, The neural basis of multisensory integration in the midbrain: its organization and maturation. Hear. Res.258.1:, 4\u201315 (2009).","journal-title":"Hear. Res."},{"unstructured":"A Kendall, Y Gal, R Cipolla, Multi-Task Learning Using Uncertainty to Weigh Losses for Scene Geometry and Semantics (2017). arXiv preprint arXiv:1705.07115.","key":"235_CR15"},{"doi-asserted-by":"crossref","unstructured":"X Zeng, W Ouyang, B Yang, J Yan, X Wang, in European Conference on Computer Vision. Gated bi-directional cnn for object detection (Springer International Publishing, 2016), pp. 354\u2013369.","key":"235_CR16","DOI":"10.1007\/978-3-319-46478-7_22"},{"unstructured":"YN Dauphin, A Fan, M Auli, D Grangier, Language modeling with gated convolutional networks (2016). arXiv preprint arXiv:1612.08083.","key":"235_CR17"},{"doi-asserted-by":"crossref","unstructured":"E Park, X Han, TL Berg, AC Berg, in Applications of Computer Vision (WACV), 2016 IEEE Winter Conference on. Combining multiple sources of knowledge in deep cnns for action recognition (IEEE, 2016), pp. 1\u20138.","key":"235_CR18","DOI":"10.1109\/WACV.2016.7477589"},{"doi-asserted-by":"crossref","unstructured":"N Yudistira, T Kurita, in Systems, Man, and Cybernetics (SMC), 2015 IEEE International Conference on. Multiresolution Local Autocorrelation of Optical Flows over time for Action Recognition (IEEE, 2015), pp. 1930\u20131935.","key":"235_CR19","DOI":"10.1109\/SMC.2015.337"},{"unstructured":"H Wang, C Schmid, in Proceedings of the IEEE international conference on computer vision. Action recognition with improved trajectories, (2013), pp. 3551\u20133558.","key":"235_CR20"},{"unstructured":"A Gorban, H Idrees, YG Jiang, AR Zamir, I Laptev, M Shah, R Sukthankar, in CVPR workshop. THUMOS challenge: Action recognition with a large number of classes, (2015).","key":"235_CR21"},{"unstructured":"C Feichtenhofer, A Pinz, A Zisserman, in Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Convolutional two-stream network fusion for video action recognition, (2016), pp. 1933\u20131941.","key":"235_CR22"},{"unstructured":"L Wang, Y Xiong, Z Wang, Y Qiao, Towards good practices for very deep two-stream convnets (2015). arXiv preprint arXiv:1507.02159.","key":"235_CR23"},{"unstructured":"K He, X Zhang, S Ren, J Sun, in Proceedings of the IEEE conference on computer vision and pattern recognition. Deep residual learning for image recognition, (2016), pp. 770\u2013778.","key":"235_CR24"},{"issue":"03","key":"235_CR25","first-page":"141","volume":"7","author":"H El Khiyari","year":"2016","unstructured":"H El Khiyari, H Wechsler, Face recognition across time lapse using convolutional neural networks. J. Inf. Secur. 7(03), 141 (2016).","journal-title":"J. Inf. Secur"},{"doi-asserted-by":"crossref","unstructured":"Y Iwashita, A Takamine, R Kurazume, MS Ryoo, in Pattern Recognition (ICPR), 2014 22nd International Conference on. First-person animal activity recognition from egocentric videos (IEEE, 2014), pp. 4310\u20134315.","key":"235_CR26","DOI":"10.1109\/ICPR.2014.739"},{"unstructured":"K Soomro, Amir RZ, Mubarak S, UCF 101: A dataset of 101 human actions classes from videos in the wild (2012). arXiv preprint arXiv:1212.0402.","key":"235_CR27"}],"container-title":["EURASIP Journal on Image and Video Processing"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s13640-017-0235-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1186\/s13640-017-0235-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s13640-017-0235-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,28]],"date-time":"2025-06-28T21:33:12Z","timestamp":1751146392000},"score":1,"resource":{"primary":{"URL":"https:\/\/jivp-eurasipjournals.springeropen.com\/articles\/10.1186\/s13640-017-0235-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,12]]},"references-count":27,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2017,12]]}},"alternative-id":["235"],"URL":"https:\/\/doi.org\/10.1186\/s13640-017-0235-9","relation":{},"ISSN":["1687-5281"],"issn-type":[{"type":"electronic","value":"1687-5281"}],"subject":[],"published":{"date-parts":[[2017,12]]},"article-number":"85"}}