{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,1]],"date-time":"2025-06-01T05:10:02Z","timestamp":1748754602788,"version":"3.41.0"},"reference-count":46,"publisher":"Springer Science and Business Media LLC","issue":"8","license":[{"start":{"date-parts":[[2016,1,19]],"date-time":"2016-01-19T00:00:00Z","timestamp":1453161600000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"name":"National High Technology Research and Development Program of China","award":["No.2013CB329605"],"award-info":[{"award-number":["No.2013CB329605"]}]},{"name":"Training Program of the Major Project of BIT"},{"name":"International Graduate Exchange Program of BIT"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Neural Comput &amp; Applic"],"published-print":{"date-parts":[[2017,8]]},"DOI":"10.1007\/s00521-015-2171-x","type":"journal-article","created":{"date-parts":[[2016,1,19]],"date-time":"2016-01-19T06:33:00Z","timestamp":1453185180000},"page":"2147-2163","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["A general description generator for human activity images based on deep understanding framework"],"prefix":"10.1007","volume":"28","author":[{"given":"Zheng","family":"Zhou","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kan","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lin","family":"Bai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2016,1,19]]},"reference":[{"key":"2171_CR1","doi-asserted-by":"crossref","first-page":"158","DOI":"10.1007\/978-3-642-33765-9_12","volume-title":"Computer vision-ECCV 2012","author":"C Desai","year":"2012","unstructured":"Desai C, Ramanan D (2012) Detecting actions, poses, and objects with relational phraselets. Computer vision-ECCV 2012. Springer, Berlin, pp 158\u2013172"},{"issue":"1","key":"2171_CR2","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/s11263-011-0439-x","volume":"95","author":"C Desai","year":"2011","unstructured":"Desai C, Ramanan D, Fowlkes CC (2011) Discriminative models for multi-class object layout. Int J Comput Vis 95(1):1\u201312","journal-title":"Int J Comput Vis"},{"key":"2171_CR3","doi-asserted-by":"crossref","unstructured":"Elliott D, Keller F (2013) Image description using visual dependency representations. In: Conference on empirical methods in natural language processing, pp 1292\u20131302","DOI":"10.18653\/v1\/D13-1128"},{"key":"2171_CR4","doi-asserted-by":"crossref","first-page":"15","DOI":"10.1007\/978-3-642-15561-1_2","volume-title":"Computer vision-ECCV 2010","author":"A Farhadi","year":"2010","unstructured":"Farhadi A, Hejrati M, Sadeghi MA, Young P, Rashtchian C, Hockenmaier J, Forsyth D (2010) Every picture tells a story: generating sentences from images. Computer vision-ECCV 2010. Springer, Berlin, pp 15\u201329"},{"issue":"9","key":"2171_CR5","doi-asserted-by":"crossref","first-page":"1627","DOI":"10.1109\/TPAMI.2009.167","volume":"32","author":"PF Felzenszwalb","year":"2010","unstructured":"Felzenszwalb PF, Girshick RB, McAllester D, Ramanan D (2010) Object detection with discriminatively trained part-based models. IEEE Trans Pattern Anal Mach Intell 32(9):1627\u20131645","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2171_CR6","doi-asserted-by":"crossref","unstructured":"Franc V, Sonnenburg S (2008) Optimized cutting plane algorithm for support vector machines. In: Proceedings of the 25th international conference on Machine learning. ACM, pp 320\u2013327","DOI":"10.1145\/1390156.1390197"},{"key":"2171_CR7","unstructured":"George D (2008) How the brain might work: a hierarchical and temporal model for learning and recognition. Ph.D. thesis, Stanford University"},{"key":"2171_CR8","unstructured":"Guerra-Filho G, Fermuller C, Aloimonos Y (2005) Discovering a language for human activity. In: Proceedings of the AAAI 2005 fall symposium on anticipatory cognitive embodied systems"},{"issue":"10","key":"2171_CR9","doi-asserted-by":"crossref","first-page":"1775","DOI":"10.1109\/TPAMI.2009.83","volume":"31","author":"A Gupta","year":"2009","unstructured":"Gupta A, Kembhavi A, Davis LS (2009) Observing human-object interactions: using spatial and functional compatibility for recognition. IEEE Trans Pattern Anal Mach Intell 31(10):1775\u20131789","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2171_CR10","doi-asserted-by":"crossref","first-page":"196","DOI":"10.1007\/978-3-642-34500-5_24","volume-title":"Neural information processing","author":"A Gupta","year":"2012","unstructured":"Gupta A, Mannem P (2012) From image annotation to image description. Neural information processing. Springer, Berlin, pp 196\u2013204"},{"key":"2171_CR11","volume-title":"On intelligence","author":"J Hawkins","year":"2007","unstructured":"Hawkins J, Blakeslee S (2007) On intelligence. Macmillan, London"},{"key":"2171_CR12","volume-title":"Hierarchical temporal memory: concepts, theory and terminology","author":"J Hawkins","year":"2006","unstructured":"Hawkins J, George D (2006) Hierarchical temporal memory: concepts, theory and terminology. Whitepaper, Numenta Inc, Redwood City"},{"issue":"7","key":"2171_CR13","doi-asserted-by":"crossref","first-page":"1527","DOI":"10.1162\/neco.2006.18.7.1527","volume":"18","author":"G Hinton","year":"2006","unstructured":"Hinton G, Osindero S, Teh YW (2006) A fast learning algorithm for deep belief nets. Neural Comput 18(7):1527\u20131554","journal-title":"Neural Comput"},{"issue":"5786","key":"2171_CR14","doi-asserted-by":"crossref","first-page":"504","DOI":"10.1126\/science.1127647","volume":"313","author":"GE Hinton","year":"2006","unstructured":"Hinton GE, Salakhutdinov RR (2006) Reducing the dimensionality of data with neural networks. Science 313(5786):504\u2013507","journal-title":"Science"},{"issue":"3","key":"2171_CR15","doi-asserted-by":"crossref","first-page":"328","DOI":"10.1007\/s11263-010-0400-4","volume":"91","author":"D Hoiem","year":"2011","unstructured":"Hoiem D, Efros AA, Hebert M (2011) Recovering occlusion boundaries from an image. Int J Comput Vis 91(3):328\u2013346","journal-title":"Int J Comput Vis"},{"key":"2171_CR16","unstructured":"Huang FJ, LeCun Y (2006) Large-scale learning with svm and convolutional for generic object categorization. In: IEEE conference on computer vision and pattern recognition (CVPR), IEEE, vol 1. pp 284\u2013291"},{"issue":"6","key":"2171_CR17","doi-asserted-by":"crossref","first-page":"1053","DOI":"10.1016\/S0896-6273(03)00524-5","volume":"39","author":"SH Johnson-Frey","year":"2003","unstructured":"Johnson-Frey SH, Maloof FR, Newman-Norlund R, Farrer C, Inati S, Grafton ST (2003) Actions or hand-object interactions: Human inferior frontal cortex and action observation. Neuron 39(6):1053\u20131058","journal-title":"Neuron"},{"key":"2171_CR18","unstructured":"Karpathy A, Joulin A, Li FF (2014) Deep fragment embeddings for bidirectional image sentence mapping. In: Advances in neural information processing systems, pp 1889\u20131897"},{"key":"2171_CR19","unstructured":"Krizhevsky A, Sutskever I, Hinton GE (2012) Imagenet classification with deep convolutional neural networks. In: Advances in neural information processing systems, pp 1097\u20131105"},{"key":"2171_CR20","doi-asserted-by":"crossref","unstructured":"Kulkarni G, Premraj V, Dhar S, Li S, Choi Y, Berg AC, Berg TL (2011) Baby talk: Understanding and generating simple image descriptions. In: IEEE conference on computer vision and pattern recognition (CVPR ). IEEE, pp 1601\u20131608","DOI":"10.1109\/CVPR.2011.5995466"},{"issue":"12","key":"2171_CR21","doi-asserted-by":"crossref","first-page":"2891","DOI":"10.1109\/TPAMI.2012.162","volume":"35","author":"G Kulkarni","year":"2013","unstructured":"Kulkarni G, Premraj V, Ordonez V, Dhar S, Li S, Choi Y, Berg AC, Berg T (2013) Babytalk: understanding and generating simple image descriptions. IEEE Trans Pattern Anal Mach Intell 35(12):2891\u20132903","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2171_CR22","unstructured":"Kuznetsova P, Ordonez V, Berg AC, Berg TL, Choi Y (2012) Collective generation of natural image descriptions. In: Proceedings of the 50th annual meeting of the association for computational linguistics. Association for Computational Linguistics, pp 359\u2013368"},{"key":"2171_CR23","unstructured":"Kuznetsova P, Ordonez V, Berg AC, Berg TL, Choi Y (2013) Generalizing image captions for image-text parallel corpus. In: Annual meeting of the association for computational linguistics. Citeseer, pp 790\u2013796"},{"issue":"10","key":"2171_CR24","doi-asserted-by":"crossref","first-page":"351","DOI":"10.1162\/tacl_a_00188","volume":"2","author":"P Kuznetsova","year":"2014","unstructured":"Kuznetsova P, Ordonez V, Berg T, Choi Y (2014) Treetalk: composition and compression of trees for image descriptions. Trans Assoc Comput Linguist 2(10):351\u2013362","journal-title":"Trans Assoc Comput Linguist"},{"key":"2171_CR25","doi-asserted-by":"crossref","unstructured":"LeCun Y, Kavukcuoglu K, Farabet C (2010) Convolutional networks and applications in vision. In: Proceedings of 2010 IEEE international symposium on circuits and systems (ISCAS), IEEE, pp 253\u2013256","DOI":"10.1109\/ISCAS.2010.5537907"},{"key":"2171_CR26","unstructured":"Li S, Kulkarni G, Berg TL, Berg AC, Choi Y (2011) Composing simple image descriptions using web-scale n-grams. In: Proceedings of the fifteenth conference on computational natural language learning. Association for Computational Linguistics, pp 220\u2013228"},{"key":"2171_CR27","doi-asserted-by":"crossref","unstructured":"Li Y, Xie W, Gao Z, Huang Q, Cao Y (2014) A new bag of words model based on fuzzy membership for image description. In: 12th International conference on signal processing (ICSP), 2014, IEEE, pp 972\u2013976","DOI":"10.1109\/ICOSP.2014.7015149"},{"key":"2171_CR28","doi-asserted-by":"crossref","first-page":"740","DOI":"10.1007\/978-3-319-10602-1_48","volume-title":"Computer vision-ECCV 2014","author":"TY Lin","year":"2014","unstructured":"Lin TY, Maire M, Belongie S, Hays J, Perona P, Ramanan D, Doll\u00e1r P, Zitnick CL (2014) Microsoft coco: common objects in context. Computer vision-ECCV 2014. Springer, Berlin, pp 740\u2013755"},{"key":"2171_CR29","unstructured":"Memisevic R, Zach C, Pollefeys M, Hinton GE (2010) Gated softmax classification. In: Advances in neural information processing systems, pp 1603\u20131611"},{"key":"2171_CR30","unstructured":"Mitchell M, Han X, Dodge J, Mensch A, Goyal A, Berg A, Yamaguchi K, Berg T, Stratos K, Daum\u00e9 III H (2012) Midge: generating image descriptions from computer vision detections. In: Proceedings of the 13th conference of the european chapter of the association for computational linguistics. Association for Computational Linguistics, pp 747\u2013756"},{"issue":"5746","key":"2171_CR31","doi-asserted-by":"crossref","first-page":"332","DOI":"10.1126\/science.1115593","volume":"310","author":"K Nelissen","year":"2005","unstructured":"Nelissen K, Luppino G, Vanduffel W, Rizzolatti G, Orban GA (2005) Observing others: multiple action representation in the frontal lobe. Science 310(5746):332\u2013336","journal-title":"Science"},{"key":"2171_CR32","unstructured":"Ordonez V, Kulkarni G, Berg TL (2011) Im2text: Describing images using 1 million captioned photographs. In: Advances in neural information processing systems, pp 1143\u20131151"},{"key":"2171_CR33","unstructured":"Papineni K, Roukos S, Ward T, Zhu WJ (2002) Bleu: a method for automatic evaluation of machine translation. In: Proceedings of the 40th annual meeting on association for computational linguistics, Association for Computational Linguistics, pp 311\u2013318"},{"issue":"4","key":"2171_CR34","doi-asserted-by":"crossref","first-page":"835","DOI":"10.1109\/TPAMI.2012.175","volume":"35","author":"A Prest","year":"2013","unstructured":"Prest A, Ferrari V, Schmid C (2013) Explicit modeling of human-object interactions in realistic videos. IEEE Trans Pattern Anal Mach Intell 35(4):835\u2013848","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2171_CR35","unstructured":"Ratliff N, Bagnell JA, Zinkevich M (2006) Subgradient methods for maximum margin structured learning. In: ICML workshop on learning in structured output spaces, vol. 46. Citeseer"},{"key":"2171_CR36","doi-asserted-by":"crossref","unstructured":"Rohrbach M, Qiu W, Titov I, Thater S, Pinkal M, Schiele B (2013) Translating video content to natural language descriptions. In: IEEE international conference on computer vision-ICCV, 2013, IEEE, pp 433\u2013440","DOI":"10.1109\/ICCV.2013.61"},{"key":"2171_CR37","doi-asserted-by":"crossref","unstructured":"Sadeghi MA, Farhadi A (2011) Recognition using visual phrases. In: IEEE conference on computer vision and pattern recognition (CVPR), IEEE, pp 1745\u20131752","DOI":"10.1109\/CVPR.2011.5995711"},{"key":"2171_CR38","unstructured":"Smolensky P (1986) Information processing in dynamical systems: foundations of harmony theory. University of Colorado, Boulder"},{"key":"2171_CR39","doi-asserted-by":"crossref","first-page":"207","DOI":"10.1162\/tacl_a_00177","volume":"2","author":"R Socher","year":"2014","unstructured":"Socher R, Karpathy A, Le QV, Manning CD, Ng AY (2014) Grounded compositional semantics for finding and describing images with sentences. Trans Assoc Comput Linguist 2:207\u2013218","journal-title":"Trans Assoc Comput Linguist"},{"key":"2171_CR40","doi-asserted-by":"crossref","unstructured":"Tsochantaridis I, Hofmann T, Joachims T, Altun Y (2004) Support vector machine learning for interdependent and structured output spaces. In: Proceedings of the twenty-first international conference on machine learning. ACM, p 104","DOI":"10.1145\/1015330.1015341"},{"key":"2171_CR41","doi-asserted-by":"crossref","first-page":"613","DOI":"10.1007\/978-3-319-16865-4_40","volume-title":"Computer vision-ACCV 2014","author":"F Yan","year":"2015","unstructured":"Yan F, Mikolajczyk K (2015) Leveraging high level visual information for matching images and captions. Computer vision-ACCV 2014. Springer, Berlin, pp 613\u2013627"},{"key":"2171_CR42","unstructured":"Yang Y, Teo CL, Daum\u00e9 III H, Aloimonos Y (2011) Corpus-guided sentence generation of natural images. In: Proceedings of the conference on empirical methods in natural language processing. Association for Computational Linguistics, pp 444\u2013454"},{"key":"2171_CR43","doi-asserted-by":"crossref","unstructured":"Yao B, Fei-Fei L (2010) Grouplet: a structured image representation for recognizing human and object interactions. In: IEEE conference on computer vision and pattern recognition (CVPR), IEEE, pp 9\u201316","DOI":"10.1109\/CVPR.2010.5540234"},{"key":"2171_CR44","doi-asserted-by":"crossref","unstructured":"Yao B, Fei-Fei L (2010) Modeling mutual context of object and human pose in human-object interaction activities. In: IEEE conference on computer vision and pattern recognition (CVPR), IEEE, pp 17\u201324","DOI":"10.1109\/CVPR.2010.5540235"},{"issue":"9","key":"2171_CR45","doi-asserted-by":"crossref","first-page":"1691","DOI":"10.1109\/TPAMI.2012.67","volume":"34","author":"B Yao","year":"2012","unstructured":"Yao B, Fei-Fei L (2012) Recognizing human-object interactions in still images by modeling the mutual context of objects and human poses. IEEE Trans Pattern Anal Mach Intell 34(9):1691\u20131703","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2171_CR46","doi-asserted-by":"crossref","unstructured":"Zhang X, Song X, Lv X, Jiang S, Ye Q, Jiao J (2015) Rich image description based on regions. In: Proceedings of the 23rd annual ACM conference on multimedia conference. ACM, pp 1315\u20131318","DOI":"10.1145\/2733373.2806338"}],"container-title":["Neural Computing and Applications"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s00521-015-2171-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-015-2171-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-015-2171-x","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-015-2171-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,1]],"date-time":"2025-06-01T04:53:36Z","timestamp":1748753616000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s00521-015-2171-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,1,19]]},"references-count":46,"journal-issue":{"issue":"8","published-print":{"date-parts":[[2017,8]]}},"alternative-id":["2171"],"URL":"https:\/\/doi.org\/10.1007\/s00521-015-2171-x","relation":{},"ISSN":["0941-0643","1433-3058"],"issn-type":[{"type":"print","value":"0941-0643"},{"type":"electronic","value":"1433-3058"}],"subject":[],"published":{"date-parts":[[2016,1,19]]}}}