{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,3]],"date-time":"2026-02-03T12:17:13Z","timestamp":1770121033898,"version":"3.49.0"},"reference-count":40,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2018,2,26]],"date-time":"2018-02-26T00:00:00Z","timestamp":1519603200000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["World Wide Web"],"published-print":{"date-parts":[[2019,3]]},"DOI":"10.1007\/s11280-018-0531-z","type":"journal-article","created":{"date-parts":[[2018,2,26]],"date-time":"2018-02-26T07:56:10Z","timestamp":1519631770000},"page":"621-636","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":37,"title":["Residual attention-based LSTM for video captioning"],"prefix":"10.1007","volume":"22","author":[{"given":"Xiangpeng","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhilong","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lijiang","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2522-6394","authenticated-orcid":false,"given":"Lianli","family":"Gao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,2,26]]},"reference":[{"key":"531_CR1","unstructured":"Banerjee, S., Lavie, A.: Meteor: an Automatic Metric for Mt Evaluation with Improved Correlation with Human Judgments. In: Proceedings of the Acl Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation And\/Or Summarization, Vol. 29, pp. 65\u201372 (2005)"},{"key":"531_CR2","doi-asserted-by":"crossref","unstructured":"Fang, H., Gupta, S., Iandola, F., Srivastava, R.K., Deng, L., Doll\u00e1r, P., Gao, J., He, X., Mitchell, M., Platt, J.C., et al.: From Captions to Visual Concepts and Back. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1473\u20131482 (2015)","DOI":"10.1109\/CVPR.2015.7298754"},{"issue":"9","key":"531_CR3","doi-asserted-by":"publisher","first-page":"2045","DOI":"10.1109\/TMM.2017.2729019","volume":"19","author":"L Gao","year":"2017","unstructured":"Gao, L., Guo, Z., Zhang, H., Xu, X., Shen, H.T.: Video captioning with attention-based LSTM and semantic consistency. IEEE Trans. Multimedia 19(9), 2045\u20132055 (2017)","journal-title":"IEEE Trans. Multimedia"},{"key":"531_CR4","doi-asserted-by":"crossref","unstructured":"Guadarrama, S., Krishnamoorthy, N., Malkarnenkar, G., Venugopalan, S., Mooney, R., Darrell, T., Saenko, K.: Youtube2text: Recognizing and Describing Arbitrary Activities Using Semantic Hierarchies and Zero-Shot Recognition. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2712\u20132719 (2013)","DOI":"10.1109\/ICCV.2013.337"},{"key":"531_CR5","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep Residual Learning for Image Recognition. In: The IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2016)","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"531_CR6","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 9(8), 1735\u20131780 (1997)","journal-title":"Neural Comput."},{"key":"531_CR7","doi-asserted-by":"crossref","unstructured":"Kafle, K., Kanan, C.: Answer-Type Prediction for Visual Question Answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4976\u20134984 (2016)","DOI":"10.1109\/CVPR.2016.538"},{"issue":"2","key":"531_CR8","doi-asserted-by":"publisher","first-page":"171","DOI":"10.1023\/A:1020346032608","volume":"50","author":"A Kojima","year":"2002","unstructured":"Kojima, A., Tamura, T., Fukunaga, K.: Natural language description of human activities from video images based on concept hierarchy of actions. Int. J. Comput. Vis. 50(2), 171\u2013184 (2002)","journal-title":"Int. J. Comput. Vis."},{"key":"531_CR9","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet Classification with Deep Convolutional Neural Networks. In: Advances in Neural Information Processing Systems, pp. 1097\u20131105 (2012)"},{"key":"531_CR10","doi-asserted-by":"publisher","first-page":"89","DOI":"10.1016\/j.neucom.2016.11.081","volume":"253","author":"X Li","year":"2017","unstructured":"Li, X., Gao, L., Xu, X., Shao, J., Shen, F., Song, J.: Kernel based latent semantic sparse hashing for large-scale retrieval from heterogeneous data sources. Neurocomputing 253, 89\u201396 (2017)","journal-title":"Neurocomputing"},{"key":"531_CR11","unstructured":"Mao, J., Xu, W., Yang, Y., Wang, J., Huang, Z., Yuille, A.: Deep captioning with multimodal recurrent neural networks (m-rnn). arXiv: 1412.6632 (2014)"},{"key":"531_CR12","doi-asserted-by":"crossref","unstructured":"Pan, P., Xu, Z., Yang, Y., Wu, F., Zhuang, Y.: Hierarchical Recurrent Neural Encoder for Video Representation with Application to Captioning. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1029\u20131038 (2016)","DOI":"10.1109\/CVPR.2016.117"},{"key":"531_CR13","doi-asserted-by":"crossref","unstructured":"Pan, Y., Mei, T., Yao, T., Li, H., Rui, Y.: Jointly Modeling Embedding and Translation to Bridge Video and Language. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4594\u20134602 (2016)","DOI":"10.1109\/CVPR.2016.497"},{"key":"531_CR14","doi-asserted-by":"crossref","unstructured":"Pan, Y., Yao, T., Li, H., Mei, T.: Video captioning with transferred semantic attributes. arXiv: 1611.07675 (2016)","DOI":"10.1109\/CVPR.2017.111"},{"key":"531_CR15","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., Zhu, W.J.: Bleu: a Method for Automatic Evaluation of Machine Translation. In: Proceedings of the 40Th Annual Meeting on Association for Computational Linguistics, pp. 311\u2013318. Association for Computational Linguistics (2002)","DOI":"10.3115\/1073083.1073135"},{"key":"531_CR16","doi-asserted-by":"crossref","unstructured":"Rohrbach, M., Qiu, W., Titov, I., Thater, S., Pinkal, M., Schiele, B.: Translating Video Content to Natural Language Descriptions. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 433\u2013440 (2013)","DOI":"10.1109\/ICCV.2013.61"},{"key":"531_CR17","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. arXiv: 1409.1556 (2014)"},{"key":"531_CR18","doi-asserted-by":"crossref","unstructured":"Song, J., Gao, L., Guo, Z., Liu, W., Zhang, D., Shen, H.T.: Hierarchical LSTM with Adjusted Temporal Attention for Video Captioning. In: IJCAI, pp. 2737\u20132743 (2017)","DOI":"10.24963\/ijcai.2017\/381"},{"key":"531_CR19","doi-asserted-by":"publisher","first-page":"175","DOI":"10.1016\/j.patcog.2017.03.021","volume":"75","author":"J Song","year":"2018","unstructured":"Song, J., Gao, L., Liu, L., Zhu, X., Sebe, N.: Quantization-based hashing: a general framework for scalable image and video retrieval. Pattern Recogn. 75, 175\u2013187 (2018)","journal-title":"Pattern Recogn."},{"issue":"11","key":"531_CR20","doi-asserted-by":"publisher","first-page":"4999","DOI":"10.1109\/TIP.2016.2601260","volume":"25","author":"J Song","year":"2016","unstructured":"Song, J., Gao, L., Nie, F., Shen, H.T., Yan, Y., Sebe, N.: Optimized graph learning using partial tags and multiple features for image and video annotation. IEEE Trans. Image Process. 25(11), 4999\u20135011 (2016)","journal-title":"IEEE Trans. Image Process."},{"key":"531_CR21","doi-asserted-by":"crossref","unstructured":"Song, J., He, T., Fan, H., Gao, L.: Deep discrete hashing with self-supervised pairwise labels. arXiv: 1707.02112 (2017)","DOI":"10.1007\/978-3-319-71249-9_14"},{"issue":"3","key":"531_CR22","doi-asserted-by":"publisher","first-page":"484","DOI":"10.1109\/TMM.2016.2515990","volume":"18","author":"J Song","year":"2016","unstructured":"Song, J., Shen, H.T., Wang, J., Huang, Z., Sebe, N., Wang, J.: A distance-computation-free search scheme for binary code databases. IEEE Trans. Multimed. 18(3), 484\u2013495 (2016)","journal-title":"IEEE Trans. Multimed."},{"key":"531_CR23","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V., Rabinovich, A.: Going Deeper with Convolutions. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1\u20139 (2015)","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"531_CR24","doi-asserted-by":"crossref","unstructured":"Teney, D., Anderson, P., He, X., Hengel, A.V.D.: Tips and tricks for visual question answering: Learnings from the 2017 challenge. arXiv: 1708.02711 (2017)","DOI":"10.1109\/CVPR.2018.00444"},{"key":"531_CR25","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., Paluri, M.: Learning Spatiotemporal Features with 3D Convolutional Networks. In: 2015 IEEE International Conference on Computer Vision (ICCV), pp. 4489\u20134497. IEEE (2015)","DOI":"10.1109\/ICCV.2015.510"},{"key":"531_CR26","doi-asserted-by":"crossref","unstructured":"Vedantam, R., Lawrence Zitnick, C., Parikh, D.: Cider: Consensus-Based Image Description Evaluation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4566\u20134575 (2015)","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"531_CR27","doi-asserted-by":"crossref","unstructured":"Venugopalan, S., Rohrbach, M., Donahue, J., Mooney, R., Darrell, T., Saenko, K.: Sequence to Sequence-Video to Text. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 4534\u20134542 (2015)","DOI":"10.1109\/ICCV.2015.515"},{"key":"531_CR28","doi-asserted-by":"crossref","unstructured":"Venugopalan, S., Xu, H., Donahue, J., Rohrbach, M., Mooney, R., Saenko, K.: Translating videos to natural language using deep recurrent neural networks. arXiv: 1412.4729 (2014)","DOI":"10.3115\/v1\/N15-1173"},{"key":"531_CR29","doi-asserted-by":"crossref","unstructured":"Vinyals, O., Toshev, A., Bengio, S., Erhan, D.: Show and Tell: a Neural Image Caption Generator. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 3156\u20133164 (2015)","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"531_CR30","unstructured":"Wang, J., Zhang, T., Sebe, N., Shen, H.T., et al.: A survey on learning to hash. IEEE Transactions on Pattern Analysis and Machine Intelligence (2017)"},{"key":"531_CR31","unstructured":"Wu, Q., Shen, C., van den Hengel, A., Liu, L., Dick, A.: Image captioning with an intermediate attributes layer. arXiv: 1506.01144 (2015)"},{"key":"531_CR32","doi-asserted-by":"crossref","unstructured":"Xu, J., Mei, T., Yao, T., Rui, Y.: Msr-Vtt: a Large Video Description Dataset for Bridging Video and Language. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2016)","DOI":"10.1109\/CVPR.2016.571"},{"key":"531_CR33","doi-asserted-by":"crossref","unstructured":"Xu, R., Xiong, C., Chen, W., Corso, J.J.: Jointly Modeling Deep Video and Compositional Text to Bridge Vision and Language in a Unified Framework. In: AAAI, vol. 5, p. 6 (2015)","DOI":"10.1609\/aaai.v29i1.9512"},{"key":"531_CR34","doi-asserted-by":"crossref","unstructured":"Yao, L., Torabi, A., Cho, K., Ballas, N., Pal, C., Larochelle, H., Courville, A.: Describing Videos by Exploiting Temporal Structure. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 4507\u20134515 (2015)","DOI":"10.1109\/ICCV.2015.512"},{"key":"531_CR35","doi-asserted-by":"crossref","unstructured":"Yu, H., Wang, J., Huang, Z., Yang, Y., Xu, W.: Video Paragraph Captioning Using Hierarchical Recurrent Neural Networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4584\u20134593 (2016)","DOI":"10.1109\/CVPR.2016.496"},{"key":"531_CR36","unstructured":"Zeiler, M.D.: Adadelta: an adaptive learning rate method. arXiv: 1212.5701 (2012)"},{"key":"531_CR37","doi-asserted-by":"crossref","unstructured":"Zhang, H., Wang, M., Hong, R., Chua, T.S.: Play and Rewind: Optimizing Binary Representations of Videos by Self-Supervised Temporal Hashing. In: Proceedings of the 2016 ACM on Multimedia Conference, pp. 781\u2013790. ACM (2016)","DOI":"10.1145\/2964284.2964308"},{"key":"531_CR38","doi-asserted-by":"crossref","unstructured":"Zhu, X., Huang, Z., Shen, H.T., Zhao, X.: Linear Cross-Modal Hashing for Efficient Multimedia Search. In: ACM MM, pp. 143\u2013152 (2013)","DOI":"10.1145\/2502081.2502107"},{"issue":"2","key":"531_CR39","doi-asserted-by":"publisher","first-page":"450","DOI":"10.1109\/TCYB.2015.2403356","volume":"46","author":"X Zhu","year":"2016","unstructured":"Zhu, X., Li, X., Zhang, S.: Block-row sparse multiview multilabel learning for image classification. IEEE Transactions on Cybernetics 46(2), 450\u2013461 (2016)","journal-title":"IEEE Transactions on Cybernetics"},{"issue":"9","key":"531_CR40","doi-asserted-by":"publisher","first-page":"3737","DOI":"10.1109\/TIP.2014.2332764","volume":"23","author":"X Zhu","year":"2014","unstructured":"Zhu, X., Zhang, L., Huang, Z.: A sparse embedding and least variance encoding approach to hashing. IEEE Trans. Image Process. 23(9), 3737\u20133750 (2014)","journal-title":"IEEE Trans. Image Process."}],"container-title":["World Wide Web"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11280-018-0531-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11280-018-0531-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11280-018-0531-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,8,14]],"date-time":"2022-08-14T21:48:28Z","timestamp":1660513708000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11280-018-0531-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,2,26]]},"references-count":40,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2019,3]]}},"alternative-id":["531"],"URL":"https:\/\/doi.org\/10.1007\/s11280-018-0531-z","relation":{},"ISSN":["1386-145X","1573-1413"],"issn-type":[{"value":"1386-145X","type":"print"},{"value":"1573-1413","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,2,26]]},"assertion":[{"value":"29 September 2017","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 December 2017","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 January 2018","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"26 February 2018","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}