{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T05:08:42Z","timestamp":1750136922933,"version":"3.40.4"},"publisher-location":"Cham","reference-count":40,"publisher":"Springer International Publishing","isbn-type":[{"type":"print","value":"9783319105772"},{"type":"electronic","value":"9783319105789"}],"license":[{"start":{"date-parts":[[2014,1,1]],"date-time":"2014-01-01T00:00:00Z","timestamp":1388534400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2014]]},"DOI":"10.1007\/978-3-319-10578-9_43","type":"book-chapter","created":{"date-parts":[[2014,8,14]],"date-time":"2014-08-14T00:51:57Z","timestamp":1407977517000},"page":"660-674","source":"Crossref","is-referenced-by-count":33,"title":["Boosting VLAD with Supervised Dictionary Learning and High-Order Statistics"],"prefix":"10.1007","author":[{"given":"Xiaojiang","family":"Peng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Limin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yu","family":"Qiao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qiang","family":"Peng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","reference":[{"key":"43_CR1","doi-asserted-by":"crossref","unstructured":"Arandjelovic, R., Zisserman, A.: All about VLAD. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.207"},{"key":"43_CR2","doi-asserted-by":"crossref","unstructured":"Bengio, Y., Courville, A.C., Vincent, P.: Representation learning: A review and new perspectives. TPAMI 35(8) (2013)","DOI":"10.1109\/TPAMI.2013.50"},{"key":"43_CR3","doi-asserted-by":"crossref","unstructured":"Boureau, Y.L., Bach, F., LeCun, Y., Ponce, J.: Learning mid-level features for recognition. In: CVPR (2010)","DOI":"10.1109\/CVPR.2010.5539963"},{"key":"43_CR4","doi-asserted-by":"crossref","unstructured":"Cai, Z., Wang, L., Peng, X., Qiao, Y.: Multi-view super vector for action recognition. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.83"},{"key":"43_CR5","doi-asserted-by":"crossref","unstructured":"Chatfield, K., Lempitsky, V.S., Vedaldi, A., Zisserman, A.: The devil is in the details: An evaluation of recent feature encoding methods. In: BMVC (2011)","DOI":"10.5244\/C.25.76"},{"key":"43_CR6","doi-asserted-by":"crossref","unstructured":"Delhumeau, J., Gosselin, P.H., J\u00e9gou, H., P\u00e9rez, P., et al.: Revisiting the vlad image representation. In: ACM MM (2013)","DOI":"10.1145\/2502081.2502171"},{"key":"43_CR7","unstructured":"Everingham, M., Van Gool, L., Williams, C.K.I., Winn, J., Zisserman, A.: The PASCAL Visual Object Classes Challenge 2007 (VOC 2007) Results (2007)"},{"key":"43_CR8","doi-asserted-by":"crossref","unstructured":"Gong, Y., Wang, L., Guo, R., Lazebnik, S.: Multi-scale orderless pooling of deep convolutional activation features. CoRR abs\/1403.1840 (2014)","DOI":"10.1007\/978-3-319-10584-0_26"},{"key":"43_CR9","unstructured":"Hogg, R.V., Craig, A.: Introduction to mathematical statistics (1994)"},{"key":"43_CR10","unstructured":"Jaakkola, T., Haussler, D., et al.: Exploiting generative models in discriminative classifiers. In: NIPS (1999)"},{"key":"43_CR11","doi-asserted-by":"crossref","unstructured":"Jain, M., J\u00e9gou, H., Bouthemy, P.: Better exploiting motion for better action recognition. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.330"},{"key":"43_CR12","doi-asserted-by":"crossref","unstructured":"J\u00e9gou, H., Perronnin, F., Douze, M., Schmid, C., et al.: Aggregating local image descriptors into compact codes. TPAMI (2012)","DOI":"10.1109\/TPAMI.2011.235"},{"key":"43_CR13","unstructured":"Jia, Y., Darrell, T.: Heavy-tailed distances for gradient based image descriptors. In: NIPS (2011)"},{"key":"43_CR14","unstructured":"Jiang, Y.G., Liu, J., Roshan Zamir, A., Laptev, I., Piccardi, M., Shah, M., Sukthankar, R.: THUMOS challenge: Action recognition with a large number of classes (2013), http:\/\/crcv.ucf.edu\/ICCV13-Action-Workshop\/"},{"key":"43_CR15","doi-asserted-by":"crossref","unstructured":"Kobayashi, T.: BoF meets HOG: Feature extraction based on histograms of oriented pdf gradients for image classification. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.102"},{"key":"43_CR16","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: NIPS (2012)"},{"key":"43_CR17","doi-asserted-by":"crossref","unstructured":"Kuehne, H., Jhuang, H., Garrote, E., Poggio, T., Serre, T.: HMDB: A large video database for human motion recognition. In: ICCV (2011)","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"43_CR18","doi-asserted-by":"crossref","unstructured":"LeCun, Y., Bottou, L., Bengio, Y., Haffner, P.: Gradient-based learning applied to document recognition. Proceedings of the IEEE 86(11) (1998)","DOI":"10.1109\/5.726791"},{"key":"43_CR19","unstructured":"Liu, L., Wang, L., Liu, X.: In defense of soft-assignment coding. In: ICCV (2011)"},{"key":"43_CR20","doi-asserted-by":"crossref","unstructured":"Lowe, D.G.: Distinctive image features from scale-invariant keypoints. IJCV (2004)","DOI":"10.1023\/B:VISI.0000029664.99615.94"},{"key":"43_CR21","unstructured":"Mihir, J., Jegou, H., Bouthemy, P.: Better exploiting motion for better action recognition. In: CVPR (2013)"},{"key":"43_CR22","unstructured":"Peng, X., Wang, L., Wang, X., Qiao, Y.: Bag of visual words and fusion methods for action recognition: Comprehensive study and good practice. CoRR abs\/1405.4506 (2014)"},{"key":"43_CR23","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"143","DOI":"10.1007\/978-3-642-15561-1_11","volume-title":"Computer Vision \u2013 ECCV 2010","author":"F. Perronnin","year":"2010","unstructured":"Perronnin, F., S\u00e1nchez, J., Mensink, T.: Improving the fisher kernel for large-scale image classification. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part IV. LNCS, vol.\u00a06314, pp. 143\u2013156. Springer, Heidelberg (2010)"},{"key":"43_CR24","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/978-3-642-33709-3_1","volume-title":"Computer Vision \u2013 ECCV 2012","author":"O. Russakovsky","year":"2012","unstructured":"Russakovsky, O., Lin, Y., Yu, K., Fei-Fei, L.: Object-centric spatial pooling for image classification. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012, Part II. LNCS, vol.\u00a07573, pp. 1\u201315. Springer, Heidelberg (2012)"},{"key":"43_CR25","doi-asserted-by":"crossref","unstructured":"Shi, F., Petriu, E., Laganiere, R.: Sampling strategies for real-time action recognition. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.335"},{"key":"43_CR26","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. CoRR abs\/1406.2199 (2014)"},{"key":"43_CR27","doi-asserted-by":"crossref","unstructured":"Sivic, J., Zisserman, A.: Video google: A text retrieval approach to object matching in videos. In: ICCV (2003)","DOI":"10.1109\/ICCV.2003.1238663"},{"key":"43_CR28","unstructured":"Soomro, K., Zamir, A.R., Shah, M.: UCF101: A dataset of 101 human actions classes from videos in the wild. ArXiv:1212.0402 (2012)"},{"key":"43_CR29","doi-asserted-by":"crossref","unstructured":"Sydorov, V., Sakurada, M., Lampert, C.H.: Deep fisher kernels - end to end learning of the fisher kernel gmm parameters. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.182"},{"key":"43_CR30","doi-asserted-by":"crossref","unstructured":"Tariq, U., Yang, J., Huang, T.S.: Maximum margin gmm learning for facial expression recognition. In: FG Workshops (2013)","DOI":"10.1109\/FG.2013.6553794"},{"key":"43_CR31","unstructured":"Vedaldi, A., Fulkerson, B.: VLFeat: An open and portable library of computer vision algorithms (2008)"},{"key":"43_CR32","doi-asserted-by":"crossref","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., Liu, C.L.: Dense trajectories and motion boundary descriptors for action recognition. IJCV (2013)","DOI":"10.1007\/s11263-012-0594-8"},{"key":"43_CR33","doi-asserted-by":"crossref","unstructured":"Wang, H., Schmid, C., et al.: Action recognition with improved trajectories. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.441"},{"key":"43_CR34","doi-asserted-by":"crossref","unstructured":"Wang, J., Yang, J., Yu, K., Lv, F., Huang, T., Gong, Y.: Locality-constrained linear coding for image classification. In: CVPR (2010)","DOI":"10.1109\/CVPR.2010.5540018"},{"key":"43_CR35","doi-asserted-by":"crossref","unstructured":"Wang, L., Qiao, Y., Tang, X.: Motionlets: Mid-level 3D parts for human motion recognition. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.345"},{"key":"43_CR36","doi-asserted-by":"crossref","unstructured":"Wang, X., Wang, L., Qiao, Y.: A comparative study of encoding, pooling and normalization methods for action recognition. In: ACCV (2012)","DOI":"10.1007\/978-3-642-37431-9_44"},{"key":"43_CR37","doi-asserted-by":"crossref","unstructured":"Wu, J., Zhang, Y., Lin, W.: Towards good practices for action video encoding. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.330"},{"key":"43_CR38","doi-asserted-by":"crossref","unstructured":"Wu, R., Yu, Y., Wang, W.: Scale: Supervised and cascaded laplacian eigenmaps for visual object recognition based on nearest neighbors. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.117"},{"key":"43_CR39","unstructured":"Yang, J., Yu, K., Gong, Y., Huang, T.: Linear spatial pyramid matching using sparse coding for image classification. In: CVPR (2009)"},{"key":"43_CR40","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"141","DOI":"10.1007\/978-3-642-15555-0_11","volume-title":"Computer Vision \u2013 ECCV 2010","author":"X. Zhou","year":"2010","unstructured":"Zhou, X., Yu, K., Zhang, T., Huang, T.S.: Image classification using super-vector coding of local image descriptors. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part V. LNCS, vol.\u00a06315, pp. 141\u2013154. Springer, Heidelberg (2010)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2014"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-10578-9_43","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,4]],"date-time":"2025-05-04T05:31:36Z","timestamp":1746336696000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-10578-9_43"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2014]]},"ISBN":["9783319105772","9783319105789"],"references-count":40,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-10578-9_43","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2014]]}}}