{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T15:50:06Z","timestamp":1779205806799,"version":"3.51.4"},"reference-count":51,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2021,3,1]],"date-time":"2021-03-01T00:00:00Z","timestamp":1614556800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,3,1]],"date-time":"2021-03-01T00:00:00Z","timestamp":1614556800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Machine Vision and Applications"],"published-print":{"date-parts":[[2021,3]]},"DOI":"10.1007\/s00138-021-01168-8","type":"journal-article","created":{"date-parts":[[2021,3,1]],"date-time":"2021-03-01T20:02:55Z","timestamp":1614628975000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":8,"title":["Recognition of varying size scene images using semantic analysis of deep activation maps"],"prefix":"10.1007","volume":"32","author":[{"given":"Shikha","family":"Gupta","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"A. D.","family":"Dileep","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Veena","family":"Thenkanidiyoor","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2021,3,1]]},"reference":[{"key":"1168_CR1","doi-asserted-by":"crossref","unstructured":"Bau, D., Zhou, B., Khosla, A., Oliva, A., Torralba, A.: Network dissection: quantifying interpretability of deep visual representations, pp. 3319\u20133327 (2017)","DOI":"10.1109\/CVPR.2017.354"},{"key":"1168_CR2","doi-asserted-by":"crossref","unstructured":"Chatfield, K., Lempitsky, V.S., Vedaldi, A., Zisserman, A.: The devil is in the details: an evaluation of recent feature encoding methods. In: Proceedings of the British Machine Vision Conference (BMVC 2011), Dundee, Scotland, vol.\u00a02, p.\u00a08 (2011)","DOI":"10.5244\/C.25.76"},{"key":"1168_CR3","doi-asserted-by":"publisher","first-page":"474","DOI":"10.1016\/j.patcog.2017.09.025","volume":"74","author":"X Cheng","year":"2018","unstructured":"Cheng, X., Lu, J., Feng, J., Yuan, B., Zhou, J.: Scene recognition with objectness. Pattern Recogn. 74, 474\u2013487 (2018)","journal-title":"Pattern Recogn."},{"key":"1168_CR4","unstructured":"Csurka, G., Dance, C., Fan, L., Willamowski, J., Bray, C.: Visual categorization with bags of keypoints. In: Proceedings of Workshop on Statistical Learning in Computer Vision (ECCV 2004), Prague, Czech Republic, vol.\u00a01, pp. 1\u20132 (2004)"},{"key":"1168_CR5","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., Fei-Fei, L.: Imagenet: a large-scale hierarchical image database. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2009), Florida, USA, pp. 248\u2013255 (2009)","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"1168_CR6","doi-asserted-by":"crossref","unstructured":"Dhillon, I.S., Guan, Y., Kulis, B.: Kernel k-means: spectral clustering and normalized cuts. In: Proceedings of the International Conference on Knowledge Discovery and Data Mining, pp. 551\u2013556 (2004)","DOI":"10.1145\/1014052.1014118"},{"key":"1168_CR7","doi-asserted-by":"publisher","unstructured":"Dixit, M., Chen, S., Gao, D., Rasiwasia, N., Vasconcelos, N.: Scene classification with semantic Fisher vectors. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2015), Boston, Massachusetts, pp. 2974\u20132983, https:\/\/doi.org\/10.1109\/CVPR.2015.7298916 (2015)","DOI":"10.1109\/CVPR.2015.7298916"},{"key":"1168_CR8","unstructured":"Donahue, J., Jia, Y., Vinyals, O., Hoffman, J., Zhang, N., Tzeng, E., Darrell, T.: Decaf: A deep convolutional activation feature for generic visual recognition. In: Proceedings of the International Conference on Machine Learning (ICML 2014), Beijing, China, pp. 647\u2013655 (2014)"},{"issue":"3","key":"1168_CR9","doi-asserted-by":"publisher","first-page":"186","DOI":"10.1007\/s11263-014-0700-1","volume":"108","author":"B Fernando","year":"2014","unstructured":"Fernando, B., Fromont, E., Tuytelaars, T.: Mining mid-level features for image classification. Int. J. Comput. Vis. 108(3), 186\u2013203 (2014)","journal-title":"Int. J. Comput. Vis."},{"key":"1168_CR10","unstructured":"Fong, R., Vedaldi, A.: Net2vec: Quantifying and explaining how concepts are encoded by filters in deep neural networks (2018) Preprint arXiv:1801.03454"},{"key":"1168_CR11","unstructured":"Gao, B.B., Wei, X.S., Wu, J., Lin, W.: Deep spatial pyramid: the devil is once again in the details (2015). Preprint arXiv:1504.05277"},{"key":"1168_CR12","doi-asserted-by":"crossref","unstructured":"Gong, Y., Wang, L., Guo, R., Lazebnik, S.: Multi-scale orderless pooling of deep convolutional activation features. In: Proceedings of European Conference on Computer Vision (ECCV 2014), Zurich, pp. 392\u2013407 (2014)","DOI":"10.1007\/978-3-319-10584-0_26"},{"key":"1168_CR13","doi-asserted-by":"crossref","unstructured":"Gupta, S., Dileep, A.D., Thenkanidiyoor, V.: Segment-level pyramid match kernels for the classification of varying length patterns of speech using svms. In: Proceedings of the European Signal Processing Conference (EUSIPCO 2016), Budapest, Hungary, pp. 2030\u20132034 (2016)","DOI":"10.1109\/EUSIPCO.2016.7760605"},{"key":"1168_CR14","doi-asserted-by":"crossref","unstructured":"Gupta, S., Dileep, A.D., Thenkanidiyoor, V.: The semantic multinomial representation of images obtained using dynamic kernel based pseudo-concept SVMs. In: Proceedings of National Conference on Communication (NCC 2017), Chennai, India, pp. 1\u20136 (2017)","DOI":"10.1109\/NCC.2017.8077077"},{"key":"1168_CR15","doi-asserted-by":"crossref","unstructured":"Gupta, S., Dinesh, D.A., Thenkanidiyoor, V.: Deep cnn based pseudo-concept selection and modeling for generation of semantic multinomial representation of scene images. In: Proceedings of the ACM India Joint International Conference on Data Science and Management of Data, pp. 336\u2013339 (2018a)","DOI":"10.1145\/3152494.3167985"},{"key":"1168_CR16","doi-asserted-by":"crossref","unstructured":"Gupta, S., Pradhan, D.K., Aroor, Dinesh D., Thenkanidiyoor, V.: Deep spatial pyramid match kernel for scene classification. In: International Conference on Pattern Recognition Applications and Methods ICPRAM, pp. 141\u2013148 (2018b)","DOI":"10.5220\/0006596101410148"},{"issue":"1","key":"1168_CR17","doi-asserted-by":"publisher","first-page":"231","DOI":"10.1007\/s10772-018-09587-1","volume":"22","author":"S Gupta","year":"2019","unstructured":"Gupta, S., Karanath, A., Mahrifa, K., Dileep, A.D., Thenkanidiyoor, V.: Segment-level probabilistic sequence kernel and segment-level pyramid match kernel based extreme learning machine for classification of varying length patterns of speech. Int. J. Speech Technol. 22(1), 231\u2013249 (2019)","journal-title":"Int. J. Speech Technol."},{"issue":"9","key":"1168_CR18","doi-asserted-by":"publisher","first-page":"1904","DOI":"10.1109\/TPAMI.2015.2389824","volume":"37","author":"K He","year":"2015","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Spatial pyramid pooling in deep convolutional networks for visual recognition. IEEE Trans. Pattern Anal. Mach. Intell. 37(9), 1904\u20131916 (2015)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1168_CR19","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2016, Las Vegas, USA, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"issue":"6","key":"1168_CR20","doi-asserted-by":"publisher","first-page":"849","DOI":"10.1080\/13506280444000544","volume":"12","author":"J Henderson","year":"2005","unstructured":"Henderson, J.: Introduction to real-world scene perception. Vis. Cogn. 12(6), 849\u2013851 (2005)","journal-title":"Vis. Cogn."},{"key":"1168_CR21","doi-asserted-by":"crossref","unstructured":"Herranz, L., Jiang, S., Li, X.: Scene recognition with CNNs: objects, scales and dataset bias. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2016), Las Vegas, USA, pp. 571\u2013579 (2016)","DOI":"10.1109\/CVPR.2016.68"},{"issue":"1s","key":"1168_CR22","first-page":"5","volume":"15","author":"S Jiang","year":"2019","unstructured":"Jiang, S., Chen, G., Song, X., Liu, L.: Deep patch representations with shared codebook for scene classification. ACM Trans. Multimed. Comput. Commun. Appl. (TOMM) 15(1s), 5 (2019)","journal-title":"ACM Trans. Multimed. Comput. Commun. Appl. (TOMM)"},{"issue":"7","key":"1168_CR23","doi-asserted-by":"publisher","first-page":"3372","DOI":"10.1109\/TIP.2016.2567076","volume":"25","author":"SH Khan","year":"2016","unstructured":"Khan, S.H., Hayat, M., Bennamoun, M., Togneri, R., Sohel, F.A.: A discriminative representation of convolutional features for indoor scene recognition. IEEE Trans. Image Process. 25(7), 3372\u20133383 (2016)","journal-title":"IEEE Trans. Image Process."},{"key":"1168_CR24","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: Pereira F, Burges CJC, Bottou L, Weinberger KQ (eds) Proceedings of Conference on Advances in Neural Information Processing Systems (NIPS 2012), Nevada, USA, pp. 1097\u20131105 (2012)"},{"issue":"1","key":"1168_CR25","doi-asserted-by":"publisher","first-page":"20","DOI":"10.1007\/s11263-013-0660-x","volume":"107","author":"LJ Li","year":"2014","unstructured":"Li, L.J., Su, H., Lim, Y., Fei-Fei, L.: Object bank: an object-level image representation for high-level visual recognition. Int. J. Comput. Vis. 107(1), 20\u201339 (2014). https:\/\/doi.org\/10.1007\/s11263-013-0660-x","journal-title":"Int. J. Comput. Vis."},{"key":"1168_CR26","unstructured":"Li, P., Samorodnitsk, G., Hopcroft, J.: Sign cauchy projections and chi-square kernel. In: Proceedings of Conference on Advances in Neural Information Processing Systems (NIPS 2013), Harrah\u2019s Lake Tahoe, USA, pp. 2571\u20132579 (2013)"},{"issue":"3","key":"1168_CR27","doi-asserted-by":"publisher","first-page":"344","DOI":"10.1007\/s11263-016-0945-y","volume":"121","author":"Y Li","year":"2017","unstructured":"Li, Y., Liu, L., Shen, C., Van Den Hengel, A.: Mining mid-level visual patterns with deep cnn activations. Int. J. Comput. Vis. 121(3), 344\u2013364 (2017)","journal-title":"Int. J. Comput. Vis."},{"key":"1168_CR28","doi-asserted-by":"crossref","unstructured":"Liu, C., Yuen, J., Torralba, A.: Nonparametric scene parsing: Label transfer via dense scene alignment. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2009), Florida, USA, pp. 1972\u20131979 (2009)","DOI":"10.1109\/CVPR.2009.5206536"},{"issue":"2","key":"1168_CR29","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","volume":"60","author":"DG Lowe","year":"2004","unstructured":"Lowe, D.G.: Distinctive image features from scale-invariant keypoints. Int. J. Comput. Vis. 60(2), 91\u2013110 (2004)","journal-title":"Int. J. Comput. Vis."},{"issue":"3","key":"1168_CR30","doi-asserted-by":"publisher","first-page":"145","DOI":"10.1023\/A:1011139631724","volume":"42","author":"A Oliva","year":"2001","unstructured":"Oliva, A., Torralba, A.: Modeling the shape of the scene: a holistic representation of the spatial envelope. Int. J. Comput. Vis. 42(3), 145\u2013175 (2001)","journal-title":"Int. J. Comput. Vis."},{"key":"1168_CR31","doi-asserted-by":"crossref","unstructured":"Quattoni, A., Torralba, A.: Recognizing indoor scenes. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2009), Florida, USA, pp. 413\u2013420 (2009)","DOI":"10.1109\/CVPRW.2009.5206537"},{"issue":"5","key":"1168_CR32","doi-asserted-by":"publisher","first-page":"902","DOI":"10.1109\/TPAMI.2011.175","volume":"34","author":"N Rasiwasia","year":"2012","unstructured":"Rasiwasia, N., Vasconcelos, N.: Holistic context models for visual recognition. IEEE Trans. Pattern Anal. Mach. Intell. 34(5), 902\u2013917 (2012)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"5","key":"1168_CR33","doi-asserted-by":"publisher","first-page":"923","DOI":"10.1109\/TMM.2007.900138","volume":"9","author":"N Rasiwasia","year":"2007","unstructured":"Rasiwasia, N., Moreno, P.J., Vasconcelos, N.: Bridging the gap: query by semantic example. IEEE Trans. Multimed. 9(5), 923\u2013938 (2007)","journal-title":"IEEE Trans. Multimed."},{"issue":"3","key":"1168_CR34","doi-asserted-by":"publisher","first-page":"222","DOI":"10.1007\/s11263-013-0636-x","volume":"105","author":"J S\u00e1nchez","year":"2013","unstructured":"S\u00e1nchez, J., Perronnin, F., Mensink, T., Verbeek, J.: Image classification with the fisher vector: theory and practice. Int. J. Comput. Vis. 105(3), 222\u2013245 (2013)","journal-title":"Int. J. Comput. Vis."},{"key":"1168_CR35","doi-asserted-by":"publisher","first-page":"82066","DOI":"10.1109\/ACCESS.2020.2989863","volume":"8","author":"H Seong","year":"2020","unstructured":"Seong, H., Hyun, J., Kim, E.: Fosnet: an end-to-end trainable deep neural network for scene recognition. IEEE Access 8, 82066\u201382077 (2020)","journal-title":"IEEE Access"},{"key":"1168_CR36","doi-asserted-by":"crossref","unstructured":"Sharma, K., Gupta, S., Dileep, A.D., Rameshan, R.: Scene image classification using reduced virtual feature representation in sparse framework. In: 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 2701\u20132705 (2018)","DOI":"10.1109\/ICASSP.2018.8462429"},{"key":"1168_CR37","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition.Preprint arXiv:1409.1556 (2014)"},{"key":"1168_CR38","doi-asserted-by":"publisher","first-page":"84967","DOI":"10.1109\/ACCESS.2019.2925002","volume":"7","author":"C Sitaula","year":"2019","unstructured":"Sitaula, C., Xiang, Y., Zhang, Y., Lu, X., Aryal, S.: Indoor image representation by high-level semantic features. IEEE Access 7, 84967\u201384979 (2019)","journal-title":"IEEE Access"},{"issue":"6","key":"1168_CR39","doi-asserted-by":"publisher","first-page":"2721","DOI":"10.1109\/TIP.2017.2686017","volume":"26","author":"X Song","year":"2017","unstructured":"Song, X., Jiang, S., Herranz, L.: Multi-scale multi-feature context modeling for scene recognition in the semantic manifold. IEEE Trans. Image Process. 26(6), 2721\u20132735 (2017)","journal-title":"IEEE Trans. Image Process."},{"issue":"6","key":"1168_CR40","doi-asserted-by":"publisher","first-page":"1715","DOI":"10.1109\/TCSVT.2018.2848543","volume":"29","author":"N Sun","year":"2019","unstructured":"Sun, N., Li, W., Liu, J., Han, G., Wu, C.: Fusing object semantics and deep appearance features for scene recognition. IEEE Trans. Circuits Syst. Video Technol. 29(6), 1715\u20131728 (2019)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"1168_CR41","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V., Rabinovich, A.: Going deeper with convolutions. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2015), Boston, Massachusetts, pp. 1\u20139 (2015)","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"1168_CR42","doi-asserted-by":"publisher","first-page":"188","DOI":"10.1016\/j.neucom.2016.11.023","volume":"225","author":"P Tang","year":"2017","unstructured":"Tang, P., Wang, H., Kwong, S.: G-ms2f: Googlenet based multi-stage feature fusion of deep cnn for scene recognition. Neurocomputing 225, 188\u2013197 (2017)","journal-title":"Neurocomputing"},{"key":"1168_CR43","doi-asserted-by":"crossref","unstructured":"Vogel, J., Schiele, B.: Natural scene retrieval based on a semantic modeling step. In: Proceedings of the International Conference on Image and Video Retrieval (CIVR 2004), Dublin, Ireland, pp. 207\u2013215 (2004)","DOI":"10.1007\/978-3-540-27814-6_27"},{"key":"1168_CR44","doi-asserted-by":"crossref","unstructured":"Wu, R., Wang, B., Wang, W., Yu, Y.: Harvesting discriminative meta objects with deep cnn features for scene classification. In: Proceedings of the IEEE International Conference on Computer Vision (ICCV 2015), Santiago, Chile, pp. 1287\u20131295 (2015)","DOI":"10.1109\/ICCV.2015.152"},{"key":"1168_CR45","doi-asserted-by":"crossref","unstructured":"Xiao, J., Hays, J., Ehinger, K.A., Oliva, A., Torralba, A.: Sun database: large-scale scene recognition from abbey to zoo. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2010), San Francisco, CA, pp. 3485\u20133492 (2010)","DOI":"10.1109\/CVPR.2010.5539970"},{"issue":"6","key":"1168_CR46","doi-asserted-by":"publisher","first-page":"1263","DOI":"10.1109\/TCSVT.2015.2511543","volume":"27","author":"GS Xie","year":"2015","unstructured":"Xie, G.S., Zhang, X.Y., Yan, S., Liu, C.L.: Hybrid cnn and dictionary-based models for scene recognition and domain adaptation. IEEE Trans. Circuits Syst. Video Technol. 27(6), 1263\u20131274 (2015)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"1168_CR47","unstructured":"Yang, J., Yu, K., Gong, Y., Huang, T.: Linear spatial pyramid matching using sparse coding for image classification. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2009), Florida, USA, pp. 1794\u20131801 (2009)"},{"key":"1168_CR48","unstructured":"Yosinski, J., Clune, J., Nguyen, A., Fuchs, T., Lipson, H.: Understanding neural networks through deep visualization. In: Proceedings of the Deep Learning Workshop in International Conference on Machine Learning (ICML 2015) (2015)"},{"key":"1168_CR49","doi-asserted-by":"crossref","unstructured":"Zeiler, M.D., Fergus, R.: Visualizing and understanding convolutional networks. In: Proceedings of the European Conference on Computer Vision (ECCV 2014), Zurich, pp. 818\u2013833 (2014)","DOI":"10.1007\/978-3-319-10590-1_53"},{"key":"1168_CR50","unstructured":"Zhou, B., Lapedriza, A., Xiao, J., Torralba, A., Oliva, A.: Learning deep features for scene recognition using places database. In: Proceedings of Conference on Advances in Neural Information Processing Systems (NIPS 2014), Montreal, Canada, pp. 487\u2013495 (2014)"},{"issue":"6","key":"1168_CR51","doi-asserted-by":"publisher","first-page":"1452","DOI":"10.1109\/TPAMI.2017.2723009","volume":"40","author":"B Zhou","year":"2017","unstructured":"Zhou, B., Lapedriza, A., Khosla, A., Oliva, A., Torralba, A.: Places: a 10 million image database for scene recognition. IEEE Trans. Pattern Anal. Mach. Intell. 40(6), 1452\u20131464 (2017)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."}],"container-title":["Machine Vision and Applications"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00138-021-01168-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s00138-021-01168-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00138-021-01168-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,3,11]],"date-time":"2021-03-11T19:28:41Z","timestamp":1615490921000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s00138-021-01168-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,3]]},"references-count":51,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2021,3]]}},"alternative-id":["1168"],"URL":"https:\/\/doi.org\/10.1007\/s00138-021-01168-8","relation":{},"ISSN":["0932-8092","1432-1769"],"issn-type":[{"value":"0932-8092","type":"print"},{"value":"1432-1769","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,3]]},"assertion":[{"value":"18 April 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 September 2020","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 January 2021","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 March 2021","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"52"}}