{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,15]],"date-time":"2026-04-15T21:43:12Z","timestamp":1776289392537,"version":"3.50.1"},"reference-count":55,"publisher":"Springer Science and Business Media LLC","issue":"22","license":[{"start":{"date-parts":[[2022,4,11]],"date-time":"2022-04-11T00:00:00Z","timestamp":1649635200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,4,11]],"date-time":"2022-04-11T00:00:00Z","timestamp":1649635200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2022,9]]},"DOI":"10.1007\/s11042-022-12931-y","type":"journal-article","created":{"date-parts":[[2022,4,11]],"date-time":"2022-04-11T20:02:46Z","timestamp":1649707366000},"page":"32057-32072","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Noise invariant feature pooling for the internet of audio things"],"prefix":"10.1007","volume":"81","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7398-5862","authenticated-orcid":false,"given":"Christoforos","family":"Nalmpantis","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lazaros","family":"Vrysis","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Danai","family":"Vlachava","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lefteris","family":"Papageorgiou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dimitris","family":"Vrakas","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,4,11]]},"reference":[{"key":"12931_CR1","doi-asserted-by":"publisher","unstructured":"Abdulhussain SH, Rahman Ramli A, Mahmmod BM, Iqbal Saripan M, Al-Haddad S, Baker T, Flayyih WN, Jassim WA (2019) A fast feature extraction algorithm for image and video processing. In: 2019 international joint conference on neural networks (IJCNN), pp 1\u20138, https:\/\/doi.org\/10.1109\/IJCNN.2019.8851750","DOI":"10.1109\/IJCNN.2019.8851750"},{"key":"12931_CR2","doi-asserted-by":"crossref","unstructured":"Achille A, Soatto S (2018) Information dropout: Learning optimal representations through noisy computation. IEEE Transactions on pattern analysis and machine intelligence","DOI":"10.1109\/TPAMI.2017.2784440"},{"key":"12931_CR3","unstructured":"Alemi A, Fischer I, Dillon J, Murphy K (2017) Deep variational information bottleneck. In: ICLR, https:\/\/arxiv.org\/abs\/1612.00410"},{"key":"12931_CR4","doi-asserted-by":"crossref","unstructured":"Bacanin N, Bezdan T, Venkatachalam K, Al-Turjman F (2021) Optimized convolutional neural network by firefly algorithm for magnetic resonance image classification of glioma brain tumor grade. Journal of Real-Time Image Processing, pp 1\u201314","DOI":"10.1109\/ZINC52049.2021.9499297"},{"key":"12931_CR5","doi-asserted-by":"crossref","unstructured":"Bahdanau D, Chorowski J, Serdyuk D, Brakel P, Bengio Y (2016) End-to-end attention-based large vocabulary speech recognition. In: 2016 IEEE international conference on acoustics, speech and signal processing (ICASSP), IEEE, pp 4945\u20134949","DOI":"10.1109\/ICASSP.2016.7472618"},{"key":"12931_CR6","doi-asserted-by":"publisher","unstructured":"Bharitkar S (2019) Generative feature models and robustness analysis for multimedia content classification. In: 2019 18th IEEE international conference on machine learning and applications (ICMLA), pp 105\u2013110. https:\/\/doi.org\/10.1109\/ICMLA.2019.00025","DOI":"10.1109\/ICMLA.2019.00025"},{"key":"12931_CR7","doi-asserted-by":"crossref","unstructured":"Bountourakis V, Vrysis L, Konstantoudakis K, Vryzas N (2019) An enhanced temporal feature integration method for environmental sound recognition. In: Acoustics, multidisciplinary digital publishing institute, vol 1, pp 410\u2013422","DOI":"10.3390\/acoustics1020023"},{"key":"12931_CR8","unstructured":"Boureau YL, Ponce J, LeCun Y (2010) A theoretical analysis of feature pooling in visual recognition. In: Proceedings of the 27th international conference on machine learning (ICML-10), pp 111\u2013118"},{"key":"12931_CR9","unstructured":"Chen S, Dobriban E, Lee J (2020) A group-theoretic framework for data augmentation. Advances in neural information processing systems 33"},{"key":"12931_CR10","first-page":"577","volume":"28","author":"JK Chorowski","year":"2015","unstructured":"Chorowski JK, Bahdanau D, Serdyuk D, Cho K, Bengio Y (2015) Attention-based models for speech recognition. Advances in neural information processing systems 28:577\u2013585","journal-title":"Advances in neural information processing systems"},{"key":"12931_CR11","doi-asserted-by":"crossref","unstructured":"Coucke A, Chlieh M, Gisselbrecht T, Leroy D, Poumeyrol M, Lavril T (2019) Efficient keyword spotting using dilated convolutions and gating. In: ICASSP 2019 - 2019 IEEE international conference on acoustics, speech and signal processing (ICASSP), pp 6351\u20136355","DOI":"10.1109\/ICASSP.2019.8683474"},{"key":"12931_CR12","doi-asserted-by":"publisher","unstructured":"Devlin J, Chang MW, Lee K, Toutanova K (2019) BERT: Pre-training of deep bidirectional transformers for language understanding. In: Proceedings of the 2019 conference of the north american chapter of the association for computational linguistics: Human language technologies, Volume 1 (Long and Short Papers), Association for Computational Linguistics, Minneapolis, Minnesota, pp 4171\u20134186, https:\/\/doi.org\/10.18653\/v1\/N19-1423, https:\/\/www.aclweb.org\/anthology\/N19-1423","DOI":"10.18653\/v1\/N19-1423"},{"key":"12931_CR13","doi-asserted-by":"crossref","unstructured":"Dong B, Lumezanu C, Chen Y, Song D, Mizoguchi T, Chen H, Khan L (2020) At the speed of sound: Efficient audio scene classification. In: Proceedings of the 2020 international conference on multimedia retrieval, pp 301\u2013305","DOI":"10.1145\/3372278.3390730"},{"key":"12931_CR14","doi-asserted-by":"publisher","first-page":"2147","DOI":"10.1109\/TIFS.2019.2956591","volume":"15","author":"M Esmaeilpour","year":"2020","unstructured":"Esmaeilpour M, Cardinal P, Lameiras Koerich A (2020) A robust approach for securing audio classification against adversarial attacks. IEEE transactions on information forensics and security 15:2147\u20132159. https:\/\/doi.org\/10.1109\/TIFS.2019.2956591","journal-title":"IEEE transactions on information forensics and security"},{"key":"12931_CR15","doi-asserted-by":"crossref","unstructured":"Falcini F, Lami G (2017) Deep learning in automotive: Challenges and opportunities. In: International conference on software process improvement and capability determination, Springer, pp 279\u2013288","DOI":"10.1007\/978-3-319-67383-7_21"},{"issue":"15","key":"12931_CR16","doi-asserted-by":"publisher","first-page":"4220","DOI":"10.3390\/s20154220","volume":"20","author":"J Fayyad","year":"2020","unstructured":"Fayyad J, Jaradat MA, Gruyer D, Najjaran H (2020) Deep learning sensor fusion for autonomous vehicle perception and localization: a review. Sensors 20(15):4220","journal-title":"Sensors"},{"key":"12931_CR17","doi-asserted-by":"crossref","unstructured":"Gkalinikis NV, Nalmpantis C, Vrakas D (2020) Attention in recurrent neural networks for energy disaggregation. In: International conference on discovery science, Springer, pp 551\u2013565","DOI":"10.1007\/978-3-030-61527-7_36"},{"key":"12931_CR18","doi-asserted-by":"crossref","unstructured":"Han W, Zhang Z, Zhang Y, Yu J, Chiu CC, Qin J, Gulati A, Pang R, Wu Y (2020) Contextnet: Improving convolutional neural networks for automatic speech recognition with global context. arXiv preprint arXiv:200503191","DOI":"10.21437\/Interspeech.2020-2059"},{"key":"12931_CR19","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"12931_CR20","doi-asserted-by":"publisher","first-page":"106622","DOI":"10.1016\/j.knosys.2020.106622","volume":"212","author":"X He","year":"2021","unstructured":"He X, Zhao K, Chu X (2021) Automl: A survey of the state-of-the-art. Knowl-Based Syst 212:106622","journal-title":"Knowl-Based Syst"},{"key":"12931_CR21","doi-asserted-by":"crossref","unstructured":"Jarrett K, Kavukcuoglu K, LeCun Y et al (2009) What is the best multi-stage architecture for object recognition? In: 2009 IEEE 12th international conference on computer vision, IEEE, pp 2146\u20132153","DOI":"10.1109\/ICCV.2009.5459469"},{"key":"12931_CR22","unstructured":"Kingma DP, Salimans T, Welling M (2015) Variational dropout and the local reparameterization trick. In: Advances in neural information processing systems, pp 2575\u20132583"},{"issue":"4","key":"12931_CR23","doi-asserted-by":"publisher","first-page":"684","DOI":"10.1287\/opre.43.4.684","volume":"43","author":"CW Ko","year":"1995","unstructured":"Ko CW, Lee J, Queyranne M (1995) An exact algorithm for maximum entropy sampling. Oper Res 43(4):684\u2013691","journal-title":"Oper Res"},{"key":"12931_CR24","unstructured":"Krizhevsky A, Sutskever I, Hinton GE (2012) Imagenet classification with deep convolutional neural networks. In: NIPS"},{"key":"12931_CR25","unstructured":"Kusupati A, Singh M, Bhatia K, Kumar A, Jain P, Varma M (2018) Fastgrnn: A fast, accurate, stable and tiny kilobyte sized gated recurrent neural network. In: Advances in neural information processing systems, pp 9017\u20139028"},{"key":"12931_CR26","unstructured":"LeCun Y, Boser BE, Denker JS, Henderson D, Howard RE, Hubbard WE, Jackel LD (1990) Handwritten digit recognition with a back-propagation network. In: Advances in neural information processing systems, pp 396\u2013404"},{"issue":"11","key":"12931_CR27","doi-asserted-by":"publisher","first-page":"2278","DOI":"10.1109\/5.726791","volume":"86","author":"Y LeCun","year":"1998","unstructured":"LeCun Y, Bottou L, Bengio Y, Haffner P (1998) Gradient-based learning applied to document recognition. Proc IEEE 86(11):2278\u20132324","journal-title":"Proc IEEE"},{"key":"12931_CR28","doi-asserted-by":"crossref","unstructured":"Lentzas A, Nalmpantis C, Vrakas D (2019) Hyperparameter tuning using quantum genetic algorithms. In: 2019 IEEE 31St international conference on tools with artificial intelligence (ICTAI), IEEE, pp 1412\u20131416","DOI":"10.1109\/ICTAI.2019.00199"},{"key":"12931_CR29","unstructured":"Li B, Huang K, Chen S, Xiong D, Jiang H, Claesen L (2020) Dfqf: Data free quantization-aware fine-tuning. In: Asian conference on machine learning, PMLR, pp 289\u2013304"},{"key":"12931_CR30","doi-asserted-by":"crossref","unstructured":"Li S, Raj D, Lu X, Shen P, Kawahara T, Kawai H (2019) Improving transformer-based speech recognition systems with compressed structure and speech attributes augmentation. In: INTERSPEECH, pp 4400\u20134404","DOI":"10.21437\/Interspeech.2019-2112"},{"key":"12931_CR31","doi-asserted-by":"crossref","unstructured":"Makridis G, Mavrepis P, Kyriazis D, Polychronou I, Kaloudis S (2020) Enhanced food safety through deep learning for food recalls prediction. In: International conference on discovery science, Springer, pp 566\u2013580","DOI":"10.1007\/978-3-030-61527-7_37"},{"key":"12931_CR32","doi-asserted-by":"publisher","unstructured":"Martin-Morato I, Cobos M, Ferri FJ (2018) On the robustness of deep features for audio event classification in adverse environments. In: 2018 14th IEEE international conference on signal processing (ICSP), pp 562\u2013566, https:\/\/doi.org\/10.1109\/ICSP.2018.8652438","DOI":"10.1109\/ICSP.2018.8652438"},{"key":"12931_CR33","doi-asserted-by":"crossref","unstructured":"McGraw I, Prabhavalkar R, Alvarez R, Arenas MG, Rao K, Rybach D, Alsharif O, Sak H, Gruenstein A, Beaufays F et al (2016) Personalized speech recognition on mobile devices. In: 2016 IEEE international conference on acoustics, speech and signal processing (ICASSP), IEEE, pp 5955\u20135959","DOI":"10.1109\/ICASSP.2016.7472820"},{"issue":"2","key":"12931_CR34","doi-asserted-by":"publisher","first-page":"207","DOI":"10.1088\/0954-898X_9_2_004","volume":"9","author":"JP Nadal","year":"1998","unstructured":"Nadal JP, Brunel N, Parga N (1998) Nonlinear feedforward networks with stochastic outputs: Infomax implies redundancy reduction. Network: Computation in Neural Systems 9(2):207\u2013217","journal-title":"Network: Computation in Neural Systems"},{"key":"12931_CR35","doi-asserted-by":"crossref","unstructured":"Nakamura S, Hiyane K, Asano F, Yamada T, Endo T (1999) Data collection in real acoustical environments for sound scene understanding and hands-free speech recognition. In: Sixth European conference on speech communication and technology","DOI":"10.21437\/Eurospeech.1999-568x"},{"key":"12931_CR36","doi-asserted-by":"crossref","unstructured":"Nalmpantis C, Vrakas D (2019) Signal2vec: Time series embedding representation. In: International conference on engineering applications of neural networks, Springer, pp 80\u201390","DOI":"10.1007\/978-3-030-20257-6_7"},{"key":"12931_CR37","doi-asserted-by":"crossref","unstructured":"Nalmpantis C, Vrakas D (2020) On time series representations for multi-label nilm. Neural Computing & Applications","DOI":"10.1007\/s00521-020-04916-5"},{"key":"12931_CR38","doi-asserted-by":"crossref","unstructured":"Nalmpantis C, Lentzas A, Vrakas D (2019) A theoretical analysis of pooling operation using information theory. In: 2019 IEEE 31St international conference on tools with artificial intelligence (ICTAI), IEEE, 1729\u20131733","DOI":"10.1109\/ICTAI.2019.00256"},{"issue":"8","key":"12931_CR39","doi-asserted-by":"publisher","first-page":"2326","DOI":"10.3390\/s20082326","volume":"20","author":"A Pervaiz","year":"2020","unstructured":"Pervaiz A, Hussain F, Israr H, Tahir MA, Raja FR, Baloch NK, Ishmanov F, Zikria YB (2020) Incorporating noise robustness in speech command recognition by noise augmentation of training data. Sensors 20(8):2326","journal-title":"Sensors"},{"key":"12931_CR40","doi-asserted-by":"crossref","unstructured":"Phan H, Hertel L, Maass M, Mertins A (2016) Robust audio event recognition with 1-max pooling convolutional neural networks. In: Proceedings of interspeech, ISCA, pp 3653\u20133657","DOI":"10.21437\/Interspeech.2016-123"},{"key":"12931_CR41","doi-asserted-by":"publisher","unstructured":"Qu Y, Liu P, Song W, Liu L, Cheng M (2020) A text generation and prediction system: Pre-training on new corpora using bert and gpt-2. In: 2020 IEEE 10th international conference on electronics information and emergency communication (ICEIEC), pp 323\u2013326. https:\/\/doi.org\/10.1109\/ICEIEC49280.2020.9152352","DOI":"10.1109\/ICEIEC49280.2020.9152352"},{"issue":"2","key":"12931_CR42","doi-asserted-by":"publisher","first-page":"165","DOI":"10.1080\/02664768700000020","volume":"14","author":"MC Shewry","year":"1987","unstructured":"Shewry MC, Wynn HP (1987) Maximum entropy sampling. Journal of applied statistics 14(2):165\u2013170","journal-title":"Journal of applied statistics"},{"key":"12931_CR43","unstructured":"Simonyan K, Zisserman A (2014) Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:14091556"},{"key":"12931_CR44","doi-asserted-by":"crossref","unstructured":"Solovyev RA, Vakhrushev M, Radionov A, Romanova II, Amerikanov AA, Aliev V, Shvets AA (2020) Deep learning approaches for understanding simple speech commands. In: 2020 IEEE 40Th international conference on electronics and nanotechnology (ELNANO), IEEE, pp 688\u2013693","DOI":"10.1109\/ELNANO50318.2020.9088863"},{"key":"12931_CR45","doi-asserted-by":"publisher","unstructured":"Sun Z, Yu H, Song X, Liu R, Yang Y, Zhou D (2020) MobileBERT: a compact task-agnostic BERT for resource-limited devices. In: Proceedings of the 58th annual meeting of the association for computational linguistics, association for computational linguistics, online, pp 2158\u20132170. https:\/\/doi.org\/10.18653\/v1\/2020.acl-main.195","DOI":"10.18653\/v1\/2020.acl-main.195"},{"key":"12931_CR46","doi-asserted-by":"publisher","first-page":"12563","DOI":"10.1109\/ACCESS.2017.2717998","volume":"5","author":"S Tippaya","year":"2017","unstructured":"Tippaya S, Sitjongsataporn S, Tan T, Khan MM, Chamnongthai K (2017) Multi-modal visual features-based video shot boundary detection. IEEE Access 5:12563\u201312575","journal-title":"IEEE Access"},{"key":"12931_CR47","doi-asserted-by":"crossref","unstructured":"Turchet L, Fazekas G, Lagrange M, Ghadikolaei HS, Fischione C (2020) The internet of audio things: State-of-the-art, vision, and challenges. IEEE internet of things journal","DOI":"10.1109\/JIOT.2020.2997047"},{"key":"12931_CR48","doi-asserted-by":"crossref","unstructured":"Viswanathan J, Saranya N, Inbamani A (2021) Deep learning applications in medical imaging: Introduction to deep learning-based intelligent systems for medical applications. In: Deep learning applications in medical imaging, IGI Global, pp 156\u2013177","DOI":"10.4018\/978-1-7998-5071-7.ch007"},{"key":"12931_CR49","unstructured":"Vrysis L, Thoidis I, Dimoulas C, Papanikolaou G (2020) Experimenting with 1d cnn architectures for generic audio classification. In: Audio engineering society convention 148, Audio Engineering Society"},{"issue":"1\/2","key":"12931_CR50","doi-asserted-by":"publisher","first-page":"66","DOI":"10.17743\/jaes.2019.0058","volume":"68","author":"L Vrysis","year":"2020","unstructured":"Vrysis L, Tsipas N, Thoidis I, Dimoulas C (2020) 1d\/2d deep cnns vs. temporal feature integration for general audio classification. Journal of the Audio Engineering Society 68(1\/2):66\u201377","journal-title":"Journal of the Audio Engineering Society"},{"issue":"1\/2","key":"12931_CR51","doi-asserted-by":"publisher","first-page":"66","DOI":"10.17743\/jaes.2019.0058","volume":"68","author":"L Vrysis","year":"2020","unstructured":"Vrysis L, Tsipas N, Thoidis I, Dimoulas C (2020) Enhanced temporal feature integration in audio semantics. J Audio Eng Soc 68(1\/2):66\u201377","journal-title":"J Audio Eng Soc"},{"issue":"2","key":"12931_CR52","doi-asserted-by":"publisher","first-page":"183","DOI":"10.3390\/e22020183","volume":"22","author":"KC Wang","year":"2020","unstructured":"Wang KC (2020) Robust audio content classification using hybrid-based smd and entropy-based vad. Entropy 22(2):183","journal-title":"Entropy"},{"key":"12931_CR53","unstructured":"Warden P (2018) Speech commands: A dataset for limited-vocabulary speech recognition. arXiv preprint arXiv:180403209"},{"key":"12931_CR54","doi-asserted-by":"publisher","first-page":"10767","DOI":"10.1109\/ACCESS.2019.2891838","volume":"7","author":"M Zeng","year":"2019","unstructured":"Zeng M, Xiao N (2019) Effective combination of densenet and bilstm for keyword spotting. IEEE Access 7:10767\u201310775","journal-title":"IEEE Access"},{"key":"12931_CR55","doi-asserted-by":"publisher","unstructured":"Zhang Z, Geiger J, Pohjalainen J, Mousa AED, Jin W, Schuller B (2018) Deep learning for environmentally robust speech recognition: an overview of recent developments, ACM Trans Intell Syst Technol 9(5). https:\/\/doi.org\/10.1145\/3178115","DOI":"10.1145\/3178115"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-022-12931-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-022-12931-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-022-12931-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,21]],"date-time":"2024-09-21T23:42:29Z","timestamp":1726962149000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-022-12931-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,4,11]]},"references-count":55,"journal-issue":{"issue":"22","published-print":{"date-parts":[[2022,9]]}},"alternative-id":["12931"],"URL":"https:\/\/doi.org\/10.1007\/s11042-022-12931-y","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,4,11]]},"assertion":[{"value":"6 July 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 October 2021","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 March 2022","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"11 April 2022","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"<!--Emphasis Type='Bold' removed-->Conflict of Interests"}}]}}