{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,27]],"date-time":"2026-01-27T02:16:25Z","timestamp":1769480185410,"version":"3.49.0"},"reference-count":36,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["SIViP"],"published-print":{"date-parts":[[2026,1]]},"DOI":"10.1007\/s11760-025-04968-x","type":"journal-article","created":{"date-parts":[[2026,1,16]],"date-time":"2026-01-16T18:29:12Z","timestamp":1768588152000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Unified multi-prototype network with pretrained swin transformer for visual and audio open set recognition"],"prefix":"10.1007","volume":"20","author":[{"given":"Haiyan","family":"Yang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sheng","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Juncheng","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jun","family":"Shi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jun","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,1,16]]},"reference":[{"issue":"3","key":"4968_CR1","doi-asserted-by":"publisher","first-page":"4545","DOI":"10.1109\/TNNLS.2024.3373809","volume":"36","author":"J Guo","year":"2024","unstructured":"Guo, J., Wang, H., Yuanyuan, X., Wenchao, X., Zhan, Y., Sun, Y., Guo, S.: Multimodal dual-embedding networks for malware open-set recognition. IEEE Trans. Neural Netw. Learn. Syst. 36(3), 4545\u20134559 (2024)","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"4968_CR2","doi-asserted-by":"crossref","unstructured":"Vaze, S., Han, K., Vedaldi, A., Zisserman, A.: Generalized category discovery. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp. 7492\u20137501, (2022)","DOI":"10.1109\/CVPR52688.2022.00734"},{"issue":"7","key":"4968_CR3","doi-asserted-by":"publisher","first-page":"5092","DOI":"10.1109\/TPAMI.2024.3361862","volume":"46","author":"W Jianzong","year":"2024","unstructured":"Jianzong, W., Li, X., Shilin, X., Yuan, H., Ding, H., Yang, Y., Li, X., Zhang, J., Tong, Y., Jiang, X., et al.: Towards open vocabulary learning: a survey. IEEE Trans. Pattern Anal. Mach. Intell. 46(7), 5092\u20135113 (2024)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"2","key":"4968_CR4","doi-asserted-by":"publisher","first-page":"2327","DOI":"10.1109\/TNNLS.2022.3189996","volume":"35","author":"J Jang","year":"2022","unstructured":"Jang, J., Kim, C.O.: Collective decision of one-vs-rest networks for open-set recognition. IEEE Trans. Neural Netw. Learn. Syst. 35(2), 2327\u20132338 (2022)","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"4968_CR5","doi-asserted-by":"publisher","first-page":"738","DOI":"10.1016\/j.ins.2023.01.062","volume":"626","author":"J Liu","year":"2023","unstructured":"Liu, J., Tian, J., Han, W., Qin, Z., Fan, Y., Shao, J.: Learning multiple gaussian prototypes for open-set recognition. Inf. Sci. 626, 738\u2013753 (2023)","journal-title":"Inf. Sci."},{"key":"4968_CR6","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2024.110400","volume":"151","author":"L-Y Sun","year":"2024","unstructured":"Sun, L.-Y., Chu, W.-T.: Overall positive prototype for few-shot open-set recognition. Pattern Recogn. 151, 110400 (2024)","journal-title":"Pattern Recogn."},{"issue":"9","key":"4968_CR7","doi-asserted-by":"publisher","first-page":"4403","DOI":"10.1109\/TAI.2024.3379940","volume":"5","author":"Q Wang","year":"2024","unstructured":"Wang, Q., Meng, F., Breckon, T.P.: Progressively select and reject pseudolabeled samples for open-set domain adaptation. IEEE Trans. Artif. Intell. 5(9), 4403\u20134414 (2024)","journal-title":"IEEE Trans. Artif. Intell."},{"key":"4968_CR8","first-page":"5739","volume":"37","author":"Y Wang","year":"2024","unstructured":"Wang, Y., Hang, J.-Y., Zhang, M.-L.: Multi-label open set recognition. Adv. Neural. Inf. Process. Syst. 37, 5739\u20135756 (2024)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"4968_CR9","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2024.129276","volume":"621","author":"W Shaoling","year":"2025","unstructured":"Shaoling, W., Luo, H., Lin, X.: Tnpnet: an approach to few-shot open-set recognition via contextual transductive learning. Neurocomputing 621, 129276 (2025)","journal-title":"Neurocomputing"},{"issue":"7","key":"4968_CR10","doi-asserted-by":"publisher","first-page":"9238","DOI":"10.1109\/TNNLS.2022.3231924","volume":"35","author":"Z Xia","year":"2023","unstructured":"Xia, Z., Wang, P., Dong, G., Liu, H.: Adversarial kinetic prototype framework for open set recognition. IEEE Trans. Neural Netw. Learn. Syst. 35(7), 9238\u20139251 (2023)","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"4968_CR11","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2024.104230","volume":"250","author":"Yu Qing","year":"2025","unstructured":"Qing, Yu., Irie, G., Aizawa, K.: Open-set domain adaptation with visual-language foundation models. Comput. Vis. Image Underst. 250, 104230 (2025)","journal-title":"Comput. Vis. Image Underst."},{"issue":"3","key":"4968_CR12","doi-asserted-by":"publisher","first-page":"340","DOI":"10.1109\/TAFFC.2014.2346515","volume":"5","author":"SH Lee","year":"2014","unstructured":"Lee, S.H., Plataniotis, K.N., Ro, Y.M.: Intra-class variation reduction using training expression images for sparse representation based facial expression recognition. IEEE Trans. Affect. Comput. 5(3), 340\u2013351 (2014)","journal-title":"IEEE Trans. Affect. Comput."},{"issue":"4","key":"4968_CR13","doi-asserted-by":"publisher","first-page":"1615","DOI":"10.1109\/TFUZZ.2023.3329108","volume":"32","author":"S Zeng","year":"2023","unstructured":"Zeng, S., Duan, X., Bai, J., Tao, W., Kun, H., Tang, Y.: Soft multiprototype clustering algorithm via two-layer semi-nmf. IEEE Trans. Fuzzy Syst. 32(4), 1615\u20131629 (2023)","journal-title":"IEEE Trans. Fuzzy Syst."},{"key":"4968_CR14","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Li, B., Fang, H., Meng, Q.: Spectrogram transformers for audio classification. In 2022 IEEE International Conference on Imaging Systems and Techniques (IST), pp. 1\u20136. IEEE, (2022)","DOI":"10.1109\/IST55454.2022.9827729"},{"key":"4968_CR15","doi-asserted-by":"publisher","first-page":"122136","DOI":"10.1109\/ACCESS.2022.3223444","volume":"10","author":"ZK Abdul","year":"2022","unstructured":"Abdul, Z.K., Al-Talabani, A.K.: Mel frequency cepstral coefficient and its applications: a review. IEEE Access 10, 122136\u2013122158 (2022)","journal-title":"IEEE Access"},{"key":"4968_CR16","doi-asserted-by":"crossref","unstructured":"Bartusiak, E.R., Delp, E.J.: Transformer-based speech synthesizer attribution in an open set scenario. In 2022 21st IEEE International Conference on Machine Learning and Applications (ICMLA), pp. 329\u2013336. IEEE, (2022)","DOI":"10.1109\/ICMLA55696.2022.00054"},{"key":"4968_CR17","doi-asserted-by":"crossref","unstructured":"Cai, F., Zhang, Z., Liu, J., Koutsoukos, X.: A vision transformer architecture for open set recognition. In 2022 21st IEEE International Conference on Machine Learning and Applications (ICMLA), pp. 190\u2013197. IEEE, (2022)","DOI":"10.1109\/ICMLA55696.2022.00034"},{"issue":"7","key":"4968_CR18","doi-asserted-by":"publisher","first-page":"1757","DOI":"10.1109\/TPAMI.2012.256","volume":"35","author":"WJ Scheirer","year":"2012","unstructured":"Scheirer, W.J., de Rezende Rocha, A., Sapkota, A., Boult, T.E.: Toward open set recognition. IEEE Trans. Pattern Anal. Mach. Intell. 35(7), 1757\u20131772 (2012)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"4968_CR19","unstructured":"Dhamija, A.R., G\u00fcnther, M., Boult, T.: Reducing network agnostophobia. Adv. Neural Inf. Process. Syst., 31, (2018)"},{"issue":"5","key":"4968_CR20","first-page":"2358","volume":"44","author":"H-M Yang","year":"2022","unstructured":"Yang, H.-M., Zhang, X.-Y., Yin, F., Yang, Q., Liu, C.-L.: Convolutional prototype network for open set recognition. IEEE Trans. Pattern Anal. Mach. Intell. 44(5), 2358\u20132370 (2022)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"4968_CR21","doi-asserted-by":"crossref","unstructured":"Bao, Q., Chen, L., Zhang, F., Wang, J., Zhang, C.: Causal evidence learning for trusted open set recognition under covariate shift. IEEE Transactions on Circuits and Systems for Video Technology, (2024)","DOI":"10.1109\/TCSVT.2024.3445182"},{"key":"4968_CR22","doi-asserted-by":"crossref","unstructured":"Brignac, D., Mahalanobis, A.: Cascading unknown detection with known classification for open set recognition. In 2024 IEEE International Conference on Image Processing (ICIP), pp. 652\u2013658. IEEE, (2024)","DOI":"10.1109\/ICIP51287.2024.10648239"},{"key":"4968_CR23","first-page":"6877","volume":"35","author":"A Cao","year":"2021","unstructured":"Cao, A., Luo, Y., Klabjan, D.: Open-set recognition with gaussian mixture variational autoencoders. In Proc. AAAI Conf. Artif. Intell. 35, 6877\u20136884 (2021)","journal-title":"In Proc. AAAI Conf. Artif. Intell."},{"issue":"11","key":"4968_CR24","first-page":"8065","volume":"44","author":"G Chen","year":"2021","unstructured":"Chen, G., Peng, P., Wang, X., Tian, Y.: Adversarial reciprocal points learning for open set recognition. IEEE Trans. Pattern Anal. Mach. Intell. 44(11), 8065\u20138081 (2021)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"4968_CR25","unstructured":"Krizhevsky, A., Hinton, G., et\u00a0al.: Learning multiple layers of features from tiny images. Technical report (2009)"},{"issue":"11","key":"4968_CR26","doi-asserted-by":"publisher","first-page":"2278","DOI":"10.1109\/5.726791","volume":"86","author":"Y LeCun","year":"2002","unstructured":"LeCun, Y., Bottou, L., Bengio, Y., Haffner, P.: Gradient-based learning applied to document recognition. Proc. IEEE 86(11), 2278\u20132324 (2002)","journal-title":"Proc. IEEE"},{"key":"4968_CR27","doi-asserted-by":"crossref","unstructured":"Piczak, K.J.: Esc: Dataset for environmental sound classification. In Proceedings of the 23rd ACM international conference on Multimedia, pp. 1015\u20131018, (2015)","DOI":"10.1145\/2733373.2806390"},{"key":"4968_CR28","doi-asserted-by":"crossref","unstructured":"Salamon, J., Jacoby, C., Bello, J.P.: A dataset and taxonomy for urban sound research. In Proceedings of the 22nd ACM international conference on Multimedia, pp. 1041\u20131044, (2014)","DOI":"10.1145\/2647868.2655045"},{"key":"4968_CR29","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., Guo, B.: Swin transformer: Hierarchical vision transformer using shifted windows. In Proceedings of the IEEE\/CVF international conference on computer vision, pp. 10012\u201310022, (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"4968_CR30","doi-asserted-by":"crossref","unstructured":"Chen, K., Du, X., Zhu, B., Ma, Z., Berg-Kirkpatrick, T., Dubnov, S.: Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection. In ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 646\u2013650. IEEE, (2022)","DOI":"10.1109\/ICASSP43922.2022.9746312"},{"key":"4968_CR31","doi-asserted-by":"crossref","unstructured":"Elizalde, B., Deshmukh, S., Al\u00a0Ismail, M., Wang, H.: Clap learning audio concepts from natural language supervision. In ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 1\u20135. IEEE, (2023)","DOI":"10.1109\/ICASSP49357.2023.10095889"},{"key":"4968_CR32","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 770\u2013778, (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"4968_CR33","doi-asserted-by":"crossref","unstructured":"Bendale, A., Boult, T.E.: Towards open set deep networks. In Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 1563\u20131572, (2016)","DOI":"10.1109\/CVPR.2016.173"},{"key":"4968_CR34","doi-asserted-by":"crossref","unstructured":"Yang, H.-M., Zhang, X.-Y., Yin, F., Liu, C.-L.: Robust classification with convolutional prototype learning. In Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 3474\u20133482, (2018)","DOI":"10.1109\/CVPR.2018.00366"},{"key":"4968_CR35","unstructured":"Bahavan, N., Seneviratne, S., Halgamuge, S.: Sphor: a representation learning perspective on open-set recognition for identifying unknown classes in deep learning models. arXiv preprint arXiv:2503.08049, (2025)"},{"issue":"1","key":"4968_CR36","doi-asserted-by":"publisher","first-page":"5415","DOI":"10.1038\/s41467-019-13055-y","volume":"10","author":"AC Belkina","year":"2019","unstructured":"Belkina, A.C., Ciccolella, C.O., Anno, R., Halpert, R., Spidlen, J., Snyder-Cappione, J.E.: Automated optimized parameters for t-distributed stochastic neighbor embedding improve visualization and analysis of large datasets. Nat. Commun. 10(1), 5415 (2019)","journal-title":"Nat. Commun."}],"container-title":["Signal, Image and Video Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-025-04968-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11760-025-04968-x","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-025-04968-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,1,26]],"date-time":"2026-01-26T15:44:18Z","timestamp":1769442258000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11760-025-04968-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,1]]},"references-count":36,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2026,1]]}},"alternative-id":["4968"],"URL":"https:\/\/doi.org\/10.1007\/s11760-025-04968-x","relation":{},"ISSN":["1863-1703","1863-1711"],"issn-type":[{"value":"1863-1703","type":"print"},{"value":"1863-1711","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,1]]},"assertion":[{"value":"13 August 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"7 October 2025","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 November 2025","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 January 2026","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"30"}}