{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,26]],"date-time":"2025-03-26T11:39:01Z","timestamp":1742989141389,"version":"3.40.3"},"publisher-location":"Cham","reference-count":25,"publisher":"Springer Nature Switzerland","isbn-type":[{"type":"print","value":"9783031628351"},{"type":"electronic","value":"9783031628368"}],"license":[{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024]]},"DOI":"10.1007\/978-3-031-62836-8_18","type":"book-chapter","created":{"date-parts":[[2024,6,16]],"date-time":"2024-06-16T15:01:37Z","timestamp":1718550097000},"page":"188-199","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Multimodal-Attention Fusion for\u00a0the\u00a0Detection of\u00a0Questionable Content in\u00a0Videos"],"prefix":"10.1007","author":[{"given":"Arnold","family":"Morales","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Elaheh","family":"Baharlouei","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Thamar","family":"Solorio","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hugo Jair","family":"Escalante","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,6,17]]},"reference":[{"key":"18_CR1","doi-asserted-by":"publisher","unstructured":"Anwar, A., Kanjo, E., Anderez, D.O.: Deepsafety: multi-level audio-text feature extraction and fusion approach for violence detection in conversations. CoRR abs\/2206.11822 (2022). https:\/\/doi.org\/10.48550\/arXiv.2206.11822","DOI":"10.48550\/arXiv.2206.11822"},{"key":"18_CR2","doi-asserted-by":"publisher","first-page":"10209","DOI":"10.1007\/s00521-019-04559-1","volume":"32","author":"J Arevalo","year":"2020","unstructured":"Arevalo, J., Solorio, T., Montes-y Gomez, M., Gonz\u00e1lez, F.A.: Gated multimodal networks. Neural Comput. Appl. 32, 10209\u201310228 (2020)","journal-title":"Neural Comput. Appl."},{"key":"18_CR3","unstructured":"Ba, J.L., Kiros, J.R., Hinton, G.E.: Layer normalization (2016)"},{"key":"18_CR4","unstructured":"Baharlouei\u00a0Elaheh, S.T.: Labeling comic mischief content in online videos. In: LREC-COLING. vol. In press (2024)"},{"issue":"2","key":"18_CR5","doi-asserted-by":"publisher","first-page":"423","DOI":"10.1109\/TPAMI.2018.2798607","volume":"41","author":"T Baltru\u0161aitis","year":"2018","unstructured":"Baltru\u0161aitis, T., Ahuja, C., Morency, L.P.: Multimodal machine learning: a survey and taxonomy. IEEE Trans. Pattern Anal. Mach. Intell. 41(2), 423\u2013443 (2018)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"4","key":"18_CR6","doi-asserted-by":"publisher","first-page":"123","DOI":"10.2753\/JOA0091-3367400408","volume":"40","author":"BJ Blackford","year":"2011","unstructured":"Blackford, B.J., Gentry, J., Harrison, R.L., Carlson, L.: The prevalence and influence of the combination of humor and violence in super bowl commercials. J. Advert. 40(4), 123\u2013134 (2011)","journal-title":"J. Advert."},{"key":"18_CR7","doi-asserted-by":"crossref","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition? a new model and the kinetics dataset. In: proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 6299\u20136308 (2017)","DOI":"10.1109\/CVPR.2017.502"},{"key":"18_CR8","series-title":"LNCS","doi-asserted-by":"publisher","first-page":"461","DOI":"10.1007\/978-3-031-25085-9_26","volume-title":"ECCV 2022","author":"X Chen","year":"2022","unstructured":"Chen, X., Kang, B., Wang, D., Li, D., Lu, H.: Efficient visual tracking via hierarchical cross-attention transformer. In: Karlinsky, L., Michaeli, T., Nishino, K. (eds.) ECCV 2022. LNCS, vol. 13808, pp. 461\u2013477. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-25085-9_26"},{"key":"18_CR9","doi-asserted-by":"crossref","unstructured":"Chen, X., Yan, B., Zhu, J., Wang, D., Yang, X., Lu, H.: Transformer tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 8126\u20138135 (2021)","DOI":"10.1109\/CVPR46437.2021.00803"},{"key":"18_CR10","unstructured":"Crawshaw, M.: Multi-task learning with deep neural networks: a survey (2020)"},{"key":"18_CR11","unstructured":"Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: Bert: Pre-training of deep bidirectional transformers for language understanding (2019)"},{"key":"18_CR12","unstructured":"Dutta, S., Ganapathy, S.: Hcam\u2013hierarchical cross attention model for multi-modal emotion recognition. arXiv preprint arXiv:2304.06910 (2023)"},{"key":"18_CR13","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition (2015)","DOI":"10.1109\/CVPR.2016.90"},{"key":"18_CR14","doi-asserted-by":"crossref","unstructured":"Kiela, D., Bottou, L.: Learning image embeddings using convolutional neural networks for improved multi-modal semantics. Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP-14), pp. 36\u201345 (2014)","DOI":"10.3115\/v1\/D14-1005"},{"key":"18_CR15","doi-asserted-by":"publisher","first-page":"15","DOI":"10.1109\/TIFS.2022.3216479","volume":"18","author":"T Liu","year":"2023","unstructured":"Liu, T., Zhang, C., Lam, K.M., Kong, J.: Decouple and resolve: transformer-based models for online anomaly detection from weakly labeled videos. IEEE Trans. Inf. Forensics Secur. 18, 15\u201328 (2023)","journal-title":"IEEE Trans. Inf. Forensics Secur."},{"key":"18_CR16","unstructured":"Ngiam, J., Khosla, A., Kim, M., Nam, J., Lee, H., Ng, A.Y.: Multimodal deep learning. In: Proceedings of the 28th International Conference on Machine Learning (ICML-11), pp. 689\u2013696 (2011)"},{"key":"18_CR17","doi-asserted-by":"crossref","unstructured":"Pang, W.F., He, Q.H., Hu, Y.J., Li, Y.X.: Violence detection in videos based on fusing visual and audio information. In: ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 2260\u20132264 (2021)","DOI":"10.1109\/ICASSP39728.2021.9413686"},{"key":"18_CR18","doi-asserted-by":"crossref","unstructured":"Pei, D., Liu, H., Liu, Y., Sun, F.: Unsupervised multimodal feature learning for semantic image segmentation. In: The 2013 International Joint Conference on Neural Networks (IJCNN), pp.\u00a01\u20136 (2013)","DOI":"10.1109\/IJCNN.2013.6706748"},{"key":"18_CR19","doi-asserted-by":"publisher","first-page":"50","DOI":"10.1016\/j.neucom.2015.01.095","volume":"174","author":"S Poria","year":"2016","unstructured":"Poria, S., Cambria, E., Howard, N., Huang, G.B., Hussain, A.: Fusing audio, visual and textual clues for sentiment analysis from multimodal content. Neurocomputing 174, 50\u201359 (2016)","journal-title":"Neurocomputing"},{"key":"18_CR20","doi-asserted-by":"crossref","unstructured":"Shafaei, M., Smailis, C., Kakadiaris, I., Solorio, T.: A case study of deep learning-based multi-modal methods for labeling the presence of questionable content in movie trailers. In: Proceedings of the International Conference on Recent Advances in Natural Language Processing (RANLP 2021), pp. 1297\u20131307. INCOMA Ltd., Held Online (sep 2021)","DOI":"10.26615\/978-954-452-072-4_146"},{"key":"18_CR21","unstructured":"Srivastava, N., Salakhutdinov, R.R.: Multimodal learning with deep Boltzmann machines. In: Pereira, F., Burges, C., Bottou, L., Weinberger, K. (eds.) Advances in Neural Information Processing Systems, vol.\u00a025. Curran Associates, Inc. (2012)"},{"key":"18_CR22","series-title":"LNCS","doi-asserted-by":"publisher","first-page":"583","DOI":"10.1007\/978-3-642-40763-5_72","volume-title":"Medical Image Computing and Computer-Assisted Intervention - MICCAI 2013","author":"HI Suk","year":"2013","unstructured":"Suk, H.I., Shen, D.: Deep learning-based feature representation for AD\/MCI classification. In: Mori, K., Sakuma, I., Sato, Y., Barillot, C., Navab, N. (eds.) Medical Image Computing and Computer-Assisted Intervention - MICCAI 2013. LNCS, pp. 583\u2013590. Springer, Heidelberg (2013). https:\/\/doi.org\/10.1007\/978-3-642-40763-5_72"},{"key":"18_CR23","doi-asserted-by":"crossref","unstructured":"Wei, D.L., Liu, C.G., Liu, Y., Liu, J., Zhu, X.G., Zeng, X.H.: Look, listen and pay more attention: fusing multi-modal information for video violence detection. In: ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 1980\u20131984 (2022)","DOI":"10.1109\/ICASSP43922.2022.9746422"},{"key":"18_CR24","doi-asserted-by":"crossref","unstructured":"Zaidi, S.A.M., Latif, S., Qadir, J.: Cross-language speech emotion recognition using multimodal dual attention transformers (2023)","DOI":"10.1109\/OJCS.2024.3486904"},{"key":"18_CR25","doi-asserted-by":"crossref","unstructured":"Zhang, L., Zhang, X., Pan, J.: Hierarchical cross-modality semantic correlation learning model for multimodal summarization. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.\u00a036, pp. 11676\u201311684 (2022)","DOI":"10.1609\/aaai.v36i10.21422"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-62836-8_18","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,21]],"date-time":"2024-11-21T23:26:56Z","timestamp":1732231616000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-62836-8_18"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024]]},"ISBN":["9783031628351","9783031628368"],"references-count":25,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-62836-8_18","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2024]]},"assertion":[{"value":"17 June 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"MCPR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Mexican Conference on Pattern Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Xalapa","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Mexico","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"19 June 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"22 June 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"16","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"mcpr22024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/www.mcpr.org.mx","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}