{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T07:03:39Z","timestamp":1784531019756,"version":"3.55.0"},"reference-count":43,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,19]],"date-time":"2026-06-19T00:00:00Z","timestamp":1781827200000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100007480","name":"University of Castilla-La Mancha","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100007480","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100000780","name":"European Commission","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100000780","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100011698","name":"Regional Government of Castilla-La Mancha","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100011698","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Image and Vision Computing"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.imavis.2026.106087","type":"journal-article","created":{"date-parts":[[2026,6,19]],"date-time":"2026-06-19T23:21:37Z","timestamp":1781911297000},"page":"106087","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Identifying weapon-carrying actions in video surveillance systems through self-attention"],"prefix":"10.1016","volume":"173","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1454-7624","authenticated-orcid":false,"given":"Jesus","family":"Ruiz-Santaquiteria","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Oscar","family":"Deniz","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gloria","family":"Bueno","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"2","key":"10.1016\/j.imavis.2026.106087_b1","doi-asserted-by":"crossref","first-page":"96","DOI":"10.1016\/j.trc.2006.05.006","article-title":"A motion-based image processing system for detecting potentially dangerous situations in underground railway stations","volume":"14","author":"Velastin","year":"2006","journal-title":"Transp. Res. C"},{"key":"10.1016\/j.imavis.2026.106087_b2","series-title":"Computational Science\u2013ICCS 2019: 19th International Conference, Faro, Portugal, June 12\u201314, 2019, Proceedings, Part V 19","first-page":"15","article-title":"Vision and crowdsensing technology for an optimal response in physical-security","author":"Enr\u00edquez","year":"2019"},{"key":"10.1016\/j.imavis.2026.106087_b3","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2024.124800","article-title":"An efficient weapon detection system using NSGCU-DCNN classifier in surveillance","volume":"255","author":"Rao","year":"2024","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.imavis.2026.106087_b4","doi-asserted-by":"crossref","DOI":"10.1109\/ACCESS.2024.3442728","article-title":"Improving armed people detection on video surveillance through heuristics and machine learning models","author":"Amado-Garfias","year":"2024","journal-title":"IEEE Access"},{"key":"10.1016\/j.imavis.2026.106087_b5","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"779","article-title":"You only look once: Unified, real-time object detection","author":"Redmon","year":"2016"},{"key":"10.1016\/j.imavis.2026.106087_b6","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"7263","article-title":"YOLO9000: better, faster, stronger","author":"Redmon","year":"2017"},{"key":"10.1016\/j.imavis.2026.106087_b7","series-title":"YOLOv8 by ultralytics","author":"Jocher","year":"2023"},{"key":"10.1016\/j.imavis.2026.106087_b8","article-title":"Faster R-CNN: Towards real-time object detection with region proposal networks","volume":"28","author":"Ren","year":"2015","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.imavis.2026.106087_b9","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"10781","article-title":"EfficientDet: Scalable and efficient object detection","author":"Tan","year":"2020"},{"key":"10.1016\/j.imavis.2026.106087_b10","first-page":"1","article-title":"Improved bounding box regression loss for weapon detection systems using deep learning","author":"Sumi","year":"2024","journal-title":"Int. J. Inf. Technol."},{"issue":"11","key":"10.1016\/j.imavis.2026.106087_b11","article-title":"An edge computing-based handgun and knife detection method in IoT video surveillance systems","volume":"14","author":"Liu","year":"2023","journal-title":"Int. J. Adv. Comput. Sci. Appl."},{"key":"10.1016\/j.imavis.2026.106087_b12","series-title":"IEEE ICIP","first-page":"2031","article-title":"Localizing firearm carriers by identifying human-object pairs","author":"Basit","year":"2020"},{"key":"10.1016\/j.imavis.2026.106087_b13","series-title":"IEEE Int. Symp. on Techn. for Homeland Security","first-page":"1","article-title":"Cascaded neural networks for identification and posture-based threat assessment of armed people","author":"Abruzzo","year":"2019"},{"key":"10.1016\/j.imavis.2026.106087_b14","doi-asserted-by":"crossref","first-page":"17273","DOI":"10.1007\/s00521-021-06317-8","article-title":"Using human pose information for handgun detection","volume":"33","author":"Velasco-Mata","year":"2021","journal-title":"Neural Comput. Appl."},{"key":"10.1016\/j.imavis.2026.106087_b15","doi-asserted-by":"crossref","first-page":"123815","DOI":"10.1109\/ACCESS.2021.3110335","article-title":"Handgun detection using combined human pose and weapon appearance","volume":"9","author":"Ruiz-Santaquiteria","year":"2021","journal-title":"IEEE Access"},{"key":"10.1016\/j.imavis.2026.106087_b16","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2022.109252","article-title":"Improving handgun detection through a combination of visual features and body pose-based data","volume":"136","author":"Ruiz-Santaquiteria","year":"2023","journal-title":"Pattern Recognit."},{"issue":"5","key":"10.1016\/j.imavis.2026.106087_b17","doi-asserted-by":"crossref","first-page":"1005","DOI":"10.3390\/s19051005","article-title":"A comprehensive survey of vision-based human action recognition methods","volume":"19","author":"Zhang","year":"2019","journal-title":"Sensors"},{"key":"10.1016\/j.imavis.2026.106087_b18","doi-asserted-by":"crossref","first-page":"134","DOI":"10.1007\/s11760-024-03726-9","article-title":"Iv3-MGRUA: A novel human action recognition features extraction using Inception v3 and video behaviour prediction using modified gated recurrent units with attention mechanism model","volume":"19","author":"Jayamohan","year":"2025","journal-title":"Signal Image Video Process."},{"issue":"1","key":"10.1016\/j.imavis.2026.106087_b19","doi-asserted-by":"crossref","first-page":"118","DOI":"10.1007\/s44196-025-00848-x","article-title":"A novel human action recognition model by Grad-CAM visualization with multi-level feature extraction using global average pooling with sequence modeling by bidirectional gated recurrent units","volume":"18","author":"Manoharan","year":"2025","journal-title":"Int. J. Comput. Intell. Syst."},{"key":"10.1016\/j.imavis.2026.106087_b20","doi-asserted-by":"crossref","first-page":"10835","DOI":"10.1007\/s00521-025-10978-0","article-title":"A novel human action recognition using Grad-CAM visualization with gated recurrent units","volume":"37","author":"Jayamohan","year":"2025","journal-title":"Neural Comput. Appl."},{"issue":"10","key":"10.1016\/j.imavis.2026.106087_b21","doi-asserted-by":"crossref","first-page":"7321","DOI":"10.1007\/s00521-024-10962-0","article-title":"A novel human actions recognition and classification using semantic segmentation with deep learning techniques","volume":"37","author":"Jayamohan","year":"2025","journal-title":"Neural Comput. Appl."},{"key":"10.1016\/j.imavis.2026.106087_b22","series-title":"Advances in Data-Driven Computing and Intelligent Systems","first-page":"379","article-title":"Video-based action recognition of spatial and temporal deep learning models","volume":"vol. 891","author":"Jayamohan","year":"2024"},{"key":"10.1016\/j.imavis.2026.106087_b23","series-title":"2021 4th International Conference on Recent Trends in Computer Science and Technology","first-page":"43","article-title":"Review of video analytics method for video surveillance","author":"Jayamohan","year":"2022"},{"key":"10.1016\/j.imavis.2026.106087_b24","series-title":"YOLOv3: An incremental improvement","author":"Redmon","year":"2018"},{"key":"10.1016\/j.imavis.2026.106087_b25","doi-asserted-by":"crossref","first-page":"66","DOI":"10.1016\/j.neucom.2017.05.012","article-title":"Automatic handgun detection alarm in videos using deep learning","volume":"275","author":"Olmos","year":"2018","journal-title":"Neurocomputing"},{"key":"10.1016\/j.imavis.2026.106087_b26","doi-asserted-by":"crossref","first-page":"297","DOI":"10.1016\/j.neunet.2020.09.013","article-title":"Real-time gun detection in CCTV: An open problem","volume":"132","author":"Salazar Gonz\u00e1lez","year":"2020","journal-title":"Neural Netw."},{"key":"10.1016\/j.imavis.2026.106087_b27","doi-asserted-by":"crossref","unstructured":"R.F. de Azevedo Kanehisa, A. de Almeida, Firearm Detection using Convolutional Neural Networks, in: ICAART (2), 2019, pp. 707\u2013714.","DOI":"10.5220\/0007397707070714"},{"key":"10.1016\/j.imavis.2026.106087_b28","series-title":"2019 ICSIMA","first-page":"1","article-title":"Gun detection system using YOLOv3","author":"Warsi","year":"2019"},{"key":"10.1016\/j.imavis.2026.106087_b29","article-title":"OpenPose: Realtime multi-person 2D pose estimation using part affinity fields","author":"Cao","year":"2019","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.imavis.2026.106087_b30","doi-asserted-by":"crossref","first-page":"68213","DOI":"10.1109\/ACCESS.2022.3186465","article-title":"Improving human activity recognition integrating LSTM with different data sources: Features, object detection and skeleton tracking","volume":"10","author":"Domingo","year":"2022","journal-title":"IEEE Access"},{"key":"10.1016\/j.imavis.2026.106087_b31","series-title":"MULTICAST: MULTI Confirmation-level Alarm SysTem based on CNN and LSTM to mitigate false alarms for handgun detection in video-surveillance","author":"Olmos","year":"2021"},{"key":"10.1016\/j.imavis.2026.106087_b32","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.imavis.2026.106087_b33","series-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020"},{"key":"10.1016\/j.imavis.2026.106087_b34","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2021.108487","article-title":"Action Transformer: A self-attention model for short-time pose-based human action recognition","volume":"124","author":"Mazzia","year":"2022","journal-title":"Pattern Recognit."},{"issue":"8","key":"10.1016\/j.imavis.2026.106087_b35","doi-asserted-by":"crossref","first-page":"5359","DOI":"10.1109\/TII.2021.3116377","article-title":"AI-assisted edge vision for violence detection in IoT-based industrial surveillance networks","volume":"18","author":"Ullah","year":"2021","journal-title":"IEEE Trans. Ind. Inform."},{"issue":"12","key":"10.1016\/j.imavis.2026.106087_b36","doi-asserted-by":"crossref","first-page":"10400","DOI":"10.1002\/int.22537","article-title":"An intelligent system for complex violence pattern analysis and detection","volume":"37","author":"Ullah","year":"2022","journal-title":"Int. J. Intell. Syst."},{"key":"10.1016\/j.imavis.2026.106087_b37","series-title":"Computer Vision\u2013ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part V 13","first-page":"740","article-title":"Microsoft COCO: Common objects in context","author":"Lin","year":"2014"},{"key":"10.1016\/j.imavis.2026.106087_b38","doi-asserted-by":"crossref","DOI":"10.1016\/j.engappai.2020.104094","article-title":"Deep multi-level feature pyramids: Application for non-canonical firearm detection in video surveillance","volume":"97","author":"Lim","year":"2021","journal-title":"Eng. Appl. Artif. Intell."},{"issue":"1","key":"10.1016\/j.imavis.2026.106087_b39","doi-asserted-by":"crossref","first-page":"47","DOI":"10.3390\/s16010047","article-title":"Automated detection of firearms and knives in a CCTV image","volume":"16","author":"Grega","year":"2016","journal-title":"Sensors"},{"key":"10.1016\/j.imavis.2026.106087_b40","doi-asserted-by":"crossref","first-page":"22","DOI":"10.1016\/j.imavis.2017.02.002","article-title":"Martial arts, dancing and sports dataset: A challenging stereo and multi-view dataset for 3D human pose estimation","volume":"61","author":"Zhang","year":"2017","journal-title":"Image Vis. Comput."},{"key":"10.1016\/j.imavis.2026.106087_b41","doi-asserted-by":"crossref","DOI":"10.1016\/j.dib.2024.110030","article-title":"Firearm-related action recognition and object detection dataset for video surveillance systems","volume":"52","author":"Ruiz-Santaquiteria","year":"2024","journal-title":"Data Brief"},{"issue":"8","key":"10.1016\/j.imavis.2026.106087_b42","doi-asserted-by":"crossref","first-page":"13498","DOI":"10.1109\/TITS.2021.3124981","article-title":"OpenPifPaf: Composite fields for semantic keypoint detection and spatio-temporal association","volume":"23","author":"Kreiss","year":"2021","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"key":"10.1016\/j.imavis.2026.106087_b43","series-title":"International Conference on Learning Representations","article-title":"Decoupled weight decay regularization","author":"Loshchilov","year":"2019"}],"container-title":["Image and Vision Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0262885626001940?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0262885626001940?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T06:22:28Z","timestamp":1784528548000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0262885626001940"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":43,"alternative-id":["S0262885626001940"],"URL":"https:\/\/doi.org\/10.1016\/j.imavis.2026.106087","relation":{"is-supplemented-by":[{"id-type":"uri","id":"https:\/\/data.mendeley.com\/datasets\/bbzpxhd22j\/2","asserted-by":"subject"}]},"ISSN":["0262-8856"],"issn-type":[{"value":"0262-8856","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Identifying weapon-carrying actions in video surveillance systems through self-attention","name":"articletitle","label":"Article Title"},{"value":"Image and Vision Computing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.imavis.2026.106087","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Author(s). Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"106087"}}