{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,19]],"date-time":"2026-06-19T06:47:11Z","timestamp":1781851631097,"version":"3.54.5"},"reference-count":45,"publisher":"Frontiers Media SA","license":[{"start":{"date-parts":[[2025,1,20]],"date-time":"2025-01-20T00:00:00Z","timestamp":1737331200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["frontiersin.org"],"crossmark-restriction":true},"short-container-title":["Front. Neurorobot."],"abstract":"<jats:p>Object detection is a critical component in the development of autonomous driving technology and has demonstrated significant growth potential. To address the limitations of current techniques, this paper presents an improved object detection method for autonomous driving based on a detection transformer (DETR). First, we introduce a multi-scale feature and location information extraction method, which solves the inadequacy of the model for multi-scale object localization and detection. In addition, we developed a transformer encoder based on the group axial attention mechanism. This allows for efficient attention range control in the horizontal and vertical directions while reducing computation, ultimately enhancing the inference speed. Furthermore, we propose a novel dynamic hyperparameter tuning training method based on Pareto efficiency, which coordinates the training state of the loss functions through dynamic weights, overcoming issues associated with manually setting fixed weights and enhancing model convergence speed and accuracy. Experimental results demonstrate that the proposed method surpasses others, with improvements of 3.3%, 4.5%, and 3% in average precision on the COCO, PASCAL VOC, and KITTI datasets, respectively, and an 84% increase in FPS.<\/jats:p>","DOI":"10.3389\/fnbot.2024.1484276","type":"journal-article","created":{"date-parts":[[2025,1,20]],"date-time":"2025-01-20T07:20:50Z","timestamp":1737357650000},"update-policy":"https:\/\/doi.org\/10.3389\/crossmark-policy","source":"Crossref","is-referenced-by-count":12,"title":["Improved object detection method for autonomous driving based on DETR"],"prefix":"10.3389","volume":"18","author":[{"given":"Huaqi","family":"Zhao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Songnan","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiang","family":"Peng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhengguang","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guojing","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"1965","published-online":{"date-parts":[[2025,1,20]]},"reference":[{"key":"B1","doi-asserted-by":"publisher","first-page":"2758","DOI":"10.1109\/TAC.2021.3090749","article-title":"A unifying complexity certification framework for active-set methods for convex quadratic programming","volume":"67","author":"Arnstr\u00f6m","year":"2021","journal-title":"IEEE Trans. Automat. Contr"},{"key":"B2","first-page":"213","article-title":"\u201cEnd-to-end object detection with transformers,\u201d","volume-title":"European Conference on Computer Vision","author":"Carion","year":"2020"},{"key":"B3","doi-asserted-by":"publisher","first-page":"613","DOI":"10.1080\/02331934.2020.1810248","article-title":"The kkt optimality conditions for optimization problem with interval-valued objective function on hadamard manifolds","volume":"71","author":"Chen","year":"2022","journal-title":"Optimization"},{"key":"B4","first-page":"886","article-title":"\u201cHistograms of oriented gradients for human detection,\u201d","volume-title":"2005 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR'05)","author":"Dalal","year":"2005"},{"key":"B5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01181","article-title":"\u201cCswin transformer: a general vision transformer backbone with cross-shaped windows,\u201d","author":"Dong","year":"2022","journal-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition"},{"key":"B6","article-title":"An image is worth 16x16 words: transformers for image recognition at scale","author":"Dosovitskiy","year":"2020","journal-title":"arxiv preprint arxiv:2010.11929"},{"key":"B7","doi-asserted-by":"publisher","first-page":"303","DOI":"10.1007\/s11263-009-0275-4","article-title":"The pascal visual object classes (VOC) challenge","volume":"88","author":"Everingham","year":"2010","journal-title":"Int. J. Comput. Vis"},{"key":"B8","doi-asserted-by":"publisher","first-page":"652","DOI":"10.1109\/TPAMI.2019.2938758","article-title":"Res2net: a new multi-scale backbone architecture","volume":"43","author":"Gao","year":"2019","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell"},{"key":"B9","article-title":"Yolox: exceeding yolo series in 2021","author":"Ge","year":"2021","journal-title":"arxiv preprint arxiv:2107.08430"},{"key":"B10","doi-asserted-by":"publisher","first-page":"1231","DOI":"10.1177\/0278364913491297","article-title":"Vision meets robotics: the kitti dataset","volume":"32","author":"Geiger","year":"2013","journal-title":"Int. J. Rob. Res"},{"key":"B11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01350","article-title":"\u201cCoordinate attention for efficient mobile network design,\u201d","author":"Hou","year":"2021","journal-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition"},{"key":"B12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.243","article-title":"\u201cDensely connected convolutional networks,\u201d","author":"Huang","year":"2017","journal-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"B13","article-title":"Shuffle transformer: Rethinking spatial shuffle for vision transformer","author":"Huang","year":"2021","journal-title":"arxiv preprint arxiv:2106.03650"},{"key":"B14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00781","article-title":"\u201cMulti-task learning using uncertainty to weigh losses for scene geometry and semantics,\u201d","author":"Kendall","year":"2018","journal-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"B15","article-title":"Yolov6 v3. 0: a full-scale reloading","author":"Li","year":"2023","journal-title":"arxiv preprint arxiv:2301.05586"},{"key":"B16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01325","article-title":"\u201cDn-detr: accelerate detr training by introducing query denoising,\u201d","author":"Li","year":"2022","journal-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition"},{"key":"B17","article-title":"Bevformer: learning bird's-eye-view representation from lidar-camera via spatiotemporal transformers","author":"Li","year":"2024","journal-title":"arxiv preprint arXiv:2203.17270."},{"key":"B18","article-title":"Reasonable effectiveness of random weighting: a litmus test for multi-task learning","author":"Lin","year":"2021","journal-title":"arxiv preprint arxiv:2111.10603"},{"key":"B19","article-title":"D2etr: decoder-only detr with computationally efficient cross-scale attention","author":"Lin","year":"2022","journal-title":"arxiv preprint arxiv:2203.00860"},{"key":"B20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.106","article-title":"\u201cFeature pyramid networks for object detection,\u201d","author":"Lin","year":"2017","journal-title":"2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)"},{"key":"B21","doi-asserted-by":"crossref","first-page":"740","DOI":"10.1007\/978-3-319-10602-1_48","article-title":"\u201cMicrosoft coco: Common objects in context,\u201d","volume-title":"Computer Vision-ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6\u201312, 2014, Proceedings, Part V 13","author":"Lin","year":"2014"},{"key":"B22","doi-asserted-by":"publisher","DOI":"10.1145\/3298689.3346998","article-title":"\u201cA pareto-efficient algorithm for multiple objective optimization in e-commerce recommendation,\u201d","author":"Lin","year":"2019","journal-title":"Proceedings of the 13th ACM Conference on Recommender Systems"},{"key":"B23","article-title":"Dab-detr: Dynamic anchor boxes are better queries for detr","author":"Liu","year":"2022","journal-title":"arxiv preprint arxiv:2201.12329"},{"key":"B24","first-page":"14721","article-title":"\u201cProfiling pareto front with multi-objective stein variational gradient descent,\u201d","author":"Liu","year":"2021","journal-title":"Advances in Neural Information Processing Systems"},{"key":"B25","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986","article-title":"\u201cSwin transformer: hierarchical vision transformer using shifted windows,\u201d","author":"Liu","year":"2021","journal-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision"},{"key":"B26","first-page":"6597","article-title":"\u201cMulti-task learning with user preferences: gradient descent with controlled ascent in pareto optimization,\u201d","volume-title":"International Conference on Machine Learning","author":"Mahapatra","year":"2020"},{"key":"B27","article-title":"Mobilevit: light-weight, general-purpose, and mobile-friendly vision transformer","author":"Mehta","year":"2021","journal-title":"arxiv preprint arxiv:2110.02178"},{"key":"B28","doi-asserted-by":"publisher","first-page":"739","DOI":"10.3390\/info15110739","article-title":"PLC-fusion: perspective-based hierarchical and deep lidar camera fusion for 3D object detection in autonomous vehicles","volume":"15","author":"Mushtaq","year":"2024","journal-title":"Information"},{"key":"B29","doi-asserted-by":"crossref","first-page":"850","DOI":"10.1109\/ICPR.2006.479","article-title":"\u201cEfficient non-maximum suppression,\u201d","volume-title":"18th International Conference on Pattern Recognition (ICPR'06)","author":"Neubeck","year":"2006"},{"key":"B30","doi-asserted-by":"publisher","first-page":"4226","DOI":"10.1109\/JIOT.2022.3215469","article-title":"AD-RCNN: adaptive dynamic neural network for small object detection","volume":"10","author":"Ou","year":"2023","journal-title":"IEEE Internet Things J"},{"key":"B31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.91","article-title":"\u201cYou only look once: unified, real-time object detection,\u201d","author":"Redmon","year":"2016","journal-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"B32","article-title":"\u201cFaster r-CNN: towards real-time object detection with region proposal networks,\u201d","author":"Ren","year":"2015","journal-title":"Advances in Neural Information Processing Systems"},{"key":"B33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00075","article-title":"Generalized intersection over union: a metric and a loss for bounding box regression,\u201d","author":"Rezatofighi","year":"2019","journal-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition"},{"key":"B34","article-title":"\u201cMulti-task learning as multi-objective optimization,\u201d","author":"Sener","year":"2018","journal-title":"Advances in Neural Information Processing Systems"},{"key":"B35","article-title":"Very deep convolutional networks for large-scale image recognition","author":"Simonyan","year":"2014","journal-title":"arxiv preprint arxiv:1409.1556"},{"key":"B36","doi-asserted-by":"publisher","first-page":"20939","DOI":"10.1007\/s00521-023-08809-1","article-title":"An improved fire detection approach based on yolo-v8 for smart cities","volume":"35","author":"Talaat","year":"2023","journal-title":"Neural Comput. Applic"},{"key":"B37","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00536","article-title":"\u201cElasticvit: conflict-aware supernet training for deploying fast vision transformer on diverse mobile devices,\u201d","author":"Tang","year":"2023","journal-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision"},{"key":"B38","article-title":"\u201cAttention is all you need,\u201d","author":"Vaswani","year":"2017","journal-title":"Advances in Neural Information Processing Systems"},{"key":"B39","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00721","article-title":"\u201cYolov7: trainable bag-of-freebies sets new state-of-the-art for real-time object detectors,\u201d","author":"Wang","year":"2023","journal-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition"},{"key":"B40","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i3.20158","article-title":"\u201cAnchor detr: query design for transformer-based detector,\u201d","author":"Wang","year":"2022","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"B41","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00255","article-title":"\u201cDeep layer aggregation,\u201d","author":"Yu","year":"2018","journal-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"B42","doi-asserted-by":"crossref","first-page":"164","DOI":"10.1109\/GECOST55694.2022.10010490","article-title":"\u201cSafety helmet detection using deep learning: Implementation and comparative study using yolov5, yolov6, and yolov7,\u201d","volume-title":"2022 International Conference on Green Energy, Computing and Sustainable Technology (GECOST)","author":"Yung","year":"2022"},{"key":"B43","article-title":"Dino: detr with improved denoising anchor boxes for end-to-end object detection","author":"Zhang","year":"2022","journal-title":"arxiv preprint arxiv:2203.03605"},{"key":"B44","article-title":"Deformable detr: Deformable transformers for end-to-end object detection","author":"Zhu","year":"2020","journal-title":"arxiv preprint arxiv:2010.04159"},{"key":"B45","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00621","article-title":"\u201cDetrs with collaborative hybrid assignments training,\u201d","author":"Zong","year":"2023","journal-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision"}],"container-title":["Frontiers in Neurorobotics"],"original-title":[],"link":[{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/fnbot.2024.1484276\/full","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,20]],"date-time":"2025-01-20T07:20:55Z","timestamp":1737357655000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/fnbot.2024.1484276\/full"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,1,20]]},"references-count":45,"alternative-id":["10.3389\/fnbot.2024.1484276"],"URL":"https:\/\/doi.org\/10.3389\/fnbot.2024.1484276","relation":{},"ISSN":["1662-5218"],"issn-type":[{"value":"1662-5218","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,1,20]]},"article-number":"1484276"}}