{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:25:46Z","timestamp":1740122746285,"version":"3.37.3"},"reference-count":69,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2021,10,19]],"date-time":"2021-10-19T00:00:00Z","timestamp":1634601600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,10,19]],"date-time":"2021-10-19T00:00:00Z","timestamp":1634601600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61866019"],"award-info":[{"award-number":["61866019"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Neural Process Lett"],"published-print":{"date-parts":[[2022,2]]},"DOI":"10.1007\/s11063-021-10645-0","type":"journal-article","created":{"date-parts":[[2021,10,19]],"date-time":"2021-10-19T21:20:34Z","timestamp":1634678434000},"page":"581-595","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Scale-Insensitive Object Detection via Attention Feature Pyramid Transformer Network"],"prefix":"10.1007","volume":"54","author":[{"given":"Lingling","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Changwen","family":"Zheng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Cunli","family":"Mao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haibo","family":"Deng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Taisong","family":"Jin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2021,10,19]]},"reference":[{"key":"10645_CR1","doi-asserted-by":"crossref","unstructured":"Ciaparrone G, S\u00e1nchez F. L, Tabik S, Troiano L, Tagliaferri R, Herrera F (2020) Deep learning in video multi-object tracking: a survey. Neurocomputing 381:61-88","DOI":"10.1016\/j.neucom.2019.11.023"},{"key":"10645_CR2","doi-asserted-by":"publisher","first-page":"241","DOI":"10.1016\/j.neucom.2015.11.131","volume":"215","author":"X Lin","year":"2016","unstructured":"Lin X, Shen Y, Cai L, Ji R (2016) The distributed system for inverted multi-index visual retrieval. Neurocomputing 215:241\u2013249","journal-title":"Neurocomputing"},{"issue":"4","key":"10645_CR3","doi-asserted-by":"publisher","first-page":"767","DOI":"10.1109\/TCYB.2014.2336697","volume":"45","author":"J Yu","year":"2015","unstructured":"Yu J, Tao D, Wang M, Rui Y (2015) Learning to rank using user clicks and visual features for image retrieval. IEEE Trans Cybern 45(4):767\u2013779","journal-title":"IEEE Trans Cybern"},{"issue":"5","key":"10645_CR4","doi-asserted-by":"publisher","first-page":"2019","DOI":"10.1109\/TIP.2014.2311377","volume":"23","author":"J Yu","year":"2014","unstructured":"Yu J, Rui Y, Tao D (2014) Click prediction for web image reranking using multimodal sparse coding. IEEE Trans Image Process 23(5):2019\u20132032","journal-title":"IEEE Trans Image Process"},{"key":"10645_CR5","doi-asserted-by":"crossref","unstructured":"He K, Gkioxari G, Doll\u00e1r P, Girshick R (2017) Mask R-CNN. In: ICCV","DOI":"10.1109\/ICCV.2017.322"},{"key":"10645_CR6","unstructured":"Zou Z., Shi Z, Guo Y, Ye J (2019) Object detection in 20 years: a survey. arXiv arXiv:1905.05055"},{"key":"10645_CR7","doi-asserted-by":"crossref","unstructured":"Uijlings JRR, van de Sande KEA, Gevers T, Smeulders AWM (2013)Selective search for object recognition, IJCV","DOI":"10.1007\/s11263-013-0620-5"},{"key":"10645_CR8","first-page":"91","volume":"28","author":"S Ren","year":"2015","unstructured":"Ren S, He K, Girshick R, Sun J (2015) Faster R-CNN: towards real-time object detection with region proposal networks. Adv. Neural Inf Process Syst 28:91\u201399","journal-title":"Adv. Neural Inf Process Syst"},{"key":"10645_CR9","doi-asserted-by":"crossref","unstructured":"Redmon J, Divvala S, Girshick R, Farhadi A (2016) you only look once: unified, real-time object detection. In: CVPR","DOI":"10.1109\/CVPR.2016.91"},{"key":"10645_CR10","doi-asserted-by":"crossref","unstructured":"Carion N, Massa F, Synnaeve G, Usunier N, Kirillov A, Zagoruyko S (2020) End-to-end object detection with transformers. In: ECCV","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"10645_CR11","doi-asserted-by":"crossref","unstructured":"Girshick R (2015) Fast R-CNN. In: ICCV","DOI":"10.1109\/ICCV.2015.169"},{"key":"10645_CR12","doi-asserted-by":"crossref","unstructured":"Singh B, Davis LS (2018) An analysis of scale invariance in object detection - SNIP. In: CVPR","DOI":"10.1109\/CVPR.2018.00377"},{"key":"10645_CR13","unstructured":"Singh B, Najibi M, Davis LS (2018) SNIPER: efficient multi-scale training. In: NeurIPS"},{"key":"10645_CR14","doi-asserted-by":"crossref","unstructured":"Liu W, Anguelov D, Erhan D, Szegedy C, Reed S, Fu CY, Berg AC (2016) SSD: single shot multibox detector. In: ECCV","DOI":"10.1007\/978-3-319-46448-0_2"},{"key":"10645_CR15","doi-asserted-by":"crossref","unstructured":"Lin TY, Doll\u00e1r P, Girshick R, He K, Hariharan B, Belongie S (2017) Feature pyramid networks for object detection. In: CVPR","DOI":"10.1109\/CVPR.2017.106"},{"key":"10645_CR16","doi-asserted-by":"crossref","unstructured":"Girshick R, Donahue J, Darrell T, Malik J (2014) Rich feature hierarchies for accurate object detection and semantic segmentation. In: CVPR","DOI":"10.1109\/CVPR.2014.81"},{"key":"10645_CR17","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2014) Spatial Pyramid Pooling in Deep Convolutional Networks for Visual Recognition. In: ECCV","DOI":"10.1007\/978-3-319-10578-9_23"},{"key":"10645_CR18","unstructured":"Dai J, Li Y, He K, Sun J (2016) R-FCN: object detection via region-based fully convolutional networks. In: NeurIPS"},{"key":"10645_CR19","doi-asserted-by":"crossref","unstructured":"Shrivastava A, Gupta A, Ross G (2016) Training region-based object detectors with online hard example mining. In: CVPR","DOI":"10.1109\/CVPR.2016.89"},{"key":"10645_CR20","doi-asserted-by":"crossref","unstructured":"Cai Z, Vasconcelos N (2018) Cascade R-CNN: delving into high quality object detection. In: CVPR","DOI":"10.1109\/CVPR.2018.00644"},{"key":"10645_CR21","doi-asserted-by":"crossref","unstructured":"Hu H, Gu J, Zhang Z, Dai J, Wei Y (2018) Relation networks for object detection. In: CVPR","DOI":"10.1109\/CVPR.2018.00378"},{"key":"10645_CR22","doi-asserted-by":"crossref","unstructured":"Dai J, Qi H, Xiong Y, Li Y, Zhang G, Hu H, Wei Y (2017) Deformable convolutional networks. In: ICCV","DOI":"10.1109\/ICCV.2017.89"},{"key":"10645_CR23","doi-asserted-by":"crossref","unstructured":"Rezatofighi H, Tsoi N, Gwak J, Sadeghian A, Reid I, Savarese S (2019) Generalized intersection over union: a metric and a loss for bounding box regression. In: CVPR","DOI":"10.1109\/CVPR.2019.00075"},{"key":"10645_CR24","doi-asserted-by":"crossref","unstructured":"Wang J, Chen K, Yang S, Loy CC, Lin D (2019) Region proposal by guided anchoring. In: CVPR","DOI":"10.1109\/CVPR.2019.00308"},{"key":"10645_CR25","doi-asserted-by":"crossref","unstructured":"Zhang S, Chi C, Yao Y, Lei Z, Li SZ (2020) Bridging the gap between anchor-based and anchor-free detection via adaptive training sample selection. In: CVPR","DOI":"10.1109\/CVPR42600.2020.00978"},{"key":"10645_CR26","doi-asserted-by":"crossref","unstructured":"Tychsen-Smith L, Petersson L (2018) Improving object localization with fitness NMS and bounded IoU loss. In: CVPR","DOI":"10.1109\/CVPR.2018.00719"},{"key":"10645_CR27","doi-asserted-by":"crossref","unstructured":"Shen Y, Ji R, Chen Z, Hong X, Zheng F, Liu J, Xu M, Tian Q (2020) Noise-aware fully webly supervised object detection. In: CVPR","DOI":"10.1109\/CVPR42600.2020.01134"},{"key":"10645_CR28","doi-asserted-by":"publisher","first-page":"843","DOI":"10.1109\/TIP.2019.2933735","volume":"29","author":"Y Shen","year":"2019","unstructured":"Shen Y, Ji R, Yang K, Deng C, Wang C (2019) Category-aware spatial constraint for weakly supervised detection. IEEE Trans Image Process 29:843\u2013858","journal-title":"IEEE Trans Image Process"},{"key":"10645_CR29","unstructured":"Jaderberg M, Simonyan K, Zisserman A, Kavukcuoglu K (2015) Spatial transformer networks. In: NeurIPS"},{"key":"10645_CR30","doi-asserted-by":"crossref","unstructured":"Shen Y, Ji R, Wang Y, Wu Y, Cao L (2019) Cyclic guidance for weakly supervised joint detection and segmentation. In: CVPR","DOI":"10.1109\/CVPR.2019.00079"},{"key":"10645_CR31","doi-asserted-by":"crossref","unstructured":"Shen Y, Ji R, Zhang S, Zuo W, Wang Y (2018) Generative adversarial learning towards fast weakly supervised detection. In: CVPR","DOI":"10.1109\/CVPR.2018.00604"},{"key":"10645_CR32","doi-asserted-by":"crossref","unstructured":"Tian Z, Shen C, Chen H, He T (2019) FCOS: fully convolutional one-stage object detection. In: ICCV","DOI":"10.1109\/ICCV.2019.00972"},{"key":"10645_CR33","unstructured":"Fu CY, Liu W, Ranga A, Tyagi A, Berg AC (2017) DSSD: deconvolutional single shot detector. arXiv arXiv:1701.06659"},{"key":"10645_CR34","doi-asserted-by":"crossref","unstructured":"Lin TY, Goyal P, Girshick R, He K, Doll\u00e1r P (2017) Focal loss for dense object detection. In: ICCV","DOI":"10.1109\/ICCV.2017.324"},{"key":"10645_CR35","doi-asserted-by":"crossref","unstructured":"Zhang S, Wen L, Bian X, Lei Z, Li SZ (2018) single-shot refinement neural network for object detection. In: CVPR","DOI":"10.1109\/CVPR.2018.00442"},{"key":"10645_CR36","unstructured":"Li Z, Peng C, Yu G, Zhang X, Deng Y, Sun J (2017) Light-Head R-CNN: in defense of two-stage object detector. arXiv arXiv:1711.07264"},{"key":"10645_CR37","doi-asserted-by":"crossref","unstructured":"Tychsen-Smith L, Petersson L (2017) DeNet: scalable real-time object detection with directed sparse sampling. In: ICCV","DOI":"10.1109\/ICCV.2017.54"},{"key":"10645_CR38","doi-asserted-by":"crossref","unstructured":"Singh B, Li H, Sharma A, Davis LS (2018) R-FCN-3000 at 30fps: decoupling detection and classification. In: CVPR","DOI":"10.1109\/CVPR.2018.00119"},{"key":"10645_CR39","unstructured":"Wang R. J, Li X, Ao S, Ling CX (2018) Pelee: a real-time object detection system on mobile devices. In: NeurIPS"},{"key":"10645_CR40","doi-asserted-by":"crossref","unstructured":"Qin Z, Li Z, Zhang Z, Bao Y, Yu G, Peng Y, Sun J (2019) ThunderNet: towards real-time generic object detection. In: ICCV","DOI":"10.1109\/ICCV.2019.00682"},{"key":"10645_CR41","doi-asserted-by":"crossref","unstructured":"Ronneberger O, Fischer P, Brox T (2015) U-Net: convolutional networks for biomedical image segmentation. In: MICCAI","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"10645_CR42","doi-asserted-by":"crossref","unstructured":"Jeong J, Park H, Kwak N (2017) Enhancement of SSD by concatenating feature maps for object detection. In: BMVC","DOI":"10.5244\/C.31.76"},{"key":"10645_CR43","doi-asserted-by":"crossref","unstructured":"Ren J, Chen X, Liu J, Sun W, Pang J, Yan Q, Tai Y.W, Xu L (2017) Accurate single stage detector using recurrent rolling convolution. In: CVPR","DOI":"10.1109\/CVPR.2017.87"},{"key":"10645_CR44","doi-asserted-by":"crossref","unstructured":"Liu S, Qi L, Qin H, Shi J, Jia J (2018) Path aggregation network for instance segmentation. In: CVPR","DOI":"10.1109\/CVPR.2018.00913"},{"key":"10645_CR45","doi-asserted-by":"crossref","unstructured":"Bell S, Zitnick CL, Bala K, Girshick R (2016) Inside-outside net: detecting objects in context with skip pooling and recurrent neural networks. In: CVPR","DOI":"10.1109\/CVPR.2016.314"},{"key":"10645_CR46","doi-asserted-by":"crossref","unstructured":"Kong T, Yao A, Chen Y, Sun F (2016) HyperNet: towards accurate region proposal generation and joint object detection. In: CVPR","DOI":"10.1109\/CVPR.2016.98"},{"key":"10645_CR47","doi-asserted-by":"crossref","unstructured":"Cai Z, Fan Q, Feris R. S, Vasconcelos N (2016) A unified multi-scale deep convolutional neural network for fast object detection. In: ECCV","DOI":"10.1007\/978-3-319-46493-0_22"},{"key":"10645_CR48","doi-asserted-by":"crossref","unstructured":"Newell A, Yang K, Deng J (2016) Stacked hourglass networks for human pose estimation. In: ECCV","DOI":"10.1007\/978-3-319-46484-8_29"},{"key":"10645_CR49","doi-asserted-by":"crossref","unstructured":"Cao J, Pang Y, Li X (2019) Triply supervised decoder networks for joint detection and segmentation. In: CVPR","DOI":"10.1109\/CVPR.2019.00757"},{"key":"10645_CR50","unstructured":"Dosovitskiy A, Beyer L, Kolesnikov A, Weissenborn D, Zhai X, Unterthiner T, Dehghani M, Minderer M, Heigold G, Gelly S, Uszkoreit J, Houlsby N (2021) An image is worth 16x16 words: transformers for image recognition at scale. In: ICLR"},{"key":"10645_CR51","doi-asserted-by":"crossref","unstructured":"Chen H, Wang Y, Guo T, Xu C, Deng Y, Liu Z, Ma S, Xu C, Xu C, Gao W (2021) Pre-trained image processing transformer. In: CVPR","DOI":"10.1109\/CVPR46437.2021.01212"},{"key":"10645_CR52","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez AN, Kaiser L, Polosukhin I (2017) Attention is all you need. In: NeurIPS"},{"key":"10645_CR53","doi-asserted-by":"crossref","unstructured":"Lin T.-Y, Maire M, Belongie S, Bourdev L, Girshick R, Hays J, Perona P, Ramanan D, Zitnick CL, Doll\u00e1r P (2014) Microsoft COCO: common objects in context. In: ECCV","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"10645_CR54","unstructured":"Loshchilov I, Hutter F (2019) Decoupled weight decay regularization. In: ICLR"},{"key":"10645_CR55","unstructured":"Glorot X, Bengio Y (2010) Understanding the difficulty of training deep feedforward neural networks. In: AISTATS"},{"key":"10645_CR56","unstructured":"Redmon J, Farhadi A, Ap C (2018) YOLOv3 : an incremental improvement. arXiv arXiv:1804.02767"},{"key":"10645_CR57","doi-asserted-by":"crossref","unstructured":"Law H, Deng J (2018) CornerNet: detecting objects as paired keypoints. In: ECCV","DOI":"10.1007\/978-3-030-01264-9_45"},{"key":"10645_CR58","doi-asserted-by":"crossref","unstructured":"Zhou X, Zhuo J, Kr\u00e4henb\u00fchl P (2019) Bottom-up object detection by grouping extreme and center points. In: CVPR","DOI":"10.1109\/CVPR.2019.00094"},{"key":"10645_CR59","doi-asserted-by":"crossref","unstructured":"Zhu C, He Y, Savvides M (2019) Feature selective anchor-free module for single-shot object detection. In: CVPR","DOI":"10.1109\/CVPR.2019.00093"},{"key":"10645_CR60","doi-asserted-by":"crossref","unstructured":"Duan K, Bai S, Xie L, Qi H, Huang Q, Tian Q (2019) CenterNet: keypoint triplets for object detection. In: ICCV","DOI":"10.1109\/ICCV.2019.00667"},{"key":"10645_CR61","doi-asserted-by":"crossref","unstructured":"Ghiasi G, Lin TY, Le QV (2019) NAS-FPN: learning scalable feature pyramid architecture for object detection. In: CVPR","DOI":"10.1109\/CVPR.2019.00720"},{"key":"10645_CR62","doi-asserted-by":"crossref","unstructured":"Du X, Lin T-Y, Jin P, Ghiasi G, Tan M, Cui Y, Le QV, Song X: SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization. CVPR 2020: 11589\u201311598","DOI":"10.1109\/CVPR42600.2020.01161"},{"key":"10645_CR63","doi-asserted-by":"crossref","unstructured":"Pang J, Chen K, Shi J, Feng H, Ouyang W, Lin D (2019) Libra R-CNN: towards balanced learning for object detection. In: CVPR","DOI":"10.1109\/CVPR.2019.00091"},{"key":"10645_CR64","doi-asserted-by":"crossref","unstructured":"Zhu X, Hu H, Lin S, Dai J (2019) Deformable ConvNets v2: more deformable, better results. In: CVPR","DOI":"10.1109\/CVPR.2019.00953"},{"key":"10645_CR65","doi-asserted-by":"crossref","unstructured":"Li Y, Chen Y, Wang N, Zhang Z (2019) Scale-aware trident networks for object detection. In: ICCV","DOI":"10.1109\/ICCV.2019.00615"},{"key":"10645_CR66","doi-asserted-by":"crossref","unstructured":"Song G, Liu Y, Wang X (2020) Revisiting the sibling head in object detector. In: CVPR","DOI":"10.1109\/CVPR42600.2020.01158"},{"key":"10645_CR67","doi-asserted-by":"crossref","unstructured":"Peng C, Xiao T, Li Z, Jiang Y, Zhang X, Jia K, Yu G, Sun J (2018) MegDet: a large mini-batch object detector. In: CVPR","DOI":"10.1109\/CVPR.2018.00647"},{"key":"10645_CR68","doi-asserted-by":"crossref","unstructured":"Liu Y, Wang Y, Wang S, Liang T, Zhao Q, Tang Z, Ling H (2019) CBNet: a novel composite backbone network architecture for object detection. In: AAAI","DOI":"10.1609\/aaai.v34i07.6834"},{"key":"10645_CR69","unstructured":"Chen B, Medini T, Farwell J, Gobriel S, Tai C, Shrivastava A (2019) Slide: in defense of smart algorithms over hardware acceleration for large-scale deep learning systems"}],"container-title":["Neural Processing Letters"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11063-021-10645-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11063-021-10645-0\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11063-021-10645-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,2,25]],"date-time":"2022-02-25T16:23:46Z","timestamp":1645806226000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11063-021-10645-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,10,19]]},"references-count":69,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2022,2]]}},"alternative-id":["10645"],"URL":"https:\/\/doi.org\/10.1007\/s11063-021-10645-0","relation":{},"ISSN":["1370-4621","1573-773X"],"issn-type":[{"type":"print","value":"1370-4621"},{"type":"electronic","value":"1573-773X"}],"subject":[],"published":{"date-parts":[[2021,10,19]]},"assertion":[{"value":"9 September 2021","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"19 October 2021","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}