{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:27:57Z","timestamp":1740122877549,"version":"3.37.3"},"reference-count":49,"publisher":"Springer Science and Business Media LLC","issue":"20","license":[{"start":{"date-parts":[[2023,12,20]],"date-time":"2023-12-20T00:00:00Z","timestamp":1703030400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,12,20]],"date-time":"2023-12-20T00:00:00Z","timestamp":1703030400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62171294, 62101344"],"award-info":[{"award-number":["62171294, 62101344"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003453","name":"Natural Science Foundation of Guangdong Province","doi-asserted-by":"publisher","award":["2022A1515010159, 2020A1515010959"],"award-info":[{"award-number":["2022A1515010159, 2020A1515010959"]}],"id":[{"id":"10.13039\/501100003453","id-type":"DOI","asserted-by":"publisher"}]},{"name":"the key Project of DEGP","award":["2018KCXTD027"],"award-info":[{"award-number":["2018KCXTD027"]}]},{"name":"the Key project of Shenzhen Science and Technology Plan","award":["20220810180617001"],"award-info":[{"award-number":["20220810180617001"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"DOI":"10.1007\/s11042-023-16484-6","type":"journal-article","created":{"date-parts":[[2023,12,20]],"date-time":"2023-12-20T06:01:52Z","timestamp":1703052112000},"page":"58267-58292","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["MI-RPN: Integrating multi-modalities and multi-scales information for region proposal"],"prefix":"10.1007","volume":"83","author":[{"given":"Shishun","family":"Tian","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ruifeng","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wenbin","family":"Zou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xia","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,12,20]]},"reference":[{"issue":"11","key":"16484_CR1","doi-asserted-by":"publisher","first-page":"2189","DOI":"10.1109\/TPAMI.2012.28","volume":"34","author":"B Alexe","year":"2012","unstructured":"Alexe B, Deselaers T, Ferrari V (2012) Measuring the objectness of image windows. IEEE Trans Pattern Anal Mach Intell 34(11):2189\u20132202","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"16484_CR2","doi-asserted-by":"crossref","unstructured":"Blum M, Springenberg JT, W\u00fclfing J, Riedmiller M (2012) A learned feature descriptor for object recognition in rgb-d data. In: 2012 IEEE international conference on robotics and automation, pp 1298\u20131303. IEEE","DOI":"10.1109\/ICRA.2012.6225188"},{"key":"16484_CR3","doi-asserted-by":"crossref","unstructured":"Bo L, Lai K, Ren X, Fox D (2011) Object recognition with hierarchical kernel descriptors. In: CVPR 2011, pp 1729\u20131736. IEEE","DOI":"10.1109\/CVPR.2011.5995719"},{"key":"16484_CR4","doi-asserted-by":"crossref","unstructured":"Cai Z, Vasconcelos N (2018) Cascade r-cnn: Delving into high quality object detection. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6154\u20136162","DOI":"10.1109\/CVPR.2018.00644"},{"key":"16484_CR5","unstructured":"Cao J, Chen Q, Guo J, Shi R (2020) Attention-guided context feature pyramid network for object detection. arXiv preprint arXiv:2005.11475"},{"issue":"7","key":"16484_CR6","doi-asserted-by":"publisher","first-page":"1312","DOI":"10.1109\/TPAMI.2011.231","volume":"34","author":"J Carreira","year":"2011","unstructured":"Carreira J, Sminchisescu C (2011) Cpmc: Automatic object segmentation using constrained parametric min-cuts. IEEE Trans Pattern Anal Mach Intell 34(7):1312\u20131328","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"16484_CR7","doi-asserted-by":"crossref","unstructured":"Chen LC, Zhu Y, Papandreou G, Schroff F, Adam H (2018) Encoder-decoder with atrous separable convolution for semantic image segmentation. In: Proceedings of the European conference on computer vision (ECCV)","DOI":"10.1007\/978-3-030-01234-2_49"},{"key":"16484_CR8","doi-asserted-by":"crossref","unstructured":"Cheng MM, Zhang Z, Lin WY, Torr P (2014) Bing: Binarized normed gradients for objectness estimation at 300fps. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3286\u20133293","DOI":"10.1109\/CVPR.2014.414"},{"key":"16484_CR9","unstructured":"Chen K, Wang J, Pang J, Cao Y, Xiong Y, Li X, Sun S, Feng W, Liu Z, Xu J et al (2019) Mmdetection: open mmlab detection toolbox and benchmark. arXiv preprint arXiv:1906.07155"},{"key":"16484_CR10","unstructured":"Deng L, Yang M, Li T, He Y, Wang C (2019) Rfbnet: deep multimodal networks with residual fusion blocks for rgb-d semantic segmentation. arXiv preprint arXiv:1907.00135"},{"key":"16484_CR11","doi-asserted-by":"crossref","unstructured":"Erhan D, Szegedy C, Toshev A, Anguelov D (2014) Scalable object detection using deep neural networks. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2147\u20132154","DOI":"10.1109\/CVPR.2014.276"},{"key":"16484_CR12","doi-asserted-by":"crossref","unstructured":"Fu H, Gong M, Wang C, Batmanghelich K, Tao D (2018) Deep ordinal regression network for monocular depth estimation. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2002\u20132011","DOI":"10.1109\/CVPR.2018.00214"},{"issue":"11","key":"16484_CR13","doi-asserted-by":"publisher","first-page":"1231","DOI":"10.1177\/0278364913491297","volume":"32","author":"A Geiger","year":"2013","unstructured":"Geiger A, Lenz P, Stiller C, Urtasun R (2013) Vision meets robotics: The kitti dataset. The International Journal of Robotics Research 32(11):1231\u20131237","journal-title":"The International Journal of Robotics Research"},{"key":"16484_CR14","doi-asserted-by":"crossref","unstructured":"Ghiasi G, Lin TY, Le QV (2019) Nas-fpn: Learning scalable feature pyramid architecture for object detection. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 7036\u20137045","DOI":"10.1109\/CVPR.2019.00720"},{"issue":"17","key":"16484_CR15","doi-asserted-by":"publisher","first-page":"25985","DOI":"10.1007\/s11042-021-10954-5","volume":"80","author":"R Ghosh","year":"2021","unstructured":"Ghosh R (2021) On-road vehicle detection in varying weather conditions using faster r-cnn with several region proposal networks. Multimed Tools Appl 80(17):25985\u201325999","journal-title":"Multimed Tools Appl"},{"key":"16484_CR16","doi-asserted-by":"crossref","unstructured":"Guo C, Fan B, Zhang Q, Xiang S, Pan C (2020) Augfpn: Improving multi-scale feature learning for object detection. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 12595\u201312604","DOI":"10.1109\/CVPR42600.2020.01261"},{"key":"16484_CR17","doi-asserted-by":"crossref","unstructured":"Gupta S, Girshick R, Arbel\u00e1ez P, Malik J (2014) Learning rich features from rgb-d images for object detection and segmentation. In: European conference on computer vision, pp 345\u2013360. Springer","DOI":"10.1007\/978-3-319-10584-0_23"},{"key":"16484_CR18","doi-asserted-by":"crossref","unstructured":"Gupta S, Hoffman J, Malik J (2016) Cross modal distillation for supervision transfer. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2827\u20132836","DOI":"10.1109\/CVPR.2016.309"},{"key":"16484_CR19","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"16484_CR20","doi-asserted-by":"crossref","unstructured":"Humayun A, Li F, Rehg JM (2014) Rigor: Reusing inference in graph cuts for generating object regions. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 336\u2013343","DOI":"10.1109\/CVPR.2014.50"},{"key":"16484_CR21","doi-asserted-by":"crossref","unstructured":"Hu J, Shen L, Sun G (2018) Squeeze-and-excitation networks. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 7132\u20137141","DOI":"10.1109\/CVPR.2018.00745"},{"key":"16484_CR22","doi-asserted-by":"crossref","unstructured":"Hu X, Yang K, Fei L, Wang K (2019) Acnet: attention based network to exploit complementary features for rgbd semantic segmentation. In: 2019 IEEE international conference on image processing (ICIP), pp 1440\u20131444. IEEE","DOI":"10.1109\/ICIP.2019.8803025"},{"key":"16484_CR23","doi-asserted-by":"crossref","unstructured":"Ji W, Li J, Yu S, Zhang M, Piao Y, Yao S, Bi Q, Ma K, Zheng Y, Lu H et al (2021) Calibrated rgb-d salient object detection. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 9471\u20139481","DOI":"10.1109\/CVPR46437.2021.00935"},{"key":"16484_CR24","doi-asserted-by":"crossref","unstructured":"Lin TY, Doll\u00e1r P, Girshick R, He K, Hariharan B, Belongie S (2017) Feature pyramid networks for object detection. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2117\u2013 2125","DOI":"10.1109\/CVPR.2017.106"},{"key":"16484_CR25","doi-asserted-by":"crossref","unstructured":"Lin TY, Goyal P, Girshick R, He K, Doll\u00e1r P (2017) Focal loss for dense object detection. In: Proceedings of the IEEE international conference on computer vision, pp 2980\u20132988","DOI":"10.1109\/ICCV.2017.324"},{"key":"16484_CR26","doi-asserted-by":"crossref","unstructured":"Liu S, Qi L, Qin H, Shi J, Jia J (2018) Path aggregation network for instance segmentation. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 8759\u20138768","DOI":"10.1109\/CVPR.2018.00913"},{"key":"16484_CR27","doi-asserted-by":"crossref","unstructured":"Li X, You A, Zhu Z, Zhao H, Yang M, Yang K, Tan S, Tong Y (2020) Semantic flow for fast and accurate scene parsing. In: European conference on computer vision, pp 775\u2013793. Springer","DOI":"10.1007\/978-3-030-58452-8_45"},{"issue":"3","key":"16484_CR28","doi-asserted-by":"publisher","first-page":"3553","DOI":"10.1007\/s11042-021-11437-3","volume":"81","author":"\u00d3 P\u00e9rez-Gil","year":"2022","unstructured":"P\u00e9rez-Gil \u00d3, Barea R, L\u00f3pez-Guill\u00e9n E, Bergasa LM, G\u00f3mez-Hu\u00e9lamo C, Guti\u00e9rrez R (2022) D\u00edaz-D\u00edaz, A Deep reinforcement learning based control for autonomous vehicles in carla. Multimed Tools Appl 81(3):3553\u20133576","journal-title":"Multimed Tools Appl"},{"issue":"6","key":"16484_CR29","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","volume":"39","author":"S Ren","year":"2016","unstructured":"Ren S, He K, Girshick R, Sun J (2016) Faster r-cnn: towards real-time object detection with region proposal networks. IEEE Trans Pattern Anal Mach Intell 39(6):1137\u20131149","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"16484_CR30","doi-asserted-by":"crossref","unstructured":"Silberman N, Hoiem D, Kohli P, Fergus R (2012) Indoor segmentation and support inference from rgbd images. In: European conference on computer vision, pp 746\u2013760. Springer","DOI":"10.1007\/978-3-642-33715-4_54"},{"key":"16484_CR31","doi-asserted-by":"crossref","unstructured":"Song S, Lichtenberg SP, Xiao J (2015) Sun rgb-d: A rgb-d scene understanding benchmark suite. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 567\u2013576","DOI":"10.1109\/CVPR.2015.7298655"},{"issue":"26","key":"16484_CR32","doi-asserted-by":"publisher","first-page":"34311","DOI":"10.1007\/s11042-021-10931-y","volume":"80","author":"CS Sung","year":"2021","unstructured":"Sung CS, Park JY (2021) Correction to: design of an intelligent video surveillance system for crime prevention: applying deep learning technology. Multimed Tools Appl 80(26):34311\u20133431","journal-title":"Multimed Tools Appl"},{"key":"16484_CR33","doi-asserted-by":"crossref","unstructured":"Sun K, Xiao B, Liu D, Wang J (2019) Deep high-resolution representation learning for human pose estimation. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 5693\u20135703","DOI":"10.1109\/CVPR.2019.00584"},{"key":"16484_CR34","doi-asserted-by":"crossref","unstructured":"Tan M, Pang R, Le QV (2020) Efficientdet: Scalable and efficient object detection. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 10781\u201310790","DOI":"10.1109\/CVPR42600.2020.01079"},{"issue":"2","key":"16484_CR35","doi-asserted-by":"publisher","first-page":"154","DOI":"10.1007\/s11263-013-0620-5","volume":"104","author":"JR Uijlings","year":"2013","unstructured":"Uijlings JR, Van De Sande KE, Gevers T, Smeulders AW (2013) Selective search for object recognition. Int J Comput Vis 104(2):154\u2013171","journal-title":"Int J Comput Vis"},{"key":"16484_CR36","unstructured":"Vu T, Jang H, Pham XT, Yoo CD (2019) Delving into high-quality region proposal network with adaptive convolution. In: Thirty-third conference on neural information processing systems. Neural information processing systems foundation"},{"key":"16484_CR37","doi-asserted-by":"crossref","unstructured":"Wang J, Chen K, Yang S, Loy CC, Lin D (2019) Region proposal by guided anchoring. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 2965\u20132974","DOI":"10.1109\/CVPR.2019.00308"},{"key":"16484_CR38","doi-asserted-by":"crossref","unstructured":"Wang X, Girshick R, Gupta A, He K (2018) Non-local neural networks. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 7794\u20137803","DOI":"10.1109\/CVPR.2018.00813"},{"key":"16484_CR39","doi-asserted-by":"crossref","unstructured":"Wang T, Ma C, Su H, Wang W (2021) Cspn: Multi-scale cascade spatial pyramid network for object detection. In: ICASSP 2021-2021 IEEE international conference on acoustics, speech and signal processing (ICASSP), pp 1490\u20131494. IEEE","DOI":"10.1109\/ICASSP39728.2021.9414883"},{"key":"16484_CR40","doi-asserted-by":"crossref","unstructured":"Wang J, Wang Z, Tao D, See S, Wang G (2016) Learning common and specific features for rgb-d semantic segmentation with deconvolutional networks. In: European conference on computer vision, pp 664\u2013679. Springer","DOI":"10.1007\/978-3-319-46454-1_40"},{"key":"16484_CR41","doi-asserted-by":"publisher","first-page":"300","DOI":"10.1016\/j.patcog.2017.07.026","volume":"72","author":"X Xu","year":"2017","unstructured":"Xu X, Li Y, Wu G, Luo J (2017) Multi-modal deep feature learning for rgb-d object detection. Pattern Recognit 72:300\u2013313","journal-title":"Pattern Recognit"},{"issue":"13","key":"16484_CR42","doi-asserted-by":"publisher","first-page":"9645","DOI":"10.1007\/s11042-017-4820-9","volume":"79","author":"Y Yao","year":"2020","unstructured":"Yao Y, Li J, Wu T, Zhang L (2020) Retracted article: Moving object surveillance using object proposals and background prior prediction. Multimed Tools Appl 79(13):9645","journal-title":"Multimed Tools Appl"},{"issue":"15","key":"16484_CR43","doi-asserted-by":"publisher","first-page":"23723","DOI":"10.1007\/s11042-020-10231-x","volume":"80","author":"X Zhang","year":"2021","unstructured":"Zhang X, Kusrini K (2021) Autonomous long-range drone detection system for critical infrastructure safety. Multimed Tools Appl 80(15):23723\u201323743","journal-title":"Multimed Tools Appl"},{"key":"16484_CR44","doi-asserted-by":"crossref","unstructured":"Zhao H, Shi J, Qi X, Wang X, Jia J (2017) Pyramid scene parsing network. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2881\u20132890","DOI":"10.1109\/CVPR.2017.660"},{"key":"16484_CR45","doi-asserted-by":"crossref","unstructured":"Zhou X, Wen H, Shi R, Yin H, Zhang J, Yan C (2022) Fanet: feature aggregation network for rgbd saliency detection. Signal Process Image Commun 102:116591","DOI":"10.1016\/j.image.2021.116591"},{"issue":"10","key":"16484_CR46","doi-asserted-by":"publisher","first-page":"15469","DOI":"10.1007\/s11042-021-10574-z","volume":"80","author":"J Zhu","year":"2021","unstructured":"Zhu J, Zhang G, Zhou S, Li K (2021) Relation-aware siamese region proposal network for visual object tracking. Multimed Tools Appl 80(10):15469\u201315485","journal-title":"Multimed Tools Appl"},{"key":"16484_CR47","doi-asserted-by":"publisher","first-page":"127","DOI":"10.1016\/j.neucom.2022.02.016","volume":"483","author":"L Zhu","year":"2022","unstructured":"Zhu L, Lee F, Cai J, Yu H, Chen Q (2022) An improved feature pyramid network for object detection. Neurocomputing 483:127\u2013139","journal-title":"Neurocomputing"},{"key":"16484_CR48","doi-asserted-by":"crossref","unstructured":"Zitnick CL, Doll\u00e1r P (2014) Edge boxes: Locating object proposals from edges. In: European conference on computer vision, pp 391\u2013405. Springer","DOI":"10.1007\/978-3-319-10602-1_26"},{"key":"16484_CR49","doi-asserted-by":"crossref","unstructured":"Zou W, Zhang Z, Peng Y, Xiang C, Tian S, Zhang L (2021) Scrpn: a strong correlation learning framework for region proposal. IEEE Trans Image Process 30:4084\u20134098","DOI":"10.1109\/TIP.2021.3069547"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-16484-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-023-16484-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-16484-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,6,3]],"date-time":"2024-06-03T09:17:17Z","timestamp":1717406237000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-023-16484-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,12,20]]},"references-count":49,"journal-issue":{"issue":"20","published-online":{"date-parts":[[2024,6]]}},"alternative-id":["16484"],"URL":"https:\/\/doi.org\/10.1007\/s11042-023-16484-6","relation":{},"ISSN":["1573-7721"],"issn-type":[{"type":"electronic","value":"1573-7721"}],"subject":[],"published":{"date-parts":[[2023,12,20]]},"assertion":[{"value":"21 August 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 June 2023","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 August 2023","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 December 2023","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}