{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,19]],"date-time":"2026-06-19T16:30:04Z","timestamp":1781886604907,"version":"3.54.5"},"reference-count":84,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"7","license":[{"start":{"date-parts":[[2017,7,1]],"date-time":"2017-07-01T00:00:00Z","timestamp":1498867200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"funder":[{"name":"General Research Fund"},{"DOI":"10.13039\/501100002920","name":"Research Grants Council of Hong Kong","doi-asserted-by":"publisher","award":["CUHK14206114"],"award-info":[{"award-number":["CUHK14206114"]}],"id":[{"id":"10.13039\/501100002920","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002920","name":"Research Grants Council of Hong Kong","doi-asserted-by":"publisher","award":["CUHK14205615"],"award-info":[{"award-number":["CUHK14205615"]}],"id":[{"id":"10.13039\/501100002920","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002920","name":"Research Grants Council of Hong Kong","doi-asserted-by":"publisher","award":["CUHK14207814"],"award-info":[{"award-number":["CUHK14207814"]}],"id":[{"id":"10.13039\/501100002920","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002920","name":"Research Grants Council of Hong Kong","doi-asserted-by":"publisher","award":["CUHK417011"],"award-info":[{"award-number":["CUHK417011"]}],"id":[{"id":"10.13039\/501100002920","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002920","name":"Research Grants Council of Hong Kong","doi-asserted-by":"publisher","award":["CUHK14203015"],"award-info":[{"award-number":["CUHK14203015"]}],"id":[{"id":"10.13039\/501100002920","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2017,7,1]]},"DOI":"10.1109\/tpami.2016.2587642","type":"journal-article","created":{"date-parts":[[2016,7,7]],"date-time":"2016-07-07T16:16:32Z","timestamp":1467908192000},"page":"1320-1334","source":"Crossref","is-referenced-by-count":138,"title":["DeepID-Net: Object Detection with Deformable Part Based Convolutional Neural Networks"],"prefix":"10.1109","volume":"39","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-9163-2761","authenticated-orcid":false,"given":"Wanli","family":"Ouyang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xingyu","family":"Zeng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaogang","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shi","family":"Qiu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ping","family":"Luo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yonglong","family":"Tian","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongsheng","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuo","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhe","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongyang","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kun","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Junjie","family":"Yan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chen-Change","family":"Loy","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaoou","family":"Tang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref73","first-page":"1879","article-title":"Segmentation as selective search for\n object recognition","author":"smeulders","year":"2011","journal-title":"Proc IEEE Int Conf Comput Vis"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.134"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2011.5995711"},{"key":"ref70","first-page":"158","article-title":"Detecting actions, poses, and objects with relational phraselets","author":"desai","year":"2012","journal-title":"Proc 12th Eur Conf Comput Vis"},{"key":"ref76","author":"\u00f8ygard","year":"0"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1145\/2647868.2654889"},{"key":"ref74","first-page":"391","article-title":"Edge boxes: Locating object proposals from edges","author":"zitnick","year":"2014","journal-title":"Proc 13th Eur Conf Comput Vis"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.244"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298641"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.446"},{"key":"ref78","article-title":"Discriminatively trained deformable part models","author":"girshick","year":"0"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.417"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.414"},{"key":"ref32","first-page":"3258","article-title":"A discriminative deep model for pedestrian detection with occlusion handling","author":"ouyang","year":"2012","journal-title":"Proc IEEE Conf Comput Vis Pattern Recog"},{"key":"ref31","first-page":"392","article-title":"Multi-scale orderless pooling of deep\n convolutional activation features","author":"gong","year":"2014","journal-title":"European Conf Comput Vis"},{"key":"ref30","article-title":"Generic object detection with dense neural\n patterns and regionlets","author":"zou","year":"2014","journal-title":"Proc British Mach Vis Conf"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.120"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.299"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.22"},{"key":"ref34","first-page":"472","article-title":"Deep learning of scene-specific classifier\n for pedestrian detection","author":"zeng","year":"2014","journal-title":"Proc 13th Eur Conf Comput Vis"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206532"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5539905"},{"key":"ref61","first-page":"30","article-title":"Learning spatial context: Using stuff to find things","author":"heitz","year":"2008","journal-title":"Proc 10th Eur Conf Comput Vis Part I"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-006-0027-7"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.256"},{"key":"ref64","first-page":"3124","article-title":"Multi-pedestrian detection in crowded scenes: A global\n view","author":"yan","year":"2012","journal-title":"Proc IEEE Conf Comput Vis Pattern Recog"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2011.5995741"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2009.5459256"},{"key":"ref66","first-page":"241","article-title":"Multiresolution models for object detection","author":"park","year":"2010","journal-title":"Proc 11th Eur Conf Comput Vis"},{"key":"ref29","article-title":"Deep\n inside convolutional networks: Visualising image classification models and saliency maps","author":"simonyan","year":"2014","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2011.5995330"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5540235"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6248095"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-009-0275-4"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.81"},{"key":"ref20","first-page":"818","article-title":"Visualizing and understanding convolutional neural networks","author":"zeiler","year":"2014","journal-title":"European Conf Comput Vis"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298854"},{"key":"ref21","article-title":"Overfeat: Integrated recognition, localization and detection using convolutional networks","author":"sermanet","year":"2013","journal-title":"arXiv 1312 6229"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.335"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2014.2377734"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2009.5459303"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.320"},{"key":"ref50","article-title":"R-CNN minus R","author":"lenc","year":"2015","journal-title":"arXiv 1506 06981"},{"key":"ref51","first-page":"779","article-title":"You only look once: Unified, real-time\n object detection","author":"redmon","year":"2015","journal-title":"Proc IEEE Conf Comp Vis Pattern Recog 2016"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5540223"},{"key":"ref58","first-page":"2895","article-title":"Contextual boost for pedestrian detection","author":"ding","year":"2012","journal-title":"Proc IEEE Conf Comput Vis Pattern Recog"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2005.177"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.257"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2016.2629621"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0890-9"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.100"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.220"},{"key":"ref10","first-page":"647","article-title":"DeCAF: A deep convolutional activation feature for generic visual\n recognition","author":"donahue","year":"2014","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2014.131"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.188"},{"key":"ref12","first-page":"834","article-title":"Part-based R-CNNs for fine-grained\n category detection","author":"zhang","year":"2014","journal-title":"Proc 13th Eur Conf Comput Vis"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2009.167"},{"key":"ref14","first-page":"1062","article-title":"Latent hierarchical structural learning for object\n detection","author":"zhu","year":"2010","journal-title":"Proc IEEE Conf Comput Vis Pattern Recog"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1023\/B:VISI.0000042934.15159.49"},{"key":"ref82","first-page":"340","article-title":"Diagnosing error in object detectors","author":"hoiem","year":"2012","journal-title":"Proc 12th Eur Conf Comput Vis"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2012.261"},{"key":"ref81","first-page":"2377","article-title":"Fisher and VLAD with flair","author":"van de sande","year":"2014","journal-title":"Proc IEEE Conf Comput Vis Pattern Recog"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.411"},{"key":"ref84","article-title":"Deeper vision and deep insight solutions","author":"yan","year":"2014","journal-title":"Proc Eur Conf Comput Vis Workshop ImageNet Large Scale Visual Recog Challenge"},{"key":"ref18","article-title":"Return of the devil in the details:\n Delving deep into convolutional nets","author":"chatfield","year":"2014","journal-title":"Proc British Mach Vis Conf"},{"key":"ref83","first-page":"740","article-title":"Microsoft COCO: Common objects in context","author":"lin","year":"2014","journal-title":"Proc 13th Eur Conf Comput Vis"},{"key":"ref19","first-page":"1106","article-title":"ImageNet\n classification with deep convolutional neural networks","author":"krizhevsky","year":"2012","journal-title":"Proc Conf Adv Neural Inf Process Syst"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.10"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"ref6","first-page":"346","article-title":"Spatial pyramid pooling in deep convolutional networks\n for visual recognition","author":"he","year":"2014","journal-title":"Proc 13th Eur Conf Comput Vis"},{"key":"ref5","article-title":"Very deep convolutional networks for large-scale image recognition","author":"simonyan","year":"2014","journal-title":"arXiv 1409 1556"},{"key":"ref8","first-page":"487","article-title":"Learning deep features for scene recognition using places database","author":"zhou","year":"2014","journal-title":"Proc Conf Adv Neural Inf Process Syst"},{"key":"ref7","article-title":"Network in network","author":"lin","year":"2013","journal-title":"arXiv 1312 4400"},{"key":"ref49","first-page":"91","article-title":"Faster R-CNN: Towards real-time object detection with\n region proposal networks","author":"ren","year":"2015","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref9","article-title":"Object detectors emerge in deep scene CNNs","author":"zhou","year":"2015","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299146"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298621"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.169"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.18"},{"key":"ref42","first-page":"2648","article-title":"Pedestrian parsing via deep\n decompositional neural network","author":"luo","year":"2013","journal-title":"Proc IEEE Int Conf Comput Vis"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.356"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298731"},{"key":"ref43","first-page":"2480","article-title":"Hierarchical face parsing\n via deep learning","author":"luo","year":"2012","journal-title":"Proc IEEE Conf Comput Vis Pattern Recog"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/7938536\/07506134.pdf?arnumber=7506134","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,1,12]],"date-time":"2022-01-12T11:40:28Z","timestamp":1641987628000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7506134\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,7,1]]},"references-count":84,"journal-issue":{"issue":"7"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2016.2587642","relation":{},"ISSN":["0162-8828","2160-9292"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"}],"subject":[],"published":{"date-parts":[[2017,7,1]]}}}