{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,31]],"date-time":"2026-03-31T12:23:46Z","timestamp":1774959826274,"version":"3.50.1"},"reference-count":108,"publisher":"Springer Science and Business Media LLC","issue":"8-9","license":[{"start":{"date-parts":[[2019,12,17]],"date-time":"2019-12-17T00:00:00Z","timestamp":1576540800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2019,12,17]],"date-time":"2019-12-17T00:00:00Z","timestamp":1576540800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"DOI":"10.13039\/501100000266","name":"Engineering and Physical Sciences Research Council","doi-asserted-by":"publisher","award":["EP\/N007743\/1"],"award-info":[{"award-number":["EP\/N007743\/1"]}],"id":[{"id":"10.13039\/501100000266","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100000266","name":"Engineering and Physical Sciences Research Council","doi-asserted-by":"publisher","award":["EP\/R018456\/1"],"award-info":[{"award-number":["EP\/R018456\/1"]}],"id":[{"id":"10.13039\/501100000266","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61672265"],"award-info":[{"award-number":["61672265"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U1836218"],"award-info":[{"award-number":["U1836218"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["61902153"],"award-info":[{"award-number":["61902153"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["61876072"],"award-info":[{"award-number":["61876072"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2020,9]]},"abstract":"<jats:title>Abstract<\/jats:title><jats:p>Efficient and robust facial landmark localisation is crucial for the deployment of real-time face analysis systems. This paper presents a new loss function, namely Rectified Wing (RWing) loss, for regression-based facial landmark localisation with Convolutional Neural Networks (CNNs). We first systemically analyse different loss functions, including L2, L1 and smooth L1. The analysis suggests that the training of a network should pay more attention to small-medium errors. Motivated by this finding, we design a piece-wise loss that amplifies the impact of the samples with small-medium errors. Besides, we rectify the loss function for very small errors to mitigate the impact of inaccuracy of manual annotation. The use of our RWing loss boosts the performance significantly for regression-based CNNs in facial landmarking, especially for lightweight network architectures. To address the problem of under-representation of samples with large pose variations, we propose a simple but effective boosting strategy, referred to as pose-based data balancing. In particular, we deal with the data imbalance problem by duplicating the minority training samples and perturbing them by injecting random image rotation, bounding box translation and other data augmentation strategies. Last, the proposed approach is extended to create a coarse-to-fine framework for robust and efficient landmark localisation. Moreover, the proposed coarse-to-fine framework is able to deal with the small sample size problem effectively. The experimental results obtained on several well-known benchmarking datasets demonstrate the merits of our RWing loss and prove the superiority of the proposed method over the state-of-the-art approaches.\n<\/jats:p>","DOI":"10.1007\/s11263-019-01275-0","type":"journal-article","created":{"date-parts":[[2019,12,17]],"date-time":"2019-12-17T12:02:43Z","timestamp":1576584163000},"page":"2126-2145","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":31,"title":["Rectified Wing Loss for Efficient and Robust Facial Landmark Localisation with Convolutional Neural Networks"],"prefix":"10.1007","volume":"128","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4485-4249","authenticated-orcid":false,"given":"Zhen-Hua","family":"Feng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Josef","family":"Kittler","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Muhammad","family":"Awais","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiao-Jun","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2019,12,17]]},"reference":[{"key":"1275_CR1","unstructured":"Alp\u00a0Guler, R., Trigeorgis, G., Antonakos, E., Snape, P., Zafeiriou, S., & Kokkinos, I. (2017). Densereg: Fully convolutional dense shape regression in-the-wild. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 6799\u20136808)."},{"key":"1275_CR2","doi-asserted-by":"crossref","unstructured":"Bansal, A., Nanduri, A., Castillo, C. D., Ranjan, R., & Chellappa, R. (2017). Umdfaces: An annotated face dataset for training deep networks. In IEEE international joint conference on biometrics (IJCB) (pp. 464\u2013473).","DOI":"10.1109\/BTAS.2017.8272731"},{"key":"1275_CR3","doi-asserted-by":"crossref","unstructured":"Belhumeur, P. N., Jacobs, D. W., Kriegman, D., & Kumar, N. (2011). Localizing parts of faces using a consensus of exemplars. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 545\u2013552).","DOI":"10.1109\/CVPR.2011.5995602"},{"key":"1275_CR4","doi-asserted-by":"crossref","unstructured":"Bhagavatula, C., Zhu, C., Luu, K., & Savvides, M. (2017). Faster than real-time facial alignment: A 3D spatial transformer network approach in unconstrained poses. In IEEE international conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2017.429"},{"key":"1275_CR5","doi-asserted-by":"crossref","unstructured":"Bulat, A., & Tzimiropoulos, G. (2017a). Binarized convolutional landmark localizers for human pose estimation and face alignment with limited resources. In IEEE international conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2017.400"},{"key":"1275_CR6","doi-asserted-by":"crossref","unstructured":"Bulat, A., & Tzimiropoulos, G. (2017b). How far are we from solving the 2D & 3D face alignment problem? And a dataset of 230,000 3D facial landmarks. In IEEE international conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2017.116"},{"key":"1275_CR7","doi-asserted-by":"crossref","unstructured":"Burgos-Artizzu, X. P., Perona, P., & Doll\u00e1r, P. (2013). Robust face landmark estimation under occlusion. In IEEE international conference on computer vision (ICCV) (pp. 1513\u20131520).","DOI":"10.1109\/ICCV.2013.191"},{"issue":"2","key":"1275_CR8","doi-asserted-by":"crossref","first-page":"177","DOI":"10.1007\/s11263-013-0667-3","volume":"107","author":"X Cao","year":"2014","unstructured":"Cao, X., Wei, Y., Wen, F., & Sun, J. (2014). Face alignment by explicit shape regression. International Journal of Computer Vision (IJCV), 107(2), 177\u2013190.","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"1275_CR9","doi-asserted-by":"crossref","first-page":"60","DOI":"10.1016\/j.imavis.2015.11.003","volume":"47","author":"J \u010cech","year":"2016","unstructured":"\u010cech, J., Franc, V., U\u0159i\u010d\u00e1\u0159, M., & Matas, J. (2016). Multi-view facial landmark detection by using a 3d shape model. Image and Vision Computing, 47, 60\u201370.","journal-title":"Image and Vision Computing"},{"issue":"1","key":"1275_CR10","doi-asserted-by":"crossref","first-page":"38","DOI":"10.1006\/cviu.1995.1004","volume":"61","author":"T Cootes","year":"1995","unstructured":"Cootes, T., Taylor, C., Cooper, D., Graham, J., et al. (1995). Active shape models-their training and application. Computer Vision and Image Understanding, 61(1), 38\u201359.","journal-title":"Computer Vision and Image Understanding"},{"key":"1275_CR11","doi-asserted-by":"crossref","unstructured":"Cootes, T. F., Walker, K., & Taylor, C. J. (2000). View-based active appearance models. In IEEE international conference on automatic face and gesture recognition (FG) (pp. 227\u2013232).","DOI":"10.1109\/AFGR.2000.840639"},{"issue":"6","key":"1275_CR12","doi-asserted-by":"crossref","first-page":"681","DOI":"10.1109\/34.927467","volume":"23","author":"TF Cootes","year":"2001","unstructured":"Cootes, T. F., Edwards, G., & Taylor, C. J. (2001). Active appearance models. IEEE Transactions on Pattern Analysis and Machine Intelligence, 23(6), 681\u2013685.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"9","key":"1275_CR13","doi-asserted-by":"crossref","first-page":"657","DOI":"10.1016\/S0262-8856(02)00055-0","volume":"20","author":"TF Cootes","year":"2002","unstructured":"Cootes, T. F., Wheeler, G. V., Walker, K. N., & Taylor, C. J. (2002). View-based active appearance models. Image and Vision Computing, 20(9), 657\u2013664.","journal-title":"Image and Vision Computing"},{"key":"1275_CR14","first-page":"929","volume":"3","author":"D Cristinacce","year":"2006","unstructured":"Cristinacce, D., & Cootes, T. F. (2006). Feature Detection and Tracking with Constrained Local Models. British Mahine Vision Conference (BMVC), 3, 929\u2013938.","journal-title":"British Mahine Vision Conference (BMVC)"},{"issue":"5","key":"1275_CR15","doi-asserted-by":"crossref","first-page":"1271","DOI":"10.1109\/TPAMI.2018.2828424","volume":"41","author":"Z Cui","year":"2019","unstructured":"Cui, Z., Xiao, S., Niu, Z., Yan, S., & Zheng, W. (2019). Recurrent Shape Regression. IEEE Transactions on Pattern Analysis and Machine Intelligence, 41(5), 1271\u20131278.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1275_CR16","doi-asserted-by":"crossref","first-page":"19","DOI":"10.1016\/j.imavis.2015.11.005","volume":"47","author":"J Deng","year":"2016","unstructured":"Deng, J., Liu, Q., Yang, J., & Tao, D. (2016). M3csr: Multi-view, multi-scale and multi-component cascade shape regression. Image and Vision Computing, 47, 19\u201326.","journal-title":"Image and Vision Computing"},{"key":"1275_CR17","unstructured":"Deng, J., Roussos, A., Chrysos, G., Ververas, E., Kotsia, I., Shen, J., & Zafeiriou, S. (2018). The menpo benchmark for multi-pose 2D and 3D facial landmark localisation and tracking. In international journal of computer vision (IJCV) (pp. 1\u201326)."},{"key":"1275_CR18","doi-asserted-by":"crossref","unstructured":"Deng, J., Guo, J., Xue, N., & Zafeiriou, S. (2019a) Arcface: Additive angular margin loss for deep face recognition. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 4690\u20134699).","DOI":"10.1109\/CVPR.2019.00482"},{"issue":"7","key":"1275_CR19","doi-asserted-by":"crossref","first-page":"3636","DOI":"10.1109\/TIP.2019.2899267","volume":"28","author":"J Deng","year":"2019","unstructured":"Deng, J., Trigeorgis, G., Zhou, Y., & Zafeiriou, S. (2019b). Joint multi-view face alignment in the wild. IEEE Transactions on Image Processing, 28(7), 3636\u20133648.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1275_CR20","doi-asserted-by":"crossref","unstructured":"Doll\u00e1r, P., Welinder, P., & Perona, P. (2010). Cascaded pose regression. In IEEE conference on computer vision and pattern recognition (CVPR), IEEE (pp. 1078\u20131085).","DOI":"10.1109\/CVPR.2010.5540094"},{"key":"1275_CR21","doi-asserted-by":"crossref","unstructured":"Dong, X., Yan, Y., Ouyang, W., & Yang, Y. (2018a). Style aggregated network for facial landmark detection. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2018.00047"},{"key":"1275_CR22","doi-asserted-by":"crossref","unstructured":"Dong, X., Yu, S. I., Weng, X., Wei, S.E., Yang, Y., & Sheikh, Y. (2018b). Supervision-by-Registration: An unsupervised approach to improve the precision of facial landmark detectors. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2018.00045"},{"key":"1275_CR23","doi-asserted-by":"crossref","first-page":"105","DOI":"10.1016\/j.csi.2015.06.004","volume":"42","author":"Y Dong","year":"2015","unstructured":"Dong, Y., & Wu, Y. (2015). Adaptive cascade deep convolutional neural networks for face alignment. Computer Standards and Interfaces, 42, 105\u2013112.","journal-title":"Computer Standards and Interfaces"},{"key":"1275_CR24","doi-asserted-by":"crossref","unstructured":"Fabian Benitez-Quiroz, C., Srinivasan, R., & Martinez, A. M. (2016). Emotionet: An accurate, real-time algorithm for the automatic annotation of a million facial expressions in the wild. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2016.600"},{"key":"1275_CR25","doi-asserted-by":"crossref","first-page":"27","DOI":"10.1016\/j.imavis.2015.11.004","volume":"47","author":"H Fan","year":"2016","unstructured":"Fan, H., & Zhou, E. (2016). Approaching human level facial landmark localization by deep learning. Image and Vision Computing, 47, 27\u201335.","journal-title":"Image and Vision Computing"},{"issue":"11","key":"1275_CR26","doi-asserted-by":"crossref","first-page":"3425","DOI":"10.1109\/TIP.2015.2446944","volume":"24","author":"ZH Feng","year":"2015","unstructured":"Feng, Z. H., Hu, G., Kittler, J., Christmas, W., & Wu, X. J. (2015a). Cascaded collaborative regression for robust facial landmark detection trained using a mixture of synthetic and real images with dynamic weighting. IEEE Transactions on Image Processing, 24(11), 3425\u20133440.","journal-title":"IEEE Transactions on Image Processing"},{"issue":"1","key":"1275_CR27","doi-asserted-by":"crossref","first-page":"76","DOI":"10.1109\/LSP.2014.2347011","volume":"22","author":"ZH Feng","year":"2015","unstructured":"Feng, Z. H., Huber, P., Kittler, J., Christmas, W., & Wu, X. (2015b). Random Cascaded-Regression Copse for Robust Facial Landmark Detection. IEEE Signal Processing Letters, 22(1), 76\u201380.","journal-title":"IEEE Signal Processing Letters"},{"key":"1275_CR28","doi-asserted-by":"crossref","unstructured":"Feng, Z. H., Kittler, J., Awais, M., Huber, P., & Wu, X. J. (2017a). Face detection, bounding box aggregation and pose estimation for robust facial landmark localisation in the wild. In IEEE conference on computer vision and pattern recognition workshops (CVPRW) (pp. 160\u2013169).","DOI":"10.1109\/CVPRW.2017.262"},{"key":"1275_CR29","doi-asserted-by":"crossref","unstructured":"Feng, Z. H., Kittler, J., Christmas, W., Huber, P., & Wu, X. J. (2017b). Dynamic attention-controlled cascaded shape regression exploiting training data augmentation and fuzzy-set sample weighting. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 2481\u20132490).","DOI":"10.1109\/CVPR.2017.392"},{"key":"1275_CR30","doi-asserted-by":"crossref","unstructured":"Feng, Z. H., Huber, P., Kittler, J., Hancock, P., Wu, X. J., Zhao, Q., Koppen, P., & R\u00e4tsch, M. (2018a). Evaluation of Dense 3D Reconstruction from 2D Face Images in the Wild. In IEEE conference on automatic face and gesture recognition (FG) (pp. 780\u2013786).","DOI":"10.1109\/FG.2018.00123"},{"key":"1275_CR31","doi-asserted-by":"crossref","unstructured":"Feng, Z. H., Kittler, J., Awais, M., Huber, P., & Wu, X. J. (2018b). Wing loss for robust facial landmark localisation with convolutional neural networks. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 2235\u20132245).","DOI":"10.1109\/CVPR.2018.00238"},{"issue":"3","key":"1275_CR32","doi-asserted-by":"crossref","first-page":"450","DOI":"10.1109\/LSP.2019.2895291","volume":"26","author":"ZH Feng","year":"2019","unstructured":"Feng, Z. H., Kittler, J., & Wu, X. J. (2019). Mining Hard Augmented Samples for Robust Facial Landmark Localisation with CNNs. IEEE Signal Processing Letters, 26(3), 450\u2013454.","journal-title":"IEEE Signal Processing Letters"},{"key":"1275_CR33","doi-asserted-by":"crossref","unstructured":"Gao, X., Su, Y., Li, X., & Tao, D. (2010). A review of active appearance models. IEEE Transactions on Systems, Man, and Cybernetics, Part C (Applications and Reviews), 40(2), 145\u2013158.","DOI":"10.1109\/TSMCC.2009.2035631"},{"key":"1275_CR34","doi-asserted-by":"crossref","unstructured":"Ghiasi, G., & Fowlkes, C. C. (2014). Occlusion coherence: Localizing occluded faces with a hierarchical deformable part model. In IEEE conference on computer vision and pattern recognition","DOI":"10.1109\/CVPR.2014.306"},{"key":"1275_CR35","doi-asserted-by":"crossref","unstructured":"Girshick, R. (2015). Fast R-CNN. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1440\u20131448).","DOI":"10.1109\/ICCV.2015.169"},{"key":"1275_CR36","doi-asserted-by":"crossref","unstructured":"Hara, K., & Chellappa, R. (2014). Growing regression forests by classification: Applications to object pose estimation. In European conference on computer vision, (ECCV) (pp. 552\u2013567). Springer.","DOI":"10.1007\/978-3-319-10605-2_36"},{"key":"1275_CR37","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 770\u2013778).","DOI":"10.1109\/CVPR.2016.90"},{"key":"1275_CR38","unstructured":"Howard, A. G., Zhu, M., Chen, B., Kalenichenko, D., Wang, W., Weyand, T., Andreetto, M., & Adam, H. (2017). Mobilenets: Efficient convolutional neural networks for mobile vision applications. arXiv preprint arXiv:1704.04861"},{"key":"1275_CR39","unstructured":"Huang, Z., Zhou, E., & Cao, Z. (2015). Coarse-to-fine face alignment with multi-scale local patch regression. arXiv preprint arXiv:1511.04901"},{"issue":"1","key":"1275_CR40","doi-asserted-by":"crossref","first-page":"73","DOI":"10.1214\/aoms\/1177703732","volume":"35","author":"PJ Huber","year":"1964","unstructured":"Huber, P. J., et al. (1964). Robust estimation of a location parameter. The Annals of Mathematical Statistics, 35(1), 73\u2013101.","journal-title":"The Annals of Mathematical Statistics"},{"key":"1275_CR41","doi-asserted-by":"crossref","unstructured":"Jourabloo, A., & Liu, X. (2016). Large-pose face alignment via CNN-based dense 3D model fitting. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2016.454"},{"issue":"2","key":"1275_CR42","doi-asserted-by":"crossref","first-page":"187","DOI":"10.1007\/s11263-017-1012-z","volume":"124","author":"A Jourabloo","year":"2017","unstructured":"Jourabloo, A., & Liu, X. (2017). Pose-invariant face alignment via CNN-based dense 3D model fitting. International Journal of Computer Vision (IJCV), 124(2), 187\u2013203.","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"1275_CR43","doi-asserted-by":"crossref","unstructured":"Jourabloo, A., Ye, M., Liu, X., & Ren, L. (2017). Pose-invariant face alignment with a single cnn. In IEEE international conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2017.347"},{"key":"1275_CR44","doi-asserted-by":"crossref","unstructured":"Kazemi, V., & Sullivan, J. (2014). One millisecond face alignment with an ensemble of regression trees. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1867\u20131874).","DOI":"10.1109\/CVPR.2014.241"},{"key":"1275_CR45","unstructured":"Kingma, D. P., & Ba, J. (2014). Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980"},{"key":"1275_CR46","doi-asserted-by":"crossref","unstructured":"Kittler, J., Huber, P., Feng, Z. .H, Hu, G., & Christmas, W. (2016). 3D morphable face models and their applications. In International conference on articulated motion and deformable objects (pp. 185\u2013206). Springer.","DOI":"10.1007\/978-3-319-41778-3_19"},{"key":"1275_CR47","doi-asserted-by":"crossref","unstructured":"Koestinger, M., Wohlhart, P., Roth, P. M., & Bischof, H. (2011). Annotated facial landmarks in the wild: A large-scale, real-world database for facial landmark localization. In First IEEE international workshop on benchmarking Facial image analysis technologies.","DOI":"10.1109\/ICCVW.2011.6130513"},{"key":"1275_CR48","doi-asserted-by":"crossref","first-page":"617","DOI":"10.1016\/j.patcog.2017.09.006","volume":"74","author":"P Koppen","year":"2018","unstructured":"Koppen, P., Feng, Z. H., Kittler, J., Awais, M., Christmas, W., Wu, X. J., et al. (2018). Gaussian Mixture 3D Morphable Face Model. Pattern Recognition, 74, 617\u2013628.","journal-title":"Pattern Recognition"},{"key":"1275_CR49","doi-asserted-by":"crossref","unstructured":"Le, V., Brandt, J., Lin, Z., Bourdev, L., & Huang, T. S. (2012). Interactive facial feature localization. In European conference on computer vision (ECCV) (pp. 679\u2013692). Springer.","DOI":"10.1007\/978-3-642-33712-3_49"},{"key":"1275_CR50","doi-asserted-by":"crossref","unstructured":"Li, S., Deng, W., & Du, J. (2017). Reliable crowdsourcing and deep locality-preserving learning for expression recognition in the wild. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2017.277"},{"key":"1275_CR51","unstructured":"Liang, Z., Ding, S., & Lin, L. (2015). Unconstrained facial landmark localization with backbone-branches fully-convolutional networks. arXiv preprint arXiv:1507.03409"},{"key":"1275_CR52","doi-asserted-by":"crossref","unstructured":"Liu, W., Wen, Y., Yu, Z., Li, M., Raj, B., & Song, L. (2017a). Sphereface: Deep hypersphere embedding for face recognition. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2017.713"},{"key":"1275_CR53","doi-asserted-by":"crossref","unstructured":"Liu, Y., Jourabloo, A., Ren, W., & Liu, X. (2017b). Dense face alignment. In IEEE international conference on computer vision workshops (ICCVW).","DOI":"10.1109\/ICCVW.2017.190"},{"key":"1275_CR54","doi-asserted-by":"crossref","unstructured":"Liu, Z., Luo, P., Wang, X., & Tang, X. (2015) Deep learning face attributes in the wild. In IEEE international conference on computer vision (ICCV) (pp. 3730\u20133738).","DOI":"10.1109\/ICCV.2015.425"},{"key":"1275_CR55","doi-asserted-by":"crossref","unstructured":"Liu, Z., Zhu, X., Hu, G., Guo, H., Tang, M., Lei, Z., Robertson, N. M., & Wang, J. (2019). Semantic alignment: Finding semantically consistent ground-truth for facial landmark detection. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 3467\u20133476).","DOI":"10.1109\/CVPR.2019.00358"},{"key":"1275_CR56","unstructured":"Luo, P., Wang, X., & Tang, X. (2012). Hierarchical face parsing via deep learning. In 2012 IEEE conference on computer vision and pattern recognition (CVPR), IEEE (pp. 2480\u20132487)."},{"key":"1275_CR57","doi-asserted-by":"crossref","unstructured":"Lv, J., Shao, X., Xing, J., Cheng, C., & Zhou, X. (2017) A deep regression architecture with two-stage re-initialization for high performance facial landmark detection. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2017.393"},{"key":"1275_CR58","doi-asserted-by":"crossref","first-page":"36","DOI":"10.1016\/j.imavis.2015.09.003","volume":"47","author":"B Martinez","year":"2016","unstructured":"Martinez, B., & Valstar, M. F. (2016). L2, 1-based regression and prediction accumulation across views for robust facial landmark detection. Image and Vision Computing, 47, 36\u201344.","journal-title":"Image and Vision Computing"},{"key":"1275_CR59","doi-asserted-by":"crossref","unstructured":"Masi, I., Rawls, S., Medioni, G., & Natarajan, P. (2016a). Pose-aware face recognition in the wild. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2016.523"},{"key":"1275_CR60","doi-asserted-by":"crossref","unstructured":"Masi, I., Tran, A. T., Hassner, T., Leksut, J. T., & Medioni, G. (2016b). Do we really need to collect millions of faces for effective face recognition? In European conference on computer vision (ECCV) (pp. 579\u2013596).","DOI":"10.1007\/978-3-319-46454-1_35"},{"key":"1275_CR61","first-page":"965","volume":"964","author":"K Messer","year":"1999","unstructured":"Messer, K., Matas, J., Kittler, J., Luettin, J., & Maitre, G. (1999). XM2VTSDB: The extended M2VTS database. International Conference on Audio and Video-based Biometric Person Authentication, Citeseer, 964, 965\u2013966.","journal-title":"International Conference on Audio and Video-based Biometric Person Authentication, Citeseer"},{"key":"1275_CR62","doi-asserted-by":"crossref","unstructured":"Newell, A., Yang, K., & Deng, J. (2016). Stacked hourglass networks for human pose estimation. In European conference on computer vision (ECCV) (pp. 483\u2013499).","DOI":"10.1007\/978-3-319-46484-8_29"},{"key":"1275_CR63","doi-asserted-by":"crossref","unstructured":"Parkhi, O. M., Vedaldi, A., & Zisserman, A. (2015) Deep face recognition. In British machine vision conference.","DOI":"10.5244\/C.29.41"},{"key":"1275_CR64","doi-asserted-by":"crossref","unstructured":"Phillips, P. J., Flynn, P. J., Scruggs, T., Bowyer, K. W., Chang, J., Hoffman, K., Marques, J., Min, J., & Worek, W. (2005). Overview of the face recognition grand challenge. In 2005 IEEE computer society conference on computer vision and pattern recognition (CVPR\u201905), IEEE (Vol.\u00a01, pp. 947\u2013954).","DOI":"10.1109\/CVPR.2005.268"},{"key":"1275_CR65","unstructured":"Ranjan, R., Patel, V. M., & Chellappa, R. (2017). Hyperface: A deep multi-task learning framework for face detection, landmark localization, pose estimation, and gender recognition. In IEEE transactions on pattern analysis and machine, intelligence."},{"key":"1275_CR66","doi-asserted-by":"crossref","unstructured":"Rashid, M., Gu, X., & Jae\u00a0Lee, Y. (2017). Interspecies knowledge transfer for facial keypoint detection. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2017.174"},{"issue":"3","key":"1275_CR67","doi-asserted-by":"crossref","first-page":"1233","DOI":"10.1109\/TIP.2016.2518867","volume":"25","author":"S Ren","year":"2016","unstructured":"Ren, S., Cao, X., Wei, Y., & Sun, J. (2016). Face alignment via regressing local binary features. IEEE Transactions on Image Processing, 25(3), 1233\u20131245.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1275_CR68","first-page":"483","volume":"99","author":"S Romdhani","year":"1999","unstructured":"Romdhani, S., Gong, S., Psarrou, A., et al. (1999). A multi-view nonlinear active shape model using kernel PCA. British Machine Vision Conference (BMVC), 99, 483\u2013492.","journal-title":"British Machine Vision Conference (BMVC)"},{"key":"1275_CR69","doi-asserted-by":"crossref","unstructured":"Roth, J., Tong, Y., & Liu, X. (2016) Adaptive 3D face reconstruction from unconstrained photo collections. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2016.455"},{"key":"1275_CR70","doi-asserted-by":"crossref","unstructured":"Sagonas, C., Tzimiropoulos, G., Zafeiriou, S., & Pantic, M. (2013). A semi-automatic methodology for facial landmark annotation. In IEEE conference on computer vision and pattern recognition workshops (CVPRW) (pp. 896\u2013903).","DOI":"10.1109\/CVPRW.2013.132"},{"key":"1275_CR71","doi-asserted-by":"crossref","first-page":"3","DOI":"10.1016\/j.imavis.2016.01.002","volume":"47","author":"C Sagonas","year":"2016","unstructured":"Sagonas, C., Antonakos, E., Tzimiropoulos, G., Zafeiriou, S., & Pantic, M. (2016). 300 faces in-the-wild challenge: Database and results. Image and Vision Computing, 47, 3\u201318.","journal-title":"Image and Vision Computing"},{"key":"1275_CR72","doi-asserted-by":"crossref","unstructured":"Sandler, M., Howard, A., Zhu, M., Zhmoginov, A., & Chen, L. C. (2018). MobileNetV2: Inverted residuals and linear bottlenecks. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 4510\u20134520).","DOI":"10.1109\/CVPR.2018.00474"},{"key":"1275_CR73","doi-asserted-by":"crossref","unstructured":"Shrivastava, A., Gupta, A., & Girshick, R. (2016). Training region-based object detectors with online hard example mining. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 761\u2013769).","DOI":"10.1109\/CVPR.2016.89"},{"key":"1275_CR74","unstructured":"Simonyan, K., & Zisserman, A. (2014). Very deep convolutional networks for large-scale image recognition. CoRR. abs\/1409.1556."},{"key":"1275_CR75","doi-asserted-by":"crossref","unstructured":"Sun, X., Wei, Y., Liang, S., Tang, X., & Sun, J. (2015). Cascaded hand pose regression. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 824\u2013832).","DOI":"10.1109\/CVPR.2015.7298683"},{"key":"1275_CR76","doi-asserted-by":"crossref","unstructured":"Sun, Y., Wang, X., & Tang, X. (2013) Deep convolutional network cascade for facial point detection. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 3476\u20133483).","DOI":"10.1109\/CVPR.2013.446"},{"key":"1275_CR77","doi-asserted-by":"crossref","unstructured":"Taigman, Y., Yang, M., Ranzato, M., & Wolf, L. (2014). Deepface: Closing the gap to human-level performance in face verification. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1701\u20131708).","DOI":"10.1109\/CVPR.2014.220"},{"key":"1275_CR78","doi-asserted-by":"crossref","unstructured":"Trigeorgis, G., Snape, P., Nicolaou, M. A., Antonakos, E., & Zafeiriou, S. (2016). Mnemonic descent method: A recurrent process applied for end-to-end face alignment. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2016.453"},{"key":"1275_CR79","doi-asserted-by":"crossref","first-page":"45","DOI":"10.1016\/j.imavis.2016.02.004","volume":"47","author":"M U\u0159i\u010d\u00e1\u0159","year":"2016","unstructured":"U\u0159i\u010d\u00e1\u0159, M., Franc, V., Thomas, D., Sugimoto, A., & Hlav\u00e1\u010d, V. (2016). Multi-view facial landmark detector learned by the structured output svm. Image and Vision Computing, 47, 45\u201359.","journal-title":"Image and Vision Computing"},{"key":"1275_CR80","doi-asserted-by":"crossref","unstructured":"Walecki, R., Rudovic, O., Pavlovic, V., & Pantic, M. (2016) Copula ordinal regression for joint estimation of facial action unit intensity. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2016.530"},{"key":"1275_CR81","doi-asserted-by":"crossref","first-page":"50","DOI":"10.1016\/j.neucom.2017.05.013","volume":"275","author":"N Wang","year":"2018","unstructured":"Wang, N., Gao, X., Tao, D., Yang, H., & Li, X. (2018). Facial feature point detection: A comprehensive survey. Neurocomputing, 275, 50\u201365.","journal-title":"Neurocomputing"},{"issue":"10","key":"1275_CR82","doi-asserted-by":"crossref","first-page":"2066","DOI":"10.1109\/TMM.2016.2591508","volume":"18","author":"R Weng","year":"2016","unstructured":"Weng, R., Lu, J., Tan, Y. P., & Zhou, J. (2016). Learning cascaded deep auto-encoder networks for face alignment. IEEE Transactions on Multimedia, 18(10), 2066\u20132078.","journal-title":"IEEE Transactions on Multimedia"},{"key":"1275_CR83","doi-asserted-by":"crossref","unstructured":"Wu, W., & Yang, S. (2017). Leveraging intra and inter-dataset variations for robust face alignment. In Proceedings of the IEEE conference on computer vision and pattern recognition workshops (pp. 150\u2013159).","DOI":"10.1109\/CVPRW.2017.261"},{"key":"1275_CR84","doi-asserted-by":"crossref","unstructured":"Wu, W., Qian, C., Yang, S., Wang, Q., Cai, Y., & Zhou, Q. (2018a). Look at boundary: A boundary-aware face alignment algorithm. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 2129\u20132138).","DOI":"10.1109\/CVPR.2018.00227"},{"issue":"2","key":"1275_CR85","doi-asserted-by":"crossref","first-page":"115","DOI":"10.1007\/s11263-018-1097-z","volume":"127","author":"Y Wu","year":"2019","unstructured":"Wu, Y., & Ji, Q. (2019). Facial landmark detection: A literature survey. International Journal of Computer Vision, 127(2), 115\u2013142.","journal-title":"International Journal of Computer Vision"},{"key":"1275_CR86","doi-asserted-by":"crossref","unstructured":"Wu, Y., Gou, C., & Ji, Q. (2017a). Simultaneous facial landmark detection, pose and deformation estimation under facial occlusion. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 3471\u20133480).","DOI":"10.1109\/CVPR.2017.606"},{"key":"1275_CR87","doi-asserted-by":"crossref","unstructured":"Wu, Y., Hassner, T., Kim, K., Medioni, G., & Natarajan, P. (2017b). Facial landmark detection with tweaked convolutional neural networks. In IEEE transactions on pattern analysis and machine, intelligence.","DOI":"10.1109\/TPAMI.2017.2787130"},{"key":"1275_CR88","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/j.imavis.2017.12.002","volume":"73","author":"Y Wu","year":"2018","unstructured":"Wu, Y., Shah, S. K., & Kakadiaris, I. A. (2018b). GoDP: Globally Optimized Dual Pathway deep network architecture for facial landmark localization in-the-wild. Image and Vision Computing, 73, 1\u201316.","journal-title":"Image and Vision Computing"},{"key":"1275_CR89","doi-asserted-by":"crossref","unstructured":"Xiao, S., Feng, J., Xing, J., Lai, H., Yan, S., & Kassim, A. (2016). Robust facial landmark detection via recurrent attentive-refinement networks. In European conference on computer vision (ECCV) (pp. 57\u201372).","DOI":"10.1007\/978-3-319-46448-0_4"},{"key":"1275_CR90","doi-asserted-by":"crossref","unstructured":"Xiao, S., Feng, J., Liu, L., Nie, X., Wang, W., Yan, S., & Kassim, A. (2017). Recurrent 3D\u20132D dual learning for large-pose facial landmark detection. In The IEEE international conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2017.181"},{"issue":"4","key":"1275_CR91","doi-asserted-by":"crossref","first-page":"987","DOI":"10.1109\/TPAMI.2017.2697958","volume":"40","author":"J Xing","year":"2018","unstructured":"Xing, J., Niu, Z., Huang, J., Hu, W., Zhou, X., & Yan, S. (2018). Towards robust and accurate multi-view and partially-occluded face alignment. IEEE transactions on pattern analysis and machine intelligence, 40(4), 987\u20131001.","journal-title":"IEEE transactions on pattern analysis and machine intelligence"},{"key":"1275_CR92","doi-asserted-by":"crossref","unstructured":"Xiong, X., & De la Torre, F. (2013). Supervised descent method and its applications to face alignment. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 532\u2013539).","DOI":"10.1109\/CVPR.2013.75"},{"key":"1275_CR93","doi-asserted-by":"crossref","unstructured":"Xiong, X., & De\u00a0la Torre, F. (2015). Global supervised descent method. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 2664\u20132673).","DOI":"10.1109\/CVPR.2015.7298882"},{"key":"1275_CR94","doi-asserted-by":"crossref","unstructured":"Xu, X., & Kakadiaris, I. A. (2017). Joint head pose estimation and face alignment framework using global and local cnn features. In IEEE international conference on automatic face gesture recognition (FG) (pp. 642\u2013649).","DOI":"10.1109\/FG.2017.81"},{"key":"1275_CR95","doi-asserted-by":"crossref","unstructured":"Yang, J., Liu, Q., & Zhang, K. (2017a). Stacked hourglass network for robust facial landmark localisation. In IEEE conference on computer vision and pattern recognition workshops (CVPRW) (pp. 2025\u20132033).","DOI":"10.1109\/CVPRW.2017.253"},{"key":"1275_CR96","doi-asserted-by":"crossref","unstructured":"Yang, J., Ren, P., Zhang, D., Chen, D., Wen, F., Li, H., & Hua, G. (2017b). Neural aggregation network for video face recognition. In IEEE conference on computer vision and pattern recognition (CVPR)","DOI":"10.1109\/CVPR.2017.554"},{"key":"1275_CR97","doi-asserted-by":"crossref","unstructured":"Yu, X., Zhou, F., & Chandraker, M. (2016). Deep deformation network for object landmark localization. In European conference on computer vision (ECCV) (pp. 52\u201370).","DOI":"10.1007\/978-3-319-46454-1_4"},{"key":"1275_CR98","unstructured":"Zeiler, M. D. (2012). Adadelta: An adaptive learning rate method. arXiv preprint arXiv:1212.5701"},{"issue":"5","key":"1275_CR99","doi-asserted-by":"crossref","first-page":"2096","DOI":"10.1109\/TIP.2017.2784571","volume":"27","author":"J Zeng","year":"2018","unstructured":"Zeng, J., Liu, S., Li, X., Mahdi, D. A., Wu, F., & Wang, G. (2018). Deep context-sensitive facial landmark detection with tree-structured modeling. IEEE Transactions on Image Processing, 27(5), 2096\u20132107.","journal-title":"IEEE Transactions on Image Processing"},{"issue":"1","key":"1275_CR100","doi-asserted-by":"crossref","first-page":"39","DOI":"10.1109\/TPAMI.2008.52","volume":"31","author":"Z Zeng","year":"2009","unstructured":"Zeng, Z., Pantic, M., Roisman, G. I., & Huang, T. S. (2009). A survey of affect recognition methods: Audio, visual, and spontaneous expressions. IEEE Transactions on Pattern Analysis and Machine Intelligence, 31(1), 39\u201358.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1275_CR101","first-page":"1","volume":"8690","author":"J Zhang","year":"2014","unstructured":"Zhang, J., Shan, S., Kan, M., & Chen, X. (2014). Coarse-to-Fine Auto-Encoder Networks (CFAN) for Real-Time Face Alignment. European Conference on Computer Vision (ECCV), 8690, 1\u201316.","journal-title":"European Conference on Computer Vision (ECCV)"},{"key":"1275_CR102","doi-asserted-by":"crossref","unstructured":"Zhang, J., Kan, M., Shan, S., & Chen, X. (2016a). Occlusion-free face alignment: Deep regression networks coupled with de-corrupt autoencoders. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2016.373"},{"issue":"10","key":"1275_CR103","doi-asserted-by":"crossref","first-page":"1499","DOI":"10.1109\/LSP.2016.2603342","volume":"23","author":"K Zhang","year":"2016","unstructured":"Zhang, K., Zhang, Z., Li, Z., & Qiao, Y. (2016b). Joint face detection and alignment using multitask cascaded convolutional networks. IEEE Signal Processing Letters, 23(10), 1499\u20131503.","journal-title":"IEEE Signal Processing Letters"},{"key":"1275_CR104","doi-asserted-by":"crossref","unstructured":"Zhu, M., Shi, D., Zheng, M., & Sadiq, M. (2019). Robust facial landmark detection via occlusion-adaptive deep networks. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 3486\u20133496).","DOI":"10.1109\/CVPR.2019.00360"},{"key":"1275_CR105","unstructured":"Zhu, S., Li, C., Change\u00a0Loy, C., & Tang, X. (2015). Face alignment by coarse-to-fine shape searching. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 4998\u20135006)."},{"key":"1275_CR106","doi-asserted-by":"crossref","unstructured":"Zhu, S., Li, C., Loy, C. C., & Tang, X. (2016a). Unconstrained face alignment via cascaded compositional learning. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 3409\u20133417).","DOI":"10.1109\/CVPR.2016.371"},{"key":"1275_CR107","unstructured":"Zhu, X., & Ramanan, D. (2012). Face detection, pose estimation, and landmark localization in the wild. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 2879\u20132886)."},{"key":"1275_CR108","doi-asserted-by":"crossref","unstructured":"Zhu, X., Lei, Z., Liu, X., Shi, H., & Li, S. Z. (2016b). Face alignment across large poses: A 3D solution. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 146\u2013155).","DOI":"10.1109\/CVPR.2016.23"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-019-01275-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-019-01275-0\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-019-01275-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,12,16]],"date-time":"2020-12-16T00:17:28Z","timestamp":1608077848000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-019-01275-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,12,17]]},"references-count":108,"journal-issue":{"issue":"8-9","published-print":{"date-parts":[[2020,9]]}},"alternative-id":["1275"],"URL":"https:\/\/doi.org\/10.1007\/s11263-019-01275-0","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019,12,17]]},"assertion":[{"value":"20 April 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 December 2019","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 December 2019","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}