{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T11:47:36Z","timestamp":1785930456974,"version":"3.56.0"},"reference-count":61,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,5,27]],"date-time":"2026-05-27T00:00:00Z","timestamp":1779840000000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100011033","name":"Agencia Estatal de Investigaci\u00f3n","doi-asserted-by":"publisher","award":["PID2022-137581OB-I00"],"award-info":[{"award-number":["PID2022-137581OB-I00"]}],"id":[{"id":"10.13039\/501100011033","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100011033","name":"Agencia Estatal de Investigaci\u00f3n","doi-asserted-by":"publisher","award":["MCIN\/AEI\/10.13039\/501100011033\/FEDER"],"award-info":[{"award-number":["MCIN\/AEI\/10.13039\/501100011033\/FEDER"]}],"id":[{"id":"10.13039\/501100011033","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100011033","name":"Agencia Estatal de Investigaci\u00f3n","doi-asserted-by":"publisher","award":["PID2020-113118RB-C31"],"award-info":[{"award-number":["PID2020-113118RB-C31"]}],"id":[{"id":"10.13039\/501100011033","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100011033","name":"Agencia Estatal de Investigaci\u00f3n","doi-asserted-by":"publisher","award":["MICINN\/AEI\/10.13039\/501100011033"],"award-info":[{"award-number":["MICINN\/AEI\/10.13039\/501100011033"]}],"id":[{"id":"10.13039\/501100011033","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003359","name":"Comunitat Valenciana","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100003359","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100000780","name":"European Commission","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100000780","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004837","name":"Ministerio de Ciencia e Innovaci\u00f3n","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004837","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100008530","name":"ERDF","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100008530","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100012818","name":"Comunidad de Madrid","doi-asserted-by":"publisher","award":["CM\/JIN\/2021-015"],"award-info":[{"award-number":["CM\/JIN\/2021-015"]}],"id":[{"id":"10.13039\/100012818","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100012818","name":"Comunidad de Madrid","doi-asserted-by":"publisher","award":["PEJ-2019-AI\/TIC-15032"],"award-info":[{"award-number":["PEJ-2019-AI\/TIC-15032"]}],"id":[{"id":"10.13039\/100012818","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100006302","name":"Universidad de Alcal\u00e1","doi-asserted-by":"publisher","award":["PIUAH22\/IA-037"],"award-info":[{"award-number":["PIUAH22\/IA-037"]}],"id":[{"id":"10.13039\/501100006302","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100006302","name":"Universidad de Alcal\u00e1","doi-asserted-by":"publisher","award":["PIUAH21\/IA-016"],"award-info":[{"award-number":["PIUAH21\/IA-016"]}],"id":[{"id":"10.13039\/501100006302","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Journal of Visual Communication and Image Representation"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1016\/j.jvcir.2026.104842","type":"journal-article","created":{"date-parts":[[2026,5,26]],"date-time":"2026-05-26T23:42:26Z","timestamp":1779838946000},"page":"104842","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Landmark-assisted face and mouth 3D localization in smart spaces with a monocular camera"],"prefix":"10.1016","volume":"118","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6946-0326","authenticated-orcid":false,"given":"Frank","family":"Sanabria-Macias","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Andr\u00e9s","family":"Prados-Torreblanca","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7723-2262","authenticated-orcid":false,"given":"Marta","family":"Marron-Romera","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3303-3963","authenticated-orcid":false,"given":"Javier","family":"Macias-Guarasa","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4308-9653","authenticated-orcid":false,"given":"Jos\u00e9 M.","family":"Buenaposada","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6910-4359","authenticated-orcid":false,"given":"Luis","family":"Baumela","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2311-441X","authenticated-orcid":false,"given":"Sira E.","family":"Palazuelos-Cagigas","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.jvcir.2026.104842_b1","series-title":"Acoustics, Speech and Signal Processing (ICASSP), 2013 IEEE International Conference on","first-page":"3627","article-title":"Audio constrained particle filter based visual tracking","author":"Kilic","year":"2013"},{"issue":"12","key":"10.1016\/j.jvcir.2026.104842_b2","doi-asserted-by":"crossref","first-page":"2417","DOI":"10.1109\/TMM.2016.2599150","article-title":"Mean-shift and sparse sampling-based SMC-PHD filtering for audio informed visual speaker tracking","volume":"18","author":"Kilic","year":"2016","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.jvcir.2026.104842_b3","article-title":"Audio-visual speaker diarization based on spatiotemporal Bayesian fusion","author":"Gebru","year":"2017","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.jvcir.2026.104842_b4","doi-asserted-by":"crossref","unstructured":"Y. Ban, L. Girin, X. Alameda-Pineda, R. Horaud, Exploiting the Complementarity of Audio and Visual Data in Multi-Speaker Tracking, in: ICCV Workshop on Computer Vision for Audio-Visual Media, 2017, pp. 88\u201393.","DOI":"10.1109\/ICCVW.2017.60"},{"key":"10.1016\/j.jvcir.2026.104842_b5","series-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"4280","article-title":"Multi-target doa estimation with an audio-visual fusion mechanism","author":"Qian","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104842_b6","series-title":"Audio visual speaker localization from EgoCentric views","author":"Zhao","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104842_b7","first-page":"1","article-title":"Labelled non-zero diffusion particle flow SMC-PHD filtering for multi-speaker tracking","author":"Liu","year":"2023","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.jvcir.2026.104842_b8","doi-asserted-by":"crossref","first-page":"137","DOI":"10.1016\/j.sigpro.2016.04.014","article-title":"Robust indoor speaker recognition in a network of audio and video sensors","volume":"129","author":"D\u2019Arca","year":"2016","journal-title":"Signal Process."},{"key":"10.1016\/j.jvcir.2026.104842_b9","series-title":"2016 13th IEEE International Conference on Advanced Video and Signal Based Surveillance","first-page":"131","article-title":"Prioritized target tracking with active collaborative cameras","author":"Wang","year":"2016"},{"issue":"7","key":"10.1016\/j.jvcir.2026.104842_b10","doi-asserted-by":"crossref","DOI":"10.1002\/aisy.202370028","article-title":"Persistent human\u2013machine interfaces for robotic arm control via gaze and eye direction tracking","volume":"5","author":"Ban","year":"2023","journal-title":"Adv. Intell. Syst."},{"key":"10.1016\/j.jvcir.2026.104842_b11","series-title":"Information Fusion (FUSION), 2013 16th International Conference on","first-page":"1222","article-title":"Audio-visual face detection for tracking in a meeting room environment","author":"Barnard","year":"2013"},{"issue":"3","key":"10.1016\/j.jvcir.2026.104842_b12","doi-asserted-by":"crossref","first-page":"864","DOI":"10.1109\/TMM.2014.2301977","article-title":"Robust multi-speaker tracking via dictionary learning and identity modeling","volume":"16","author":"Barnard","year":"2014","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.jvcir.2026.104842_b13","first-page":"5616","article-title":"Face tracking with a probabilistic viola and jones face detector","volume":"vol. 1","author":"Sanabria-Mac\u00edas","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104842_b14","doi-asserted-by":"crossref","unstructured":"F. Sanabria-Mac\u00edas, M. Marron-Romera, J. Macias-Guarasa, 3D Audiovisual Speaker Tracking with Distributed Sensors Configuration, in: 28th European Signal Processing Conference, EUSIPCO 2020, 2021.","DOI":"10.23919\/Eusipco47968.2020.9287677"},{"issue":"15","key":"10.1016\/j.jvcir.2026.104842_b15","doi-asserted-by":"crossref","DOI":"10.3390\/s23156969","article-title":"Audiovisual tracking of multiple speakers in smart spaces","volume":"23","author":"Sanabria-Mac\u00edas","year":"2023","journal-title":"Sensors"},{"key":"10.1016\/j.jvcir.2026.104842_b16","series-title":"Acoustics, Speech and Signal Processing (ICASSP), 2017 IEEE International Conference on","first-page":"2896","article-title":"3D audio-visual speaker tracking with an adaptive particle filter","author":"Qian","year":"2017"},{"key":"10.1016\/j.jvcir.2026.104842_b17","series-title":"2018 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"3071","article-title":"3D mouth tracking from a compact microphone array co-located with a camera","author":"Qian","year":"2018"},{"key":"10.1016\/j.jvcir.2026.104842_b18","doi-asserted-by":"crossref","DOI":"10.1109\/TMM.2019.2902489","article-title":"Multi-speaker tracking from an audio-visual sensing device","author":"Qian","year":"2019","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.jvcir.2026.104842_b19","doi-asserted-by":"crossref","first-page":"942","DOI":"10.1109\/TMM.2021.3061800","article-title":"Audio-visual tracking of concurrent speakers","volume":"24","author":"Qian","year":"2022","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.jvcir.2026.104842_b20","doi-asserted-by":"crossref","first-page":"1405","DOI":"10.1109\/LSP.2021.3092959","article-title":"Three-dimensional speaker localization: Audio-refined visual scaling factor estimation","volume":"28","author":"Qian","year":"2021","journal-title":"IEEE Signal Process. Lett."},{"key":"10.1016\/j.jvcir.2026.104842_b21","series-title":"2021 IEEE Statistical Signal Processing Workshop","first-page":"321","article-title":"Multi-speaker tracking by fusing audio and video information","author":"Xiong","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104842_b22","doi-asserted-by":"crossref","first-page":"3704","DOI":"10.21437\/Interspeech.2022-10190","article-title":"Audio visual multi-speaker tracking with improved GCF and PMBM filter","author":"Zhao","year":"2022","journal-title":"Proc. Interspeech 2022"},{"key":"10.1016\/j.jvcir.2026.104842_b23","doi-asserted-by":"crossref","unstructured":"J. Deng, J. Guo, E. Ververas, I. Kotsia, S. Zafeiriou, Retinaface: Single-shot multi-level face localisation in the wild, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 5203\u20135212.","DOI":"10.1109\/CVPR42600.2020.00525"},{"issue":"8","key":"10.1016\/j.jvcir.2026.104842_b24","doi-asserted-by":"crossref","first-page":"2874","DOI":"10.1109\/TPAMI.2020.3046323","article-title":"Multi-task head pose estimation in-the-wild","volume":"43","author":"Valle","year":"2021","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.jvcir.2026.104842_b25","doi-asserted-by":"crossref","unstructured":"V. Albiero, X. Chen, X. Yin, G. Pang, T. Hassner, img2pose: Face Alignment and Detection via 6DoF, Face Pose Estimation, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 7617\u20137627.","DOI":"10.1109\/CVPR46437.2021.00753"},{"key":"10.1016\/j.jvcir.2026.104842_b26","unstructured":"P. Viola, M. Jones, Rapid Object Detection using a Boosted Cascade of Simple Features, in: Proc. IEEE CVPR 2001, 2001."},{"key":"10.1016\/j.jvcir.2026.104842_b27","series-title":"A lightened CNN for deep face representation, CoRR abs\/1511.02683","author":"Wu","year":"2015"},{"key":"10.1016\/j.jvcir.2026.104842_b28","doi-asserted-by":"crossref","unstructured":"P. Hu, D. Ramanan, Finding tiny faces, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2017, pp. 951\u2013959.","DOI":"10.1109\/CVPR.2017.166"},{"key":"10.1016\/j.jvcir.2026.104842_b29","series-title":"CVPRW","first-page":"2074","article-title":"Fine-grained head pose estimation without keypoints","author":"Ruiz","year":"2018"},{"key":"10.1016\/j.jvcir.2026.104842_b30","unstructured":"A. Prados-Torreblanca, J.M. Buenaposada, L. Baumela, Shape Preserving Facial Landmarks with Graph Attention Networks, in: Proceedings of the 33rd British Machine Vision Conference Proceedings, BMVC 2022, 2022."},{"key":"10.1016\/j.jvcir.2026.104842_b31","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110263","article-title":"On the representation and methodology for wide and short range head pose estimation","volume":"149","author":"Cobo","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.jvcir.2026.104842_b32","series-title":"2018 IEEE Winter Conference on Applications of Computer Vision","first-page":"2028","article-title":"Fusion of keypoint tracking and facial landmark detection for real-time head pose estimation","author":"D\u00edaz-Barros","year":"2018"},{"key":"10.1016\/j.jvcir.2026.104842_b33","series-title":"International Joint Conference on Computer Vision, Imaging and Computer Graphics","first-page":"326","article-title":"Real-time head pose estimation by tracking and detection of keypoints and facial landmarks","author":"D\u00edaz-Barros","year":"2018"},{"issue":"5","key":"10.1016\/j.jvcir.2026.104842_b34","doi-asserted-by":"crossref","first-page":"1841","DOI":"10.3390\/s21051841","article-title":"Head pose estimation through keypoints matching between reconstructed 3D face model and 2D image","volume":"21","author":"Liu","year":"2021","journal-title":"Sensors"},{"issue":"4","key":"10.1016\/j.jvcir.2026.104842_b35","doi-asserted-by":"crossref","first-page":"2014","DOI":"10.1109\/TITS.2015.2396031","article-title":"Driver gaze tracking and eyes off the road detection system","volume":"16","author":"Vicente","year":"2015","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"issue":"12","key":"10.1016\/j.jvcir.2026.104842_b36","doi-asserted-by":"crossref","first-page":"2444","DOI":"10.1109\/TPAMI.2016.2522441","article-title":"Joint head pose\/soft label estimation for human recognition in-the-wild","volume":"38","author":"Proenca","year":"2016","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.jvcir.2026.104842_b37","series-title":"Real-time facial surface geometry from monocular video on mobile GPUs","author":"Kartynnik","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104842_b38","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2022.117368","article-title":"An efficient multitask neural network for face alignment, head pose estimation and face tracking","volume":"205","author":"Xia","year":"2022","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.jvcir.2026.104842_b39","doi-asserted-by":"crossref","unstructured":"T.-Y. Yang, Y.-T. Chen, Y.-Y. Lin, Y.-Y. Chuang, Fsa-net: Learning fine-grained structure aggregation for head pose estimation from a single image, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2019, pp. 1087\u20131096.","DOI":"10.1109\/CVPR.2019.00118"},{"key":"10.1016\/j.jvcir.2026.104842_b40","first-page":"12789","article-title":"FDN: Feature decoupling network for head pose estimation","volume":"vol. 34\u201307","author":"Zhang","year":"2020"},{"key":"10.1016\/j.jvcir.2026.104842_b41","doi-asserted-by":"crossref","DOI":"10.1016\/j.imavis.2019.11.005","article-title":"Improving head pose estimation using two-stage ensembles with top-k regression","volume":"93","author":"Huang","year":"2020","journal-title":"Image Vis. Comput."},{"key":"10.1016\/j.jvcir.2026.104842_b42","doi-asserted-by":"crossref","first-page":"7673","DOI":"10.1007\/s00521-020-05511-4","article-title":"RealHePoNet: a robust single-stage ConvNet for head pose estimation in the wild","volume":"33","author":"Berral-Soler","year":"2021","journal-title":"Neural Comput. Appl."},{"key":"10.1016\/j.jvcir.2026.104842_b43","doi-asserted-by":"crossref","unstructured":"Z. Cao, Z. Chu, D. Liu, Y. Chen, A vector-based representation to enhance head pose estimation, in: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, 2021, pp. 1188\u20131197.","DOI":"10.1109\/WACV48630.2021.00123"},{"key":"10.1016\/j.jvcir.2026.104842_b44","series-title":"2022 IEEE International Conference on Image Processing","first-page":"2496","article-title":"6D rotation representation for unconstrained head pose estimation","author":"Hempel","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104842_b45","series-title":"Computer Vision \u2013 ECCV 2022","first-page":"737","article-title":"Towards unbiased label distribution learning for facial pose estimation using anisotropic spherical Gaussian","author":"Cao","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104842_b46","article-title":"A review of solutions for perspective-n-point problem in camera pose estimation","volume":"vol. 1087","author":"Lu","year":"2018"},{"key":"10.1016\/j.jvcir.2026.104842_b47","doi-asserted-by":"crossref","unstructured":"D. Merget, M. Rock, G. Rigoll, Robust facial landmark detection via a fully-convolutional local-global context network, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018, pp. 781\u2013790.","DOI":"10.1109\/CVPR.2018.00088"},{"issue":"4","key":"10.1016\/j.jvcir.2026.104842_b48","doi-asserted-by":"crossref","first-page":"322","DOI":"10.1109\/34.845375","article-title":"Fast, reliable head tracking under varying illumination: An approach based on registration of texture-mapped 3D models","volume":"22","author":"La Cascia","year":"2000","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.jvcir.2026.104842_b49","doi-asserted-by":"crossref","unstructured":"X. Zhu, Z. Lei, X. Liu, H. Shi, S.Z. Li, Face alignment across large poses: A 3D solution, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2016, pp. 146\u2013155.","DOI":"10.1109\/CVPR.2016.23"},{"key":"10.1016\/j.jvcir.2026.104842_b50","doi-asserted-by":"crossref","first-page":"437","DOI":"10.1007\/s11263-012-0549-0","article-title":"Random forests for real time 3D face analysis","volume":"101","author":"Fanelli","year":"2013","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.jvcir.2026.104842_b51","doi-asserted-by":"crossref","unstructured":"C. Sagonas, G. Tzimiropoulos, S. Zafeiriou, M. Pantic, 300 faces in-the-wild challenge: The first facial landmark localization challenge, in: Proceedings of the IEEE International Conference on Computer Vision Workshops, 2013, pp. 397\u2013403.","DOI":"10.1109\/ICCVW.2013.59"},{"key":"10.1016\/j.jvcir.2026.104842_b52","series-title":"Machine Learning for Multimodal Interaction","first-page":"182","article-title":"AV16.3: An audio-visual corpus for speaker localization and tracking","author":"Lathoud","year":"2005"},{"issue":"1\u20132","key":"10.1016\/j.jvcir.2026.104842_b53","doi-asserted-by":"crossref","first-page":"123","DOI":"10.1007\/BF01450852","article-title":"Model-based object pose in 25 lines of code","volume":"15","author":"DeMenthon","year":"1995","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.jvcir.2026.104842_b54","series-title":"Anthropometric Survey of US Army Personnel: Methods and Summary Statistics 1988","author":"Gordon","year":"1989"},{"key":"10.1016\/j.jvcir.2026.104842_b55","first-page":"36","article-title":"Variation and extrema of human interpupillary distance","volume":"vol. 5291","author":"Dodgson","year":"2004"},{"key":"10.1016\/j.jvcir.2026.104842_b56","series-title":"2020 25th International Conference on Pattern Recognition","first-page":"7343","article-title":"3D audio-visual speaker tracking with a novel particle filter","author":"Liu","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104842_b57","series-title":"AV16.3: an audio-visual corpus for speaker localization and tracking","author":"Guillaume Lathoud","year":"2010"},{"key":"10.1016\/j.jvcir.2026.104842_b58","series-title":"CAV3D: Co-located audio-visual streams with 3D tracks","author":"Qian","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104842_b59","series-title":"LandPose-vloc: Visual localization and pose estimation from images and 3D landmarks","author":"Sanabria-Macias","year":"2026"},{"key":"10.1016\/j.jvcir.2026.104842_b60","series-title":"Img2pose: Face alignment and detection via 6dof, face pose estimation","author":"Albiero","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104842_b61","series-title":"Head pose annotations used in the LandPose-vloc paper for 2D and 3D face and mouth localization, zenodo dataset","author":"Sanabria-Macias","year":"2026"}],"container-title":["Journal of Visual Communication and Image Representation"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1047320326001379?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1047320326001379?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T11:24:04Z","timestamp":1785929044000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1047320326001379"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":61,"alternative-id":["S1047320326001379"],"URL":"https:\/\/doi.org\/10.1016\/j.jvcir.2026.104842","relation":{},"ISSN":["1047-3203"],"issn-type":[{"value":"1047-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,6]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Landmark-assisted face and mouth 3D localization in smart spaces with a monocular camera","name":"articletitle","label":"Article Title"},{"value":"Journal of Visual Communication and Image Representation","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.jvcir.2026.104842","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier Inc.","name":"copyright","label":"Copyright"}],"article-number":"104842"}}