{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T19:57:38Z","timestamp":1776887858393,"version":"3.51.2"},"reference-count":24,"publisher":"IEEE","license":[{"start":{"date-parts":[[2020,12,16]],"date-time":"2020-12-16T00:00:00Z","timestamp":1608076800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2020,12,16]],"date-time":"2020-12-16T00:00:00Z","timestamp":1608076800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2020,12,16]],"date-time":"2020-12-16T00:00:00Z","timestamp":1608076800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2020,12,16]]},"DOI":"10.1109\/bibm49941.2020.9313289","type":"proceedings-article","created":{"date-parts":[[2021,2,9]],"date-time":"2021-02-09T10:44:40Z","timestamp":1612867480000},"page":"1999-2004","source":"Crossref","is-referenced-by-count":53,"title":["A Comparison of Pre-trained Vision-and-Language Models for Multimodal Representation Learning across Medical Images and Reports"],"prefix":"10.1109","author":[{"given":"Yikuan","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hanyin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuan","family":"Luo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"BERT: pre-training of deep bidirectional transformers for language understanding","volume":"abs\/1810.04805","author":"Devlin","year":"2018","journal-title":"CoRR"},{"key":"ref2","article-title":"Xlnet: Generalized autoregressive pretraining for language understanding","volume":"abs\/1906.08237","author":"Yang","year":"2019","journal-title":"CoRR"},{"key":"ref3","article-title":"Attention is all you need","volume":"abs\/1706.03762","author":"Vaswani","year":"2017","journal-title":"CoRR"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-66179-7_37"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1038\/sdata.2018.251"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1186\/s12911-020-1078-3"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00943"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.369"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2019.2955476"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.5626\/JCSE.2012.6.2.168"},{"key":"ref11","article-title":"Unsupervised multimodal representation learning across medical images and reports","volume-title":"arXiv preprint arXiv:1811.08615","author":"Harry Hsu","year":"2018"},{"key":"ref12","article-title":"Mimic-cxr-jpg, a large publicly available database of labeled chest radiographs","author":"Johnson","year":"2019","journal-title":"arXiv preprint arXiv:1901.07042"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1093\/jamia\/ocv080"},{"key":"ref14","article-title":"Visualbert: A simple and performant baseline for vision and language","author":"Li","year":"2019","journal-title":"arXiv preprint arXiv:1908.03557"},{"key":"ref15","article-title":"Uniter: Learning universal imagetext representations","author":"Chen","year":"2019","journal-title":"arXiv preprint arXiv:1909.11740"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1514"},{"key":"ref17","volume-title":"Pixel-bert: Aligning image pixels with text by deep multi-modal transformers","author":"Huang","year":"2020"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00636"},{"key":"ref20","article-title":"Publicly available clinical bert embeddings","author":"Alsentzer","year":"2019","journal-title":"arXiv preprint arXiv:1904.03323"},{"key":"ref21","article-title":"Chexnet: Radiologist-level pneumonia detection on chest x-rays with deep learning","volume":"abs\/1711.05225","author":"Rajpurkar","year":"2017","journal-title":"CoRR"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1445"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58539-6_34"},{"key":"ref24","article-title":"Vqa-med: Overview of the medical visual question answering task at imageclef 2019","author":"Abacha","year":"2019","journal-title":"CLEF (Working Notes)"}],"event":{"name":"2020 IEEE International Conference on Bioinformatics and Biomedicine (BIBM)","location":"Seoul, Korea (South)","start":{"date-parts":[[2020,12,16]]},"end":{"date-parts":[[2020,12,19]]}},"container-title":["2020 IEEE International Conference on Bioinformatics and Biomedicine (BIBM)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9312958\/9312977\/09313289.pdf?arnumber=9313289","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,24]],"date-time":"2024-01-24T01:14:29Z","timestamp":1706058869000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9313289\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,12,16]]},"references-count":24,"URL":"https:\/\/doi.org\/10.1109\/bibm49941.2020.9313289","relation":{},"subject":[],"published":{"date-parts":[[2020,12,16]]}}}