{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,10]],"date-time":"2026-04-10T21:22:49Z","timestamp":1775856169693,"version":"3.50.1"},"reference-count":29,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,10,2]],"date-time":"2024-10-02T00:00:00Z","timestamp":1727827200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,10,2]],"date-time":"2024-10-02T00:00:00Z","timestamp":1727827200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,10,2]]},"DOI":"10.1109\/mmsp61759.2024.10743395","type":"proceedings-article","created":{"date-parts":[[2024,11,12]],"date-time":"2024-11-12T18:35:35Z","timestamp":1731436535000},"page":"1-6","source":"Crossref","is-referenced-by-count":4,"title":["FMiFood: Multi-Modal Contrastive Learning for Food Image Classification"],"prefix":"10.1109","author":[{"given":"Xinyue","family":"Pan","sequence":"first","affiliation":[{"name":"Elmore Family School of Electrical and Computer Engineering, Purdue University,West Lafayette,IN,U.S.A."}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiangpeng","family":"He","sequence":"additional","affiliation":[{"name":"Elmore Family School of Electrical and Computer Engineering, Purdue University,West Lafayette,IN,U.S.A."}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fengqing","family":"Zhu","sequence":"additional","affiliation":[{"name":"Elmore Family School of Electrical and Computer Engineering, Purdue University,West Lafayette,IN,U.S.A."}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1145\/3475725.3483625"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1080\/09637486.2017.1283683"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1016\/j.jand.2014.09.015"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.3945\/jn.113.189407"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-68821-9_47"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/IEEECONF59524.2023.10476964"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/MMSP53017.2021.9733586"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1145\/3607828.3617798"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2024.3371212"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3237871"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2019.2929447"},{"key":"ref12","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proceedings of the 38th International Conference on Machine Learning","volume":"139","author":"Radford"},{"key":"ref13","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","volume-title":"Proceedings of Machine Learning Research","author":"Jia","year":"2021"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_30"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01857"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00272"},{"key":"ref17","article-title":"Gpt-4 technical report","volume-title":"OpenAI","year":"2023"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3414031"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01394"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW54120.2021.00265"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/icip49359.2023.10222925"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.3390\/nu15122751"},{"key":"ref23","article-title":"Supervision exists everywhere: A data efficient contrastive language-image pretraining paradigm","volume-title":"International Conference on Learning Representations","author":"Li","year":"2022"},{"key":"ref24","article-title":"FILIP: Fine-grained interactive language-image pretraining","volume-title":"International Conference on Learning Representations","author":"Yao","year":"2022"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.3115\/1075812.1075938"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/IVCNZ51579.2020.9290622"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.3390\/nu9010086"},{"key":"ref28","article-title":"An image is worth 16x16 words: Trans-formers for image recognition at scale","volume-title":"Proceedings of International Conference on Learning Representations","author":"Dosovitskiy","year":"2021"},{"key":"ref29","article-title":"SGDR: Stochastic gradient descent with warm restarts","volume-title":"Proceedings of International Conference on Learning Representations","author":"Loshchilov","year":"2017"}],"event":{"name":"2024 IEEE 26th International Workshop on Multimedia Signal Processing (MMSP)","location":"West Lafayette, IN, USA","start":{"date-parts":[[2024,10,2]]},"end":{"date-parts":[[2024,10,4]]}},"container-title":["2024 IEEE 26th International Workshop on Multimedia Signal Processing (MMSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10743173\/10743194\/10743395.pdf?arnumber=10743395","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,27]],"date-time":"2024-11-27T16:26:47Z","timestamp":1732724807000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10743395\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,2]]},"references-count":29,"URL":"https:\/\/doi.org\/10.1109\/mmsp61759.2024.10743395","relation":{},"subject":[],"published":{"date-parts":[[2024,10,2]]}}}