{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T21:04:42Z","timestamp":1780607082338,"version":"3.54.1"},"reference-count":56,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/100015860","name":"China Railway","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100015860","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Journal of Visual Communication and Image Representation"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1016\/j.jvcir.2026.104834","type":"journal-article","created":{"date-parts":[[2026,5,5]],"date-time":"2026-05-05T23:27:22Z","timestamp":1778023642000},"page":"104834","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Curriculum-Meta learning for unbiased Multimodal Relation Extraction"],"prefix":"10.1016","volume":"118","author":[{"given":"Xin","family":"Su","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jin","family":"Yi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ziteng","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chan","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Aili","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Peng","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.jvcir.2026.104834_b1","article-title":"Multi-modal knowledge graph construction and application: A survey","author":"Zhu","year":"2022","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"10.1016\/j.jvcir.2026.104834_b2","series-title":"2021 IEEE International Conference on Multimedia and Expo","first-page":"1","article-title":"Mnre: A challenge multimodal dataset for neural relation extraction with visual evidence in social media posts","author":"Zheng","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104834_b3","first-page":"13916","article-title":"FL-MSRE: A few-shot learning based approach to multimodal social relation extraction","volume":"vol. 35","author":"Wan","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104834_b4","series-title":"The Semantic Web: 16th International Conference, ESWC 2019, Portoro\u017e, Slovenia, June 2\u20136, 2019, Proceedings 16","first-page":"459","article-title":"MMKG: multi-modal knowledge graphs","author":"Liu","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104834_b5","series-title":"Answering Visuo-Semantic Queries with IMGpedia","author":"Ferrada","year":"2017"},{"key":"10.1016\/j.jvcir.2026.104834_b6","series-title":"The Semantic Web\u2013ISWC 2021: 20th International Semantic Web Conference, ISWC 2021, Virtual Event, October 24\u201328, 2021, Proceedings 20","first-page":"146","article-title":"Zero-shot visual question answering using knowledge graph","author":"Chen","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104834_b7","article-title":"State graph reasoning for multimodal conversational recommendation","author":"Wu","year":"2022","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.jvcir.2026.104834_b8","doi-asserted-by":"crossref","first-page":"175","DOI":"10.1016\/j.procs.2018.09.017","article-title":"Exploring the synergy between knowledge graph and computer vision for personalisation systems","volume":"137","author":"Lully","year":"2018","journal-title":"Procedia Comput. Sci."},{"key":"10.1016\/j.jvcir.2026.104834_b9","series-title":"A survey of knowledge graph reasoning on graph types: Static, dynamic, and multimodal","author":"Liang","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104834_b10","series-title":"2023 IEEE 39th International Conference on Data Engineering","first-page":"96","article-title":"Mmkgr: Multi-hop multi-modal knowledge graph reasoning","author":"Zheng","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104834_b11","doi-asserted-by":"crossref","unstructured":"C. Zheng, J. Feng, Z. Fu, Y. Cai, Q. Li, T. Wang, Multimodal relation extraction with efficient graph alignment, in: Proceedings of the 29th ACM International Conference on Multimedia, 2021, pp. 5298\u20135306.","DOI":"10.1145\/3474085.3476968"},{"key":"10.1016\/j.jvcir.2026.104834_b12","doi-asserted-by":"crossref","unstructured":"X. Chen, N. Zhang, L. Li, Y. Yao, S. Deng, C. Tan, F. Huang, L. Si, H. Chen, Good Visual Guidance Make A Better Extractor: Hierarchical Visual Prefix for Multimodal Entity and Relation Extraction, in: Findings of the Association for Computational Linguistics: NAACL 2022, 2022, pp. 1607\u20131618.","DOI":"10.18653\/v1\/2022.findings-naacl.121"},{"key":"10.1016\/j.jvcir.2026.104834_b13","doi-asserted-by":"crossref","unstructured":"X. Hu, J. Chen, A. Liu, S. Meng, L. Wen, P.S. Yu, Prompt me up: Unleashing the power of alignments for multimodal entity and relation extraction, in: Proceedings of the 31st ACM International Conference on Multimedia, 2023, pp. 5185\u20135194.","DOI":"10.1145\/3581783.3611899"},{"key":"10.1016\/j.jvcir.2026.104834_b14","doi-asserted-by":"crossref","unstructured":"L. He, H. Wang, Y. Cao, Z. Wu, J. Zhang, X. Dai, MORE: A Multimodal Object-Entity Relation Extraction Dataset with a Benchmark Evaluation, in: Proceedings of the 31st ACM International Conference on Multimedia, 2023, pp. 4564\u20134573.","DOI":"10.1145\/3581783.3612209"},{"key":"10.1016\/j.jvcir.2026.104834_b15","doi-asserted-by":"crossref","unstructured":"X. Wang, J. Cai, Y. Jiang, P. Xie, K. Tu, W. Lu, Named Entity and Relation Extraction with Multi-Modal Retrieval, in: Findings of the Association for Computational Linguistics: EMNLP 2022, 2022, pp. 5925\u20135936.","DOI":"10.18653\/v1\/2022.findings-emnlp.437"},{"key":"10.1016\/j.jvcir.2026.104834_b16","first-page":"13860","article-title":"RpBERT: a text-image relation propagation-based BERT model for multimodal NER","volume":"vol. 35","author":"Sun","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104834_b17","first-page":"514","article-title":"Exploring long tail data in distantly supervised relation extraction","author":"Gui","year":"2016"},{"key":"10.1016\/j.jvcir.2026.104834_b18","unstructured":"K. Lei, D. Chen, Y. Li, N. Du, M. Yang, W. Fan, Y. Shen, Cooperative denoising for distantly supervised relation extraction, in: Proceedings of the 27th International Conference on Computational Linguistics, 2018, pp. 426\u2013436."},{"key":"10.1016\/j.jvcir.2026.104834_b19","series-title":"Long-tail relation extraction via knowledge graph embeddings and graph convolution networks","author":"Zhang","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104834_b20","doi-asserted-by":"crossref","unstructured":"X. Han, P. Yu, Z. Liu, M. Sun, P. Li, Hierarchical relation extraction with coarse-to-fine grained attention, in: Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing, 2018, pp. 2236\u20132245.","DOI":"10.18653\/v1\/D18-1247"},{"key":"10.1016\/j.jvcir.2026.104834_b21","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2020.105912","article-title":"A dynamic parameter enhanced network for distant supervised relation extraction","volume":"197","author":"Gou","year":"2020","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.jvcir.2026.104834_b22","series-title":"Learning to Learn","first-page":"3","article-title":"Learning to learn: Introduction and overview","author":"Thrun","year":"1998"},{"key":"10.1016\/j.jvcir.2026.104834_b23","series-title":"International Conference on Machine Learning","first-page":"1842","article-title":"Meta-learning with memory-augmented neural networks","author":"Santoro","year":"2016"},{"key":"10.1016\/j.jvcir.2026.104834_b24","doi-asserted-by":"crossref","unstructured":"P. Bateni, R. Goyal, V. Masrani, F. Wood, L. Sigal, Improved few-shot visual classification, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 14493\u201314502.","DOI":"10.1109\/CVPR42600.2020.01450"},{"key":"10.1016\/j.jvcir.2026.104834_b25","doi-asserted-by":"crossref","first-page":"29454","DOI":"10.52202\/068431-2136","article-title":"Bidirectional learning for offline infinite-width model-based optimization","volume":"35","author":"Chen","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.jvcir.2026.104834_b26","article-title":"Siamese neural networks for one-shot image recognition","volume":"vol. 2","author":"Koch","year":"2015"},{"key":"10.1016\/j.jvcir.2026.104834_b27","article-title":"Prototypical networks for few-shot learning","volume":"30","author":"Snell","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.jvcir.2026.104834_b28","article-title":"Matching networks for one shot learning","volume":"29","author":"Vinyals","year":"2016","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.jvcir.2026.104834_b29","unstructured":"S. Ravi, H. Larochelle, Optimization as a model for few-shot learning, in: International Conference on Learning Representations, 2016."},{"key":"10.1016\/j.jvcir.2026.104834_b30","first-page":"14097","article-title":"Generalized dataweighting via class-level gradient manipulation","volume":"34","author":"Chen","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.jvcir.2026.104834_b31","series-title":"International Conference on Machine Learning","first-page":"1126","article-title":"Model-agnostic meta-learning for fast adaptation of deep networks","author":"Finn","year":"2017"},{"key":"10.1016\/j.jvcir.2026.104834_b32","series-title":"On first-order meta-learning algorithms","author":"Nichol","year":"2018"},{"key":"10.1016\/j.jvcir.2026.104834_b33","unstructured":"M. Zinkevich, Online convex programming and generalized infinitesimal gradient ascent, in: Proceedings of the 20th International Conference on Machine Learning, Icml-03, 2003, pp. 928\u2013936."},{"key":"10.1016\/j.jvcir.2026.104834_b34","doi-asserted-by":"crossref","unstructured":"Y. Bengio, J. Louradour, R. Collobert, J. Weston, Curriculum learning, in: Proceedings of the 26th Annual International Conference on Machine Learning, 2009, pp. 41\u201348.","DOI":"10.1145\/1553374.1553380"},{"issue":"9","key":"10.1016\/j.jvcir.2026.104834_b35","first-page":"4555","article-title":"A survey on curriculum learning","volume":"44","author":"Wang","year":"2021","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.jvcir.2026.104834_b36","series-title":"International Conference on Machine Learning","first-page":"2535","article-title":"On the power of curriculum learning in training deep networks","author":"Hacohen","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104834_b37","unstructured":"V.I. Spitkovsky, H. Alshawi, D. Jurafsky, From baby steps to leapfrog: How \u201cless is more\u201d in unsupervised dependency parsing, in: Human Language Technologies: The 2010 Annual Conference of the North American Chapter of the Association for Computational Linguistics, 2010, pp. 751\u2013759."},{"key":"10.1016\/j.jvcir.2026.104834_b38","first-page":"10363","article-title":"Curriculum-meta learning for order-robust continual relation extraction","volume":"vol. 35","author":"Wu","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104834_b39","series-title":"Worst-case-aware curriculum learning for zero and few shot transfer","author":"Zhang","year":"2020"},{"key":"10.1016\/j.jvcir.2026.104834_b40","series-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020"},{"key":"10.1016\/j.jvcir.2026.104834_b41","series-title":"Bert: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018"},{"key":"10.1016\/j.jvcir.2026.104834_b42","doi-asserted-by":"crossref","unstructured":"J. Tan, C. Wang, B. Li, Q. Li, W. Ouyang, C. Yin, J. Yan, Equalization loss for long-tailed object recognition, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 11662\u201311671.","DOI":"10.1109\/CVPR42600.2020.01168"},{"key":"10.1016\/j.jvcir.2026.104834_b43","first-page":"1877","article-title":"Language models are few-shot learners","volume":"33","author":"Brown","year":"2020","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.jvcir.2026.104834_b44","series-title":"A survey on in-context learning","author":"Dong","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104834_b45","series-title":"A survey on multimodal large language models","author":"Yin","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104834_b46","article-title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","volume":"32","author":"Lu","year":"2019","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.jvcir.2026.104834_b47","series-title":"Visualbert: A simple and performant baseline for vision and language","author":"Li","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104834_b48","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.jvcir.2026.104834_b49","doi-asserted-by":"crossref","unstructured":"K. Tang, Y. Niu, J. Huang, J. Shi, H. Zhang, Unbiased scene graph generation from biased training, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 3716\u20133725.","DOI":"10.1109\/CVPR42600.2020.00377"},{"key":"10.1016\/j.jvcir.2026.104834_b50","doi-asserted-by":"crossref","unstructured":"D. Zeng, K. Liu, Y. Chen, J. Zhao, Distant supervision for relation extraction via piecewise convolutional neural networks, in: Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing, 2015, pp. 1753\u20131762.","DOI":"10.18653\/v1\/D15-1203"},{"key":"10.1016\/j.jvcir.2026.104834_b51","series-title":"Matching the blanks: Distributional similarity for relation learning","author":"Soares","year":"2019"},{"key":"10.1016\/j.jvcir.2026.104834_b52","first-page":"16254","article-title":"On analyzing the role of image for visual-enhanced relation extraction (student abstract)","volume":"vol. 37","author":"Li","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104834_b53","doi-asserted-by":"crossref","unstructured":"X. Chen, N. Zhang, L. Li, S. Deng, C. Tan, C. Xu, F. Huang, L. Si, H. Chen, Hybrid transformer with multi-level fusion for multimodal knowledge graph completion, in: Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2022, pp. 904\u2013915.","DOI":"10.1145\/3477495.3531992"},{"issue":"3","key":"10.1016\/j.jvcir.2026.104834_b54","doi-asserted-by":"crossref","DOI":"10.1016\/j.ipm.2023.103264","article-title":"TSVFN: Two-stage visual fusion network for multimodal relation extraction","volume":"60","author":"Zhao","year":"2023","journal-title":"Inf. Process. Manage."},{"key":"10.1016\/j.jvcir.2026.104834_b55","doi-asserted-by":"crossref","first-page":"1274","DOI":"10.1109\/TASLP.2023.3345146","article-title":"Enhancing multimodal entity and relation extraction with variational information bottleneck","volume":"32","author":"Cui","year":"2024","journal-title":"IEEE\/ACM Trans. Audio, Speech, Lang. Process."},{"key":"10.1016\/j.jvcir.2026.104834_b56","doi-asserted-by":"crossref","unstructured":"C. Zheng, J. Feng, Y. Cai, X. Wei, Q. Li, Rethinking multimodal entity and relation extraction from a translation point of view, in: Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2023, pp. 6810\u20136824.","DOI":"10.18653\/v1\/2023.acl-long.376"}],"container-title":["Journal of Visual Communication and Image Representation"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S104732032600129X?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S104732032600129X?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T20:11:21Z","timestamp":1780603881000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S104732032600129X"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":56,"alternative-id":["S104732032600129X"],"URL":"https:\/\/doi.org\/10.1016\/j.jvcir.2026.104834","relation":{},"ISSN":["1047-3203"],"issn-type":[{"value":"1047-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,6]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Curriculum-Meta learning for unbiased Multimodal Relation Extraction","name":"articletitle","label":"Article Title"},{"value":"Journal of Visual Communication and Image Representation","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.jvcir.2026.104834","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Inc. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"104834"}}