{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,25]],"date-time":"2026-07-25T16:02:31Z","timestamp":1784995351138,"version":"3.55.0"},"reference-count":73,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"8","license":[{"start":{"date-parts":[[2024,8,1]],"date-time":"2024-08-01T00:00:00Z","timestamp":1722470400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2024,8,1]],"date-time":"2024-08-01T00:00:00Z","timestamp":1722470400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,8,1]],"date-time":"2024-08-01T00:00:00Z","timestamp":1722470400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62207029"],"award-info":[{"award-number":["62207029"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62271454"],"award-info":[{"award-number":["62271454"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2018YFB1403903"],"award-info":[{"award-number":["2018YFB1403903"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2021YFF0900700"],"award-info":[{"award-number":["2021YFF0900700"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004826","name":"Beijing Natural Science Foundation","doi-asserted-by":"publisher","award":["L223033"],"award-info":[{"award-number":["L223033"]}],"id":[{"id":"10.13039\/501100004826","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Circuits Syst. Video Technol."],"published-print":{"date-parts":[[2024,8]]},"DOI":"10.1109\/tcsvt.2024.3349567","type":"journal-article","created":{"date-parts":[[2024,1,4]],"date-time":"2024-01-04T20:12:28Z","timestamp":1704399148000},"page":"6901-6912","source":"Crossref","is-referenced-by-count":17,"title":["MtArtGPT: A Multi-Task Art Generation System With Pre-Trained Transformer"],"prefix":"10.1109","volume":"34","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0464-9862","authenticated-orcid":false,"given":"Cong","family":"Jin","sequence":"first","affiliation":[{"name":"School of Information and Communication Engineering, Communication University of China, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-4911-8584","authenticated-orcid":false,"given":"Ruolin","family":"Zhu","sequence":"additional","affiliation":[{"name":"School of Information and Communication Engineering, Communication University of China, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-5160-2138","authenticated-orcid":false,"given":"Zixing","family":"Zhu","sequence":"additional","affiliation":[{"name":"School of Information and Communication Engineering, Communication University of China, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3857-3982","authenticated-orcid":false,"given":"Lu","family":"Yang","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-5885-8138","authenticated-orcid":false,"given":"Min","family":"Yang","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4516-9729","authenticated-orcid":false,"given":"Jiebo","family":"Luo","sequence":"additional","affiliation":[{"name":"University of Rochester, Rochester, NY, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proc. Adv. Neural Inf. Process. Sys.","volume":"33","author":"Brown"},{"key":"ref2","first-page":"5547","article-title":"GLaM: Efficient scaling of language models with mixture-of-experts","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Du"},{"key":"ref3","article-title":"On the opportunities and risks of foundation models","author":"Bommasani","year":"2021","journal-title":"arXiv:2108.07258"},{"key":"ref4","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Radford"},{"key":"ref5","article-title":"EVA-CLIP: Improved training techniques for CLIP at scale","author":"Fang","year":"2022","journal-title":"arXiv:2211.07636"},{"key":"ref6","first-page":"12888","article-title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref7","article-title":"Scaling language-image pre-training via masking","author":"Li","year":"2022","journal-title":"arXiv:2212.00794"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2022-10961"},{"key":"ref9","article-title":"LAION-400M: Open dataset of CLIP-filtered 400 million image-text pairs","author":"Schuhmann","year":"2021","journal-title":"arXiv:2111.02114"},{"key":"ref10","article-title":"BEiT: BERT pre-training of image transformers","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Bao"},{"key":"ref11","article-title":"BEiT v2: Masked image modeling with vector-quantized visual tokenizers","author":"Peng","year":"2022","journal-title":"arXiv:2208.06366"},{"key":"ref12","article-title":"Image as a foreign language: BEiT pretraining for all vision and vision-language tasks","author":"Wang","year":"2022","journal-title":"arXiv:2208.10442"},{"key":"ref13","article-title":"Language models are general-purpose interfaces","author":"Hao","year":"2022","journal-title":"arXiv:2206.06336"},{"key":"ref14","article-title":"PaLI: A jointly-scaled multilingual language-image model","author":"Chen","year":"2022","journal-title":"arXiv:2209.06794"},{"key":"ref15","article-title":"mT5: A massively multilingual pre-trained text-to-text transformer","author":"Xue","year":"2020","journal-title":"arXiv:2010.11934"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01630"},{"key":"ref17","article-title":"Uni-Perceiver v2: A generalist model for large-scale vision and vision-language tasks","author":"Li","year":"2022","journal-title":"arXiv:2211.09808"},{"key":"ref18","article-title":"Uni-Perceiver-MoE: Learning sparse generalist models with conditional MoEs","author":"Zhu","year":"2022","journal-title":"arXiv:2206.04674"},{"key":"ref19","volume-title":"Introducing ChatGPT"},{"key":"ref20","article-title":"GPT-4 technical report","volume-title":"arXiv:2303.08774","author":"Achiam","year":"2023"},{"issue":"8","key":"ref21","first-page":"9","article-title":"Language models are unsupervised multitask learners","volume":"1","author":"Radford","year":"2019","journal-title":"OpenAI Blog"},{"key":"ref22","article-title":"Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality","author":"Chiang","year":"2023"},{"key":"ref23","article-title":"Stanford Alpaca: An instruction-following LLaMA model","author":"Taori","year":"2023"},{"key":"ref24","article-title":"Scaling instruction-finetuned language models","author":"Chung","year":"2022","journal-title":"arXiv:2210.11416"},{"key":"ref25","article-title":"LLaMA: Open and efficient foundation language models","author":"Touvron","year":"2023","journal-title":"arXiv:2302.13971"},{"key":"ref26","article-title":"Visual instruction tuning","author":"Liu","year":"2023","journal-title":"arXiv:2304.08485"},{"key":"ref27","article-title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","author":"Zhu","year":"2023","journal-title":"arXiv:2304.10592"},{"key":"ref28","article-title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","author":"Dai","year":"2023","journal-title":"arXiv:2305.06500"},{"key":"ref29","article-title":"Valley: Video assistant with large language model enhanced abilitY","author":"Luo","year":"2023","journal-title":"arXiv:2306.07207"},{"key":"ref30","article-title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023","journal-title":"arXiv:2301.12597"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3282953"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1312.6114"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1145\/3422622"},{"key":"ref34","first-page":"1747","article-title":"Pixel recurrent neural networks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"van den Oord"},{"key":"ref35","first-page":"2256","article-title":"Deep unsupervised learning using nonequilibrium thermodynamics","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Sohl-Dickstein"},{"key":"ref36","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume-title":"Proc. Neural Inf. Process. Syst.","volume":"33","author":"Ho"},{"issue":"1","key":"ref37","first-page":"5485","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","volume":"21","author":"Raffel","year":"2020","journal-title":"J. Mach. Learn. Res."},{"key":"ref38","first-page":"36479","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","volume-title":"Proc. Neural Inf. Process. Syst.","volume":"35","author":"Saharia"},{"key":"ref39","article-title":"Hierarchical text-conditional image generation with CLIP latents","author":"Ramesh","year":"2022","journal-title":"arXiv:2204.06125"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref41","article-title":"Phenaki: Variable length video generation from open domain textual description","author":"Villegas","year":"2022","journal-title":"arXiv:2210.02399"},{"key":"ref42","article-title":"CogVideo: Large-scale pretraining for text-to-video generation via transformers","author":"Hong","year":"2022","journal-title":"arXiv:2205.15868"},{"key":"ref43","article-title":"CogView2: Faster and better text-to-image generation via hierarchical transformers","author":"Ding","year":"2022","journal-title":"arXiv:2204.14217"},{"key":"ref44","article-title":"Make-A-Video: Text-to-video generation without text-video data","author":"Singer","year":"2022","journal-title":"arXiv:2209.14792"},{"key":"ref45","article-title":"Video diffusion models","author":"Ho","year":"2022","journal-title":"arXiv:2204.03458"},{"key":"ref46","article-title":"Museformer: Transformer with fine- and coarse-grained attention for music generation","author":"Yu","year":"2022","journal-title":"arXiv:2210.10349"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/SBGAMES56371.2022.9961081"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1145\/3424116"},{"key":"ref49","volume-title":"Difficulty controlled piano music generation using GAN approach","author":"Ghatas","year":"2022"},{"key":"ref50","article-title":"SurpriseNet: Melody harmonization conditioning on user-controlled surprise contours","author":"Chen","year":"2021","journal-title":"arXiv:2108.00378"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i01.5413"},{"key":"ref52","article-title":"Exploring the efficacy of pre-trained checkpoints in text-to-music generation task","author":"Wu","year":"2022","journal-title":"arXiv:2211.11216"},{"key":"ref53","article-title":"Mo\u00fbsai: Text-to-music generation with long-context latent diffusion","author":"Schneider","year":"2023","journal-title":"arXiv:2301.11757"},{"key":"ref54","article-title":"AudioLDM: Text-to-audio generation with latent diffusion models","author":"Liu","year":"2023","journal-title":"arXiv:2301.12503"},{"key":"ref55","volume-title":"Mubert"},{"key":"ref56","article-title":"AudioLM: A language modeling approach to audio generation","author":"Borsos","year":"2022","journal-title":"arXiv:2209.03143"},{"key":"ref57","first-page":"4171","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","volume-title":"Proc. NAACL-HLT","volume":"1","author":"Devlin"},{"key":"ref58","article-title":"XLNet: Generalized autoregressive pretraining for language understanding","volume-title":"Proc. Neural Inf. Process. Syst.","volume":"32","author":"Yang"},{"key":"ref59","first-page":"1","article-title":"Improving language understanding by generative pre-training","volume-title":"Proc. EMNLP","author":"Radford"},{"key":"ref60","first-page":"4302","article-title":"Deep reinforcement learning from human preferences","volume-title":"Proc. Neural Inf. Process. Syst.","volume":"30","author":"Christiano"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref62","article-title":"Grounding DINO: Marrying DINO with grounded pre-training for open-set object detection","author":"Liu","year":"2023","journal-title":"arXiv:2303.05499"},{"key":"ref63","article-title":"DINOv2: Learning robust visual features without supervision","author":"Oquab","year":"2023","journal-title":"arXiv:2304.07193"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1056\/NEJMsr2214184"},{"key":"ref65","article-title":"Capabilities of GPT-4 on medical challenge problems","author":"Nori","year":"2023","journal-title":"arXiv:2303.13375"},{"key":"ref66","article-title":"A brief report on LawGPT 1.0: A virtual legal assistant based on GPT-3","volume-title":"arXiv:2302.05729","author":"Nguyen","year":"2023"},{"key":"ref67","article-title":"LoRA: Low-rank adaptation of large language models","author":"Hu","year":"2021","journal-title":"arXiv:2106.09685"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10094628"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.244"},{"key":"ref70","article-title":"Chain-of-thought prompting elicits reasoning in large language models","author":"Wei","year":"2022","journal-title":"arXiv:2201.11903"},{"key":"ref71","article-title":"Jukebox: A generative model for music","author":"Dhariwal","year":"2020","journal-title":"arXiv:2005.00341"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1049\/cit2.12065"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1007\/s11063-020-10241-8"}],"container-title":["IEEE Transactions on Circuits and Systems for Video Technology"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/76\/10634006\/10380595.pdf?arnumber=10380595","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,8,13]],"date-time":"2024-08-13T17:43:01Z","timestamp":1723570981000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10380595\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,8]]},"references-count":73,"journal-issue":{"issue":"8"},"URL":"https:\/\/doi.org\/10.1109\/tcsvt.2024.3349567","relation":{},"ISSN":["1051-8215","1558-2205"],"issn-type":[{"value":"1051-8215","type":"print"},{"value":"1558-2205","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,8]]}}}