我们提出了Imagen,一个文本到图像的扩散模型,具有前所未有的写实主义程度和深度的语言理解。Imagen建立在理解文本的大型变压器语言模型的基础上,并依赖于在高保真图像生成中扩散模型的强度。我们的关键发现是,在纯文本语料库上进行预训练的通用大型语言模型(例如T5)在编码用于图像合成的文本方面惊人地有效:在Imagen中增加语言模型的大小比增加图像扩散模型的大小更能提高样本保真度和图像-文本对齐。Imagen在没有经过COCO训练的情况下,在COCO数据集上获得了7.27的最新FID分数,并且人类评分者发现Imagen样本在图像-文本对齐方面与COCO数据本身不相上下。为了更深入地评估文本到图像模型,我们引入了DrawBench,这是一个全面且具有挑战性的文本到图像模型基准测试。使用DrawBench,我们将Imagen与最近的方法进行了比较,包括VQ-GAN+CLIP、潜在扩散模型和DALL-E 2,并发现人类评分者在并排比较中更喜欢Imagen,无论是在样本质量还是图像-文本对齐方面。
类似的工具
免费AI 中文社
AI 中文社区 - 一个学习交流 AI 人工智能技术的中文社区
抖音Dreamina – 免费
抖音剪映旗下的一款AI绘画工具,能够根据用户提供的文本内容生成由AI制作的创意图片
LiblibAI·哩布哩布AI
限时免费的LoRA炼丹炉!更全、更热门的素材,为所有AI绘画者提供更得心应手的平台,持续深耕专业领域。
TTS Online
提供200多种声音选择,并支持多款热门游戏角色语音生成
新华妙笔AI
新华社研发的公文写作AI工具
Dify
简单易用的开源 LLMOps 平台,定义你的 AI 原生应用
他人最近看的工具
LiblibAI·哩布哩布AI
限时免费的LoRA炼丹炉!更全、更热门的素材,为所有AI绘画者提供更得心应手的平台,持续深耕专业领域。
Stable Diffusion官网
Stable Diffusion官网,图像生成模型创建图像!
Chaos® Vantage高阶应用
用实时光线追踪探索您的最复杂的3D场景。 使用 Chaos® Vantage,再也无需等待。只需要拖动完整的 V-Ray 场景到 Vantage 便可开始浏览。还可以与 3ds Max,SketchUp,Rhino,Revit 和 Cinema 4D 实时链接,作为视口使用。
Masterpiece Studio
Masterpiece Studio的愿景是轻松制作 3D,解锁 10 亿个 3D 创意,我们是一个多学科的团队,专注于创造和推动尖端3D创作的界限超过8年。我们很自豪能与一些最伟大的组织一起塑造未来。我们很荣幸我们的工作得到了行业领导者的认可。
LOGOAI
创建匹配的文具,设计您喜欢的品牌!
Clippah
Clippah提供由人工智能驱动的视频编辑工具。用户可以使用他们的工具快速生成内容,创建带有字幕的垂直视频,从视频中提取病毒式对话片段,并为长视频生成YouTube时间戳。
AI 中文社
