云南淘乐房科技有限公司

400 128 6709

行业新闻

当前位置：首页 > 新闻中心 > 行业新闻

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

发布时间：2024-03-06

点击次数：

Stability AI在发布了Stable Diffusion 3之后，今天公布了详细的技术报告。

论文深入分析了Stable Diffusion 3的核心技术——改进版的Diffusion模型和一个基于DiT的文生图全新架构！

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

报告地址：

https://www.php.cn/link/e5fb88b398b042f6cccce46bf3fa53e8

通过人类评价测试，Stable Diffusion 3在字体设计和对提示的精准响应方面，超过了DALL·E 3、Midjourney v6和Ideogram v1。

Stability AI最新开发的多模态扩散Transformer（MMDiT）架构，使用了专门针对图像和语言表示的独立权重集。与SD 3的早期版本相比，MMDiT在文本理解和拼写方面取得了显著的提升。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

性能评估

在人类反馈的基础之上，技术报告将SD 3于大量开源模型SDXL、SDXL Turbo、Stable Cascade、Playground v2.5 和 Pixart-α，以及闭源模型DALL·E 3、Midjourney v6 和 Ideogram v1进行了详细的对比评估。

评估员根据指定提示的一致性、文本的清晰度和图像的整体美观性来选择每个模型的最佳输出。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

测试结果显示，无论是在遵循提示的准确性、文本的清晰呈现还是图像的视觉美感方面，Stable Diffusion 3都达到或超过了当前文生图生成技术的最高水平。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

完全没有针对硬件进行过优化的SD 3模型具有8B参数，能够在24GB显存的RTX 4090消费级GPU上运行，并且在使用50个采样步骤的情况下，生成1024x1024分辨率的图像需耗时34秒。

此外，Stable Diffusion 3在发布时将提供多个版本，参数范围从8亿到80亿，从而能以进一步降低使用的硬件门槛。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

架构细节曝光

在文生图的过程中，模型需同时处理文本和图像这两种不同的信息。所以作者将这个新框架称之为MMDiT。

在文本到图像生成的过程中，模型需同时处理文本和图像这两种不同的信息类型。这就是作者将这种新技术称为MMDiT（多模态Diffusion Transformer的简称）的原因。

与Stable Diffusion之前的版本一样，SD 3采用了预训练模型来提取适合的文本和图像的表达形式。

具体而言，他们利用了三种不同的文本编码器——两个CLIP模型和一个T5 ——来处理文本信息，同时使用了一个更为先进的自编码模型来处理图像信息。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

SD 3的架构是在Diffusion Transformer（DiT）的基础上建立的。由于文本和图像信息的差异，SD 3为这两种信息各自设置了独立的权重。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

这种设计相当于为每种信息类型配备了两个独立的Transformer，但在执行注意力机制时，会将两种信息的数据序列合并，这样就可以在各自的领域内独立工作的同时，能保持够相互参考和融合。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

通过这种独特的构架，图像和文本信息之间可以相互流动和交互，从而在生成的结果中提高对内容的整体理解和视觉表现。

而且，这种架构未来还可以轻松扩展到其他包括视频在内的多种模态。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

得益于SD 3在遵循提示方面的进步，模型能够精确生成集中于多种不同主题和特性的图像，同时在图像风格上也保持了极高的灵活性。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

通过重赋权法改进Rectified Flow

Machine Translation

Machine Translation

聚合多个来源的AI翻译

Machine Translation

49 查看详情 Machine Translation

Machine Translation

除了推出的全新Diffusion Transformer构架之外，SD 3对于Diffusion模型也进行了重大的改进。

SD 3采用了Rectified Flow（RF）策略，将训练数据和噪声沿着直线轨迹连接起来。

这种方法让模型的推理路径更加直接，因此可以通过更少的步骤完成样本的生成。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

作者在训练流程中引入了一种创新的轨迹采样计划，特别增加了对轨迹中间部分的权重，这些部分的预测任务更具挑战性。

通过与其他60种扩散轨迹（例如 LDM、EDM 和 ADM）进行比较，作者发现尽管之前的RF方法在少步骤采样中表现更佳，但随着采样步骤增多，性能会慢慢下降。

为了避免这种情况的出现，作者提出的加权RF方法，就能够持续提升模型性能。

扩展RF Transformer模型

Stability AI训练了多个不同规模的模型，从 15 个模块、450M参数到38个模块、8B参数，发现模型大小和训练步骤都能平滑地降低验证损失。

为了验证这是否意味着模型输出有实质性的改进，他们还评估了自动图像对齐指标和人类偏好评分。

结果表明，这些评估指标与验证损失强相关，说明验证损失是衡量模型整体性能的有效指标。

此外，这种扩展趋势没有达到饱和点，让我们对未来能够进一步提升模型性能持乐观态度。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

作者在256 *256像素分辨率下，在4096的批大小下，用不同参数数对模型进行了500k步训练。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

上图说明了长时间训练较大模型对样本质量的影响。

上表显示了GenEval的结果。当使用作者提出的训练方法并提高训练图像的分辨率时，最大的模型在大多数类别中都表现出色，在总分上超过了 DALL·E 3。

根据作者对不同构架模型的测试对比，MMDiT效果非常好，超过了DiT，Cross DiT，UViT，MM-DiT。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

灵活的文本编码器

通过在推理阶段去除占用大量内存的4.7B参数的T5文本编码器，SD 3的内存需求得到了大幅降低，而性能损失微乎其微。

去除这个文本编码器不会影响图像的视觉美感（不使用T5的胜率为 50%），只会略微降低文本的准确遵循能力（胜率为46%）。

然而，为了充分发挥SD 3在生成文字的能力，作者还是建议使用T5编码器。

因为作者发现在没有它的情况下，排版生成文字的性能会有更大的下降（胜率为 38%）。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

网友热议

网友们对Stability AI不断撩拨用户但是不让用的行为显得有些不耐烦了，纷纷催促赶快上线让大家使用。

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

看了技术报考后，网友说看来现在生图圈子要成第一个开源碾压闭源的赛道了！

Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？

以上就是Stable Diffusion 3技术报告流出，Sora构架再立大功！生图圈开源暴打Midjourney和DALL·E 3？的详细内容，更多请关注其它相关文章！

# 丰田 # 网站建设美丽芭蕾 # 智库营销推广公司 # hexo seo设置 # 请seo唱歌多少钱 # 荆门营销推广公司 # seo做网站赚钱吗 # 东城区综合网站建设操作 # 西乡seo优化学习 # 一元网站建设 # 上海培训seo # 胜率 # 进行了 # 超过了 # 模型 # 是在 # 这两种 # 中国科学院 # 多个 # 暴打 # 开源 # playg # ideogram # midjourney # stable diffusion # sora # follow # 测评

相关栏目：【行业新闻62819 】【科技资讯67470 】

相关推荐： “技术+实践+生态”三箭齐发，京东方抢占物联网高地 OpenAI夺冠：人工智能为云计算带来新变革 AI框架生态峰会本周开幕华为昇腾“朋友圈”再聚首全球首个全模态大模型将登场将上下文长度扩展到256k，无限上下文版本的LongLLaMA来了？ 650亿参数，8块GPU就能全参数微调：邱锡鹏团队把大模型门槛打下来了当科幻走进现实脑机接口新技术能为生活带来哪些惊喜？ 70年前他本想逃避考试，却影响了整个互联网软通动力天枢元宇宙研究院签约落户江宁高新区国内首款大尺寸仿鸵双足机器人“大圣”亮相，穿戴红色战袍两型无人机完成交付！国家级机动观测业务正式启动 GPT-4 模型架构泄露：包含 1.8 万亿参数、采用混合专家模型有 ARM 和 X86 两个版本，香橙派游戏掌机细节曝光谷歌借AI打破十年排序算法封印，每天被执行数万亿次，网友却说是最不切实际的研究？ “痴迷”元宇宙，魔珐科技想做什么？人工智能赋能无人驾驶：商业化进程再提速导演郭帆：人工智能应用可能会影响《流浪地球 3》的创作开发马斯克WAIC2025演讲全文：AI将对人类文明产生深远影响亚太地区 70% 的企业高管正探索生成式 AI 应用或已经进行投资全面拥抱大模型浪潮，ISC 2025打造全球首场AI数字安全峰会看懂AI，找到增长新势能 | 笔记侠AI峰会等你来 AI技术改变*，新骗局来袭，*成功率接近100% 社区里，孩子们体验“机器人竞技” Meta Quest订阅服务每月7.99美元畅玩两款VR游戏应用昇腾AI & 讯飞星火：深度联手，共话国产大模型“大未来” 业内领先四川大学华西第四医院甲状腺乳腺外科成功进入手术机器人时代微软Xbox称VR和AR还需要时间先玩大的亚马逊CEO：人工智能将成为公司未来战略的重中之重 618京东3C数码趋势产品备受青睐 AR设备成交额同比增长15倍 AI工具助力公司实施每周4.5天工作制，带来巨大效益猿编程参加人工智能高峰论坛，推动人工智能教育解决方案在千所学校推行世界人工智能大会中西部县域数字就业中心组团亮相日本演员工会提出AI立法建议要求建立“声音肖像权” 能源电力数字化转型恰逢其时生成式AI与云结合，机遇与挑战并存国内通用人形机器人将发布、产业加速突破赋能选题探索：AI助手在经济学专业中的应用指南标贝科技亮相国际顶会ICASSP2025 加速布局海外AI数据市场 AI成政客博弈工具，美国大选真假难辨，律师们的生意来了美图设计室2.0什么时候上线成功孵化首个大型模型解决方案的重庆人工智能创新中心实践J*a开发，构建高性能的MongoDB数据迁移工具 LinkedIn 推出生成式 AI 辅助撰写帖文功能，将向所有用户开放科学家称，面对人工智能，人类未来或只有灭亡与虚拟永生两个选择 MetaGPT开源框架爆红 GitHub，达到1.1万星，模拟软件开发流程 AI 作画工具 Midjourney 推出“pan”功能，可平移扩展图片外场景 GPT-4最全攻略来袭！OpenAI官方发布，六个月攒下来的使用经验都在里面了 AYANEO AIR 1S 掌机发布：R7 7840U，预订价 4699 元起 12页线性代数笔记登GitHub热榜，还获得了Gilbert Strang大神亲笔题词构建人机交互创新模式，微美全息研究AIGC智能交互界面生成技术为什么很多人对纽约《人工智能招聘法》感到生气？

上一篇：Stable Diffusion 3论文终于发布，架构细节大

下一篇：AWS的CISO：GenAI只是一个工具，不是万能钥匙

400 128 6709

E-mail

contact@tlftec.cn

扫一扫，添加微信

© 云南淘乐房科技有限公司版权所有滇ICP备2025071560号