400 128 6709

行业新闻

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

发布时间:2024-03-06点击次数:

Stability AI在发布了Stable Diffusion 3之后,今天公布了详细的技术报告。

论文深入分析了Stable Diffusion 3的核心技术——改进版的Diffusion模型和一个基于DiT的文生图全新架构!

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

报告地址:

https://www.php.cn/link/e5fb88b398b042f6cccce46bf3fa53e8

通过人类评价测试,Stable Diffusion 3在字体设计和对提示的精准响应方面,超过了DALL·E 3、Midjourney v6和Ideogram v1。

Stability AI最新开发的多模态扩散Transformer(MMDiT)架构,使用了专门针对图像和语言表示的独立权重集。与SD 3的早期版本相比,MMDiT在文本理解和拼写方面取得了显著的提升。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

性能评估

在人类反馈的基础之上,技术报告将SD 3于大量开源模型SDXL、SDXL Turbo、Stable Cascade、Playground v2.5 和 Pixart-α,以及闭源模型DALL·E 3、Midjourney v6 和 Ideogram v1进行了详细的对比评估。

评估员根据指定提示的一致性、文本的清晰度和图像的整体美观性来选择每个模型的最佳输出。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

测试结果显示,无论是在遵循提示的准确性、文本的清晰呈现还是图像的视觉美感方面,Stable Diffusion 3都达到或超过了当前文生图生成技术的最高水平。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

完全没有针对硬件进行过优化的SD 3模型具有8B参数,能够在24GB显存的RTX 4090消费级GPU上运行,并且在使用50个采样步骤的情况下,生成1024x1024分辨率的图像需耗时34秒。

此外,Stable Diffusion 3在发布时将提供多个版本,参数范围从8亿到80亿,从而能以进一步降低使用的硬件门槛。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

架构细节曝光

在文生图的过程中,模型需同时处理文本和图像这两种不同的信息。所以作者将这个新框架称之为MMDiT。

在文本到图像生成的过程中,模型需同时处理文本和图像这两种不同的信息类型。这就是作者将这种新技术称为MMDiT(多模态Diffusion Transformer的简称)的原因。

与Stable Diffusion之前的版本一样,SD 3采用了预训练模型来提取适合的文本和图像的表达形式。

具体而言,他们利用了三种不同的文本编码器——两个CLIP模型和一个T5 ——来处理文本信息,同时使用了一个更为先进的自编码模型来处理图像信息。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

SD 3的架构是在Diffusion Transformer(DiT)的基础上建立的。由于文本和图像信息的差异,SD 3为这两种信息各自设置了独立的权重。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

这种设计相当于为每种信息类型配备了两个独立的Transformer,但在执行注意力机制时,会将两种信息的数据序列合并,这样就可以在各自的领域内独立工作的同时,能保持够相互参考和融合。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

通过这种独特的构架,图像和文本信息之间可以相互流动和交互,从而在生成的结果中提高对内容的整体理解和视觉表现。

而且,这种架构未来还可以轻松扩展到其他包括视频在内的多种模态。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

得益于SD 3在遵循提示方面的进步,模型能够精确生成集中于多种不同主题和特性的图像,同时在图像风格上也保持了极高的灵活性。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

通过重赋权法改进Rectified Flow

Machine Translation Machine Translation

聚合多个来源的AI翻译

Machine Translation 49 查看详情 Machine Translation

除了推出的全新Diffusion Transformer构架之外,SD 3对于Diffusion模型也进行了重大的改进。

SD 3采用了Rectified Flow(RF)策略,将训练数据和噪声沿着直线轨迹连接起来。

这种方法让模型的推理路径更加直接,因此可以通过更少的步骤完成样本的生成。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

作者在训练流程中引入了一种创新的轨迹采样计划,特别增加了对轨迹中间部分的权重,这些部分的预测任务更具挑战性。

通过与其他60种扩散轨迹(例如 LDM、EDM 和 ADM)进行比较,作者发现尽管之前的RF方法在少步骤采样中表现更佳,但随着采样步骤增多,性能会慢慢下降。

为了避免这种情况的出现,作者提出的加权RF方法,就能够持续提升模型性能。

扩展RF Transformer模型

Stability AI训练了多个不同规模的模型,从 15 个模块、450M参数到38个模块、8B参数,发现模型大小和训练步骤都能平滑地降低验证损失。

为了验证这是否意味着模型输出有实质性的改进,他们还评估了自动图像对齐指标和人类偏好评分。

结果表明,这些评估指标与验证损失强相关,说明验证损失是衡量模型整体性能的有效指标。

此外,这种扩展趋势没有达到饱和点,让我们对未来能够进一步提升模型性能持乐观态度。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

作者在256 *256像素分辨率下,在4096的批大小下,用不同参数数对模型进行了500k步训练。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

上图说明了长时间训练较大模型对样本质量的影响。

上表显示了GenEval的结果。当使用作者提出的训练方法并提高训练图像的分辨率时,最大的模型在大多数类别中都表现出色,在总分上超过了 DALL·E 3。

根据作者对不同构架模型的测试对比,MMDiT效果非常好,超过了DiT,Cross DiT,UViT,MM-DiT。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

灵活的文本编码器

通过在推理阶段去除占用大量内存的4.7B参数的T5文本编码器,SD 3的内存需求得到了大幅降低,而性能损失微乎其微。

去除这个文本编码器不会影响图像的视觉美感(不使用T5的胜率为 50%),只会略微降低文本的准确遵循能力(胜率为46%)。

然而,为了充分发挥SD 3在生成文字的能力,作者还是建议使用T5编码器。

因为作者发现在没有它的情况下,排版生成文字的性能会有更大的下降(胜率为 38%)。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

网友热议

网友们对Stability AI不断撩拨用户但是不让用的行为显得有些不耐烦了,纷纷催促赶快上线让大家使用。

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

看了技术报考后,网友说看来现在生图圈子要成第一个开源碾压闭源的赛道了!

Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?

以上就是Stable Diffusion 3技术报告流出,Sora构架再立大功!生图圈开源暴打Midjourney和DALL·E 3?的详细内容,更多请关注其它相关文章!


# 丰田  # 网站建设美丽芭蕾  # 智库营销推广公司  # hexo seo设置  # 请seo唱歌多少钱  # 荆门营销推广公司  # seo做网站赚钱吗  # 东城区综合网站建设操作  # 西乡seo优化学习  # 一元网站建设  # 上海培训seo  # 胜率  # 进行了  # 超过了  # 模型  # 是在  # 这两种  # 中国科学院  # 多个  # 暴打  # 开源  # playg  # ideogram  # midjourney  # stable diffusion  # sora  # follow  # 测评 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: “技术+实践+生态”三箭齐发,京东方抢占物联网高地  OpenAI夺冠:人工智能为云计算带来新变革  AI框架生态峰会本周开幕 华为昇腾“朋友圈”再聚首 全球首个全模态大模型将登场  将上下文长度扩展到256k,无限上下文版本的LongLLaMA来了?  650亿参数,8块GPU就能全参数微调:邱锡鹏团队把大模型门槛打下来了  当科幻走进现实 脑机接口新技术能为生活带来哪些惊喜?  70年前他本想逃避考试,却影响了整个互联网  软通动力天枢元宇宙研究院签约落户江宁高新区  国内首款大尺寸仿鸵双足机器人“大圣”亮相,穿戴红色战袍  两型无人机完成交付!国家级机动观测业务正式启动  GPT-4 模型架构泄露:包含 1.8 万亿参数、采用混合专家模型  有 ARM 和 X86 两个版本,香橙派游戏掌机细节曝光  谷歌借AI打破十年排序算法封印,每天被执行数万亿次,网友却说是最不切实际的研究?  “痴迷”元宇宙,魔珐科技想做什么?  人工智能赋能无人驾驶:商业化进程再提速  导演郭帆:人工智能应用可能会影响《流浪地球 3》的创作开发  马斯克WAIC2025演讲全文:AI将对人类文明产生深远影响  亚太地区 70% 的企业高管正探索生成式 AI 应用或已经进行投资  全面拥抱大模型浪潮,ISC 2025打造全球首场AI数字安全峰会  看懂AI,找到增长新势能 | 笔记侠AI峰会等你来  AI技术改变*,新骗局来袭,*成功率接近100%  社区里,孩子们体验“机器人竞技”  Meta Quest订阅服务每月7.99美元畅玩两款VR游戏应用  昇腾AI & 讯飞星火:深度联手,共话国产大模型“大未来”  业内领先 四川大学华西第四医院甲状腺乳腺外科成功进入手术机器人时代  微软Xbox称VR和AR还需要时间 先玩大的  亚马逊CEO:人工智能将成为公司未来战略的重中之重  618京东3C数码趋势产品备受青睐 AR设备成交额同比增长15倍  AI工具助力公司实施每周4.5天工作制,带来巨大效益  猿编程参加人工智能高峰论坛,推动人工智能教育解决方案在千所学校推行  世界人工智能大会中西部县域数字就业中心组团亮相  日本演员工会提出AI立法建议 要求建立“声音肖像权”  能源电力数字化转型恰逢其时  生成式AI与云结合,机遇与挑战并存  国内通用人形机器人将发布、产业加速突破  赋能选题探索:AI助手在经济学专业中的应用指南  标贝科技亮相国际顶会ICASSP2025 加速布局海外AI数据市场  AI成政客博弈工具,美国大选真假难辨,律师们的生意来了  美图设计室2.0什么时候上线  成功孵化首个大型模型解决方案的重庆人工智能创新中心  实践J*a开发,构建高性能的MongoDB数据迁移工具  LinkedIn 推出生成式 AI 辅助撰写帖文功能,将向所有用户开放  科学家称,面对人工智能,人类未来或只有灭亡与虚拟永生两个选择  MetaGPT开源框架爆红 GitHub,达到1.1万星,模拟软件开发流程  AI 作画工具 Midjourney 推出“pan”功能,可平移扩展图片外场景  GPT-4最全攻略来袭!OpenAI官方发布,六个月攒下来的使用经验都在里面了  AYANEO AIR 1S 掌机发布:R7 7840U,预订价 4699 元起  12页线性代数笔记登GitHub热榜,还获得了Gilbert Strang大神亲笔题词  构建人机交互创新模式,微美全息研究AIGC智能交互界面生成技术  为什么很多人对纽约《人工智能招聘法》感到生气? 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司