发布时间:2024-06-25
点击次数: 当前的多模态和多任务基础模型,如 **4m** 或 **unifiedio**,显示出有希望的结果。然而,它们接受不同输入和执行不同任务的开箱即用能力,受到它们接受训练的模态和任务的数量(通常很少)的限制。
,基于此,来自洛桑联邦理工学院(EPFL)和苹果的研究者联合开发了一个**先进的**任意到任意模态单一模型,该模型在数十种**广泛**多样化的模态上进行训练,并对大规模多模态数据集和文本语料库进行协同训练。
训练过程中一个关键步骤是对各种模态执行离散 **tokenization**,无论它们是类似图像的神经网络 **feature map**、向量、实例分割或人体姿态等结构化数据,还是可以表征为文本的数据。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

论文地址:https://arxiv.org/pdf/2406.09406
论文主页 https://4m.epfl.ch/
论文标题:4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities
该研究展示了训练单一模型,也能完成现有模型至少**三倍**多的任务 / **模态**,并且不会损失性能。此外,该研究还实现了更细粒度和更可控的多**模态**生成能力。
该研究建立在多模态掩码预训练方案的基础上,并通过在数十种高度多样化的模态上进行训练来提升**模型**能力。通过使用特定于模态的离散分词器对其进行编码,该研究实现了在不同模态上训练单个统一**模型**。
简单来说,该研究在几个关键维度上扩展了现有模型的功能:
模态:从现有最佳任意到任意模型的 7 种模态增加到 21 种不同模态,从而实现跨模态检索、可控生成和强大的开箱即用性能。这是第一次单个视觉模型可以以任意到任意的方式解决数十个不同的任务,而不会损害性能,并且没有任何传统的多任务学习。
多样性:添加对更多结构化数据的支持,例如人体姿态、SAM 实例、元数据等等。
tokenization:使用特定于模态的方法研究不同模态的离散 tokenization,例如全局图像嵌入、人体姿态和语义实例。
扩展:将模型大小扩展至 3B 参数,将数据集扩展至 0.5B 样本。
协同训练:同时在视觉和语言上协同训练。
方法介绍
该研究采用 4M 预训练方案(该研究同样来自 EPFL 和苹果,在去年发布),其被证明是一种通用方法,可以有效扩展到多模态。
具体而言,本文保持架构和多模态掩码训练目标不变,通过扩大模型和数据集的规模、增加训练模型所涉及的模态类型和数量,并且在多个数据集上进行联合训练,可以提升模型的性能和适应性。
模态分为以下几大类别:RGB、几何、语义、边缘、特征图、元数据和文本,如下图所示。

Tokenization
Tokenization 主要包括将不同模态和任务转换为序列或离散 token,从而统一它们的表示空间。研究者使用不同的 tokenization 方法来离散具有不同特征的模态,如图 3 所示。总而言之,本文采用了三种 tokenizer,包括 ViT tokenizer、MLP tokenizer 以及文本 tokenizer。

灵感PPT
AI灵感PPT - 免费一键PPT生成工具
308
查看详情
在架构选择上,本文采用基于 Transformer 的 4M 编码器 - 解码器架构,并添加额外的模态嵌入以适应新模态。
实验结果
接下来,论文展示了 4M-21 多模态能力。
多模态生成
基于迭代解码 token ,4M-21 可以用来预测任意训练模态。如图 2 所示,本文可以从给定的输入模态以一致的方式生成所有模态。
此外,由于该研究可以有条件和无条件地从其他模态的任何子集生成任何训练模态,因此它支持几种方法来执行细粒度和多模态生成,如图 4 所示,例如执行多模态编辑。此外,4M-21 表现出改进的文本理解能力,无论是在 T5-XXL 嵌入上还是在常规字幕上,都可以实现几何和语义上合理的生成(图 4,右上)。

多模态检索
如图 5 所示,4M-21 解锁了原始 DINOv2 和 ImageBind 模型无法实现的检索功能,例如通过使用其他模态作为查询来检索 RGB 图像或其他模态。此外,4M-21 还可以组合多种模态来预测全局嵌入,从而更好地控制检索,如右图所示。

开箱即用
4M-21 能够开箱即用地执行一系列常见的视觉任务,如图 6 所示。

表 1 评估了 DIODE 表面法线和深度估计、COCO 语义和实例分割、3DPW 3D 人体姿态估计等。

迁移实验
此外,本文还训练了三种不同尺寸的模型:B、L 和 XL。然后,将其编码器迁移到下游任务,并在单模态 (RGB) 和多模态 (RGB + 深度) 设置上进行评估。所有迁移实验均丢弃解码器,而是训练特
定任务的头部。结果如表 2 所示:

最后,本文在 NYUv2、Hypersim 语义分割和 ARKitScenes 上的 3D 对象检测上执行多模态传输。如表 3 所示,4M-21 充分利用了可选的深度输入,并显著改进了基线。

以上就是太全了!苹果上新视觉模型4M-21,搞定21种模态的详细内容,更多请关注其它相关文章!
# 三种
# 珠海网站建设案例课堂
# 引流seo推广哪家有名
# 企业网站优化软件优化
# 苏州网站建设小程序
# 抚州网站建设推广方案公示
# 网站推广咨询天天软文
# 武汉seo运营招聘
# 保定网站推广推荐
# 如何分析别人网站seo
# seo软件没用
# 量产
# 工程
# 即用
# 是在
# 如图
# 多模
# 上新
# 所示
# 模态
# 洛桑联邦理工学院
# 4m-21
# 苹果公司
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
人工智能在交通领域的革新:智能解决方案彻底改变交通方式
马斯克回应人工智能拯救世界:人类已处于“半机器人”状态
AI大模型火了!科技巨头纷纷加入,多地政策加码加速落地
探展WAIC |万向区块链杜宇:不存在单一技术的iPhone时刻,Web3.0核心将基于AI+区块链+物联网
掌阅科技申请阅爱聊商标 掌阅科技申请AI相关商标
看懂AI,找到增长新势能 | 笔记侠AI峰会等你来
导演郭帆:人工智能应用可能会影响《流浪地球 3》的创作开发
陈根教授:离人形机器人时代还有10年吗?
V社回应拒绝上架含 AI 生成内容的游戏:审核政策正在调整中
笔神作文声讨学而思AI大模型 称用“爬虫”技术盗取数据
调查显示:实际上没有那么多人在用 ChatGPT
为了避免人工智能可能带来的灾难,我们要向核安全学习
微软必应聊天现已在Chrome和Safari浏览器上可用,但仍有许多限制存在
科技数码圈的新物种 乐天派桌面机器人 AI +安卓+机器人 首发价1799元
月薪6万,哪些AI岗位在抢人?
实践J*a开发,构建高性能的MongoDB数据迁移工具
美图公司吴欣鸿:AI技术重构影像产业
探展WAIC | 第四范式“式说”聚焦toB大模型,布局生成式AI重构企业软件
微软 Azure AI 文本转语音服务升级:新增男性声音和扩展语言支持
科学家称,面对人工智能,人类未来或只有灭亡与虚拟永生两个选择
联想创投携手12家被投企业MWC展示元宇宙、机器人等技术
天翼云在国际AI顶会大模型挑战赛中获得冠军
推动综合能源服务高质量发展
十个AI算法常用库J*a版
第四范式「式说」大模型入选《2025年通用人工智能创新应用案例集》
套娃不可取:研究人员证实用AI生成的结果训练AI将导致模型退化
丰田汽车研究院推出生成式人工智能汽车设计工具
万兴播爆桌面端上线,支持AI数字人搜索、视频编辑等功能
衡水市冀州中学机器人社团在世界机器人大赛中斩获佳绩
国产医疗企业的人工智能
无人机巡检方案是什么,该如何选择适合的巡检方案
Dubbo负载均衡策略之 一致性哈希
编程版GPT狂飙30星,AutoGPT危险了!
腾讯TRS之元学习与跨域推荐的工业实战
一文看懂被英伟达看中的九号机器人移动底盘
助力人工智能产业高质量发展 龙岗区算法训练基地正式启用
国网辉南供电:无人机空中巡检 全力护航端午佳节
人工智能在项目管理中的作用
Meta 人工智能业务落后竞争对手,研究人员大量离职成重要原因
东软成立魔形科技研究院,积极布局大语言模型系统工程战略,迎接AI时代
类GPT模型训练提速26.5%,清华朱军等人用INT4算法加速神经网络训练
OpenAI限制网络爬虫访问以保护数据免被用于AI模型训练
兆讯传媒率先全面拥抱AI 数智广告内容焕发新生机
AI 助手 Copilot 上线,微软 Win11 Dev 预览版 Build 23493 发布
数据显示:人工智能相关专业热度上升最快 考古、美术、生物医学工程等小众专业火了
Gartner发布中国企业人工智能趋势浪潮3.0
RoboNeo安装教程
扎克·施奈德新片《月球叛军》曝剧照 机器人首度现身
曝光HarmonyOS 4的重要新能力:全面升级AI大模型,小艺实现全面进化
2025 年开发者必须知道的六个 AI 工具