400 128 6709

行业新闻

跨模态占据性知识的学习:使用渲染辅助蒸馏技术的RadOcc

发布时间:2024-01-25点击次数:

原标题:radocc: learning cross-modality occupancy knowledge through rendering assisted distillation

论文链接:https://arxiv.org/pdf/2312.11829.pdf

作者单位:FNii, CUHK-Shenzhen SSE, CUHK-Shenzhen 华为诺亚方舟实验室

会议:AAAI 2025

RadOcc:通过渲染辅助蒸馏学习跨模态Occupancy知识

论文思路:

3D 占用预测是一项新兴任务,旨在使用多视图图像估计 3D 场景的占用状态和语义。然而,由于缺乏几何先验,基于图像的场景感知在实现准确预测方面遇到了重大挑战。本文通过探索该任务中的跨模态知识蒸馏来解决这个问题,即,本文在训练过程中利用更强大的多模态模型来指导视觉模型。在实践中,本文观察到直接应用,在鸟瞰(BEV)感知中提出并广泛使用的特征或 logits 对齐,并不能产生令人满意的结果。为了克服这个问题,本文引入了 RadOcc,一种用于 3D 占用预测的渲染辅助蒸馏范式。通过采用可微体渲染(differentiable volume rendering),本文在透视图中生成深度和语义图,并提出了教师和学生模型的渲染输出之间的两个新颖的一致性标准(consistency criteria)。具体来说,深度一致性损失对齐渲染光线的终止分布(termination distributions),而语义一致性损失则模仿视觉基础模型(VLM)引导的 intra-segment 相似性。nuScenes 数据集上的实验结果证明了本文提出的方法在改进各种 3D 占用预测方法方面的有效性,例如,本文提出的方法在 mIoU 指标中将本文的基线提高了 2.2%,在 Occ3D 基准中达到了 50%。

主要贡献:

本文介绍了一种名为RadOcc的渲染辅助蒸馏范式,用于3D占用预测。这是第一篇探索3D-OP中跨模态知识蒸馏的论文,为现有BEV蒸馏技术在该任务中的应用提供了有价值的见解。

作者提出了两种新颖的蒸馏约束,即渲染深度和语义一致性(RDC和RSC)。这些约束通过对齐由视觉基础模型引导的光线分布和关联矩阵,有效地增强了知识迁移过程。这种方法的关键在于利用深度和语义信息来引导渲染过程,从而提高了渲染结果的质量和准确性。通过将这两种约束结合起来,研究人员取得了显著的改进,为视觉任务中的知识迁移提供了新的解决方案。

配备所提出的方法,RadOcc 在 Occ3D 和 nuScenes 基准上表现出了最先进的密集和稀疏占用预测性能。此外,实验证明了本文提出的蒸馏方法可以有效地提升多个基线模型的性能。

网络设计:

本文首次研究了针对3D占用预测任务的跨模态知识蒸馏。以BEV感知领域利用BEV或logits一致性进行知识迁移的方法为基础,本文将这些蒸馏技术扩展到3D占用预测任务中,旨在对齐体素特征和体素logits,如图1(a)所示。然而,初步实验表明,这些对齐技术在3D-OP任务中面临重大挑战,特别是前一种方法引入了负迁移。这一挑战可能源于3D目标检测和占用预测之间的根本差异,后者作为一项更细粒度的感知任务,需要捕获几何细节以及背景目标。

Machine Translation Machine Translation

聚合多个来源的AI翻译

Machine Translation 49 查看详情 Machine Translation

为了解决上述挑战,本文提出了 RadOcc,这是一种利用可微体渲染进行跨模态知识蒸馏的新颖方法。RadOcc的核心思想是对教师模型和学生模型生成的渲染结果进行对齐,如图1(b)所示。具体来说,本文使用相机的内参和外参对体素特征进行体渲染(Mildenhall et al. 2025),这使本文能够从不同的视点获得相应的深度图和语义图。为了实现渲染输出之间更好的对齐,本文引入了新颖的渲染深度一致性(RDC)和渲染语义一致性(RSC)损失。一方面,RDC 损失强制光线分布(ray distribution)的一致性,这使得学生模型能够捕获数据的底层结构。另一方面,RSC 损失利用了视觉基础模型的优势(Kirillov et al. 2025),并利用预先提取的 segment 进行 affinity 蒸馏。该标准允许模型学习和比较不同图像区域的语义表示,从而增强其捕获细粒度细节的能力。通过结合上述约束,本文提出的方法有效地利用了跨模态知识蒸馏,从而提高了性能并更好地优化了学生模型。本文展示了本文的方法在密集和稀疏占用预测方面的有效性,并在这两项任务上取得了最先进的结果。

RadOcc:通过渲染辅助蒸馏学习跨模态Occupancy知识

图 1:渲染辅助蒸馏。(a) 现有方法对特征或 logits 进行对齐。(b) 本文提出的 RadOcc 方法同时约束渲染的深度图和语义。RadOcc:通过渲染辅助蒸馏学习跨模态Occupancy知识图2:RadOcc的总体框架。它采用师生架构,其中教师网络是多模态模型,而学生网络仅接受相机输入。两个网络的预测将用于通过可微分体渲染(differentiable volume rendering)生成渲染深度和语义。渲染结果之间采用了新提出的渲染深度和语义一致性损失。

RadOcc:通过渲染辅助蒸馏学习跨模态Occupancy知识

图 3:渲染深度分析。尽管教师(T)和学生(S)的渲染深度相似,特别是对于前景物体,但它们的光线终止分布显示出很大的差异。

RadOcc:通过渲染辅助蒸馏学习跨模态Occupancy知识

图 4:affinity matrix 的生成。本文首先采用视觉基础模型(VFM),即 SAM,将 segments 提取到原始图像中。之后,本文对每个 segment 中渲染的语义特征进行 segment 聚合,获得 affinity matrix 。

实验结果:

RadOcc:通过渲染辅助蒸馏学习跨模态Occupancy知识

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

RadOcc:通过渲染辅助蒸馏学习跨模态Occupancy知识RadOcc:通过渲染辅助蒸馏学习跨模态Occupancy知识

RadOcc:通过渲染辅助蒸馏学习跨模态Occupancy知识

RadOcc:通过渲染辅助蒸馏学习跨模态Occupancy知识

RadOcc:通过渲染辅助蒸馏学习跨模态Occupancy知识

总结:

本文提出了 RadOcc,一种用于 3D 占用预测的新型跨模态知识蒸馏范式。它利用多模态教师模型通过可微分体渲染(differentiable volume rendering)为视觉学生模型提供几何和语义指导。此外,本文提出了两个新的一致性标准,深度一致性损失和语义一致性损失,以对齐教师和学生模型之间的 ray distribution 和 affinity matrix 。对 Occ3D 和 nuScenes 数据集的大量实验表明,RadOcc 可以显着提高各种 3D 占用预测方法的性能。本文的方法在 Occ3D 挑战基准上取得了最先进的结果,并且大大优于现有已发布的方法。本文相信本文的工作为场景理解中的跨模态学习开辟了新的可能性。

以上就是跨模态占据性知识的学习:使用渲染辅助蒸馏技术的RadOcc的详细内容,更多请关注其它相关文章!


# 多模  # 网站建设保障效果  # 廊坊网站建设欢迎洽谈  # 嘉峪关关键词优化排名  # 苏州抖音seo哪家好点  # 伊春网络推广营销  # 文登网站建设企业  # 宁夏抖音seo是什么  # 江西seo入门是什么软件  # seo教学 华网天下  # 阜新网站优化找谁好做  # 3D  # 提高了  # 取得了  # 多个  # 十大  # 出了  # 最先进  # 前十  # 提出了  # 模态  # 预测 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: 山东机器人编程:Scratch编程基础,认识舞台!~济南机器人编程  WAIC 2025|云深处科技绝影Lite3与X20四足机器人亮相  提升工作效率的智能工具:Zapier 让工作变得更简单!  人形机器人概念集体爆发,能买吗?  音乐制作元工具AudioCraft发布开源AI工具  2025 年开发者必须知道的六个 AI 工具  推动企业数字化转型升级!“松江智造”摘世界人工智能大会重磅奖项  ChatGPT大更新!OpenAI奉上程序员大礼包:API新增杀手级能力还降价,新模型、四倍上下文都来了  VR健身应用《FitXR》将取消Quest 1端会员服务  元宇宙迈入2.0时代,它和生成式人工智能有何关联吗?  复旦发布「新闻推荐生态系统模拟器」SimuLine:单机支持万名读者、千名创作者、100+轮次推荐  AI数字人业务频频获点赞,谦寻积极引领示范作用  RoboNeo安装教程  中国联通发布图文AI大模型,可实现以文生图、视频剪辑  生成式AI爆发,亚马逊云科技持续专注创新,助力企业数字化转型  令人震惊的特斯拉机器人  北京市元宇宙产业创新中心筹建工作正式启动  MiracleVision视觉大模型  小米又拿下国际比赛第一:AI翻译立功  真全息产品,亮相深圳文博会——dipal数伴拓展元宇宙非沉浸式体验  2025世界人工智能大会前沿科技共绘“未来”图景, 这家这家独角兽企业的通用大脑将在AI领域大放异彩  2025智源大会AI安全话题备受关注,《人机对齐》新书首发  AI 作画工具 Midjourney 推出“pan”功能,可平移扩展图片外场景  “三夏”农忙保障用电,无人机高空巡视高压线  Prompt解锁语音语言模型生成能力,SpeechGen实现语音翻译、修补多项任务  谷歌将使用公开信息训练 AI 模型,构建更强大的自家产品  如何获得元宇宙的第一个属于自己的空间  人工智能和你聊天 成本有多高  兆讯传媒率先全面拥抱AI 数智广告内容焕发新生机  Meta发布语音AI模型 Voicebox 助虚拟助手与NPC对话  史玉柱谈AI:国内最缺是计算数学人才,曾给浙大数学系捐五千万  小艺将具备大模型能力,鸿蒙4加速AI普及之路  人工智能时代 数字文明对话向“尼”走来  联想浏览器引入小乐 AI 助手,成功接入百度文心一言大模型,经过实测证实  英国前首相:AI可能被用来制造“生物恐怖武器”  美图公司吴欣鸿:AI技术重构影像产业  如布AI口袋学习机S12 将亮相综艺节目《好样的!国货》  曝索尼在开发新头显设备:游戏中使用AR技术  人工智能领域,突破难题:国产大模型“无源之水”问题得到解决。  AMD称下半年AI显卡供应充足,不需要像NVIDIA那样加价抢购  央视报道!星纪魅族集团车载人机交互技术成世界移动通信大会焦点  AI创作广告文案等同2.47年工作经验,且消费者无法区分|AI营销前沿  OpenAI宣布在伦敦设立海外分部,要招揽“世界级人才”  下一个前沿:量子机器学习和人工智能的未来  扎克伯格吐槽苹果Vision Pro:社交落后Meta太多,无法建设元宇宙  如何对员工进行再培训以充分利用供应链管理中的人工智能创新  普渡机器人与变形金刚品牌合作,特别活动爆火,商品售罄!  喜马拉雅在国际会议挑战赛中突破语音重叠难题斩获第一 加速AI创新  “踩油门,也要会踩刹车” 互联网企业高管谈人工智能发展  世界周刊丨AI“棱镜”? 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司