400 128 6709

行业新闻

Sparse4D v3来了!推进端到端3D检测和跟踪

发布时间:2023-11-24点击次数:

新标题:sparse4d v3:推进端到端的3d检测和跟踪技术

论文链接:https://arxiv.org/pdf/2311.11722.pdf

需要重新写的内容是:代码链接:https://github.com/linxuewu/Sparse4D

重新写的内容:作者所属单位为地平线公司

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

Sparse4D v3来了!推进端到端3D检测和跟踪

论文思路:

在自动驾驶感知系统中,3D检测和跟踪是两项基本任务。本文基于 Sparse4D 框架更深入地研究了该领域。本文引入了两个辅助训练任务(时序实例去噪-Temporal Instance Denoising和质量估计-Quality Estimation),并提出解耦注意力(decoupled attention)来进行结构改进,从而显着提高检测性能。此外,本文使用一种简单的方法将检测器扩展到跟踪器,该方法在推理过程中分配实例 ID,进一步突出了 query-based 算法的优势。在 nuScenes 基准上进行的大量实验验证了所提出的改进的有效性。以ResNet50为骨干,mAP、NDS和AMOTA分别提高了3.0%、2.2%和7.6%,分别达到46.9%、56.1%和49.0%。本文最好的模型在 nuScenes 测试集上实现了 71.9% NDS 和 67.7% AMOTA

主要贡献:

Sparse4D-v3 是一个强大的 3D 感知框架,它提出了三种有效的策略:时序实例去噪、质量估计和解耦注意力

本文将 Sparse4D 扩展为端到端跟踪模型。

本文展示了 nuScenes 改进的有效性,在检测和跟踪任务中实现了最先进的性能。

网络设计:

首先,观察到与稠密算法相比,稀疏算法在收敛方面面临更大的挑战,从而影响了最终性能。这个问题已经在2D检测领域得到了充分研究[17,48,53],主要原因是稀疏算法使用了一对一的正样本匹配。这种匹配方式在训练初期不稳定,而且与一对多匹配相比,正样本数量有限,从而降低了解码器训练的效率。此外,Sparse4D使用稀疏特征采样而不是全局交叉注意力,由于正样本稀缺,这进一步阻碍了编码器的收敛。在Sparse4Dv2中,引入了密集深度监督来部分缓解图像编码器面临的这些收敛问题。本文的主要目标是通过关注解码器训练的稳定性来增强模型性能。本文将去噪任务作为辅助监督,并将去噪技术从2D单帧检测扩展到3D时序检测。这不仅保证了稳定的正样本匹配,而且显著增加了正样本的数量。此外,本文还引入了质量评估任务作为辅助监督。这使得输出的置信度分数更加合理,提高了检测结果排名的准确性,从而获得更高的评估指标。此外,本文改进了Sparse4D中实例自注意力和时序交叉注意力模块的结构,引入了一种解耦注意力机制,旨在减少注意力权重计算过程中的特征干扰。通过将锚点嵌入和实例特征作为注意力计算的输入,可以减少注意力权重中存在异常值的实例。这样可以更准确地反映目标特征之间的相互关联,从而实现正确的特征聚合。本文使用连接而不是注意力机制来显著减少这种错误。这种增强方法与条件DETR有相似之处,但关键区别在于本文强调查询之间的注意力,而条件DETR则专注于查询和图像特征之间的交叉注意力。此外,本文还涉及独特的编码方法

为了提高感知系统的端到端能力,本文研究了将3D多目标跟踪任务集成到Sparse4D框架中的方法,以直接输出目标的运动轨迹。与基于检测的跟踪方法不同,本文通过消除数据关联和过滤的需求,将所有跟踪功能整合到检测器中。此外,与现有的联合检测和跟踪方法不同,本文的跟踪器在训练过程中无需进行修改或调整损失函数。它不需要提供ground truth IDs,而是实现了预定义的实例到跟踪的回归。本文的跟踪实现充分融合了检测器和跟踪器,无需修改检测器的训练过程,也无需额外微调

TTSMaker TTSMaker

TTSMaker是一个免费的文本转语音工具,提供语音生成服务,支持多种语言。

TTSMaker 2275 查看详情 TTSMaker

Sparse4D v3来了!推进端到端3D检测和跟踪

这是一个关于Sparse4D框架概述的图1,输入是多视图视频,输出是所有帧的感知结果

Sparse4D v3来了!推进端到端3D检测和跟踪

图 2:不同算法的 nuScenes 验证数据集上的推理效率 (FPS) - 感知性能 (mAP)。

Sparse4D v3来了!推进端到端3D检测和跟踪

图 3:实例自注意力中的注意力权重的可视化:1)第一行显示了普通自注意力中的注意力权重,其中红色圆圈中的行人显示出与目标车辆(绿色框)的意外相关性。2)第二行显示了解耦注意力中的注意力权重,有效解决了该问题。

Sparse4D v3来了!推进端到端3D检测和跟踪

第四张图展示了时序实例去噪的示例。在训练阶段,实例包括两个部分:可学习的和噪声的。噪声实例由时间和非时间元素组成。本文采用预匹配方法来分配正样本和负样本,即将 anchors 与 ground truth 进行匹配,而可学习实例则与预测和 ground truth 进行匹配。在测试阶段,只保留绿色块。为防止特征在 groups 之间传播,采用了 Attention mask,灰色表示 queries 和 keys 之间没有注意力,绿色表示相反

Sparse4D v3来了!推进端到端3D检测和跟踪

请看图5:锚点编码器和注意力的架构。本文独立地对锚点的多个组件进行了高维特征编码,然后将它们连接起来。与原始的Sparse4D相比,这种方法可以减少计算和参数的开销。E和F分别表示锚点嵌入和实例特征

Sparse4D v3来了!推进端到端3D检测和跟踪

实验结果:

Sparse4D v3来了!推进端到端3D检测和跟踪Sparse4D v3来了!推进端到端3D检测和跟踪Sparse4D v3来了!推进端到端3D检测和跟踪Sparse4D v3来了!推进端到端3D检测和跟踪Sparse4D v3来了!推进端到端3D检测和跟踪Sparse4D v3来了!推进端到端3D检测和跟踪Sparse4D v3来了!推进端到端3D检测和跟踪

总结:

本文首先提出了增强 Sparse4D 检测性能的方法。这一增强主要包括三个方面:时序实例去噪、质量估计和解耦注意力。随后,本文说明了将 Sparse4D 扩展为端到端跟踪模型的过程。本文在 nuScenes 上的实验表明,这些增强功能显着提高了性能,使 Sparse4Dv3 处于该领域的前沿。

引用:

Lin, X., Pei, Z., Lin, T., Huang, L., & Su, Z. (2025). Sparse4D v3: Advancing End-to-End 3D Detection and Tracking. ArXiv. /abs/2311.11722

以上就是Sparse4D v3来了!推进端到端3D检测和跟踪的详细内容,更多请关注其它相关文章!


# 自动驾驶  # 来了  # 端到  # 自己的  # 是一个  # 过程中  # 训练  # 商丘网站建设优化建站  # 专业网站建设要什么条件  # seo外包快速入门  # 海淀的网站建设公司  # 福建营销推广拍摄网址  # 河南官网seo网站优化推荐  # seo公司资源推广工具  # 湖州新品推广招聘网站  # 市场营销方案 推广抖音  # 文章摘要对seo影响  # 提高了  # 引入了  # 实现了  # 各大  # 提出了 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: 云深处科技绝影 Lite3 与 X20 四足机器人亮相  华为云发布华为云盘古模型3.0和升腾AI云服务,亮点亮相2025华为开发者大会  磐镭发布全新 GeForce RTX 4080 ARMOUR 显卡,售价为 9499 元  人工智能如何帮助制造业?  Valve 将拒绝采用 AI 生成未知版权内容的游戏上架 Steam  Meta Connect 2025已确定时间为9月27-28,主题涵盖Quest 3与AI技术  昇腾AI大模型训推一体化解决方案将在WAIC发布  MetaGPT AI 模型开源:可模拟软件公司开发过程,生成高质量代码  前特斯拉总监、OpenAI大牛Karpathy:我被自动驾驶分了心,AI智能体才是未来!  马斯克发推讽刺人工智能,机器学习本质是统计?  MiracleVision视觉大模型上线时间  李开复官宣新公司「零一万物」,进军 AI 2.0  鸿蒙生态带来了哪些新的流量可能性,包括AI、服务分发和原生智能等方面?  AYANEO AIR 1S 掌机 7 月 9 日发布:R7 7840U + OLED 屏  跑不动的元宇宙,虚拟世界比现实更冷酷  《自然》杂志拒绝刊登人工智能生成的图片和视频  对Hugging Face开源模型精准投毒!LLM切脑后变身PoisonGPT,用虚假事实洗脑60亿人  AMD在ChinaJoy展示全新的锐龙AI笔记本,开创了人工智能领域的新时代!  天翼云在国际AI顶会大模型挑战赛中获得冠军  闪电快讯|京东推出言犀AI大模型 面向零售、医疗、物流等产业场景  全新升级的广州麦当劳:面积最大餐厅正式引入智慧机器人  优化系统韧性:故障恢复与监控在RabbitMQ中的应用  再度重仓 AI 赛道,SaaS 巨头 Salesforce 扩大 AIGC 风投基金规模  Stability AI 推出文生图模型 SDXL0.9,GPU要求下探至消费级水平  GPT-4不能在麻省理工学院获得计算机科学学位  ChatGPT设计出的第一个机器人来了!【附人工智能行业预测】  硅谷人工智能研究院创始人皮埃罗·斯加鲁菲:Transformer模型演讲  英特尔张宇:边缘计算在整个AI生态系统中扮演重要角色  如何对员工进行再培训以充分利用供应链管理中的人工智能创新  人工智能产业协同创新中心:全产业链资源在这里汇聚  加强高质量数据供应能力,促进通用人工智能大模型领域的创新  通用医疗人工智能如何革新医疗行业?  Bing Chat 和 Bing Search 正式引入深色模式  微软和谷歌面临的人工智能困境:需要投入大量资金才能获得盈利  技术如何使人变得懒惰?  美图设计室2.0使用教程  零AI含量!纯随机数学无限生成逼真3D世界火了,普林斯顿华人一作  周鸿祎参加中美青年科技创新峰会,分享人工智能创新机遇  央视报道车载人机交互技术!MWC上海魅族表现亮眼,现场热火朝天  一图速览 | 十大脑机接口关键技术发布  7条线路感受智慧美好生活,“2025 世界人工智能大会民营企业社会开放日”主题活动启动  AI成政客博弈工具,美国大选真假难辨,律师们的生意来了  国内通用人形机器人将发布、产业加速突破  日本学校探索引入 AI 和无人机:提高安保效率,节省劳动力  机构研选 | 虚拟电厂是电力物联网升级版 智能电网望迎来高速发展  人形机器人概念大热!这些产业链标的或受提振  如布AI口袋学习机S12 将亮相综艺节目《好样的!国货》  马斯克称人类是半机器人,记忆外包给了电脑  AI拉动PCB发展|行业发现  田渊栋团队新研究:微调 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司