搜索
首页科技周边人工智能Transformer统一化3D目标检测基于体素的表征

arXiv论文“Unifying Voxel-based Representation with Transformer for 3D Object Detection“,22年6月,香港中文大学、香港大学、旷视科技(纪念孙剑博士)和思谋科技等。

Transformer统一化3D目标检测基于体素的表征

本文提出一个统一的多模态3-D目标检测框架,称为UVTR。该方法旨在统一体素空间的多模态表示,实现准确、稳健的单模态或跨模态3-D检测。为此,首先设计模态特定空间来表示体素特征空间的不同输入。在不进行高度信息(height)压缩的情况下保留体素空间,减轻语义歧义并实现空间交互。基于这种统一方式,提出跨模态交互,充分利用不同传感器的固有特性,包括知识迁移和模态融合。通过这种方式,可以很好地利用点云的几何-觉察表达式和图像中上下文丰富的特征,获得更好的性能和鲁棒性。

transformer解码器用于从具备可学习位置的统一空间中高效采样特征,这有助于目标级交互。一般来说,UVTR代表在统一框架中表示不同模态的早期尝试,在单模态和多模态输入方面优于以往的工作,在nuScenes测试集上取得了领先的性能,激光雷达、相机和多模态输出的NDS分别为69.7%、55.1%和71.1%。

代码:https://github.com/dvlab-research/UVTR.

如图所示:

Transformer统一化3D目标检测基于体素的表征

在表征统一过程中,可以大致分为输入级流和特征级流的表示。对于第一种方法,多模态数据在网络开始时对齐。特别是,图(a)中的伪点云是从预测深度辅助的图像转换而来的,而图(b)中的距离视图图像是从点云投影而来的。由于伪点云的深度不准确和距离视图图像中的3-D几何塌陷,数据的空间结构受到破坏,从而导致较差的结果。对于特征级方法,典型的方法是将图像特征转换为截锥(frustum),然后压缩到BEV空间,如图(c)所示。然而,由于其类似射线的轨迹,每个位置的高度信息(height)压缩聚合了各种目标的特征,因此引入了语义多义。同时,他隐式方式很难支持3-D空间中的显式特征交互,并限制进一步的知识迁移。因此,需要一种更统一的表示法弥合模态的差距,并促进多方面的交互。

本文提出的框架,将基于体素的表示与transformer统一起来。特别是,在基于体素的显式空间中图像和点云的特征表征和交互。对于图像,根据预测的深度和几何约束,从图像平面采样特征来构建体素空间,如图(d)所示。对于点云,准确的位置自然允许特征与体素相关联。然后,引入体素编码器进行空间交互,建立相邻特征之间的关系。这样,跨模态交互自然地与每个体素空间的特征进行。对于目标级交互,采用可变形transformer作为解码器,对统一体素空间中每个位置(x、y、z)的目标查询特定特征进行采样,如图(d)所示。同时,3-D查询位置的引入有效地缓解了BEV空间中高度信息(height)压缩带来的语义多义。

如图是多模态输入的UVTR架构:给定单帧或多帧图像和点云,首先在单个主干进行处理,并将其转换为特定于模态的空间VI和VP,其中视图转换用于图像。在体素编码器中,特征在空间上相互作用,并且 知识迁移在训练期间易于支持。根据不同的设置,通过模态开关选择单模态或多模态特征。最后,从具备可学习位置的统一空间VU中采样特征,利用transformer解码器进行预测。

Transformer统一化3D目标检测基于体素的表征

如图是视图变换的细节:

Transformer统一化3D目标检测基于体素的表征

如图是知识迁移的细节:

Transformer统一化3D目标检测基于体素的表征

实验结果如下:

Transformer统一化3D目标检测基于体素的表征

Transformer统一化3D目标检测基于体素的表征

以上是Transformer统一化3D目标检测基于体素的表征的详细内容。更多信息请关注PHP中文网其他相关文章!

声明
本文转载于:51CTO.COM。如有侵权,请联系admin@php.cn删除
免费学习SQL的YouTube频道 - 分析Vidhya免费学习SQL的YouTube频道 - 分析VidhyaApr 13, 2025 am 10:46 AM

介绍 掌握SQL(结构化查询语言)对于追求数据管理,数据分析和数据库管理的个人至关重要。如果您是从新手开始的,或者是经验丰富的专业人士,请寻求改进,

具有多模式和Azure文档智能的抹布具有多模式和Azure文档智能的抹布Apr 13, 2025 am 10:38 AM

介绍 在基于数据运行的当前世界中,关系AI图(RAG)通过关联数据并绘制关系来对行业产生很大影响。但是,如果一个人可以再进一步多怎么办

在生成AI时代负责的AI在生成AI时代负责的AIApr 13, 2025 am 10:28 AM

介绍 现在,我们生活在人工智能时代,我们周围的一切都在一天变得更加聪明。最先进的大语言模型(LLM)和AI代理,能够执行复杂的任务

GPT-4O vs OpenAI O1:新的Openai模型值得炒作吗?GPT-4O vs OpenAI O1:新的Openai模型值得炒作吗?Apr 13, 2025 am 10:18 AM

介绍 Openai已根据备受期待的“草莓”建筑发布了其新模型。这种称为O1的创新模型增强了推理能力,使其可以通过问题进行思考

小语言模型的微调和推断小语言模型的微调和推断Apr 13, 2025 am 10:15 AM

介绍 想象一下,您正在建立医疗聊天机器人,大量的,渴望资源的大型语言模型(LLMS)似乎满足您的需求。那是小语言模型(SLM)等杰玛(SLM)发挥作用

如何访问OpenAi O1 API |分析Vidhya如何访问OpenAi O1 API |分析VidhyaApr 13, 2025 am 10:14 AM

介绍 OpenAI的O1系列模型代表了大语言模型(LLM)功能的重大飞跃,尤其是对于复杂的推理任务。这些模型在RESP之前从事深厚的内部思维过程

使用Python的Google表自动化|分析Vidhya使用Python的Google表自动化|分析VidhyaApr 13, 2025 am 10:01 AM

Google表是Excel的最受欢迎和广泛使用的替代方案之一,它提供了具有实时编辑,版本控制和与Google Suite无缝集成等功能的协作环境,允许U

O1-Mini:一种改变游戏规则的STEM和推理模型O1-Mini:一种改变游戏规则的STEM和推理模型Apr 13, 2025 am 09:55 AM

OpenAI引入了O1-Mini,这是一种具有成本效益的推理模型,重点是STEM受试者。该模型在数学和编码中表现出令人印象深刻的性能,与其前身Openai O1非常相似

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

AI Hentai Generator

AI Hentai Generator

免费生成ai无尽的。

热门文章

R.E.P.O.能量晶体解释及其做什么(黄色晶体)
3 周前By尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.最佳图形设置
3 周前By尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.如果您听不到任何人,如何修复音频
3 周前By尊渡假赌尊渡假赌尊渡假赌
WWE 2K25:如何解锁Myrise中的所有内容
4 周前By尊渡假赌尊渡假赌尊渡假赌

热工具

MinGW - 适用于 Windows 的极简 GNU

MinGW - 适用于 Windows 的极简 GNU

这个项目正在迁移到osdn.net/projects/mingw的过程中,你可以继续在那里关注我们。MinGW:GNU编译器集合(GCC)的本地Windows移植版本,可自由分发的导入库和用于构建本地Windows应用程序的头文件;包括对MSVC运行时的扩展,以支持C99功能。MinGW的所有软件都可以在64位Windows平台上运行。

螳螂BT

螳螂BT

Mantis是一个易于部署的基于Web的缺陷跟踪工具,用于帮助产品缺陷跟踪。它需要PHP、MySQL和一个Web服务器。请查看我们的演示和托管服务。

安全考试浏览器

安全考试浏览器

Safe Exam Browser是一个安全的浏览器环境,用于安全地进行在线考试。该软件将任何计算机变成一个安全的工作站。它控制对任何实用工具的访问,并防止学生使用未经授权的资源。

SublimeText3 Mac版

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

Dreamweaver Mac版

Dreamweaver Mac版

视觉化网页开发工具