7月21日,小鹏汽车正式推出turingvit高效视觉编码器,聚焦于系统性重塑面向视觉语言模型(vlm)与视觉语言动作模型(vla)时代的视觉编码器架构、数据体系及训练范式。该技术将深度赋能智能驾驶、智能座舱以及iron人形机器人三大核心业务方向,并致力于为业界提供一条可复现、低门槛、达到sota水准的视觉transformer训练路径。
TuringViT依托三项关键创新实现性能跃升:其一,原创的Turing线性注意力(TLA)机制将计算复杂度压缩至近似线性水平,在1536²超高分辨率输入下,推理效率大幅超越当前主流基准模型;其二,VISTA-Curation数据治理方法仅需10%规模的训练数据,即可达成更优的零样本泛化能力;其三,原生动态分辨率训练策略从预训练初始阶段即精准匹配下游任务的实际分辨率需求,彻底摆脱传统“预训练-微调”中常见的后置适配环节。
作为小鹏物理AI全栈技术闭环中的核心视觉基座,TuringViT不仅显著增强车载端对高分辨率视觉信息的理解与处理能力,更为具身智能系统构建了通用、鲁棒、可扩展的视觉感知基础,加速先进视觉大模型在真实产业场景中的规模化落地与普惠应用。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜












