
一句话看懂:小鹏汽车于2026年7月21日发布TuringViT视觉编码器,通过架构重构和数据治理,在仅使用约十分之一训练数据(0.85B图文对)的情况下,于ImageNet-1K等六个零样本分类基准上平均准确率达83.6%,超越基于10B数据训练的SigLIP2-L等主流开源模型,核心解决了视觉大模型训练成本高、数据依赖大的行业瓶颈。
事件核心:发生了什么
小鹏集团正式推出TuringViT,这是一款定位为支撑智能驾驶、智能座舱和IRON人形机器人三类业务场景的视觉编码器。其在架构设计上采用线性注意力(TLA层)为主、少量MHA层为辅的方案,提供18层与24层两种规格。测试数据显示,当输入分辨率提升至1536×1536时,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍和SigLIP2-ViT-L的2.16倍,高分辨率场景下延迟增长曲线显著平缓。
更核心的突破在于数据路线:小鹏自研了VISTA-Curation多模态数据治理管线,彻底放弃“堆数据”思路。该管线通过三级筛选机制——先剔除低质量图像,再用多模型多提示词生成候选描述并交叉验证视觉一致性,最后根据图文对齐度、语义信息量和歧义性进行排名——实现了样本级效率提升。最终用于训练的仅0.85B图文对,约为SigLIP2-L数据规模的十分之一,却在多个基准上反超。
此外,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练第一天就适配下游VLM和VLA的输入特征,避开了传统固定分辨率预训练后额外微调的路线。
为什么重要
这一发布改变了视觉大模型的竞争逻辑。以往行业共识是“数据规模和算力投入直接决定模型能力”,而TuringViT用可验证的方法证明,系统性的架构改革加上精细化的数据治理,可以大幅降低训练门槛。对行业而言,这意味着视觉感知能力不再只是少数头部团队的“奢侈品”。特别是对自动驾驶和机器人研发领域,能嵌入边缘设备的高效高分辨率视觉编码器,为多摄像头输入和长时间视频处理提供了落地的技术路径。如果其数据治理方法公开或部分开源,可能引发行业模仿,加速视觉大模型在商业场景的普及。
对用户/开发者/创作者的影响
对于智能驾驶或机器人领域的开发者,TuringViT通过减少对超大规模算力和海量数据的依赖,降低了技术准入门槛。他们未来或许能用更少的预算训练出接近SOTA的视觉感知模型,实现多摄像头、高分辨率场景下的实时处理。对于AI训练平台和算力供应商,这类高效架构可能改变传统算力消耗评估,需要关注模型效率提升对算力需求结构的影响。对于内容创作者和普通用户,短期内可能不易直接感知变化,但应用在汽车座舱和机器人上的视觉AI若变得更精准、响应更快,用户体验会间接提升。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,TuringViT是否在近期落地的车型或机器人上实际部署,以及实际性能表现能否复现官方测试数据。第二,小鹏是否开放TuringViT的权重、数据治理管线文档或API接口,开发商和研究者能否复用其成果。第三,其他厂商(如特斯拉、Wayve、地平线等)是否会在视觉编码器数据效率和架构设计上跟进,形成新的技术路线竞争。
来源:AIbase


