首页 > 教程攻略 > ai资讯 >小鹏集团发布 TuringViT,宣称重构视觉大模型训练范式

小鹏集团发布 TuringViT,宣称重构视觉大模型训练范式

来源:互联网 时间:2026-07-21 12:36:25

7月21日,小鹏集团正式发布了TuringViT高效视觉编码器。这可不是一个常规的升级——它意味着小鹏在视觉大模型训练范式上正试图重构游戏规则,从架构设计、数据范式到训练流程,系统性推倒重来。

小鹏集团发布 TuringViT,宣称重构视觉大模型训练范式

先说说几个关键判断。TuringViT的定位很明确:全面支撑智能驾驶、智能座舱、IRON人形机器人三大业务场景。更值得关注的是,它为行业提供了一条可复现、低成本训练SOTA级视觉Transformer的技术路径——这实际上是在推动先进视觉大模型从“头部团队专属”走向“行业普惠”,让更多团队有机会站上同一竞技场。

▲ TuringViT 的块架构和模型配置

从技术路线来看,TuringViT的突破集中在三个维度:架构、数据和训练。简单来说,就是“线性注意力主导+高质量数据治理+原生动态分辨率”这套组合拳,试图在效果、效率和落地性之间找到最优解。

这次发布的TuringViT共推出两个规格版本:

TuringViT-18L包含3组Turing Block(共15层TLA+3层MHA),主打动态分辨率下的高效部署;TuringViT-24L则包含4组Turing Block(共20层TLA+4层MHA),在保持线性计算主导的前提下进一步提升表征能力。

实测数据很能说明问题。随着输入分辨率提升,TuringViT的延迟增长曲线远平缓于标准softmax ViT,高分辨率下的效率优势愈发明显。在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍。这意味着在高分辨率感知、多摄像头输入、长时序视频处理等场景下,端侧部署的核心障碍基本被扫清了。

不过,硬件的效率只是事情的一面。真正让TuringViT脱颖而出的,是它在数据策略上的思考。

行业里常见的做法是“堆数据规模”——越大越好,越多越好。但TuringViT走了一条不同的路。它打造的VISTA-Curation多模态数据治理流水线,核心思路是提升单样本的监督价值,从“用更多数据”转向“用更优质的监督”。

这个流水线怎么做到的?简单说,三步走:

第一步,过滤掉低分辨率、模糊、低纹理的低质量图片;第二步,通过多模型、多提示词生成多样化候选字幕,并交叉验证视觉一致性;第三步,在统一对比池中,通过相对图文对齐度、文本信息量、歧义度综合打分,筛选出视觉贴合度高、语义信息密度高的优质标注,淘汰模糊、泛化、弱对齐的样本。

▲ 图像-文本筛选及处理流程

视频数据同样经过了全流程治理。先把长视频切分为连续短片段并均匀采样代表帧,再通过语义一致性与运动一致性双重过滤,保留语义连贯、变化信息有效的片段。最后,融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,让模型从连续画面中学习更鲁棒的视觉表征。

▲ 视频-语义筛选及处理流程

结果很能说明问题。TuringViT仅用了0.85B图文对——大约是SigLIP2-L训练数据规模的10%——就在ImageNet-1K等六项零样本分类基准上取得了83.6%的平均准确率,超越了使用10B数据训练的主流开源基线。在COCO、Flickr30K图文检索任务上同样优势显著。这确实是“十分之一数据,更优效果”的突破。

还有一个关键设计:TuringViT采用了四阶段渐进式原生动态分辨率训练范式。从预训练之初就适配下游VLM/VLA的输入特性,告别了“固定分辨率预训练+事后适配”的传统模式。这意味着它在实际部署时,不需要再花大量精力去做分辨率适配。

那么,TuringViT具体用在哪?三个场景。

在智能驾驶领域,它是第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供视觉token。

面向智能座舱与驾泊一体化场景,TuringViT的VLM原生特性让视觉特征与语言模型实现更高效的对齐,能提供更高的识别精度,支持不同画幅和比例的视觉输入,为未来车辆与用户交互的丰富座舱功能打下基础。

在小鹏IRON人形机器人的技术体系中,TuringViT充当着“视觉视网膜”的核心角色,为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。