很高兴分享我们 Physical AI 工作的另一项基础性成果——TuringViT。
在之前的文章中,我一直在讨论世界模型:它们如何让 Physical AI 预测未来、推理后果并在行动之前进行规划。但所有的预测和推理都首先建立在感知之上。
这一切始于一个基本问题:模型究竟如何看到物理世界?

我之前的文章中提到的一个前提依然成立:Physical AI 不能仅靠单一突破性模型来扩展。它的进步在于我们改进理解物理世界流程中的每一个组成部分。
世界模型是其中一个关键的扩展支柱。视觉编码器同样至关重要。
如今的视觉编码器主要是为互联网规模的 VLM 构建的。它们在数字内容任务上表现非常出色,但 Physical AI 提出了不同的需求。智能移动、机器人技术以及边缘部署都带来了高分辨率输入、多摄像头、长视频流、动态分辨率以及严格的延迟限制。
常见的解决方案是复用现有的 ViT。但这给 Physical AI 带来了三个常见的权衡取舍:
- 随着输入分辨率的提高,二次自注意力的计算成本变得极其高昂
- 扩展原始网络数据对表示质量的提升会迅速触及收益递减点
- 固定分辨率的预训练与下游 VLM 和 VLA 的实际运行方式不一致
我们的目标不是构建另一个增量式的 ViT 变体。我们着手重新思考视觉编码器的完整设计和训练流程,专门为 Physical AI 量身打造。
三个核心见解塑造了我们端到端的设计,涵盖架构、数据和训练。
首先,效率必须随分辨率线性扩展。 我们构建了图灵线性注意力(TLA)作为主要计算骨干,采用混合结构:每个块中使用 5 层 TLA 实现接近线性的计算扩展,配合 1 层标准多头注意力以保留 Physical AI 任务所需的精细全局细节。结果是,随着输入分辨率增加,延迟几乎持平。
第二,更优的监督而非更多的监督。 我们并非简单地扩展数据集,而是构建了 VISTA-Curation 来提升监督质量。结果显著:TuringViT 仅使用约 10% 的数据量就达到了与领先开源 ViT 相当的性能。对我们来说,这强烈表明数据质量仍有巨大的扩展空间。
第三,按实际部署的方式进行训练。 TuringViT 并非在固定分辨率下预训练然后后期适配,而是从一开始就学习原生动态分辨率,使预训练更接近下游 VLM 和 VLA 系统的实际部署方式。

更重要的是,这些设计原则不仅限于自动驾驶。同样的视觉编码器现在支持智能移动、座舱多模态交互以及人形机器人。不同的形态,不同的用例,但感知和理解物理世界的核心问题是相同的。
更多信息:





