TuringViT:构建面向物理 AI 的视觉编码器

@liuxianming
英语2天前 · 2026年7月21日
571K
79
10
5
12

TL;DR

TuringViT 是一款专为物理 AI 设计的视觉编码器,通过利用线性注意力机制和高质量数据筛选,在减少 90% 数据量的情况下实现了高性能表现。

很高兴分享我们 Physical AI 工作的另一项基础性成果——TuringViT

在之前的文章中,我一直在讨论世界模型:它们如何让 Physical AI 预测未来、推理后果并在行动之前进行规划。但所有的预测和推理都首先建立在感知之上。

这一切始于一个基本问题:模型究竟如何看到物理世界?

Xianming Liu - inline image

我之前的文章中提到的一个前提依然成立:Physical AI 不能仅靠单一突破性模型来扩展。它的进步在于我们改进理解物理世界流程中的每一个组成部分。

世界模型是其中一个关键的扩展支柱。视觉编码器同样至关重要。

如今的视觉编码器主要是为互联网规模的 VLM 构建的。它们在数字内容任务上表现非常出色,但 Physical AI 提出了不同的需求。智能移动、机器人技术以及边缘部署都带来了高分辨率输入、多摄像头、长视频流、动态分辨率以及严格的延迟限制。

常见的解决方案是复用现有的 ViT。但这给 Physical AI 带来了三个常见的权衡取舍:

  1. 随着输入分辨率的提高,二次自注意力的计算成本变得极其高昂
  2. 扩展原始网络数据对表示质量的提升会迅速触及收益递减点
  3. 固定分辨率的预训练与下游 VLM 和 VLA 的实际运行方式不一致

我们的目标不是构建另一个增量式的 ViT 变体。我们着手重新思考视觉编码器的完整设计和训练流程,专门为 Physical AI 量身打造。

三个核心见解塑造了我们端到端的设计,涵盖架构、数据和训练。

首先,效率必须随分辨率线性扩展。 我们构建了图灵线性注意力(TLA)作为主要计算骨干,采用混合结构:每个块中使用 5 层 TLA 实现接近线性的计算扩展,配合 1 层标准多头注意力以保留 Physical AI 任务所需的精细全局细节。结果是,随着输入分辨率增加,延迟几乎持平。

第二,更优的监督而非更多的监督。 我们并非简单地扩展数据集,而是构建了 VISTA-Curation 来提升监督质量。结果显著:TuringViT 仅使用约 10% 的数据量就达到了与领先开源 ViT 相当的性能。对我们来说,这强烈表明数据质量仍有巨大的扩展空间。

第三,按实际部署的方式进行训练。 TuringViT 并非在固定分辨率下预训练然后后期适配,而是从一开始就学习原生动态分辨率,使预训练更接近下游 VLM 和 VLA 系统的实际部署方式。

Xianming Liu - inline image

更重要的是,这些设计原则不仅限于自动驾驶。同样的视觉编码器现在支持智能移动、座舱多模态交互以及人形机器人。不同的形态,不同的用例,但感知和理解物理世界的核心问题是相同的。

更多信息:

https://turingvit.github.io/

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章