TuringViT: Construyendo el codificador de visión para IA física

@liuxianming
INGLÉShace 3 días · 21 jul 2026
571K
79
10
5
12

TL;DR

TuringViT es un codificador de visión especializado para IA física que utiliza atención lineal y una curación de datos de alta calidad para lograr un alto rendimiento con un 90 % menos de datos.

Me alegra compartir otra pieza fundamental de nuestro trabajo en IA Física — TuringViT.

En mis publicaciones anteriores, he estado hablando de los modelos del mundo: cómo permiten a la IA Física predecir el futuro, razonar sobre consecuencias y planificar antes de actuar. Pero toda predicción y razonamiento se basa primero en la percepción.

Todo comienza con una pregunta básica: ¿Cómo ve realmente el modelo el mundo físico?

Xianming Liu - inline image

La premisa de mis publicaciones anteriores sigue siendo válida: la IA Física no puede escalarse solo con un modelo innovador. Avanza a medida que mejoramos cada componente en el flujo de comprensión del mundo físico.

Los modelos del mundo son un pilar crítico de escalamiento. Los codificadores de visión son igualmente fundamentales.

Los codificadores de visión actuales fueron construidos en gran medida para VLMs a escala de internet. Funcionan notablemente bien para tareas de contenido digital, pero la IA Física exige algo diferente. La movilidad inteligente, la robótica y la implementación en el borde traen consigo entradas de alta resolución, múltiples cámaras, largas transmisiones de video, resoluciones dinámicas y estrictas restricciones de latencia.

La solución común es reutilizar los ViT existentes. Pero eso conlleva tres compensaciones conocidas para la IA Física:

  1. La autoatención cuadrática se vuelve prohibitivamente costosa a medida que aumenta la resolución de entrada.
  2. Escalar datos web en bruto tiene rendimientos decrecientes rápidamente en la calidad de representación.
  3. El preentrenamiento con resolución fija no se alinea con la forma en que los VLM y VLA descendentes realmente operan.

Nuestro objetivo no era construir una variante incremental más de ViT. Nos propusimos repensar el diseño completo y el flujo de entrenamiento de un codificador de visión, construido específicamente para la IA Física.

Tres ideas fundamentales dieron forma a nuestro diseño de extremo a extremo, en arquitectura, datos y entrenamiento.

Primero, la eficiencia debe escalar con la resolución. Construimos Turing Linear Attention (TLA) como la columna vertebral computacional principal, con una estructura híbrida: 5 capas de TLA para un escalamiento computacional casi lineal, combinadas con 1 capa de atención estándar de múltiples cabezas por bloque para preservar el detalle global fino requerido por las tareas de IA Física. El resultado es un crecimiento de latencia casi plano a medida que aumenta la resolución de entrada.

Segundo, mejor supervisión en lugar de más supervisión. En lugar de simplemente escalar conjuntos de datos, construimos VISTA-Curation para mejorar la calidad de la supervisión. El resultado es notable: TuringViT alcanza un rendimiento competitivo usando solo alrededor del 10% de los datos que los ViT de código abierto líderes. Para nosotros, esa es una señal clara de que la calidad de los datos aún tiene mucho margen para escalar.

Tercero, entrenar de la manera en que realmente se ve la implementación. En lugar de preentrenar a resoluciones fijas y adaptar después, TuringViT aprende resoluciones dinámicas nativas desde el primer día, acercando el preentrenamiento a cómo se implementan realmente los sistemas VLM y VLA descendentes.

Xianming Liu - inline image

Más importante aún, estos principios de diseño no se limitan a la conducción autónoma. El mismo codificador de visión ahora soporta movilidad inteligente, interacción multimodal en cabina y robótica humanoide. Diferentes factores de forma, diferentes casos de uso, pero el problema central de percibir y comprender el mundo físico es el mismo.

Para más información:

https://turingvit.github.io/

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales