TuringViT: створення візуального енкодера для фізичного ШІ

@liuxianming
АНГЛІЙСЬКА3 дні тому · 21 лип. 2026 р.
571K
79
10
5
12

Коротко

TuringViT — це спеціалізований візуальний енкодер для фізичного ШІ, який використовує лінійну увагу та високоякісну обробку даних для досягнення високої продуктивності з використанням на 90% меншої кількості даних.

Радий поділитися ще одним фундаментальним компонентом нашої роботи з Physical AI — TuringViT.

У моїх попередніх постах я говорив про world models: як вони дозволяють Physical AI передбачати майбутнє, аналізувати наслідки та планувати дії. Але все прогнозування та міркування спираються на сприйняття.

Це починається з простого питання: Як модель насправді бачить фізичний світ?

Xianming Liu - inline image

Припущення з моїх попередніх постів залишається в силі: Physical AI не можна масштабувати за допомогою однієї проривної моделі. Він розвивається, коли ми покращуємо кожен компонент конвеєра розуміння фізичного світу.

World models — це один із ключових стовпів масштабування. Візуальні енкодери так само фундаментальні.

Сучасні візуальні енкодери були значною мірою створені для інтернет-масштабованих VLM. Вони чудово працюють із завданнями цифрового контенту, але Physical AI вимагає іншого. Інтелектуальна мобільність, робототехніка та периферійне розгортання потребують високої роздільної здатності, кількох камер, довгих відеопотоків, динамічної роздільної здатності та жорстких обмежень затримки.

Поширене рішення — використовувати наявні ViT. Але це приносить три знайомі компроміси для Physical AI:

  1. Квадратична self-attention стає надто дорогою зі збільшенням роздільної здатності
  2. Масштабування необроблених веб-даних швидко призводить до зменшення віддачі від якості представлення
  3. Попереднє навчання з фіксованою роздільною здатністю не відповідає тому, як downstream VLM та VLA насправді працюють

Нашою метою було не створити черговий інкрементальний варіант ViT. Ми вирішили переосмислити повний дизайн і конвеєр навчання візуального енкодера, створеного спеціально для Physical AI.

Три ключові ідеї сформували наш наскрізний дизайн, охоплюючи архітектуру, дані та навчання.

По-перше, ефективність має масштабуватися з роздільною здатністю. Ми створили Turing Linear Attention (TLA) як основний обчислювальний рушій із гібридною структурою: 5 шарів TLA для майже лінійного масштабування обчислень у поєднанні з 1 шаром стандартної multi-head attention на блок, щоб зберегти детальну глобальну інформацію, необхідну для завдань Physical AI. Результат — майже незмінна затримка зі збільшенням роздільної здатності.

По-друге, кращий контроль замість більшої кількості контролю. Замість простого масштабування наборів даних ми створили VISTA-Curation для покращення якості контролю. Результат помітний: TuringViT досягає конкурентної продуктивності, використовуючи лише близько 10% даних порівняно з провідними відкритими ViT. Для нас це сильний сигнал, що якість даних все ще має значний простір для масштабування.

По-третє, навчання так, як виглядає розгортання. Замість попереднього навчання з фіксованою роздільною здатністю та адаптації пізніше, TuringViT вивчає рідну динамічну роздільну здатність з першого дня, наближаючи попереднє навчання до того, як downstream VLM та VLA системи насправді розгортаються.

Xianming Liu - inline image

Що важливіше, ці принципи дизайну не обмежуються лише автономним водінням. Той самий візуальний енкодер тепер підтримує інтелектуальну мобільність, мультимодальну взаємодію в салоні та гуманоїдну робототехніку. Різні форм-фактори, різні випадки використання, але основна проблема сприйняття та розуміння фізичного світу однакова.

Для отримання додаткової інформації:

https://turingvit.github.io/

Збереження в один клік

Використовуйте YouMind для AI-глибокого читання віральних статей

Зберігайте джерела, ставте цілеспрямовані запитання, підсумовуйте аргументи та перетворюйте віральні статті на корисні нотатки в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей