Радий поділитися ще одним фундаментальним компонентом нашої роботи з Physical AI — TuringViT.
У моїх попередніх постах я говорив про world models: як вони дозволяють Physical AI передбачати майбутнє, аналізувати наслідки та планувати дії. Але все прогнозування та міркування спираються на сприйняття.
Це починається з простого питання: Як модель насправді бачить фізичний світ?

Припущення з моїх попередніх постів залишається в силі: Physical AI не можна масштабувати за допомогою однієї проривної моделі. Він розвивається, коли ми покращуємо кожен компонент конвеєра розуміння фізичного світу.
World models — це один із ключових стовпів масштабування. Візуальні енкодери так само фундаментальні.
Сучасні візуальні енкодери були значною мірою створені для інтернет-масштабованих VLM. Вони чудово працюють із завданнями цифрового контенту, але Physical AI вимагає іншого. Інтелектуальна мобільність, робототехніка та периферійне розгортання потребують високої роздільної здатності, кількох камер, довгих відеопотоків, динамічної роздільної здатності та жорстких обмежень затримки.
Поширене рішення — використовувати наявні ViT. Але це приносить три знайомі компроміси для Physical AI:
- Квадратична self-attention стає надто дорогою зі збільшенням роздільної здатності
- Масштабування необроблених веб-даних швидко призводить до зменшення віддачі від якості представлення
- Попереднє навчання з фіксованою роздільною здатністю не відповідає тому, як downstream VLM та VLA насправді працюють
Нашою метою було не створити черговий інкрементальний варіант ViT. Ми вирішили переосмислити повний дизайн і конвеєр навчання візуального енкодера, створеного спеціально для Physical AI.
Три ключові ідеї сформували наш наскрізний дизайн, охоплюючи архітектуру, дані та навчання.
По-перше, ефективність має масштабуватися з роздільною здатністю. Ми створили Turing Linear Attention (TLA) як основний обчислювальний рушій із гібридною структурою: 5 шарів TLA для майже лінійного масштабування обчислень у поєднанні з 1 шаром стандартної multi-head attention на блок, щоб зберегти детальну глобальну інформацію, необхідну для завдань Physical AI. Результат — майже незмінна затримка зі збільшенням роздільної здатності.
По-друге, кращий контроль замість більшої кількості контролю. Замість простого масштабування наборів даних ми створили VISTA-Curation для покращення якості контролю. Результат помітний: TuringViT досягає конкурентної продуктивності, використовуючи лише близько 10% даних порівняно з провідними відкритими ViT. Для нас це сильний сигнал, що якість даних все ще має значний простір для масштабування.
По-третє, навчання так, як виглядає розгортання. Замість попереднього навчання з фіксованою роздільною здатністю та адаптації пізніше, TuringViT вивчає рідну динамічну роздільну здатність з першого дня, наближаючи попереднє навчання до того, як downstream VLM та VLA системи насправді розгортаються.

Що важливіше, ці принципи дизайну не обмежуються лише автономним водінням. Той самий візуальний енкодер тепер підтримує інтелектуальну мобільність, мультимодальну взаємодію в салоні та гуманоїдну робототехніку. Різні форм-фактори, різні випадки використання, але основна проблема сприйняття та розуміння фізичного світу однакова.
Для отримання додаткової інформації:




![[Нотатка] Керівники звільняють підлеглих, які не справляються з роботою](https://youmind.club/__ym/cms-assets/media/1784827522698_408j7z_HN3Kb76awAAvvjF.jpg)
