Glad to share another foundational piece of our Physical AI work — TuringViT.
Önceki yazılarımda, dünya modellerinden bahsediyordum: Fiziksel Yapay Zekanın geleceği tahmin etmesini, sonuçlar hakkında akıl yürütmesini ve harekete geçmeden önce plan yapmasını nasıl sağladıklarından. Ancak tüm tahmin ve akıl yürütme, önce algıya dayanır.
Temel bir soruyla başlıyor: Model, fiziksel dünyayı nasıl görüyor?

Önceki yazılarımdaki önerme hâlâ geçerli: Fiziksel Yapay Zeka, tek bir çığır açan modelle ölçeklendirilemez. Fiziksel dünyayı anlama sürecindeki her bileşeni geliştirdikçe ilerler.
Dünya modelleri, kritik bir ölçekleme ayağıdır. Görüntü kodlayıcılar da aynı derecede temeldir.
Günümüzün görüntü kodlayıcıları çoğunlukla internet ölçeğindeki VLM'ler için inşa edildi. Dijital içerik görevlerinde oldukça iyi çalışıyorlar, ancak Fiziksel Yapay Zeka farklı bir şey istiyor. Akıllı mobilite, robotik ve uç birim dağıtımı, yüksek çözünürlüklü girdiler, birden fazla kamera, uzun video akışları, dinamik çözünürlükler ve sıkı gecikme süresi kısıtlamaları getiriyor.
Yaygın çözüm, mevcut ViT'leri yeniden kullanmaktır. Ancak bu, Fiziksel Yapay Zeka için üç tanıdık ödünleşimi beraberinde getiriyor:
- Kuadratik öz-dikkat, girdi çözünürlüğü arttıkça yasaklayıcı derecede pahalı hale gelir
- Ham web verilerini ölçeklendirmek, temsil kalitesinde hızla azalan getirilere ulaşır
- Sabit çözünürlüklü ön eğitim, aşağı akış VLM'lerinin ve VLA'ların gerçekte nasıl çalıştığıyla uyumlu değildir
Amacımız, bir tane daha kademeli ViT varyantı oluşturmak değildi. Fiziksel Yapay Zeka için özel olarak inşa edilmiş bir görüntü kodlayıcının tüm tasarım ve eğitim sürecini yeniden düşünmek için yola çıktık.
Üç temel içgörü, mimari, veri ve eğitim olmak üzere uçtan uca tasarımımızı şekillendirdi.
Birincisi, verimlilik çözünürlükle ölçeklenmelidir. Turing Linear Attention (TLA)'yı birincil hesaplama omurgası olarak, hibrit bir yapıyla inşa ettik: neredeyse doğrusal hesaplama ölçeklemesi için 5 katman TLA, Fiziksel Yapay Zeka görevlerinin gerektirdiği ince taneli küresel detayı korumak için blok başına 1 katman standart çok başlı dikkat ile eşleştirildi. Sonuç, girdi çözünürlüğü arttıkça neredeyse düz bir gecikme artışıdır.
İkincisi, daha fazla denetim yerine daha iyi denetim. Veri kümelerini basitçe ölçeklendirmek yerine, denetimin kalitesini artırmak için VISTA-Curation'ı oluşturduk. Sonuç dikkat çekici: TuringViT, önde gelen açık kaynak ViT'lerin kullandığı verinin yalnızca yaklaşık %10'unu kullanarak rekabetçi performansa ulaşıyor. Bize göre bu, veri kalitesinin hâlâ ölçeklenecek çok yeri olduğuna dair güçlü bir işaret.
Üçüncüsü, dağıtımın gerçekte nasıl göründüğüne göre eğitim. Sabit çözünürlüklerde ön eğitim yapıp daha sonra uyarlamak yerine, TuringViT ilk günden itibaren yerel dinamik çözünürlükleri öğrenir ve ön eğitimi, aşağı akış VLM ve VLA sistemlerinin gerçekte nasıl dağıtıldığına çok daha yakın hale getirir.

Daha da önemlisi, bu tasarım ilkeleri yalnızca otonom sürüşle sınırlı değil. Aynı görüntü kodlayıcı artık akıllı mobiliteyi, araç içi çok modlu etkileşimi ve insansı robotiği destekliyor. Farklı form faktörleri, farklı kullanım senaryoları, ancak fiziksel dünyayı algılama ve anlama temel sorunu aynı.
Daha fazla bilgi için:





