TuringViT: Fiziksel Yapay Zeka için Görsel Kodlayıcı Oluşturma

@liuxianming
İNGILIZCE2 gün önce · 21 Tem 2026
571K
79
10
5
12

TL;DR

TuringViT, %90 daha az veriyle yüksek performans elde etmek için doğrusal dikkat ve yüksek kaliteli veri kürasyonundan yararlanan, Fiziksel Yapay Zeka'ya özel bir görsel kodlayıcıdır.

Glad to share another foundational piece of our Physical AI work — TuringViT.

Önceki yazılarımda, dünya modellerinden bahsediyordum: Fiziksel Yapay Zekanın geleceği tahmin etmesini, sonuçlar hakkında akıl yürütmesini ve harekete geçmeden önce plan yapmasını nasıl sağladıklarından. Ancak tüm tahmin ve akıl yürütme, önce algıya dayanır.

Temel bir soruyla başlıyor: Model, fiziksel dünyayı nasıl görüyor?

Xianming Liu - inline image

Önceki yazılarımdaki önerme hâlâ geçerli: Fiziksel Yapay Zeka, tek bir çığır açan modelle ölçeklendirilemez. Fiziksel dünyayı anlama sürecindeki her bileşeni geliştirdikçe ilerler.

Dünya modelleri, kritik bir ölçekleme ayağıdır. Görüntü kodlayıcılar da aynı derecede temeldir.

Günümüzün görüntü kodlayıcıları çoğunlukla internet ölçeğindeki VLM'ler için inşa edildi. Dijital içerik görevlerinde oldukça iyi çalışıyorlar, ancak Fiziksel Yapay Zeka farklı bir şey istiyor. Akıllı mobilite, robotik ve uç birim dağıtımı, yüksek çözünürlüklü girdiler, birden fazla kamera, uzun video akışları, dinamik çözünürlükler ve sıkı gecikme süresi kısıtlamaları getiriyor.

Yaygın çözüm, mevcut ViT'leri yeniden kullanmaktır. Ancak bu, Fiziksel Yapay Zeka için üç tanıdık ödünleşimi beraberinde getiriyor:

  1. Kuadratik öz-dikkat, girdi çözünürlüğü arttıkça yasaklayıcı derecede pahalı hale gelir
  2. Ham web verilerini ölçeklendirmek, temsil kalitesinde hızla azalan getirilere ulaşır
  3. Sabit çözünürlüklü ön eğitim, aşağı akış VLM'lerinin ve VLA'ların gerçekte nasıl çalıştığıyla uyumlu değildir

Amacımız, bir tane daha kademeli ViT varyantı oluşturmak değildi. Fiziksel Yapay Zeka için özel olarak inşa edilmiş bir görüntü kodlayıcının tüm tasarım ve eğitim sürecini yeniden düşünmek için yola çıktık.

Üç temel içgörü, mimari, veri ve eğitim olmak üzere uçtan uca tasarımımızı şekillendirdi.

Birincisi, verimlilik çözünürlükle ölçeklenmelidir. Turing Linear Attention (TLA)'yı birincil hesaplama omurgası olarak, hibrit bir yapıyla inşa ettik: neredeyse doğrusal hesaplama ölçeklemesi için 5 katman TLA, Fiziksel Yapay Zeka görevlerinin gerektirdiği ince taneli küresel detayı korumak için blok başına 1 katman standart çok başlı dikkat ile eşleştirildi. Sonuç, girdi çözünürlüğü arttıkça neredeyse düz bir gecikme artışıdır.

İkincisi, daha fazla denetim yerine daha iyi denetim. Veri kümelerini basitçe ölçeklendirmek yerine, denetimin kalitesini artırmak için VISTA-Curation'ı oluşturduk. Sonuç dikkat çekici: TuringViT, önde gelen açık kaynak ViT'lerin kullandığı verinin yalnızca yaklaşık %10'unu kullanarak rekabetçi performansa ulaşıyor. Bize göre bu, veri kalitesinin hâlâ ölçeklenecek çok yeri olduğuna dair güçlü bir işaret.

Üçüncüsü, dağıtımın gerçekte nasıl göründüğüne göre eğitim. Sabit çözünürlüklerde ön eğitim yapıp daha sonra uyarlamak yerine, TuringViT ilk günden itibaren yerel dinamik çözünürlükleri öğrenir ve ön eğitimi, aşağı akış VLM ve VLA sistemlerinin gerçekte nasıl dağıtıldığına çok daha yakın hale getirir.

Xianming Liu - inline image

Daha da önemlisi, bu tasarım ilkeleri yalnızca otonom sürüşle sınırlı değil. Aynı görüntü kodlayıcı artık akıllı mobiliteyi, araç içi çok modlu etkileşimi ve insansı robotiği destekliyor. Farklı form faktörleri, farklı kullanım senaryoları, ancak fiziksel dünyayı algılama ve anlama temel sorunu aynı.

Daha fazla bilgi için:

https://turingvit.github.io/

Tek tıkla kaydet

YouMind ile viral makaleleri AI derin okumayla incele

Kaynağı kaydedin, odaklı sorular sorun, argümanı özetleyin ve viral bir makaleyi tek bir AI çalışma alanında yeniden kullanılabilir notlara dönüştürün.

YouMind'ı keşfet
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet