TuringViT: फिजिकल AI के लिए विज़न एनकोडर का निर्माण

@liuxianming
अंग्रेज़ी3 दिन पहले · 21 जुल॰ 2026
571K
79
10
5
12

TL;DR

TuringViT फिजिकल AI के लिए एक विशेष विज़न एनकोडर है, जो 90% कम डेटा के साथ उच्च प्रदर्शन प्राप्त करने के लिए लीनियर अटेंशन और उच्च-गुणवत्ता वाले डेटा क्यूरेशन का उपयोग करता है।

हमारे भौतिक AI कार्य का एक और मूलभूत हिस्सा साझा करने में खुशी हो रही है — TuringViT

अपने पिछले पोस्ट्स में, मैं वर्ल्ड मॉडल्स के बारे में बात कर रहा था: वे कैसे भौतिक AI को भविष्य की भविष्यवाणी करने, परिणामों पर तर्क करने और कार्रवाई करने से पहले योजना बनाने में सक्षम बनाते हैं। लेकिन सभी भविष्यवाणी और तर्क पहले धारणा पर निर्भर करते हैं।

यह एक बुनियादी सवाल से शुरू होता है: मॉडल वास्तव में भौतिक दुनिया को कैसे देखता है?

Xianming Liu - inline image

मेरे पिछले पोस्ट्स की धारणा अभी भी बनी हुई है: भौतिक AI को केवल एक ही सफलता मॉडल द्वारा स्केल नहीं किया जा सकता। यह तब आगे बढ़ता है जब हम भौतिक दुनिया को समझने की पाइपलाइन के हर घटक को बेहतर बनाते हैं।

वर्ल्ड मॉडल्स एक महत्वपूर्ण स्केलिंग स्तंभ हैं। विज़न एन्कोडर भी उतने ही मौलिक हैं।

आज के विज़न एन्कोडर ज्यादातर इंटरनेट-स्केल VLM के लिए बनाए गए थे। वे डिजिटल सामग्री कार्यों के लिए उल्लेखनीय रूप से अच्छा काम करते हैं, लेकिन भौतिक AI कुछ अलग मांगता है। बुद्धिमान गतिशीलता, रोबोटिक्स और एज डिप्लॉयमेंट सभी उच्च-रिज़ॉल्यूशन इनपुट, कई कैमरे, लंबे वीडियो स्ट्रीम, गतिशील रिज़ॉल्यूशन और तंग लेटेंसी बाधाएं लाते हैं।

सामान्य समाधान मौजूदा ViT का पुन: उपयोग करना है। लेकिन इसके साथ भौतिक AI के लिए तीन परिचित ट्रेड-ऑफ आते हैं:

  1. क्वाड्रैटिक सेल्फ-अटेंशन इनपुट रिज़ॉल्यूशन बढ़ने पर निषेधात्मक रूप से महंगा हो जाता है
  2. कच्चे वेब डेटा को स्केल करने से रिप्रेजेंटेशन गुणवत्ता पर तेजी से घटते रिटर्न मिलते हैं
  3. फिक्स्ड-रिज़ॉल्यूशन प्रीट्रेनिंग इस बात से मेल नहीं खाती कि डाउनस्ट्रीम VLM और VLA वास्तव में कैसे काम करते हैं

हमारा लक्ष्य एक और वृद्धिशील ViT वेरिएंट बनाना नहीं था। हमने विशेष रूप से भौतिक AI के लिए बनाए गए विज़न एन्कोडर के पूर्ण डिज़ाइन और प्रशिक्षण पाइपलाइन पर पुनर्विचार करने का बीड़ा उठाया।

तीन मुख्य अंतर्दृष्टियों ने हमारे एंड-टू-एंड डिज़ाइन को आकार दिया, आर्किटेक्चर, डेटा और प्रशिक्षण में।

पहला, दक्षता को रिज़ॉल्यूशन के साथ स्केल करना होगा। हमने प्राथमिक कम्प्यूटेशन बैकबोन के रूप में Turing Linear Attention (TLA) बनाया, एक हाइब्रिड संरचना के साथ: near-linear computational scaling के लिए TLA की 5 परतें, प्रति ब्लॉक मानक मल्टी-हेड अटेंशन की 1 परत के साथ जोड़ी गईं ताकि भौतिक AI कार्यों के लिए आवश्यक बारीक वैश्विक विवरण को संरक्षित किया जा सके। परिणाम इनपुट रिज़ॉल्यूशन बढ़ने पर लगभग सपाट लेटेंसी वृद्धि है।

दूसरा, अधिक सुपरविज़न के बजाय बेहतर सुपरविज़न। केवल डेटासेट को स्केल करने के बजाय, हमने सुपरविज़न की गुणवत्ता में सुधार के लिए VISTA-Curation बनाया। परिणाम उल्लेखनीय है: TuringViT प्रमुख ओपन-सोर्स ViT के केवल 10% डेटा का उपयोग करके प्रतिस्पर्धी प्रदर्शन तक पहुँचता है। हमारे लिए, यह एक मजबूत संकेत है कि डेटा गुणवत्ता में अभी भी स्केल करने की काफी गुंजाइश है।

तीसरा, प्रशिक्षण उस तरह जैसा डिप्लॉयमेंट वास्तव में दिखता है। फिक्स्ड रिज़ॉल्यूशन पर प्रीट्रेनिंग और बाद में अनुकूलन करने के बजाय, TuringViT पहले दिन से नेटिव डायनेमिक रिज़ॉल्यूशन सीखता है, जिससे प्रीट्रेनिंग इस बात के बहुत करीब आ जाती है कि डाउनस्ट्रीम VLM और VLA सिस्टम वास्तव में कैसे तैनात किए जाते हैं।

Xianming Liu - inline image

अधिक महत्वपूर्ण बात यह है कि ये डिज़ाइन सिद्धांत केवल स्वायत्त ड्राइविंग तक सीमित नहीं हैं। वही विज़न एन्कोडर अब बुद्धिमान गतिशीलता, इन-कैबिन मल्टीमॉडल इंटरैक्शन और ह्यूमनॉइड रोबोटिक्स का समर्थन करता है। अलग-अलग फॉर्म फैक्टर, अलग-अलग उपयोग के मामले, लेकिन भौतिक दुनिया को देखने और समझने की मूल समस्या एक ही है।

अधिक जानकारी के लिए:

https://turingvit.github.io/

एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें