हमारे भौतिक AI कार्य का एक और मूलभूत हिस्सा साझा करने में खुशी हो रही है — TuringViT।
अपने पिछले पोस्ट्स में, मैं वर्ल्ड मॉडल्स के बारे में बात कर रहा था: वे कैसे भौतिक AI को भविष्य की भविष्यवाणी करने, परिणामों पर तर्क करने और कार्रवाई करने से पहले योजना बनाने में सक्षम बनाते हैं। लेकिन सभी भविष्यवाणी और तर्क पहले धारणा पर निर्भर करते हैं।
यह एक बुनियादी सवाल से शुरू होता है: मॉडल वास्तव में भौतिक दुनिया को कैसे देखता है?

मेरे पिछले पोस्ट्स की धारणा अभी भी बनी हुई है: भौतिक AI को केवल एक ही सफलता मॉडल द्वारा स्केल नहीं किया जा सकता। यह तब आगे बढ़ता है जब हम भौतिक दुनिया को समझने की पाइपलाइन के हर घटक को बेहतर बनाते हैं।
वर्ल्ड मॉडल्स एक महत्वपूर्ण स्केलिंग स्तंभ हैं। विज़न एन्कोडर भी उतने ही मौलिक हैं।
आज के विज़न एन्कोडर ज्यादातर इंटरनेट-स्केल VLM के लिए बनाए गए थे। वे डिजिटल सामग्री कार्यों के लिए उल्लेखनीय रूप से अच्छा काम करते हैं, लेकिन भौतिक AI कुछ अलग मांगता है। बुद्धिमान गतिशीलता, रोबोटिक्स और एज डिप्लॉयमेंट सभी उच्च-रिज़ॉल्यूशन इनपुट, कई कैमरे, लंबे वीडियो स्ट्रीम, गतिशील रिज़ॉल्यूशन और तंग लेटेंसी बाधाएं लाते हैं।
सामान्य समाधान मौजूदा ViT का पुन: उपयोग करना है। लेकिन इसके साथ भौतिक AI के लिए तीन परिचित ट्रेड-ऑफ आते हैं:
- क्वाड्रैटिक सेल्फ-अटेंशन इनपुट रिज़ॉल्यूशन बढ़ने पर निषेधात्मक रूप से महंगा हो जाता है
- कच्चे वेब डेटा को स्केल करने से रिप्रेजेंटेशन गुणवत्ता पर तेजी से घटते रिटर्न मिलते हैं
- फिक्स्ड-रिज़ॉल्यूशन प्रीट्रेनिंग इस बात से मेल नहीं खाती कि डाउनस्ट्रीम VLM और VLA वास्तव में कैसे काम करते हैं
हमारा लक्ष्य एक और वृद्धिशील ViT वेरिएंट बनाना नहीं था। हमने विशेष रूप से भौतिक AI के लिए बनाए गए विज़न एन्कोडर के पूर्ण डिज़ाइन और प्रशिक्षण पाइपलाइन पर पुनर्विचार करने का बीड़ा उठाया।
तीन मुख्य अंतर्दृष्टियों ने हमारे एंड-टू-एंड डिज़ाइन को आकार दिया, आर्किटेक्चर, डेटा और प्रशिक्षण में।
पहला, दक्षता को रिज़ॉल्यूशन के साथ स्केल करना होगा। हमने प्राथमिक कम्प्यूटेशन बैकबोन के रूप में Turing Linear Attention (TLA) बनाया, एक हाइब्रिड संरचना के साथ: near-linear computational scaling के लिए TLA की 5 परतें, प्रति ब्लॉक मानक मल्टी-हेड अटेंशन की 1 परत के साथ जोड़ी गईं ताकि भौतिक AI कार्यों के लिए आवश्यक बारीक वैश्विक विवरण को संरक्षित किया जा सके। परिणाम इनपुट रिज़ॉल्यूशन बढ़ने पर लगभग सपाट लेटेंसी वृद्धि है।
दूसरा, अधिक सुपरविज़न के बजाय बेहतर सुपरविज़न। केवल डेटासेट को स्केल करने के बजाय, हमने सुपरविज़न की गुणवत्ता में सुधार के लिए VISTA-Curation बनाया। परिणाम उल्लेखनीय है: TuringViT प्रमुख ओपन-सोर्स ViT के केवल 10% डेटा का उपयोग करके प्रतिस्पर्धी प्रदर्शन तक पहुँचता है। हमारे लिए, यह एक मजबूत संकेत है कि डेटा गुणवत्ता में अभी भी स्केल करने की काफी गुंजाइश है।
तीसरा, प्रशिक्षण उस तरह जैसा डिप्लॉयमेंट वास्तव में दिखता है। फिक्स्ड रिज़ॉल्यूशन पर प्रीट्रेनिंग और बाद में अनुकूलन करने के बजाय, TuringViT पहले दिन से नेटिव डायनेमिक रिज़ॉल्यूशन सीखता है, जिससे प्रीट्रेनिंग इस बात के बहुत करीब आ जाती है कि डाउनस्ट्रीम VLM और VLA सिस्टम वास्तव में कैसे तैनात किए जाते हैं।

अधिक महत्वपूर्ण बात यह है कि ये डिज़ाइन सिद्धांत केवल स्वायत्त ड्राइविंग तक सीमित नहीं हैं। वही विज़न एन्कोडर अब बुद्धिमान गतिशीलता, इन-कैबिन मल्टीमॉडल इंटरैक्शन और ह्यूमनॉइड रोबोटिक्स का समर्थन करता है। अलग-अलग फॉर्म फैक्टर, अलग-अलग उपयोग के मामले, लेकिन भौतिक दुनिया को देखने और समझने की मूल समस्या एक ही है।
अधिक जानकारी के लिए:





