ยินดีที่จะแชร์อีกหนึ่งชิ้นส่วนพื้นฐานของงาน Physical AI ของเรา — TuringViT
ในโพสต์ก่อนหน้านี้ ผมได้พูดถึง world models: ว่าพวกมันช่วยให้ Physical AI สามารถทำนายอนาคต คิดถึงผลลัพธ์ที่ตามมา และวางแผนก่อนลงมือทำได้อย่างไร แต่การทำนายและการให้เหตุผลทั้งหมดนั้นเริ่มต้นจากการรับรู้ก่อน
ทุกอย่างเริ่มต้นจากคำถามพื้นฐาน: โมเดลมองเห็นโลกทางกายภาพได้อย่างไร?

สมมติฐานจากโพสต์ก่อนหน้านี้ยังคงอยู่: Physical AI ไม่สามารถขยายขนาดได้ด้วยโมเดลที่ก้าวล้ำเพียงตัวเดียว มันจะก้าวหน้าไปเมื่อเราปรับปรุงทุกองค์ประกอบในกระบวนการทำความเข้าใจโลกทางกายภาพ
World models เป็นเสาหลักในการขยายขนาดที่สำคัญ Vision encoders ก็เป็นพื้นฐานที่สำคัญไม่แพ้กัน
Vision encoders ในปัจจุบันส่วนใหญ่ถูกสร้างขึ้นสำหรับ VLMs ระดับอินเทอร์เน็ต พวกมันทำงานได้ดีอย่างน่าทึ่งสำหรับงานด้านเนื้อหาดิจิทัล แต่ Physical AI ต้องการสิ่งที่แตกต่างออกไป การเคลื่อนที่อัจฉริยะ หุ่นยนต์ และการปรับใช้บนอุปกรณ์ Edge ล้วนต้องใช้อินพุตความละเอียดสูง กล้องหลายตัว สตรีมวิดีโอที่ยาว ความละเอียดแบบไดนามิก และข้อจำกัดด้านเวลาแฝงที่เข้มงวด
วิธีแก้ไขทั่วไปคือการนำ ViTs ที่มีอยู่กลับมาใช้ใหม่ แต่นั่นมาพร้อมกับข้อแลกเปลี่ยนที่คุ้นเคยสามประการสำหรับ Physical AI:
- Quadratic self-attention จะมีค่าใช้จ่ายสูงเกินทนเมื่อความละเอียดอินพุตเพิ่มขึ้น
- การขยายขนาดข้อมูลเว็บดิบให้ผลตอบแทนด้านคุณภาพการเป็นตัวแทนที่ลดลงอย่างรวดเร็ว
- การฝึกสอนล่วงหน้าด้วยความละเอียดคงที่ไม่สอดคล้องกับวิธีการทำงานจริงของ VLMs และ VLAs ปลายน้ำ
เป้าหมายของเราไม่ใช่การสร้าง ViT รูปแบบใหม่แบบค่อยเป็นค่อยไปอีกตัวหนึ่ง เราตั้งใจที่จะออกแบบท่อส่งและกระบวนการฝึกสอนของ vision encoder ใหม่ทั้งหมด ซึ่งสร้างขึ้นมาโดยเฉพาะสำหรับ Physical AI
ข้อมูลเชิงลึกหลักสามประการเป็นตัวกำหนดการออกแบบแบบครบวงจรของเรา ครอบคลุมทั้งสถาปัตยกรรม ข้อมูล และการฝึกสอน
ประการแรก ประสิทธิภาพต้องปรับขนาดตามความละเอียด เราสร้าง Turing Linear Attention (TLA) เป็นแกนหลักในการคำนวณหลัก โดยมีโครงสร้างแบบไฮบริด: TLA 5 ชั้นสำหรับการปรับขนาดการคำนวณแบบเกือบเป็นเส้นตรง ควบคู่กับ attention แบบหลายหัวมาตรฐาน 1 ชั้นต่อบล็อก เพื่อรักษารายละเอียดระดับโลกที่ละเอียดซึ่งจำเป็นสำหรับงาน Physical AI ผลลัพธ์ที่ได้คือการเติบโตของเวลาแฝงที่เกือบจะคงที่เมื่อความละเอียดอินพุตเพิ่มขึ้น
ประการที่สอง การกำกับดูแลที่ดีขึ้น แทนที่จะเป็นการกำกับดูแลที่มากขึ้น แทนที่จะเพียงแค่ขยายขนาดชุดข้อมูล เราสร้าง VISTA-Curation เพื่อปรับปรุงคุณภาพของการกำกับดูแล ผลลัพธ์ที่ได้นั้นน่าสังเกต: TuringViT บรรลุประสิทธิภาพการแข่งขันโดยใช้ข้อมูลเพียงประมาณ 10% ของ ViTs โอเพนซอร์สชั้นนำ สำหรับเราแล้ว นั่นเป็นสัญญาณที่ชัดเจนว่าคุณภาพข้อมูลยังมีพื้นที่ให้ขยายขนาดได้อีกมาก
ประการที่สาม ฝึกสอนในแบบที่การปรับใช้จริงเป็น แทนที่จะฝึกสอนล่วงหน้าที่ความละเอียดคงที่แล้วค่อยปรับใช้ในภายหลัง TuringViT เรียนรู้ความละเอียดแบบไดนามิกตามธรรมชาติตั้งแต่วันแรก ทำให้การฝึกสอนล่วงหน้าใกล้เคียงกับวิธีการปรับใช้ระบบ VLM และ VLA ปลายน้ำจริงมากขึ้น

ที่สำคัญกว่านั้น หลักการออกแบบเหล่านี้ไม่ได้จำกัดอยู่แค่การขับขี่อัตโนมัติเท่านั้น vision encoder ตัวเดียวกันนี้ตอนนี้รองรับการเคลื่อนที่อัจฉริยะ การโต้ตอบแบบมัลติโมดัลภายในห้องโดยสาร และหุ่นยนต์ humanoid ฟอร์มแฟกเตอร์ที่แตกต่างกัน กรณีการใช้งานที่แตกต่างกัน แต่ปัญหาหลักของการรับรู้และทำความเข้าใจโลกทางกายภาพนั้นเหมือนกัน
ข้อมูลเพิ่มเติม:




![[บันทึก] หัวหน้ากำลังตัดหางปล่อยวัดลูกน้องที่ผลงานไม่เข้าเป้า](https://youmind.club/__ym/cms-assets/media/1784827522698_408j7z_HN3Kb76awAAvvjF.jpg)
