TuringViT: การสร้าง Vision Encoder สำหรับ Physical AI

@liuxianming
อังกฤษ3 วันที่ผ่านมา · 21 ก.ค. 2569
571K
79
10
5
12

TL;DR

TuringViT คือ Vision Encoder เฉพาะทางสำหรับ Physical AI ที่ใช้ Linear Attention และการคัดสรรข้อมูลคุณภาพสูง เพื่อให้ได้ประสิทธิภาพที่ยอดเยี่ยมโดยใช้ข้อมูลน้อยลงถึง 90%

ยินดีที่จะแชร์อีกหนึ่งชิ้นส่วนพื้นฐานของงาน Physical AI ของเรา — TuringViT

ในโพสต์ก่อนหน้านี้ ผมได้พูดถึง world models: ว่าพวกมันช่วยให้ Physical AI สามารถทำนายอนาคต คิดถึงผลลัพธ์ที่ตามมา และวางแผนก่อนลงมือทำได้อย่างไร แต่การทำนายและการให้เหตุผลทั้งหมดนั้นเริ่มต้นจากการรับรู้ก่อน

ทุกอย่างเริ่มต้นจากคำถามพื้นฐาน: โมเดลมองเห็นโลกทางกายภาพได้อย่างไร?

Xianming Liu - inline image

สมมติฐานจากโพสต์ก่อนหน้านี้ยังคงอยู่: Physical AI ไม่สามารถขยายขนาดได้ด้วยโมเดลที่ก้าวล้ำเพียงตัวเดียว มันจะก้าวหน้าไปเมื่อเราปรับปรุงทุกองค์ประกอบในกระบวนการทำความเข้าใจโลกทางกายภาพ

World models เป็นเสาหลักในการขยายขนาดที่สำคัญ Vision encoders ก็เป็นพื้นฐานที่สำคัญไม่แพ้กัน

Vision encoders ในปัจจุบันส่วนใหญ่ถูกสร้างขึ้นสำหรับ VLMs ระดับอินเทอร์เน็ต พวกมันทำงานได้ดีอย่างน่าทึ่งสำหรับงานด้านเนื้อหาดิจิทัล แต่ Physical AI ต้องการสิ่งที่แตกต่างออกไป การเคลื่อนที่อัจฉริยะ หุ่นยนต์ และการปรับใช้บนอุปกรณ์ Edge ล้วนต้องใช้อินพุตความละเอียดสูง กล้องหลายตัว สตรีมวิดีโอที่ยาว ความละเอียดแบบไดนามิก และข้อจำกัดด้านเวลาแฝงที่เข้มงวด

วิธีแก้ไขทั่วไปคือการนำ ViTs ที่มีอยู่กลับมาใช้ใหม่ แต่นั่นมาพร้อมกับข้อแลกเปลี่ยนที่คุ้นเคยสามประการสำหรับ Physical AI:

  1. Quadratic self-attention จะมีค่าใช้จ่ายสูงเกินทนเมื่อความละเอียดอินพุตเพิ่มขึ้น
  2. การขยายขนาดข้อมูลเว็บดิบให้ผลตอบแทนด้านคุณภาพการเป็นตัวแทนที่ลดลงอย่างรวดเร็ว
  3. การฝึกสอนล่วงหน้าด้วยความละเอียดคงที่ไม่สอดคล้องกับวิธีการทำงานจริงของ VLMs และ VLAs ปลายน้ำ

เป้าหมายของเราไม่ใช่การสร้าง ViT รูปแบบใหม่แบบค่อยเป็นค่อยไปอีกตัวหนึ่ง เราตั้งใจที่จะออกแบบท่อส่งและกระบวนการฝึกสอนของ vision encoder ใหม่ทั้งหมด ซึ่งสร้างขึ้นมาโดยเฉพาะสำหรับ Physical AI

ข้อมูลเชิงลึกหลักสามประการเป็นตัวกำหนดการออกแบบแบบครบวงจรของเรา ครอบคลุมทั้งสถาปัตยกรรม ข้อมูล และการฝึกสอน

ประการแรก ประสิทธิภาพต้องปรับขนาดตามความละเอียด เราสร้าง Turing Linear Attention (TLA) เป็นแกนหลักในการคำนวณหลัก โดยมีโครงสร้างแบบไฮบริด: TLA 5 ชั้นสำหรับการปรับขนาดการคำนวณแบบเกือบเป็นเส้นตรง ควบคู่กับ attention แบบหลายหัวมาตรฐาน 1 ชั้นต่อบล็อก เพื่อรักษารายละเอียดระดับโลกที่ละเอียดซึ่งจำเป็นสำหรับงาน Physical AI ผลลัพธ์ที่ได้คือการเติบโตของเวลาแฝงที่เกือบจะคงที่เมื่อความละเอียดอินพุตเพิ่มขึ้น

ประการที่สอง การกำกับดูแลที่ดีขึ้น แทนที่จะเป็นการกำกับดูแลที่มากขึ้น แทนที่จะเพียงแค่ขยายขนาดชุดข้อมูล เราสร้าง VISTA-Curation เพื่อปรับปรุงคุณภาพของการกำกับดูแล ผลลัพธ์ที่ได้นั้นน่าสังเกต: TuringViT บรรลุประสิทธิภาพการแข่งขันโดยใช้ข้อมูลเพียงประมาณ 10% ของ ViTs โอเพนซอร์สชั้นนำ สำหรับเราแล้ว นั่นเป็นสัญญาณที่ชัดเจนว่าคุณภาพข้อมูลยังมีพื้นที่ให้ขยายขนาดได้อีกมาก

ประการที่สาม ฝึกสอนในแบบที่การปรับใช้จริงเป็น แทนที่จะฝึกสอนล่วงหน้าที่ความละเอียดคงที่แล้วค่อยปรับใช้ในภายหลัง TuringViT เรียนรู้ความละเอียดแบบไดนามิกตามธรรมชาติตั้งแต่วันแรก ทำให้การฝึกสอนล่วงหน้าใกล้เคียงกับวิธีการปรับใช้ระบบ VLM และ VLA ปลายน้ำจริงมากขึ้น

Xianming Liu - inline image

ที่สำคัญกว่านั้น หลักการออกแบบเหล่านี้ไม่ได้จำกัดอยู่แค่การขับขี่อัตโนมัติเท่านั้น vision encoder ตัวเดียวกันนี้ตอนนี้รองรับการเคลื่อนที่อัจฉริยะ การโต้ตอบแบบมัลติโมดัลภายในห้องโดยสาร และหุ่นยนต์ humanoid ฟอร์มแฟกเตอร์ที่แตกต่างกัน กรณีการใช้งานที่แตกต่างกัน แต่ปัญหาหลักของการรับรู้และทำความเข้าใจโลกทางกายภาพนั้นเหมือนกัน

ข้อมูลเพิ่มเติม:

https://turingvit.github.io/

บันทึกในคลิกเดียว

อ่านบทความไวรัลเชิงลึกด้วย AI ใน YouMind

บันทึกแหล่งที่มา ถามคำถามที่ตรงประเด็น สรุปข้อโต้แย้ง และเปลี่ยนบทความไวรัลให้เป็นโน้ตที่นำกลับมาใช้ได้ใน AI เวิร์กสเปซเดียว

สำรวจ YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม