การเพิ่มประสิทธิภาพเส้นโค้งสมรรถนะระดับแนวหน้า

@mustafasuleyman
อังกฤษ2 วันที่ผ่านมา · 29 ก.ค. 2569
133K
250
32
21
72

TL;DR

Mustafa Suleyman อธิบายรายละเอียดกลยุทธ์ของ Microsoft AI ในด้านประสิทธิภาพของโทเค็นและโมเดลเฉพาะทาง โดยเน้นย้ำถึงการประหยัดต้นทุนอย่างมหาศาลและการเปิดตัวบริการ Frontier Tuning

สัปดาห์นี้ MAI-Cyber-1-Flash ในฮาร์เนส MDASH ของเรา ขึ้นอันดับ 1 ในเกณฑ์วัด CyberGym - เอาชนะ Mythos ได้ 12 จุดเปอร์เซ็นต์ - ด้วยต้นทุนเพียง 50%

การปรับแต่งประสิทธิภาพ-ต้นทุนแบบนี้เป็นหัวใจสำคัญของกระบวนทัศน์การปรับใช้โมเดลใหม่ Tokenmaxxing เป็นเรื่องราวหลักในช่วงไม่กี่เดือนที่ผ่านมา ประสิทธิภาพของ Token คือโฟกัสใหญ่ถัดไปของอุตสาหกรรม

เพื่อสร้างบริษัทระดับแนวหน้า คุณต้องปรับประสิทธิภาพระดับแนวหน้าให้สอดคล้องกับต้นทุน การเลือกตำแหน่งบนเส้นโค้งนั้นเป็นสิ่งสำคัญ ด้วยการปรับแต่งโมเดล ฮาร์เนส และ RLE ร่วมกัน คุณสามารถเลือกจุดบนเส้นโค้งที่เหมาะสมกับบริษัทของคุณ

ในขณะที่เราเร่งสู่โลกที่บริษัทระดับแนวหน้าปรับใช้เอเจนต์แบบเรียลไทม์ที่ทำงานต่อเนื่องอยู่เบื้องหลัง ค่าความต้องการอินเฟอเรนซ์จะพุ่งสูงขึ้นอย่างมาก

ในกรณีส่วนใหญ่ โมเดลทั่วไประดับแนวหน้าไม่จำเป็นสำหรับทุกงาน ด้วยการปรับแต่งโมเดลสำหรับผลิตภัณฑ์เฉพาะ คุณสามารถรักษาหรือแม้กระทั่งเกินประสิทธิภาพระดับแนวหน้า พร้อมลดต้นทุน Token ลงอย่างมาก บางครั้งถึง 50% หรือมากกว่า

ดังที่ Satya เพิ่งกล่าวในการประชุมผลประกอบการไตรมาส 4 ของเรา เราส่งมอบโมเดล MAI เฉพาะทางมากกว่าสิบรุ่น ครอบคลุมผลิตภัณฑ์ Microsoft ตั้งแต่ไตรมาสที่แล้ว โมเดลทั้งหมดนี้ คงหรือปรับปรุงคุณภาพ เมื่อเทียบกับโมเดลที่ใช้งานอยู่เดิม ขณะใช้ Token น้อยลงอย่างมาก ในหลายกรณีประหยัดค่าใช้จ่าย GPU ได้ถึง 50-90%

นี่คือเครื่องจักรปีนเขาที่กำลังทำงาน การปรับแต่งโมเดลของตัวเองในฮาร์เนสของตัวเอง ด้วยข้อมูลและเวิร์กโฟลว์ของคุณ ฝึกใน RLE ของคุณ เราเชื่อว่านี่คือจังหวะใหม่ของบริษัทระดับแนวหน้า และเรากำลังสร้างบริการชื่อ Frontier Tuning ซึ่งจะช่วยให้ทุกบริษัททำงานแบบนี้ได้

วงล้อนี้คือสิ่งที่ทำให้ระบบนิเวศระดับแนวหน้าเจริญรุ่งเรืองและมีความยืดหยุ่นมากขึ้น ทำให้คุณสามารถสลับโมเดล สร้างทรัพย์สินทางปัญญาของตัวเอง และควบคุมต้นทุนได้

นี่คือรายชื่อโมเดลบางส่วนที่เราส่งมอบในไตรมาสนี้และผลกระทบต่อประสิทธิภาพของ Token:

  • MAI-Code-1-Flash มีอัตราการยอมรับโค้ดสูงกว่า GPT-5.4 Mini และ Claude Haiku 4.5 ใน VS Code ถึง 10% การใช้งาน Token เฉลี่ยลดลง 10% และเพิ่มการรักษาผู้ใช้โดยเฉลี่ย 9%
  • MAI-Code-1-Flash ยังเป็นพื้นฐานของโมเดล Excel ของเรา ซึ่งให้ประสิทธิภาพเทียบเท่าโมเดลที่คล้ายกัน ในขณะที่ให้บริการบน H100s แทนที่จะเป็น GBs
  • MAI-Image-2.5-Flash ลดค่าใช้จ่าย GPU ใน PowerPoint ได้ สูงสุด 84% เมื่อเทียบกับ GPT-Image-2 ใน OneDrive ให้ประสิทธิภาพ Token สูงถึง 2.5 เท่า พร้อมลดเวลาแฝง P95 ลง 25% เมื่อเทียบกับ GPT-Image-1.5 และเพิ่มอัตราการบันทึกของผู้ใช้ 25%
  • MAI-Voice-2-Flash ให้คุณภาพระดับโลก ขณะลดค่าใช้จ่าย GPU สูงสุด 89% และเร็วกว่า 2 เท่า ราคาถูกกว่ารุ่นก่อน 32%
  • MAI-Transcribe-1.5 ซึ่งทำงานได้ เร็วกว่าโมเดลคู่แข่งถึง 5 เท่า ถูกส่งมอบใน 58 ภาษาทั่วผลิตภัณฑ์ Dragon Copilot ซึ่งถูกใช้งานโดยผู้ให้บริการทางการแพทย์ 170,000 ราย สำหรับการพบผู้ป่วยเกือบ 30 ล้านครั้ง

มันเป็นฤดูร้อนแห่งการทำงานหนักในช่วงเวลาที่น่าตื่นเต้นที่สุดในประวัติศาสตร์ของอุตสาหกรรมเรา ผลงานยอดเยี่ยมจากทีม! ยังมีอีกมากรออยู่ เราเพิ่งเริ่มต้นเท่านั้น

สร้างต่อใน YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม