สัปดาห์นี้ MAI-Cyber-1-Flash ในฮาร์เนส MDASH ของเรา ขึ้นอันดับ 1 ในเกณฑ์วัด CyberGym - เอาชนะ Mythos ได้ 12 จุดเปอร์เซ็นต์ - ด้วยต้นทุนเพียง 50%
การปรับแต่งประสิทธิภาพ-ต้นทุนแบบนี้เป็นหัวใจสำคัญของกระบวนทัศน์การปรับใช้โมเดลใหม่ Tokenmaxxing เป็นเรื่องราวหลักในช่วงไม่กี่เดือนที่ผ่านมา ประสิทธิภาพของ Token คือโฟกัสใหญ่ถัดไปของอุตสาหกรรม
เพื่อสร้างบริษัทระดับแนวหน้า คุณต้องปรับประสิทธิภาพระดับแนวหน้าให้สอดคล้องกับต้นทุน การเลือกตำแหน่งบนเส้นโค้งนั้นเป็นสิ่งสำคัญ ด้วยการปรับแต่งโมเดล ฮาร์เนส และ RLE ร่วมกัน คุณสามารถเลือกจุดบนเส้นโค้งที่เหมาะสมกับบริษัทของคุณ
ในขณะที่เราเร่งสู่โลกที่บริษัทระดับแนวหน้าปรับใช้เอเจนต์แบบเรียลไทม์ที่ทำงานต่อเนื่องอยู่เบื้องหลัง ค่าความต้องการอินเฟอเรนซ์จะพุ่งสูงขึ้นอย่างมาก
ในกรณีส่วนใหญ่ โมเดลทั่วไประดับแนวหน้าไม่จำเป็นสำหรับทุกงาน ด้วยการปรับแต่งโมเดลสำหรับผลิตภัณฑ์เฉพาะ คุณสามารถรักษาหรือแม้กระทั่งเกินประสิทธิภาพระดับแนวหน้า พร้อมลดต้นทุน Token ลงอย่างมาก บางครั้งถึง 50% หรือมากกว่า
ดังที่ Satya เพิ่งกล่าวในการประชุมผลประกอบการไตรมาส 4 ของเรา เราส่งมอบโมเดล MAI เฉพาะทางมากกว่าสิบรุ่น ครอบคลุมผลิตภัณฑ์ Microsoft ตั้งแต่ไตรมาสที่แล้ว โมเดลทั้งหมดนี้ คงหรือปรับปรุงคุณภาพ เมื่อเทียบกับโมเดลที่ใช้งานอยู่เดิม ขณะใช้ Token น้อยลงอย่างมาก ในหลายกรณีประหยัดค่าใช้จ่าย GPU ได้ถึง 50-90%
นี่คือเครื่องจักรปีนเขาที่กำลังทำงาน การปรับแต่งโมเดลของตัวเองในฮาร์เนสของตัวเอง ด้วยข้อมูลและเวิร์กโฟลว์ของคุณ ฝึกใน RLE ของคุณ เราเชื่อว่านี่คือจังหวะใหม่ของบริษัทระดับแนวหน้า และเรากำลังสร้างบริการชื่อ Frontier Tuning ซึ่งจะช่วยให้ทุกบริษัททำงานแบบนี้ได้
วงล้อนี้คือสิ่งที่ทำให้ระบบนิเวศระดับแนวหน้าเจริญรุ่งเรืองและมีความยืดหยุ่นมากขึ้น ทำให้คุณสามารถสลับโมเดล สร้างทรัพย์สินทางปัญญาของตัวเอง และควบคุมต้นทุนได้
นี่คือรายชื่อโมเดลบางส่วนที่เราส่งมอบในไตรมาสนี้และผลกระทบต่อประสิทธิภาพของ Token:
- MAI-Code-1-Flash มีอัตราการยอมรับโค้ดสูงกว่า GPT-5.4 Mini และ Claude Haiku 4.5 ใน VS Code ถึง 10% การใช้งาน Token เฉลี่ยลดลง 10% และเพิ่มการรักษาผู้ใช้โดยเฉลี่ย 9%
- MAI-Code-1-Flash ยังเป็นพื้นฐานของโมเดล Excel ของเรา ซึ่งให้ประสิทธิภาพเทียบเท่าโมเดลที่คล้ายกัน ในขณะที่ให้บริการบน H100s แทนที่จะเป็น GBs
- MAI-Image-2.5-Flash ลดค่าใช้จ่าย GPU ใน PowerPoint ได้ สูงสุด 84% เมื่อเทียบกับ GPT-Image-2 ใน OneDrive ให้ประสิทธิภาพ Token สูงถึง 2.5 เท่า พร้อมลดเวลาแฝง P95 ลง 25% เมื่อเทียบกับ GPT-Image-1.5 และเพิ่มอัตราการบันทึกของผู้ใช้ 25%
- MAI-Voice-2-Flash ให้คุณภาพระดับโลก ขณะลดค่าใช้จ่าย GPU สูงสุด 89% และเร็วกว่า 2 เท่า ราคาถูกกว่ารุ่นก่อน 32%
- MAI-Transcribe-1.5 ซึ่งทำงานได้ เร็วกว่าโมเดลคู่แข่งถึง 5 เท่า ถูกส่งมอบใน 58 ภาษาทั่วผลิตภัณฑ์ Dragon Copilot ซึ่งถูกใช้งานโดยผู้ให้บริการทางการแพทย์ 170,000 ราย สำหรับการพบผู้ป่วยเกือบ 30 ล้านครั้ง
มันเป็นฤดูร้อนแห่งการทำงานหนักในช่วงเวลาที่น่าตื่นเต้นที่สุดในประวัติศาสตร์ของอุตสาหกรรมเรา ผลงานยอดเยี่ยมจากทีม! ยังมีอีกมากรออยู่ เราเพิ่งเริ่มต้นเท่านั้น





