Tuần này, MAI-Cyber-1-Flash trong bộ khung MDASH của chúng tôi đã đạt vị trí số 1 trên benchmark CyberGym - vượt qua Mythos 12 điểm phần trăm - với chi phí chỉ bằng 50%.
Những kiểu tối ưu hóa giữa hiệu suất và chi phí này là trọng tâm của mô hình triển khai mới. Tokenmaxxing đã là câu chuyện chính trong vài tháng qua. Hiệu suất token là trọng tâm lớn tiếp theo trong toàn ngành.
Để xây dựng một công ty tiên phong, bạn phải tối ưu hóa hiệu suất tiên phong so với chi phí. Việc chọn vị trí trên đường cong đó là rất quan trọng. Bằng cách đồng tối ưu hóa các mô hình, bộ khung và RLE của bạn, bạn có thể chọn một điểm trên đường cong phù hợp với công ty mình.
Khi chúng ta chạy đua hướng tới một thế giới nơi các công ty tiên phong triển khai các tác nhân thời gian thực luôn bật, hoạt động liên tục trong nền, chi phí yêu cầu suy luận sẽ tăng vọt.
Trong hầu hết các trường hợp, các mô hình đa năng tiên phong không cần thiết cho mọi tác vụ. Bằng cách tinh chỉnh mô hình cho một sản phẩm cụ thể, bạn có thể duy trì hoặc thậm chí vượt qua hiệu suất tiên phong, đồng thời giảm chi phí token một cách đáng kể, đôi khi lên tới 50% hoặc hơn.
Như Satya vừa đề cập trong cuộc họp báo cáo thu nhập quý 4, chúng tôi đã ra mắt hơn một chục mô hình MAI chuyên biệt trên các sản phẩm của Microsoft kể từ quý trước. Tất cả đều duy trì hoặc cải thiện chất lượng so với các mô hình đã triển khai trước đó, đồng thời sử dụng ít token hơn đáng kể, trong nhiều trường hợp tiết kiệm tới 50-90% chi phí GPU.
Đây chính là cỗ máy leo đồi đang hoạt động. Đồng tối ưu hóa các mô hình của riêng bạn, trong bộ khung của riêng bạn, với dữ liệu và quy trình làm việc của bạn, được huấn luyện trong RLE của bạn. Chúng tôi tin rằng đây là nhịp điệu mới của một công ty tiên phong, và chúng tôi đang xây dựng một dịch vụ có tên Frontier Tuning, sẽ giúp tất cả các công ty hoạt động theo cách này.
Vòng quay này sẽ giúp hệ sinh thái tiên phong phát triển thịnh vượng và linh hoạt hơn, đảm bảo bạn có thể hoán đổi mô hình, xây dựng IP riêng và kiểm soát chi phí.
Dưới đây là danh sách một số mô hình chúng tôi đã ra mắt trong quý này và tác động đến hiệu suất token:
- MAI-Code-1-Flash mang lại tỷ lệ chấp nhận mã cao hơn 10% so với GPT-5.4 Mini và Claude Haiku 4.5 trong VS Code, giảm 10% mức sử dụng token trung bình, và tăng tỷ lệ giữ chân người dùng trung bình 9%.
- MAI-Code-1-Flash cũng là nền tảng cho mô hình Excel của chúng tôi, mang lại hiệu suất tương đương với các mô hình tương tự, trong khi được phục vụ trên H100s, thay vì GBs.
- MAI-Image-2.5-Flash giảm chi phí GPU tới 84% trong PowerPoint so với GPT-Image-2. Trong OneDrive, nó mang lại hiệu suất token lên tới 2.5x, đồng thời cắt giảm độ trễ P95 xuống 25% so với GPT-Image-1.5 và tăng tỷ lệ lưu của người dùng lên 25%.
- MAI-Voice-2-Flash mang lại chất lượng đẳng cấp thế giới trong khi giảm chi phí GPU tới 89%, đồng thời nhanh hơn 2 lần và rẻ hơn 32% so với phiên bản tiền nhiệm.
- MAI-Transcribe-1.5 có thể chạy nhanh hơn tới 5 lần so với các mô hình đối thủ, được triển khai cho 58 ngôn ngữ trên sản phẩm Dragon Copilot, được 170.000 nhà cung cấp dịch vụ y tế sử dụng cho gần 30 triệu lượt khám bệnh.
Đó là một mùa hè làm việc chăm chỉ trong thời điểm thú vị nhất trong lịch sử ngành của chúng ta. Công việc tuyệt vời của cả nhóm! Còn nhiều điều sắp tới, chúng ta mới chỉ bắt đầu.





