Tận dụng tối đa GPT-5.6: Sol, Terra và Luna

@cerebras
TIẾNG ANH2 ngày trước · 27 thg 7, 2026
278K
1.3K
98
53
1.2K

TL;DR

Hướng dẫn này khám phá dòng mô hình GPT-5.6, so sánh tốc độ và trí tuệ của Sol, Terra và Luna. Tài liệu cung cấp các chiến lược về cấp độ suy luận, bộ nhớ đệm prompt và quy trình làm việc đa tác nhân để tối đa hóa hiệu suất AI.

Tác giả: @0xSero & Zhenwei Gao (@zhennydez

Gói đăng ký Codex của bạn hiện đi kèm với 3 mô hình chính: Sol, Terra và Luna, mỗi mô hình được huấn luyện và phục vụ độc lập, với các mức độ suy luận có thể điều chỉnh. Cùng với nhau, chúng cho phép bạn chọn sự cân bằng về tốc độ, chi phí và trí thông minh cho từng tác vụ.

So sánh Giá nhanh (Giá nhà phát triển OpenAI ngày 21 tháng 7 năm 2026

Về giá, Terra có chi phí bằng một nửa Sol, trong khi Luna chỉ bằng một phần năm, cho cả hai loại sử dụng ngữ cảnh ngắn và dài.

Cerebras - inline image

Mức giá này khá tương đồng với trí thông minh và tốc độ. Trên thực tế, mỗi mô hình phù hợp nhất với một loại công việc khác nhau:

  1. Sol [thông minh nhất trong số này](https://openai.com/index/previewing-gpt-5-6-sol/). Nó phù hợp nhất cho các tác vụ dài hạn, các thách thức kỹ thuật phức tạp và hỗ trợ cá nhân. Khả năng bổ sung đó đi kèm với độ trễ và chi phí cao hơn, nhưng Sol xuất sắc trong việc điều phối các tác nhân phụ và giải quyết các dự án lớn trong các quy trình làm việc mở rộng.
  2. Terra nằm ở vị trí trung gian thoải mái, cung cấp phần lớn trí thông minh với chi phí bằng một nửa Sol. Nó cũng nhanh hơn ở mức vừa phải. Khi kết hợp với Sol, Terra có thể là một tác nhân phụ mạnh mẽ: Sol có thể cân nhắc các lựa chọn và đặt ra hướng đi, sau đó chuyển giao việc thực hiện cho Terra nhanh hơn, rẻ hơn.
  3. Luna là nhanh nhất và có giá phải chăng nhất trong ba mô hình, đồng thời vẫn vượt trội hơn hầu hết các mô hình trên thị trường, chỉ với chi phí bằng một phần năm của Sol. Đối với hầu hết các tác vụ AI hàng ngày, Luna hoàn toàn đủ khả năng, mang lại hiệu suất đáng tin cậy với chi phí cực kỳ thấp. Kể từ ngày 17 tháng 7 năm 2026, nó xếp hạng 16/576 trên tất cả các mô hình trong chỉ số trí thông minh của Artificial Intelligence.
Cerebras - inline image

Chọn Mô hình Tốt nhất cho Tác vụ

Làm thế nào để bạn quyết định mô hình nào nên xử lý một yêu cầu và mức độ suy luận mà nó nên áp dụng? Sự lựa chọn đó phải được thực hiện trước khi bất kỳ token nào được tạo ra.

Bắt đầu với Luna, Sau đó Leo thang.

Một cách đơn giản để tiếp cận bất kỳ tác vụ nào là chọn mô hình mang lại sự cân bằng tốt nhất giữa tốc độ và trí thông minh với mức giá bạn sẵn sàng trả. Trong họ GPT-5.6:

1. GPT-5.6-Sol: Trần và sàn trí thông minh cao nhất

2. GPT-5.6-Luna: Trần và sàn tốc độ cao nhất

Một mặc định tốt là bắt đầu hầu hết các tác vụ với Luna, sau đó chuyển lên Terra hoặc Sol khi tiến độ bị đình trệ, chẳng hạn như khi các tác nhân bị kẹt, các bản sửa lỗi không được áp dụng hoặc mô hình bắt đầu mất mạch. Nếu bạn sẵn sàng trả nhiều hơn cho cả tốc độ và trí thông minh, bạn có thể chạy Sol trên Cerebras với tốc độ 750 token mỗi giây, nhanh hơn tới 10 lần so với chế độ thông thường của Sol.

Cerebras - inline image

Tính toán Thời gian Thử nghiệm / Suy luận

Một cách khác để điều chỉnh cách mô hình xử lý một tác vụ là điều chỉnh mức độ suy luận của nó. Trong Codex, bạn có thể chọn từ năm tùy chọn: “Light,” “Medium,” “High,” “Extra High” và “Ultra”.

Bằng cách sử dụng nhiều thời gian xử lý máy tính hơn để tăng độ chính xác của đầu ra, mô hình sẽ tạo ra các token tranh luận và tự đặt câu hỏi trước khi đưa ra câu trả lời cho người dùng.

  • Light: Tuyệt vời để hoàn thành nhanh các tác vụ cơ bản, tìm kiếm tệp, sao chép và cấu hình kho lưu trữ, sắp xếp các bản tải xuống của bạn, v.v. Đây là mức độ suy luận bạn nên chọn về cơ bản cho bất cứ điều gì mà mô hình biết nó cần làm và khả năng thất bại là thấp.
  • Medium: Một mặc định hàng ngày tốt cho các tác vụ yêu cầu một số diễn giải, lập kế hoạch hoặc gỡ lỗi, nhưng không cần khám phá sâu. Điều này có thể bao gồm tóm tắt qua các tệp, triển khai một tính năng nhỏ hoặc khắc phục sự cố quen thuộc.
  • HighExtra-High: Tốt nhất cho các tác vụ STEM và mã hóa khó, chẳng hạn như gỡ lỗi phức tạp, quyết định kiến trúc, tái cấu trúc lớn hoặc các vấn đề có một số cách tiếp cận khả thi. Hầu hết các tác vụ hỗ trợ thông thường không cần nhiều suy luận như vậy, nếu có.
  • Ultra: Sử dụng chế độ suy luận cao nhất nếu bạn thực sự biết mình muốn gì và có các ràng buộc chi tiết, đặc biệt là trong công việc trải dài trên nhiều hệ thống độc lập. Ví dụ: xây dựng giao diện và API để kết nối 2 API theo một cách rất cụ thể.

Chúng tôi thường dành chế độ Ultra cho các câu hỏi nghiên cứu lớn nhất và những thách thức mới lạ. Chế độ Ultra có xu hướng tiêu hao giới hạn sử dụng của bạn rất nhanh, nhưng bạn có thể yên tâm rằng mô hình đã sử dụng toàn bộ ngân sách suy luận có sẵn để khám phá, xác minh và tinh chỉnh câu trả lời của mình.

Trong thử nghiệm của Artificial Analysis ngày 17 tháng 7, mỗi bước tăng lên trong mức độ suy luận của GPT-5.6 Sol đã làm tăng chi phí trung bình cho mỗi tác vụ lên khoảng 50%. Các biểu đồ dưới đây cho thấy mức độ suy luận bổ sung ảnh hưởng như thế nào đến cả trí thông minh và chi phí.

Cerebras - inline image

Tận dụng Cache Reads.

Đầu vào được lưu trong bộ nhớ đệm (cache) rẻ hơn 90% so với đầu vào mới. Các tác vụ Codex xử lý lặp đi lặp lại cùng một cơ sở mã hoặc ngữ cảnh sẽ được hưởng lợi rất nhiều.

Mỗi mô hình GPT-5.6 có TTL bộ nhớ đệm khoảng ~30 phút. Điều đó có nghĩa là duy trì một phiên làm việc duy nhất sẽ tốt hơn so với việc bắt đầu một phiên mới cho mỗi tác vụ.

Tính năng nén của Codex cũng đã đủ tốt để bạn có thể chạy một phiên duy nhất lên đến hàng trăm triệu token mà không gặp bất kỳ vấn đề nào.

Nếu bạn giữ phiên làm việc nóng, bạn sẽ có chi phí xử lý prompt rẻ hơn nhiều. Bạn có thể đặt các tự động hóa Codex được lên lịch sau mỗi 20 phút để giữ cho bộ nhớ đệm của bạn hoạt động và sử dụng các tự động hóa đó để thúc đẩy các quy trình chạy dài.

Cerebras - inline image

Sử dụng Hiệu quả Quy trình làm việc Đa tác nhân.

Các mô hình khác nhau được huấn luyện trên các dữ liệu khác nhau và được tối ưu hóa cho các mục tiêu khác nhau, có nghĩa là mỗi mô hình sẽ tốt hơn hoặc kém hơn một chút so với những mô hình khác ở một số khía cạnh nhất định.

Quy trình làm việc Cố vấn (Advisor) cho một tác nhân một công việc cụ thể: đọc toàn bộ phiên làm việc, theo dõi mục tiêu và các ràng buộc, và can thiệp bất cứ khi nào tác nhân làm việc bắt đầu đi chệch hướng. Điều này giúp tự động định hướng tác nhân làm việc và cải thiện độ tin cậy trong các tác vụ dài hơn.

Codex Local cũng cho phép bạn đưa các nhà cung cấp khác vào ứng dụng. Điều này có nghĩa là bạn có thể thử nghiệm với các mô hình có trọng số mở, chi phí thấp hơn như Kimi K2.7 Code hoặc các mô hình có điểm mạnh khác, chẳng hạn như GLM-5.2 cho suy luận và mã hóa tầm xa, trong khi vẫn ở trong trải nghiệm Codex quen thuộc.

Sau đó, bạn có thể sử dụng các mô hình bên ngoài này cho công việc của tác nhân phụ có giới hạn, giúp giảm chi phí hoặc tận dụng các điểm mạnh khác nhau của từng mô hình.

Một sắc thái quan trọng: việc này được thực hiện thông qua cấu hình Codex và các tệp tác nhân tùy chỉnh, chứ không phải là một bộ chọn mô hình đơn giản trong ứng dụng. Codex hỗ trợ các nhà cung cấp cục bộ như Ollama và LM Studio, cùng với các nhà cung cấp tùy chỉnh tương thích với Responses.

Cerebras - inline image

Kết luận

Giới hạn sử dụng của gói đăng ký khá hào phóng, nhưng khi các tác nhân AI trở nên hữu ích hơn cho nhiều người hơn, nhiều người đang đẩy giới hạn vượt xa những gì một gói đăng ký có thể cung cấp.

ngay cả khi bạn có tiền để chi, không phải mọi mô hình “tiên phong” đều nằm ở vị trí tiên phong trong tất cả các trường hợp sử dụng. Thường thì một mô hình nhỏ có thể hoàn toàn vượt trội so với một tập hợp các mô hình tốt nhất thế giới trên một vài điểm chuẩn.

Tốc độ là một công tắc quan trọng. Trong ngày khi bạn đang tương tác với các tác nhân của mình, tốc độ tok/s cao có thể cải thiện đáng kể trải nghiệm của bạn. Trong giờ nghỉ, một /goal với một mô hình suy luận bổ sung chậm có thể tạo ra sự khác biệt lớn.

Và cuối cùng, hãy để mắt đến Artificial Analysis, nó chứa đầy các điểm chuẩn tốc độ mô hình chất lượng cao và các chỉ số trí thông minh.

Cảm ơn Sarah Chieng (@MilksandMatcha), Joyce Er và Hai-Ching vì đã xem xét và đóng góp ý kiến, và Halley Change (@halleychangg) vì đã thiết kế đồ họa cho bài blog này.

Viết lại trong YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral