Ngày 26/6/2026, OpenAI âm thầm mở một đợt preview giới hạn cho một nhóm nhỏ đối tác được kiểm định — động thái khá bất thường, được cho là có phối hợp trước với chính phủ Mỹ (OpenAI, 2026a; CNBC, 2026). Hai tuần sau, ngày 9/7, hãng chính thức mở rộng: GPT‑5.6 ra mắt toàn cầu, không phải như một bản nâng cấp đơn lẻ, mà như một họ ba mô hình (OpenAI, 2026b).
Không còn "một mô hình, một nút chỉnh" — giờ là ba tầng riêng biệt
Đây có lẽ là thay đổi đáng chú ý nhất về mặt chiến lược sản phẩm. Thay vì tung ra một mô hình duy nhất kèm các mức "effort" như trước, OpenAI chia GPT‑5.6 thành ba tầng năng lực độc lập:
- Sol — flagship, dành cho việc khó: coding dài hơi, an ninh mạng, nghiên cứu khoa học, agent phức tạp.
- Terra — bản cân bằng, hiệu năng ngang GPT‑5.5 nhưng rẻ hơn đáng kể.
- Luna — nhanh và rẻ nhất, hợp cho khối lượng xử lý lớn.
Theo OpenAI, con số "5.6" giờ chỉ đại diện cho thế hệ, còn Sol/Terra/Luna là các tầng năng lực có thể phát triển theo nhịp độ riêng — nghĩa là lần sau có thể chỉ Sol được nâng cấp mà không cần đổi cả họ (OpenAI, 2026b).
Coding: điểm sáng lớn nhất, nhưng không phải ở mọi mặt trận
OpenAI gọi Sol là "mô hình coding tốt nhất từ trước đến nay" của hãng, và số liệu ủng hộ phần lớn tuyên bố này. Trên Artificial Analysis Coding Agent Index, Sol đạt 80 điểm — nhỉnh hơn Claude Fable 5 (77,2) khoảng 2,8 điểm, trong khi chỉ tốn chưa đến một nửa số token và một nửa thời gian (OpenAI, 2026b). Trên Terminal‑Bench 2.1 — bài test về xử lý dòng lệnh phức tạp — Sol đạt 88,8% (chế độ Ultra lên đến 91,9%), vượt hẳn 85,6% của GPT‑5.5 (OpenAI, 2026b).
Nhưng có một benchmark mà Sol không dẫn đầu: SWE‑Bench Pro, bài test thiên về sửa lỗi trong codebase thực tế phức tạp. Ở đây Claude Fable 5 vẫn bỏ xa với 80%, so với 64,6% của Sol (OpenAI, 2026b). Nói cách khác: nếu việc của bạn là điều phối agent, chạy terminal, làm việc dài hơi — Sol là lựa chọn mạnh. Nếu là refactor sâu một codebase rắc rối — Fable 5 vẫn đang ở vị trí dẫn đầu.
An ninh mạng: bước nhảy rõ rệt nhất trong cả bản cập nhật
Nếu phải chọn một mảng cải thiện ấn tượng nhất, đó là an ninh mạng. Trên ExploitBench — đo khả năng đi từ phát hiện lỗ hổng đến thực thi mã tùy ý — Sol đạt 73,5%, so với 47,9% của GPT‑5.5 (OpenAI, 2026b). Trên ExploitGym, tỷ lệ thành công gần như tăng gấp đôi: từ 15,1% lên 24,9% (giới hạn 2 giờ), thậm chí 33,7% nếu cho 6 giờ (OpenAI, 2026b).
Con số này dễ khiến người ta lo ngại, nhưng OpenAI khẳng định Sol không vượt ngưỡng "Critical" trong khung Preparedness Framework của hãng — mô hình giỏi tìm và vá lỗ hổng hơn là tự mình thực hiện trọn vẹn một cuộc tấn công vào hệ thống đã được gia cố (OpenAI, 2026a; OpenAI, 2026b). Để đi kèm, OpenAI cũng siết chặt safeguard: các biện pháp chặn hoạt động độc hại liên quan an ninh mạng tăng khoảng 10 lần so với thế hệ trước (OpenAI, 2026b).
Khoa học, sử dụng máy tính, và những con số lặt vặt nhưng đáng giá
Ở mảng khoa học sự sống, Sol cho kết quả cải thiện đồng đều so với GPT‑5.5 trên các bài test về sinh học, hóa học và nghiên cứu khoa học sự sống, dù OpenAI không công bố điểm số cụ thể cho mọi benchmark trong nhóm này (OpenAI, 2026b). Ở mảng "computer use" — mô hình tự thao tác máy tính, duyệt web — Sol lập kỷ lục mới trên BrowseComp (90,4%, chế độ Ultra 92,2%) và OSWorld 2.0 (62,6%), vượt cả Claude Opus 4.8 trong khi chỉ dùng khoảng 15% lượng token của mô hình đó cho cùng một việc (OpenAI, 2026b).
Một tính năng mới đáng chú ý là chế độ ultra: thay vì chạy một agent, hệ thống điều phối song song 4 agent con (có thể mở rộng lên 16) để đẩy nhanh các tác vụ phức tạp. Đi kèm là Programmatic Tool Calling — cho phép mô hình tự viết và chạy chương trình điều phối công cụ trong bộ nhớ, giảm đáng kể số lượt gọi và token cần dùng (OpenAI, 2026b).
So với đối thủ: cạnh tranh sát nút, không có người thắng tuyệt đối
Nhìn tổng thể vào bảng benchmark do chính OpenAI công bố (nên cần đọc với một chút thận trọng, vì là số liệu tự chấm), bức tranh cạnh tranh khá rõ:
- Claude Fable 5 (Anthropic) vẫn dẫn đầu ở chỉ số thông minh tổng quát (Artificial Analysis Intelligence Index: 59,9 so với 58,9 của Sol) và SWE‑Bench Pro, nhưng OpenAI cho rằng Sol đạt mức gần tương đương với tốc độ nhanh hơn 61% và chi phí chỉ bằng một nửa (OpenAI, 2026b).
- Gemini 3.1 Pro Preview (Google) tụt lại khá xa ở các benchmark coding-agent (42,7 điểm trên Coding Agent Index, so với 80 của Sol) nhưng vẫn cạnh tranh sòng phẳng ở GPQA Diamond (94,3% so với 94,6%) (OpenAI, 2026b).
- Claude Opus 4.8 nằm ở giữa hai nhóm trên hầu hết các bài test.
Phân tích độc lập từ Artificial Analysis củng cố thêm góc nhìn "hiệu năng trên mỗi đồng chi": Sol (chế độ max) dùng khoảng 15.000 token/tác vụ trong Intelligence Index — ít hơn cả GPT‑5.5 (16.000 token) — trong khi đạt mức thông minh gần tương đương Fable 5 với chi phí chỉ bằng khoảng một phần ba (Artificial Analysis, 2026).
Giá bán: rẻ ba tầng, không đổi ở đỉnh
| Model | Input / 1M token | Output / 1M token |
|---|---|---|
| GPT‑5.6 Sol | $5 | $30 |
| GPT‑5.6 Terra | $2,50 | $15 |
| GPT‑5.6 Luna | $1 | $6 |
(OpenAI, 2026b)
Đáng chú ý, giá của Sol giữ nguyên so với mức của GPT‑5.5 — nghĩa là người dùng trả cùng một mức giá nhưng nhận được năng lực cao hơn. Về khả năng tiếp cận: người dùng ChatGPT Plus/Pro/Business/Enterprise dùng được Sol ở mức reasoning trung bình trở lên; gói Free/Go trong ChatGPT Work và Codex chỉ được cấp Terra; nhà phát triển truy cập cả ba tầng qua API (OpenAI, 2026b; OpenAI, 2026c).
Vậy có nên nâng cấp?
Nếu công việc của bạn xoay quanh coding-agent, thao tác terminal dài hơi, hoặc tác vụ tự động hóa nhiều bước — Sol là bước tiến rõ ràng so với GPT‑5.5, với chi phí trên mỗi tác vụ thấp hơn hẳn. Nếu công việc thiên về phân tích codebase phức tạp hoặc cần điểm "thông minh tổng quát" cao nhất, Claude Fable 5 vẫn là lựa chọn đáng cân nhắc song song. Không có "người chiến thắng tuyệt đối" ở đây — bức tranh benchmark tháng 7/2026 là một cuộc đua sát nút giữa vài mô hình, mỗi mô hình mạnh ở một khía cạnh khác nhau.
