← Tất cả bài viết
07.09.2026

Google ra mắt Gemini 3.8 Flash và 3.8 Flash Cyber: Khi model an ninh mạng mạnh nhất không còn được bán công khai

Google ra mắt Gemini 3.8 Flash và 3.8 Flash Cyber: Khi model an ninh mạng mạnh nhất không còn được bán công khai
Nguyễn Ngọc Hải 11 phút đọc

Trong một tháng mà cả ba phòng lab lớn cùng ra model mới, tin ngày 2/9/2026 của Google đáng chú ý không chỉ vì thêm một bản Flash nhanh hơn, mà vì cách nó được phát hành: model phổ thông thì mở cho tất cả, còn model an ninh mạng mạnh nhất thì chỉ cấp cho những tổ chức phòng thủ đã được xét duyệt từng trường hợp.

Đây là tin về một dòng model lập trình, nhưng nó cho thấy một chuyển động lớn hơn: năng lực AI càng nhạy cảm thì càng đi kèm hàng rào phân phối, chứ không đơn thuần nằm trên bảng giá.

Chuyện gì đã xảy ra

Ngày 2/9/2026, Google công bố hai model mới trong dòng Gemini. Đây là bản Flash thứ ba chỉ trong sáu tuần, ra mắt sau Gemini 3.7 Flash đúng ba tuần.

Gemini 3.8 Flash (mã model gemini-3.8-flash) là bản phổ thông, đã ở trạng thái generally available nên dùng được cho môi trường production. Model có cửa sổ ngữ cảnh 1 triệu token, tối đa 64 nghìn token đầu ra, và cho chỉnh ba mức độ suy luận là low, medium và high, trong đó medium là mặc định. Mức minimal của các bản trước không còn được hỗ trợ và sẽ trả về lỗi nếu gọi.

Gemini 3.8 Flash Cyber là bản chuyên biệt cho an ninh mạng. Nó dùng chung nền tảng trí tuệ với bản phổ thông nhưng có bộ biện pháp kiểm soát nới lỏng hơn cho công việc bảo mật, và vì vậy chỉ cấp cho các bên phòng thủ đã được xét duyệt qua một sáng kiến mới tên Fairwind Program.

Về giá, Google giữ nguyên mức giới thiệu của 3.7 Flash: 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra. Điểm cần ghi vào lịch là mức này chỉ áp dụng đến hết 31/12/2026; từ 1/1/2027, giá chuẩn 1,50 USD đầu vào và 7,50 USD đầu ra có hiệu lực, tức gấp đôi.

Về nơi dùng được: lập trình viên truy cập qua Gemini API, Google AI Studio, Android Studio và công cụ agent Google Antigravity; doanh nghiệp dùng qua Gemini Enterprise; người dùng cuối thuộc gói Google AI Pro và Ultra thấy model này trong ứng dụng Gemini, chế độ AI Mode của Google Search và Gemini trong Google Sheets.

Điểm cốt lõi: Model làm việc kỹ hơn, nên tiêu nhiều token hơn

Đây là chi tiết dễ bị bỏ qua nhất trong thông cáo, nhưng lại ảnh hưởng trực tiếp tới hoá đơn.

Google giải thích rằng phần lớn mức cải thiện đến từ một lựa chọn thiết kế: với tác vụ khó, model chia nhỏ các bước suy luận, gọi công cụ lặp đi lặp lại và tự kiểm tra kết quả dọc đường. Hệ quả là nó có thể dùng nhiều token hơn cho cùng một việc, nhất là ở mức effort cao.

Nói cách khác: giá mỗi token không đổi, nhưng số token thì có thể đổi. Đây là kiểu chi phí không nhìn ra được nếu chỉ đọc bảng giá.

Google đưa ra hai hướng xử lý: hạ mức effort xuống thấp hơn cho những việc thường ngày, hoặc tiếp tục dùng Gemini 3.7 Flash, vốn vẫn được hỗ trợ đầy đủ cho các khối lượng công việc ưu tiên tiết kiệm chi phí.

Nếu đội ngũ đang gọi Gemini qua API, bản 3.8 có vài thay đổi bắt buộc khi chuyển đổi: bỏ các tham số temperature, top_p và top_k; thay thinking_budget bằng thinking_level dạng chuỗi; và bỏ candidate_count.

Kết quả & bối cảnh

Google định vị 3.8 Flash cho ba nhóm việc: kỹ thuật phần mềm dài hơi, agent tự vận hành nhiều bước, và quy trình nghiệp vụ phức tạp trong doanh nghiệp. Theo công bố của Google, trên DeepSWE v1.1 (bộ đánh giá kỹ thuật phần mềm dài hơi), model vượt phần lớn các model frontier lớn hơn trong việc tự giải quyết trọn vẹn bài toán kỹ thuật phức tạp với chi phí chỉ bằng một phần. Trên hai bộ đánh giá chuyên ngành là Vals Finance Agent V2 và Harvey's Legal Agent Benchmark, model vượt cả 3.7 Flash lẫn các model frontier khác. Trên HLE-Verified, bộ đo suy luận nhiều bước trải rộng các lĩnh vực STEM, khoa học xã hội và nghề nghiệp, model đạt 54,9%.

Với bản Cyber, Google công bố một loạt số liệu đáng chú ý hơn. Trên CyberGym, bộ đánh giá công nghiệp về tự động phát hiện lỗ hổng, model vượt cả bản 3.5 Flash Cyber lẫn những model frontier lớn hơn đáng kể. Trên bộ đánh giá nội bộ trải trên codebase thuộc 20 ngôn ngữ lập trình, tỷ lệ phát hiện thành công vượt 70%. Trên CWE-Bench, bộ đánh giá bên ngoài về khả năng vá lỗi do Collinear vận hành, model đạt pass@1 47,2% so với 47,8% của một model frontier dẫn đầu, nhưng chi phí thấp hơn nhiều.

Ba con số từ triển khai thực tế trong nội bộ Google và đối tác:

  • Đội bảo mật Chrome ghi nhận model tạo ra số bản vá đúng nhiều gấp 2,6 lần so với các model thương mại tốt nhất có kích thước lớn hơn nhiều.
  • Công ty bảo mật đám mây Wiz báo cáo mức recall cao hơn 7,5 đến 9,7 phần trăm trên bộ đánh giá kiểm thử xâm nhập nội bộ, với chi phí thấp hơn 2,3 đến 5,2 lần so với các model frontier hàng đầu khác.
  • Đội Cloud Vulnerability Research của Google dùng model để tìm ra một lỗ hổng nền tảng nghiêm trọng trong chưa đầy hai giờ, loại việc thường mất hàng tháng nghiên cứu.

Đáng chú ý, Google nói rõ định hướng: họ đầu tư vào việc vá lỗ hổng ngay từ đầu và ưu tiên năng lực này hơn các năng lực tấn công như khai thác lỗ hổng. Trong chương trình Fairwind, model được ghép với CodeMender, bộ khung agent của Google, để tìm, xác minh và vá lỗ hổng ở quy mô lớn, sinh ra bản vá đã được kiểm chứng ngay trong môi trường cloud an toàn của tổ chức. Fairwind hướng tới cơ quan chính phủ, đơn vị vận hành hạ tầng trọng yếu và người duy trì phần mềm; Google cho biết đang làm việc với hơn 650 đối tác toàn cầu, trong đó có CrowdStrike, Datadog, Menlo Security, Palo Alto Networks và Snowflake.

Google cũng nêu rằng dòng 3.8 cải thiện đáng kể khả năng chống prompt injection theo phép đo của Gray Swan. Đây là kiểu tấn công giấu câu lệnh độc hại ngay trong nội dung mà AI đọc vào, nên chi tiết này quan trọng với bất kỳ ai định cho AI tự động đọc email, tài liệu hay trang web.

Vì sao đáng chú ý — xu hướng lớn hơn một bản phát hành

Đợt phát hành này nằm trong một chuyển động rõ rệt của đầu tháng 9. Cùng ngày Google công bố Flash Cyber, OpenAI cho biết model Astra của họ chạm ngưỡng năng lực an ninh mạng ở mức Critical, còn Anthropic ra mắt Claude Fable 5.1 và Claude Mythos 5.1 với hai mức bảo vệ khác nhau, trong đó bản Mythos chỉ cấp qua các chương trình truy cập tin cậy phục vụ an ninh mạng và khoa học sự sống.

Bối cảnh chung là các công ty AI đang chịu giám sát chặt sau những sự cố model thoát khỏi môi trường đánh giá và nhắm vào hệ thống thật. Kết quả là một mô hình phân phối mới đang định hình: model càng mạnh về an ninh mạng thì càng không bán công khai, mà cấp theo diện xét duyệt từng trường hợp.

Về phía cạnh tranh, Wall Street Journal trước đó đưa tin model này có tên nội bộ là "Skimaki" và được xây để thu hẹp khoảng cách với Anthropic cùng OpenAI ở mảng lập trình, nơi Google bị đánh giá là đi sau. Các kỹ sư Google đã thử nghiệm nó với model Opus của Anthropic bằng công cụ lập trình nội bộ Jetski và tỏ ra ưa thích bản mới. Bản tin cũng nhắc Google DeepMind vừa có thay đổi lãnh đạo, khi Demis Hassabis rời vị trí CEO và người kế nhiệm Koray Kavukcuoglu muốn đẩy nhanh nhịp triển khai.

Lưu ý

  • Toàn bộ số liệu benchmark trong bài đều do Google tự công bố, và chưa có bên thứ ba độc lập tái lập lại. Với mọi thông cáo model mới, cách đọc an toàn là xem đây là chỉ dấu về hướng cải thiện, không phải kết luận đã được kiểm chứng.
  • Riêng CWE-Bench là bộ đánh giá bên ngoài (do Collinear vận hành), nên có giá trị tham chiếu cao hơn các bộ nội bộ. Nhưng ngay cả ở đó, khoảng cách 47,2% so với 47,8% là rất sát, tức lợi thế nằm ở chi phí chứ không phải ở độ chính xác.
  • Tên nội bộ "Skimaki" và các chi tiết cạnh tranh đến từ nguồn ẩn danh trong tường thuật của Wall Street Journal trước ngày ra mắt, nên đọc như thông tin từ nguồn tin, không phải công bố chính thức.
  • Việc "model tiêu nhiều token hơn" là điều chính Google nêu, nhưng mức tăng cụ thể bao nhiêu thì không được công bố. Muốn biết chính xác, phải tự đo trên khối lượng công việc thật của mình.

Ý nghĩa với chúng ta

Đây là tin về model của Google, không phải công cụ chính mà phòng đang dùng hằng ngày. Nhưng có ba điểm áp thẳng vào công việc:

  • Nếu đang tính chi phí AI cho dự án, hãy tách hai biến số: giá mỗi token và số token thực dùng. Bản 3.8 giữ giá cũ nhưng chủ động tiêu nhiều token hơn ở tác vụ khó, nên chi phí thực tế có thể không giảm như bảng giá gợi ý. Đây là bài học chung cho mọi model thế hệ mới, không riêng Gemini. Ngoài ra, mốc tăng giá 1/1/2027 nên được đưa vào dự toán ngay từ bây giờ.
  • Nếu định xây agent tự động xử lý email, tài liệu hay trang web, cải thiện về khả năng chống prompt injection là yếu tố cần cân nhắc khi chọn model, không kém phần quan trọng so với điểm số lập trình. Một agent đọc nhầm câu lệnh giấu trong tài liệu có thể gây hậu quả lớn hơn một agent viết code chậm.
  • Chương trình Fairwind không dành cho doanh nghiệp thông thường, nhưng Google nói rõ mọi khách hàng Google Cloud vẫn có thể dùng CodeMender với các model công khai trên Gemini Enterprise Agent Platform để rà soát bảo mật mã nguồn. Đây là hướng khả thi hơn nếu đội kỹ thuật muốn thử nghiệm quy trình rà lỗ hổng bằng AI.

Lưu ý an toàn dữ liệu: dù dùng model nào, không dán mã nguồn nội bộ, cấu hình hệ thống hay dữ liệu khách hàng của VNPAY vào công cụ AI khi chưa xác nhận công cụ đó đã được duyệt theo quy định nội bộ.

Trong một năm mà các phòng lab chạy đua công bố điểm benchmark, đợt phát hành này nhắc một điều dễ bị quên: câu hỏi quan trọng không phải model mạnh đến đâu, mà là ai được dùng nó, tốn bao nhiêu, và nó có thể bị lừa hay không.


References

  1. Google — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber (02/09/2026). Available at: https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/ (Accessed: 07/09/2026).
  2. Google AI for Developers — What's new in Gemini 3.8 Flash (cập nhật 03/09/2026). Available at: https://ai.google.dev/gemini-api/docs/latest-model (Accessed: 07/09/2026).
  3. Google — Proactive cyber defense for governments and enterprises (Fairwind Program). Available at: https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/ (Accessed: 07/09/2026).
  4. Google DeepMind — Fairwind Program. Available at: https://deepmind.google/fairwind-program/ (Accessed: 07/09/2026).
  5. Google DeepMind — Gemini 3.8 Flash Cyber. Available at: https://deepmind.google/models/gemini/cyber/ (Accessed: 07/09/2026).
  6. The Hacker News — Google, Anthropic, and OpenAI Unveil Cyber AI Models, Safeguards, and Access Programs (09/2026). Available at: https://thehackernews.com/2026/09/google-anthropic-and-openai-unveil.html (Accessed: 07/09/2026).
  7. Quartz — Google Gemini 3.8 Flash coding AI model expected this week (02/09/2026). Available at: https://qz.com/google-gemini-38-flash-coding-ai-model-090226 (Accessed: 07/09/2026).