Google DeepMind vừa giới thiệu Gemini 3.8 FlashGemini 3.8 Flash Cyber, hai biến thể mới nhất của dòng Flash, đánh dấu lần phát hành Flash thứ ba chỉ trong sáu tuần. Cả hai đều chạy trên cùng nền tảng trí tuệ cốt lõi, được tăng tốc bởi các vòng lặp agentic tự động đánh giá và tinh chỉnh model.

Gemini 3.8 Flash là model đa năng mạnh nhất trong dòng Flash, cải thiện đáng kể so với 3.7 Flash ở kỹ thuật phần mềm, tác vụ agentic và suy luận đa bước trong các lĩnh vực chuyên môn.

Giá giữ nguyên mức giới thiệu của 3.7 Flash: 0,75 USD/triệu token input và 3,75 USD/triệu token output (hết hạn 31/12/2026, sau đó là 1,50/7,50 USD).

Về hiệu năng công bố:

  • Trên DeepSWE v1.1 (lập trình phần mềm dài hạn), 3.8 Flash vượt hầu hết các model frontier lớn hơn với chi phí chỉ một phần nhỏ

  • Trên Vals Finance Agent V2 và Harvey’s Legal Agent Benchmark, nó vượt cả 3.7 Flash lẫn các model frontier khác.

  • HLE-Verified (suy luận khoa học liên ngành) đạt 54,9%.

gemini-3.8-flash-benchmarkVề hiệu năng thực tế, theo trang Arena.ai, Gemini 3.8 Flash (mức High) được đánh giá là vượt mặt một số model phổ biến hiện nay:

  • Agent Arena: Đạt hạng 14 với +5,94% cải thiện ròng (so vớ Gemini 3.7 Flash chỉ có +0,84% cải thiện) và vượt mặt DeepSeek-V4-Pro (#15, +5,91%).

  • Text Arena: Đạt hạng 7 với 1494 điểm, xếp trên Claude Opus 5 (High) (hạng 8, 1492 điểm) với các cải thiện theo về khả năng viết, Multi-Turn, Hard Prompts English, Coding và Instruction Following

  • Code Arena WebDev: Xếp thứ 18 với 1567 điểm, vượt qua Claude Opus 4.8 hạng 19 với 1563 điểm.

Điểm khác biệt của Gemini 3.8 Flash được thiết kế cho việc làm việc liên tục trong thời gian dài, trên các tác vụ phức tạp, model thực hiện thêm các bước suy luận và gọi công cụ lặp lại. Nếu ưu tiên hiệu quả tính toán, developer có thể dùng mức effort thấp hơn hoặc tiếp tục dùng 3.7 Flash.

Gemini 3.8 Flash Cyber dành riêng cho chuyên gia bảo mật, chỉ có qua chương trình Fairwind dành cho chính phủ, nhà vận hành hạ tầng trọng yếu và người bảo trì phần mềm. Các điểm nổi bật:

  • CyberGym (phát hiện lỗ hổng tự động): Vượt cả 3.5 Flash Cyber lẫn các model frontier lớn hơn.

Gemini 3.8 Flash Cyber

  • Benchmark nội bộ 20 ngôn ngữ lập trình: tỷ lệ thành công phát hiện lỗ hổng vượt 70%, tăng vọt so với thế hệ trước.

  • CWE-Bench (vá lỗi tự động): 47,2% pass@1, ngang với model frontier dẫn đầu (47,8%) nhưng chi phí thấp hơn đáng kể.

CWE-Bench

  • Tác động thực tế tại Google: Chrome Security ghi nhận 2,6 lần số bản vá đúng so với model thương mại lớn hơn; Wiz ghi nhận recall cao hơn 7,5-9,7% với chi phí thấp hơn 2,3-5,2 lần; đội Cloud Vulnerability Research tìm ra lỗ hổng nghiêm trọng trong chưa đầy 2 giờ (thường mất nhiều tháng).

Cả hai model đều có cải thiện đáng kể về khả năng chống prompt injection (theo benchmark Gray Swan) và tuân thủ Frontier Safety Framework về các lĩnh vực nhạy cảm (CBRN, tấn công mạng). 3.8 Flash Cyber có bộ mitigation cởi mở hơn cho an ninh mạng, do đó chỉ dành cho người dùng tin cậy.