Z.AI (phòng lab AI Trung Quốc, còn gọi là Zhipu) vào ngày 26/8 đã chính thức lên tiếng xác nhận danh tính của GLM 5.3 Flash, model AI đã được test ẩn danh trong gần một tuần dưới cái tên Ox Alpha và âm thầm leo lên đỉnh bảng usage trên OpenRouter, vượt qua cả DeepSeek về lượng người dùng thực tế.

Trước khi ra mắt chính thức, Z.AI đã triển khai GLM 5.3 Flash miễn phí lên OpenCodeOpenRouter dưới alias “ox-alpha” mà không công bố danh tính. Trong vòng chưa đầy một tuần, model này trở thành lựa chọn phổ biến nhất trên OpenRouter, mức usage cao gấp đôi DeepSeek. CEO Stripe Patrick Collison nhận xét “very impressive” trên mạng xã hội sau khi dùng thử model này.

Trước đó, cộng đồng người dùng cũng đã phân tích output và tokenization của Ox Alpha, cho rằng đặc điểm của model này khá giống với kiến trúc GLM-5 và đoán đây là checkpoint từ dòng GLM-5.3.Chỉ vài ngày sau đó, vào ngày 26/8, Zhipu cũng đã xác nhận với Bloomberg rằng Ox Alpha chính là GLM 5.3 Flash preview, đồng thời thông báo sẽ mở weight sau khi ra mắt chính thức.

GLM 5.3 Flash là model đầu tiên trong dòng GLM-5 hỗ trợ multimodal native (text, ảnh, video) với context 1,3 triệu token, phục vụ tốt cho các workload xử lý tài liệu dài hoặc multi-turn conversation có context lặp lại lớn. Điểm đáng chú ý về kiến trúc bao gồm:

  • 320B tổng tham số, chỉ 18B tham số active, thấp hơn gần một nửa so với GLM-4.5/5.x (32B active), giúp tốc độ suy luận nhanh hơn đáng kể.

  • Kiến trúc hybrid attention kết hợp linear attention (xử lý phụ thuộc cục bộ) với sparse attention (truy xuất ngữ cảnh toàn cục) — được tối ưu bởi cơ chế IndexPool, giảm 3× attention compute và 4.4× KV cache size so với GLM-5.3 thông thường.

  • Được pre-train trên 30 nghìn tỷ token đa phương thức.

Về benchmark, GLM 5.3 Flash ghi nhận 63.4 điểm trên DeepSWE v1.1 (so với 46.2 của GLM-5.2) và 48.8 điểm trên AutomationBench v1.0.6 (so với 26.2). Trên Z.ai Code Bench v1.0, model đạt 29.0 điểm, gần ngang bằng Claude Opus 4.8 ở mức 29.5.

GLM 5.3 Flash benchmark

Về giá API, GLM 5.3 Flash có giá trên 1 triệu context token như sau:

  • Input: 0.15 USD/M token
  • Output: 0.50 USD/M token
  • Cached input: 0.03/M token

Theo giá gốc, GLM 5.3 Flash rẻ hơn khoảng 9 lần so với GLM-5.2 tính theo output token.Ngoài ra, Z.AI cũng công bố mức giá chiết khấu rẻ hơn 50% cho model này đến hết ngày 09/09/2026.

Giá GLM 5.3 Flash

Một điểm đáng chú ý nữa đó là việc Z.AI chạy bộ series GLM 5.3 trên cụm chip AI nội địa Trung Quốc quy mô lớn mà không sử dụng GPU từ NVIDIA. Công ty cho biết đã đạt cải thiện gấp 3 lần hiệu năng đầu cuối so với baseline ban đầu thông qua các kỹ thuật như EPD disaggregated architecture, W8A8 quantization và hybrid cache. Đây là một trong số ít minh chứng công khai về việc chip AI nội địa có thể vận hành frontier model ở quy mô thực tế.

Tóm lại, GLM 5.3 Flash nổi bật với cách tiếp cận ra mắt phi truyền thống bằng việc test ẩn danh trên nền tảng thực tế trước khi công bố và kết quả thu được trên OpenRouter cho thấy mức độ quan tâm thực chất từ người dùng. Z.AI cho biết đang scale recipe kiến trúc này cho các model lớn hơn trong thời gian tới.