Sau khi Z.AI công bố GLM-5.3-Flash vào giữa tuần, làn sóng model mới từ các phòng lab Trung Quốc tiếp tục với Tencent và Alibaba chỉ trong vòng vài ngày. Cả hai đều theo một hướng giống nhau: open-source, nhấn mạnh chi phí rẻ và hiệu năng trên tác vụ thực tế, thay vì đua theo bảng xếp hạng benchmark đơn thuần.
Tencent mở nguồn Hy4 preview: 770B tham số, context 1 triệu token
Ngày 28/8, Tencent phát hành và open-source Hy4 preview, model thế hệ tiếp theo của dòng Hunyuan với 770 tỷ tham số tổng, 49 tỷ active mỗi lần suy luận, 1 triệu context token. Con số này gấp hơn ba lần Hy3 tiền nhiệm (295B tổng, 21B active, 256K context).
Tencent không đặt trọng tâm vào thứ hạng. Thay vào đó, hãng nhấn mạnh hiệu năng trên tác vụ productivity thực tế: lập trình long-context, công việc văn phòng, phân tích tài chính, phát triển game (tạo prototype chơi được từ yêu cầu ngôn ngữ tự nhiên) và nghiên cứu khoa học. Trong đánh giá nội bộ với 163 chuyên gia và 203 tác vụ kỹ thuật, Hy4 preview đạt 2,99/4,00, nhỉnh hơn GLM-5.3 (2,92) và Kimi K3 (2,94).
Điểm đáng chú ý nhất là Hy4 preview lần đầu tham gia tối ưu hóa quá trình phát triển của chính nó, tự đề xuất phương pháp huấn luyện, chạy thí nghiệm, và tự phân tích nút thắt hệ thống suy luận rồi tối ưu, giúp tăng 31,8% throughput end-to-end. API định giá 0,834 USD/triệu token input, 2,501 USD/triệu token output. Model có trên WorkBuddy, CodeBuddy, Yuanbao và OpenRouter.
Alibaba ra mắt Qwen3.8-Flash-Next: 125B tổng, chỉ 6B active
Trước đó 2 ngày Alibaba Qwen công bố Qwen3.8-Flash-Next, model đa phương thức Mixture-of-Experts với 125 tỷ tham số tổng nhưng chỉ 6 tỷ active mỗi token, nhỏ hơn gần ba lần so với Qwen3.7-Plus (17B), trong khi chi phí huấn luyện chỉ bằng 1/9. Model được định vị là bản xem trước kiến trúc của Qwen4, tương tự vai trò Qwen3-Next từng đóng cho Qwen3.5.
Kiến trúc có bốn đổi mới chính: hybrid attention (Gated DeltaNet cho 3/4 số layer, Qwen Sparse Attention cho layer còn lại), Gated Residual, N-gram Embedding (bảng 51 tỷ tham số lưu cụm từ phổ biến, chạy trên RAM hệ thống thay vì GPU) và optimizer Muon. Context gốc 262.144 token, mở rộng tới 1 triệu bằng YaRN.
Về hiệu năng, Qwen cho biết Flash-Next vượt Qwen3.7-Plus ở hầu hết tác vụ dù rẻ hơn nhiều, dẫn đầu nhiều benchmark agentic coding: 58,7 DeepSWE, 62,5 SWE-bench Pro, 73,9 CoWorkBench (so với 45,1 của DeepSeek-V4-Flash), JobBench 55,7 (gần gấp đôi Qwen3.7-Plus). Kém nhất là các bài suy luận khoa học cực khó (HLE 35,9 so với Claude Opus 4.6 là 40,0).
Giá là điểm tạo sức ép lớn: 0,16 USD/triệu token input, 0,47 USD/triệu output - thấp hơn khoảng 12 lần so với flagship Qwen3.8-Max của chính hãng. Phiên bản production là Qwen3.8-Flash, open-weight trên Hugging Face và ModelScope.
Điểm chung của ba hãng: đua chi phí, không đua thứ hạng
Ba phòng lab Trung Quốc (Z.AI, Tencent, Alibaba) trong cùng một tuần đều ra model mở với thông điệp tương tự: frontier intelligence không nhất thiết phải trả giá frontier. Đây là bước đi cho thấy các model Trung Quốc đang trong một cuộc đua theo hướng mới: thay vì chứng minh ai thông minh hơn, các hãng Trung Quốc cạnh tranh bằng cách chứng minh ai rẻ hơn và mở hơn. Áp lực giá lên Anthropic/OpenAI là thật và những đợt giảm giá gần đây của OpenAI cho dòng GPT-5.6 có thể là phản ứng đầu tiên.