Ngày 20/08, một mô hình có tên Ox Alpha xuất hiện trên OpenRouter dưới dạng stealth model, mô hình do một bên thứ ba ẩn danh phát triển và vận hành, không công bố danh tính. OpenRouter chỉ làm nhiệm vụ định tuyến request và khẳng định không phải đơn vị phát triển hay sở hữu mô hình.
Đây không phải lần đầu OpenRouter đón một model kiểu này. Các stealth model thường là model mới của một lab lớn được đưa lên dưới tên mã, trước đây đã có Owl Alpha, Quasar Alpha, để chạy thử trong môi trường thật trước khi công bố chính thức. Mục đích là đo hiệu năng, thu thập phản hồi cộng đồng và, trong hầu hết trường hợp, ghi lại dữ liệu prompt lẫn response để tinh chỉnh model. Vì vậy đây là sân chơi phù hợp cho side project hơn là workload production nghiêm túc.
Về định vị, Ox Alpha là mô hình reasoning hướng tới coding, tác vụ agent kéo dài và khối lượng công việc production; phù hợp với kỹ thuật phần mềm dài hạn và workflow kết hợp text với ngữ cảnh hình ảnh. Mô hình nhận cả text, hình ảnh lẫn video và trả về text, với cửa sổ context lên tới 1.048.576 token (khoảng 1 triệu) và đầu ra tối đa 131.072 token. Về tích hợp, nó hỗ trợ tool calling và xuất JSON có cấu trúc qua response_format, dù chưa có cơ chế ép schema.
Điểm gây chú ý nhất là giá: hiện tại Ox Alpha được cung cấp miễn phí, ở cả chiều input lẫn output. OpenCode cho biết model đã có trên OpenCode Go với mức dùng gần như không giới hạn trong 6 ngày tới, không tính vào hạn mức Go, và công bố năng lực phục vụ tới 100.000 tỷ token mỗi ngày — nếu tính trung bình là khoảng 1,16 tỷ token/giây. Quy mô compute này đặt ra câu hỏi hiển nhiên: một đơn vị ẩn danh lấy đâu ra lượng tài nguyên lớn đến vậy.
Về hiệu năng, chưa có benchmark độc lập đầy đủ, nhưng kết quả thử nghiệm cộng đồng ban đầu đang tạo tranh cãi. Theo chia sẻ của một số tester, Ox Alpha đạt hơn 80% trên 10 task DeepSWE — trong đó một phép so sánh của cộng đồng cho rằng Claude Fable chỉ ghi khoảng 65% và GPT-5.6 Sol khoảng 52% — cùng khoảng 87,5% trên 80 task Kingbench. Mô hình được đánh giá tốt ở agentic coding, kỹ thuật phần mềm dài hạn và tác vụ đa phương thức. Cần lưu ý đây là số liệu do cộng đồng tự chạy, chưa phải benchmark được kiểm chứng độc lập.
Riêng về dữ liệu có một điểm cần đọc kỹ. OpenCode quảng cáo Zero Data Retention, nhưng điều khoản Stealth Model của OpenRouter lại ghi rõ prompt và completion được bên cung cấp lưu giữ, chỉ không dùng để huấn luyện. Trong khi đó, mô tả chung về stealth model cho thấy mục đích phổ biến là thu thập prompt lẫn response để tinh chỉnh trước khi ra mắt. Ba thông tin này chưa hoàn toàn khớp nhau, vì thế người dùng doanh nghiệp cần kiểm tra kỹ trước khi tin vào cam kết “không lưu dữ liệu”.
Con số trên giấy tương đối tốt: OpenRouter ghi nhận tốc độ 25 token/giây, độ trễ 3,85 giây, uptime 99,40% trong 3 ngày. Tuy nhiên phản hồi từ người dùng cho thấy máy đang quá tải: một số phàn nàn lag, rớt kết nối giữa chừng, tốc độ thực tế chỉ quanh 20 token/giây, thậm chí có người gặp tình trạng mô hình dừng giữa task không hoàn thành.
Về mức độ tiếp nhận sớm, danh sách ứng dụng gửi nhiều traffic nhất tới Ox Alpha trên OpenRouter có Hermes Agent (Nous Research) dẫn đầu với khoảng 276 tỷ token, theo sau là omp, Claude Code và DeepSeek Harness — đều là nhóm công cụ coding/agent đang tranh thủ quãng miễn phí để chạy khối lượng lớn.
Điều cộng đồng quan tâm nhất vẫn là danh tính thật. OpenCode chưa công bố lab nào đứng sau, nhưng một số researcher đã thử đối chiếu kỹ thuật và cái tên được nhắc đến nhiều nhất là Zhipu AI / Z.ai, lab đứng sau dòng GLM. Các điểm trùng khớp được chỉ ra gồm tokenizer khớp với GLM-5.3 trên nhiều chuỗi test, tham số API và cài đặt mặc định giống GLM-5.3, fingerprint của video encoder trùng với GLM-5V-Turbo, và kiểu hỗ trợ video nhưng không hỗ trợ audio cũng tương tự GLM-5V. Một số người ước tính xác suất Ox Alpha là model nội bộ mới của Z.ai lên tới khoảng 90%. Bên cạnh đó còn có các phỏng đoán khác như Kimi (Moonshot), MiMo (Xiaomi) hay SSI của Ilya Sutskever. Tất cả đều mới chỉ là suy đoán — chưa có xác nhận chính thức từ bất kỳ lab nào.
Nhìn chung, đây vừa là một ván bài free preview điển hình — tung model miễn phí một tuần, giữ ẩn danh, để đo tải và thu hút cộng đồng agent chạy thử — vừa là câu hỏi về nguồn lực: một lab giấu tên phục vụ hàng trăm nghìn tỷ token mỗi ngày nghĩa là phía sau có nền tảng compute rất lớn. Nếu các con số benchmark đầu tiên được xác nhận, đây sẽ là một trong những đợt preview đáng chú ý nhất gần đây; nhưng mọi chuyện vẫn nên chờ benchmark độc lập và thông tin chính thức. Model hiện có thể thử qua ID stealth/ox-alpha trên OpenRouter hoặc trực tiếp trong OpenCode.
