Tại hội nghị Hot Chips, OpenAI lần đầu công bố kết quả benchmark cho Jalapeño, con chip AI được phát triển cùng Broadcom. Trên benchmark InferenceX của SemiAnalysis, Jalapeño ghi nhận số lượng token trên mỗi người dùng (token/user) và thông lượng trên mỗi kilowatt (throughput/kW) cao hơn so với hệ thống tính toán tiên tiến nhất hiện có là Blackwell của NVIDIA.

Chip Jalapeño của OpenAI

“Kết quả cho thấy một bước tiến hiệu năng rất, rất đáng kể so với công nghệ tiên tiến nhất hiện tại”, Richard Ho, người đứng đầu mảng phần cứng của OpenAI, nói trong buổi trao đổi với báo chí. “Jalapeño phục vụ được nhiều việc AI hơn trên mỗi đơn vị điện năng, đồng thời vẫn trả phản hồi nhanh hơn.”

Con số cụ thể công bố trên ba mô hình công khai:

  • Trên mô hình open-weight 120B (GPT-OSS), Jalapeño đạt khoảng 85.448 token/giây trên mỗi kilowatt ở đỉnh thông lượng hỗn hợp, so với 44.960 của Nvidia GB200, tức gấp khoảng 1,9 lần; ở cùng mức thông lượng, độ trễ giảm khoảng 4,2 lần.
  • Trên DeepSeek R1 670B (so với GB300), hiệu suất trên mỗi watt cao hơn khoảng 1,7 lần, độ trễ giảm khoảng 3,6 lần.
  • Trên Kimi K2.5 1T của Moonshot, mô hình lớn nhất trong bộ thử, lợi thế khoảng 1,5 lần về hiệu suất trên mỗi watt.

Benchmark của các frontier model  chạy trên Jalapeño

Chip có định mức công suất 700W, nhưng đo thực tế trên các tác vụ thử chỉ khoảng 550W. Điểm đáng chú ý là các kết quả này đạt được mà không cần dự đoán đa token hay tách riêng prefill-decode, hai kỹ thuật mà nhà cung cấp thường dùng để đạt được con số trên giấy đẹp hơn.

Tuy nhiên cần làm rõ ràng, việc so sánh này đối chiếu với hệ thống Nvidia Blackwell hiện tại. Đến khi Jalapeño triển khai đầy đủ, các nhà cung cấp chip khác có thể đã tung ra thêm nhiều thế hệ chip mới mạnh mẽ hơn. Ông Ho ước tính Jalapeño sẽ triển khai số lượng rất nhỏ vào cuối 2026 và mở rộng đáng kể vào 2027.

Jalapeño được công bố lần đầu tháng 10/2025, phát triển với sự hỗ trợ từ chính các model của OpenAI trong quá trình thiết kế. OpenAI dự định biến nó thành nền tảng đa thế hệ, để sản phẩm AI, model, chip và bộ nhớ được phát triển đồng bộ. Về phần cứng, chip dùng bộ nhớ HBM4 với băng thông khoảng 15,4 TB/giây mỗi gói và phiên bản B0 đang trong dây chuyền sản xuất được kỳ vọng cải thiện thêm khoảng 25% hiệu suất trên mỗi watt so với phiên bản A0 đang được thử nghiệm.

Nhờ cách tiếp cận toàn ngăn xếp, OpenAI nhắm vào các điểm nghẽn cụ thể trong quá trình inference, đặc biệt là độ trễ ở giai đoạn prefill (nạp trước) và giao tiếp giữa các khối tính toán. Công ty cho biết Jalapeño được thiết kế để “giảm thiểu di chuyển dữ liệu và độ trễ giao tiếp”, giữ KV cache ở vị trí cục bộ trong lúc hệ thống kích hoạt tổ hợp compute, bộ nhớ và mạng phù hợp cho từng giai đoạn inference.

Về ý nghĩa, đây là tín hiệu rõ ràng rằng OpenAI muốn giảm phụ thuộc vào Nvidia. Các con số này đáng tin hơn một bài tự công bố thông thường, vì kỹ sư SemiAnalysis đã đến tận lab của OpenAI để xác minh. Dù vậy vẫn còn giới hạn: benchmark InferenceX chỉ đo ngữ cảnh 8k đầu vào và 1k đầu ra, mỗi lượt phục vụ đơn lẻ, chưa phản ánh các workload agent nhiều bước vốn là chỗ chip chịu tải thật.