Hy3 của Tencent — model 295B chạy với chi phí của model 21B
Hy3 là model mã nguồn mở lớn nhất mà tôi thấy đáng để cắm vào quy trình làm việc hằng ngày. Ghi chép về kiến trúc, điểm số thật, và ranh giới giữa việc nên và không nên giao cho nó.
Tencent phát hành Hy3 ngày 6/7/2026 dưới giấy phép Apache 2.0, sau bản preview hồi cuối tháng 4. Con số gây chú ý là 295 tỷ tham số — nhưng con số đáng quan tâm hơn nằm ở chỗ khác: mỗi token chỉ đi qua 21 tỷ trong số đó.
Bài này ghi lại chỗ tôi thấy Hy3 hữu ích trong công việc làm web, và quan trọng hơn, chỗ tôi không giao việc cho Hy3.
295B tham số nhưng mỗi lần chỉ chạy 21B
Hy3 là kiến trúc Mixture-of-Experts. Model có 192 expert, mỗi token được bộ định tuyến đẩy qua 8 expert phù hợp nhất thay vì toàn bộ mạng. Phần còn lại nằm im.
Vài thông số cụ thể: 80 layer cộng một layer MTP 3,8 tỷ tham số, 64 attention head theo cơ chế GQA với 8 KV head, hidden size 4096, từ vựng 120.832 token, cửa sổ ngữ cảnh 256K.
Điểm số của Hy3 nói lên điều gì?
Ở nhóm suy luận, Hy3 đạt 90,4 điểm GPQA Diamond, 72,0 ở USAMO 2026 và 90,0 ở IMOAnswerBench. Ở nhóm lập trình: 78,0 trên SWE-Bench Verified, 75,8 trên SWE-Bench Multilingual, 71,7 trên Terminal-Bench 2.1.
Nhưng đặt cạnh GLM-5.2 thì bức tranh khác hẳn:
Hy3 thua cả bốn. Khoảng cách ở DeepSWE là rất lớn. Đổi lại, GLM-5.2 có khoảng 744 tỷ tham số tổng và ~40 tỷ tham số kích hoạt — gần gấp đôi Hy3 ở phần thực sự tốn tiền.
Nên cách đọc đúng không phải "Hy3 mạnh nhất" mà là "Hy3 cho mức hiệu năng trên chi phí tốt". Trong một bài đánh giá mù có 270 chuyên gia tham gia với 312 lượt so sánh hợp lệ, Hy3 được 2,67/4 so với 2,51/4 của GLM-5.1 — hơn, nhưng không phải cách biệt.
Bản chính thức của Hy3 khác bản preview ở đâu?
Phần lớn công sức giữa hai bản đổ vào độ ổn định chứ không phải điểm số benchmark, và đây mới là thứ ảnh hưởng tới việc dùng thật:
Tỷ lệ bịa đặt giảm từ 12,5% xuống 5,4% là con số tôi để ý nhất. Hy3 vẫn là 5,4% — nghĩa là cứ khoảng hai mươi câu trả lời thì có một câu sai mà nghe rất thuyết phục.
Việc tôi sẽ giao cho Hy3
Nguyên tắc chung: giao những việc mà tôi kiểm chứng được kết quả trong vài giây.
- Dịch và tóm tắt tài liệu kỹ thuật dài — sai thì đọc bản gốc là ra ngay
- Viết bản nháp đầu tiên cho mô tả sản phẩm, email, nội dung trang dịch vụ
- Giải thích một đoạn code lạ, một thư viện chưa dùng bao giờ
- Sinh dữ liệu mẫu, viết script vặt, chuyển đổi định dạng
- Rà soát một đoạn code tìm lỗi rõ ràng, trước khi tự đọc kỹ
Cửa sổ 256K token hợp với việc đọc cả một file log dài hoặc toàn bộ tài liệu API của bên thứ ba trong một lượt. Hồi làm tích hợp API đồng bộ KiotViet, phần tốn thời gian nhất là đọc tài liệu để hiểu đúng ngữ nghĩa từng trường — đây đúng là loại việc nên đưa cho model rẻ và nhanh.
Việc tôi không giao
Kiến trúc hệ thống, quyết định công nghệ, và bất cứ thứ gì đi thẳng ra production mà không có người đọc lại.
Lý do không nằm ở chỗ Hy3 kém. Nó nằm ở chỗ 5,4% tỷ lệ bịa đặt là con số đủ thấp để bạn mất cảnh giác, và đủ cao để một trong hai mươi lần bạn dính. Với những quyết định mà cái sai chỉ lộ ra sau vài tuần, tỷ lệ đó không chấp nhận được.
Điểm DeepSWE 28,0 cũng nói một điều cụ thể: các tác vụ lập trình dài hơi, nhiều bước, tự sửa lỗi không phải chỗ mạnh của Hy3.
Hy3 miễn phí tới bao giờ?
Đây là phần cần nói thẳng, vì đang có nhiều bài viết trên mạng xã hội hứa hẹn hạn mức khổng lồ.
Hy3 có mặt trên OpenRouter ở cả bản trả phí lẫn bản :free. Bản miễn phí đúng là 0 đồng mỗi token, nhưng giới hạn theo số lượt gọi, không theo token: 20 lượt/phút, 50 lượt/ngày với tài khoản chưa từng nạp tiền, và 1.000 lượt/ngày khi đã nạp từ 10 USD. Không có "200 triệu token mỗi ngày" nào ở đây — con số đó đến từ việc nhân hạn mức lượt gọi với độ dài ngữ cảnh tối đa, một phép tính không phản ánh cách dùng thật.
Quan trọng hơn: bản miễn phí trên OpenRouter được công bố kết thúc ngày 21/7/2026. Sau mốc đó giá niêm yết là 0,132 USD cho mỗi triệu token đầu vào và 0,528 USD cho mỗi triệu token đầu ra.
Gọi thử Hy3 trong năm phút
Điểm cuối của OpenRouter tương thích OpenAI, nên phần lớn SDK chỉ cần đổi baseURL:
const res = await fetch('https://openrouter.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
Authorization: `Bearer ${process.env.OPENROUTER_API_KEY}`,
'Content-Type': 'application/json',
},
body: JSON.stringify({
model: 'tencent/hy3',
reasoning_effort: 'low', // no_think | low | high
messages: [{ role: 'user', content: 'Tóm tắt tài liệu sau trong 5 gạch đầu dòng: ...' }],
}),
})
Tham số reasoning_effort là thứ đáng nghịch nhất. Đặt no_think cho việc dịch, tóm tắt, đổi định dạng — nhanh hơn hẳn và chất lượng không đổi. Chỉ bật high khi câu hỏi thật sự cần suy luận nhiều bước.
Tự host Hy3 thì cần gì
Trọng số mở hoàn toàn theo Apache 2.0, tải về từ Hugging Face. Cấu hình tham chiếu là 8 GPU loại H20-3e hoặc card có bộ nhớ lớn hơn, chạy ở độ chính xác BF16; có sẵn bản FP8 nếu thiếu VRAM.
vllm serve tencent/Hy3 \
--tensor-parallel-size 8 \
--speculative-config.method mtp \
--speculative-config.num_speculative_tokens 2 \
--tool-call-parser hy_v3 \
--reasoning-parser hy_v3 \
--enable-auto-tool-choice
Layer MTP chính là chỗ dùng cho speculative decoding — nó đoán trước nhiều token mỗi bước, đổi lại tốc độ sinh cao hơn đáng kể. SGLang cũng hỗ trợ tương tự.
Nói thẳng: với một xưởng làm website, tự host không có ý nghĩa kinh tế. Tám GPU loại đó đắt hơn nhiều năm tiền API. Giá trị của giấy phép Apache 2.0 ở đây là bạn có thể rời đi nếu nhà cung cấp đổi giá hay đóng cửa, chứ không phải bạn nên tự dựng ngay.
Kết luận về Hy3
Hy3 không phải model mạnh nhất hiện có, và Tencent cũng không quảng cáo như vậy. Hy3 là model mở tốt nhất trong nhóm chi phí thấp ở thời điểm này: kiến thức rộng, ngữ cảnh dài, tiếng Anh chắc, tiếng Việt dùng được, giấy phép sạch.
Cách dùng hợp lý là để Hy3 gánh phần việc nhiều mà nhẹ — dịch, tóm tắt, nháp, giải thích, script vặt — rồi dành model đắt tiền cho phần thật sự khó. Chia việc như vậy tiết kiệm được phần lớn chi phí mà không đánh đổi thứ gì quan trọng.
Bài viết liên quan
tất cả bài viết →- Tối ưu PageSpeed cho WordPress — cái gì thật sự đổi trong 2026Google có thay đổi trong 2026, nhưng không phải chỗ mà phần lớn bài viết đang nói. Ghi chép về những gì thực sự khác, và thứ tự việc cần làm để website WordPress chạy nhanh.đọc tiếp →
- Một route, mười layout — kiến trúc site Next.js chạy hoàn toàn bằng MarkdownToàn bộ site này render từ đúng một file route. Ghi chép về pipeline phía sau — frontmatter chia section, computed fields, registry layout và collection.đọc tiếp →
- Nâng cấp Next.js 15 lên 16 — Turbopack, static export và ba chỗ vấpGhi chép thật từ đợt nâng cấp site này lên Next.js 16 — vì sao vẫn giữ static export cho Nginx, Turbopack khắt khe hơn webpack ở đâu, và ba lỗi ngốn nhiều giờ nhất.đọc tiếp →
- Tự dựng dashboard giám sát uptime cho 30 website khách hàngKhách gọi báo web sập trước khi tôi biết — đó là lý do có cái dashboard này. Ghi chép về cách theo dõi uptime, tốc độ phản hồi và hạn SSL mà không tạo ra một núi cảnh báo rác.đọc tiếp →