DeepSeek-V4-Flash là gì? Tính năng, giá và cách dùng
DeepSeek-V4-Flash là model MoE 284 tỷ tham số, ngữ cảnh 1 triệu token, giá rẻ, mạnh về agent và coding. Xem thông số, benchmark và cách dùng.
Cuối tháng 7/2026, DeepSeek chính thức phát hành bản GA của DeepSeek-V4-Flash (build 0731) sau vài tháng chạy thử nghiệm. Đây là phiên bản “nhẹ” trong dòng V4, được huấn luyện lại để mạnh hơn hẳn ở các tác vụ agent nhiều bước và lập trình, trong khi chi phí chạy vẫn rẻ hơn rất nhiều so với các model cỡ lớn. Nếu bạn đang tìm một model mã nguồn mở vừa rẻ vừa “chịu làm việc” thay vì chỉ trả lời câu hỏi đơn giản, DeepSeek-V4-Flash đáng để xem qua.
DeepSeek-V4-Flash là gì?
DeepSeek-V4-Flash là phiên bản tối ưu tốc độ và chi phí trong họ DeepSeek V4, đứng cạnh bản đầy đủ V4-Pro (1,6 nghìn tỷ tham số). Model dùng kiến trúc Mixture-of-Experts (MoE): tổng cộng có 284 tỷ tham số, nhưng với mỗi token chỉ khoảng 13 tỷ tham số thực sự được kích hoạt (router chọn 6 trong số 256 chuyên gia, cộng thêm 1 chuyên gia dùng chung). Nhờ vậy model này suy luận nhanh và rẻ như một model nhỏ, nhưng chất lượng đầu ra vẫn tiệm cận model lớn hơn nhiều.
Bản 0731 không phải là lần đầu DeepSeek-V4-Flash xuất hiện — bản preview đã có từ tháng 4/2026 — nhưng đây là lần đầu model được huấn luyện lại (post-training) kỹ hơn để đạt trạng thái chính thức, thay vì chỉ dừng ở bản thử nghiệm.
Những điểm mới đáng chú ý
Ngữ cảnh dài tới 1 triệu token
DeepSeek-V4-Flash hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token, đủ để nhồi cả một repo code cỡ vừa hoặc vài trăm trang tài liệu vào một lần hỏi. Model dùng cơ chế attention lai (kết hợp Compressed Sparse Attention và Heavily Compressed Attention) để giữ ngữ cảnh dài mà không làm chi phí suy luận tăng vọt như các kiến trúc attention truyền thống.
Điểm agent và coding tăng rõ rệt
So với bản DeepSeek-V4-Flash trước, điểm Elo trên GDPval-AA v2 (bài test các tác vụ công việc thực tế) tăng từ 1189 lên 1559. Trên bộ Terminal Bench 2.1, model đạt 82,7 điểm; trên Toolathlon (đánh giá khả năng dùng công cụ) đạt 70,3 điểm. Theo Artificial Analysis, chỉ số Intelligence Index của bản 0731 đạt 50 điểm, cao hơn 10 điểm so với bản trước đó. Những con số này cho thấy model không còn chỉ “trả lời đúng”, mà đã làm tốt hơn ở việc gọi công cụ, chạy lệnh terminal và xử lý tác vụ nhiều bước — đúng thế mạnh mà các AI agent hiện nay cần.
Giá rẻ và cache siêu tiết kiệm
Trên các nền tảng như OpenRouter, DeepSeek-V4-Flash được niêm yết ở mức khoảng 0,068 USD cho một triệu token đầu vào và 0,168 USD cho một triệu token đầu ra — rẻ hơn nhiều lần so với các model đóng có năng lực tương đương. Với các request lặp lại phần ngữ cảnh (cache), chi phí có thể giảm tới khoảng 98% nhờ cơ chế cache read giá rất thấp, phù hợp cho agent phải đọc đi đọc lại cùng một tài liệu hay repo trong một phiên làm việc dài.
Bảng tóm tắt thông số DeepSeek-V4-Flash
| Thông số | Giá trị |
|---|---|
| Kiến trúc | Mixture-of-Experts (MoE) |
| Tổng tham số | 284 tỷ |
| Tham số kích hoạt/token | ~13 tỷ (6/256 chuyên gia + 1 chuyên gia dùng chung) |
| Ngữ cảnh tối đa | 1 triệu token |
| Giá API (tham khảo) | ~0,068 USD/1M token vào • ~0,168 USD/1M token ra |
| Thế mạnh | AI agent, coding, tác vụ nhiều bước |
Cách dùng thử DeepSeek-V4-Flash
- Gọi trực tiếp qua DeepSeek API (tương thích định dạng phổ biến, dễ thay thế các model khác trong code có sẵn).
- Dùng qua các nền tảng trung gian như OpenRouter nếu muốn so giá và tốc độ với nhiều model khác cùng lúc.
- Với ai muốn chạy cục bộ để thử nghiệm hoặc giữ dữ liệu riêng tư, có thể tham khảo cách thiết lập trong bài so sánh Ollama và LM Studio hoặc cách dùng LM Studio chạy AI cục bộ trên Windows — lưu ý bản đầy đủ 284B tham số đòi hỏi cấu hình máy rất mạnh, phù hợp hơn với server GPU thay vì máy cá nhân thông thường.
DeepSeek-V4-Flash so với các model khác có gì khác?
Cùng thời điểm này, thị trường model mở và giá rẻ đang khá sôi động. Nếu đã đọc qua bài so sánh Qwen3.8 bản 27B và 2.4T-A95B, bạn sẽ thấy điểm chung: các hãng Trung Quốc đang đẩy mạnh model MoE để vừa tăng chất lượng vừa giữ chi phí suy luận thấp. Còn nếu so với các model đóng như Gemini 3.7 Flash của Google, model này có lợi thế rõ nhất ở giá và việc cho phép tải trọng số về chạy riêng, đổi lại việc triển khai phức tạp hơn vì kích thước 284B đòi hỏi hạ tầng GPU đáng kể.
Câu hỏi thường gặp
DeepSeek-V4-Flash có miễn phí không?
Trọng số model được công bố mở nên có thể tự tải về chạy, nhưng cần hạ tầng GPU đủ mạnh do tổng kích thước 284 tỷ tham số. Nếu dùng qua API (DeepSeek hoặc bên trung gian như OpenRouter), chi phí tính theo token và ở mức khá rẻ như đã nêu ở trên.
DeepSeek-V4-Flash khác gì DeepSeek-V4-Pro?
V4-Pro là bản đầy đủ với 1,6 nghìn tỷ tham số, hướng tới chất lượng cao nhất. V4-Flash nhỏ hơn (284 tỷ tham số, 13 tỷ kích hoạt), đánh đổi một phần chất lượng đỉnh cao để lấy tốc độ và chi phí thấp hơn nhiều, phù hợp chạy ở quy mô lớn hoặc cho các tác vụ agent lặp đi lặp lại.
Có thể chạy DeepSeek-V4-Flash trên máy cá nhân không?
Rất khó với cấu hình phổ thông. Với 284 tỷ tham số (dù chỉ kích hoạt một phần mỗi lần), model vẫn cần toàn bộ trọng số nằm trong VRAM vì router có thể chọn bất kỳ chuyên gia nào cho từng token — nên đây là bài toán dành cho server GPU nhiều bộ nhớ hơn là máy tính cá nhân.
Kết luận
DeepSeek-V4-Flash cho thấy hướng đi rõ ràng của DeepSeek: dùng kiến trúc MoE để vừa tăng năng lực agent và coding, vừa giữ chi phí suy luận ở mức thấp nhất có thể. Với ngữ cảnh 1 triệu token, giá rẻ và điểm benchmark agent tăng mạnh so với bản trước, đây là một trong những lựa chọn đáng cân nhắc nếu bạn cần một model mở, giá tốt để chạy các tác vụ agent hoặc coding ở quy mô lớn. Thông tin và benchmark trong bài được tổng hợp từ MarkTechPost và Artificial Analysis.