
Qwen3.8 có gì mới? So sánh bản 27B và 2.4T-A95B
Qwen3.8 mới nhất có bản 27B và 2.4T-A95B. Tìm hiểu khả năng AI agent, multimodal, context 262K, yêu cầu phần cứng và giấy phép.
Qwen3.8 là thế hệ mô hình AI mới nhất của Qwen tại thời điểm tháng 8/2026. Alibaba công bố Qwen3.8-Max ngày 03/08, sau đó mở trọng số Qwen3.8-2.4T-A95B ngày 12/08 và Qwen3.8-27B ngày 14/08. Ba cái tên đứng cạnh nhau rất dễ khiến người mới tưởng chỉ khác dung lượng tải về. Thực tế, chúng hướng tới ba cách dùng khác nhau.
Qwen3.8-Max là dịch vụ flagship trên Qwen Cloud. Qwen3.8-2.4T-A95B là mô hình Mixture of Experts khổng lồ, có 2,4 nghìn tỷ tham số nhưng kích hoạt khoảng 95 tỷ tham số cho mỗi lượt xử lý. Qwen3.8-27B nhỏ hơn nhiều, có kiến trúc dense 27 tỷ tham số và hỗ trợ nguyên bản cả văn bản, hình ảnh lẫn video.
Nếu chỉ cần câu trả lời nhanh: phần lớn cá nhân và đội IT muốn thử nghiệm, triển khai riêng hoặc chạy bản lượng tử hóa nên chú ý Qwen3.8-27B. Bản 2.4T-A95B dành cho hạ tầng rất lớn. Còn người muốn dùng năng lực mạnh nhất mà không tự chăm cả “trang trại GPU” có thể gọi Qwen3.8-Max qua dịch vụ đám mây.
Qwen3.8 có gì mới?
Qwen mô tả Qwen3.8 là thế hệ mạnh nhất trong dòng mô hình mở của hãng tính đến thời điểm phát hành. Trọng tâm không chỉ là trả lời câu hỏi khó hơn mà còn là hoàn thành công việc nhiều bước: đọc yêu cầu, lập kế hoạch, sử dụng công cụ, nhận phản hồi từ môi trường rồi sửa hướng đi. Đây là kiểu năng lực cần cho AI agent, trợ lý lập trình và quy trình nghiên cứu dài.
Bốn thay đổi đáng chú ý gồm khả năng code và làm việc chuyên môn tốt hơn; lập kế hoạch tự chủ đáng tin cậy hơn; tương thích rộng hơn với các công cụ phát triển; và điều khiển độ sâu suy luận bằng reasoning_effort. Các mức được công bố gồm xhigh, medium và low, giúp cân bằng chất lượng với tốc độ, chi phí.
Tính năng preserve_thinking giữ ngữ cảnh suy luận từ lịch sử hội thoại. Hiểu đơn giản, model có thể tiếp tục một công việc dài mà không phải “làm quen lại từ đầu” ở mỗi lượt. Dù vậy, đây không phải chiếc nút bảo đảm luôn đúng. Agent càng được cấp nhiều công cụ và quyền truy cập thì càng cần giới hạn phạm vi, log hoạt động và bước xác nhận trước thao tác quan trọng.
So sánh Qwen3.8-27B và Qwen3.8-2.4T-A95B
| Tiêu chí | Qwen3.8-27B | Qwen3.8-2.4T-A95B |
|---|---|---|
| Kiến trúc | Dense, có vision encoder | Mixture of Experts |
| Tham số | 27 tỷ | 2,4 nghìn tỷ tổng; khoảng 95 tỷ kích hoạt |
| Dữ liệu đầu vào | Văn bản, hình ảnh, video | Văn bản |
| Context gốc | 262.144 token, mở rộng đến 1 triệu | 262.144 token, mở rộng khoảng 1,01 triệu |
| Giấy phép | Apache 2.0 | Qwen3.8-Max License, có điều kiện riêng |
| Phù hợp | Máy trạm, máy chủ riêng, nghiên cứu và ứng dụng multimodal | Cụm GPU lớn, phòng lab hoặc nhà cung cấp dịch vụ |
Tên A95B thường bị hiểu nhầm là model chỉ có 95B tham số. Thực ra toàn bộ hệ thống chứa 2,4T tham số. Kiến trúc MoE chọn một phần chuyên gia cho mỗi token, nên khoảng 95B tham số được kích hoạt trong một lượt. Cách làm này giảm lượng tính toán so với kích hoạt toàn bộ 2,4T, nhưng không làm biến mất khối lượng trọng số phải lưu và phân phối trên hệ thống.
Qwen3.8-27B: bản thực tế hơn để triển khai riêng
Qwen3.8-27B là mô hình vision-language nguyên bản. Nó có thể hiểu ảnh, tài liệu, sơ đồ khoa học và video dài, thay vì phải ghép một model thị giác rời với model ngôn ngữ. Đây là lợi thế khi xây hệ thống hỏi đáp tài liệu có hình, phân tích ảnh chụp màn hình, đọc biểu đồ hoặc hỗ trợ xử lý hồ sơ.
Model có 64 lớp và kiến trúc lai giữa Gated DeltaNet với attention đầy đủ. Người dùng không cần nhớ hết tên kiến trúc để sử dụng, nhưng có một ý quan trọng: Qwen đang cố gắng giữ context dài và tăng hiệu quả suy luận, thay vì chỉ phóng to mô hình theo cách truyền thống.
Context gốc 262.144 token rất rộng, nhưng context tối đa không phải mức nên bật mặc định. KV cache, ảnh, video và phần suy luận đều tiêu tốn bộ nhớ. Một cuộc chat ngắn mà đặt context 262K có thể giống việc thuê cả hội trường để họp ba người: vẫn làm được, chỉ hơi tốn.
Máy cá nhân có chạy được Qwen3.8-27B không?
Trọng số 27B ở BF16 cần khoảng 54 GB chỉ theo phép tính hai byte cho mỗi tham số, chưa tính vision encoder, KV cache và phần bộ nhớ phụ của runtime. Bản 4-bit có kích thước lý thuyết khoảng 13,5 GB, nhưng mức dùng thực tế sẽ cao hơn vì metadata, cache và các thành phần không lượng tử hóa hoàn toàn.
Do đó, bản lượng tử hóa 4-bit hoặc 5-bit mới là hướng phù hợp với máy cá nhân. Máy có khoảng 16 GB VRAM vẫn có thể chật khi tăng context hoặc xử lý ảnh; hệ thống có 24 GB VRAM hay bộ nhớ hợp nhất rộng sẽ dễ thở hơn. Nếu dùng CPU và RAM, model vẫn có thể chạy nhưng tốc độ phụ thuộc mạnh vào băng thông bộ nhớ, cấu hình offload và bản GGUF cụ thể.
Qwen liệt kê Transformers, llama.cpp, MLX và Unsloth cho nhu cầu local. Với người thích giao diện, có thể tìm bản GGUF phù hợp trong LM Studio. Người muốn API gọn hoặc ghép model vào script có thể theo dõi thư viện model rồi dùng Ollama khi bản tương thích được cung cấp. Bài so sánh Ollama và LM Studio sẽ giúp chọn công cụ theo cách làm việc.
Qwen3.8-2.4T-A95B mạnh đến đâu và dành cho ai?
Đây là lần đầu Qwen đưa một model thuộc lớp Qwen-Max ra dưới dạng trọng số mở. Model có 512 expert, trong đó mỗi token dùng 10 expert định tuyến cùng một expert dùng chung. Context gốc là 262.144 token và có thể kéo dài khoảng 1,01 triệu token theo hướng dẫn chính thức.
Nhưng “mở trọng số” không đồng nghĩa “tải về laptop cuối tuần chạy thử”. Chỉ tính 4-bit cho toàn bộ 2,4T tham số đã là khoảng 1,2 TB dữ liệu lý thuyết. Hệ thống thực còn cần bộ nhớ cho cache, routing và runtime. Bản này hợp với hạ tầng nhiều GPU, nơi trọng số được chia trên nhiều thiết bị và có kỹ thuật phục vụ chuyên dụng.
Giấy phép cũng cần đọc kỹ. Qwen3.8-2.4T-A95B dùng Qwen3.8-Max License, cho phép sử dụng, sửa đổi và thương mại hóa nhưng đặt điều kiện với sản phẩm quy mô rất lớn, dịch vụ Model as a Service và một số loại trợ lý công việc có doanh thu cao. Đây không phải tư vấn pháp lý; tổ chức định triển khai thương mại nên để bộ phận pháp chế đọc nguyên văn giấy phép trước khi đưa model vào sản phẩm.
Dùng Qwen3.8 qua API và máy chủ riêng
Qwen Cloud cung cấp API Qwen3.8 tương thích với các đặc tả phổ biến như OpenAI và Anthropic. Đây là đường ngắn nhất nếu muốn thử model mạnh mà không tải trọng số. Đổi lại, dữ liệu được gửi tới dịch vụ bên ngoài, có chi phí theo chính sách nhà cung cấp và phụ thuộc kết nối mạng.
Với triển khai riêng, tài liệu chính thức đưa ví dụ cho Transformers, SGLang, vLLM và TokenSpeed. Các server này có thể mở endpoint tương thích OpenAI tại http://localhost:8000/v1. Qwen3.8-27B được minh họa với context 262.144 token và bộ parser dành cho reasoning, tool calling.
transformers serve Qwen/Qwen3.8-27B \
--port 8000 \
--continuous-batching
Lệnh trên là ví dụ chính thức ở mức cơ bản, không phải bảo đảm máy nào cũng đủ bộ nhớ. Khi phục vụ thực tế, cần giới hạn người gọi API, đặt xác thực, log hợp lý và không mở cổng trực tiếp ra Internet. Model có tool calling càng mạnh thì quyền của công cụ phía sau càng phải nhỏ và rõ ràng.
Benchmark Qwen3.8 nên đọc thế nào?
Model card công bố nhiều kết quả tốt ở coding, nhiệm vụ agent và context dài. Tuy nhiên benchmark chỉ có ý nghĩa khi xem cả harness, context, nhiệt độ, số lần chạy và cách chấm. Chẳng hạn một số bài coding dùng Claude Code harness, giới hạn thời gian nhiều giờ và context 256K. So một con số rời khỏi điều kiện thử nghiệm dễ tạo kết luận quá mức.
Cách thực tế hơn là chọn bộ việc gần nhu cầu của mình: một repository thật, vài tài liệu tiếng Việt, ảnh chụp màn hình, tác vụ gọi công cụ và câu hỏi có đáp án kiểm chứng. Đo chất lượng đầu ra, thời gian phản hồi, token mỗi giây, RAM, VRAM và tỷ lệ phải sửa. Model đứng đầu bảng nhưng không vừa hạ tầng hoặc thường sai ở dữ liệu nội bộ vẫn chưa phải lựa chọn tốt.
Nên chọn phiên bản Qwen3.8 nào?
- Chọn Qwen3.8-27B nếu cần triển khai riêng, xử lý văn bản kèm ảnh/video hoặc muốn giấy phép Apache 2.0.
- Chọn bản lượng tử hóa của 27B nếu có máy trạm mạnh và chấp nhận đánh đổi một phần chất lượng để giảm bộ nhớ.
- Chọn Qwen3.8-2.4T-A95B nếu có cụm GPU lớn, đội vận hành chuyên môn và mục tiêu thật sự cần model lớp flagship.
- Chọn Qwen3.8-Max qua cloud nếu muốn dùng ngay mà không quản lý hạ tầng.
- Chưa nên nâng cấp nếu model hiện tại đã giải quyết ổn công việc. Model mới không tự động biến quy trình thiếu dữ liệu, thiếu kiểm thử thành quy trình tốt.
Kết luận
Qwen3.8 đáng chú ý vì lần đầu trọng số của model lớp Qwen-Max được phát hành, đồng thời có bản 27B thực tế hơn cho cộng đồng triển khai riêng. Thế hệ này tập trung mạnh vào coding, công việc dài, AI agent và khả năng điều khiển mức suy luận.
Với phần lớn người dùng, Qwen3.8-27B là cái tên nên theo dõi. Nó có multimodal nguyên bản, context dài và giấy phép Apache 2.0, nhưng vẫn cần phần cứng đáng kể khi chạy local. Qwen3.8-2.4T-A95B hấp dẫn về công nghệ, song dung lượng và yêu cầu vận hành khiến nó thuộc về cụm máy chủ hơn là góc làm việc tại nhà.

