
GLM-5.3-Flash và GLM-5.3: Có gì mới, mạnh đến đâu?
So sánh GLM-5.3-Flash và GLM-5.3 về khả năng lập trình, đa phương thức, ngữ cảnh 1 triệu token, giá API và cách lựa chọn phù hợp.
GLM-5.3-Flash và GLM-5.3 là hai mô hình AI mới của Z.ai nhưng đi theo hai hướng khá khác nhau. GLM-5.3 tập trung vào lập trình phức tạp, AI Agent và nhiệm vụ kéo dài nhiều bước. Bản Flash ưu tiên tốc độ, chi phí thấp và khả năng xử lý cả hình ảnh, video lẫn tệp tin.
Nếu chỉ nhìn tên, nhiều người sẽ nghĩ Flash là bản “ăn bớt cấu hình”. Lần này không hẳn vậy. GLM-5.3-Flash được huấn luyện từ một mô hình nền mới, có kiến trúc riêng và hỗ trợ đa phương thức. Trong nhiều công việc thường ngày, đây có thể là lựa chọn hợp lý hơn bản chủ lực.
Bài viết cập nhật theo tài liệu chính thức của Z.ai, model card trên Hugging Face và báo cáo kỹ thuật GLM-5 được kiểm tra ngày 30/8/2026. Các con số benchmark do Z.ai công bố sẽ được ghi rõ, tránh biến tài liệu quảng bá thành “chân lý đã được đóng dấu”.
GLM-5.3 là gì?
GLM-5.3 là mô hình ngôn ngữ chủ lực mới của Z.ai. Mô hình dùng cùng phần nền với GLM-5.2; các cải tiến chủ yếu đến từ giai đoạn hậu huấn luyện.
Hậu huấn luyện có thể hiểu là quá trình tiếp tục rèn kỹ năng cho một mô hình đã có kiến thức nền. Thay vì dạy lại mọi thứ từ đầu, nhà phát triển cho mô hình làm các nhiệm vụ thực tế, dùng công cụ, nhận phản hồi và điều chỉnh cách giải quyết vấn đề.
Theo Z.ai, GLM-5.3 tiến bộ rõ ở lập trình dự án lớn, thao tác terminal, nhiệm vụ AI Agent dài và phân tích lỗ hổng phần mềm. Mô hình hiện nhận đầu vào văn bản, hỗ trợ ngữ cảnh tối đa 1 triệu token và có thể tạo tối đa 128.000 token đầu ra.
Một triệu token cho phép AI đọc nhiều tệp mã nguồn, tài liệu kỹ thuật hoặc lịch sử làm việc trong cùng một phiên. Điều đó không có nghĩa nên ném cả ổ cứng vào prompt. Dữ liệu càng dài thì chi phí và thời gian xử lý càng tăng. Tuy nhiên, với kho mã lớn hoặc nhiệm vụ nghiên cứu dài, khoảng ngữ cảnh rộng giúp Agent ít phải cắt bỏ thông tin cũ.
GLM-5.3-Flash có gì khác?
GLM-5.3-Flash là mô hình đa phương thức đầu tiên trong dòng GLM-5. Trước khi mang tên chính thức, nó từng được thử nghiệm ẩn danh với tên OX Alpha trên OpenCode và OpenRouter.
Mô hình có 320 tỷ tham số tổng cộng nhưng chỉ kích hoạt khoảng 18 tỷ tham số cho mỗi lượt xử lý. Đây là cách hoạt động quen thuộc của kiến trúc hỗn hợp chuyên gia, hay MoE. Có thể hình dung hệ thống sở hữu một nhóm chuyên gia lớn, nhưng mỗi câu hỏi chỉ gọi đúng những thành phần phù hợp vào làm việc. Cả phòng không phải họp chỉ để trả lời một email.
- Đầu vào: văn bản, hình ảnh, video và tệp.
- Đầu ra: văn bản.
- Ngữ cảnh tối đa: 1 triệu token.
- Đầu ra tối đa: 128.000 token.
- 320 tỷ tham số tổng, khoảng 18 tỷ tham số được kích hoạt.
- Bản phát hành trên Hugging Face sử dụng giấy phép MIT.

Vì sao bản Flash chạy tiết kiệm hơn?
GLM-5.3-Flash kết hợp linear attention và sparse attention. Attention là cơ chế giúp AI xác định phần thông tin nào cần chú ý khi đọc một chuỗi dữ liệu. Với ngữ cảnh rất dài, cách tính truyền thống có thể ngốn nhiều bộ nhớ và phép tính.
Linear attention phụ trách các quan hệ cục bộ với chi phí thấp. Sparse attention tìm lại những phần quan trọng nằm xa trong ngữ cảnh. Z.ai còn dùng kỹ thuật IndexPool để nén dữ liệu lập chỉ mục khi mô hình xử lý lượng thông tin lớn.
Theo tài liệu kỹ thuật của hãng, so với GLM-5.3, bản Flash giảm lượng tính toán attention khoảng 3 lần và giảm dung lượng KV cache khoảng 4,44 lần. KV cache là vùng nhớ lưu thông tin trung gian để mô hình không phải tính lại toàn bộ nội dung cũ khi sinh token tiếp theo.
Những thay đổi này cho thấy Flash không đơn thuần là bản lớn bị cắt bớt. Nó được thiết kế lại để làm ít phép tính không cần thiết hơn.
Khả năng nhìn hình ảnh giúp ích gì khi lập trình?
GLM-5.3 chỉ nhận văn bản. GLM-5.3-Flash có thể đọc ảnh chụp màn hình, video, tệp và nội dung hiển thị trên giao diện. Khác biệt này rất đáng kể khi AI làm frontend, game hoặc điều khiển phần mềm.
Một mô hình chỉ đọc code có thể kiểm tra cú pháp và luồng xử lý, nhưng không tự biết nút bấm đang lệch, chữ tràn khỏi khung hoặc màu nền khiến nội dung khó nhìn. Flash có thể quan sát sản phẩm sau khi render rồi tiếp tục sửa.
- Đọc yêu cầu và ảnh giao diện mẫu.
- Viết mã nguồn.
- Khởi chạy ứng dụng.
- Quan sát giao diện đã render.
- So sánh bố cục, màu sắc và trạng thái tương tác.
- Sửa code rồi kiểm tra lại.
Vòng lặp “quan sát – làm – kiểm tra – sửa” cũng hữu ích với Blender, phần mềm CAD, trò chơi và Computer Use. Khả năng thực tế vẫn phụ thuộc vào công cụ bên ngoài. Mô hình không tự nhiên điều khiển được trình duyệt hoặc Blender nếu hệ thống Agent chưa cấp cho nó mắt, chuột và môi trường chạy lệnh.
GLM-5.3-Flash còn nhắm tới công việc văn phòng
Z.ai giới thiệu Flash như một cộng sự cho nhiều quy trình chuyên môn, không chỉ sinh code. Mô hình có thể đọc tài liệu nguồn, biểu đồ, bảng tính và hình ảnh để hỗ trợ tạo PPTX, PDF, DOCX hoặc XLSX.
Phần hữu ích nằm ở khả năng kiểm tra sản phẩm sau khi tạo. Với bản trình chiếu, một Agent phù hợp có thể render từng trang để phát hiện chữ tràn, ảnh cắt sai, thành phần chồng lên nhau hoặc căn lề thiếu nhất quán. Với bảng tính, nó có thể rà công thức và đối chiếu số liệu với tài liệu nguồn.
Tất nhiên, “có thể tạo file” không đồng nghĩa file nào cũng dùng được ngay. Dữ liệu kinh doanh, mô hình tài chính và tài liệu pháp lý vẫn cần con người kiểm tra. AI làm nhanh thật, nhưng bảng Excel sai một dấu âm thì phòng kế toán cũng khó cười nổi.
Hiệu năng lập trình và AI Agent
Z.ai cho biết GLM-5.3 cải thiện khoảng 50% so với GLM-5.2 trên Z.ai Code Bench, một bài đánh giá nội bộ mô phỏng yêu cầu lập trình trong môi trường phát triển thực tế.
| Bài đánh giá | GLM-5.3 | GLM-5.2 |
|---|---|---|
| Terminal-Bench 3.0 | 28,3 | 4,6 |
| DeepSWE 1.1 | 66,9 | 46,2 |
| Agents’ Last Exam CLI | 28,5 | 23,8 |
| AutomationBench 1.0.6 | 48,2 | 26,2 |
| CyberGym | 84,5 | 77,2 |
| ExploitBench | 54,4 | 24,4 |
GLM-5.3-Flash cũng đạt 63,4 trên DeepSWE 1.1 và 48,8 trên AutomationBench, theo số liệu do Z.ai công bố. Trên Z.ai Code Bench ở mức suy luận cao nhất, Flash đạt 29,0; Claude Opus 4.8 đạt 29,5 trong cấu hình so sánh của hãng.
Nếu đang quan tâm tới hệ sinh thái coding agent, bạn có thể đọc thêm bài Kilo Code là gì? và phần giải thích về giao thức A2A dành cho AI Agent.
Khả năng phân tích bảo mật của GLM-5.3
Z.ai đã đưa dữ liệu và môi trường phát hiện lỗ hổng vào quá trình hậu huấn luyện GLM-5.3. Hãng cho biết mô hình không chỉ nhận ra lỗi riêng lẻ mà còn tiến bộ trong việc lập luận qua nhiều bước của một chuỗi khai thác.
Trên CyberGym, GLM-5.3 đạt 84,5%, so với 77,2% của GLM-5.2. Trên ExploitBench, điểm số tăng từ 24,4 lên 54,4. Z.ai cũng tuyên bố mô hình đã hỗ trợ các nhóm bảo mật phát hiện 2.436 lỗ hổng trong 269 dự án sau khi chuyên gia rà soát, loại trùng và đánh giá. Trong đó có 1.097 vấn đề ở mức trung bình đến cao.
Đây là tuyên bố từ Z.ai, không nên diễn giải thành việc AI có thể thay thế chuyên gia an ninh mạng. Năng lực tìm lỗ hổng cũng là con dao hai lưỡi. Khi triển khai, doanh nghiệp cần giới hạn quyền truy cập, cô lập môi trường chạy lệnh, lưu nhật ký và kiểm soát dữ liệu đầu vào.
So sánh GLM-5.3-Flash và GLM-5.3
| Tiêu chí | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|
| Vai trò | Nhanh, tiết kiệm, đa phương thức | Mô hình chủ lực cho nhiệm vụ khó |
| Đầu vào | Văn bản, hình ảnh, video, tệp | Văn bản |
| Đầu ra | Văn bản | Văn bản |
| Ngữ cảnh | 1 triệu token | 1 triệu token |
| Đầu ra tối đa | 128.000 token | 128.000 token |
| Chế độ suy luận | Luôn bật; Low, High, Max | Luôn bật; Low, High, Max |
| Điểm mạnh | Visual coding, tài liệu, GUI, chi phí thấp | Coding phức tạp, Agent dài, phân tích bảo mật |
| Giấy phép trọng số | MIT | Giấy phép GLM-5.3 riêng |
| Mã API | glm-5.3-flash |
glm-5.3 |
Giá API GLM-5.3-Flash và GLM-5.3
Bảng giá Z.ai được tính trên mỗi một triệu token. Tại thời điểm kiểm tra ngày 30/8/2026, GLM-5.3-Flash đang được giảm giá 50%.
| Mô hình | Đầu vào | Đầu vào đã cache | Đầu ra |
|---|---|---|---|
| GLM-5.3-Flash – giá niêm yết | 0,15 USD | 0,03 USD | 0,50 USD |
| GLM-5.3-Flash – khuyến mại | 0,075 USD | 0,015 USD | 0,25 USD |
| GLM-5.3 | 1,40 USD | 0,26 USD | 4,40 USD |
Z.ai cho biết chương trình giảm giá Flash kết thúc lúc 24 giờ ngày 9/9/2026 theo múi giờ UTC+8. Giá có thể được điều chỉnh sau thời điểm đó, vì vậy nên kiểm tra trang chính thức trước khi dự toán cho hệ thống có lưu lượng lớn.

Ngay cả theo giá niêm yết, đầu vào của Flash rẻ hơn GLM-5.3 khoảng 9,3 lần và đầu ra rẻ hơn khoảng 8,8 lần. Trong giai đoạn khuyến mại, mức chênh lệch còn lớn hơn.
Cách gọi GLM-5.3 bằng API tương thích OpenAI
Z.ai cung cấp API tương thích với thư viện OpenAI. Sau khi tạo API key, có thể gọi GLM-5.3 bằng Python như sau:
from openai import OpenAI
client = OpenAI(
api_key="ZAI_API_KEY",
base_url="https://api.z.ai/api/paas/v4/"
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[
{"role": "system", "content": "Bạn là lập trình viên nhiều kinh nghiệm."},
{"role": "user", "content": "Kiểm tra dự án và đề xuất kế hoạch tối ưu."}
],
extra_body={
"thinking": {"type": "enabled"},
"reasoning_effort": "max"
}
)
print(response.choices[0].message.content)
Muốn dùng bản Flash, chỉ cần đổi mã model thành glm-5.3-flash. Cả hai mô hình đều luôn bật suy luận. Tham số reasoning_effort nhận ba mức: low, high và max.
- Low: phù hợp câu hỏi đơn giản và phản hồi nhanh.
- High: cân bằng giữa chất lượng, token và thời gian.
- Max: nên dùng cho lập trình, phân tích hoặc nhiệm vụ khó.
Không nên gửi thinking.type: "disabled" như một số phiên bản cũ. Tài liệu GLM-5.3 cho biết yêu cầu đó sẽ thất bại.
Có thể chạy GLM-5.3 trên máy cá nhân không?
Trọng số của cả GLM-5.3 và GLM-5.3-Flash đã xuất hiện trên Hugging Face. Các framework được hỗ trợ gồm SGLang, vLLM, Transformers, KTransformers, Unsloth và TokenSpeed.
Tuy nhiên, “tải được” không đồng nghĩa “chạy nhẹ nhàng trên laptop”. Riêng Flash đã có tổng cộng 320 tỷ tham số. Dù mỗi lượt chỉ kích hoạt khoảng 18 tỷ, hệ thống vẫn phải lưu trọng số của toàn mô hình. Các bản lượng tử hóa giúp giảm bộ nhớ, nhưng đây vẫn là bài toán phần cứng nghiêm túc.
Với đa số cá nhân và doanh nghiệp nhỏ, API hoặc GLM Coding Plan thực tế hơn tự dựng máy chủ. Chạy cục bộ phù hợp khi cần kiểm soát dữ liệu, có hạ tầng đủ lớn và đội ngũ biết tối ưu hệ thống suy luận.
Nên chọn model nào?
Chọn GLM-5.3-Flash nếu:
- Cần đọc hình ảnh, video hoặc tệp.
- Muốn dựng giao diện từ ảnh mẫu và kiểm tra kết quả render.
- Cần Agent thao tác GUI hoặc Computer Use.
- Xử lý tài liệu văn phòng và báo cáo có nhiều thành phần hình ảnh.
- Khối lượng yêu cầu lớn và chi phí là yếu tố quan trọng.
- Muốn một model mặc định đủ tốt cho nhiều công việc.
Chọn GLM-5.3 nếu:
- Xử lý kho mã lớn hoặc dự án phần mềm phức tạp.
- Cần Agent chạy lâu qua nhiều công cụ.
- Sửa lỗi khó, tối ưu hạ tầng hoặc thao tác terminal dài.
- Phân tích mã nguồn phục vụ bảo mật.
- Chất lượng đầu ra quan trọng hơn chi phí.
- Không cần đầu vào hình ảnh hay video.
Đánh giá cuối cùng
GLM-5.3 tập trung vào lập trình chuyên sâu, tác vụ Agent dài và phân tích bảo mật. GLM-5.3-Flash nhắm tới hiệu quả chi phí, ngữ cảnh dài và khả năng nhìn hình ảnh trong vòng lặp làm việc.
Flash có vẻ là lựa chọn phù hợp hơn cho số đông vì rẻ, nhận nhiều loại dữ liệu và vẫn đạt kết quả mạnh trên các bài đánh giá do Z.ai công bố. GLM-5.3 nên dành cho nhiệm vụ thật sự khó, nơi vài bước suy luận sai có thể làm Agent đi lạc khá xa.
Dù vậy, benchmark chỉ là bước tham khảo. Trước khi triển khai, nên thử cả hai trên chính dữ liệu của mình, đo tỷ lệ hoàn thành, số lần con người phải sửa, thời gian phản hồi và tổng chi phí. Mô hình đứng đầu bảng xếp hạng nhưng sửa sai ba vòng vẫn có thể đắt hơn model “Flash” làm đúng ngay từ đầu.
Câu hỏi thường gặp
GLM-5.3-Flash có miễn phí không?
API không miễn phí hoàn toàn. Z.ai đang áp dụng giá khuyến mại theo token tại thời điểm bài viết được cập nhật. Gói thuê bao hoặc nền tảng trung gian có thể có hạn mức riêng.
GLM-5.3-Flash có phải mô hình mã nguồn mở không?
Trọng số Flash được phát hành trên Hugging Face với giấy phép MIT. Tuy nhiên, trọng số mở không có nghĩa toàn bộ dữ liệu huấn luyện, quy trình và hạ tầng phục vụ đều được công bố.
GLM-5.3 có đọc được ảnh không?
Theo tài liệu hiện tại, GLM-5.3 chỉ nhận văn bản. Muốn xử lý ảnh, video hoặc tệp, nên dùng GLM-5.3-Flash.
Có thể tắt suy luận không?
Không. Cả hai mô hình yêu cầu bật suy luận. Người dùng chỉ có thể chọn mức low, high hoặc max.