Qwen Image 3.0 là gì? Công cụ AI tạo ảnh chữ rõ nét của Alibaba
Qwen Image 3.0 là model AI tạo ảnh mới của Alibaba, nổi bật với khả năng render chữ nét 10px, hỗ trợ 12 ngôn ngữ. Tìm hiểu tính năng, giá và cách dùng.
Qwen Image 3.0 vừa được Alibaba đưa lên trạng thái GA (general availability) từ ngày 5/8/2026, sau thời gian chạy thử nghiệm giới hạn. Đây là model tạo ảnh AI được quảng bá là giải quyết đúng điểm yếu mà gần như mọi công cụ vẽ ảnh AI khác đều gặp: chữ trong ảnh bị méo, sai font, hoặc biến thành ký tự vô nghĩa. Nếu bạn từng thử tạo một tấm poster, banner hay infographic bằng AI rồi phải Photoshop lại phần chữ vì AI vẽ sai, đây là công cụ đáng thử.
Qwen Image 3.0 là gì?
Qwen Image 3.0 là model text-to-image và chỉnh sửa ảnh (image editing) thế hệ mới trong họ Qwen của Alibaba, được vận hành qua Alibaba Cloud Model Studio (DashScope). Model này vừa có thể tạo ảnh từ mô tả văn bản, vừa có thể chỉnh sửa ảnh có sẵn dựa trên 1-4 ảnh tham chiếu kèm hướng dẫn bằng lời. Qwen Image 3.0 ra mắt với hai phiên bản: Qwen-Image-3.0-Pro và Qwen-Image-3.0-Standard, dùng chung một API.
Điểm được nhắc đến nhiều nhất khi nói về model này là khả năng render chữ trong ảnh cực nét — thứ mà DALL-E hay Stable Diffusion vẫn hay bị lỗi khi cần chữ dài, chữ nhỏ, hoặc chữ không phải tiếng Anh.
Điểm nổi bật kỹ thuật của Qwen Image 3.0
Chữ nét 10px, hỗ trợ 12 ngôn ngữ
Theo các bên tổng hợp benchmark, model có thể render chữ rõ nét ở kích thước chỉ 10px, hỗ trợ 12 ngôn ngữ và hơn 20 font khác nhau. Điều này giúp model xử lý tốt các thể loại ảnh vốn “khó nhằn” với AI tạo ảnh trước đây: infographic khoa học, bài báo có công thức toán học, trang báo giấy mô phỏng, hay ghi chú viết tay được thêm vào khi chỉnh sửa ảnh.
Hiểu prompt dài tới 4.500 token
Model này chấp nhận prompt đầu vào dài tới khoảng 4.500 token, giúp model hiểu được các yêu cầu phức tạp gồm cả mô tả bố cục lẫn nội dung chữ cần xuất hiện trong ảnh, rồi dựng ra layout dày đặc thông tin (dense layout) chỉ trong một lần tạo — thay vì phải tạo nhiều lần rồi ghép lại.
Chỉnh sửa ảnh bằng ảnh tham chiếu
Với tác vụ image editing, công cụ nhận tối đa 4 ảnh tham chiếu trong một yêu cầu, xuất ảnh ở độ phân giải 1K hoặc 2K, hỗ trợ nhiều tỉ lệ khung hình (1:1, 1:2, 1:4, 2:1, 2:3, 3:2 và một số tỉ lệ khác), và có thể trả về tối đa 6 ảnh cho mỗi lần gọi.
Giá của Qwen Image 3.0: Pro và Standard chênh nhau bao nhiêu?
Trên Alibaba Cloud (QwenCloud), giá của Qwen Image 3.0 được tính theo lượt xuất ảnh và độ phân giải:
| Phiên bản | Giá ảnh 1K | Giá ảnh 2K | Phù hợp với |
|---|---|---|---|
| Qwen-Image-3.0-Pro | $0,04 / ảnh | $0,075 / ảnh | Ảnh cần chữ nét, layout phức tạp, chất lượng cao nhất |
| Qwen-Image-3.0-Standard | $0,03 / ảnh (1K hoặc 2K) | Tạo ảnh số lượng lớn, cần tốc độ và chi phí thấp | |
Ngoài kênh chính thức của Alibaba Cloud, model còn được một số bên trung gian cung cấp API với mức giá khác nhau, ví dụ khoảng $0,021/ảnh trên Fal hay $0,030/ảnh trên Replicate cho ảnh 1024×1024 — nên nếu chỉ cần dùng thử, bạn có thể so sánh giá qua các nền tảng trung gian trước khi đăng ký trực tiếp Alibaba Cloud.
Qwen Image 3.0 so với các đối thủ
Trên bảng xếp hạng Arena về text-to-image, Qwen-Image-3.0-Pro được ghi nhận đứng số 1 trong nhóm model Trung Quốc và đứng thứ 2 trong nhóm model nói chung, chỉ sau dòng GPT-Image của OpenAI. Đây là mức cải thiện đáng kể so với các bản Qwen Image trước, vốn mạnh về chỉnh sửa ảnh nhưng chưa nổi bật ở khoản render chữ.
Nếu đặt cạnh các model ngôn ngữ khác cùng nhà Alibaba, Qwen Image 3.0 cho thấy chiến lược nhất quán: Qwen3.8 với hai bản 27B và 2.4T-A95B tập trung vào xử lý ngôn ngữ và suy luận, còn Qwen Image 3.0 phụ trách mảng hình ảnh — cả hai đều theo hướng tối ưu chi phí vận hành thay vì chỉ chạy đua tham số. Trong khi đó, ở nhóm model đóng của các hãng khác như Gemini Omni 1.1 Flash của Google, thế mạnh lại nằm ở xử lý đa phương thức hợp nhất (văn bản, ảnh, âm thanh) trong cùng một model thay vì tách riêng model ảnh và model ngôn ngữ như Alibaba đang làm.
Còn nếu bạn đang cân nhắc dùng AI để tạo nội dung nói chung chứ không riêng gì ảnh, có thể tham khảo thêm cách các model như DeepSeek-V4-Flash tối ưu chi phí cho tác vụ agent và coding — cùng xu hướng “rẻ hơn nhưng vẫn đủ dùng” đang lan rộng trong ngành AI Trung Quốc năm 2026.
Cách dùng Qwen Image 3.0
- Qua Alibaba Cloud Model Studio: đăng ký tài khoản, lấy API key, cài SDK DashScope rồi gọi API text-to-image hoặc image-editing. Lưu ý model, endpoint và API key phải cùng khu vực (region), gọi khác vùng sẽ báo lỗi.
- Qua nền tảng trung gian: một số nhà cung cấp API bên thứ ba (như Fal, Replicate) đã tích hợp sẵn model này, phù hợp nếu bạn muốn dùng thử nhanh mà không cần đăng ký tài khoản Alibaba Cloud.
- Mẹo khi viết prompt: vì model hiểu được prompt dài, hãy mô tả rõ cả bố cục lẫn nội dung chữ cần xuất hiện (font, vị trí, kích thước tương đối) thay vì chỉ mô tả chung chung — model tận dụng tốt phần chi tiết này để render chữ chính xác hơn.
Câu hỏi thường gặp
Qwen Image 3.0 có miễn phí không?
Không có bản miễn phí chính thức. Model tính phí theo số ảnh xuất ra, dao động khoảng $0,03-0,075/ảnh tùy phiên bản và độ phân giải qua Alibaba Cloud, hoặc rẻ hơn một chút nếu dùng qua các nền tảng trung gian như Fal.
Qwen Image 3.0 Pro và Standard khác nhau chỗ nào?
Cả hai dùng chung engine render chữ và cùng API, nhưng Pro nhắm tới chất lượng cao nhất cho ảnh có layout phức tạp, còn Standard có giá đồng nhất và phù hợp hơn khi cần tạo ảnh số lượng lớn với tốc độ nhanh.
Qwen Image 3.0 có xử lý tiếng Việt không?
Model công bố hỗ trợ 12 ngôn ngữ với trọng tâm là tiếng Trung và tiếng Anh. Thông tin chi tiết về việc tiếng Việt có nằm trong danh sách này hay không chưa được các nguồn kiểm chứng xác nhận rõ, nên nếu cần render chữ tiếng Việt, tốt nhất nên test thử trực tiếp trước khi dùng cho công việc thật.
Kết luận
Qwen Image 3.0 cho thấy Alibaba đang nhắm thẳng vào điểm yếu chung của AI tạo ảnh: chữ trong ảnh. Với khả năng render chữ nét ở kích thước nhỏ, hiểu prompt dài và giá không quá cao so với mặt bằng chung, đây là công cụ đáng cân nhắc nếu công việc của bạn thường xuyên cần tạo poster, banner, infographic hay tài liệu có chữ bằng AI. Thông tin và số liệu trong bài được tổng hợp, đối chiếu từ tài liệu chính thức của Alibaba Cloud Model Studio và bài phân tích của OrcaRouter.