SWE-2 là gì? Model code mới của Cognition cho AI agent Devin

SWE-2 là model code mới của Cognition, huấn luyện trên nền Kimi K3, dùng cho AI agent Devin. Điểm FrontierCode gần ngang Claude Fable 5.1 nhưng chi phí thấp hơn 64%.

Bởi Danh Võ — 13 Tháng 9, 2026 trong Công cụ AI

0 bình luận

Ngày 10/9/2026, Cognition — công ty đứng sau AI agent lập trình Devin — ra mắt SWE-2, model code mới được huấn luyện dựa trên nền tảng Kimi K3 của Moonshot AI. Điểm đáng chú ý là SWE-2 được Cognition công bố đạt điểm số ngang ngửa Claude Fable 5.1 trên benchmark FrontierCode, trong khi chi phí vận hành thấp hơn đáng kể. Bài này tổng hợp những gì đã được xác minh về SWE-2: sức mạnh thực sự tới đâu, cách dùng trong Devin, và có đáng để cân nhắc chuyển sang hay chưa.

SWE-2 là gì?

SWE-2 là model AI chuyên cho việc viết code, do Cognition phát triển để chạy bên trong Devin — AI agent có khả năng tự nhận task, đọc codebase, viết code và mở pull request gần như không cần con người can thiệp giữa chừng. Khác với các bản SWE trước đó, SWE-2 không được huấn luyện từ đầu mà post-train (huấn luyện tiếp) trên nền model Kimi K3 của Moonshot AI — một base model quy mô lớn vốn đã được RL-train (reinforcement learning) sẵn cho các tác vụ agentic coding.

Cách làm này giúp Cognition rút ngắn thời gian phát triển và tận dụng được năng lực nền tảng của Kimi K3, thay vì phải xây một large language model hoàn toàn mới. SWE-2 hiện được triển khai trước trên Devin Desktop và Devin CLI, với Devin Web và Devin Fusion sẽ nhận bản cập nhật sau.

SWE-2 mạnh đến đâu? Các con số benchmark

Theo công bố chính thức từ Cognition, SWE-2 đạt các mốc điểm sau trên bộ benchmark nội bộ của họ:

Benchmark Điểm SWE-2 Ghi chú
FrontierCode 1.1 Main 50,0% Đo khả năng pull request được merge thật; Claude Fable 5.1 đạt 50,9%
DeepSWE 1.1 73,0% Benchmark sửa lỗi/hoàn thiện task code
Terminal-Bench 2.1 92,8% Thao tác dòng lệnh, terminal
Terminal-Bench 4 27,3% Phiên bản benchmark khó hơn, mới hơn

Trên FrontierCode 1.1 Main — benchmark mà Cognition dùng để đánh giá xem một maintainer thật có chấp nhận merge pull request do AI viết hay không — SWE-2 chỉ thua Claude Fable 5.1 chưa đến 1 điểm phần trăm, đồng thời được cho là vượt qua SWE-1.7 (bản tiền nhiệm), Grok 4.6 và GPT-5.6 Sol. Điểm nhấn thương mại là Cognition tuyên bố SWE-2 đạt mức điểm tương đương Fable 5.1 với chi phí vận hành thấp hơn khoảng 64%.

Cần lưu ý: toàn bộ số liệu trên là benchmark nội bộ do chính Cognition công bố, chưa có bên thứ ba độc lập chạy lại để kiểm chứng. Đây là điều bình thường với các thông báo ra mắt model mới, nhưng bạn nên xem đây là con số tham khảo thay vì tuyệt đối khi so sánh với các model AI khác.

Biểu đồ so sánh điểm FrontierCode 1.1 Main giữa SWE-2, Claude Fable 5.1, GPT-5.6 Sol, Grok 4.6 và SWE-1.7

Reasoning effort chọn được: medium, high, max

SWE-2 là model đầu tiên của Cognition cho phép chọn mức độ suy luận (reasoning effort) theo ba cấp: medium, high và max. Điều đặc biệt là ba mức này không phải ba model tách biệt, mà được huấn luyện cùng lúc trong một lần chạy reinforcement learning duy nhất, có áp dụng “cost penalty” — tức mô hình được thưởng/phạt dựa trên cả độ chính xác lẫn chi phí tính toán. Nhờ vậy người dùng có thể chọn mức reasoning phù hợp với từng loại task: task đơn giản dùng medium cho nhanh và rẻ, task phức tạp dùng max để tăng độ chính xác.

Dùng SWE-2 trong Devin như thế nào?

Nếu bạn đang dùng Devin, SWE-2 xuất hiện như một lựa chọn model mới ngay trong Devin Desktop hoặc Devin CLI — không cần cài đặt gì thêm. Vài điểm cần biết khi thử nghiệm:

  • Bắt đầu với mức reasoning medium cho các task quen thuộc (fix bug nhỏ, viết test, refactor cục bộ) để tiết kiệm chi phí.
  • Chuyển sang high hoặc max khi giao Devin xử lý task nhiều bước, liên quan tới nhiều file hoặc yêu cầu hiểu sâu kiến trúc hệ thống.
  • Theo dõi pull request do SWE-2 tạo ra như với bất kỳ agent nào khác — review kỹ trước khi merge, đặc biệt với code đụng tới phần bảo mật hoặc dữ liệu người dùng.

SWE-2 vs Claude Fable 5.1: nên chọn AI nào để code?

Nếu bạn đã đọc bài so sánh GPT-6 Astra và Claude Fable 5.1 trên site, sẽ thấy Fable 5.1 hiện vẫn là chuẩn tham chiếu phổ biến cho coding agent chi phí thấp. Với SWE-2, sự khác biệt nằm ở chỗ Cognition không bán model đơn lẻ như Claude Fable 5.1 mà tích hợp SWE-2 làm “bộ não” cho Devin — nghĩa là bạn đang mua trải nghiệm agent trọn gói (tự lập kế hoạch, tự chạy terminal, tự mở PR) chứ không chỉ một API code hoàn chỉnh.

Nếu nhu cầu của bạn là gọi API để tích hợp vào pipeline riêng, Claude Fable 5.1 hoặc các model tương tự vẫn linh hoạt hơn. Nhưng nếu bạn muốn một agent “giao việc rồi chờ kết quả” đúng nghĩa, SWE-2 bên trong Devin là lựa chọn đáng thử, nhất là với mức chi phí được quảng cáo thấp hơn đáng kể so với việc chạy Fable 5.1 ở quy mô tương đương.

Có nên chuyển sang SWE-2 ngay không?

Với các đội nhóm đang dùng Devin, việc thử SWE-2 gần như không có rủi ro vì chỉ là đổi model trong cùng một agent quen thuộc — cứ bật thử ở mức medium cho vài task rồi so sánh chất lượng PR với bản SWE-1.7 cũ. Với người chưa dùng Devin, nên chờ thêm đánh giá độc lập (không phải benchmark tự công bố) trước khi quyết định chuyển hẳn workflow sang, đặc biệt nếu codebase của bạn có yêu cầu bảo mật hoặc compliance nghiêm ngặt.

Câu hỏi thường gặp về SWE-2

SWE-2 có phải là model mã nguồn mở không?

Không. SWE-2 được Cognition phát triển và tích hợp riêng cho Devin, hiện chưa có thông tin chính thức về việc mở weight hay cung cấp API độc lập bên ngoài Devin.

SWE-2 có thay thế được Claude Fable 5.1 hay GPT-6 Astra không?

Tùy nhu cầu. SWE-2 mạnh nhất khi dùng trong hệ sinh thái Devin cho các task lập trình agentic; nếu bạn cần một model đa năng gọi qua API cho nhiều loại tác vụ khác nhau, các lựa chọn như Fable 5.1 vẫn phù hợp hơn.

Điểm benchmark của SWE-2 có đáng tin không?

Các con số hiện tại đều do Cognition tự công bố, chưa có bên thứ ba độc lập kiểm chứng lại. Nên xem là tham khảo ban đầu, và tự đánh giá thêm bằng cách chạy thử trên task thực tế của mình.

Kết luận

SWE-2 cho thấy hướng đi khá thực dụng của Cognition: thay vì chạy đua xây model từ đầu, họ tận dụng nền tảng Kimi K3 rồi tối ưu riêng cho bài toán coding agent trong Devin. Điểm số FrontierCode gần ngang Claude Fable 5.1 cùng mức chi phí thấp hơn là tín hiệu tích cực, nhưng vì đây vẫn là số liệu tự công bố, cách kiểm chứng tốt nhất vẫn là tự tay thử SWE-2 trên vài task code thật của bạn trước khi quyết định có gắn bó lâu dài hay không.

Nguồn tham khảo: thông báo chính thức từ Cognitionphân tích của MarkTechPost.

Chân dung Danh Võ

Danh Võ

Người sáng lập danhvo.net — viết về AI, WordPress và tự động hóa dựa trên kinh nghiệm thực chiến, không lý thuyết suông. 8+ năm làm việc trong ngành công nghệ.

Viết một bình luận