
Cách cài Ollama trên Windows 11 để chạy AI cục bộ
Hướng dẫn cài Ollama trên Windows 11, tải mô hình AI, tối ưu dung lượng, kiểm tra GPU và sử dụng API cục bộ an toàn.
Cài Ollama trên Windows 11 là một trong những cách dễ nhất để chạy mô hình AI ngay trên máy tính cá nhân. Thay vì gửi câu hỏi, tài liệu hoặc đoạn mã lên một dịch vụ bên ngoài, bạn có thể để máy mình tự xử lý. Nghe hơi giống chuyện “nuôi AI trong nhà”: không phải cho ăn cơm, nhưng ổ cứng và RAM thì chắc chắn sẽ vơi đi đôi chút.
Trong bài này, chúng ta sẽ đi từ bước kiểm tra máy, cài Ollama, tải mô hình đầu tiên, quản lý dung lượng cho đến cách gọi API cục bộ. Hướng dẫn ưu tiên sự thực tế: máy nào phù hợp, máy nào vẫn chạy được nhưng cần kiên nhẫn, và những thiết lập bảo mật nào không nên bỏ qua.
Cài Ollama trên Windows 11 để làm gì?
Ollama là công cụ giúp tải, quản lý và chạy các mô hình ngôn ngữ trên máy tính. Sau khi cài đặt, Ollama hoạt động nền như một ứng dụng Windows, đồng thời cung cấp lệnh ollama trong Command Prompt, PowerShell hoặc Windows Terminal. API cục bộ mặc định được phục vụ tại http://localhost:11434.
Điểm hấp dẫn nhất là bạn có thể trò chuyện với mô hình, tóm tắt tài liệu, hỗ trợ viết mã hoặc tích hợp AI vào phần mềm nội bộ mà không cần gửi mọi dữ liệu lên Internet. Với người làm IT, đây còn là một “phòng thí nghiệm” khá thú vị để thử prompt, API, chatbot nội bộ hay quy trình tự động hóa trước khi đưa lên hệ thống lớn.

Ưu điểm dễ nhận thấy
- Chủ động hơn với dữ liệu: nội dung có thể được xử lý tại chỗ nếu bạn dùng mô hình cục bộ và không kết nối thêm dịch vụ đám mây.
- Không tính phí theo từng câu hỏi: chi phí chuyển sang phần cứng, điện năng và thời gian chờ.
- Có thể dùng khi mạng chập chờn: mô hình đã tải về vẫn hoạt động ngoại tuyến cho nhiều tác vụ.
- Dễ tích hợp: API cục bộ phù hợp để thử nghiệm chatbot, công cụ viết nội dung, tra cứu tài liệu hoặc trợ lý lập trình.
Tuy vậy, AI cục bộ không tự động đồng nghĩa với “bí mật tuyệt đối”. Nếu ứng dụng bạn dùng cùng Ollama có plugin, web search hoặc kết nối API bên ngoài, dữ liệu vẫn có thể rời khỏi máy. Vì vậy, hãy kiểm tra toàn bộ chuỗi xử lý, đừng chỉ nhìn mỗi chú lạc đà ở cửa ra vào rồi yên tâm giao luôn chìa khóa kho dữ liệu.
Yêu cầu trước khi cài Ollama trên Windows 11
Theo tài liệu chính thức dành cho Windows, Ollama hỗ trợ Windows 10 phiên bản 22H2 trở lên, bao gồm bản Home và Pro. Như vậy Windows 11 nằm trong phạm vi hỗ trợ. Ứng dụng chạy nguyên bản trên Windows và hỗ trợ tăng tốc bằng GPU NVIDIA cũng như AMD Radeon trong các cấu hình tương thích.
Phần cài đặt chương trình cần ít nhất khoảng 4 GB dung lượng. Tuy nhiên, đây mới chỉ là “tiền đặt cọc”. Các mô hình có thể chiếm từ vài GB đến hàng chục, thậm chí hàng trăm GB tùy kích thước và số lượng bạn tải. Nếu ổ C chỉ còn vài vạch đỏ, nên dọn hoặc chuyển thư mục mô hình trước khi tải.

RAM, VRAM và kích thước mô hình
Không có một con số cấu hình duy nhất phù hợp cho mọi mô hình. Nguyên tắc đơn giản là mô hình càng lớn thì càng cần nhiều RAM hoặc VRAM. GPU rời thường giúp tốc độ phản hồi tốt hơn, nhưng máy chỉ có CPU vẫn có thể chạy một số mô hình nhỏ. Đổi lại, bạn có thêm thời gian pha trà, uống trà và đôi khi rửa luôn cái cốc.
Người mới nên bắt đầu bằng biến thể nhỏ hoặc tầm trung trong thư viện mô hình của Ollama, đọc kỹ kích thước tải xuống rồi mới quyết định. Đừng chọn mô hình chỉ vì tên nghe “khủng”; mô hình phù hợp với công việc và phần cứng thường hữu ích hơn mô hình lớn nhưng mỗi câu trả lời khiến quạt máy bay lên tinh thần.
Cách tải và cài Ollama trên Windows 11
Bước 1: Tải bộ cài chính thức
Truy cập trang Download Ollama for Windows và tải trình cài đặt. Nên dùng trang chính thức thay vì các nguồn chia sẻ lại, bởi một công cụ có khả năng chạy nền và mở API cục bộ không phải thứ phù hợp để thử vận may với file “đã crack sẵn”.
Bước 2: Chạy trình cài đặt
Mở file vừa tải và làm theo hướng dẫn. Tài liệu của Ollama cho biết cài đặt mặc định không yêu cầu quyền Administrator và chương trình được đặt trong thư mục người dùng. Nếu muốn đổi vị trí cài, có thể khởi chạy bộ cài với tham số như sau:
OllamaSetup.exe /DIR="D:\Apps\Ollama"
Đường dẫn chỉ là ví dụ; bạn có thể chọn ổ đĩa phù hợp. Sau khi hoàn tất, Ollama chạy nền và biểu tượng ứng dụng có thể xuất hiện tại khu vực khay hệ thống.
Bước 3: Kiểm tra Ollama đã hoạt động
Mở Windows Terminal hoặc PowerShell rồi chạy:
ollama --version
Nếu lệnh trả về phiên bản, phần cài đặt cơ bản đã ổn. Nếu Windows báo không nhận diện được lệnh, hãy đóng cửa sổ Terminal, mở lại rồi thử lần nữa. Biến môi trường đôi khi cũng cần một nhịp nghỉ; máy tính có vẻ lạnh lùng nhưng vẫn thích được “đóng đi mở lại”.
Tải và chạy mô hình AI đầu tiên
Tài liệu CLI chính thức dùng cú pháp ollama run TÊN_MÔ_HÌNH. Chẳng hạn, với tên mô hình đang được Ollama minh họa trong tài liệu API, bạn có thể chạy:
ollama run gemma4
Ollama sẽ tải mô hình nếu máy chưa có, sau đó mở phiên trò chuyện trong Terminal. Tên và biến thể mô hình có thể thay đổi theo thời điểm; hãy kiểm tra trang thư viện để chọn bản phù hợp. Nếu một mô hình quá nặng, hãy dừng và chuyển sang biến thể nhỏ hơn thay vì cố chứng minh với chiếc laptop rằng ý chí con người mạnh hơn định luật vật lý.
Khi giao diện trò chuyện xuất hiện, hãy thử một yêu cầu rõ ràng:
Hãy giải thích mô hình AI cục bộ cho người mới trong 5 ý,
kèm một ví dụ ứng dụng tại doanh nghiệp.
Chất lượng câu trả lời phụ thuộc vào mô hình, kích thước, ngôn ngữ và cách đặt yêu cầu. Những nguyên tắc trong bài cách viết prompt ChatGPT hiệu quả cũng áp dụng khá tốt: nêu vai trò, mục tiêu, dữ liệu đầu vào, ràng buộc và định dạng mong muốn.
Các lệnh Ollama nên nhớ
Bạn không cần thuộc lòng cả cuốn sổ tay. Một số lệnh sau đã đủ cho phần lớn tình huống hằng ngày:
# Tải mô hình nhưng chưa chạy
ollama pull TEN_MO_HINH
# Chạy và trò chuyện với mô hình
ollama run TEN_MO_HINH
# Liệt kê mô hình đã tải
ollama list
# Xem mô hình đang chạy và mức sử dụng bộ xử lý
ollama ps
# Dừng một mô hình
ollama stop TEN_MO_HINH
# Xóa mô hình không còn dùng
ollama rm TEN_MO_HINH
Lệnh ollama list đặc biệt hữu ích khi ổ đĩa bỗng nhiên đầy mà bạn không nhớ mình đã tải những gì trong một tối “nghiên cứu khoa học”. Hãy xóa mô hình không sử dụng và vẫn duy trì thói quen sao lưu dữ liệu quan trọng. Nếu cần một quy trình riêng, bạn có thể tham khảo bài backup dữ liệu Windows tự động.
Chuyển nơi lưu mô hình sang ổ khác
Mặc định, mô hình được lưu trong vùng dữ liệu người dùng. Để chuyển sang ổ D hoặc ổ SSD có dung lượng lớn hơn, hãy tạo biến môi trường người dùng tên OLLAMA_MODELS và đặt giá trị là thư mục mong muốn, ví dụ:
D:\AI\OllamaModels
- Mở Settings và tìm “environment variables”.
- Chọn phần chỉnh sửa biến môi trường cho tài khoản người dùng.
- Tạo biến mới tên
OLLAMA_MODELS. - Điền đường dẫn thư mục, lưu lại và khởi động lại Ollama.
Nên thực hiện trước khi tải nhiều mô hình. Nếu đã có dữ liệu cũ, hãy dừng Ollama và kiểm tra kỹ quy trình di chuyển thay vì kéo thả khi dịch vụ vẫn đang dùng file.
Tối ưu context length mà không làm máy “thở dốc”
Context length là lượng token mô hình có thể giữ trong vùng nhớ cho một phiên xử lý. Context dài hữu ích khi đọc tài liệu lớn, viết mã hoặc làm việc với chuỗi hội thoại dài, nhưng nó cũng tiêu tốn thêm bộ nhớ.
Theo tài liệu context length của Ollama, thiết lập mặc định hiện phụ thuộc vào VRAM: dưới 24 GiB dùng mức 4k, từ 24–48 GiB dùng 32k và từ 48 GiB trở lên dùng 256k. Đây là giá trị mặc định tại thời điểm bài viết; phần mềm có thể thay đổi trong các bản sau.
Bạn có thể điều chỉnh trong phần Settings của ứng dụng. Hãy tăng từng bước và dùng ollama ps để xem cột PROCESSOR, từ đó biết mô hình đang được đưa lên GPU hay phải chia tải sang CPU. Context lớn không tự động làm câu trả lời thông minh hơn; đôi khi nó chỉ giúp máy có thêm nhiều thứ để… quên chậm hơn.
Gọi Ollama qua API cục bộ
Sau khi cài, API mặc định có địa chỉ http://localhost:11434. Điều này cho phép phần mềm khác gửi yêu cầu tới mô hình. Ví dụ PowerShell dưới đây tạo một yêu cầu sinh nội dung:
$body = @{
model = "gemma4"
prompt = "Viết 5 ý tưởng ứng dụng AI cho bộ phận IT"
stream = $false
} | ConvertTo-Json
Invoke-RestMethod `
-Uri "http://localhost:11434/api/generate" `
-Method Post `
-ContentType "application/json" `
-Body $body
Đây là nền tảng để xây chatbot nội bộ, công cụ tóm tắt log, phân loại yêu cầu hỗ trợ hoặc trợ lý tra cứu tài liệu. Nếu muốn hiểu rộng hơn về cách một hệ thống có thể nhận mục tiêu rồi tự thực hiện nhiều bước, bài AI Agent là gì sẽ cho bạn bức tranh tổng quát hơn.
Bảo mật khi dùng Ollama trong mạng nội bộ
API trên localhost chỉ nhằm phục vụ ứng dụng cùng máy trong thiết lập mặc định. Không nên tùy tiện mở cổng 11434 trực tiếp ra Internet. Nếu doanh nghiệp cần nhiều máy truy cập, hãy đặt dịch vụ sau reverse proxy có xác thực, giới hạn IP, mã hóa TLS, ghi log phù hợp và chính sách dữ liệu rõ ràng.
- Không đưa tài liệu mật vào mô hình khi chưa đánh giá toàn bộ ứng dụng và plugin đi kèm.
- Chỉ tải mô hình và bộ cài từ nguồn đáng tin cậy.
- Cập nhật Ollama và driver GPU có kiểm soát.
- Không cấp quyền truy cập API rộng hơn nhu cầu thực tế.
- Kiểm tra giấy phép của mô hình trước khi dùng cho mục đích thương mại hoặc doanh nghiệp.
AI chạy tại chỗ giúp giảm một số rủi ro truyền dữ liệu, nhưng không thay thế phân quyền, sao lưu, giám sát và quy trình an toàn thông tin. Công nghệ tốt không phải lá bùa; cùng lắm nó là một chiếc ô tốt, còn đi giữa bão mà mở ô ngược thì vẫn ướt.
Lỗi thường gặp và cách xử lý
Lệnh ollama không hoạt động
Đóng và mở lại Terminal, kiểm tra Ollama có chạy trong khay hệ thống hay không. Nếu vẫn lỗi, khởi động lại ứng dụng hoặc Windows rồi kiểm tra lại phiên bản.
Tải mô hình quá chậm hoặc hết dung lượng
Kiểm tra đường truyền, dung lượng ổ đĩa và kích thước mô hình trước khi tải. Chuyển thư mục bằng OLLAMA_MODELS nếu ổ hệ thống không đủ chỗ. Dùng ollama list và ollama rm để dọn các mô hình cũ.
Phản hồi chậm, CPU luôn cao
Chạy ollama ps để xem mô hình đang dùng CPU hay GPU. Hãy chọn mô hình nhỏ hơn, giảm context length và đóng bớt ứng dụng nặng. Với GPU NVIDIA hoặc AMD, đối chiếu yêu cầu driver trong tài liệu Windows chính thức.
Tiếng Việt chưa tự nhiên
Thử mô hình khác có khả năng đa ngôn ngữ tốt hơn, viết prompt rõ ràng và cung cấp một ví dụ về phong cách mong muốn. Bạn cũng có thể yêu cầu mô hình tự rà lại câu chữ sau khi tạo bản nháp. AI cục bộ rất chăm, nhưng đôi lúc vẫn cần người biên tập đứng cạnh nhắc: “Câu này nghe như biên bản họp quá em ơi”.
Có nên dùng Ollama thay ChatGPT, Claude hoặc Gemini?
Không nhất thiết phải chọn một bỏ một. Dịch vụ đám mây thường thuận tiện, có mô hình mạnh và nhiều tính năng sẵn dùng. Ollama phù hợp khi bạn muốn thử nghiệm tại chỗ, kiểm soát mô hình, tích hợp API cục bộ hoặc xử lý các tác vụ không muốn gửi ra ngoài. Bạn có thể xem thêm bài so sánh ChatGPT, Claude và Gemini để cân nhắc từng nhóm nhu cầu.
Một mô hình nhỏ chạy trên máy không mặc nhiên đánh bại dịch vụ hàng đầu, nhưng nó có lợi thế riêng: chủ động, tùy biến và không tính tiền theo lượt gọi. Cách hợp lý nhất thường là kết hợp: việc nhạy cảm hoặc lặp lại xử lý cục bộ; việc cần mô hình mạnh, dữ liệu thời gian thực hoặc hệ sinh thái đầy đủ thì dùng dịch vụ phù hợp.
Kết luận
Cài Ollama trên Windows 11 không khó: tải bộ cài chính thức, kiểm tra bằng Terminal, chọn mô hình vừa sức rồi quản lý dung lượng và context length hợp lý. Phần quan trọng nhất không phải tải được mô hình lớn nhất, mà là xác định đúng việc cần làm và giữ toàn bộ quy trình an toàn.
Nếu mới bắt đầu, hãy thử một mô hình nhỏ với ba tác vụ quen thuộc: tóm tắt văn bản, soạn bản nháp và giải thích đoạn mã. Sau một tuần, bạn sẽ biết AI cục bộ có thật sự giúp mình tiết kiệm thời gian hay chỉ giúp quạt máy có thêm nghề tay trái.
Bạn đang dùng cấu hình nào để chạy Ollama, và tác vụ nào cho kết quả hữu ích nhất? Hãy chia sẻ trải nghiệm ở phần bình luận để mọi người cùng tham khảo.
Câu hỏi thường gặp
Ollama có miễn phí không?
Bạn có thể tải và dùng Ollama để chạy mô hình trên máy. Tuy nhiên, cần xem giấy phép riêng của từng mô hình và tính đến chi phí phần cứng, dung lượng lưu trữ, điện năng. Một số tính năng hoặc mô hình đám mây có thể có điều kiện khác với chạy cục bộ.
Máy không có GPU rời có chạy được không?
Có thể chạy một số mô hình nhỏ bằng CPU, nhưng tốc độ thường chậm hơn. Nên bắt đầu với biến thể nhỏ, giảm context và kiểm tra trải nghiệm thực tế trước khi tải thêm.
Dùng Ollama có cần Internet không?
Bạn cần Internet để tải ứng dụng và mô hình. Sau khi mô hình đã nằm trên máy, nhiều tác vụ cục bộ có thể hoạt động không cần mạng, miễn là ứng dụng không gọi thêm dịch vụ bên ngoài.
Ollama có tự bảo vệ dữ liệu doanh nghiệp không?
Không. Ollama là một thành phần kỹ thuật, không thay thế chính sách bảo mật. Doanh nghiệp vẫn cần phân quyền, kiểm soát mạng, nhật ký, sao lưu, đánh giá mô hình và quy định rõ loại dữ liệu nào được phép xử lý.