The best local LLM models free to run in 2026

- Published on
- /14 mins read/
Hồi 2024, chạy LLM ở máy nhà còn là thú chơi của dân vọc vạch: model nhỏ thì ngớ ngẩn, model khá một chút thì máy gào lên như sắp cất cánh. Sang 2026 thì khác hẳn. Một model 27B chạy trên card 24GB đã gánh được phần lớn việc hằng ngày của dev mà chẳng tốn đồng API nào.
Khổ nỗi model ra nhiều quá. Qwen ra 3.5, rồi 3.6, rồi 3.8. Google chuyển Gemma 4 sang giấy phép Apache 2.0. Meta tung model agent chạy trên một GPU. NVIDIA, IBM, Cohere cũng nhảy vào góp vui. Nên câu mình bị hỏi nhiều nhất là: "máy em thế này thì chạy con nào hả anh?"
Bài này trả lời câu đó. Nhưng trước khi đưa danh sách, mình sẽ nói cách đọc thông số để bạn tự chọn được, vì kiểu gì tháng sau danh sách này cũng cũ.
Số liệu trong bài lấy từ thư viện Ollama và trang công bố của các hãng, tính tới tháng 10/2026. Dung lượng là kích thước file tải về (đã quantize), chưa tính bộ nhớ cho context.
# có nên chạy local không
Chạy local đáng nhất khi dữ liệu không được phép rời khỏi máy: code công ty, tài liệu nội bộ, thông tin khách hàng. Nó cũng đáng khi bạn có những việc lặp đi lặp lại với số lượng lớn như phân loại, tóm tắt, trích xuất dữ liệu, vì gọi API cho mấy việc đó thì tiền token cộng dồn nhanh lắm. Rồi những lúc ngồi trên máy bay, ở chỗ mạng chập chờn, hay làm trong môi trường không được ra Internet thì local là lựa chọn duy nhất. Còn nếu bạn muốn hiểu LLM chạy ra sao (xem bài How LLMs work và chuyện gì xảy ra khi bạn nhấn Enter) thì tự chạy một con là cách học nhanh nhất.
Ngược lại, đừng cố ép local khi việc cần làm thật sự khó, kiểu agent code chạy dài hơi hay suy luận nhiều bước. Model frontier trên cloud vẫn hơn rõ. Máy yếu (RAM 8GB, không có GPU) mà lại cần context dài và tốc độ cao thì cũng nên thôi. Và nếu cả team cần dùng chung thì dựng một server vLLM sẽ hợp lý hơn là để mỗi người ôm một model trên laptop.
Mình thì chia thế này: việc vặt và việc nhạy cảm cho local, việc khó cho cloud.
# đọc thông số trước khi tải
số tham số
"9B", "27B", "120B" là số lượng con số model học được, tính bằng tỷ (B là billion). Nhiều tham số thì thường giỏi hơn, nhưng cũng nặng hơn, chậm hơn.
dense hay MoE
Model dense cho mỗi token đi qua toàn bộ tham số, ví dụ Qwen3.8 27B, Gemma 4 31B. Model MoE (Mixture of Experts) thì chia thành nhiều nhóm "chuyên gia", mỗi token chỉ ghé vài nhóm. Gemma 4 26B chẳng hạn, mỗi token chỉ dùng khoảng 3.8B tham số. Nemotron 3.5 Lightning 30B thì chỉ 3B.
Với MoE, bộ nhớ cần để chứa tính theo tổng tham số, nhưng tốc độ chạy lại gần với số tham số active. Nên mấy máy nhiều RAM mà GPU không quá khoẻ, nhất là Mac, chạy MoE rất sướng.
quantization
Trọng số gốc lưu 16-bit, tức 2 byte mỗi tham số. Quantization nén xuống 8-bit, 4-bit, chịu mất một chút chất lượng để đổi lấy dung lượng nhỏ đi rất nhiều. Bản mặc định trên Ollama thường là 4-bit (kiểu Q4_K_M), mức cân bằng ổn cho đa số người dùng. gpt-oss thì phát hành sẵn ở dạng MXFP4, khoảng 4.25 bit mỗi tham số.
Với bản 4-bit, có thể ước lượng nhanh như sau:
Dung lượng ≈ số tham số (tỷ) × 0.6 GB
Bộ nhớ cần ≈ dung lượng file + 1–2 GB overhead + KV cache cho contextcontext window
Model ghi "256K context" nghĩa là nó có thể đọc tối đa 256 nghìn token. Nhưng mỗi token context lại ăn thêm bộ nhớ cho KV cache, context dài có khi ngốn thêm vài GB tới vài chục GB. Không cần thì đừng bật mức tối đa.
VRAM, RAM và Mac
Với GPU rời (NVIDIA, AMD), model nằm gọn trong VRAM thì chạy nhanh, tràn ra RAM hệ thống là chậm hẳn. Mac dòng M-series thì dùng unified memory, GPU xài chung RAM với CPU, nên một con Mac 32GB hay 64GB chạy được những model mà card rời 16GB chịu chết. Có điều macOS giữ lại một phần RAM cho hệ thống, nên nhớ tính dư ra vài GB. Còn máy chỉ có CPU thì vẫn chạy được model nhỏ (dưới khoảng 4B), chậm thôi.
giấy phép
"Open weights" không có nghĩa muốn làm gì thì làm. Đa số model trong bài dùng Apache 2.0, dùng thương mại thoải mái, nhưng định đưa vào sản phẩm thì vẫn nên đọc license cho chắc.
# chạy bằng gì
Dễ nhất là Ollama: một lệnh là chạy, lại có sẵn API tương thích OpenAI nên gọi từ code rất tiện. Ai thích bấm chuột thì có LM Studio, tìm model, tải về, chat, chỉnh tham số đều qua giao diện. llama.cpp là cái engine mà nhiều công cụ khác dùng bên dưới, hợp với ai muốn tự tay chỉnh từng cờ. Người dùng Mac muốn vắt kiệt tốc độ thì có MLX của Apple, và Ollama cũng có sẵn các bản -mlx. Còn nếu dựng server cho cả team thì dùng vLLM (mình có bài vLLM và PagedAttention).
Trong bài mình dùng Ollama cho gọn:
# macOS
brew install ollama
# Linux
curl -fsSL https://ollama.com/install.sh | sh
# chạy thử
ollama run qwen3.5:9b# máy nào chạy model nào
| bộ nhớ có thể dùng | gợi ý chính | lựa chọn khác |
|---|---|---|
| 8 GB (laptop thường, chỉ CPU) | qwen3.5:4b (3.3–4.0 GB) | qwen3.5:2b, gemma4:e2b |
| 16 GB (Mac 16GB, card 12–16GB) | qwen3.5:9b (6.6–7.6 GB) | gemma4:12b (~8 GB), gpt-oss:20b (14 GB) |
| 24 GB (RTX 3090/4090, Mac 32GB) | qwen3.8:27b (18 GB) | gemma4:26b (16–19 GB), muse-glimmer:30b (18 GB), gemma4:31b (19–20 GB) |
| 32–48 GB (card 32GB, Mac 48GB) | qwen3.6:35b (23–24 GB, MoE) | nemotron-3.5-lightning:30b (25 GB, context 1M) |
| 64 GB trở lên (Mac 64–128GB, nhiều GPU) | gpt-oss:120b (65 GB) | qwen3.5:122b (81 GB) |
Nhớ chừa chỗ cho context. Model 18GB trên card 24GB chỉ còn chừng 4–5GB cho KV cache và overhead, đủ cho context vừa phải chứ đừng mơ 256K.
# điểm mặt từng nhà
Qwen 3.5 / 3.6 / 3.8 của Alibaba
Bắt chọn đúng một họ model thì mình chọn Qwen. Đủ cỡ từ 0.8B tới 122B, giấy phép Apache 2.0, đa ngôn ngữ tốt (tiếng Việt ổn áp), lại có cả đọc ảnh, gọi tool và chế độ suy nghĩ (thinking).
Qwen3.5 có cả một dải kích cỡ: qwen3.5:0.8b, 2b, 4b, 9b, 27b, 35b, 122b, context 256K, nhận cả chữ lẫn ảnh. Bản 4b với 9b là lựa chọn ngon nhất cho máy yếu và máy tầm trung.
Qwen3.6 (qwen3.6:27b, qwen3.6:35b) thiên về agentic coding. Bản 35B là MoE, khoảng 35.5B tổng tham số, có thêm tính năng giữ lại phần suy luận của các lượt chat trước (thinking preservation), hợp làm trợ lý code nhiều bước.
Qwen3.8 (qwen3.8:27b) là bản mới nhất, dense 27B, mạnh về code, nghiên cứu và mấy việc agent dài hơi. Thinking bật sẵn và chỉnh được độ sâu. Có card 24GB thì đây là con mình thử đầu tiên.
ollama run qwen3.8:27bOllama cũng đã có bản xem trước qwen3.8-flash-next, được giới thiệu là kiến trúc nền cho Qwen4. Ai thích thử đồ mới thì để mắt.
Gemma 4 của Google
Gemma 4 ra mắt tháng 4/2026, và đây là lần đầu Google phát hành Gemma dưới giấy phép Apache 2.0 thay cho license riêng như trước, dùng thương mại thoải mái hơn hẳn.
| tag | kiểu | dung lượng | context |
|---|---|---|---|
gemma4:e2b | Edge, 2.3B tham số hiệu dụng | 4.6–7.5 GB | 128K |
gemma4:e4b | Edge, 4.5B tham số hiệu dụng | 6.6–9.5 GB | 128K |
gemma4:12b | Dense | 7.7–8.0 GB | 256K |
gemma4:26b | MoE, 25.2B tổng / 3.8B active | 16–19 GB | 256K |
gemma4:31b | Dense, 30.7B | 19–20 GB | 256K |
Bản nào cũng đọc được cả chữ lẫn ảnh. Đáng chú ý nhất là bản 26B MoE: chất lượng cỡ model 20–30B mà tốc độ gần model 4B, chạy trên Mac rất hợp. Hai bản e2b/e4b làm ra cho thiết bị biên như điện thoại, máy tính nhúng.
gpt-oss của OpenAI
OpenAI có hai model open-weight, giấy phép Apache 2.0, context 128K. gpt-oss:20b nặng 14GB, chạy được trên máy 16GB, suy luận và gọi tool khá chắc tay. gpt-oss:120b nặng 65GB, cần GPU 80GB hoặc Mac nhiều RAM.
Cái hay của gpt-oss là chỉnh được mức suy luận (low, medium, high): việc dễ để low cho nhanh, việc khó để high. Ra mắt từ 2025 nhưng tới giờ bản 20B vẫn là một trong những lựa chọn đáng tiền nhất ở phân khúc 16GB.
Muse Glimmer của Meta
Sau Llama 4, Meta gần như ngừng phát hành bản open-weight cho dòng Llama. Model mở mới của họ là Muse Glimmer: 30B tham số, Apache 2.0, context 128K, đọc được cả ảnh.
muse-glimmer:30b (18GB) được làm riêng cho agent chạy trên phần cứng phổ thông: gọi tool đúng schema, làm nhiều bước liền, tool báo lỗi thì tự xoay xở. Định dựng agent local để tự động hoá mấy việc lặp đi lặp lại thì nên thử con này song song với Qwen3.6.
Nemotron 3.5 Lightning của NVIDIA
nemotron-3.5-lightning:30b (25GB) là MoE 30B tổng, 3B active, context lên tới 1M token (bản MLX là 256K). NVIDIA nhắm tới agent chạy liên tục, cần throughput cao. Hợp với những việc phải nhồi cả núi tài liệu vào context, miễn là máy bạn đủ bộ nhớ cho KV cache.
vài cái tên khác
Granite 4.2 của IBM (granite4.2, các cỡ 3B, 8B, 30B) hướng tới doanh nghiệp, gọn nhẹ, hợp làm RAG và trích xuất dữ liệu có cấu trúc. Mistral Small 4 là MoE 119B tổng, khoảng 6.5B active, Apache 2.0, gộp suy luận, đọc ảnh và code vào một model. Tên "Small" vậy thôi chứ cần nhiều bộ nhớ lắm, hợp máy trạm hơn laptop. Còn nếu bạn làm trợ lý code trong IDE thì để ý thêm laguna-xs-2.1 (Poolside, MoE 33B / 3B active) và north-mini-code-1.0 (Cohere, MoE 30B / 3B active).
mấy "ông lớn" không dành cho máy nhà
DeepSeek V4, GLM-5.x của Z.ai, Kimi K3 của Moonshot đều công bố trọng số và nằm trong nhóm model mở mạnh nhất hiện nay. Có điều kích thước của chúng từ vài trăm tỷ tới hơn một nghìn tỷ tham số, muốn chạy thật phải có cả cụm GPU. Trên Ollama chúng chủ yếu xuất hiện dưới dạng tag cloud, tức chạy trên server của Ollama chứ không phải trên máy bạn. Biết để theo dõi thôi, còn chạy local thì thôi khỏi.
# cần làm gì thì chọn con nào
| việc | gợi ý |
|---|---|
| Chat thường ngày, tiếng Việt | qwen3.5:9b (16GB), qwen3.8:27b (24GB) |
| Trợ lý code, agent code | qwen3.6:35b, qwen3.8:27b, laguna-xs-2.1 |
| Agent gọi tool nhiều bước | muse-glimmer:30b, qwen3.6:35b, gpt-oss:20b |
| Suy luận, toán, logic | gpt-oss:20b (reasoning high), qwen3.8:27b (thinking) |
| Hiểu ảnh (OCR, đọc biểu đồ, screenshot) | gemma4:26b, qwen3.5:9b |
| Tài liệu rất dài | nemotron-3.5-lightning:30b (1M context) |
| RAG, trích xuất dữ liệu có cấu trúc | granite4.2, qwen3.5:4b |
| Máy yếu, chỉ CPU | qwen3.5:2b, qwen3.5:4b, gemma4:e2b |
Có điều đừng tin bảng xếp hạng của ai cả, bảng này cũng vậy. Cách chắc nhất là gom 5–10 câu hỏi thật trong công việc của bạn, chạy thử qua 2–3 model ứng viên rồi chọn con làm tốt nhất trên chính dữ liệu của mình.
# gọi model local từ code
Ollama có API tương thích OpenAI ở http://localhost:11434/v1, nên code đang dùng OpenAI SDK chỉ cần đổi base_url là chạy:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama") # api_key bất kỳ
resp = client.chat.completions.create(
model="qwen3.5:9b",
messages=[
{"role": "system", "content": "Bạn là senior Java developer, trả lời ngắn gọn."},
{"role": "user", "content": "Khi nào nên dùng ConcurrentHashMap thay cho HashMap?"},
],
temperature=0.3,
)
print(resp.choices[0].message.content)Spring AI, LangChain, LlamaIndex hay mấy extension trong IDE cũng trỏ được về Ollama theo cách tương tự. Ví dụ với Spring AI thì xem bài Spring AI 1.1.
chỉnh context window
Context mặc định của Ollama thường nhỏ hơn nhiều so với mức tối đa model hỗ trợ, và giá trị mặc định đổi theo từng phiên bản. Muốn đưa tài liệu dài vào thì tăng lên:
# tạm thời trong phiên chat
ollama run qwen3.5:9b
>>> /set parameter num_ctx 32768Hoặc tạo hẳn một model riêng bằng Modelfile:
FROM qwen3.5:9b
PARAMETER num_ctx 32768
PARAMETER temperature 0.3
SYSTEM "Bạn là trợ lý lập trình, trả lời bằng tiếng Việt."ollama create qwen-dev -f Modelfile
ollama run qwen-devđo tốc độ trên máy mình
ollama run qwen3.5:9b --verboseSau mỗi câu trả lời, Ollama in ra prompt eval rate (tốc độ đọc prompt) và eval rate (tốc độ sinh chữ, token/giây). Dưới khoảng 10 token/giây là bắt đầu thấy sốt ruột khi chat, trên 30 token/giây thì dùng thoải mái.
# mấy lỗi hay gặp
Máy mạnh mà model chạy rùa bò thì nhiều khả năng model bị tràn khỏi VRAM, một phần phải chạy trên CPU. Gõ ollama ps xem cột PROCESSOR, nó cho biết bao nhiêu phần trăm đang chạy trên GPU. Gặp vậy thì đổi bản nhỏ hơn hoặc giảm context.
Câu trả lời cụt ngủn hay model "quên" mất phần đầu tài liệu thường là do context quá nhỏ so với lượng nội dung đưa vào, phần đầu bị cắt bỏ. Tăng num_ctx lên là xong.
Model nói lan man, tự đóng vai người dùng thì hay là sai chat template, gặp nhiều nhất khi tự tải mấy file GGUF trôi nổi trên mạng. Cứ ưu tiên model chính thức trong thư viện Ollama.
Model "nghĩ" mãi không xong là do mấy model bật thinking sẵn sinh ra rất nhiều token suy luận. Việc đơn giản thì tắt thinking hoặc hạ mức suy luận xuống.
Còn laptop nóng ran, tụt pin vèo vèo thì là chuyện bình thường, LLM dùng GPU gần hết công suất mà. Việc vặt thì dùng model nhỏ thôi.
# bắt đầu từ đâu
Laptop 8GB thì thử qwen3.5:4b. Máy 16GB thì qwen3.5:9b, thêm gpt-oss:20b cho mấy việc cần suy luận. Có card 24GB hoặc Mac 32GB thì qwen3.8:27b và gemma4:26b. Mac 48GB trở lên thì qwen3.6:35b, từ 64GB có thể lên gpt-oss:120b. Muốn dựng agent local thì thử muse-glimmer:30b với qwen3.6:35b.
Cài Ollama, tải một con hợp với máy, rồi dùng nó cho công việc thật trong một tuần xem có bao nhiêu việc không cần tới API trả phí. Model mới thì tháng nào cũng có, nên đến lúc đó bạn cứ nhìn tổng tham số và tham số active, mức quantize, bộ nhớ cho context và giấy phép là tự đánh giá được.
Tài liệu tham khảo:
- Ollama model library
- Gemma 4: Byte for byte, the most capable open models (Google)
- Gemma 4: Expanding the Gemmaverse with Apache 2.0
- gpt-oss trên Ollama
- Mistral-Small-4-119B-2603 trên Hugging Face
- Ollama OpenAI compatibility
Chỉ là những ghi chép cá nhân với hy vọng mang lại chút giá trị. Nếu thấy hữu ích, đừng ngại chia sẻ cho bạn bè & đồng nghiệp nhé!
Happy coding 😎 👍🏻 🚀 🔥.
On this page
- # có nên chạy local không
- # đọc thông số trước khi tải
- số tham số
- dense hay MoE
- quantization
- context window
- VRAM, RAM và Mac
- giấy phép
- # chạy bằng gì
- # máy nào chạy model nào
- # điểm mặt từng nhà
- Qwen 3.5 / 3.6 / 3.8 của Alibaba
- Gemma 4 của Google
- gpt-oss của OpenAI
- Muse Glimmer của Meta
- Nemotron 3.5 Lightning của NVIDIA
- vài cái tên khác
- mấy "ông lớn" không dành cho máy nhà
- # cần làm gì thì chọn con nào
- # gọi model local từ code
- chỉnh context window
- đo tốc độ trên máy mình
- # mấy lỗi hay gặp
- # bắt đầu từ đâu