Phần 2 – Chọn máy để chạy Local AI: CPU, GPU, RAM và VRAM quan trọng thế nào?

cudem_HCM

New member

Phần 2 – Chọn máy để chạy Local AI: CPU, GPU, RAM và VRAM quan trọng thế nào?​

Sau khi hiểu Local AI là gì, câu hỏi tiếp theo thường là:

Máy của tôi có chạy được Local AI không?
Và nếu mua một máy mới:

Nên ưu tiên CPU, GPU, RAM hay VRAM?
Câu trả lời ngắn gọn là:

Đối với Local LLM, dung lượng bộ nhớ thường quan trọng không kém, thậm chí trong nhiều trường hợp còn quan trọng hơn sức mạnh tính toán thuần túy của GPU.


1. Trước tiên: bạn muốn chạy model cỡ nào?​

Local LLM thường được gọi theo số lượng parameter:

3B
7B
8B
14B
20B
32B
70B
120B
...
Trong đó:

B = billion parameters
Ví dụ:

8B ≈ 8 tỷ parameter
32B ≈ 32 tỷ parameter
70B ≈ 70 tỷ parameter
Model càng lớn thường càng cần nhiều bộ nhớ.

Tuy nhiên dung lượng thực tế còn phụ thuộc vào quantization:

FP16
Q8
Q6
Q5
Q4
Q3
Trong thế giới Local AI, Q4 và Q5 rất phổ biến vì cho tỷ lệ khá tốt giữa:

chất lượng / tốc độ / dung lượng bộ nhớ.


2. VRAM là gì và tại sao cực kỳ quan trọng?​

VRAM là bộ nhớ nằm trên GPU.

Ví dụ:

GPU 8 GB VRAM
GPU 12 GB VRAM
GPU 16 GB VRAM
GPU 24 GB VRAM
GPU 48 GB VRAM
Khi chạy Local LLM, lý tưởng nhất là:

Toàn bộ model
↓
nằm trong VRAM
Khi đó GPU có thể xử lý model mà không phải liên tục trao đổi dữ liệu với RAM hệ thống.

Nếu model lớn hơn VRAM:

Model
├── một phần → VRAM
└── một phần → RAM
hệ thống vẫn có thể chạy được với một số runtime, nhưng thường chậm hơn.

Đây gọi là CPU/GPU offloading hoặc chia model giữa CPU và GPU.


3. Vì sao GPU 24 GB đôi khi hữu ích hơn GPU mới nhưng chỉ có 12 GB?​

Giả sử:

GPU A
12 GB VRAM
rất nhanh
và:

GPU B
24 GB VRAM
chậm hơn
Nếu model cần khoảng 20 GB bộ nhớ, GPU A không thể chứa toàn bộ model.

GPU B lại có thể.

Do đó đối với Local AI:

Không nên chỉ nhìn benchmark gaming hay số CUDA core.
Phải nhìn thêm:

VRAM.

Đây cũng là lý do một số GPU workstation hoặc GPU thế hệ cũ có nhiều VRAM vẫn rất được người chơi Local AI quan tâm.


4. Bao nhiêu VRAM là hợp lý?​

Có thể chia tương đối như sau.

8 GB VRAM​

Phù hợp để bắt đầu.

Có thể chạy tốt các model nhỏ như:

3B
7B
8B quantized
Phù hợp:

  • chatbot
  • dịch
  • tóm tắt
  • AI assistant nhẹ
  • coding cơ bản.
Nhưng 8 GB sẽ nhanh chóng trở thành giới hạn nếu muốn thử model lớn.


12 GB VRAM​

Đây là mức khá dễ sử dụng.

Phù hợp:

7B
8B
12B
14B tùy quantization
Có thể làm:

  • coding
  • RAG
  • chatbot
  • tool calling
  • AI assistant.

16 GB VRAM​

Bắt đầu khá thoải mái.

Có thể chạy:

8B
14B
20B ở một số cấu hình
và có thêm không gian cho context.


24 GB VRAM​

Đây là một trong những mức rất hấp dẫn cho Local AI cá nhân.

Có thể chạy nhiều model:

8B
14B
20B
24B
32B Q4
Trong thực tế, 24 GB mở ra rất nhiều lựa chọn model mà GPU 8–12 GB không thể chứa hoàn toàn.


32–48 GB VRAM​

Bắt đầu bước sang workstation AI.

Phù hợp:

  • model lớn
  • context dài
  • nhiều request
  • VLM
  • RAG lớn
  • nhiều model cùng lúc.

80 GB VRAM trở lên​

Đây chủ yếu là vùng server/datacenter.

Phù hợp:

  • model rất lớn
  • nhiều user
  • batching
  • inference production.

5. RAM hệ thống có quan trọng không?​

Có. Rất quan trọng.

Nếu model không nằm hết trong GPU thì phần còn lại phải nằm trong RAM.

Ngoài model, hệ thống còn cần RAM cho:

  • hệ điều hành
  • ứng dụng
  • KV cache
  • embedding
  • vector database
  • document processing
  • browser
  • IDE
  • Docker.
Vì vậy Local AI thường hưởng lợi rất nhiều từ việc có RAM lớn.


6. 16 GB RAM​

16 GB vẫn có thể chơi Local AI.

Nhưng nên giới hạn ở:

3B
7B
8B nhỏ
Nếu vừa chạy:

LLM
+
Chrome
+
VS Code
+
Docker
thì 16 GB khá dễ đầy.

Do đó 16 GB phù hợp hơn với:

thử nghiệm Local AI.


7. 32 GB RAM​

Đây là mức tôi cho rằng hợp lý để bắt đầu sử dụng Local AI nghiêm túc.

Có thể thoải mái hơn với:

7B
8B
14B
và vẫn còn không gian cho:

  • IDE
  • browser
  • database
  • RAG
  • Docker.
Đối với PC dùng cả công việc và AI:

32 GB hiện là mức khá cân bằng.


8. 64 GB RAM​

64 GB mở ra nhiều khả năng hơn đáng kể.

Bạn có thể thử:

14B
20B
32B
70B quantized trong một số trường hợp
đặc biệt khi dùng llama.cpp và offload một phần model lên GPU.

64 GB cũng phù hợp với:

  • coding project lớn
  • RAG
  • database
  • Docker
  • AI server.

9. 128 GB RAM trở lên​

Đây bắt đầu là workstation Local AI thực sự.

Có thể phục vụ:

  • model 70B
  • MoE
  • context lớn
  • nhiều service AI
  • nhiều người dùng.
Nếu dùng CPU + GPU hybrid, RAM lớn có thể cho phép chạy những model vượt xa dung lượng VRAM của GPU.

Đổi lại tốc độ sẽ thấp hơn chạy hoàn toàn trên GPU.


10. CPU có quan trọng không?​

Có, nhưng nếu mục tiêu chính là LLM inference thì thường không phải thành phần đầu tiên nên dồn toàn bộ ngân sách.

CPU chịu trách nhiệm cho:

  • tokenization
  • model loading
  • một phần inference
  • preprocessing
  • embedding
  • RAG
  • database
  • application logic.
Nếu chạy model hoàn toàn bằng CPU thì:

memory bandwidth đặc biệt quan trọng.

CPU nhiều core cũng giúp, nhưng tăng core không đồng nghĩa tốc độ LLM sẽ tăng tuyến tính.


11. Có thể chạy AI hoàn toàn bằng CPU không?​

Có.

Các runtime như llama.cpp hỗ trợ inference trên CPU và cả mô hình kết hợp CPU + GPU.

Ví dụ:

32B Q4
│
├── 16 GB → GPU
│
└── phần còn lại → RAM
Nhờ vậy một máy không có GPU đủ lớn vẫn có thể chạy model.

Nhược điểm là:

token/giây thường thấp hơn đáng kể so với khi model nằm hoàn toàn trong GPU.


12. SSD quan trọng đến mức nào?​

Model AI chiếm rất nhiều dung lượng.

Một người chơi Local AI rất dễ có:

Model A 5 GB
Model B 10 GB
Model C 20 GB
Model D 40 GB
Embedding models
Vision models
Image models
Chỉ sau một thời gian:

200–500 GB
model là chuyện bình thường.

Do đó:

512 GB SSD​

Đủ thử nghiệm nhưng nhanh đầy.

1 TB​

Mức khá hợp lý.

2 TB​

Tốt cho người dùng AI thường xuyên.

4 TB+​

Hợp lý nếu lưu:

  • nhiều LLM
  • Stable Diffusion/Flux
  • dataset
  • video
  • embeddings.
NVMe SSD cũng giúp giảm thời gian load model.


13. NVIDIA hay AMD?​

NVIDIA​

Hiện vẫn là lựa chọn rất phổ biến trong hệ sinh thái AI vì CUDA có độ tương thích phần mềm rộng.

Nhiều framework AI ưu tiên NVIDIA trước.

Nếu mục tiêu là:

Local AI
+
Stable Diffusion
+
training
+
fine-tuning
+
CUDA applications
NVIDIA thường là lựa chọn dễ triển khai.


14. AMD có chạy được không?​

Có.

Hệ sinh thái Local AI ngày càng hỗ trợ AMD tốt hơn qua:

  • ROCm
  • Vulkan
  • llama.cpp.
Ollama 0.30 cũng mở rộng tăng tốc Vulkan mặc định cho nhiều GPU AMD và Intel.

Điểm cần kiểm tra trước khi mua là:

phần mềm bạn dự định sử dụng có hỗ trợ GPU cụ thể đó tốt hay không.


15. Apple Silicon thì sao?​

Apple Silicon có một lợi thế rất đặc biệt:

Unified Memory.

Thay vì:

CPU RAM
+
GPU VRAM
Mac sử dụng vùng bộ nhớ thống nhất giữa CPU và GPU.

Ví dụ:

64 GB Unified Memory
GPU có thể truy cập phần lớn vùng bộ nhớ chung này.

Điều này đặc biệt hữu ích cho model lớn.

LM Studio hiện hỗ trợ cả llama.cpp và MLX trên Apple Silicon.

Do đó Mac có:

64 GB
96 GB
128 GB
Unified Memory có thể chạy những model mà GPU PC 12–16 GB VRAM không thể chứa hoàn toàn.

Nhược điểm là NVIDIA vẫn có lợi thế mạnh về một số workload AI chuyên dụng, training và hệ sinh thái CUDA.


16. Context length cũng ăn bộ nhớ​

Một lỗi phổ biến là chỉ nhìn dung lượng file model.

Ví dụ:

Model = 20 GB
VRAM = 24 GB
không có nghĩa chắc chắn mọi workload đều vừa.

Khi context tăng:

8K
32K
64K
128K
KV cache cũng tăng theo.

Đặc biệt với coding agent đọc repository lớn, context dài có thể tiêu tốn thêm rất nhiều RAM/VRAM.

Ollama hiện cũng khuyến nghị context lớn cho các coding tool; tài liệu của họ đưa ví dụ một model chạy 64K context có thể cần khoảng 23 GB VRAM.


17. Cấu hình đề xuất theo nhu cầu​

Cấu hình A – Bắt đầu chơi Local AI​

CPU: Core i5 / Ryzen 5
RAM: 16–32 GB
GPU: 8 GB VRAM
SSD: 1 TB
Phù hợp:

  • học Local AI
  • 3B–8B
  • chat
  • coding nhẹ.

Cấu hình B – Developer Local AI​

CPU: Core i7 / Ryzen 7
RAM: 32–64 GB
GPU: 12–16 GB VRAM
SSD: 1–2 TB
Phù hợp:

  • AI coding
  • RAG
  • API local
  • agent
  • 7B–14B.

Cấu hình C – Local AI mạnh​

CPU: Core i9 / Ryzen 9
RAM: 64–128 GB
GPU: 24 GB VRAM
SSD: 2 TB+
Phù hợp:

  • 14B
  • 20B
  • 32B
  • coding agent
  • VLM
  • RAG lớn.
Đây là vùng cấu hình rất hấp dẫn đối với workstation AI cá nhân.


Cấu hình D – AI Workstation​

RAM: 128 GB+
GPU: 32–48 GB VRAM+
SSD: 4 TB+
hoặc:

Apple Silicon
64–128 GB+ Unified Memory
Phù hợp:

  • 32B
  • 70B
  • MoE
  • AI server
  • nhiều agent
  • nhiều user.

18. Quy tắc chọn máy đơn giản​

Nếu mục tiêu là Local LLM, có thể ưu tiên theo thứ tự:

1. Model muốn chạy
↓
2. VRAM / Unified Memory
↓
3. RAM
↓
4. Memory bandwidth
↓
5. GPU compute
↓
6. CPU
↓
7. SSD
Không phải lúc nào GPU benchmark cao nhất cũng là lựa chọn Local AI tốt nhất.

Ví dụ:

Một GPU có 24 GB VRAM đôi khi hữu ích hơn rất nhiều so với GPU mạnh hơn nhưng chỉ có 8 hoặc 12 GB VRAM.

Kết luận​

Khi xây máy Local AI, hãy bắt đầu từ câu hỏi:

Tôi muốn chạy model bao nhiêu B?
sau đó mới chọn phần cứng.

Có thể ghi nhớ ba mốc:

32 GB RAM + 8–12 GB VRAM
→ Local AI cơ bản

64 GB RAM + 16–24 GB VRAM
→ Local AI mạnh

128 GB RAM + 24–48 GB VRAM
→ AI Workstation
Và nếu hướng tới model lớn:

dung lượng bộ nhớ thường là yếu tố quyết định trước khi sức mạnh GPU trở thành vấn đề.
 
Back
Top