LLM GPU Calculator

Tính xem GPU nào chạy được AI model bạn muốn dùng

llm-stats.com
💡
Bạn mới tìm hiểu? Đây là cách dùng tool này
1 Chọn model AI bạn muốn chạy (ví dụ: Qwen3 8B để chat, hoặc model OCR để đọc văn bản)
2 Chọn mức nén — nén càng nhiều thì cần ít bộ nhớ GPU hơn, nhưng chất lượng giảm nhẹ
3 Xem kết quả — tool sẽ cho biết GPU nào đủ mạnh và tốc độ sinh text ước tính
📖 Thuật ngữ cơ bản:
VRAM = Bộ nhớ của GPU (như RAM nhưng trên card đồ họa) Model = Bộ não AI, số B (tỷ) càng lớn thì càng thông minh nhưng cần nhiều VRAM Quantization (Nén) = Giảm dung lượng model để vừa GPU nhỏ hơn, đổi lại mất ít chất lượng Context = Độ dài văn bản model nhớ được cùng lúc (8K ≈ 6,000 từ) MoE = Model dùng "chuyên gia" — kích thước lớn nhưng chỉ dùng một phần khi chạy, nên nhanh hơn
🎯 Bạn muốn làm gì? Chọn bài toán để tự động tính tổng VRAM cần thiết
01 — Chọn model AI ?
02 — Mức nén (Quantization) ?
Mức nén Q4_K_M
Nén ít → chất lượng cao, cần nhiều bộ nhớ  |  Nén nhiều → tiết kiệm bộ nhớ, chất lượng giảm nhẹ
Chọn model để xem link GGUF trên HuggingFace
👈 Chọn một model AI ở bên trái để xem cần GPU gì