GPUFits

每十亿参数需要多少显存?(2026 速查表)

更新于 2026-08-04 · 核实于 2026-08-04

本地大模型领域最有用的一个数字就是每十亿参数的显存占用。记住下面这张表,任何模型的显存需求你都能心算出来。

速查表(仅权重,实测值)

量化档位每权重比特数每 1B 参数占用相对 FP16
FP1616.02.00 GB
Q8_08.51.06 GB−47%
Q6_K6.60.82 GB−59%
Q5_K_M5.70.71 GB−64%
Q4_K_M4.90.61 GB−69%
Q3_K_M4.00.50 GB−75%
Q2_K3.20.40 GB−80%

这些不是 llama.cpp 的理论比特率,而是从真实 GGUF 文件实测得出(Llama-3.1-8B,2026-08-04 验证)。实测值略高于理论值,因为嵌入表和元数据的压缩率更低;模型越大,差距越小。

完整公式

总显存 = 权重(上表 × 参数量)+ KV 缓存 + 运行时开销

  • KV 缓存:常见模型在 8K 上下文下约 0.5–4GB,随上下文长度线性增长。Qwen3-32B 从 8K 的 2.1GB 涨到 32K 的 8.6GB。
  • 运行时开销:约 1.5GB(CUDA 上下文等)。

完整算例(Q4_K_M,8K 上下文)

模型权重KV 缓存开销合计判定
Llama 3.1 8B4.9 GB1.1 GB1.5 GB7.5 GB12GB 显卡轻松
Qwen3 32B20.1 GB2.1 GB1.5 GB23.7 GB24GB 显卡勉强
Llama 3.3 70B43.2 GB2.7 GB1.5 GB47.4 GB需要 2×24GB
gpt-oss-120b(MoE)71.5 GB1.2 GB1.5 GB74.2 GB96GB Mac 或 4×24GB
DeepSeek-R1 671B410.7 GB0.6 GB¹1.5 GB412.8 GB只能用云端

¹ DeepSeek-R1 使用 MLA 注意力机制,KV 缓存被大幅压缩,详见我们的 KV 缓存指南。

心算口诀

经验法则:Q4_K_M 下 GB ≈ 0.6 × 参数十亿数。 8B → 约 5GB,30B → 约 18GB,70B → 约 43GB。8K 上下文再加约 2.5GB 的 KV 缓存与开销,上下文更长则再加。

MoE 模型(DeepSeek-R1、gpt-oss、Qwen3-A3B)仍需把全部参数装入显存,但生成速度取决于小得多的激活参数量。这就是为什么 gpt-oss-120b 需要 74GB 显存却跑得挺快。

常见问题

7B 或 8B 模型需要多少显存?

Q4_K_M 下权重约 4.9GB,8K 上下文的 KV 缓存约 1.1GB,再加约 1.5GB 运行时开销,合计约 7.5GB。任何 12GB 显卡都能轻松运行。

70B 模型需要多少显存?

Q4_K_M 下含 KV 缓存与开销合计约 43GB,单张消费级显卡放不下。两张 24GB 显卡(48GB)可以勉强运行,64GB 以上才算宽裕。

为什么速查表以 Q4_K_M 为默认档?

Q4_K_M 是社区标准:相比 FP16 省约 70% 显存,而在对话场景中大多数用户察觉不到质量损失。所有主流运行时(llama.cpp、Ollama、LM Studio)都把它作为默认下载档。

来源