GPUFits

本地运行 DeepSeek-R1:完整硬件指南

更新于 2026-08-04 · 核实于 2026-08-04

DeepSeek-R1 是让所有人都想玩本地 AI 的模型——也是最不适合本地的模型。这里有完整的图景,包括 YouTube 视频不太强调的那些路径。

R1 为什么不一样

DeepSeek-R1 是 671B 混合专家模型,256 个路由专家中每个 token 只激活 37B 参数。两个推论:

  • 容量要求残酷:671B 参数必须全部加载。Q4_K_M 下权重约 411GB——好在 KV 缓存几乎为零。R1 使用 MLA(多头潜在注意力),8K 上下文下 KV 缓存只有约 0.6GB,而标准架构需要几十 GB。
  • 速度出人意料地可以:每个 token 只读取 37B 参数,R1 的生成速度相当于约 37B 的模型,而不是 671B——前提是你装得下它

现实路径

路径 1:别跑完整模型,用蒸馏版(95% 的人该选这条)

DeepSeek 发布了用 R1 推理轨迹微调的蒸馏版。R1-Distill-Qwen-32B 在 Q4_K_M 下需要约 24GB——一张二手 RTX 3090。它不是完整 R1,但复现了大部分推理风格,那些「我的 Mac 跑 R1」视频里跑的通常就是它。

路径 2:多卡主机(发烧友路径)

  • 算精确一点:Q4_K_M 总共需要 约 413GB。这是 14 张 3090,或者更现实的 6 张 A100 80GB / H100——坚定的数据中心领域。
  • Q2_K(约 215GB):8 张 3090(192GB)仍然不够,需要约 9–10 张卡或 3 张 A100 80GB。
  • 现实检验:这就是为什么基本上没有人在消费级硬件上自托管完整 R1。

路径 3:CPU/内存推理(耐心者路径)

一台 512GB–1TB DDR4/DDR5 的二手双路 Epyc 工作站能把 Q4 的 R1 完整装进系统内存。速度:状态好的时候 3–6 tok/s——适合批处理任务和「挂上跑一夜」的场景,不适合聊天。

路径 4:API(大多数人的理性路径)

DeepSeek 官方 API 已换代到 V4 系列(V4-Flash 每百万 token $0.14/$0.28,便宜得惊人)。第三方仍托管 R1 本体:Together AI $3.00/$7.00,DeepInfra 的 R1-0528 每百万 token $0.50/$2.15。除非你每月处理数十亿 token 或有硬性隐私要求,API 仅凭成本就赢了——见我们的成本计算器

如果你还是要跑

  1. unsloth 的动态量化 R1 开始——他们的 Q2_K_XL/Q3 混合方案让关键层保持更高精度,实测明显好于朴素 Q2。
  2. MLA 意味着长上下文很便宜——R1 的 128K 上下文几乎不增加显存占用。用起来。
  3. 预期放现实一点:即使 3 张 A100,生成速度也就在约 15 tok/s。

常见问题

Mac Studio 能跑 DeepSeek-R1 吗?

跑不了完整 671B——即使 Q2_K 也需要约 215GB,而苹果 2026 年已停产 256GB/512GB 配置,产品线封顶 96GB。Mac Studio 能轻松跑的是优秀的 R1-Distill-Qwen-32B,大多数「Mac 跑 R1」视频实际演示的都是它。

本地跑完整 DeepSeek-R1 最便宜的现实方案是什么?

Q4_K_M 下约 413GB 总量,需要 14 张 3090 或 6 张 A100 80GB 级别的数据中心硬件;或者用 512GB+ 内存的二手 Epyc 服务器跑 CPU 推理,速度 3–6 tok/s。两条都是严肃工程,不是消费决策。

R1 蒸馏版和 R1 是一回事吗?

不是——它们是用 R1 的推理输出微调的 Qwen/Llama 模型。R1-Distill-Qwen-32B 以二十分之一的体量复现了大部分推理风格,Q4 下单张 24GB 显卡就能跑。对大多数人来说它就是正确答案。

来源