指南
深度指南:每 B 参数显存速查、量化详解、各预算显卡推荐、Mac vs GPU、多卡方案等。
-
2026 年本地大模型显卡选购指南:全预算覆盖
2026 年本地 LLM 硬件选购:二手性价比之王 RTX 3090、新卡首选 RTX 5090、大显存方案 Mac Studio,以及哪些不要买。
核实于 2026-08-04
-
CPU 卸载:部分层放上显卡值得吗?
llama.cpp -ngl 详解:部分卸载对速度的影响(60–100 GB/s 内存墙)、什么时候是合理妥协,以及什么时候该直接换小模型。
核实于 2026-08-04
-
每十亿参数需要多少显存?(2026 速查表)
显存估算速查表:FP16、Q8、Q6、Q5、Q4、Q3、Q2 各量化档位下每十亿参数占用多少 GB,加上 KV 缓存与运行时开销,附完整算例。
核实于 2026-08-04
-
KV 缓存详解:长上下文为什么吃掉你的显存
KV 缓存是什么,精确公式(2 × 层数 × KV 头数 × 头维度 × 字节数 × token 数),为什么 128K 上下文可能比模型本身还贵,以及 MLA 和 q8 KV 如何改变算法。
核实于 2026-08-04
-
Mac 还是显卡?统一内存跑 LLM 全面解析
Apple Silicon 统一内存对比 NVIDIA 显存:真实带宽数据(273/546/819 GB/s)、75% 可用内存规则,以及谁该买哪种方案。
核实于 2026-08-04
-
多卡跑本地大模型:NVLink、PCIe 与层拆分详解
如何用多张显卡跑 70B+ 模型:张量并行 vs 层拆分、为什么推理不需要 NVLink,以及多卡速度的真实算法。
核实于 2026-08-04
-
量化详解:Q4 与 Q8 到底差多少?
GGUF 量化到底牺牲了什么:Q8_0、Q6_K、Q5_K_M、Q4_K_M、Q3、Q2 的实测文件体积、质量对比与适用场景,以及什么时候才该用 Q4 以下。
核实于 2026-08-04
-
本地运行 DeepSeek-R1:完整硬件指南
DeepSeek-R1 671B 在 Q4 下需要约 413GB——这里是所有现实路径:Mac Studio 的真相、8 卡主机、真正装得下的 R1 蒸馏版,以及什么时候该直接用 API。
核实于 2026-08-04