GPUFits

Mac 还是显卡?统一内存跑 LLM 全面解析

更新于 2026-08-04 · 核实于 2026-08-04

Apple Silicon 是本地 LLM 世界的异类:没有显存、没有 CUDA、听不到风扇声——却能装下需要四张 N 卡才能放下的模型。这是一篇诚实的对比。

统一内存改变了什么

PC 上,显卡有自己的显存(4090 是 24GB),CPU 有独立的内存。模型必须完整装进显存,否则就要承受 PCIe 来回拷贝层的惨重速度惩罚。

Apple Silicon 在芯片封装上放了一个 CPU 与 GPU 共享的内存池。96GB 的 Mac Studio 能把 74GB 的模型完整装下——没有任何消费级 N 卡能达到它的三分之一。代价是:这个共享池是 LPDDR5 而非 GDDR6X,带宽上限更低。

带宽天梯(均已核实)

芯片带宽最大内存8B Q4 大致速度
M4120 GB/s32GB约 15 tok/s
M4 Pro273 GB/s64GB约 40 tok/s
M4 Max(16 核)546 GB/s128GB约 80 tok/s
M3 Ultra819 GB/s96GB¹约 120 tok/s
RTX 4090(GDDR6X)1008 GB/s24GB约 150 tok/s
RTX 5090(GDDR7)1792 GB/s32GB约 265 tok/s

¹ 苹果 2026 年因 DRAM 缺货停产了 256GB/512GB 的 Mac Studio 配置;96GB 是当前上限,起售价从 3999 美元涨到 5299 美元。

75% 规则

macOS 不会把一切都交给 GPU。系统要保留内存,GPU 分配的实际天花板约为物理内存的 65–75%。我们的工具这样建模:

可用显存 = 物理内存 × 0.75 → 48GB 的 Mac mini 约 36GB 可用,96GB 的 Studio 约 72GB。

这就是为什么「96GB 的 Mac」实际装不下 96GB 的模型。

谁该买什么

买 Mac 的理由: 想要一台静音、省电、能装巨大模型(Q8 的 70B、gpt-oss-120b、低量化的 Qwen3-235B)的机器;看重 Ollama/LM Studio/MLX「开箱即用」;能接受 70B 模型约 10–15 tok/s 的速度——聊天够用,跑 Agent 难受。

买 NVIDIA 的理由: 每美元速度更重要;要用 CUDA 工具链(vLLM、训练、SD);或者你的模型本来就在 24–32GB 以内。一张 1000 美元的二手 3090,在 32B 以内模型的性价比上让苹果全系汗颜。

MLX 因素

苹果的 MLX 框架在同一台 Mac 上跑 LLM 推理通常比 llama.cpp 快 10–20%,且已成为多个 Mac 前端的默认后端。走 Mac 路线就优先选模型的 MLX 版本——注意 MLX 用自己的量化格式,不是 GGUF。

常见问题

Mac mini 跑 LLM 表现如何?

M4 Pro 版 Mac mini(48GB,273 GB/s)是台不错的静音小主机,Q4 下能跑 32B 以内的模型,8B 模型约 40 tok/s。基础款 M4(120 GB/s)跑 7B–8B 可以,更大的模型就力不从心了。

为什么 Mac 不能把全部内存分给 GPU?

macOS 把 GPU 显存分配上限限制在物理内存的约 65–75%(其余留给系统)。我们的工具按 0.75 的可用系数建模:48GB 的 Mac 约有 36GB 可用显存。

Mac Studio M3 Ultra 跑 LLM 比 RTX 4090 快吗?

速度上不行,容量上完胜。M3 Ultra 的 819 GB/s 低于 4090 的 1008 GB/s,单 token 生成更慢;但它 96GB 的容量能装下任何单张 24GB 显卡都放不下的模型(gpt-oss-120b、Q8 的 70B)。

来源