GPUFits

显卡库 / Mac Studio M5 Ultra (96GB)

Mac Studio M5 Ultra (96GB) 跑本地 LLM:能跑什么模型、速度多快

Mac Studio M5 Ultra 96GB 是 2026 年 8 月 25 日发布、9 月 22 日上市的苹果新旗舰:1.2TB/s 统一内存带宽——Apple 史上最高,比 M3 Ultra 高 50%,起售价 $5,499 只比调价后的 M3 Ultra 贵 $200。可用显存同样约 72GB:gpt-oss-120b Q4(约 73.6GB)仍差一口气、Q3_K_M(约 60GB)勉强、70B Q6_K(约 62GB)宽裕;但只要装得下,都快上一半——gpt-oss-120b 理论约 288 tok/s、稠密 70B 约 21 tok/s。

选型焦点在 96GB Ultra 与 128GB M5 Max(614GB/s)之间:模型工作集在 72GB 以内就选 Ultra 拿带宽,85-100GB 才考虑 128GB Max。256GB 版 Ultra(+约 $4,000)才是真正改变大模型格局的档位——Qwen3.8-Flash-Next Q4(约 112.6GB)宽裕、GLM-5.3-Flash 3-bit(约 129GB)宽裕;512GB 版 10 月下旬才发售。此外最多四台 Mac Studio 可经 Thunderbolt 5 池化内存。tdpW 为整机估算值。

规格

标称显存96 GB
可用显存(模型可用)72.0 GB
显存带宽1200 GB/s
类型统一内存
发布年份2026
MSRP$5,499
TDP140 W

Apple 统一内存按 75% 折算为模型可用显存(其余供系统/显示)。

性价比指标

每美元带宽
0.22 GB/s/$
每美元可用显存
0.013 GB/$

按 MSRP(暂无二手价) 计算;二手价为市场参考价【估】,波动见评述。

模型判定矩阵(Q4_K_M @8K)

模型 显存需求 判定 推荐量化 理论速度
Llama 3.2 3B 4.4 GB 宽裕 FP16 ≈140 tok/s 试算 →
Llama 3.1 8B 7.5 GB 宽裕 FP16 ≈56 tok/s 试算 →
Qwen3 8B 7.7 GB 宽裕 FP16 ≈55 tok/s 试算 →
Phi-4 14B 12.2 GB 宽裕 FP16 ≈31 tok/s 试算 →
Mistral Small 3.2 24B 17.5 GB 宽裕 FP16 ≈19 tok/s 试算 →
Gemma 3 27B 22.4 GB 宽裕 FP16 ≈16 tok/s 试算 →
Qwen3.8 27B 20.7 GB 宽裕 FP16 ≈16 tok/s 试算 →
Muse Glimmer 30B 20.1 GB 宽裕 FP16 ≈15 tok/s 试算 →
Qwen3 30B-A3B 21.0 GB 宽裕 FP16 ≈136 tok/s 试算 →
Qwen3 32B 23.7 GB 宽裕 FP16 ≈14 tok/s 试算 →
gpt-oss-20b 14.7 GB 宽裕 FP16 ≈125 tok/s 试算 →
Llama 3.3 70B 47.4 GB 宽裕 Q6_K ≈16 tok/s 试算 →
gpt-oss-120b 73.6 GB 需要多卡 Q3_K_M ≈353 tok/s 试算 →
Qwen3.8 Flash-Next 112.6 GB 本地不可行 需 2 张 — 试算 →
GLM-5.3-Flash 198.7 GB 本地不可行 需 3 张 — 试算 →
DeepSeek-R1 671B 413.1 GB 本地不可行 — — 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

Mac Studio M5 Ultra 96GB 能跑什么模型?
可用约 72GB,容量结论与 M3 Ultra 相同:gpt-oss-120b Q3_K_M(约 60GB)勉强、70B Q6_K(约 62GB)宽裕、其余全部宽裕;Q4 口径 gpt-oss-120b(73.6GB)差 1.6GB。差别全在速度:1.2TB/s 让能装下的模型都快约 50%。
96GB M5 Ultra 还是 128GB M5 Max?
目标模型在 72GB 可用以内:选 Ultra,1.2TB/s 对 614GB/s 接近翻倍;真实工作集在 85-100GB(如 80-90GB 模型文件):才选 128GB Max——带宽救不了装不下的权重。119GB 级 Q4 模型两者都不行,需 256GB Ultra。
比 M3 Ultra 贵 $200 值吗?
值。本地 LLM 生成是带宽瓶颈,1.2TB/s vs 819GB/s 直接转化为约 +50% tok/s;且 M5 Ultra 每 GPU 核带 Neural Accelerator,长 prompt 预处理更快。唯一选 M3 Ultra 的理由是二手/折价渠道明显便宜。

相关指南

在显卡兼容性查询工具中试算 Mac Studio M5 Ultra (96GB) →

数据核实于 2026-10-01