GPUFits

模型库 / GLM-5.3-Flash

GLM-5.3-Flash 显存需求与显卡搭配

GLM-5.3-Flash(智谱 Z.ai,2026 年 8 月 25 日发布,MIT 协议)是 9 月本地部署圈的黑马:321.3B 总参数、18B 激活的 MoE,45 层中 11 层为 DSA 稀疏注意力(走 MLA 压缩潜向量,512+64 维,与 DeepSeek 同构)、34 层为 KDA 线性注意力,原生 1M 上下文。9 月它登顶 OpenRouter 日榜,Unsloth 3-bit GGUF 与 Mac/DGX Spark 部署指南接连出现。Q4_K_M 权重约 196.8GB——和 DeepSeek-R1 一样,消费硬件无单卡解。

现实路径:Unsloth 3-bit 量化(约 129GB)需 256GB 的 M5 Ultra(宽裕)或 3×A100 80GB(Q4 勉强);否则走 Z.ai 官方 API。18B 激活意味着只要装得下就很快:M5 Ultra 1.2TB/s 理论约 82 tok/s。KV 缓存极小——真实只有 11 层持有 KV,8K 实测约 0.1GB,1M 全上下文也仅约 13GB;本站按 45 层保守估算,显示值约为实际的 4 倍。

架构规格

总参数321.3B
激活参数(MoE:显存按总参数装,速度按激活参数跑) 18B
层数45
KV 头数(MLA 压缩潜向量:KV = 层数 × (kvLoraRank + qkRopeHeadDim) × 字节数,不适用标准 GQA 公式) —
Head 维度—
原生上下文1024K
开源协议mit
每 token KV 字节数(fp16)50.6 KB

混合架构:45 层中仅 11 层为 MLA 稀疏注意力(DSA),34 层 KDA 线性注意力的 KV 不随上下文增长。上表 KV 列按 MLA 公式保守计算全部 45 层,实际 KV 约为显示值的 1/4。

量化档显存需求(@8K 上下文,fp16 KV)

量化档 权重 总需求(含 1.5GB 运行时开销)
Q8_0 341.8 GB 343.7 GB
Q6_K 263.9 GB 265.8 GB
Q4_K_M 196.8 GB 198.7 GB
Q3_K_M 160.7 GB 162.6 GB
Q2_K 127.3 GB 129.2 GB

KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。

显卡判定矩阵(Q4_K_M @8K)

显卡 可用显存 判定 推荐量化 理论速度
RTX 3060 12GB 12.0 GB 本地不可行 — — 试算 →
RTX 3090 24.0 GB 本地不可行 — — 试算 →
RTX 4070 Ti Super 16.0 GB 本地不可行 — — 试算 →
RTX 4090 24.0 GB 本地不可行 — — 试算 →
RTX 5090 32.0 GB 本地不可行 — — 试算 →
RTX A6000 48.0 GB 本地不可行 — — 试算 →
A100 80GB 80.0 GB 本地不可行 需 3 张 — 试算 →
H100 80GB 80.0 GB 本地不可行 需 3 张 — 试算 →
RX 7900 XTX 24.0 GB 本地不可行 — — 试算 →
Mac mini M4 Pro (48GB) 36.0 GB 本地不可行 — — 试算 →
Mac Studio M4 Max (64GB) 48.0 GB 本地不可行 — — 试算 →
Mac Studio M3 Ultra (96GB) 72.0 GB 本地不可行 需 3 张 — 试算 →
Mac Studio M5 Ultra (96GB) 72.0 GB 本地不可行 需 3 张 — 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

本地跑 GLM-5.3-Flash 到底要什么硬件?
Q4_K_M 总需求约 198.7GB:3×A100 80GB 勉强、2×A100 不够;256GB 的 M5 Ultra(可用约 192GB)在 Q4 差一口气、Q3_K_M(约 162.6GB)勉强、3-bit(约 129GB)宽裕。没有消费级单卡/双卡路径。
为什么本站显示的 KV 比实测大那么多?
它 45 层中只有 11 层 DSA 注意力按 MLA 持有 KV(每层 512+64 维),其余 34 层 KDA 线性注意力的 KV 不随上下文增长。本站 MLA 公式保守地按 45 层全算,高估约 4 倍——实际 8K KV 约 0.1GB 而非 0.4GB。
和 DeepSeek-R1 相比怎么选?
GLM-5.3-Flash 总参数不到 R1 一半(321B vs 671B)、激活 18B vs 37B,同为 MIT,还带 1M 原生上下文;同样无消费单卡解,但 3-bit 量化 + 256GB Mac 的路径比 R1 现实得多。要最强推理基准仍是 R1,要长上下文与可及性是 GLM-5.3-Flash。

相关指南

在显卡兼容性查询工具中试算 GLM-5.3-Flash →

数据核实于 2026-10-01