在家跑 GLM-5.2

GLM-5.2 是 744B 参数的 MoE 模型(40B active),1M context,Unsloth 做了动态量化 GGUF 让它在本地跑。2026 年 6 月这帖在 HN 上 347 分、150 条评论,评论里有人真跑起来了,配置和数字都在。

量化选哪档

Unsloth 的动态量化按层分配精度——重要层留高位、不重要层压低位。各档内存需求和精度:

量化 总内存 top-1 精度
1-bit (UD-IQ1_M) 223 GB ~76%
2-bit (UD-IQ2_M) 245 GB ~82%
4-bit (UD-Q4_K_XL) 290–360 GB 基本无损
5-bit (UD-Q5_K_XL) 372–475 GB 无损
8-bit 810 GB 无损

Unsloth 说 4-bit 和 5-bit "mostly lossless"。评论里有人直接说:编码任务至少 Q8 才有意义,2-bit 不够。所以——想体验就 Q2,想干活就 Q4 起步。

真实配置和速度

评论里三个真实跑通的案例:

512GB RAM + 双 3090,Q4_K_XL,6 tok/s。 用 llama.cpp 的 -cmoe 模式:attention/route tensor 留在 GPU 上,其余 offload 到系统内存。DDR4-2400 的带宽是瓶颈,换 DDR4-3200 能到 9 tok/s。这套配置实际花费接近 $10k——512GB 内存约 $5k,两块 3090 各约 $2k。

纯 CPU,Q6,1 tok/s。 AMD 9684X 跑 Q6,单路 1 tok/s,但能并行 16 路——每路也是 1 tok/s。适合批量跑不赶时间的活。

12GB VRAM 3060 + 大内存。 能跑,但评论者建议直接上双 3090——-cmoe 把 attention 放 GPU、其余 offload 到 CPU 内存,3060 的 12GB 勉强够 attention 层。

256GB 能启动 2-bit,但评论者普遍说不会有好体验。512GB 是现实最低线。

怎么跑

用 llama.cpp,关键参数:

llama-server \
  -m GLM-5.2-Q4_K_XL.gguf \
  -cmoe \                          # MoE offload:attention 留 GPU,其余放 CPU
  -ngl 99 \                        # GPU 层数
  -c 1048576 \                     # 最大 context(1M)
  --chat-template-kwargs '{"enable_thinking":true}'  # 开启思考模式

GLM-5.2 有三种思考模式:关闭、High、Max。复杂任务用 Max Thinking。推荐参数:temperature=1.0, top_p=0.95。关闭思考把 enable_thinking 设为 false,或者用 --reasoning off

一台 Mac 行不行

256GB 统一内存的 Mac(Mac Pro 或 Mac Studio Ultra)可以直接跑 2-bit(239GB 磁盘)。统一内存的好处是不用操心 GPU/CPU 分配,坏处是带宽不如多通道 DDR4+GPU 组合。评论里有人提到 AMD 即将出的 Medusa Halo 支持到 256GB 统一内存,"刚好够跑 2-bit 量化"。

成本账

本地跑的电费:满载 600W,一天 14 度电,$0.2/度 = 一年约 $1k。硬件是主要成本——$10k 起步的 512GB + 双 3090 方案,对比 GLM-5.2 的 API 价格(不到 Opus 的五分之一),纯算经济账不划算。但数据不出门这件事,对有些人无价。