在家跑 GLM-5.2

---
title: "在家跑 GLM-5.2"
source_url: "https://news.ycombinator.com/item?id=48558041"
original_article: "https://unsloth.ai/docs/models/glm-5.2"
published_at: "2026-06-23"
updated_at: "2026-06-23"
language: "zh"
---

# 在家跑 GLM-5.2

GLM-5.2 是 744B 参数的 MoE 模型(40B active),1M context,Unsloth 做了动态量化 GGUF 让它在本地跑。2026 年 6 月这帖在 [HN](https://news.ycombinator.com/item?id=48558041) 上 347 分、150 条评论,评论里有人真跑起来了,配置和数字都在。

## 量化选哪档

Unsloth 的动态量化按层分配精度——重要层留高位、不重要层压低位。各档内存需求和精度:

| 量化 | 总内存 | top-1 精度 |
|------|--------|-----------|
| 1-bit (UD-IQ1_M) | 223 GB | ~76% |
| 2-bit (UD-IQ2_M) | 245 GB | ~82% |
| 4-bit (UD-Q4_K_XL) | 290–360 GB | 基本无损 |
| 5-bit (UD-Q5_K_XL) | 372–475 GB | 无损 |
| 8-bit | 810 GB | 无损 |

Unsloth 说 4-bit 和 5-bit "mostly lossless"。评论里有人直接说:编码任务至少 Q8 才有意义,2-bit 不够。所以——想体验就 Q2,想干活就 Q4 起步。

## 真实配置和速度

评论里三个真实跑通的案例:

**512GB RAM + 双 3090,Q4_K_XL,6 tok/s。** 用 llama.cpp 的 `-cmoe` 模式:attention/route tensor 留在 GPU 上,其余 offload 到系统内存。DDR4-2400 的带宽是瓶颈,换 DDR4-3200 能到 9 tok/s。这套配置实际花费接近 $10k——512GB 内存约 $5k,两块 3090 各约 $2k。

**纯 CPU,Q6,1 tok/s。** AMD 9684X 跑 Q6,单路 1 tok/s,但能并行 16 路——每路也是 1 tok/s。适合批量跑不赶时间的活。

**12GB VRAM 3060 + 大内存。** 能跑,但评论者建议直接上双 3090——`-cmoe` 把 attention 放 GPU、其余 offload 到 CPU 内存,3060 的 12GB 勉强够 attention 层。

256GB 能启动 2-bit,但评论者普遍说不会有好体验。512GB 是现实最低线。

## 怎么跑

用 llama.cpp,关键参数:

```bash
llama-server \
  -m GLM-5.2-Q4_K_XL.gguf \
  -cmoe \                          # MoE offload:attention 留 GPU,其余放 CPU
  -ngl 99 \                        # GPU 层数
  -c 1048576 \                     # 最大 context(1M)
  --chat-template-kwargs '{"enable_thinking":true}'  # 开启思考模式
```

GLM-5.2 有三种思考模式:关闭、High、Max。复杂任务用 Max Thinking。推荐参数:`temperature=1.0, top_p=0.95`。关闭思考把 `enable_thinking` 设为 `false`,或者用 `--reasoning off`。

## 一台 Mac 行不行

256GB 统一内存的 Mac(Mac Pro 或 Mac Studio Ultra)可以直接跑 2-bit(239GB 磁盘)。统一内存的好处是不用操心 GPU/CPU 分配,坏处是带宽不如多通道 DDR4+GPU 组合。评论里有人提到 AMD 即将出的 Medusa Halo 支持到 256GB 统一内存,"刚好够跑 2-bit 量化"。

## 成本账

本地跑的电费:满载 600W,一天 14 度电,$0.2/度 = 一年约 $1k。硬件是主要成本——$10k 起步的 512GB + 双 3090 方案,对比 GLM-5.2 的 API 价格(不到 Opus 的五分之一),纯算经济账不划算。但数据不出门这件事,对有些人无价。