本地模型上手指南:它能干什么,怎么开始

2026 年 6 月,Vicki Boykis 发了篇《Running local models is good now》,用一台 64GB 内存的 M2 Mac 跑 Gemma 4,说本地模型终于"好用"了。她很坦白地交代判断标准:没有科学证据,全凭一个私人指标——"我还用不用 API 模型去复查它"。底下有人给这套判断法起了个名字,叫 butt dyno(凭屁股感觉测马力)。

"好不好"这种主观判断没太多可争的。2026 年 6 月 17 日,这帖在 HN 上有 1258 分、494 条评论,真正有参考价值的也不是那句结论,而是评论区一群人凑出来的施工笔记:到底拿本地模型干哪些活、配什么机器、踩过哪些坑。下面把这些整理成一条上手路径——如果你也想试试,可以照着一步步走。

第一步:先想清楚要它干什么

别一上来就纠结"能不能替代 Claude",先看你要它干的是哪类活。这一步决定了后面所有选择。

轻活——几乎都能干,而且现在就够用。 很多人默认本地模型就是拿来写代码的,其实远不止。0xbadcafebee 提醒:哪怕 4B 以下的小模型,在本地能干的事也一长串——搜索、索引、摘要、排错、文档格式化、图像分析、转写、语音互转。这类活不要求绝顶聪明,要的是便宜、随手、数据不出门。

几个评论里的真实用法很有代表性:iagooar 拿一台 64GB 的 MacMini M4 常驻跑 Qwen3.6-35B,扫描、提取、分类邮件,顺便当私人助理("下一次星舰发射是什么时候");ngxson 那条 HN 评论本身就是用本地的 Qwen3.5-4B 帮着写的,浏览器插件把页面上下文喂进去,5 秒首字、100 tok/s。

编码——能干,但要拆细了喂。 Vicki 自己列的活其实很克制:把 notebook 重构成几个模块、补类型标注、写单测、校对文章。dejawu 给了个贴切的定位:他用 coding agent 像骑自行车——能让他走得更远更快,但去哪、怎么去、踩踏板还是他自己的事;在这种用法下"最新的本地模型就跟在家有个 Claude 一样好"。但别指望端到端:你越含糊它越翻车,你把规格拆得越细,它干得越稳。

一句话定预期:轻活直接上,编码要当成需要你管的实习生用。

第二步:配硬件

想清楚干什么,硬件档位就有了答案。下面这几档是评论区反复出现的真实配置,照着对号入座。

  • 16GB 笔记本(入门):monegator 在一台 16GB 的 12 代 i5 上跑,速度居然跟付费服务相当,但能用的模型被严格限制,且必须保证至少 16k 上下文——扔个小 C 文件分析,4k 上下文直接崩。能玩轻活,编码勉强。
  • 64GB 统一内存 Mac(甜区):Vicki 的起点。这一档能舒服跑 30B 量级的模型,还留得出内存干别的。simonw 点出这个甜区:MoE + 30B 参数跑起来占 20-30GB 内存,64GB 机器游刃有余。
  • 单卡工作站(~3k 美元):nullc 花 3k 买的单块工作站 GPU,Qwen3.6-27B 配 Q8 量化加 MTP 跑到 50 tok/s,35B-A3B 能到 100 tok/s——"比我见过的商用 SOTA 还快一些"。skittleson 用一块 3090ti 跑 35B-A3B,配 tailscale 让全家设备都能访问,附一句"那机器烫得很"。
  • AMD 双卡(性价比路线,~2600 美元):androiddrew 算过账,2600 刀买两块 AMD 9700(每卡 32GB、285 瓦),比一块 5090 又便宜又省电,打了 AITER 补丁的 vLLM 能让 Qwen3.6-27B FP8 跑 45-50 TPS。代价是 ROCm 这套不适合不愿意自己动手打补丁的人。

经验法则:内存/显存决定你能跑多大的模型,带宽决定它跑多快。 想认真用来编码,64GB 内存或 24GB 以上显存是个体面门槛。

第三步:选模型和量化

硬件定了,接下来是选模型。两个决定:dense 还是 MoE,量化到几 bit。

dense vs MoE。 iagooar 同时跑两种,讲得最清楚:27B 8bit(dense)更聪明更可靠但慢,35B 4bit(MoE)因为只激活一部分参数所以快得多、但稍逊一点。c0rruptbytes 补全另一半:dense(Qwen 27B、Gemma 31B)聪明但慢,MoE(Gemma 26B、Qwen 35B)快但更爱犯错。要可靠选 dense,要速度选 MoE。

当前值得跑的型号:Qwen3.6 系列(27B dense / 35B-A3B MoE)和 Gemma 4 是评论区提名最多的。

量化别贪低。 这是最容易踩的坑。c0rruptbytes 说得直接:量化会削弱工具调用能力,很多人跑 4bit 然后纳闷为啥这么烂——因为你基本上把模型"脑叶切除"了。他的建议:用 unsloth 的量化,MoE 用 6bit、dense 用 5bit,别为了省内存一律压到 4bit。

第四步:搭工具链(隐藏关卡)

模型选好只是一半。0xc0c0c0 这句被很多人忽略:harness 几乎和模型一样重要。 Codex 是为 GPT 调的、Claude Code 是为 Claude 调的,他换了好几个 harness 才找到一个能让小 Qwen 好好干本地编码的。xienze 补充:本地模型要你花时间调 harness、调 AGENTS.md、调 skills 才能到预期水平——但调好之后 Qwen3.6-27B 配上联网和一套好 skills"真的挺能打",而且你可以放开了用,不心疼 token。

一套本地流水线由三块组成:推理引擎(llama.cpp 或 LM Studio,负责把模型跑起来)+ agent harness(Pi、OpenCode 等,负责让模型干活)+ 模型文件本身

Vicki 的配置是个可直接照搬的完整样本:Pi 当 harness,LM Studio 当推理服务器,每个 Pi session 跑在 Docker 容器里、只给 bash 权限,不让它跑 Python、不让它联网。她改了 Pi 的 models.json 指向容器外的 LM Studio:

"lmstudio": {
  "baseUrl": "http://host.docker.internal:1234/v1",
  "api": "openai-completions",
  "apiKey": "not-needed",
  "models": [{ "id": "google/gemma-4-12b-qat", "input": ["text", "image"] }]
}

这么做的好处是 Pi 在容器里动不了你物理硬盘上的文件,删不了东西——本地跑 agent 时这层隔离值得花点功夫加上。

进阶打法:前沿规划 + 本地执行

如果本地模型独自挑大梁还是吃力,评论区有个反复出现的聪明用法:别让它单干。

gregwebs 给了最成型的方案:用最强的前沿模型做规划、第二个前沿模型审查计划,然后让较弱的本地模型去执行,最后前沿模型再做一次 code review。Claude Code 直接支持——把模型设成 opusplan,自动用强模型规划、弱模型实现。chrismarlow9 把原理说穿:你拆得越细、规格越具体,执行的本地模型可以越"笨";代价是烧更多 token,这是跑本地的时间换空间式权衡。robertkarl 甚至靠让一个 9B 的 Qwen 先规划、再交还给它跑干净的上下文,就把分数提了上去。

不过这套不是万能解。Tharre 泼了盆冷水:让强模型给 Qwen 写详细计划再实现,规划本身就吃不少 token,效果还不见得好——计划里总有微妙问题 Qwen 实现时认不出来。所以这套打法适合任务能清晰拆解的场景,别套到含糊需求上。

起步建议和心理预期

最后几条让你少走弯路的话。

先租后买。 andix 提醒了一个很多人忽略的事实:那些本地模型大多在 OpenRouter 之类平台上也有,便宜得很还更快,拿来试和对比正合适——别一上来就砸几千刀买硬件,先花小钱把模型摸清楚,确认它能干你的活,再决定要不要本地化。

算清楚账。 aliljet 把反方观点摆得最硬:$200/月你买的是被补贴过的最强访问,市面上没有模型能在这个价位竞争。本地硬件的真正价值在隐私、可控、不限量和长期成本,不在"立刻比订阅便宜"。

接受它会翻车。 jszymborski 描述过一个经典死循环:模型在 harness 里反复 ls 同一个文件夹、grep 同一个文件,把上下文吃光跳不出来。遇到这种别意外,本地小模型就是需要你盯着、需要你把活拆清楚。

说到底,本地模型"好不好用"没有统一答案——它取决于你那台机器、你手头那种活、你愿不愿意花心思伺候它。现在能干的事确实比半年前多了一大截,但具体对你够不够用,最靠谱的办法就是按上面这几步,自己上手跑一遍。

🔗 HN 原帖 · 文章原文