用本地模型做日常编程

---
title: "用本地模型做日常编程"
source_url: "https://news.ycombinator.com/item?id=48542100"
published_at: "2026-06-16"
updated_at: "2026-06-17"
language: "zh"
---

# 用本地模型做日常编程

2026 年 6 月,有人在 HN 上问了句很多人都好奇的话:有没有人真的把 Claude/GPT 换成了本地模型做日常编程,不是玩票,是当主力?说说你的配置和性能。到 6 月 17 日,这帖攒了 1267 分、539 条回帖,里面藏着一份别处难找的东西——一群人用自己真实的机器、模型、踩过的坑,讲清楚了本地编程到底怎么上手。

先说结论里最该知道的两件事,免得你抱着错的期待入场。

第一,**真有人干成了。** fortyseven 在一块 4090 上跑 Qwen 3.6 27B,包圆了自己所有的个人项目,"公司活才用 Claude,因为公司付钱、也要求我用"。horsawlarway 更彻底,直接退掉了每月 100 美元的 Claude 订阅,换成双 3090 跑本地模型。Greenpants 在 Mac Studio 上让本地模型从头重做了一个 Django + Wagtail 网站的首页和博客。这些不是实验,是日常在用的活。

第二,**没人真的"全换"。** jwr 用顶配 M4 Max Mac 试了又试,话说得很重:"这些能在家跑的小模型,跟 Opus/Fable 那种庞然大物差得不是一点半点,我能看到很多人在自欺欺人。" mark_l_watson 也坦白,他很想说自己 100% 本地,但每周还得用 Opus 和 Gemini 三四个小时。

把这两件事摆在一起,本地编程真正的样子就清楚了:**它不是用来"替代" Claude 的,是用来接管 Claude 那些活里你舍得交出去的部分。** 想清楚这点,下面的每一步才有意义。

## 第一关:搞清楚它能干好什么,干不好什么

这是最该先想、却最多人跳过的一步。同样一个 Qwen 3.6 27B,jwr 说不值得浪费时间,K0balt 却说"灵的时候像 Sonnet,翻车的时候像 Haiku,整体挺有用"。两个人都没说谎——区别在于他们拿它干的活不一样。

sosodev 把这层窗户纸捅破了:"这个问题横跨了巨大的能力与预期光谱。你只能跑 8B 还指望它一把梭、vibe-code,那必然失望;但你能跑到 30B、任务定义得当,它们表现很好。"

照着回帖里的真实用法,能交给本地的活大致是这几类:

- **查东西、写样板、跑零碎。** SupLockDef 用一台老机器配 GTX 1070 跑 Qwen3-coder,"主要当 Google 用,忘了什么查一下,或者写 boilerplate",每月预算栏写着 $0.00。这类活不要求绝顶聪明,要的是随手、便宜、数据不出门。
- **拆好的、定义清楚的编码任务。** Greenpants 能用本地模型重做整个网站,靠的不是模型多强,是他的用法:"复杂任务我自己先拆解,不信任小模型替我拆。我会直说'我要功能 X,看文件 1、2、3 去改'。"
- **干不了的:独立啃复杂设计、端到端一把梭。** 这是 jwr 划的红线,user43928 也验证过——他让 GPT 5.4 Mini 把 10-20 行代码搬到另一个文件,连试两次都改出 bug,第二次还信誓旦旦说"现在一样了"。这种活老实留给前沿模型。

一句话定预期:**把本地模型当一个需要你盯着、需要你把活拆清楚的实习生用,而不是一个能甩手的资深工程师。**

## 第二关:配一台跑得动的机器

预期摆正了,看你的机器够不够得着。回帖里跑出来的真实配置,分这么几档,对号入座。

**Mac 或 AMD 的统一内存机器,是最省心的入门路。** Greenpants 的 Mac Studio 128GB、jwr 的 M4 Max,都能舒服跑 30B 级模型。好处是不用折腾装机,坏处 gigatexal 提醒了:"本地把我安静的 M3 Max 吵翻了。" horsawlarway 的建议中肯:苹果和 AMD 的统一内存机器,速度跟他的 3090 差不多,是当下进本地模型更好的入门选择。

**双 3090 是性价比之王,但要肯折腾。** horsawlarway 给了最完整的样本:五年前装的机器里塞两块二手 3090(当时每块 850 美元,本来就要配游戏机),跑 Qwen3.6-35B-A3B 和 Gemma-4-26B-A4B,都能到约 150 tok/s,还塞得下完整的 300K 上下文。他特意点破一个误区:"第二块卡不会让推理变快,单块 3090 也是差不多的 tok/s,多一块只是能塞更大的上下文或更大的模型。"

**从零开始攒,jborak 算过一笔值得抄的账。** 他用 4 块 RTX 5070(每块约 600 美元)跑 Qwen3.6 27B,50-60 tok/s 做日常驱动。要凑 48GB 显存:2x 3090 要 3000 美元,单块 5090 要 4000 美元但只有 32GB;他已有两块 5070,再补两块只花 1200 美元。"从零开始的最佳性价比,是 5060 ti(16GB),每块 570 美元。"

**别低于这条线。** zaptheimpaler 拿 16GB 显存 + 32GB 内存跑 Gemma-4-26B 整理邮件,"光找对工具就烧掉 24K token",体验很差。经验法则:**认真做编码,24GB 显存或 64GB 以上统一内存是个体面门槛;显存/内存决定你能跑多大的模型,多卡主要是为了塞下更大的上下文,不是为了更快。**

## 第三关:选模型,定量化

机器定了,选模型其实没那么多花样,回帖提名高度集中在两个家族。

**Qwen3.6 是绝对主流,先在 27B dense 和 35B-A3B 之间选。** dense 版更聪明更可靠但慢,MoE 版(35B-A3B)因为只激活一部分参数所以快得多、但稍逊。horsawlarway 给了关键数据:同是 Gemma-4,31B dense 和 26B MoE 质量他觉得差不多,但 MoE 速度是 dense 的约 3 倍(150 vs 46 tok/s)。jborak 做编码后选了 27B dense:"虽然慢一些,但质量明显更好。" 要可靠选 dense,要速度选 MoE。

**Gemma 4 是另一选择**,尤其文档类、整理类的活。和 Qwen 换着用就行。

**量化别贪低,这是最容易栽的坑。** K0balt 的铁律就一句:"不要跑低于 Q6 的量化,我个人偏好 Q8。" 量化压得越狠,工具调用和一致性越差——很多人跑 4bit 然后纳闷为啥这么笨,其实是自己把模型压傻了。宁可换个小一点的模型跑高量化,也别把大模型压到 4bit。

**小模型(GPT 5.4 Mini、Kimi 2.6 这类)做编码就别指望了**,前面 user43928 搬代码翻车的例子就是教训。

## 第四关:搭起来——harness 比你想的重要

模型选好只是一半,真正决定手感的是 harness(让模型干活的那层 agent 工具)。回帖里点名最多的是 **Pi**。horsawlarway 的评价很有代表性:"Pi 还行,开箱工具够用、不碍事。能用合理速度跑 30B 模型的话,大多数人会惊讶于它配 Pi 有多好用。"

不想换工具也行。K0balt 提醒了一个容易被忽略的点:"我用 Claude Code,它可以接任何你想要的模型。" 你熟悉的那套,多半就能接本地。

底下的推理引擎,主流是 **llama.cpp**(或图形界面的 LM Studio);Mac 上 shironnnn_ 推荐 llm-mlx,"渲染 token 比 llama.cpp 快 10-15%"。

想看一套完整的样板,porkloin 的配置可以整套照抄:AMD 7900 XTX(24GB)+ llama.cpp 的 vulkan 版(他实测比 ROCm 快),用 llama-swap 在单个端点上挂多个模型,用 Podman 把容器跑成系统服务,用 Open WebUI 做网页聊天入口,全套挂在 tailscale 上随处访问。

还有一步别省:**沙箱。** Greenpants 把 Pi 跑在容器里、完全断网,确保代码一个字节都出不去机器——他在一个还没有明确 AI 规范的欧盟组织做事,靠这层隔离换来"绝不外泄"的踏实。本地跑 agent,让它动不了你硬盘上真正的文件,这点功夫值得花。

## 第五关:学会真正的用法——别让它单干

机器配好、模型跑起来,很多人就卡在"能跑但不好用"这一步。回帖里出现频率最高的破局办法只有一个核心:**别让小模型一个人扛,让前沿模型给它当大脑。**

K0balt 给了最清晰的描述:"让 SOTA 模型写一份开发计划,本质上是一堆 prompt,每步生成一部分,然后让本地模型照着执行,最后我还是喜欢留着 SOTA 模型做 review。" bijowo1676 和 shironnnn_ 用的是同一招的变体:用付费 Claude 或 SpecKit 写出高度具体的 markdown 规格,再丢给本地 Qwen/Gemma 实现——"markdown 比几百个源码文件更能压缩信息,更容易塞进上下文"。

mark_l_watson 把它做成了一套分层流水线,值得当模板:**本地 → OpenCode 接 DeepSeek v4 flash → DeepSeek v4 Pro**,活按难度往上递,"这样能慢慢把更多事挪到本地,又不耽误必须完成的工作"。

配套的手动功夫同样关键。Greenpants 的经验是 `/new` 用得最勤——简单任务不喂太多上下文,复杂任务自己先拆。这正好呼应第一关那句话:你把活拆得越细、规格写得越清楚,本地模型就干得越稳。

## 最后:算清账,知道什么时候别折腾

把这一关放最后,但它其实最该先在心里过一遍——你这点用量,到底值不值得本地化。

**个人用,云端订阅常常更便宜。** mtone 用 2x RTX Pro 6000(硬件约 2 万美元)算过账,这套摊到单用户是每月 563 美元,对比 Claude Pro / GPT Plus 每月 20 美元,自建只在多用户分摊时才划算。bob1029 的教训更扎心:"两年前花 12000 美元装的机器在角落吃灰,又吵又热。按我现在的用量,要到 2030 年底才花得掉同样多的 token 钱。"

**想低成本又不想养硬件,先走 API 试水。** kertoip_1 一句话点破:"把 OpenRouter 接到你的编码 agent 上自己试,所有相关的开源权重模型都在那,每个人需求和预期都不一样。" 这是花小钱把模型摸清楚的最理性路子——先确认它能干你的活,再决定要不要砸钱本地化。

**那本地到底图什么?** 不图"立刻比订阅便宜",图的是三件云端给不了的事:隐私(Greenpants:代码绝不离开机器)、不限量免费(SupLockDef:$0.00/月)、还有成本可控——Greenpants 说他偏好一次买断而非按月付费,"买断的设备不会某天突然涨价或被偷偷降级,只会越来越好"。

说到底,那个"换了吗"的问题,539 个人用自己的机器替你试出了答案:没人在"全换"和"不换"之间二选一,大家都在做混合——查询、样板、拆好的小任务现在就能舒服地交给本地,复杂设计和硬骨头老实留给前沿模型。想知道你自己那条线划在哪,照着上面这几关配一套、跑一遍,比看一百篇帖子都管用。

🔗 [HN 讨论](https://news.ycombinator.com/item?id=48542100)