2026 年 6 月,有人在 HN 上问了句很多人都好奇的话:有没有人真的把 Claude/GPT 换成了本地模型做日常编程,不是玩票,是当主力?说说你的配置和性能。到 6 月 17 日,这帖攒了 1267 分、539 条回帖,里面藏着一份别处难找的东西——一群人用自己真实的机器、模型、踩过的坑,讲清楚了本地编程到底怎么上手。
先说结论里最该知道的两件事,免得你抱着错的期待入场。
第一,真有人干成了。 fortyseven 在一块 4090 上跑 Qwen 3.6 27B,包圆了自己所有的个人项目,"公司活才用 Claude,因为公司付钱、也要求我用"。horsawlarway 更彻底,直接退掉了每月 100 美元的 Claude 订阅,换成双 3090 跑本地模型。Greenpants 在 Mac Studio 上让本地模型从头重做了一个 Django + Wagtail 网站的首页和博客。这些不是实验,是日常在用的活。
第二,没人真的"全换"。 jwr 用顶配 M4 Max Mac 试了又试,话说得很重:"这些能在家跑的小模型,跟 Opus/Fable 那种庞然大物差得不是一点半点,我能看到很多人在自欺欺人。" mark_l_watson 也坦白,他很想说自己 100% 本地,但每周还得用 Opus 和 Gemini 三四个小时。
把这两件事摆在一起,本地编程真正的样子就清楚了:它不是用来"替代" Claude 的,是用来接管 Claude 那些活里你舍得交出去的部分。 想清楚这点,下面的每一步才有意义。
第一关:搞清楚它能干好什么,干不好什么
这是最该先想、却最多人跳过的一步。同样一个 Qwen 3.6 27B,jwr 说不值得浪费时间,K0balt 却说"灵的时候像 Sonnet,翻车的时候像 Haiku,整体挺有用"。两个人都没说谎——区别在于他们拿它干的活不一样。
sosodev 把这层窗户纸捅破了:"这个问题横跨了巨大的能力与预期光谱。你只能跑 8B 还指望它一把梭、vibe-code,那必然失望;但你能跑到 30B、任务定义得当,它们表现很好。"
照着回帖里的真实用法,能交给本地的活大致是这几类:
- 查东西、写样板、跑零碎。 SupLockDef 用一台老机器配 GTX 1070 跑 Qwen3-coder,"主要当 Google 用,忘了什么查一下,或者写 boilerplate",每月预算栏写着 $0.00。这类活不要求绝顶聪明,要的是随手、便宜、数据不出门。
- 拆好的、定义清楚的编码任务。 Greenpants 能用本地模型重做整个网站,靠的不是模型多强,是他的用法:"复杂任务我自己先拆解,不信任小模型替我拆。我会直说'我要功能 X,看文件 1、2、3 去改'。"
- 干不了的:独立啃复杂设计、端到端一把梭。 这是 jwr 划的红线,user43928 也验证过——他让 GPT 5.4 Mini 把 10-20 行代码搬到另一个文件,连试两次都改出 bug,第二次还信誓旦旦说"现在一样了"。这种活老实留给前沿模型。
一句话定预期:把本地模型当一个需要你盯着、需要你把活拆清楚的实习生用,而不是一个能甩手的资深工程师。
第二关:配一台跑得动的机器
预期摆正了,看你的机器够不够得着。回帖里跑出来的真实配置,分这么几档,对号入座。
Mac 或 AMD 的统一内存机器,是最省心的入门路。 Greenpants 的 Mac Studio 128GB、jwr 的 M4 Max,都能舒服跑 30B 级模型。好处是不用折腾装机,坏处 gigatexal 提醒了:"本地把我安静的 M3 Max 吵翻了。" horsawlarway 的建议中肯:苹果和 AMD 的统一内存机器,速度跟他的 3090 差不多,是当下进本地模型更好的入门选择。
双 3090 是性价比之王,但要肯折腾。 horsawlarway 给了最完整的样本:五年前装的机器里塞两块二手 3090(当时每块 850 美元,本来就要配游戏机),跑 Qwen3.6-35B-A3B 和 Gemma-4-26B-A4B,都能到约 150 tok/s,还塞得下完整的 300K 上下文。他特意点破一个误区:"第二块卡不会让推理变快,单块 3090 也是差不多的 tok/s,多一块只是能塞更大的上下文或更大的模型。"
从零开始攒,jborak 算过一笔值得抄的账。 他用 4 块 RTX 5070(每块约 600 美元)跑 Qwen3.6 27B,50-60 tok/s 做日常驱动。要凑 48GB 显存:2x 3090 要 3000 美元,单块 5090 要 4000 美元但只有 32GB;他已有两块 5070,再补两块只花 1200 美元。"从零开始的最佳性价比,是 5060 ti(16GB),每块 570 美元。"
别低于这条线。 zaptheimpaler 拿 16GB 显存 + 32GB 内存跑 Gemma-4-26B 整理邮件,"光找对工具就烧掉 24K token",体验很差。经验法则:认真做编码,24GB 显存或 64GB 以上统一内存是个体面门槛;显存/内存决定你能跑多大的模型,多卡主要是为了塞下更大的上下文,不是为了更快。
第三关:选模型,定量化
机器定了,选模型其实没那么多花样,回帖提名高度集中在两个家族。
Qwen3.6 是绝对主流,先在 27B dense 和 35B-A3B 之间选。 dense 版更聪明更可靠但慢,MoE 版(35B-A3B)因为只激活一部分参数所以快得多、但稍逊。horsawlarway 给了关键数据:同是 Gemma-4,31B dense 和 26B MoE 质量他觉得差不多,但 MoE 速度是 dense 的约 3 倍(150 vs 46 tok/s)。jborak 做编码后选了 27B dense:"虽然慢一些,但质量明显更好。" 要可靠选 dense,要速度选 MoE。
Gemma 4 是另一选择,尤其文档类、整理类的活。和 Qwen 换着用就行。
量化别贪低,这是最容易栽的坑。 K0balt 的铁律就一句:"不要跑低于 Q6 的量化,我个人偏好 Q8。" 量化压得越狠,工具调用和一致性越差——很多人跑 4bit 然后纳闷为啥这么笨,其实是自己把模型压傻了。宁可换个小一点的模型跑高量化,也别把大模型压到 4bit。
小模型(GPT 5.4 Mini、Kimi 2.6 这类)做编码就别指望了,前面 user43928 搬代码翻车的例子就是教训。
第四关:搭起来——harness 比你想的重要
模型选好只是一半,真正决定手感的是 harness(让模型干活的那层 agent 工具)。回帖里点名最多的是 Pi。horsawlarway 的评价很有代表性:"Pi 还行,开箱工具够用、不碍事。能用合理速度跑 30B 模型的话,大多数人会惊讶于它配 Pi 有多好用。"
不想换工具也行。K0balt 提醒了一个容易被忽略的点:"我用 Claude Code,它可以接任何你想要的模型。" 你熟悉的那套,多半就能接本地。
底下的推理引擎,主流是 llama.cpp(或图形界面的 LM Studio);Mac 上 shironnnn_ 推荐 llm-mlx,"渲染 token 比 llama.cpp 快 10-15%"。
想看一套完整的样板,porkloin 的配置可以整套照抄:AMD 7900 XTX(24GB)+ llama.cpp 的 vulkan 版(他实测比 ROCm 快),用 llama-swap 在单个端点上挂多个模型,用 Podman 把容器跑成系统服务,用 Open WebUI 做网页聊天入口,全套挂在 tailscale 上随处访问。
还有一步别省:沙箱。 Greenpants 把 Pi 跑在容器里、完全断网,确保代码一个字节都出不去机器——他在一个还没有明确 AI 规范的欧盟组织做事,靠这层隔离换来"绝不外泄"的踏实。本地跑 agent,让它动不了你硬盘上真正的文件,这点功夫值得花。
第五关:学会真正的用法——别让它单干
机器配好、模型跑起来,很多人就卡在"能跑但不好用"这一步。回帖里出现频率最高的破局办法只有一个核心:别让小模型一个人扛,让前沿模型给它当大脑。
K0balt 给了最清晰的描述:"让 SOTA 模型写一份开发计划,本质上是一堆 prompt,每步生成一部分,然后让本地模型照着执行,最后我还是喜欢留着 SOTA 模型做 review。" bijowo1676 和 shironnnn_ 用的是同一招的变体:用付费 Claude 或 SpecKit 写出高度具体的 markdown 规格,再丢给本地 Qwen/Gemma 实现——"markdown 比几百个源码文件更能压缩信息,更容易塞进上下文"。
mark_l_watson 把它做成了一套分层流水线,值得当模板:本地 → OpenCode 接 DeepSeek v4 flash → DeepSeek v4 Pro,活按难度往上递,"这样能慢慢把更多事挪到本地,又不耽误必须完成的工作"。
配套的手动功夫同样关键。Greenpants 的经验是 /new 用得最勤——简单任务不喂太多上下文,复杂任务自己先拆。这正好呼应第一关那句话:你把活拆得越细、规格写得越清楚,本地模型就干得越稳。
最后:算清账,知道什么时候别折腾
把这一关放最后,但它其实最该先在心里过一遍——你这点用量,到底值不值得本地化。
个人用,云端订阅常常更便宜。 mtone 用 2x RTX Pro 6000(硬件约 2 万美元)算过账,这套摊到单用户是每月 563 美元,对比 Claude Pro / GPT Plus 每月 20 美元,自建只在多用户分摊时才划算。bob1029 的教训更扎心:"两年前花 12000 美元装的机器在角落吃灰,又吵又热。按我现在的用量,要到 2030 年底才花得掉同样多的 token 钱。"
想低成本又不想养硬件,先走 API 试水。 kertoip_1 一句话点破:"把 OpenRouter 接到你的编码 agent 上自己试,所有相关的开源权重模型都在那,每个人需求和预期都不一样。" 这是花小钱把模型摸清楚的最理性路子——先确认它能干你的活,再决定要不要砸钱本地化。
那本地到底图什么? 不图"立刻比订阅便宜",图的是三件云端给不了的事:隐私(Greenpants:代码绝不离开机器)、不限量免费(SupLockDef:$0.00/月)、还有成本可控——Greenpants 说他偏好一次买断而非按月付费,"买断的设备不会某天突然涨价或被偷偷降级,只会越来越好"。
说到底,那个"换了吗"的问题,539 个人用自己的机器替你试出了答案:没人在"全换"和"不换"之间二选一,大家都在做混合——查询、样板、拆好的小任务现在就能舒服地交给本地,复杂设计和硬骨头老实留给前沿模型。想知道你自己那条线划在哪,照着上面这几关配一套、跑一遍,比看一百篇帖子都管用。
🔗 HN 讨论