No.01
git's –end-of-options Flag
Git 的 --end-of-options 标志:解决版本控制系统的参数注入漏洞
118 分
51 条评论
作者: Erenay09
作者发现了一个鲜为人知的 git 标志「--end-of-options」,该标志在 git 2.24.0(2019年11月)引入,原因是 git 早已将「--」用于分隔 revision 和 pathspec,导致传统的选项终止符被占用。当脚本执行「git log $rev」时,若 $rev 以短横线开头,git 会将其解析为选项而非 revision,这就是 CVE-2019-13139 等多个安全漏洞的根源。2017年8月同一天,git、Mercurial、Subversion、CVS 四个版本控制系统均因类似问题披露 CVE。作者调查了19个包管理器,其中17个默认 fork git 二进制文件,但只有 Go 的 cmd/go 使用了「--end-of-options」作为防护(2026年1月随 CVE-2025-68119 修复才加入)。其他包管理器的最小 git 版本要求(从 2.7.0 到 2.43.1 不等)也是限制该标志普及的原因。相比之下,libgit2、gitoxide、go-git 等库因在进程内实现 wire 协议而天然规避了 argv 注入风险。
No.02
Terence Tao's ChatGPT conversation about the Jacobian Conjecture counterexample
陶哲轩与ChatGPT对话:雅可比猜想反例的发现之旅
820 分
479 条评论
作者: gmays
著名数学家陶哲轩分享了他与ChatGPT讨论Jacobian Conjecture(雅可比猜想)反例的完整对话记录。这是一场真正的人机协作研究:陶哲轩通过精心设计的开放式问题(以「what」「why」开头)引导AI逐步深入,最终发现了一个结构精巧的多项式反例,AI甚至找出了「用正确方式书写映射后行列式恒等式便 embarrassingly simple」的优雅解释。评论焦点集中在:即使是顶级数学家,AI输出的篇幅也远大于人类输入;专家提问质量决定AI产出水平;这颠覆了「LLM无法真正思考」的旧有认知。有评论者指出这更像与「AI同事」协作而非使用聊天机器人,展示了未来人机协作研究的新范式。
No.03
Escape IntelliJ: Scala and Kotlin LSPs on Emacs Eglot
用 Emacs Eglot 替代 IntelliJ:Scala 和 Kotlin LSP 配置详解
20 分
0 条评论
作者: jjba23
文章讲述作者如何用 Emacs 29 内置的 Eglot(LSP 客户端)替代 IntelliJ IDEA 来开发 Scala 和 Kotlin。作者认为 IntelliJ 体积庞大、占用内存高(常超 8GB),而 Eglot 遵循 Unix 哲学,将编辑、编译、索引职责分离,通过 JSON-RPC 与专用语言服务器通信。核心优势包括:强大的可 hack 性(可随时用 Lisp 修补 bug)、统一操作界面(所有语言使用相同工具)、资源占用低。文中提供了详细配置,包括 Metals(JVM 参数调优、ZGC)、Kotlin(IntelliJ 语言服务器)、YAML schema 映射等,并附带了实际可用的配置代码仓库链接。
No.04
Quality non-fiction books are the antithesis of AI slop
优质非虚构图书:AI垃圾内容的反面,一位图书馆管理员用AI建了一个图书奖项搜索站
325 分
107 条评论
作者: benbreen
作者分享了自己大学做图书馆书架员的经历——在整理A至F区图书时随机翻阅,发现这种「经过筛选的随机漫步」比搜索引擎更能发现好书。如今图书馆日渐衰落,但他认为非虚构类图书正处在一个少有人关注的黄金时代。为此,他用Claude Code开发了一个「Book Prize Index」平台,汇集英语世界主要非虚构类图书奖项的入围和获奖作品(共约6500种),提供语义搜索功能。用户可用自然语言查询(如「奇怪但经典的传记」),也能按出版社、奖项、时代等维度筛选,还能可视化查看百年出版商的获奖表现排行。他强调AI仅用于数据收集和语义搜索,而语义搜索正是对研究者已有习惯的改进——让文本搜索更好用,而非替代阅读本身。
No.05
GigaToken: ~1000x faster Language model tokenization
GigaToken:比主流方案快约 1000 倍的大模型分词工具
475 分
94 条评论
作者: syrusakbary
GigaToken 是一个开源的大模型分词库,声称比 Hugging Face tokenizers 和 tiktoken 等主流方案快约 1000 倍。作者通过大量手工优化(未使用 AI 辅助)实现了这一突破,核心借鉴了 SimdJson 的思路,利用创意编程榨取 CPU 性能。评论中有人惊叹这一数字「令人难以置信」,也有人指出分词通常只占推理时间的 0.1%,质疑优化价值。作者回应称,在预训练数据处理、小型 SLM 路由决策、时间到首 token 敏感场景等情况下,分词速度非常重要;即使在兼容模式下也有 200-300 倍提升。项目采用 Rust 实现,代码质量获得社区认可,被比作「软件工程师最典型行为——为一个只占 0.1% 运行时的工作投入超额工程努力」。作者承诺将发布技术论文和演示视频。
No.06
Cruller: Bun's Zig Runtime, Continued on Zig 0.16
Cruller:将 Bun 的 Zig 运行时移植到 Zig 0.16
18 分
4 条评论
作者: Erenay09
Cruller 是 Bun 最后一个 Zig 版本的分叉项目,仅提取运行预构建生产 JavaScript 服务器所需的核心运行时组件,移植到原生 Zig 0.16。该项目保留了 JavaScriptCore 引擎、Bun.serve、HTTP/1-3、WebSockets、fetch、streams、Blob、Request/Response、静态文件服务和模块解析器等功能,同时移除了包管理器、 bundler、转译器、shell、测试运行器、N-API、SQL 客户端等开发工具。性能方面:Linux x64 下运行时体积 73.0 MiB(比官方 Bun 1.3.14 的 88.5 MiB 小约 18%),V8 Crypto 纯 JS 基准测试与官方版本基本持平。核心设计理念是将自己定位为专用运行时而非通用 Bun 替代品,不支持包安装、打包、TypeScript 转换等操作。AI 被用于辅助 Zig 0.16 迁移和调试,但项目架构决策仍由维护者主导。
No.07
Show HN: Bento - An entire PowerPoint in one HTML file (edit+view+data+collab)
展示:Bento — 一个 HTML 文件装下整个 PowerPoint(编辑+查看+数据+协作)
793 分
176 条评论
作者: starfallg
Bento 是一个将完整幻灯片演示功能集成在单个 HTML 文件中的开源项目,融合了编辑、查看、数据存储和实时协作能力。文件顶部是纯 JSON 格式的幻灯片数据,底部是渲染用的 JavaScript/CSS,核心采用简单 flexbox 结构,开发者认为 HTML/CSS 本质上比 JSON 更适合构建幻灯片。协作功能通过加密的 blind relay 实现,服务器端无法看到任何数据内容。项目使用 base64 压缩等客户端技巧,被归类为「单文件 Web 应用」(Single File Web Apps)概念。社区评价普遍积极,被视为对传统云端办公软件的轻量替代,但也有用户指出可访问性(无 alt 文本支持)、隐私(声称不联网但含 Cloudflare 洞察脚本)以及在 Firefox 上动画卡顿等问题。有人在问如何导出 PPTX,也有人建议加入 AI 生成和鼠标/触摸导航功能。
No.08
Everyone should know SIMD
每个开发者都该了解 SIMD
390 分
136 条评论
作者: WadeGrimridge
作者 Mitchell H 认为 SIMD(单指令多数据)常被过度神化,实际上每个开发者都应该掌握其基础。SIMD 并没有那么复杂,常见的「一次处理 N 个值」场景只需遵循五步模式:广播常量→逐向量块循环→并行操作→归约结果→处理标量尾部。作者以 Zig 为例展示了如何将一个逐字符扫描的 while 循环(遇到控制字符停下)转换为 SIMD 版本,实际可获得 ARM NEON 4 倍、AVX2 8 倍、AVX-512 16 倍的理论加速,真实场景约 5 倍。评论中有人指出编译器自动向量化已很强大,手写 SIMD 并非必须;也有声音强调数据布局和内存带宽才是更关键的瓶颈;还有人提及 Intel Skylake 时代 AVX 降频导致的副作用。
No.09
Are AI labs pelicanmaxxing?
AI实验室是否在「pelicanmaxxing」?一项1008张SVG的实验调查
500 分
195 条评论
作者: dcastm
Simon Willison 用「生成一只骑自行车的鹈鹕SVG」测试每一代LLM,这个非正式基准在AI社区极为知名,作者通过1008张SVG的实验检验AI实验室是否针对性优化该基准。实验用7种动物×6种交通工具×7个模型×3个样本,通过GPT-5.6 Luna评分和回归分析,结果显示:鹈鹕排名第6/8(画得比猫、鲸鱼、浣熊差),自行车排名倒数第2(画得比船、滑板车差),pelican-bicycle组合在48组合中排第42。没有发现任何实验室在该组合上有统计显著的提升。唯一信号是Gemini 3.5 Flash在自行车上有+0.27分(p=0.022),但21个测试预计1个假阳性,且不通过Bonferroni校正。结论:没有证据支持pelicanmaxxing假说,但作者承认置信区间宽约±0.6分。
No.10
Amiga 1000: Ten years ahead of its time
Amiga 1000:一款领先时代十年的电脑为何最终陨落
44 分
22 条评论
作者: giuliomagnifico
1985年7月23日Commodore推出Amiga 1000,其定制芯片支持4096色显示、立体声和图形界面,操作系统具备完整抢先式多任务能力,在仅有7.14MHz处理器和256KB内存下即可运行,相比之下苹果Mac和Lisa虽有GUI却无多任务、Windows 3.x仅支持协作式多任务。Amiga的体验远超时代——用户可以一边下载文件一边写文档甚至玩游戏。但其定价不菲:基础系统1295美元,加显示器和配置后约2000美元。作者1991年才购入Amiga,此后多年PC始终无法提供同等体验,直到1995年才逐步追平。文章批评Commodore高层Irving Gould只知掏空公司而非做好营销,指出「有好产品却无好营销」是Amiga最大悲剧,Commodore在发布Amiga不到9年后破产,令人惋惜。
No.11
Making ASCII Art in Vim
在 Vim 中制作 ASCII 艺术
56 分
4 条评论
作者: evakhoury
作者分享纯用 Vim 内置功能制作 ASCII 艺术的实用技巧。核心技巧包括:启用 virtualedit=all 让光标可移动到行尾之外的空白区域;使用可视块模式(Ctrl+v)配合 Shift+i 实现多行同时插入、r 键批量替换字符、1vP 实现覆盖粘贴;通过宏(q 录制、@ 回放)自动重复绘制复杂图案;以及开启鼠标支持(set mouse=a)和显示不可见字符(set list)提升绘图体验。文章强调无需插件、纯靠 Vim 内置功能即可高效创作 ASCII 艺术,并配有丰富示例演示各种操作手法。
No.12
So Reddit has decided that plain HTML is unsafe
Reddit 称纯 HTML 不安全:old.reddit.com 强制登录背后的真相
426 分
404 条评论
作者: montroser
Reddit 宣布将对 old.reddit.com 实施登录限制,声称是为了防止「恶意爬取和自动化流量」。作者通过技术对比发现:old.reddit.com 基于纯 HTML,无需 JavaScript 即可获取内容(加载约 1MB);而 new.reddit.com 需执行 JS 才能渲染,加载量是前者 5 倍。作者质疑:若真是安全考虑,new Reddit 为何无需登录?所谓「现代安全栈」不过是让爬虫更费力。作者认为真正原因是 LLM 时代用户生成内容是黄金,Reddit 不愿让他人轻易爬取数据。Reddit 与 OpenAI、Google 已有授权协议,此举意在垄断数据价值。评论中大量用户表示将离开 Reddit,指出 Reddit 内容质量早已下滑,社区氛围已死,old Reddit 是最后的使用动力。
No.13
Show HN: Cactus Hybrid: We taught Gemma 4 to know when it's wrong
Cactus Hybrid:教会 Gemma 4 感知自身错误
123 分
17 条评论
作者: HenryNdubuaku
Cactus Hybrid 团队宣布成功对 Google Gemma 4 进行后训练,使其具备「自我认知」能力——能够识别自身何时出错,而非仅在用户追问时才承认错误。核心机制是通过分析不同层的隐藏状态,提取模型在各类场景下的自我感知信号。系统为每个响应附带 0-1 的置信度评分,帮助下游应用判断何时切换至备用方案(如更大模型)。团队已在小规模模型上完成机理研究,发现隐藏状态确实承载有意义的自我认知信息。有评论者追问无限递归问题:模型能否判断「自己判断错误」这件事本身的对错?同时也有声音关切这是否会影响模型在其他任务上的表现质量。项目支持与本地大模型(如 Qwen-3.6-27B)配合使用,可作为子任务分发框架。详细技术报告将在解决遗留问题后发布。
No.14
Making
论制作:AI时代下亲手创造的意义与失落
339 分
135 条评论
作者: erikschoster
Beej(Beej's Guide作者,现OSU-Cascades讲师)分享了他对AI时代「制作」意义的思考。他从亲手制作中获得极大的满足感,包括木工、Rust Roguelike游戏、写科幻小说等。但当他让Claude生成代码或请人建deck时,他无法心安理得地说「这是我做的」——他更倾向于说「我让人帮我做了这个」。他认为发起项目但由他人完成,比起自己亲手做,成就感要低得多。他承认自己用Claude学了Google Sheet的CSV导出方式,但代码是自己写的,这让他能自豪地 putting his name on it。核心困惑在于:prompting算是「做」还是「问」?他坦承这个问题没有清晰答案,文章末尾邀请读者一起思考「制作vs询问被制作」的边界。
No.15
Medici family mystery may be solved after more than 400 years
美第奇家族400年死亡之谜:DNA研究证实质为疟疾非砒霜
109 分
29 条评论
作者: effects
1587年,佛罗伦萨统治者弗朗切斯科一世·德·美第奇与妻子比安卡·卡波洛在数日内相继死亡,死后400年来谋杀传言不断,矛头指向王位继承人——弗朗切斯科的弟弟费尔迪南多。2024年,耶鲁大学与比萨大学合作对美第奇家族遗骸进行DNA分析,在弗朗切斯科肋骨中首次发现两种疟原虫(恶性疟与四日疟)DNA,确认其死于疟疾。历史文献记载的症状(间歇性发热)与当时前往的皮斯托亚侯国沼泽地区均符合疟疾特征。但有学者坚持砒霜中毒说,引用皮肤病变等证据。研究团队表示DNA证据降低阴谋论空间,但无法完全排除双重死因。该发现同时填补了文艺复兴时期中意大利疟疾演化研究的历史空白。
No.16
The startup's Postgres survival guide
初创公司 Postgres 生存指南
392 分
185 条评论
作者: abelanger
这是 Hatchet 工程师基于两年实战经验编写的 Postgres 避坑指南,面向略懂 SQL 但非数据库专家的开发者。核心建议:始终使用 timestamptz 与自增主键;查询优化关键是避免全表扫描,善用 btree 索引与复合索引对齐 ORDER BY;事务要尽量简短,修改大表建索引必须用 CONCURRENTLY;连接池(pgbouncer)是必选项,可避免连接风暴与锁竞争。迁移应保持增量式,优先用 expand/contract 模式。
No.17
John C. Dvorak has died
科技评论先驱 John C. Dvorak 去世,享年 74 岁
721 分
230 条评论
作者: coleca
著名科技评论人 John C. Dvorak 近日去世,享年 74 岁。他是社会学家 August Dvorak(Dvorak 键盘发明者)的侄子,本人与键盘设计无关。Dvorak 自 1980 年代起活跃于科技媒体界,在 PC Magazine、InfoWorld、MacUser 等刊物撰写专栏,以尖锐敢言的评论风格著称,曾是 TWiT、No Agenda 等播客的常客。其评论涵盖 PC 行业发展、软件开发平台之争及互联网趋势,观点鲜明但不总是正确——他曾断言电子商务不会兴起、互联网用户期望免费等。他的离世让众多老读者感叹一个时代的终结。
No.18
Restructuring GitHub's bug bounty program
GitHub 重组漏洞赏金项目:推 VIP 分级制,公开项目赏金降幅显著
40 分
16 条评论
作者: soheilpro
GitHub 宣布重组其 bug bounty 项目,主要变化有三:一是推出永久 VIP 邀请制,资格门槛为至少 1 个 Critical、2 个 High、4 个 Medium 或 7 个 Low 漏洞,VIP 享更高赏金(Critical 最高 $30,000)及更快响应;二是公开项目改为固定赏金(Critical $10,000、High $2,000、Medium $500、Low $100),且引入 HackerOne Signal 门槛,未达标者最多只允许提交 4 份报告。官方称此举旨在过滤 AI 生成的低质量报告、减少团队审核开销。社区反应强烈:有评论指出同一漏洞由非 VIP 发现仅获 $10,000 而非 VIP 可获 $30,000,悬殊待遇有失公平;也有声音认为 Signal 要求合理但减薪并不能直接阻止 AI 批量生产报告;还有人推测这会促使研究员组队互助以冲击 VIP 资格。
No.19
ascdraw: Editor for ASCII/UTF-8 diagrams (in 144FPS)
ascdraw:ASCII/UTF-8 图表编辑器(144FPS)
40 分
4 条评论
作者: xlii
ascdraw 是一款面向技术文档的 ASCII/UTF-8 图表编辑工具,官方标称可达 144FPS 的流畅度。项目旨在提供轻量级的图表绘制体验,主要用途是技术文档中的示意图绘制,而非传统的 ASCII 艺术创作。评论社区对该工具的反应整体积极,多位用户认为它让人想起早期的 ASCII 艺术编辑器,但定位更偏向实用技术文档场景。有用户对标题强调「144FPS」这一性能指标表示疑惑,认为对于文档工具来说意义不大;也有声音建议作者在 README 中嵌入 GIF 演示,帮助潜在用户更直观地了解工具的实际使用效果。整体而言,社区认为这是一个有创意的个人项目,尤其适合作为无限画布式的想法草稿工具。
No.20
Malleable Computing, Emacs, and You
可塑性计算、Emacs 与你
98 分
29 条评论
作者: kickingvegas
作者 Charles Choi 讲述如何用 Emacs 实现 GitHub Issue 与 Org Agenda 的同步。他利用 gh CLI 处理认证、通过 Transient 和 vtable 构建交互界面、用 Pandoc 做 Markdown 与 Org 格式互转,整个包约 400 行 Elisp 代码,2.5 小时完成基础功能。作者借此探讨「可塑性计算」理念:动态语言允许在运行时原型设计、高层抽象减少代码量、消费者也能参与产品定义。文中还讨论了 90/90 法则、Pareto 原则、BIBO 稳定性等软件工程概念,以及「为 1 人还是 N 人构建」的权衡。
No.21
Why malloc always does more than I asked for?
malloc 为何总是分配比你请求的更多内存?
22 分
12 条评论
作者: nathaah3
本文以构建简易内存分配器为线索,揭示 malloc 底层机制的核心原理。作者先实现 bump allocator(仅推进指针,无 free 功能),随后逐步加入 Header 元数据(存储大小)、Back Pointer(解决变长对齐填充问题)和对齐机制。核心问题:malloc 返回的内存块实际包含四部分——Header、Back Pointer、Padding 和 User Memory。Padding 因对齐需求而生,大小随每次分配变化;由于 free() 仅接收指针无法知晓填充量,Back Pointer(固定位于 User Memory 前 sizeof(void*) 字节处)成为找到 Header 的唯一途径。这些元数据和数据块之间的空隙永远不会被使用,却在整个分配生命周期内被「占用」,即内部碎片化(Internal Fragmentation)。作者进一步引入 Free List 和块分裂(Splitting)机制使 bump allocator 真正支持 free()。评论焦点:动态 Padding 是否必要(固定 8 字节对齐是否更优)、Bump Allocator 的整数溢出漏洞、malloc 是否需要知道对齐需求、C23 的 free_sized 改进方向。
No.22
Fairphone 6 wide camera experimental Linux support
Fairphone 6 广角相机实验性 Linux 支持
109 分
21 条评论
作者: helonaut
作者尝试在 Fairphone 6 上为主线 Linux / postmarketOS 实现相机支持。该设备三摄中,只有 OmniVision OV13B10 广角镜头已有主线驱动,成为实验目标。文章详述了移植过程:在 qcom-camss 框架下新增 TFE665 ISP 驱动(基于已有 TFE530 改写)、CSID665 和 CSIPHY v2.2.1 支持,并在设备树中描述相机硬件。期间遇到两大坑:CAM_CC_SOC_AHB_CLK 时钟缺失导致寄存器读值为 0,以及 TFE665 的 RDI 总线宽度(128-bit)要求 packer 格式为 0x0 而非 TFE530 使用的 0xa。最终成功让 OV13B10 输出正常图像,足够用于 QR 扫描。社区评论还涉及 GrapheneOS 对 Fairphone 的安全评估(硬件不支持其所需的 MTE 等安全特性),以及文章风格是否由 AI 辅助写作。
No.23
Businesses with ugly AI menu redesigns
AI菜单丑设计:小企业用AI重塑菜单引发众怒
264 分
174 条评论
作者: speckx
作者走访一家菲律宾餐厅时发现其菜单已被AI重新设计,批评AI生成的菜品图「令人不安」且毫无美感。作为经常与奥斯汀小企业合作的人,作者指出这是「无知而非恶意」的选择。文章引发热议:支持者认为AI设计等同于「低质量廉价」的信号,会让顾客对食物预期-vs-现实产生落差;也有人反驳「食物好吃就行,菜单难看可以接受」。评论还提到AI菜单正在全球各地迅速蔓延、巴西外卖平台已泛滥成灾,但荷兰暂时幸免。
No.24
Nobody knows what a used GPU cluster is worth
二手GPU集群究竟值多少钱?无人能答
220 分
192 条评论
作者: rbanffy
文章探讨AI基础设施热潮中一个被忽视的核心问题: GPU集群作为债务抵押品的估值困境。xAI以Colossus 20万GPU集群向Morgan Stanley融资50亿美元,若违约则贷款方有权接管并出租该集群。但GPU集群价值高度依赖运营状态——故障率约9%/年、需专业团队维护、隐性故障可能导致模型权重悄然损坏——而这些信息对贷方完全不透明。相比飞机、船舶等成熟抵押品有数十年价格发现机制,GPU仅有2024年上线的租赁指数和一家GPU计算衍生品交易所,定价基础设施几乎为零。H100租赁价格从2024年初的8美元/小时暴跌至2025年10月的1.7美元,后因推理需求回升至2.35美元。CoreWeave的GPU抵押贷款溢价约8.5%,而飞机贷款仅1-2%。文章指出,六至七个百分点的高溢价本质是「在黑暗中承保」的风险补偿;若市场成熟、避险工具出现,资金成本将显著下降,届时能获取廉价债务的公司将获得竞争优势。
No.25
All 253 Patterns from Christopher Alexander's a Pattern Language Summarized
Christopher Alexander《建筑模式语言》253个模式完整摘要
67 分
12 条评论
作者: toomuchtodo
作者通读 Christopher Alexander 的建筑学巨著《A Pattern Language》(1100余页、253个模式),创建推特账号每日分享一个模式以深化学习,现将其汇总为一份完整列表方便查阅。253个模式按尺度分为多个层级:模式1-94为「城镇」篇,阐述如何通过零散的小规模个体行为逐步构建城市,使其融入更大的整体格局。核心思想涵盖:独立区域、社区自治(7000人社区)、城乡协调布局、职住混合分布、公共交通网络、四层限高、9%停车位上限、密度递减环、邻里边界、水体可达性、全生命周期人群混合等。Alexander 强调人的尺度、混合功能、local autonomy 和场所精神,认为高密度与自然接触可以兼得,Magic of the City 应触达每个人而非仅惠及富者。
No.26
Back to Kagi
离开后再回归:一名用户详述为何 Kagi 仍是最佳选择
256 分
192 条评论
作者: speckx
作者在试用数月其他搜索服务后,重新订阅了 Kagi。他在 2021 年成为 Kagi 用户,尝试过 SearxNG、DuckDuckGo、Brave Search、Qwant 等替代品后,认为没有哪个能比得上 Kagi 的搜索质量和相关性。Google 的问题在于 AI、视频和图片内容过多,无法专注用户真正需要的文本;SearxNG 则受困于搜索结果质量和频繁的速率限制。作者还提到怀念 Kagi 的 summarize、translate 功能以及 CSS 自定义能力。他表示自己已被「惯坏」,再也无法回到那些不重视隐私和结果质量的搜索引擎。
No.27
Any text-to-SQL benchmark should address difficulties of real-world data stores
文本转 SQL 基准测试应正视现实数据仓库的挑战
50 分
17 条评论
作者: shenli3514
文章指出当前文本转 SQL 基准测试未能反映真实数据环境的复杂性,测试结果与实际应用效果存在巨大鸿沟。评论揭示了几个核心问题:一、基准测试中纯 LLM 准确率为零,加上 RAG、提示工程和 agentic AI 也仅达 10% 出头,但业界实际应用效果远好于此;二、文本转 SQL 的问题框架本身可能有误——更合理的做法是让用户问业务问题,由 agent 自主完成数据探索而非直接生成 SQL;三、90% 的问题在于数据质量而非模型能力,建立清晰的「前厅」(frontroom)文档比优化模型更有效;四、基准测试极易被针对狭窄评分器过拟合,且单次查询是死路,需并行多假设生成的研究型 agent 才能奏效。社区还提及 Malloy 等专用工具以及自定义查询语言的价值。
No.28
Petals: Run LLMs at home, BitTorrent-style
Petals:像 BitTorrent 一样在家运行大模型
102 分
31 条评论
作者: snorbleck
Petals 是一个去中心化 LLM 推理项目,用户加载模型的一部分即可加入网络,为其他部分提供服务,支持 Llama 3.1(最高 405B)、Mixtral、Falcon、BLOOM 等大模型,单批推理速度最高 6 tokens/sec。该项目诞生于 2022 年 BigScience 研讨会,提供了比传统 API 更灵活的 PyTorch 级自定义能力。社区评论普遍认为这个方向有趣但为时过早:现代量化技术和消费级 GPU 优化已大幅提升本地运行效率,而节点间带宽延迟(尤其是美国普遍缺乏高带宽)是核心瓶颈。此外,去中心化架构面临 Sybil 攻击风险和隐私泄露担忧,评论者建议可参考 AI Horde 的部分防护机制。
No.29
Ghost Cut – Or why Cut and Paste is broken everywhere
「幽灵剪切」:复制粘贴为何在所有应用里都是坏的
156 分
104 条评论
作者: willm
作者指出当前文本编辑器的「剪切+粘贴」存在三个根本缺陷:其一,剪切无法完全撤销——Ctrl+Z 只恢复文档内容,但剪贴板已被覆盖;其二,剪切后文档会立即重排,用户必须重新定位粘贴位置;其三,剪切和粘贴作为两个独立操作,无法作为单一原子步骤撤销。为此作者在 Ishmael 编辑器中实现了「Ghost Cut」机制:按下 Ctrl+X 后文本变灰、变为不可编辑状态但仍保留在原位,此时剪贴板未变、没有写入历史;真正执行粘贴时才将幽灵文本移至光标处,从而实现真正的原子移动操作。作者认为这不需要改变肌肉记忆,且已有 Excel 等应用采用类似思路。社区反馈两极:有人认同这是真实痛点,赞赏创意;更多人认为剪贴板管理器(如 Paste、Ditto)已解决主要问题,拖拽本质上就是移动文本,且跨应用兼容性存疑。还有人担忧对辅助技术的影响,以及该方案会破坏标准行为。
No.30
Codeberg Bans Cryptocurrency Projects
Codeberg 通过社区投票禁止加密货币项目引发争议
262 分
364 条评论
作者: intunderflow
Codeberg 是一个非营利性开源 Git 托管平台,其社区近期通过投票决定将「加密货币相关项目」列为有损平台声誉的内容并予禁止。该决定引发了广泛争议,批评者认为:措辞模糊会导致 ZK 证明库、哈希算法、共识协议等合法技术项目被误伤;此先例可能导致平台进一步扩大禁止范围;加密货币也是制裁国家公民(包括 LGBTQ+ 群体)获取金融服务的工具,禁令会伤害弱势群体。支持者则称 Codeberg 并非中立平台,有权基于价值观做出选择此前 Sourcehut 已于 2022 年采取类似政策。部分用户已开始考虑迁移至其他平台。
评论精华