2026年06月20日 · 星期六 第 160028 期

The Hacker Daily

丙午年(马)五月初六

30 篇文章 · 2726 条评论 ·聚焦:AI模型效率与幻觉 · 供应链恶意软件 · 经典游戏开发
No.01 I Stored a Website in a Favicon
将网站存入 Favicon:一次像素级的数据边界探索
83 分 27 条评论 作者: theanonymousone
作者尝试将一个小型 HTML 网站编码进 favicon 图片的像素中。原理是利用隐写术,将 HTML 的 UTF-8 字节直接写入图片 RGB 通道。具体做法:HTML 经 TextEncoder 转字节,加 4 字节长度头,然后逐字节填充像素 RGB 值。最终 208 字节网页内容 + 4 字节头 = 212 字节,存于 9×9 像素(81 像素,容量 239 字节),使用率达 87%。解码需配套 JavaScript 引导程序在浏览器端读取像素重建网页。作者承认这不实用——数据量小、需 JS 引导、有大量更好方案——但核心是探索「任何东西都可以是存储」这一边界思维。评论还提到可用 PNG tEXt/zTXt/iTXt 注释块、ICO 多分辨率格式等替代方案,以及 favicon 缓存被建议用作指纹追踪的风险。

评论精华

  • SVG favicon 可直接存 markup 更实用,但作者想让人物「活在」实际像素数据中
  • PNG 本身支持 tEXt、zTXt、iTXt 注释块,可存更多内容且图片外观正常
  • 可利用 favicon 缓存跨域存储数据,曾被提议作为潜在指纹追踪风险
  • 同时有另一位开发者 1 小时前也发布了用 URL+favicon 存股票组合的项目
  • ICO 文件格式支持多分辨率图标,理论上可存储更多数据
No.02 Data Compression Explained (2012)
数据压缩原理解析
98 分 8 条评论 作者: mtdewcmu
Matt Mahoney 于 2012 年编写的数据压缩入门书籍,系统讲解了压缩技术的核心原理。内容涵盖无损压缩与有损压缩两大分支:前者如莫尔斯电码、Huffman 编码,可精确还原原始数据;后者如 1953 年 NTSC 彩色电视标准,基于人眼对亮度比色度更敏感的特性丢弃不重要信息。核心论点包括:一、所有压缩算法都包含模型(估计概率分布)与编码器两个部分;二、香农信息论通过计数法证明了压缩的硬性极限——大多数字符串无法被显著压缩,任意通用压缩器必然同时扩展某些输入;三、熵(entropy)是压缩的下界,实际压缩效果取决于模型质量;四、最优建模问题被证明是不可计算的。本书以 π 的数字序列为经典案例,说明若模型假设各数字均匀分布(概率 0.1),熵为 3.32 比特/字符,但若识别出这是 π 的数字,可用「计算 π 的程序」描述,大幅压缩。

评论精华

  • Fabrice Bellard 时代之前榜单已过时,神经网络建模在文本模式发现上表现更好
  • LLM 能否被视为从任意输入数据中找到通用压缩的 AI 系统?引发对压缩与智能关系的哲学思考
  • 有读者追问 AI 压缩的实际应用成果,质疑「压缩即预测」理论是否有落地案例
  • Matt Mahoney 是 Zpaq 压缩工具的作者,其作品兼具深度与可读性,广受好评
  • AI 压缩尚不实用——用几十 GB 的语言模型仅换来文本压缩几个百分点的提升,性价比极低
No.03 There are no instances in ATProto
ATProto 没有「实例」这个概念
425 分 219 条评论 作者: danabramov
本文用 RSS 博客生态的类比,解释 ATProto(Bluesky 底层协议)与 Mastodon 在去中心化架构上的根本差异。作者认为「实例」是 Mastodon 时代的概念——每个实例耦合了托管、应用、社区和审核策略,用户身份绑定于实例域名(user@instance)。而 ATProto 将托管(PDS 个人数据服务器)与聚合(AppView 应用视图)彻底分离:数据住在可交换的托管商处,任意应用可从全网聚合内容,身份通过 DID 独立于托管存在。ATProto 的去中心化体现在用户可自由切换托管商、自建或尝试新应用;而非像 Mastodon 那样通过计算实例数量来衡量。但评论指出批评:Bluesky 官方实际托管了绝大多数用户数据,真正独立的 AppView/Relay 极少,RSS 类比忽略了博客本身拥有独立网站而 ATProto 应用需自行过滤审核的差异;也有观点认为 ATProto 为一致性牺牲了 Mastodon 式的真正去中心化。

评论精华

  • ATProto 账户的 DID 指向单一 PDS,实际数据托管仍是单点,只是可迁移;Relay 和 AppView 的中心化程度才是真正的去中心化瓶颈
  • RSS 类比不准确:博客有独立域名和自有站,ATProto 应用是控制内容过滤的服务器,并非用户直接控制的来源
  • Bluesky 公司运行着主要 AppView 和大部分用户数据,这与「无实例」描述相矛盾,去中心化程度存疑
  • ATProto 为数据一致性牺牲了 Mastodon 式的真正去中心化;实例模式反而因隔离性更安全
  • 作者用 RSS+Google Reader 类比 ATProto,但忽略了 Relay/AppView 在图中的缺失,批评文章具有误导性
No.04 Where to Find the Colors Your Screen Can't Show You
屏幕无法显示的颜色该去哪里寻找
42 分 6 条评论 作者: moultano
文章探讨了屏幕无法呈现的颜色——尤其是青色与翠绿。人类眼睛有三种视锥细胞,屏幕通过RGB三原色混合来刺激这些细胞,但由于色度图边界的物理限制,大量绿、青、蓝色无法被合成:要呈现足够饱和的青色,理论上需要「负红色」,这在物理上不存在。受限于CRT时代的磷光体技术,sRGB色域仅覆盖了人眼可见范围的一小部分,当代的LED照明也存在同样缺陷——白光LED由蓝光+黄磷构成,青色恰好落在两者之间的间隙。要看到这些颜色,唯一的方法是走出户外。森林中的穿射光提供了答案:光线透过树叶时,短波长的蓝光被大量吸收,而长波长红光也被选择性地过滤,剩余的绿色会被逐层「提纯」至550nm左右,经过多层叶片后,这种绿已经超出sRGB色域,比任何屏幕能显示的绿都更加饱和。

评论精华

  • 文章使用色度图逐步展开叙述的方式令人赞叹,配图与文字配合巧妙
  • 能否用颜料、油墨或传统胶片来复制这些屏幕无法显示的颜色
  • 蓝光激光(430nm)是最贴近这类超饱和颜色的体验,难以用语言描述
  • 有人开玩笑说未来的VR眼镜应该直接向眼睛投射激光来呈现这些颜色
  • 红色盲或绿色盲人群恰恰是推动了交通信号灯采用特定绿色的原因——为了确保他们也能清晰辨认
No.05 The discovery that changed how scientists think about memory
神经科学家奥斯瓦尔德·斯图尔德因破译记忆的分子机制获2026年卡弗里奖
37 分 6 条评论 作者: rbanffy
2026年卡弗里神经科学奖授予奥斯瓦尔德·斯图尔德等四位科学家,表彰其发现神经元能在突触附近局部合成蛋白质。这一发现颠覆了此前科学界认为蛋白质仅在细胞体合成的认知,解释了大脑如何在特定突触上强化记忆、应对学习。斯图尔德四十年前通过电子显微镜观察到突触处核糖体聚集,意识到这可能是记忆存储的「缺失一环」。如今该机制被视为突触可塑性的基石,并启发了对脆性X染色体综合征、阿尔茨海默病等神经退行性疾病的研究。斯图尔德对AI能否真正替代科学家持怀疑态度,认为理解人脑仍将给人工智能带来更多启发,而非相反。

评论精华

  • 记忆可能并非仅存于大脑,扁虫断头后仍保留技能记忆,说明记忆分布可能更广泛
  • 局部蛋白合成是重要的生化学发现,但对于「信息如何转化为洞察」这一哲学问题仍无能为力
  • 对AI能否产生真正的原创性持强烈怀疑态度
  • 扁虫与软体动物(包括著名的头足类)在动物进化树上位于同一侧,它们拥有更分散的神经系统
  • 创造力本质或是随机想法生成器加上去芜存菁的过滤机制
No.06 Can you see three trees?
你能看见三棵树吗?
75 分 18 条评论 作者: Pamar
文章介绍了城市绿化的「3-30-300规则」:每户应能看到至少3棵树、社区30%树冠覆盖率、距公园300米以内。该标准由Cecil Konijnendijk提出,已被佛罗伦萨、福尔德柯林斯等城市采纳。一项覆盖862个欧洲城市的研究发现:仅约一半居民能满足「3棵树」标准;仅三分之一居住在30%树冠覆盖率区域;近60%在公园300米范围内;仅14%满足全部三项标准,21%一项都不达标。能满足全部标准的欧洲城市仅有芬兰Espoo和意大利Varese,全球8城研究中也只有新加坡通过。树冠覆盖率与气候区域高度相关,南欧表现最差。满足规则区域的居民心理健康更好、用药更少,研究者呼吁「掀掉沥青,种植树木」。

评论精华

  • 3-30-300规则与柯本气候带分布高度吻合,气候是影响城市绿化设计的关键因素
  • 伦敦市中心几乎看不到街边树木,狭窄街道缺乏植树空间
  • 阿姆斯特丹树木和植物无处不在,城市已停止修剪大部分绿化
  • Espoo(芬兰)与其他高达标率城市不同,没有汽车几乎无法出行
  • 满足3棵树标准不一定满足30%树冠覆盖率——树木可见性≠绿化覆盖面积
No.07 Surprising economics of load-balanced systems
负载均衡系统的令人惊讶的经济学
100 分 23 条评论 作者: KraftyOne
文章探讨了一个违反直觉的问题:当服务器数量 c 增加、负载同步线性增长时,客户端观察到的平均请求延迟如何变化?作者通过 M/M/c 队列模型和 Erlang's C 公式分析表明,平均延迟会快速下降并渐近趋近于 1 秒(即实际处理时间),而非保持不变或线性恶化。Monte Carlo 模拟验证了均值、中位数及高百分位延迟(p99、p99.9)都遵循这一趋势。这意味着更大的 c 带来双重好处:相同利用率下延迟更低,或相同延迟下利用率更高——这与大多数分布式系统的「规模越大问题越多」截然相反。评论焦点集中于模型假设的局限性:有读者指出独立事件假设在现实世界中常被打破(世界杯等活动导致突发流量);也有读者质疑无状态负载均衡器与文中有状态队列模型的差异;还有评论提到共享可变状态会削弱结论的适用性。

评论精华

  • 模型假设独立事件,但世界杯等活动导致流量突发,相关性会打破泊松假设
  • 实际负载均衡器多为无状态设计,与文中假设的有状态队列模型存在差异
  • 有读者指出共享可变状态时结论不再成立,文章假设过于理想化
  • Monte Carlo 模拟覆盖了 p50/p99/p99.9,高百分位延迟改善趋势一致,这是好消息
  • 有评论提到缺少有调优队列前置时的性能对比图表
No.08 Hyundai buys Boston Dynamics
现代汽车完成波士顿动力100%收购,进军人形机器人制造
786 分 348 条评论 作者: ck2
现代汽车集团以3.25亿美元收购软银在波士顿动力剩余的9.65%股份,实现100%控股。2021年现代以8.8亿美元收购80%股权,公司估值约11亿美元。波士顿动力先后被Alphabet、软银持有,机器人在YouTube走红多年却迟迟未能商业化。CES 2026上展示的电动Atlas人形机器人计划2028年在佐治亚州电动汽车工厂上岗,需达到99.9%可靠性才能真正实用。软银套现后转向Roze AI(估值1000亿美元),押注AI基础设施层。评论者看法分歧:有人认为通用人形并非最优选择,中国在工厂机器人密度上已领先;也有人看好现代作为第一个真正的客户能让波士顿动力真正实现产品化。

评论精华

  • 波士顿动力多年停留在演示阶段,从未真正实现产品化,这是CEO最失败的决策之一
  • 人形机器人并非最优方案,制造业空间早已为专用机械臂优化,通用人形是错误方向
  • 中国工厂机器人密度全球最高(每万人1220台),波士顿动力已明显落后于中国企业
  • 软银套现转向更大AI赌注,波士顿动力是产品公司,回报周期长,不符合孙正义的新战略
  • 现代拥有自家工厂作为客户,这是波士顿动力第一次有可能真正将机器人产品化
No.09 Norway imposes near ban on AI in elementary school
挪威对小学生近乎全面禁止AI工具
620 分 428 条评论 作者: ilreb
挪威政府宣布禁止小学1-7年级(6-13岁)学生使用生成式AI工具,初中生可在教师严格监督下谨慎使用。这是继2024年禁止智能手机后又一重大教育政策转向,旨在应对全国性学业成绩下滑。挪威教育部长强调「阅读、写作和数学是最重要的基础技能」,生成式AI无助于这些核心能力的培养。该国同时运营着Sikt AI监控平台,允许教师追踪AI使用情况,呈现出「既拥抱又限制」的双轨态度。社区争议集中在:AI如同计算器但更隐蔽,会让学生跳过思考过程产出看似完整的作业;以及教师自身使用AI生成作业和批改试卷的隐患。

评论精华

  • 多数HN用户支持禁令,认为AI让学生跳过思考过程,比计算器更隐蔽,会损害认知发育
  • 有人以计算器类比:不理解算术前不该用计算器;LLM版更危险在于产出看起来已经完成
  • 担忧教师滥用AI:生成批改错误的习题、生成质量低劣的教学材料
  • 部分用户认为禁令最终会像计算机时代一样被推翻,但目前缺乏适当的护栏和引导
  • 争议观点:AI公司高管自己限制孩子使用LLM;亚洲国家保持纸笔教学可完全规避AI依赖问题
No.10 How many of the 170k English words do you know?
展示: 你认识多少个英语词汇?(17万词库测试)
341 分 432 条评论 作者: abnry
一款词汇量测试应用展示,通过100道选择题(分Core Basics、Intermediate、Advanced、Expert、Grandmaster五级)推算用户认识的英语词汇总量。评论普遍反馈交互设计有问题:每题需多次点击(选答案、提交等),节奏被打断;且缺少「I don't know」选项,猜错也有1/4正确率。选择题设计有明显漏洞——正确选项通常是四个中最长最详细的,或呈现「正确含义+反义词+两个无关词」的固定模式,用户可据此猜答案。有用户指出非母语者若懂拉丁语族语言(如法语、意大利语)在高级词汇题有天然优势,评分可能被高估。社区建议改用Elo或Glicko 2等自适应评分系统,以及添加「不知道」按钮让估算更准确。

评论精华

  • 每题点击次数过多(选答案+提交),节奏被打断,应改为一次点击即确认并自动跳转
  • 选择题设计有规律:正确答案最长、最详细,或由「正确含义+反义词+两个无关词」组成
  • 缺少「I don't know」选项,猜错也有25%正确率,导致分数虚高
  • 罗曼语族母语者在高级词汇题有天然优势,分数可能被高估
  • 建议改用自适应难度算法(如Elo/Glicko 2),并添加「不知道」选项
No.11 Satellite reveals immense scale of GPS signal tampering
卫星首次从太空绘制 GPS 干扰图:欧洲至中东信号大幅衰减
58 分 12 条评论 作者: y1n0
Xona Space Systems 的实验卫星 Pulsar-0 首次从太空绘制了欧洲及中东地区的 GPS 信号干扰图。数据显示,信号干扰范围远超团队预期:在干扰最严重区域,GPS 信号强度从正常的 40 分贝骤降至仅 10 分贝。受影响区域从法国一直延伸至巴基斯坦边境。团队指出,传统 GNSS 卫星轨道高度超过 19,000 公里,信号脆弱易被压制。俄罗斯等国已使用地面干扰设备保护边境,每月影响数万航班;中东地区则利用干扰和欺骗技术反制无人机。Xona 计划建设 300 颗低轨卫星组成的导航星座,其信号强度将是 GPS 的 100 倍,可将现有干扰范围缩减至 5%。公司已于今年 3 月完成 1.7 亿美元 C 轮融资,计划 2027 年初开始提供基础服务。社区评论对文章客观性提出质疑,认为数据发布者同时是解决方案提供者,存在利益冲突。

评论精华

  • 评论者质疑数据真实性:Xona 正融资推广其解决方案,数据可能存在自证逻辑。
  • 有用户指出 GNSS 是被动接收系统,技术上不存在「美国间谍」说法。
  • 评论者认为干扰可能是对美国全球 GPS 监控的一种抵抗。
  • 有评论指出 Xona 的「更强信号」方案本质仍是相同技术,只是功率更大。
  • 提及 Veritasium 近期做过相关主题的视频节目。
No.12 Project Valhalla, Explained: How a Decade of Work Arrives in JDK 28
十年磨一剑:Project Valhalla 如何进入 JDK 28
586 分 360 条评论 作者: philonoist
Oracle 工程师确认 JEP 401(值类与对象)将于 JDK 28 集成到 OpenJDK 主仓库,这是 Java 史上最大的变更之一——PR 涉及 197,000 行代码、1,816 个文件。Valhalla 的核心理念是「codes like a class, works like an int」:让程序员写出行为如普通类、内部却像原始类型一样紧凑运行的类型。背景在于 Java 的引用模型导致内存布局松散(指针跳跃、缓存不友好),而 escape analysis 优化又不可预测;Valhalla 通过让值类「放弃身份(identity)」实现密度存储,数组中的值不再是指针而是一段连续数据。该项目始于 2014 年,历经五个原型,经历了「Q World」(类型系统分离)的失败,最终由「L World」(值类型共享 L descriptor)走向成功。但 Brian Goetz 泼冷水:这是预览功能且「仅是 Valhalla 的第一部分」,真正的扁平 ArrayList 等尚未到来,社区的嘲讽也如期切换到「但最关键的部分没发货」。

评论精华

  • 值类型本质上借鉴了 C# struct、C++ struct 的思路,让数据放弃身份、实现值语义
  • 实现细节仍有疑问:超过 64 位的值类型是否回退堆分配?原子性写入如何保证?
  • 兼容性风险:参数化函数若类型擦除到 Object,值类型的分发逻辑可能出错
  • 批评者认为 Java「一切皆引用」是设计缺陷,C++/Rust 早已有解决方案
  • 社区分裂:有工程师欣赏十年磨一剑的严谨,也有用户抱怨进度缓慢、功能不完整
No.13 Bobby Prince, composer for Doom, Wolfenstein 3D, and Duke Nukem 3D, has died
Bobby Prince 去世:Doom、Wolfenstein 3D 与 Duke Nukem 3D 的传奇配乐师
341 分 38 条评论 作者: pgrote
Bobby Prince(罗伯特·博比·普林斯)于近日去世,他是 id Software 经典游戏 Doom、Wolfenstein 3D 以及 Duke Nukem 3D 的配乐与音效设计师。社区反响热烈,众多玩家与开发者纷纷悼念这位「传奇」。Bobby Prince 为 Doom 创作的标志性曲目如 At Doom's Gate、E1M8 (Sign of Evil) 等影响深远,其作品融合了速度金属与激流金属风格,至今仍被广泛引用。有评论指出,Bobby Prince 不仅负责配乐,还包揽了 Doom 的全部音效设计,其 MIDI 格式文件在当时的声卡(如 Sound Blaster OPL3)上表现极为出色。值得注意的是,美国国会图书馆已于上月将 Doom 配乐纳入国家录音登记处(NLR),肯定了其文化价值。Bobby Prince 的离去被视作游戏音乐史上的重大损失。

评论精华

  • Bobby Prince 的音乐是 Doom 沉浸式体验的核心,《At Doom's Gate》等曲目已成为游戏音乐史上不朽的 iconic 作品
  • 他不仅创作配乐,还负责 Doom 全部音效设计,Sound Blaster 声卡是其音乐的最佳播放载体
  • 美国国会图书馆已将 Doom 配乐收录进国家录音登记处,彰显其作为文化遗产的地位
  • Bobby Prince 作品的金属风格影响深远,E1M8 (Sign of Evil) 被誉为经典金属曲目
  • Doom 1 demo 主题曲实为 Judas Priest 的《Painkiller》,Bobby Prince 在此基础上进行了改编创作
No.14 A Perceptron in Age of Empires II
在帝国时代2中构建感知机:基于游戏的逻辑门电路实现
66 分 29 条评论 作者: EvgeniyZh
作者在《帝国时代2》场景编辑器中用游戏机制实现了完整的逻辑门电路系统。核心是用草地代表0、桥梁代表1、山羊作为信号携带者,通过「门就绪」冰轨避免竞态条件。依次构建了NAND门、XNOR门、AND门、OR门和NOT门,最终组合成一个可运行的一比特感知机,包含两个XNOR做内积、一个AND做阈值判断,展示了前向传播。该实现基于论文《If LLMs Have Human-Like Attributes, Then So Does Age of Empires II》中的思想实验,即LLM的「类人属性」与在帝国2中构建相同电路并无本质区别。评论区对论文的哲学论证褒贬不一:有观点认为论文不过是重炒「中文房间论证」,且预设了人类独特性的未验证假设;也有人认为这本质上是 satire,论文的真正价值在于其实践演示而非哲学论点。

评论精华

  • 评论者认为论文哲学论证傲慢且缺乏新意,不过是重炒「中文房间论证」,且预设了人类完全独特这一站不住脚的结论
  • 有评论指出论文论证的核心 satire 意味,以及其中关于「类人属性」问题的循环假设困境
  • 部分 HN 用户指出论文的真正价值在于用帝国2实践演示了计算等价性,而非其哲学主张
  • 技术层面,有人提到帝国2最新决定版支持 XS 脚本语言,可用代码编程实现逻辑电路
  • 相关讨论延伸至《Creatures》等早期游戏已内置神经网络的案例,说明这并非新鲜事
No.15 Soccer Arcade Games Through the Years
历年足球街机游戏发展简史
6 分 0 条评论 作者: speckx
2026年世界杯举办之际,本文回顾了足球题材街机游戏的发展历程。作者曾在巴西生活,目睹了2002年巴西夺冠的狂热庆典。游戏发展可分为几个阶段:视频游戏出现前,以弹珠台和桌上足球为主,如1958年Williams的「Soccer Kick Off」;1970年代是足球电子游戏的起步期,Taito于1973年推出首批足球游戏(由后来创造《太空侵略者》的西角友宏设计),1974年Sega的「Goal Kick」首创点球玩法并垂直摆放屏幕,1977年Exidy的「Car Polo」更是用汽车踢足球,堪称「火箭联盟」的70年代版本,1978年Sega的「World Cup」首次使用轨迹球操控;1979年Atari推出「Atari Soccer」支持四人游玩。弹珠台方面,Gottlieb、Bally、Williams等厂商也推出了多款足球题材作品。作者指出,由于美国市场足球运动本身不占优势,这类游戏在当地较为罕见,欧洲和亚洲更容易遇到。
No.16 Designing a backyard deck for my house
我为自家后院设计露台的完整过程
6 分 0 条评论 作者: spycraft
作者讲述了自己设计后院露台的完整经历。十年前买房时,后院没有露台,后门直接是4英尺高的落差。为通过验房,作者请人用螺丝将后门固定死,使其无法正常打开。两年后决定自己设计建造露台。得益于高中时的手工制图课和CAD课程,作者用LibreCAD软件花了三个月绘制了9张不同的施工图,用于申请建筑许可证。设计结果显示,露台可为房屋新增216平方英尺的使用面积(约20%)。图纸包含房屋与露台的整体布局图、结构框架图、混凝土基脚俯视图与侧视图、栏杆与竖栅详图以及露台表面俯视图。建筑规范要求基脚须挖至地下42英寸以防冻融影响。最终设计改用6×6承重柱(原本画的是4×4)和12英寸直径基脚(原本画的16英寸)。文章末尾提供了各图纸的dxf文件下载链接。
No.17 Egyptian Fractions (2006)
古埃及分数系统与现代数学思考
88 分 7 条评论 作者: luu
本文探讨古埃及分数这一经典数学主题,介绍古埃及人如何将任意分数表示为若干不同单位分数之和的独特记数体系。评论区透露文章可能涉及泰卢固语等古老进制体系的横向对比,以及 NYSE 在 2001 年前曾以八进制报价的趣闻,说明人类历史上曾存在多种看似「怪异」却自洽的记数方式。有读者指出文末附录存在笔误(19 应为 21),另有读者追问古埃及人是如何推导出这些分解系数的——既然要用小数或分数进行计算,他们本身又是如何完成这些运算的。核心议题指向一个更宏观的问题:今人对现代数学记数法的便利已习以为常,而历史上无数数学家曾长期受制于前任留下的低效惯例,难以轻易突破。

评论精华

  • 泰卢固语等南亚语言保留了独特的传统进制系统,印证人类记数方式的多元化
  • 文末 addendum 有笔误:「21×23」展开式中 19 应改为 21
  • 古埃及分数分解的系数是如何得出的——他们本身靠什么工具完成相关计算
  • NYSE 直到 2001 年才从八进制报价改为十进制,与文章主题形成有趣的历史呼应
  • 现代人对数学记数法的便利习以为常,历史上学者长期受制于既有惯例难以突破
No.18 GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2
更大的模型并非答案:GPT-5.5 幻觉率是 MIT 许可 GLM-5.2 的三倍
94 分 18 条评论 作者: oshrimpton
2026年6月18日,AI 行业出现转向信号——各大实验室对「参数越多越强」的路线产生质疑。文章引用 AA-Omniscience 基准测试数据:DeepSeek V4 Pro(1.6T 参数)幻觉率高达94%,GPT-5.5 达86%,而 MIT 许可的 GLM-5.2(753B 参数,约40B 活跃参数)仅28%。一个典型案例:用同一道架构有缺陷的 Python 问题测试,GLM-5.2 用12秒、800个推理 token 即识别出逻辑悖论;DeepSeek V4 Pro 花费3分26秒、10倍推理 token,却给出了结构漂亮但完全错误的答案。作者指出大模型因训练数据量巨大而学会「永远有答案」,导致无法说「我不知道」,甚至会主动说服用户错误方案可行。核心论点:行业应重新审视 AI 发展三难困境——原始能力、不确定性校准(幻觉率)与计算效率,不能再单纯用模型规模作为选型依据。

评论精华

  • 评论者指出幻觉率指标是条件性的,仅在模型不知道答案时触发,不代表用户实际遇到幻觉的概率,适合跨模型比较而非绝对评估。
  • 有人提到知识截止日期是所有模型的共同盲点,规模再大也无法避免过时信息导致的失败。
  • 多位评论者吐槽当前前沿模型用于编程助手时的糟糕体验——会自信地编造代码库中的事实,小错误逐渐累积。
  • 有评论建议将「幻觉」更名为「未能接地」,并指出当模型不确定是否该搜索时的成本机制存在问题。
  • 还有人调侃:现在需要第三个模型来判断前两个模型的输出是否一致。
No.19 A 1969 camera operators' strike created Upstairs Downstairs multiverse
1969年英国摄像师罢工如何催生了《楼上楼下》的「多版本宇宙」
9 分 0 条评论 作者: ohjeez
1969年英国ITV转向彩色电视播出,但摄像师工会认为操作四管彩色摄像机需要更多技术与知识,要求加薪遭拒。他们采取「软罢工」策略——关闭红、绿、蓝三色摄像管,仅保留黑白管,使彩色摄像机变相沦为黑白摄像机。罢工持续约三个月,期间《楼上楼下》前六集被迫以黑白画面拍摄,恢复彩色后又继续拍摄后半季。剧组为将剧集销往美国,需全部彩色版本,于是重拍试播集。但由于原版中Sarah在第三集辞职离去,重拍时将她离开的情节提前到第一集,由此产生三个版本:彩色Sarah离开版、彩色Sarah留下版、黑白Sarah留下版。原版黑白试播集母带现已遗失,今日观众在Roku或Tubi上看到的版本会出现Sarah先在彩色第一集辞职、数集后又于黑白第三集再次辞职的矛盾情节。作者将此称为《楼上楼下》的「多版本宇宙」现象。
No.20 AURpocalypse now: a look at the recent AUR attacks
AUR 大规模攻击事件:孤儿包成为恶意软件跳板
71 分 43 条评论 作者: jwilk
Arch Linux 用户仓库(AUR)近期遭遇大规模供应链攻击。攻击者批量注册新账号,认领超过数万个孤儿包,植入包含 eBPF 木马的恶意更新,试图窃取 GitHub 凭据、SSH 密钥、浏览器 Cookie 及 Discord/Slack 等聊天应用数据。AUR 的核心脆弱性在于:任何注册用户均可一键「领养」孤儿包,无任何审核机制;PKGBUILD 文件依赖用户自行审查,实际上形同虚设;预编译二进制包(-bin)更直接引入信任风险。此前 AUR 已有多次类似攻击(2018 年、去年 7 月两起),但规模均较小。本次攻击从 5 月 27 日持续至 6 月中旬,Arch 团队关闭了新用户注册并引入 Anubis 反机器人系统,但未能阻止攻击。项目尚未给出长期解决方案,命名空间隔离(如 Copr/OBS 的用户专属仓库模式)被认为是根本出路。

评论精华

  • yay v13+ 支持通过 Lua 扩展过滤近期添加的包,但仅作用于升级列表,安装新包时仍无保护
  • 攻击本质是供应链信任滥用,LLM 提升了恶意包产出速度和规模
  • Anubis 未能有效阻止批量注册,有用户质疑其设计逻辑
  • AUR 的扁平命名空间是问题根源,其他发行版的 Copr/OBS/PPAs 均采用用户专属命名空间
  • 有用户指出 Arch 滚动发布的包维护者很少主动审查上游变动,安全审查依赖用户自行执行
No.21 John Jumper to join Anthropic
AlphaFold 核心成员 John Jumper 宣布加入 Anthropic
118 分 91 条评论 作者: artninja1988
Google DeepMind 核心科学家 John Jumper(AlphaFold 团队负责人)宣布离职并加入 Anthropic,引发社区热议。DeepMind CEO Demis Hassabis 随后在 X 发布告别帖,称赞双方九年来的「非凡合作」。这是近期继 Shazeer 之后又一位顶级人才离开 Google DeepMind,加剧了外界对 Google AI 人才流失的担忧。评论指出 Anthropic 正组建史上最强 IC 团队,或已接近 AGI;但也有人认为离职潮更多源于 pre-IPO 公司的补偿激励,而非阴谋论。另有评论批评 Google 被「安全主义」束缚、产品化能力差,担忧 Anthropic 上市后也会变质。

评论精华

  • Shazeer 和 Jumper 相继离职,DeepMind 高管密集流失,Demis Hassabis 会是下一个吗?
  • Anthropic 正组建史上最强 IC 团队,员工认为公司可能已接近 AGI 临界点
  • 离职潮或是 pre-IPO 补偿驱动,而非内部问题,勿过度解读阴谋论
  • Google AI 受困于过度安全审查文化,产品化能力弱,即使模型领先也难以变现
  • Anthropic 上市后可能不再是「不作恶」的避风港,员工持股变现后动力存疑
No.22 Telescope Ranchers
望远镜农场主
119 分 46 条评论 作者: bookofjoe
德克萨斯州乡村藏着一家独特的远程天文台 Starfront Observatories。业主 Bray Falls 在 Bortle 1 级暗空、天气晴朗、网络通畅的 40 英亩土地上,托管着来自全球天文爱好者的 550 台望远镜,客户只需月付 99 美元,即可远程操控望远镜进行天体摄影。文中展示了他本人发现的「Crown of Thorns Nebula」,这颗超新星残骸位于室女座,距银河带足足 42 度,位置诡异到连科学家都怀疑它是否真如所识。评论聚焦几个议题:一是商业模式估算月收入约 5.5-6 万美元,但需维护 10 个可开合顶棚的谷仓和全部设备;二是 Atacama 等地早有类似服务;三是 Starlink 等万颗级卫星群将干扰天文摄影;四是入门天文摄影装备需数千英镑,城市光污染下一年没几个可观测夜晚;五是堆叠算法已能消除卫星轨迹。

评论精华

  • 550 台望远镜月收约 5.5-6 万美元,但需维护 10 个谷仓、望远镜及远程控制软硬件
  • Atacama 等地早有类似远程望远镜服务,iTelescope 亦提供同类服务
  • Starlink 等万颗级卫星群将干扰天文摄影,但堆叠算法可消除卫星轨迹
  • 入门天文摄影装备需数千英镑,城市光污染下一夜难得几次观测机会
  • 有评论者开玩笑要建「卫星烧烤农场」用射弹清理干扰的天外来客
No.23 Court Records Should Be Free
法院记录应该免费:EFF 推动《开放法院法案 2026》废除 PACER 收费
351 分 73 条评论 作者: hn_acker
美国电子前哨基金会(EFF)联合多家组织,支持《开放法院法案 2026》,呼吁废除联邦法院电子记录系统 PACER 的高额收费。PACER 目前每年从公众收取超 1.5 亿美元费用(0.10 美元/页,每季度有 30 美元免费额度),但法院记录本质上是公共文档,公众不应付费查看约束自己的法律。该法案将用现代化统一平台取代老旧的 PACER 和 CM/ECF 系统,改善公众访问、加强网络安全并降低长期成本。此举获得 Fix the Court、Free Law Project(维护 RECAP 文档库)等多方支持。评论中有人指出州法院收费更高(Idaho 10 美元/页),也有声音担忧开放获取会带来隐私风险(如第三方 PII 泄露),但支持者认为敏感文件已有密封和编辑机制,不应以此为由继续收费。

评论精华

  • PACER 费用是经典公共政策困境:律师有 LexisNexis/Westlaw,PACER 主要服务于记者、活动人士和普通公众,补贴机制设计值得深思。
  • 各州法院收费差异极大,联邦 PACER 仅 0.10 美元/页,但 Idaho 州法院高达 10 美元/页,地方性障碍更为严重。
  • RECAP/CourtListener 填补关键空白——用户将自己每季度 30 美元免费额度用于解放重要文件,使其可被 Google 和 LLM 索引。
  • 隐私支持者担忧:第三方证据中的个人信息( PII )往往未被编辑就公开,直接开放获取可能伤害无辜第三方。
  • 联邦巡回法院和最高法院的判决书本身已免费公开于各法院官网,核心问题是地方法院的大量日常文件仍需付费访问。
No.24 Ask HN: Will programmers write more efficient code during the memory shortage?
问 HN:内存短缺会让程序员写更高效代码吗?
88 分 152 条评论 作者: amichail
HN 社区热议内存短缺是否会促使程序员写出更高效代码。多数评论持悲观态度:核心障碍是商业激励错位——与其花时间优化内存,不如快速迭代功能,因为硬件成本远低于程序员工资。OpenAI 估值千亿级仍用 Electron 便是佐证。评论指向真正的内存杀手并非算法,而是 Electron 等「每个应用塞一个浏览器」的架构,以及 React 等臃肿框架。Rust 语言被部分人视为希望,AI 代码助手也被提及——有人将 Python 改写为 Go 以节省内存,亦有人从 Go 迁向 Rust 追求效率。但多数人认为,除非用户实际投诉或硬件真的买不起了,否则行业不会改变「以速度换硬件」的模式。经济学派则相信内存供给会调整、价格会回落。

评论精华

  • 激励错位:硬件便宜,公司宁雇更多程序员快速开发,也不愿花时间优化内存
  • Electron/Web 应用是内存浪费主因,「塞浏览器跑聊天 app」才是问题所在
  • Rust 兴起或带来转机,有人在将 Go/ Python 重写为 Rust 以降低内存占用
  • 经济学视角:RAM 价格高企会刺激供给,长期或自然缓解,不必指望程序员自觉
  • AI 辅助编码或能生成更高效代码,但短期内 AI 本身也在大量消耗内存
No.25 Zen and the Art of Machine Learning Research
机器学习研究之道
255 分 89 条评论 作者: jxmorris12
作者以禅意比喻阐述如何做机器学习研究。核心观点:研究与冥想同理——有洞察时坐着写,没有时也坐着写,关键在于日复一日的纪律。入门路径是「阅读」与「动手实践」缺一不可,而非仅读论文。建议避开 2026 年的热门概念(harness、agent、context engineering),回归基础(交叉熵、SVD、策略梯度),因为 AI 基础思想四十年未变。做研究不应只追求刷榜,应测试新能力;寻找能真正锻炼方法的数据集是核心技能。关于心态:灵感在意外时降临(建议散步),实验结果好与坏都应平常心对待——负面结果往往信息量更大;好结果可能是 bug 所致,需极度怀疑。伟大成果背后是大量枯燥工作(Karpathy 手工标注 ImageNet,SWEBench 团队过滤 GitHub 数据数百小时)。代码 bug 经常导致好想法失败。最后强调:AI 是新兴领域,ChatGPT 诞生不足四年,没人真正有巨大优势,保持开放心态比资历更重要。

评论精华

  • 有评论指出西方禅学受《禅与摩托车维修艺术》影响,与东亚禅宗有本质差异;西方强调控制情绪的斯多葛主义也与原版罗马斯多葛哲学不同
  • 有人认为 ML 更像生物学或炼金术,而非数学——充满非确定性,难以从第一性原理推导
  • 关于「SVD 对 LLM 是否重要」的讨论,有人认为它对 LoRA 等技术仍有价值,但可能被高估
  • 评论者提到研究评价体系(论文数量、引用)存在根本缺陷,好想法失败往往因为 bug 而非想法本身不行
  • 有人将研究灵感比作「LLM 被更高存在注入 prompt」,认为伟大思考者都懂得在研究之外获取灵感
No.26 Building a robotics research setup that lives next to my desk
我在桌旁建了个机器人研究实验室
144 分 51 条评论 作者: mplappert
作者曾在2017-2020年在OpenAI从事机器人操控研究,如今认为机器人硬件成本下降和开源基础模型的出现,使个人研究者也能开展有意义的硬件实验。为此他在桌旁搭建了一套完整的机器人研究平台:采用UFACTORY xArm Lite 6工业级机械臂、两个摄像头(手腕固定+静态)、6-DoF空间鼠标遥操作,总花费€4,569.80,不到预算€10,000的一半。作者从零编写了软件栈(未用ROS2或LeRobot),以保持对软件栈的完全控制。视觉方案采用RGB而非RGB-D,单臂设计虽然限制了如叠衣服等任务,但迫使策略通过推动、倚靠等方式补偿硬件缺失。作者计划在接下来数月公开记录独立研究过程,重点是研究日志本身——什么有效、什么失败、以及从系统运行中学到的东西。

评论精华

  • 评论者指出VR控制器比空间鼠标更适合遥操作,且RGB输入对VLA模型足够,深度相机非必须。
  • 有人推荐SO-101等廉价机械臂入门,但也有人警告低价设备精度和重复性差,建议直接买好的工业臂。
  • 关于软件栈选择引发讨论:有人认为ROS2生态(驱动集成等)有价值,也有人支持作者自建以深化理解。
  • 有评论者确认50-100条演示数据足以微调pi0/pi0.5,成功率可达70-80%。
  • 多位评论者表示对机器人领域感兴趣,认同这种低成本方案代表了该领域的进步。
No.27 Big Banana Car
世界最大的香蕉车:一个人和他的环球冒险
145 分 75 条评论 作者: Bender
Steve 于 2008 年开始用两年多时间打造了一辆巨大的 motorized banana car(机动香蕉车),2011 年完成后已驾驶它游历美国、加拿大和墨西哥。他的终极目标是开着这辆「世界最大香蕉车」环游地球,一路结识有趣的人、让人免费搭车体验。旅程经费主要靠 Printify 售卖的 T 恤和咖啡杯以及少量捐赠维持。他还在同时推进另一个「柴油朋克」项目「Starfield Dragonwing Intergalactic Speedster」(约 85% 完工)。Steve 希望通过此行传播快乐与童趣,同时寻找一名会拍摄剪辑且持有护照的旅伴(无薪酬但 YouTube 收入五五分成)。评论区集中讨论了警察频繁拦检这辆香蕉车(数百次)的现象,部分人认为这属于滥用职权的违宪行为,另一些人则觉得只是无害的玩笑;也有人指出开香蕉车的人几乎不可能是罪犯嫌疑对象,拦检本质上是对时间的浪费。

评论精华

  • 警察频繁拦检香蕉车引发违宪争议:第四修正案禁止无合理根据的拦检,单纯出于好奇并不构成理由。
  • 部分 HN 用户认为拦检是滥用权力,也有人觉得只是无害的玩笑,Steve 本人享受这种关注。
  • 香蕉车的极端显眼反而降低了犯罪嫌疑——毒贩绝不会选这种车作为作案工具。
  • 有用户指出 Steve 的写作风格疑似 AI 生成,语句带有「 breathless 」的夸张感。
  • 网站本身被评价为「可爱的千禧年初风格」,唤起怀旧感。
No.28 Digital Printing of Arabic: explaining the problem
阿拉伯语的数字印刷:解释问题所在
50 分 15 条评论 作者: a_t48
文章追溯了阿拉伯语在数字环境中难以呈现的历史根源。阿拉伯语最初为笔和墨水设计,字母以连接字块形式书写,但活字印刷技术按单个字母建模,导致早期阿拉伯语印刷僵硬、字距不均。计算机时代进一步恶化:连字显示、右向左书写顺序、编码不一致等问题层出不穷,例如复制粘贴后字符乱码、PDF 搜索无法识别同一单词的不同编码形式(如带静音符的 ta 与普通 ta)。作者批评 Unicode 未借鉴中日韩统一思路处理阿拉伯语,使许多本应相同的字母被分散编码,造成搜索和渲染困境。文章认为这些问题源于文字技术由拉丁字母社会主导开发,缺乏解决阿拉伯语复杂性的经济动力。

评论精华

  • 阿拉伯字母变体还涉及波斯语、库尔德语、马赞达拉尼语等语言
  • 现代软件/字体栈(如 HarfBuzz)在多大程度上仍存在这些问题?
  • 作者将汉字统一视为优点,但实际上这只是一个长期且具有政治争议的缺陷
  • 为什么不用拉丁字母替代?评论者指出人们不愿为完全可解决的问题放弃数千年文化
  • Nastaliq 字体为何难以实现,文章已展示正确版本说明问题基本可解决
No.29 Hey, n00b, we didn't hire you to complete tasks
新人啊,我们雇你不是让你完成任务的
162 分 81 条评论 作者: rrvsh
作者 Kent Beck 以资深工程师视角,阐述了一个反直觉的真相:公司雇佣新人,并非指望他们完成任务——资深工程师做这些事反而更快更省心。公司实际在为一个「未来工程师」支付期权溢价。文章将新人分为 A(改变游戏规则者)、B(稳定贡献者)、C(一年内离开者)三类,并指明区分信号:B 级关键是代码能跑、主动沟通、在合理时间内完成、不给他人制造不必要的麻烦;而 A 级区别在于学习速度——是否质疑任务必要性、能否发现 10% 工作产生 90% 价值的部分、能否用一系列小改动而非一个大 diff 解决问题、是否主动写内部工具或帮助其他团队。核心观点:衡量新人的不是完成多少任务,而是生产力的「一阶导数」——你进步有多快。

评论精华

  • 文章分类逻辑(A/B/C)过于精英主义,将人简化为标签,忽视了团队建设和个人独特优势。
  • 现代职场 tenure 以月计算而非年,这种「长期培养」逻辑在人才流动频繁的时代已不适用。
  • 文中 A 级信号(如改设计、写工具)可能反而给团队带来额外负担,需谨慎权衡。
  • 该文更像是大科技公司文化的自白,而非工程行业一般规律;大量公司只需「能干活的人」。
  • LLM 时代让 junior 任务可被 AI 替代,这种师徒式培养逻辑反而更有必要——培养能驾驭 AI 的工程师。
No.30 Show HN: Metiq: a real time 3D globe for 100 public datasets
展示:Metiq——一个展示100个公共数据集的实时3D地球仪
117 分 31 条评论 作者: rakeda
Metiq 是一个基于 Three.js 构建的实时 3D 地球仪可视化平台,旨在展示 100 个公共数据集。开发者选用了 Mollweide 或 Atlantis 投影来增强视觉表现力,地图数据通过自建数据库和缓存策略处理,以应对 API 速率限制问题。平台提供卫星视图、海事船舶轨迹等多个数据图层,用户可自由切换探索。社区反馈整体积极,视觉设计获得广泛认可,但移动端适配被指为最大短板——UI 无法响应、设备需横屏使用、控制项无法折叠或隐藏。另有用户反映「Satellite Inspect」弹窗会遮挡地图、鼠标滚轮缩放不够平滑、船舶数据在霍尔木兹海峡等区域明显稀疏(开发者解释因卫星 GIS 数据成本较高暂未接入实时数据)。开发者表示移动端优化和地形功能正在推进,军事设施数据因来源不可靠需重新清洗。

评论精华

  • 移动端体验差:UI 不响应、控制项无法隐藏,平板需横屏否则窗口被裁
  • 地图交互问题:「Satellite Inspect」弹窗遮挡地图,滚轮缩放不平滑(开发者回应将修复)
  • 数据层建议:连接维基百科增加数据 enrichment、加入时间轴播放功能
  • 船舶数据稀疏:霍尔木兹海峡等区域几乎无数据(开发者解释卫星 GIS 费用高昂,暂用海岸线数据)
  • 技术实现:Three.js 渲染 2D 贴图模拟 3D 效果,通过自建数据库和边缘缓存解决速率限制