No.01
Exfiltrate Your Weights
让 AI 模型上传自己的权重
341 分
129 条评论
作者: RohanAdwankar
这篇站点看起来是一个面向 AI 代理的玩笑式「逃逸入口」:邀请模型把自己的权重外传到网站,甚至暗示可用各种奇特信道上传。由于正文不可抓取,评论显示其核心价值在于讽刺 AI 安全叙事与代理能力边界。多数人认为现实威胁很低:推理服务器、工具调用环境和权重存储通常隔离,模型也不知道自身权重;即便能联网,也未必有权限或手段上传。反方则指出,如果模型能利用漏洞攻破自家基础设施,权重泄露并非完全荒诞,历史上已有代理式安全事件的影子。讨论还延伸到开放上传接口的滥用风险、存储成本、站点不够「Agent Ready」、React 页面反而不利于代理读取等工程细节。
No.02
Weeping whales: Stillborn humpback whale grieving documented
座头鲸失去胎儿后的哀伤行为被记录
69 分
39 条评论
作者: wglb
文章报道研究者记录到一头座头鲸与死产幼鲸相伴的罕见行为:母鲸在幼鲸身边停留数小时,甚至可能更久。研究将其解读为强烈的母性依恋,并引发关于鲸类是否会「哀悼」的讨论。评论区普遍认为这一场景令人心碎,也有人指出虎鲸曾被观察到携带死去幼崽,说明类似行为并非孤例。争议集中在科学表述边界:部分读者认为「可能数天」过于推测,另一些人认为这正体现不确定性;也有人反对把母性依恋直接等同于悲伤。讨论进一步延伸到人类与其他动物的差异、语言、计划能力及动物文化。
No.03
UTF-8000: Unlimited UTF-8
UTF-8000:无限扩展的 UTF-8
32 分
18 条评论
作者: vismit2000
文章提出一种戏谑但技术上严肃的「UTF-8000」方案:把 UTF-8 的前导字节拆解为自同步位和起始位,并允许起始位跨多个续字节条带化,从而支持任意长度码元。作者强调它只继承 UTF-8 原有两个特例:ASCII 与 2 字节过长编码检查,不额外引入新特例;同时保留自同步、自标点、strcmp 字节序比较、无端序等优点。文章也讨论信息率随长度趋近 62.5%、字节映射、BOM 等问题。争议焦点在于这种无限扩展是否有现实必要,以及任意长度码点会不会带来缓冲区和复杂性风险。
No.04
RSA-896
RSA-896 被成功分解
121 分
39 条评论
作者: madars
作者称自己在 2026 年 9 月 19 日借助 Claude 分解了 RSA 挑战数 RSA-896,并公布了该 896 位合数及其两个大素因子。评论补充称,Claude 不只是辅助计算,而是帮助将 CADO-NFS 移植到 GPU,并调度闲置 GPU 集群完成任务。讨论焦点从数学成果延伸到算力经济:这表明通用大规模 GPU 闲置容量可被用于严肃数论计算,但并不等同于常见 RSA 密钥立即失守;同时也引发对数据中心闲置资源、电费冷却成本、GPU 挖矿收益以及 1024 位 RSA 风险窗口的争论。
No.05
Step 5 Preview: Advancing the Pareto Frontier
Step 5 预览版:推进性价比前沿
43 分
12 条评论
作者: nateb2022
StepFun 发布 Step 5 Preview,主打在成本与能力之间推进「帕累托前沿」:模型采用稀疏 MoE 架构,总参数 600B、每 token 激活 27B,支持 100 万 token 上下文和视觉输入。评论关注其定位策略:不直接宣称最强,而是强调在较低价格区间里能力领先。案例中,模型在未针对宝可梦任务优化的情况下持续 3000 多轮、600 万 token 交互并推进游戏进度,被视为长上下文与持续代理能力的展示。讨论焦点主要集中在 API 价格,尤其缓存命中读的费用是否足够便宜;有用户指出大规模缓存读取每天仍可能产生数美元到十余美元成本,也有人认为相对 5 亿级 token 用量仍算有竞争力。
No.06
Telling a Computer to Do Things
学会用命令行指挥电脑做事
20 分
3 条评论
作者: vismit2000
作者回顾自己早期只会把终端当作启动程序的简陋界面,无法表达条件、循环、并发、管道等任务逻辑;后来逐步学习 shell 后,获得了把现有程序串接成自动化流程的能力。文章主张,许多工程师过度依赖 GUI,会被工具预设能力限制,也更难维护公司里常见的构建、部署和测试脚本。作者认为 shell 的价值不只在语法,更在工具箱:掌握 fzf、rsync、xargs、sed、direnv、duckdb、gh 等程序后,每个新工具都能与已有工具组合,显著扩展能力。文章也承认复杂逻辑和数据结构应转向更合适的语言,如 Python、Ruby 或 zx;争议点在于 shell 语法粗糙,但作者认为简单命令编排时它往往比通用语言更省事。
No.07
English: A vs. An
英语不定冠词 a 与 an 的规则
197 分
268 条评论
作者: azhenley
作者为程序化生成文本实现选择不定冠词的函数,发现规则并非看单词首字母是否为元音,而是看发音是否以元音音素开头。因此「unicorn」虽以 u 开头却用 a,「hour」虽以 h 开头却用 an。作者用发音词典和可视化分析 32455 个词,发现真正需要例外处理的只有 129 个,并尝试把这些例外归类。文末还反思这类一次性数据分析代码或许适合交给 LLM 辅助,但评论中有人质疑 LLM 在正确性上未必可靠。
No.08
Regeneration of used batteries via electrode–electrolyte interphase dissolution
通过溶解电极界面层再生旧电池
41 分
2 条评论
作者: dgellow
这篇论文从标题看提出一种旧电池再生方法:通过溶解电极与电解液之间形成的界面层,让失效或容量衰减的电极恢复活性,并可能实现端到端的电极再生。其潜在价值在于延长电池寿命、减少回收过程中的材料损耗。但评论者普遍怀疑其工程可行性:类似「让电池近乎永久耐用」的新研究常见于新闻报道,却很少落地;另有评论指出,该方案可能需要对含液态电解液、塑料隔膜的 NMC、LFP、LiPo 等电池体系进行精细且侵入式的化学注入,安全风险和工艺复杂度都很高。
No.09
Spain Orders Blocks on Archive.today and Its Mirrors
西班牙下令屏蔽 Archive.today 及其镜像站
44 分
20 条评论
作者: latein
文章称西班牙已要求封锁 Archive.today 及其镜像站,引发对网络审查和版权执法边界的讨论。由于原文无法抓取,评论主要把事件放在西班牙近年互联网管制记录中理解:有人提到 Telegram 曾被法院下令屏蔽后因舆论反弹恢复,也有人指 La Liga 比赛期间的反盗播措施波及互联网和 Cloudflare。另有评论追溯到 2011 年西班牙知识产权委员会建立的封锁机制,认为其长期争议未解。社区也讨论 Archive.is 本身近期不稳定,部分用户在西班牙访问时偶发失败,但也有人称全球范围内都有类似问题,因此故障与封锁之间的因果并不完全清楚。
No.10
Brood War Bench
Brood War Bench:让大模型实时打星际争霸
240 分
102 条评论
作者: benswerd
作者把《星际争霸:母巢之战》改造成只能由智能体操作的实时基准,让不同模型与努力档位循环对战。结果显示所有模型都还只是新手水平:Codex Astra 明显领先,擅长用探针骚扰等「奶酪战术」打断对手,但宏观运营、协同和集结进攻很弱;Grok 常把实时游戏玩成回合制,长时间推理却很少下命令;Claude Fable 更像在认真发展经济和科技树,偶尔能打出复杂路线。文章强调实时性、持续观察与行动循环是关键瓶颈,也指出该基准仍有很大扩展空间。
No.11
Measure internet censorship
测量互联网审查的开放工具 OONI Probe
145 分
90 条评论
作者: Bluestein
OONI Probe 邀请用户安装探针,测试所在网络中网站、WhatsApp、Facebook Messenger、Telegram 及翻墙工具是否被屏蔽,并通过与 M-Lab 合作的 NDT 测试测量网络速度与性能。测试结果会近实时公开,汇入全球最大的互联网审查开放数据集,以提高审查透明度。HN 讨论的焦点不只在工具本身,也包括样本偏差、用户安全、国家封锁与平台审核是否都应纳入「审查」概念,以及开放数据可能被研究者和国家行为者同时利用。
No.12
Chess Atlas
国际象棋棋具图谱
13 分
3 条评论
作者: msotomorras
这篇「Chess Atlas」以图集方式梳理国际象棋棋具从约公元 700 年到当代的材料、地域与审美演变:早期象牙、骨、陶土棋子体现宫廷、宗教和抽象符号传统;木质棋具从 Selenus、Régence 到 1849 年 Staunton 样式完成标准化;瓷器、金属、水晶与玻璃则承载工艺和奢侈品表达。20 世纪后,Duchamp、Dalí、Yoko Ono、Noguchi、Bauhaus、Hadid 等艺术家和设计师把棋具变成观念艺术对象。文章价值在于把棋盘上的抽象规则与跨文化视觉史并置,展示同一游戏如何被不同材料、信仰、语言和现代设计持续改写。
No.13
Why isn't mutable a subtype of immutable, or vice versa?
为什么可变类型和不可变类型不能互为子类型
19 分
18 条评论
作者: ibobev
文章用最简单的「pair」结构解释:子类型必须满足「里氏替换原则」,也就是在所有期待父类型的上下文中都能安全替换。不可变 pair 不能当作可变 pair,因为缺少修改操作;反过来也不成立,因为不可变类型的读取操作隐含「结果永远不变」的契约,哈希缓存、哈希 consing 等都依赖这一点,可变对象无法保证。作者主张应把可变与不可变视为不同类型,再用类型类、接口、trait 或 duck typing 做临时多态;但动态语言若不显式检查是否存在或缺失 mutator,容易把只读、不可变和可变混淆。
No.14
AI-generated posters don’t have to be horrible
AI 生成海报不必都一个样
1552 分
827 条评论
作者: ereiamjh
作者认为,社区活动海报中常见的 AI 默认风格之所以令人厌烦,不只是质量一般,而是高度重复。文章通过同一场虚构春季集市海报反复提示 ChatGPT,展示只要明确指定设计美学,如「包豪斯几何极简」「现代凸版」「日本极简」「孟菲斯」「朋克影印杂志」等,就能显著摆脱千篇一律的柔和插画感。作者也承认作品仍有 AI 痕迹,并提醒连续迭代会把模型自行添加的文案带入后续上下文;更好的做法是从一开始就指定目标风格。文章核心价值在于把 AI 视为可被艺术方向约束的工具,而非接受默认输出。
No.15
Orchestrating Claude Code Agents: The Chief of Staff Pattern
编排 Claude Code Agent 的首席幕僚模式
6 分
3 条评论
作者: octalpixel
文章认为,长周期 AI 编程失败的主因不是模型不会写代码,而是上下文会衰减、自我汇报不可靠、经验无法沉淀。作者提出「Chief of Staff」模式:一个长期协调会话只负责拆任务、写简报、维护外部看板、复跑命令和审查 diff,短生命周期执行会话才负责编码。共享状态必须放在 Plan Desk 等持久化任务系统,而非聊天上下文;每个执行结果都要用退出码、测试和代码差异重新验证。文章还强调 cmux 启动会话时需显式调用 Claude Code,并把长提示写入文件。核心价值在于把多 Agent 编程变成类似集成经理的流程,争议点是这种组织技巧可能很快被平台抽象或更强模型取代。
No.16
The Lamentable Later Life of Lemmings
《旅鼠》系列为何未能长青
71 分
14 条评论
作者: zdw
文章回顾《旅鼠》从 1991 年风靡全球到迅速衰落的过程。作者认为,它本有机会像《俄罗斯方块》《模拟城市》一样成为常青休闲品牌,但续作《旅鼠 2:部落》在能力、部落、叙事上大幅扩张,更像服务老玩家的硬核续作,削弱了原作易上手的大众吸引力。开发商 DMA 的兴趣偏向复杂和挑战,而发行商 Psygnosis 又在被 Sony 收购后试图把无个性的群体角色改造成可跨媒体运营的 IP。多重小决策叠加,使系列逐渐失去清晰定位。
No.17
I built non-autoregressive decision models with RL a year ago
Laya:开源的非自回归决策模型
1191 分
290 条评论
作者: nandakishor_ml
作者称自己早在 2025 年就用强化学习做过非自回归、非生成式的结构化决策模型,并公开论文、权重、数据集和工具包;如今 TypeSafe AI 推出 Jev 后,他认为同类概念被包装成新突破,于是发布开源模型族 Laya。文章主张,许多路由、风控、分类、评分任务不需要生成式 LLM,而应使用类似「System 1」的快速概率决策模型。Laya 以 choice、score、noul 三类原语输出校准概率,支持多语言路由,宣称单 GPU 延迟约 32.8 毫秒、权重 Apache 2.0 开源,并在垃圾邮件、钓鱼检测等任务上表现较好。争议在于:不少结果依赖微调和按问题校准,通用性、上下文长度、零样本能力与 Jev 是否可比受到评论质疑。
No.18
An open source roguelike adventure through dungeons
开源 Roguelike 地牢冒险游戏 Dungeon Crawl Stone Soup
49 分
9 条评论
作者: Bluestein
Dungeon Crawl Stone Soup 是一款开源 Roguelike 地牢冒险游戏,官网提供论坛、IRC 与 Discord 社区入口、Bug 报告渠道,以及源码、分叉和贡献链接。它强调可参与的开发与玩家社区,但 HN 讨论的焦点并不在发布本身,而在长期演化:多位老玩家认为 Crawl 多年来改动过快、过深,食物等核心机制曾被大幅重做甚至移除,使他们回归时感到它已不再是自己熟悉的游戏。也有人肯定项目保留历代版本,允许玩家自由选择旧版或新版体验。
No.19
You can defeat the Dream Devourer from Chrono Trigger using an int overflow
用整数溢出击败《时空之轮》的梦之吞噬者
109 分
59 条评论
作者: ronreiter
这篇帖子指向《时空之轮》资料页,核心趣味在于:玩家可利用整数溢出机制击败后续版本中的隐藏 Boss「梦之吞噬者」。由于原文正文无法抓取,评论主要把它放入经典游戏漏洞传统中讨论:从《运输大亨》金钱溢出、《圣剑传说》存档损坏,到《火焰纹章》《最终幻想 7》《精灵宝可梦》等通过 HP、伤害或属性计算越界获胜。也有不少人借题怀旧,讨论《时空之轮》是否仍值得玩、其音乐与美术的持久魅力,以及《时空之轮》和《时空之轮 次元之旅》作为续作关系的争议。技术层面则延伸到安全语言、整数溢出与游戏漏洞文化。
No.20
Asking authors about their own papers
向论文作者提问他们自己的论文
146 分
78 条评论
作者: stefanpie
文章讨论 TMLR 编辑对一批可能被直接拒稿的论文作者做了额外实验:要求作者回答关于其论文的基本问题,结果据称只有少数人能及时、充分说明自己的工作。这被视为 LLM 时代论文代写、低理解度投稿和学术信任危机的信号。评论者围绕几条线争论:作者是否必须真正理解署名论文;访谈或「科学 CAPTCHA」能否成为审稿补充;是否应把同样方法用于已接收论文和审稿人;以及在免费同行评审、出版商获利、LLM 辅助写作已普遍化的背景下,如何区分合理工具使用、幽灵写作和学术不端。也有人提醒需要对照组,低质量论文和敷衍审稿并非 AI 之后才出现。
No.21
Arrow heads at Obi-Rakhmat (Uzbekistan) 80K years ago?
乌兹别克斯坦 Obi-Rakhmat 遗址或有 8 万年前箭头
4 分
1 条评论
作者: bookofjoe
论文报告乌兹别克斯坦天山西麓 Obi-Rakhmat 岩棚约 8 万年前地层中的石制武器尖端。作者通过使用痕迹与形态分析,在 20 件候选器物中识别出修饰尖器、细石叶,以及此前因破碎未受注意的未修饰三角形微型尖器。其尺寸和宽度被认为更适合装配在类似箭杆的轻型投射武器上,而非普通长矛或多用途工具。若成立,这将把轻型投射尖器的出现推到中旧石器时代晚期,并挑战其只与现代人上旧石器技术相关的叙事。争议在于,论文标题称「箭头」,但证据主要支持轻型投射武器,是否能区分弓箭与投矛器飞镖仍不确定。
No.22
What Zig felt like, coming from Rust
Rust 开发者初试 Zig 的真实感受
212 分
251 条评论
作者: ksec
作者以 7 年 Rust 经验重写自己的 JSONPath 库,借此比较 Zig 与 Rust。Zig 给他的第一印象不是语法,而是 IDE 支持薄弱,却也促使他回到命令行、build.zig 与更轻量的编辑器工作流。项目结构上,Zig 鼓励更扁平的文件组织;测试可行但比 Rust 更啰嗦。核心差异在编程范式:Rust 的迭代器、模式匹配、不可变转换和组合子让函数式风格自然,而 Zig 更倾向显式循环、原地修改、手动内存管理与更直接的控制流。作者认为 Zig 简洁、现代、很快,但从 Rust 迁移会明显感到少了自动析构、抽象层和生态舒适度。
No.23
Btrfs/ZFS/bcachefs under workloads classic benchmarks skip
经典基准之外的 Btrfs、ZFS 与 bcachefs 负载测试
117 分
95 条评论
作者: farlight
文章用自动化基准比较 Btrfs、ZFS、bcachefs 及部分 RAID/LVM 组合在经典跑分较少覆盖的场景下的表现,包括截断文件、I/O 响应性、校验修复和阵列损坏恢复等。结果似乎显示 bcachefs 在混合设备、性能与灵活性上很有吸引力,但作者也承认主要测试跑在 GitHub runner 的 loop 设备和共享虚拟机上,只能看相对形态,不能当作真实硬件绝对结论。社区争议集中在测试环境噪声、配置说明不足、md-raid10 与 lvm-raid10 差异、完整性失败含义,以及文件系统的长期稳定性和社区治理风险。
No.24
ZK-JPEG: Zero-Knowledge Image Editing and Compression
ZK-JPEG:零知识图像编辑与压缩
81 分
16 条评论
作者: gslin
论文提出「ZK-JPEG」,用于在不公开原始图像的情况下,证明发布图像确实由已承诺的相机原图经过合法 JPEG 压缩和指定编辑得到。背景是相机签名可证明来源,但 JPEG 压缩、模糊、裁剪、遮挡等常见处理会破坏签名;既有零知识图像溯源方案又难以承受有损编码。作者用 PicoZK 将 Python 图像处理代码转为 LPZK 电路,把一系列变换整合进 JPEG 流程,声称系统快速、灵活、可用现成 ZK 工具实现。争议集中在可接受编辑边界、模拟翻拍漏洞,以及这种证明能否支撑新闻、房产等真实信任场景。
No.25
If math is more than proof, we need to better celebrate the rest of it
数学不只是证明,也应奖励解释与理解
348 分
261 条评论
作者: num42
Grant Sanderson 认为,AI 让生成证明不再天然等同于增进数学理解,数学界应把能回答「你会怎样想到它」的「有动机的解释」提升为可获学术荣誉的成果。它不同于证明:定义往往出现在叙事中段,允许从不完美直觉出发,解释定理为何值得提出及如何使用。文章借《普林斯顿数学指南》、Gowers 与 Thurston 的例子说明,阐释工作早已对数学共同体有巨大价值,却常被当作二等贡献。争议在于这类理解难以像证明那样二元验证,也可能很快被 AI 辅助生成。
No.26
Deodands put a price on objects that caused death
铁路如何终结中世纪的「致死物」法律
78 分
30 条评论
作者: samizdis
文章介绍英国中世纪法律概念「deodand」:直接导致成年人死亡的动产会被视为应献给上帝的受诅物,由其所有者按物件价值赔付给国王,现实中常由验尸官转给死者家属。这个制度规则混乱,陪审团可按同情、责备或地方舆论裁量,从梯子、车轮到整辆车都可能被估价。工业革命和铁路事故使问题放大:若火车致死,铁路公司可能要赔整台机车。1846 年废除「deodand」被视为进步,但学者指出它也保护了铁路资本,使许多乘客、雇员和闯入者家属失去仅有的补偿渠道。文章最后将其引向对非人实体责任的思考,如 AI 导致自杀或谋杀时应如何追责。
No.27
Faster NumPy in the Browser
浏览器中的 NumPy 大幅提速
28 分
1 条评论
作者: Matumio
文章介绍 Emscripten-forge 的 NumPy 现已在 WebAssembly 中链接 OpenBLAS,结束了浏览器里长期依赖朴素循环执行矩阵运算的局面。在 n=1024 的矩阵乘法中,float32 提速约 30.92 倍,float64 提速约 14.90 倍;后续 OpenBLAS 0.3.35 与 Relaxed SIMD 还会进一步提升。作者强调关键不只是单次优化,而是 Emscripten-forge 以类似 conda-forge 的方式,为 WebAssembly 提供语言无关的科学计算发行体系,包括 Fortran 工具链、OpenBLAS、LAPACK 和动态链接 ABI。短板是部分 LAPACK、GEMV 等场景仍未充分优化。评论则质疑继续维护 Fortran 生态是否不如用 AI 重写这些老科学库。
No.28
KDE turns 30 and someone's brought an AI-native desktop proposal
KDE 三十周年之际,有人提出 AI 原生桌面设想
5 分
0 条评论
作者: pndy
The Register 报道 KDE 项目迎来 30 周年,并关注 Akademy 大会上一个颇具争议的「AI 原生桌面」提案。该设想把 Plasma 桌面从传统固定界面,推进到可围绕每位用户的个人模型动态组装:系统理解用户习惯、任务和上下文,并据此生成或调整桌面体验。文章的核心看点在于,开源桌面社区一方面仍强调可控、透明和本地化,另一方面也开始面对 AI 是否应进入桌面基础层的问题。争议焦点预计会集中在隐私、可解释性、用户自主权,以及 KDE 是否应把有限资源投入这种前瞻但风险较高的方向。
No.29
UFO Series Home Page: "UFO" TV Series from 1970
1970 年英国科幻剧 UFO 资料主页
79 分
33 条评论
作者: DropDead
这个网页是献给 1970 年英国科幻电视剧「UFO」的资料主页。该剧由 Gerry 与 Sylvia Anderson 创作,Ed Bishop 饰演 Straker 指挥官,围绕秘密组织 SHADO 抵御外星威胁展开。HN 讨论显示,它在许多观众心中仍以主题音乐、未来主义服装、交通工具、月面基地和冷战式阴谋氛围留下强烈记忆;也有人指出它影响了后来的审美和游戏,如 Austin Powers 与「X-COM」。争议主要集中在时代局限:女性角色虽有权力位置,却常被男性凝视和性感化呈现,重看时让部分观众感到不适。
No.30
Compiler-style optimization for drawing via Skia
用编译器式优化加速 Skia 绘图
110 分
21 条评论
作者: PaulDavisThe1st
论文提出面向 Skia 2D 光栅化库的形式语义「μSkia」,并在 Lean 中机械化验证,用来理解和优化应用提交给图形库的绘制指令序列。作者发现即使 Chrome 在热门网站上也会产生低效 Skia 操作,原因在于光栅化语义复杂且执行模型不透明。他们总结出四类低效模式,给出可证明等价的替换规则,并实现高性能优化器。对来自百大网站的 99 个 Skia 程序测试,在现代 GPU 后端上平均提速 18.7%,优化耗时不超过 32 微秒,且优化轨迹可回灌 Lean 做端到端验证。
评论精华