No.01
Glm-5.3: Frontier coding with emergent cyber capabilities
GLM-5.3:前沿编程与新兴网络安全能力
319 分
116 条评论
作者: pella
Z.ai 发布 GLM-5.3,宣称仅通过扩大后训练就显著提升编码与网络安全任务能力:在自家代码基准较 5.2 提升约 50%,并在 Terminal-Bench 等公开榜单达到开源 SOTA,权重计划两周后开放。社区普遍认为它虽仍略落后 Sol、Fable、Mythos 等闭源前沿模型,但差距已很小,且体量和成本优势突出。争议集中在后训练是否只是基准过拟合、开放强网络安全能力的风险、缺少多模态、许可证是否真正自由,以及实际长任务稳定性仍需用户验证。
No.02
Gemini 3.7 Flash
Gemini 3.7 Flash 发布
785 分
419 条评论
作者: thisisauserid
Google 发布 Gemini 3.7 Flash,定位为面向编码和智能体的高性价比「主力模型」。相比 3.6 Flash,它在软件工程、网页开发、复杂文档处理和业务自动化基准上明显提升,例如 FrontierCode、DeepSWE、GDP.pdf 与 AutomationBench 均有较大增幅,并改进多步规划、工具调用和指令遵循。模型将接入 Gemini Spark、AI Studio、Android Studio 和企业平台,年内采用 0.75 美元每百万输入 token、3.75 美元每百万输出 token 的引入价。争议主要集中在价格到期后翻倍、与 Luna、DeepSeek、Qwen 等低价模型相比是否仍有优势,以及 Google 是否过度押注快速小模型而缺少新的 Pro 旗舰。
No.03
Accelerating GPT-5.6 Sol Ultrafast
Cerebras 为 GPT-5.6 Sol 推出超高速推理模式
556 分
233 条评论
作者: pr337h4m
Cerebras 与 OpenAI 预告 API 新服务层「Ultrafast」,由 Cerebras 晶圆级引擎驱动 GPT-5.6 Sol,最高可达每秒 750 个输出 token,宣称不牺牲质量。文章称其在 Humanity’s Last Exam 上以 11 小时完成 2500 题,较 Claude Fable 5 快近 7 倍;在 GDP-Val 知识工作任务中端到端提速 5.6 倍。Cerebras 将优势归因于 44GB 片上 SRAM 减少大模型推理的数据搬运,并主打故障响应、安全、法律金融工程等高时效场景。争议集中在基准是否公平、价格与配额未知、真实端到端瓶颈未必只在模型输出。
No.04
Hello, me. It's been a while
久违了,我自己
173 分
80 条评论
作者: somesoftdev
作者时隔十四年重启博客,写下对安静与自我思考的重新发现。随着工作、责任和碎片时间被播客、有声书、社交媒体填满,他逐渐养成一有空白就播放内容的习惯,也失去了慢慢听见自己想法的空间。一次做家务时,他刻意不按播放键,起初不适,随后思绪重新流动,意识到内在声音仍在且值得保留。文章呼吁读者偶尔关闭背景声,允许无聊和沉默发生;评论也提醒,噪音环境、压力、ADHD 或专注方式差异,会让沉默并非人人可得或适用。
No.05
Bluesky Protocol Services
Bluesky 推出协议服务与 Jetstream v2
153 分
28 条评论
作者: danabramov
Bluesky 发布「Bluesky Protocol Services」品牌与新站点,集中说明其在 AT Protocol 上运营的公共基础设施,包括 Jetstream、relay 和 API。核心更新是 Jetstream v2:支持通过压缩全网归档进行「Network Replay」和快照下载,开发者可按过滤条件从历史任意点补数据并无缝切到实时流;归档请求需 API token,实时流仍开放免认证。官方还推出 TypeScript 与 Go SDK,更新基于「lex」的 Bluesky TypeScript SDK和 HTTP 参考文档。评论区既认可其降低开发门槛,也担忧 Bluesky 用户增长、资金可持续性及生态方向。
No.06
Show HN: C# Game Engine with its own scripting language and IDE
展示:带自研脚本语言和 IDE 的 C# 游戏引擎
19 分
1 条评论
作者: am-gm
这个项目展示了一个用 C# 编写的游戏引擎,并且不只是引擎本体,还包含自研脚本语言和配套 IDE。由于原文无法抓取,信息主要来自标题和评论:作者似乎试图从底层搭建一套完整游戏创作环境,而不是基于现成脚本语言或编辑器生态做集成。社区关注点集中在工程规模和技术取舍上:有人认为同时从零实现语言、IDE 和引擎是一项非常庞大甚至近乎疯狂的工程,也好奇作者为何选择自定义语言,而不是嵌入 Lua 等成熟方案。争议焦点在于自研带来的控制力、学习价值与维护成本之间是否值得。
No.07
DeepSeek Harness developer preview
DeepSeek 发布可插拔 Agent Harness 开发者预览
639 分
264 条评论
作者: bjin
DeepSeek Harness 进入开发者预览并开源,定位为让智能体在真实环境中使用工具、理解上下文并持续工作的运行框架。其核心设计是「一切皆插件」:模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 都基于 Cordis 插件系统,可在配置中替换或重组。另一重点是可追踪性,系统会把模型看到的提示、推理、工具调用、子代理调度和上下文注入写入追加式会话日志,并支持查看、恢复、分叉、搜索和回放。它提供标准、代码、最小和创建者等运行模式。争议集中在:页面和 README 对「它究竟是什么」解释不足,插件架构被批评不新鲜或带来插件疲劳,Node/npm 技术栈也引发安全与膨胀担忧。
No.08
Show HN: Lumabri – Run Moe Models on a P2P Swarm with Colibri
展示:Lumabri,用 Colibri 在 P2P 群中运行 MoE 模型
4 分
0 条评论
作者: vforno
Lumabri 是一个基于 Colibri 的实验性项目,目标是在点对点网络中运行 MoE(混合专家)模型,把模型推理或专家组件分散到多个节点协作完成。根据标题可推断,它试图降低单机运行大模型的硬件门槛,并探索去中心化算力共享、模型分片与协同推理的可行性。由于原文无法抓取且暂无社区评论,目前无法确认其实际性能、容错机制、带宽开销、隐私设计或与既有分布式推理方案的差异。核心价值在于把 MoE 与 P2P swarm 结合的工程尝试,但可靠性、延迟和节点激励仍是潜在关键问题。
No.09
Spaghettifying DRAM
让 DRAM 地址空间意大利面化
593 分
154 条评论
作者: matt_d
这篇 GitHub 项目展示 Christopher Domas 对 AMD 旧平台 DRAM 控制器的研究:通过改写内存控制器的地址转换或「DCT swizzling」寄存器,让同一个物理地址映射到意想不到的位置,从而在已具备内核态权限时窥探或改写传统上藏在更低特权层的内存区域。评论指出代码主要在 AMD Family 16h、Jaguar 等较老架构上开发测试,现代 Zen 的 UMC、AGESA/PSP 初始化和寄存器锁定可能已不同。争议集中在威胁模型:它不像普通本地提权,更像「root 之后继续越权」的硬件所有权与逆向工具;若虚拟机暴露相关寄存器才可能影响 KVM。另有不少人称赞 Domas 回归,也批评 README 带有明显 AI 写作痕迹、可读性差。
No.10
Mistral OCR 4.1
Mistral OCR 4.1 文档识别服务
322 分
129 条评论
作者: spelk
Mistral 发布 OCR 4.1 公测版,定位为其 Document AI 技术栈的最新 OCR 服务,主打段落级边界框提取、结构化块标签和块级置信度评分,定价为每千页 3.5 欧元、带标注每千页 4.38 欧元。社区讨论焦点不在功能发布本身,而在性价比、速度和准确率:支持者认为它比通用大模型 API 更快、更便宜,适合简单批量文档;批评者则认为价格相对 Tesseract、自建 GPU 流水线、AWS Textract 或 Azure Document Intelligence 偏高。另有讨论涉及欧洲 AI 竞争力、数据主权、医疗法律文档合规,以及 VLM 在复杂文档理解中的可靠性问题。
No.11
The Library of Ashurbanipal (2025)
亚述巴尼拔图书馆
24 分
6 条评论
作者: samizdis
文章应围绕亚述王亚述巴尼拔在尼尼微建立的泥板文献收藏展开:这座图书馆保存了美索不达米亚文学、宗教、占卜、医学、王室档案与史诗传统,是理解古代近东文字文化的关键窗口。评论指出,美索不达米亚人对自身文学传统和历史已有高度自觉,后世统治者甚至会发掘更早王朝遗迹,带有早期考古意味。讨论焦点还包括:大量楔形文字泥板仍未被充分解读,原因不是材料不足,而是能读懂它们的历史学者太少;AI 或可辅助 OCR 和残片识别,但在缺损、低信号和未知知识场景中仍难替代专家判断。
No.12
Understanding is the new bottleneck
理解代码,成了 AI 编程的新瓶颈
298 分
160 条评论
作者: sebg
作者认为,AI agent 能写越来越多代码后,人类的瓶颈从「产出代码」转向「理解系统」。理解不只是为了验收对错,更是为了持续参与创意循环、提出下一步演化方向,否则会积累类似技术债的「认知债」。他借鉴教育方法,提出三类实践:让 agent 生成结构化代码解释文档,用测验检查是否真的掌握,以及构建可交互的「微型世界」让人通过操作理解系统变化。文章价值在于把代码审查从逐行读 diff 扩展为学习设计;争议则在于不少评论者认为理解从来就是瓶颈,AI 还可能制造更多难以验证的解释和代码。
No.13
Choose Boring Technology (2015)
选择成熟无聊的技术
326 分
164 条评论
作者: tosh
作者主张工程团队应优先选择成熟、可靠、故障模式清楚的「无聊技术」,因为公司能承担的新技术风险和注意力是有限的,可用「创新代币」来理解。新技术并非不能用,但应通过组织层面的讨论:先证明现有栈无法合理解决问题,明确新增技术带来的运维和认知成本,并承诺迁移或控制重叠。文章反对把「最适合任务的工具」理解为局部最优,强调长期维护可靠系统的成本远高于初期开发便利。争议在于该理念可能被滥用为保守借口,忽视真正更合适或已成熟的新技术。
No.14
Donkey.bas is 45 Years Old – 131 line of Glory
DONKEY.BAS 诞生 45 年:131 行 BASIC 的早期 PC 游戏记忆
226 分
104 条评论
作者: jkrauska
文章纪念随早期 IBM PC DOS 附带的演示程序「DONKEY.BAS」诞生 45 周年,并用 JavaScript 重现其 CGA 图形与音效玩法。这个 1981 年由比尔·盖茨和 Neil Konzen 编写的 BASICA 小游戏只有切换车道、避开驴子的核心机制,却展示了早期 PC 彩色图形和声音能力。社区讨论集中在复古 BASIC 的简洁性、PC Speaker 音效限制、Gates 是否仍亲自写代码的传闻,以及浏览器复刻在碰撞检测、闪烁和隐藏彩蛋上与原版的差异。
No.15
NP-overrated
NP 难被高估了
198 分
132 条评论
作者: theanonymousone
文章反驳「NP-hard 等于实践中不可解」的常见误解:复杂性理论只说明任何算法都会在某些输入上爆炸,并不排除在绝大多数真实输入上很快。作者以依赖解析、类型检查、调度、旅行商、SAT/SMT 为例,指出现实系统可通过结构约束、启发式、优化求解器和超时机制处理很多 NP-hard 问题,甚至获得可证明最优解。争议在于作者措辞偏强:社区认为理论并非无关,很多领域仍依赖近似、限制输入或接受失败。
No.16
Nine PBS sues Iron Mountain over blocked access to archival data
圣路易斯 Nine PBS 起诉 Iron Mountain,要求取回 70 年档案数据
299 分
168 条评论
作者: vinayakborkar
圣路易斯公共电视台 Nine PBS 起诉 Iron Mountain Data Centers,要求取回存放在丹佛数据中心的 50TB 以上档案资料,内容涵盖该机构 70 多年历史,包括东圣路易斯历史、COVID-19 疫情和 1993 年大洪水报道。Nine PBS 称其云存储供应商 Open Source Storage 在合约到期日突然切断访问并陷入停摆,导致档案被困在 Iron Mountain 设施中。Iron Mountain 承认持有数据,但称其客户 OSS 才拥有承载数据的物理服务,因此拒绝直接交还。法院已临时禁止删除、修改或覆盖这些资料,并将举行听证。争议焦点在于数据所有权、托管基础设施控制权以及供应链中间商失效后的法律责任。
No.17
Blog about things you don't understand yet
写下你尚未完全理解的东西
86 分
30 条评论
作者: gfysfm
作者认为,博客不应只记录已懂之事,而应成为学习和澄清思考的工具。每篇文章都应提出一个可争议的观点,因为这种限制会迫使作者研究、反驳质疑并在写作中发现自己并不理解的部分。写作常让他改变态度,结论也往往比开头更清晰。他承认初学者公开写陌生领域有风险,但认为只要透明呈现身份与资历,初学者反而能写出更适合大众的入门说明,也能纠正常见误解。争议集中在:这种实践是有益学习,还是会制造低质量内容、误导读者甚至污染训练数据。
No.18
How Compaction Works in Pi
Pi 中的上下文压缩是如何工作的
152 分
59 条评论
作者: tosh
文章解释编码代理 Pi 在长会话中如何处理上下文窗口耗尽。每轮请求都会携带系统提示、工具定义、已加载文件、历史消息和工具结果,随着会话增长最终触达模型限制。Pi 的「压缩」会保留约 2 万 token 的近期消息,把更早历史序列化后交给一次独立 LLM 请求生成结构化摘要,再以纯文本插回会话,使后续工作继续。压缩可自动触发,也可用 /compact 手动触发;中途溢出时也可能执行。作者强调摘要目标像交接班简报,只保留目标、进展、关键决策等仍有价值的信息。争议点在于压缩会打破提示缓存,导致此前缓存前缀失效,并且摘要本身可能丢失细节。
No.19
Credibility is the barrier to entry in silicon
硅芯片创业的真正门槛是可信度
19 分
7 条评论
作者: johncole
文章访谈欧洲 RISC-V 处理器 IP 初创 Fiora5 的 CEO Darian Domocos,核心观点是做 CPU 公司最难的不只是工程,而是让投资人、客户和生态相信两个罗马尼亚年轻工程师能成事。文中认为 Arm 的优势主要在成熟工具链、调试、集成和开发者习惯,RISC-V 的机会来自开放指令集、RVA23 等标准化进展,以及欧洲追求芯片供应链主权的政策窗口。Fiora5 选择避开数据中心,从更可进入的市场切入,并用股权、责任和成长空间吸引工程人才。评论区则指出文章深度不足,并围绕开放 ISA 与商业 IP、RISC-V 相比 Arm 的性能和生态短板展开争论。
No.20
Single log line is 49KB+ (ext4) / 110KB+ (btrfs) of systemd-journald disk writes
一行日志导致 journald 写入数十 KB 磁盘数据
203 分
127 条评论
作者: ValdikSS
该 GitHub issue 指出,systemd-journald 记录单行日志时会触发远超日志本身的数据写入:ext4 上约 49KB 以上,btrfs 上可达 110KB 以上。评论推测原因与 journal 文件格式、哈希索引、mmap 写入以及文件系统块或 COW 行为有关,偏离了早期宣称的高效设计。讨论迅速扩展到 journald 的长期痛点:二进制格式难过滤、索引慢、写放大严重、日志量难控制。有人建议改用 SQLite、DuckDB、Parquet 或传统文本日志,也有人认为这是架构级问题,不适合外部随手 PR 解决。少数评论给出缓解办法,如设为 volatile、限制日志大小、转发到 syslog。
No.21
Where did the old web go? We followed 657,607 links to find out
旧网页去哪了?追踪 65 万个短链接后的发现
172 分
156 条评论
作者: tdx
0.mk 团队恢复了 2009 至 2014 年创建的 65.8 万个短链接,并在 2026 年逐一抓取目标页。结果显示,在 65.5 万个可安全访问记录中,76.7% 已无法加载;按唯一 URL 计算,不可加载比例仍达 78.7%。即便返回 2xx 或 3xx,也可能只是登录墙、停放页或服务遗址,不代表原内容幸存。数据偏向马其顿用户,记录了本地新闻、论坛、博客、图床与平台链接的消亡;YouTube、Google、Wikipedia 等巨头存活更好,小型网站和地方媒体损失更重。文章也反思短链接叠短链接会放大脆弱性,并说明 AI 降低了重启 0.mk 的维护、反垃圾和支持成本。
No.22
How Organizations Use AI: Evidence from ChatGPT [pdf]
组织如何使用 ChatGPT:来自企业采用数据的证据
102 分
57 条评论
作者: malshe
这篇 OpenAI 论文似乎试图用企业使用数据说明组织正在如何采用 ChatGPT,重点可能包括大公司采用率更高、用途分布、不同部门或行业的渗透情况,以及企业仍处于探索阶段。HN 评论普遍质疑其研究设计和表达方式:有人指出采用者抽样与全体 Compustat 公司作对照可能带来统计风险,且未说明抽样率;也有人认为文章更像推广材料,缺少对投资回报、衡量方法和因果解释的实质分析。讨论还延伸到教育场景,支持者认为教师可用 AI 提升备课效率,反对者担心削弱分析能力或带来学术诚信问题。
No.23
Finite State Machines in Forth (1994)
用 Forth 实现有限状态机
73 分
2 条评论
作者: ofalkaed
这篇 1994 年 Julian Noble 的文章应是围绕如何在 Forth 中表达和实现「有限状态机」展开。Forth 以小词组合、可扩展语法和接近解释器的执行模型著称,适合把状态、事件与转移规则写成紧凑的领域化结构。评论提到可与经典论文「Lambda: the ultimate GOTO」对读:两者都借状态机讨论控制流抽象,只是一个从 Forth 的可塑性出发,另一个从函数与 lambda 的表达力出发。社区讨论很少,重点更多是怀旧和学术脉络:作者 Julian Noble 曾是评论者的本科老师,也显示这篇旧文在 Forth 社群和教学传统中的位置。
No.24
The Legend of the Novell NE2000 [video]
Novell NE2000 网卡传奇
41 分
12 条评论
作者: voxadam
这段视频回顾了 Novell NE2000 这类早期以太网卡的历史地位:尽管常被认为质量参差、兼容克隆卡众多,它在 90 年代中期的 PC、Linux 和 BSD 机器中极其普遍,几乎支撑了大量早期互联网接入。评论指出,低价和广泛驱动支持让它成为事实标准,但硬件实现差异也带来性能与可靠性问题。讨论还延伸到同期更高端的 3Com、Intel PRO/100 等网卡,认为 Intel 后来凭借稳定驱动、平台兼容和芯片组集成逐步主导市场。
No.25
Cave of the Crystals
墨西哥奈卡巨型水晶洞
40 分
2 条评论
作者: ColinWright
墨西哥奇瓦瓦州奈卡矿地下约300米处的「水晶洞」含有已知最大的天然石膏晶体之一,最长约11.4米、重约12吨。洞穴因岩浆加热含硫地下水、后在约56℃以下极缓慢结晶,历经至少50万年至约100万年形成。洞内最高58℃且湿度近饱和,人体无防护只能停留约10分钟,研究者需冷却服与呼吸系统。2000年矿工发现后,科学团队研究其矿物、生物地球化学与潜在极端微生物;采矿停止后水泵关闭,洞穴已于2015年重新淹没,未来能否再进入取决于是否开新入口。
No.26
How Gödel's Proof Works (2020)
哥德尔证明如何运作
99 分
42 条评论
作者: tzury
文章用非形式化方式解释哥德尔不完备定理:20 世纪数学家追求一致且完备的公理基础,但哥德尔证明,任何足够表达算术的公理系统都会留下真而不可证的命题,也无法证明自身一致性。核心技巧是「哥德尔编号」:把符号、公式、证明序列映射为唯一整数,再用素因数分解把关于公式的元数学陈述转写为算术命题。通过把公式自身编号代入自身,构造出类似「本命题不可证明」的语句 G,从而展示可证明性与真理之间的裂缝。评论中也有人质疑文中称 G「显然为真」过于简化。
No.27
an ambiguity in C89 which will never be fixed
C89 中一个永远不会修复的歧义
59 分
23 条评论
作者: runningmike
文章指出 C89/C90 的「隐式函数声明」规则存在标准措辞歧义:当调用未声明函数时,标识符会被隐式声明为返回 int 的 extern 函数,但标准称其进入「最内层块」却未定义具体含义。作者用函数声明中数组参数、sizeof 和同名参数构造边界案例,展示 GCC 与 Clang 对作用域位置解释相反,导致一个例子 Clang 接受而 GCC 报错,另一个例子则反过来。争议核心是隐式声明应落在块作用域、文件作用域,还是函数原型作用域。由于 C99 已移除该特性,这个历史歧义几乎不可能再被正式澄清。作者最后呼吁除非受极端遗留平台限制,否则不要再使用 C89。
No.28
Ordinary Abundance
日常丰裕
290 分
150 条评论
作者: yen223
文章以一个普通夜晚的客厅、厨房和洗漱间为线索,把音乐、电灯、图像复制、眼镜、印刷、清洁自来水、冷藏、疫苗、麻醉、室内卫生间、洗衣机、缝纫机等日常便利,逐一放回其历史稀缺背景中,提醒现代生活包含大量曾被视为奇迹的成就。核心价值在于用「负面想象」对抗享乐适应,重新看见普通丰裕;争议在于这类感恩叙事可能弱化住房、医疗、环境与全球贫困仍未解决的现实。
No.29
Ruby 4.0 Universal RCE Deserialization Gadget Chain
Ruby 4.0 通用反序列化远程代码执行链
6 分
0 条评论
作者: pentestercrab
文章发布了一条新的 Ruby 通用反序列化 RCE gadget 链,可在 Ruby 4.0.6 上通过一次「Marshal.load」实现命令执行,并向后兼容到 3.3。作者回顾了 2018 年以来 Ruby 反序列化链的发展,说明 2024 年 Ruby 3.4-rc 链为何被 RubyGems 两个提交修补。新链利用「Gem::SpecFetcher」触发 autoload 扩大可用类集合,以「Gem::StubSpecification#hash」间接调用「Gem::Specification.load」读取并 eval 文件,再复用未修补的下载与目录遍历 gadget 将攻击者代码写入可控路径。文章强调触发点依赖 Hash 反序列化时调用 key 的 hash 方法,属于语言核心行为,难以用局部类型检查彻底封堵。
No.30
Choosing an AI model: one prompt, 11 models, different results
如何选择 AI 模型:同一提示词,11 个模型,结果各异
200 分
85 条评论
作者: toddmorey
Netlify 借与 OpenRouter 合作,在 AI Gateway 和 Agent Runners 中接入更多模型,并用内部开源评测工具 AXIS 比较 11 个模型在建站任务中的表现。文章先展示最简单的咖啡店单页场景:同一提示词让各模型生成静态网站,比较视觉结果、功能合理性与信用点消耗。结论是模型间及同模型多次运行的成本和风格差异很大,Claude Opus 可产出精致设计但偶尔消耗异常高;较便宜或开放模型也可能给出更朴素、可用甚至更不「AI 味」的结果。作者强调这是偏主观的探索,而非严格基准。
评论精华