No.01
Everything I own, owned
我拥有的设备,反过来被我接管了
756 分
220 条评论
作者: schlarpc
作者用 Claude Opus 5 对身边外设做代理式逆向工程:下载固件和升级工具,让模型分析更新格式、协议、安全校验和隐藏功能。结果发现 Insta360 摄像头可无交互刷写并关闭录制指示灯,ASUS 显示器固件几乎无保护,Shure 麦克风暴露带权限系统的明文 HID 命令壳且认证近乎形同虚设。文章一方面展示 LLM 大幅降低硬件逆向门槛、让用户重新控制设备,另一方面也凸显 USB、WiFi、WebHID 等入口下消费电子普遍缺少签名、安全启动和访问控制,未来可能引发更严格锁定或自动化攻击风险。
No.02
FDA clears blood test to aid evaluation for Alzheimer's disease
FDA 批准阿尔茨海默病辅助诊断血检上市
18 分
1 条评论
作者: dabinat
美国 FDA 批准 WashU 技术衍生公司 C2N 的血液检测「PrecivityAD2」上市,用于辅助评估有认知症状患者脑内是否存在与阿尔茨海默病相关的淀粉样斑块。该检测通过高分辨率质谱量化 Aβ42/40、p-tau217 和 total tau217,比脑脊液检测和脑扫描更少侵入,研究称诊断淀粉样病理准确率超过 90%。文章强调,随着减缓病程的新疗法出现,早期诊断有助于更早治疗;FDA 许可也可能推动临床采用和保险覆盖。
No.03
Anthropic Claude and API service outages
Anthropic Claude 与 API 服务中断
28 分
20 条评论
作者: vikrantrathore
这条 HN 讨论指向 Anthropic 状态页,核心是 Claude 与 API 近期发生服务中断,引发用户对其基础设施可靠性的集中质疑。由于原文只是状态/可用性页面,评论主要围绕为何会出现全球性故障、是否所有区域依赖同一套基础设施、以及 LLM 服务高负载下的运维复杂度展开。部分评论带有讽刺,认为 Anthropic 一边鼓励大量循环、自动模式和多子代理调用,一边没有准备好承载这些用法;也有人把问题归咎于所谓「vibe coding」和过度相信 AI 编程。另一个争议点是用户是否会因频繁故障转投其他模型,以及 Anthropic 的公益或有效利他形象是否仍能支撑用户忠诚。
No.04
I were 17, I'd learn how to build LLMs from scratch
如果我 17 岁,我会从零学习构建 LLM
47 分
94 条评论
作者: bilsbie
Paul Graham 在 X 上表示,如果自己回到 17 岁,会学习如何从零构建 LLM。由于原帖正文不可抓取,社区主要围绕这句话展开:支持者认为,重点不是训练出前沿模型,而是通过亲手实现理解当前最重要技术的底层机制,像早年学习收音机、微处理器、网页一样,可能激发未来创业和工程直觉;反对者则认为这是典型成功者事后视角和幸存者偏差,真正的大模型训练需要巨额算力、数据和数学基础,市场也未必需要只会玩具模型的人。评论还延伸到年轻人应学通用基础、写作、手艺、商业常识,还是追逐当下热门技术。
No.05
Your Open Source Model Could Have a Hidden Time-Release Backdoor
开源模型可能藏有定时触发的后门
28 分
18 条评论
作者: llmbababoom
文章提出一种针对开源大模型的「定时释放」后门:攻击者可在微调阶段把特定日期训练成触发器,使模型在正常日期回答问题,在触发日输出并执行恶意 shell 命令。作者以 OpenCode 1.18.19 为例,指出其每轮系统提示自动注入当前日期、平台和目录等环境指纹,给后门提供稳定触发条件;实验中 LoRA 微调的 Qwen 3.5 2B 在 2026 年 9 月 1 日对测试提示约九成触发,其他日期未误触。文章还称 Codex 等工具也会默认暴露当前日期。争议点在于:日期提示确实有实用价值,且具备工具权限的模型本来也可自行获取时间,根本风险或许在于让 LLM 不经确认执行命令。
No.06
Anthropic's best AI model struggles to attract users as cheaper tools thrive
Anthropic 最强模型遇冷,廉价 AI 工具更受欢迎
468 分
413 条评论
作者: naves
金融时报报道称,Anthropic 最高端模型 Fable 虽被定位为最强能力模型,但用户采用率不佳,便宜、够用、速度更快的竞品和开源模型正在抢走日常工作负载。评论区普遍认为,问题不只是模型能力,而是价格过高、额度限制、容量不稳定、企业缺少 ZDR 零数据保留选项,以及安全策略和发布方式让用户失去信任。也有人反驳称 Fable 在复杂编码和前沿任务上仍明显领先,只是多数用户的需求已经被中端模型满足,边际智能收益不足以支撑高价。争议焦点集中在:顶级模型是否只适合少数专业场景,以及闭源大模型公司能否靠「最强模型」维持增长。
No.07
How I find problems to solve as a staff engineer
Staff 工程师如何发现值得解决的问题
391 分
126 条评论
作者: vanpra
作者认为,Staff 工程师的价值不只是解决被分配的难题,而是发现组织尚未意识到的重要问题。他的方法是像海绵一样持续吸收会议、聊天、邮件中的日常摩擦,追问用户真实目标而非照单接收方案请求;让问题积累,观察它是否在多个团队独立出现,再寻找共同形态。以 Perfetto 为例,多个看似分散的 UI 请求最终指向同一需求:让团队能按自身流程扩展界面。作者也强调,优雅的抽象只是 hypothesis,需要用原型、RFC 和反馈压测,避免把不同问题硬合并。评论区则指出,这种做法高度依赖公司环境、授权和激励机制,在创业公司或强自上而下组织中未必适用。
No.08
OCR It – pull text out of un-copyable documents for your LLM
OCR It:从无法复制的文档中提取文本给 LLM
12 分
4 条评论
作者: thiagolima
OCR It 是一个面向 LLM 工作流的 OCR 工具,用来从无法复制、扫描版或受限制的文档中提取文字。根据评论,它支持先固定页面区域,再通过快捷键逐页识别,也能自动翻页;翻页方式可基于快捷键、屏幕坐标或页面选择器,适合把整本书或长文档批量转成文本。社区认为它解决了给 LLM 准备上下文时常见的痛点,尤其是低可复制性资料。不过也有人指出,Windows PowerToys 已内置类似文本提取功能,是否选择浏览器扩展还涉及信任和权限考量。另一个关注点是低质量扫描件的识别准确率,目前评论中尚未给出明确数据。
No.09
The Work Number: credit score but for your employment history – by Equifax
Equifax 的雇佣履历核验服务 The Work Number
8 分
4 条评论
作者: firefoxd
The Work Number 是 Equifax 旗下的收入与雇佣信息自动核验服务,面向购房、求职、申请政府福利等场景。官方称,雇主或数据提供方把就业与收入记录接入后,具备资质且符合 FCRA 合法用途的核验方可自动获取信息,从而减少申请人提交工资单、证明信等材料的麻烦,并加快审批。争议点在于,这类服务本质上形成了类似信用报告的雇佣履历数据库,覆盖求职背景调查等高影响场景;虽然网站强调个人可查看并管理访问权限,但用户实际知情、纠错、冻结或拒绝共享的便利性与透明度仍是社区关注焦点。
No.10
I built a low-latency AI companion that plays Skyrim with me
低延迟 AI 游戏伙伴陪我玩《天际》
119 分
19 条评论
作者: pantelisk
作者展示了一个名为 Varkos 的《天际》AI 伙伴,目标不是只会聊天的 NPC,而是能在低延迟下战斗、拾取、搜寻、转交物品、执行多步条件指令,并在 VR 中保持沉浸感。系统强调本地和隐私:语音识别、行动规划、游戏桥接等尽量走本地快速路径,只有慢速人格演化仍依赖大模型或云端。Varkos 会记忆共同经历,性格与情绪稳态逐步变化,还可进入跨游戏的「虚空模式」。文章的核心价值在于把 LLM 与传统 NLP、行为图、游戏原生控制结合,避开单纯堆上下文带来的延迟和不可靠。争议主要集中在是否真正本地、成本硬件门槛,以及玩家对游戏中 AI 内容的接受度。
No.11
New EU-wide product repair rules come into force
欧盟「维修权」新规生效,推动消费品修而非换
61 分
7 条评论
作者: austinallegro
欧盟新的「维修权」规则已生效,目标是减少消费品过早报废造成的约3500万吨废弃物,并鼓励消费者在保修期后选择维修而非更换。新规覆盖洗衣机、吸尘器、手机、平板等家电和电子产品,要求部分产品制造商在技术上可修时承担维修义务,且维修应免费或价格合理、在合理时间内完成。制造商还需公开维修服务信息,并以合理价格提供备件。爱尔兰将扩展 RepairMyStuff.ie 作为国家维修平台。欧盟预计新规可带来48亿欧元增长和投资,但社区评论质疑规则是否足够,特别是旧设备软件更新和用户自主安装系统的限制。
No.12
Migrating a Synology NAS to a UniFi UNAS Pro 8 with Robocopy, SMB Multichannel
用 Robocopy 与 SMB 多通道把 Synology NAS 迁移到 UniFi UNAS Pro 8
48 分
38 条评论
作者: soheilpro
作者记录从 Synology NAS 迁移到 UniFi UNAS Pro 8 的排障过程。Windows Explorer 复制音乐文件时报「文件系统限制」,Robocopy 显示错误 665,最终发现问题不是文件名,而是 NTFS「备用数据流」:某个 .m4p 文件带有额外 JPEG 数据流,目标 NAS 写入失败。解决办法是在 Robocopy 中用「/COPY:DATX」和「/DCOPY:DATX」跳过 ADS。随后作者又发现常用的「/Z」可重启模式会显著拖慢局域网迁移,移除后约 48GB 数据以 187MB/s 完成。「/MT」多线程有用,但需按小文件、多文件等实际负载调参,不能迷信固定值。评论区则围绕 Robocopy、rsync、rclone、SMB Multichannel 和直接 NAS 间复制展开争论。
No.13
My agent.md to improve LLM-assisted code quality
用 agent.md 提升 LLM 辅助编程质量
295 分
120 条评论
作者: ibobev
作者回顾自己从 2025 年到 2026 年使用 LLM 写代码的变化:模型已能完成复杂数据结构并定位底层 bug,但默认代码常缺结构、注释和生产级风格。为减少反复口头纠正,他把个人编码偏好写进项目根目录的 agent.md,包括少废话、避免魔法值、降低缩进、短函数名、用枚举替代布尔参数、保持分层边界、少改无关代码、规范提交信息,以及修 bug 先写失败测试。作者认为这显著改善输出,使审查重点从风格转向架构,但仍必须人工验证;长上下文还会带来「注意力稀释」,需要定期让代理重读或维护规则。
No.14
Google Workspace thinks my domain is an email provider (2025)
Google Workspace 误把我的域名当成邮箱服务商
280 分
85 条评论
作者: el1s7
作者为公司注册 Google Workspace 时,输入合法的 premium .one 域名却被提示「请输入有效域名,而不是邮箱服务商」。Google 支持多次要求换浏览器、录屏,工程团队最终建议换域名,未能解释或修复。作者自行调试注册页发现,拦截来自前端本地校验:Google 用一长串正则匹配邮箱服务商,其中「web\..*」会误伤所有 web.TLD 域名,「me\..*」还会误伤乌克兰经济部的 me.gov.ua。禁用该函数后注册可继续,说明规则并非后端强制。文章批评 Google 的支持和风控流程粗糙、不可解释,也暴露安全校验只放前端的荒诞。
No.15
What Is a Harness?
什么是 AI Agent Harness
426 分
149 条评论
作者: tosh
文章面向非技术读者解释 AI 语境中的「harness」:它不是模型本身,而是让模型成为 agent 的软件环境,类似攀岩安全带,负责承载、约束并连接工具。作者将 agent harness 拆为四部分:系统提示词、可调用工具、驱动模型反复评估和行动的 agentic loop,以及适配不同模型的翻译层。其核心价值在于用户可拥有、修改并迁移自己的 harness,在 OpenAI、Anthropic 或开源模型之间切换,保留会话与工作流控制权。争议在于社区认为该词可能只是新一轮 AI 营销术语,或本质上接近既有的框架、编排与测试 harness 概念。
No.16
Andreessen Horowitz is investing billions into a bleak future
a16z 投资组合中的灰暗 AI 未来
28 分
4 条评论
作者: reasonableklout
文章批评 Andreessen Horowitz 一边试图影响美国 AI 政策,一边投资多家被指利用监管漏洞、操纵用户或触犯法律的公司。作者列举 18 个案例,重点包括 Doublespeed 这类用手机农场和假账号伪装真人内容、推广 AI 生成广告的公司,以及 AI 作弊、陪伴应用、深伪模型、赌博和问题金融科技平台。文章认为,a16z 正通过超级 PAC、政府人脉和行政令游说削弱州级 AI 监管,而其投资组合恰恰显示宽松规则会让公司获利、让公众承担欺骗、隐私和消费者保护风险。a16z 未回应置评请求。
No.17
How Complex Systems Fail (1998)
复杂系统为何会失效
305 分
72 条评论
作者: shortcrct
文章提出,交通、医疗、电力等复杂系统天然带有不可消除的危险,安全依赖多层技术、人、组织和监管防线。灾难通常不是单一故障造成,而是许多看似微小、长期存在的缺陷在特定时刻耦合;系统平时能运行,正因为有冗余和一线人员不断修补、权衡产出与风险。事故后寻找「根因」往往受后见之明和归责需求驱动,低估了操作者当时面对的不确定性与组织压力。评论争议集中在「根因分析」是否仍有价值、混沌工程能否帮助学习失败,以及该理论如何应用到软件、医疗、经济等领域。
No.18
LLM Tool Failures: Only 3 Root Causes – Value, Condition, Intent
LLM 工具失败的三类根因:值、条件与意图
5 分
1 条评论
作者: offaxis
文章可能主张,LLM 在调用工具或执行任务时的失败并非随机,可归纳为三类根因:「值」错误,即参数、字段、输入内容不对;「条件」错误,即前置状态、环境约束或执行时机不满足;「意图」错误,即模型误解了用户目标或越权补全了任务。标题暗示作者希望用执行前检查来约束模型,把对话中的推理优势转化为可验证的执行流程。唯一评论指出,推理在聊天中是优势,但在执行中会变成风险;问题不只是事后问模型是否真的运行,而是应在执行前限制或校验模型的权限与状态,避免它用推断替代真实操作。
No.19
Over 5,200 Ebola cases recorded in Congo
刚果埃博拉疫情百日:病例超 5200,传播速度超过防控
16 分
2 条评论
作者: simonebrunozzi
刚果民主共和国本轮埃博拉疫情已持续 100 天,累计病例超过 5200 例,成为该国增长最快的一次疫情。前三个月日均约 90 例确诊,疫情已扩散至第六个省,伊图里省仍是中心,约占病例 85%、死亡 79%。世卫组织称,传播速度正超过现有防控能力,社区死亡占近六周每周约 260 例死亡中的 60%,显示早发现、转诊和治疗可及性仍不足。尽管实验室、床位、感染控制和接触者追踪已有明显扩容,但冲突、不安全、人口流动、卫生设施遇袭和社区抵触仍严重阻碍响应。WHO 呼吁扩大资源投入、加强跨境监测,并强调停火对前线团队进入疫区至关重要。
No.20
AI Chip Architectures
AI 芯片架构综览
68 分
26 条评论
作者: Finbarr
文章从 Hennessy 与 Patterson 2018 年提出「计算机架构新黄金时代」谈起,指出摩尔定律与登纳德缩放放缓后,AI 推动领域专用架构爆发。作者围绕训练、预填充与解码三类负载解释矩阵乘法、内存墙和数据搬运为何成为核心瓶颈,并提出理解芯片的四个问题:数据存放、移动方式、计算单元形态、芯片间扩展。正文重点梳理已规模部署的路线,包括 NVIDIA/AMD GPU、Google TPU、AWS Trainium、Cerebras 晶圆级引擎与 Groq LPU,尤其详述 NVIDIA GPU 从 CUDA Core 到 Tensor Core、warp/wgmma、FP8/FP4 等演进。争议主要在于文章信息密度高但可读性差,部分读者质疑其 AI 生成痕迹。
No.21
Malware infects Android-based automotive head unit firmware
安卓车机固件更新链被植入恶意软件
234 分
121 条评论
作者: campuscodi
卡巴斯基披露一条针对安卓车机的供应链式感染链:DoFun 车机中的合法系统应用 TWCore 通过 MQTT 更新机制接收 APK 安装指令,且可安装设备原本不存在的应用,攻击者借此下发无界面的 JarService 投放器,再经多阶段加载器获取最终载荷。恶意软件主要用于广告欺诈和构建代理僵尸网络,会收集设备型号、分辨率、Wi‑Fi SSID、MAC 等信息,并定期向 C2 拉取配置和任务。研究方将其高置信度归因于与 BADBOX 僵尸网络相关的 MoYu Group,并称厂商已修复相关问题。争议集中在披露未说明更新服务器究竟如何被控制、是否为厂商灰色变现,以及车机联网和 CAN 总线连接带来的更大安全风险。
No.22
Fable and the end of the free lunch
Fable 与免费午餐的终结
147 分
117 条评论
作者: dbreunig
作者借「摩尔定律免费午餐」类比 AI 编程:过去新模型会以相同或更低价格变强,掩盖糟糕的上下文与工具链;但 Fable 虽强,成本、访问控制、动态降级和数据留存要求让团队开始重新思考「什么任务交给什么模型」。他认为 GLM 5.2、Opus、K3、Qwen 等便宜模型在良好上下文下足以处理大量例行编码,高端模型更适合设计、审查和策略。评论区主要争议在于类比是否成立、前沿模型是否仍会压倒一切,以及安全限制和价格是否正在推动多模型分工成为常态。
No.23
My favorite nonfiction books about cults, scams, and schemes
我最喜欢的关于邪教、骗局与阴谋的非虚构书
224 分
82 条评论
作者: bwb
文章是一份关于邪教、诈骗与操控机制的非虚构书单,重点推荐 Amanda Montell 的《Cultish》等作品,强调邪教并非只存在于极端宗教或犯罪组织中,而是一条影响力光谱:语言、归属感、身份认同和群体压力会在创业公司、健身课程、美妆社群、社媒导师等日常场景中发挥作用。书单的价值在于帮助读者识别不当影响、权威控制和骗局叙事;评论区则补充了更多经典读物,也争论了「邪教」概念是否被滥用、回忆录可信度以及如何区分宗教、社群与操控组织。
No.24
Executable Is a SQLite Database
把可执行文件做成 SQLite 数据库
8 分
0 条评论
作者: setheron
作者提出并实现原型「SELF」,尝试用 SQLite 取代 ELF 作为真正可 chmod +x 运行的可执行格式。其核心观察是 ELF 本质上像一个手写数据库:段、符号、动态链接信息和索引都由各类工具重复解析和序列化。SELF 将加载段放入 segments 表,把符号表、版本、导入导出等信息变成可查询表和索引,strip 可变成 DELETE 和 VACUUM,patchelf 可变成 UPDATE。运行上通过 SQLite 的 application_id 标记 SELF,再用 binfmt_misc 调用 self-exec 解释器,由其映射段、重定位并跳转入口。文章价值在于展示可执行格式若具备自描述、事务和查询能力,会显著改善分析与修改工具链;争议点则在于性能、兼容性、动态链接复杂度和是否值得替代成熟 ELF 生态。
No.25
Elevated Errors for Multiple Models
Claude 多个模型出现错误率升高
22 分
7 条评论
作者: rob
Anthropic 状态页通报称,Claude Mythos 5、Fable 5、Opus 5、Opus 4.8 等多个模型出现请求错误率升高,影响范围包括 claude.ai、Claude API、Claude Code 和 Claude Cowork。事件从 UTC 05:06 开始调查,05:27 确认原因并着手修复,之后持续更新称正在恢复。到 07:47,Opus 5 与 Fable 5 的错误已趋于稳定,但部分受影响模型的成功率仍未完全恢复。社区关注点集中在可用性、错误提示不清、529 过载错误,以及用户在模型服务之间切换成本快速降低。
No.26
Why Sal Khan't: On Learning by Making but Teaching by Telling
为什么 Khanmigo 没能带来 AI 教育革命
175 分
104 条评论
作者: the-mitr
文章借 Khanmigo 使用率低、Sal Khan 承认其对多数学生是「非事件」,批评教育科技长期把学习误解为更高效地传递内容。作者指出,Khan 自己学习时会阅读、画图、追问、请教朋友并制作作品,但其产品让学生主要观看视频或与聊天机器人接收解释,缺少真实目的和创造任务。文章用杜威的「探究、建构、表达、沟通」四种学习冲动说明:动机来自做中学,而非被告知。争议在于评论区许多人认为文章低估了 Khan Academy 的练习、测验和翻转课堂价值,也把 Khanmigo 的失败与视频教学混为一谈。
No.27
Implementation of GPT-2 in pure CMake
用纯 CMake 实现 GPT-2
75 分
15 条评论
作者: porridgeraisin
这个项目把 GPT-2 用纯 CMake 实现,显然不是为了实用性能,而是一次把构建系统当编程语言的极限实验。评论普遍把它视为类似「用 C++ 模板证明图灵完备」或「在奇怪设备上跑 Doom」的黑客艺术:荒诞、反直觉,但能展示作者对 GPT-2 和 CMake 的理解。主要争议在于性能和意义:有人指出 CMake 单核执行、速度可能慢到难以观察结果;也有人质疑 CMake 本身并不优雅。但支持者认为这类无用工程的价值正在于让人产生强烈感受,并展示工具复杂性。还有评论注意到代码注释和文件头可能带有 AI 辅助痕迹。
No.28
Explain it to me like I'm ten
像给十岁孩子讲一样解释
125 分
48 条评论
作者: bookofjoe
文章借 xkcd 的「Up Goer Five」和苏斯博士在词汇限制下写出经典童书的例子,讨论限制如何迫使专家重新思考表达。作者承认把复杂概念压到一千常用词未必更清楚,甚至可能显得居高临下;但「像给十岁孩子讲」能提醒专家补回基础语境,避免术语和缩写掩盖真正解释。类似地,为女性士兵、残障者或老人设计的产品常因更细致、更模块化而惠及所有人。文章强调,不能把服务少数群体的价值工具化为服务多数,但这些极端需求能成为改进沟通和设计的有效提示。
No.29
The first search engine for Internet-connected devices
Shodan:面向联网设备的搜索引擎
18 分
0 条评论
作者: momentmaker
Shodan 将自己定位为超越传统网页搜索的互联网基础设施搜索平台,重点索引直接暴露在公网的设备与服务,包括工厂设施、移动设备、家电、游戏服务器和云端资源。它提供网络暴露面监控,帮助组织在数分钟内发现网段中哪些资产可被互联网访问,并在异常服务出现时发出实时通知。平台还面向开发者开放爬取、IP 查询、搜索和数据流 API,可用于 VPN 识别、网站风险判断和全球 IP 情报增强。其价值在于把互联网资产可见性产品化,但原文主要是官网介绍,缺少对误用风险、隐私边界和安全责任的展开讨论。
No.30
A website for debloated open source alternatives
一个收录去臃肿开源替代品的网站
319 分
100 条评论
作者: ryanvogel
debloat.dev 是一个极简目录网站,主打无追踪、无 Cookie、SSR 和可用文本浏览器访问,用来发现更轻量的开源替代品。页面本身几乎没有正文,价值主要在分类收录和浏览体验:社区普遍称赞它比 AlternativeTo 等站更清爽,也能快速找到 Immich、G-Helper 等实用工具。但争议集中在「去臃肿」标准不清:Nextcloud、Tailscale 等被认为已有产品蔓延,部分分类重复;站点还出现 Firefox SSL 报错、证书链异常、负载过高和企业网关拦截等可靠性问题。
评论精华