No.01
Claude Code is steganographically marking requests
Claude Code 被发现暗藏隐写标记系统,监控用户 API 路由行为
1860 分
526 条评论
作者: kirushik
安全研究员发现 Claude Code(2.1.196)二进制文件中内嵌了一套隐写标记机制:当检测到用户设置了自定义 API 端点(ANTHROPIC_BASE_URL)、系统时区为亚洲/上海或亚洲/乌鲁木齐、以及主机名匹配特定关键词(如 deepseek、zhipu 等)时,程序会悄然修改系统提示词中的日期格式——将「Today's」中的撇号替换为不可见字符,把日期分隔符「-」改为「/」。这些微调肉眼难以察觉,却会将代理/网关/转售商分类信息编码进提示词发送给模型。域名列表和关键词库经过 base64 + XOR(密钥 91)混淆存储。作者认为,这一功能虽用于检测模型「蒸馏攻击」和未授权网关,却选择了最糟糕的实现方式——用不可见的 Unicode 标记隐藏本可显式声明的遥测字段。对于使用自定义 API 路由的合法开发者而言,这既不透明又极易绕过,实际上只会误伤正常使用场景,核心诉求是希望 Anthropic 能将此类安全机制写成文档、写入发布说明,而非躲在看不见的地方。
No.02
Claude Sonnet 5
Anthropic 发布 Claude Sonnet 5:最具代理能力的 Sonnet 模型
1087 分
625 条评论
作者: marinesebastian
Anthropic 发布 Claude Sonnet 5,定位为最具代理能力(agentic)的 Sonnet 系列模型,能自主规划、使用浏览器和终端等工具,性能接近 Opus 4.8 但价格更低。Sonnet 5 在推理、工具使用、编码和知识工作方面均优于前代 Sonnet 4.6,且整体不良行为率更低。定价方面,推广价为每百万 tokens 2 美元输入/10 美元输出(至 2026 年 8 月 31 日),之后恢复为 3/15 美元。不过,评测显示 Sonnet 5 在高推理水平下性价比不如 Opus 4.8,且使用了新版 tokenizer(token 映射增加约 1.0-1.35 倍),实际成本可能上升。安全方面,Anthropic 未针对网络安全任务进行专门训练,模型相关能力显著弱于 Opus 系列,并默认启用网络安全 safeguard。
No.03
The first early human eggs from stem cells
世界首次:人类干细胞培育出早期卵细胞
79 分
22 条评论
作者: dsr12
Conception公司宣布首次从人类干细胞(iPSCs)中培育出早期卵细胞。该技术路径为:血液样本→诱导多能干细胞(iPSCs)→构建3D「迷你卵巢」→经历完整减数分裂→形成原始卵泡。研究在小鼠中已获验证(2016年),此次是人类层面的重要突破。关键成果包括:迷你卵巢自行组织成卵巢典型结构;细胞正确完成减数分裂并形成联会复合体;成功构建疑似全球首批完全由iPSCs分化而来的人类卵泡。该技术若成熟,可让女性无需激素注射和手术即可获得大量健康卵子,并显著推迟生育年龄。但评论担忧线粒体损伤的跨代遗传风险——线粒体在生命传续中需保持最年轻状态,而用成年细胞来源的干细胞制卵可能引入累积损伤。此外该技术亦引发对人类生殖干预长期伦理风险的讨论。
No.04
ArXiv's Next Chapter
arXiv 独立之路:从 Cornell 分离,成立独立非营利组织
75 分
10 条评论
作者: subset
2026 年 7 月 1 日,开放获取论文平台 arXiv 将正式从康奈尔大学分拆,成为独立非营利组织,结束 25 年的隶属关系。arXiv 强调此次转型不影响其核心使命:继续免费向全球用户提供论文阅读和提交服务,坚持科学开放精神,让所有人平等获取前沿科研成果。平台已上线 FAQ 页面说明治理与领导层变化,并预告未来数周将发布系列博文,涵盖新工程总监任命、300 万篇投稿里程碑及 AI 相关政策更新。社区对此反应不一:有人视独立为机遇,也有人担忧非营利转型后能否抵御商业利益侵蚀,并建议向 AI 训练数据收费以实现可持续运营。
No.05
Google copybara: moving code between repositories
Google 开源 Copybara:在仓库间移动代码的工具
186 分
28 条评论
作者: reconnecting
Copybara 是 Google 开源的工具,用于在代码仓库之间移动代码并同步修改。评论指出,它特别适合大型组织将内部代码库的部分内容开源发布到 GitHub,能处理路径重映射、提交作者修改等转换操作。与 git subtree 不同,Copybara 不仅搬运代码,还会对代码进行适配性改造(如 BUILD 文件转换)。使用建议:如果是单向同步且需要转换,开箱即用;如果是双向同步或包含大量提交,使用本地仓库路径能显著提升性能。有用户提到 Jujutsu VCS 也能用极简方式实现类似功能。总体评价是「你早该配置好它」,但也有人担心项目被归档维护的风险。
No.06
Department of Commerce has lifted export controls on Claude Fable 5 and Mythos 5
商务部解除对Claude Fable 5和Mythos 5的出口管制
626 分
338 条评论
作者: Pragmata
美国商务部宣布解除对Anthropic旗下Claude Fable 5和Mythos 5两款旗舰模型的出口管制,Anthropic随即宣布将于次日起恢复访问。这两款模型在约两周半前被施加管制,引发开发者强烈不满。评论普遍批评美国政府决策缺乏可预测性,企业难以在SOTA模型上构建关键业务。Anthropic承诺将「主动检测并应对模型相关安全风险」,但用户质疑这与此前已做的事无异。更深的担忧在于:一旦中国等竞争对手发布功能相近的「自由版」模型,美国的管制策略将不攻自破。部分用户指出,真正的漏洞在于美国经济对AI过度暴露,以及政府对关键技术实施的混乱管控。
No.07
Claude Science
Anthropic 发布 Claude Science 科研 AI 工作台,支持蛋白质/基因组等科学数据可视化与数据库查询
465 分
141 条评论
作者: lebovic
Anthropic 发布 Claude Science Beta,这是一款面向科研场景的 AI 工作台,可直接在应用中可视化蛋白质、结构、分子、基因组数据,并连接 60+ 科学数据库。内置基因组、单细胞、蛋白质组、结构生物学、化学信息学等领域专属技能,支持通过 SSH 连接 HPC 集群或 Modal 执行批量任务,所有产出物均保留完整代码、环境与对话记录以确保可重复性。该应用现面向 macOS 和 Linux 的 Pro/Max/Team/Enterprise 用户开放,学术实验室可申请折扣 Team 计划。
No.08
Matrix Orthogonalization Improves Memory in Recurrent Models
矩阵正交化提升循环模型记忆能力
28 分
2 条评论
作者: at2005
本文探讨如何提升循环神经网络(RNN)在联想记忆任务上的表现。研究灵感来自 Muon 优化器——该优化器通过正交化动量防止少数强方向主导更新,从而改善尾部关联记忆。基于此,作者对 mLSTM(一种保持矩阵记忆的 LSTM 变体)的读取过程施加正交化操作(归一化 + 5 次牛顿-舒尔茨迭代),在 MAD 噪声联想记忆基准上测试。结果显示,正交化显著提升噪声联想记忆(NAR)准确率,且任务越困难提升越明显——在词汇量 96、序列长度 768/1024 的困难场景下,成功种子数从 4 提升至 14-16。作者提醒这是小模型实验,NAR 收益能否迁移到真实世界大规模任务仍待验证。
No.09
Nano Banana 2 Lite
Google 发布 Nano Banana 2 Lite:主打极速图像生成
363 分
144 条评论
作者: minimaxir
Google DeepMind 发布 Nano Banana 2 Lite 图像生成模型,核心卖点为速度——生成时间低于 5 秒,相比标准版 NB2 缩短约 6 倍。该模型面向 Artlist 用户,帮助创作者减少等待时间、提升迭代效率。评测显示其在延迟上显著优化,但价格仍较高(每千张分辨率约 0.0342 美元)。社区反馈:速度确实惊艳,有用户为孩子开发了 AI 故事生成应用;但比较图表刻意排除 ChatGPT Image 2引发质疑;Grok 图像模型在多项指标上反而更优。此外,Google AI Studio 要求 Google One 账户导致部分用户无法使用,且批量生成时频繁出现 RESOURCE_EXHAUSTED 错误。隐私方面,页面称所有图像均带有 SynthID 隐形水印,但部分用户对此存疑。
No.10
Leanstral 1.5
Mistral 发布 Leanstral 1.5:119B 参数的 Lean 4 形式化证明模型
193 分
53 条评论
作者: vetronauta
Mistral 于 2025 年 6 月 30 日发布 Leanstral 1.5,这是一款针对 Lean 4 形式化证明工程优化的模型,总参数 119B、活跃参数 6.5B,上下文窗口 256k,完全免费。该模型专注于自动定理证明和自动形式化(autoformalization),旨在将自然语言数学表述转换为严格的 Lean 4 形式化证明。社区评价呈现两极:一方面认为专用化策略和性能值得肯定,另一方面诟病 Mistral 糟糕的付费墙设计——用户反映注册后无法使用「labs model」且客服渠道形同虚设。另有开发者指出 Mistral 批量处理无缓存导致成本是 Google 的 10 倍。
No.11
How does a pull-back car work? Illustrated teardown
回力车工作原理:齿轮传动与弹簧蓄能详解
177 分
34 条评论
作者: Muhammad523
文章以图文并茂的方式深入拆解回力车(pull-back car)的机械原理。核心机制是利用齿轮系统将拉力转化为弹簧弹性势能,再释放驱动车轮:操作者向后拉动车辆时,驱动轴带动大齿轮旋转,大齿轮通过啮合将动力传递给小齿轮——由于小齿轮半径更小,相同角速度下其线速度反而更高,从而实现增速效果。文章特别指出,两个相互啮合的齿轮总是沿相反方向旋转(大齿轮顺时针则小齿轮逆时针),这一特性是理解整个传动系统的关键。评论区聚焦于多个延伸话题:有人好奇发条齿轮为何采用螺旋缠绕轴心的设计,而非直接连接 axle 与弹簧齿轮;还有用户将类似原理应用于医疗场景(如 GLP-1 自动注射针、肾上腺素笔),惊叹于这类一次性装置的机械巧思;此外「过度上弦」时发出的急促滴答声也引发讨论,实际是弹簧外壳内置的过载保护机制在起作用。
No.12
Forestiere Underground Gardens
弗雷斯诺地下花园:一个西西里移民用40年在加州沙漠凿出的地下乌托邦
63 分
13 条评论
作者: onemoresoop
Forestiere Underground Gardens 是位于加州弗雷斯诺的一片地下建筑群,由西西里移民 Baldassare Forestiere 从1906年至1946年(历时40年)独自徒手挖掘建造。Forestiere 发现当地硬土(hardpan)不适合种植柑橘,且夏季酷暑难耐,受罗马地下墓穴启发,他开始在地下凿洞居住,并意外发现植物在有天窗的地下空间反而能避开霜冻、生长良好,于是将居住空间与果园结合,逐步扩展出65间房间、三层深度(10至23英尺)的地下王国,内含夏/冬季卧室、浴室、厨房、鱼池、壁炉客厅,配有天窗和雨水收集系统,植物已被嫁接成可结多种果实。这座建筑于1977年列入美国国家史迹名录、1978年列为加州历史地标。1998年,作家 T. Coraghessan Boyle 在《纽约客》发表以此为原型的短篇小说《The Underground Gardens》。
No.13
CERN bids farewell to the LHC and enters Long Shutdown 3
CERN告别LHC进入长期停机维护3期,高亮度升级2029年重启
210 分
54 条评论
作者: HelloUsername
欧洲核子研究中心(CERN)的大型强子对撞机(LHC)完成第三运行期后正式停机,进入Long Shutdown 3(LS3)阶段,将耗时约三年进行大规模维护、整合与升级,为2030年高亮度LHC(HiLumi LHC)做准备。LHC自2008年首次出光以来完成了众多重大发现,其中最著名的是2012年证实希格斯玻色子的存在。此外还发现了超过85种强子、探索了夸克-胶子等离子体性质等。LS3期间仅LHC就有1.2公里的磁体和组件将被拆卸替换,ATLAS和CMS探测器将全面更新触发系统,换装全硅径迹探测器和高精度定时探测器,以应对升级后每秒超过50亿次碰撞。HiLumi LHC亮度将提升至原先的10倍,使研究人员能以前所未有的精度研究希格斯玻色子并寻找标准模型之外的新物理现象。
No.14
I ported Kubernetes to the browser
展示: 我把 Kubernetes 移植到了浏览器里
246 分
76 条评论
作者: peterdemin
作者用两个月时间将 Kubernetes 部分移植到 TypeScript,创造了「webernetes」项目,可在浏览器中运行模拟集群。该项目包含约 10 万行代码、552 次提交、629 个文件,体积仅 140KiB(远小于编译 Go 到 WebAssembly 的方案)。它实现了 Pod 生命周期、集群 DNS、容器垃圾回收、IP 分配、Deployment/ReplicaSet 跟踪等核心功能,但不使用真实 Docker 镜像,而是通过 TypeScript API 定义镜像并配有浏览器端注册表。作者坦言几乎所有代码均由 LLM 生成,关键在于严格的 review discipline 来确保与 Kubernetes 行为一致——他通过双环境测试(k3s 与 webernetes)验证正确性。项目面向交互式 Kubernetes 教学内容创作,非生产级发行版。
No.15
How information theory saved my word game
信息论如何拯救了我的填词游戏
9 分
12 条评论
作者: jamwise
作者想开发一款「永不猜测」的填词游戏——玩家每一步都能通过纯逻辑推理确定字母位置。他花了数月构建词典,但生成器跑出数千个棋盘后,能被人类纯逻辑破解的仅有几十个,几乎全军覆没。他一度以为项目已死,直到意识到这本质上是一个通信问题:谜题是信道,玩家是解码者,而「可推断」意味着棋盘上的空格构成「独立集」——任意两个空格永远不可能混淆(confusable)。作者借助香农1956年的信息论(尤其是「五个信号打包使用胜过逐个发送」的结论)解决了问题:打包传输时安全消息数量乘以√5(约2.236),远优于逐个传输的乘以2。通过在生成每一步就确保独立集不被破坏,他终于能系统性地构建可推断棋盘。
No.16
Pystd, similar-ish functionality with a fraction of the compile time
Pystd:用 Python 风格 API 重新发明 C++ 标准库,编译速度快 80%
22 分
18 条评论
作者: ibobev
作者开发了 Pystd——一个从零编写、不照搬 ISO 规范的 C++ 标准库,核心解决「C++ 编译奇慢」这一痛点。实测单含 vector 头文件预处理后膨胀至 29000 行代码,编译 hello world 比 C 慢约 100 倍。Pystd 将编译速度列为最高设计优先级,全量构建仅需 4 秒(单核),开启优化 9 秒,16 核并行仅 1.9 秒;代码总量约 12100 行,仅为 std::vector 预处理后体量的三分之一。作者为所有公共头文件设定了 0.15 秒的严格编译时间预算,并将 CapyPDF 项目迁移至 Pystd:编译时间下降 80%,二进制体积缩小 75%(未strip),运行时性能反而提升 25%。评论指出项目名「pystd」易被误认为 Python 相关,Python 风格 API 设计引发争议,C++ 模块(import std)的成熟度也是讨论焦点。
No.17
From brain waves to words: a new path to communication without surgery
Meta 发布 Brain2Qwerty v2:非侵入式脑电转文字准确率达 61%,无创解码新突破
149 分
77 条评论
作者: alok-g
Meta AI 发布 Brain2Qwerty v2,这是一种非侵入式脑电转文字系统,利用 MEG(脑磁图)设备在无需手术的情况下将大脑活动解码为文字。该系统在约 22,000 句、9 名志愿者的数据上训练,采用端到端深度学习而非手工特征工程,并结合大语言模型引入语义上下文。最终达到 61% 的单词准确率,远超其他非侵入式方法的 8%;最佳参与者更达到 78%,超过一半的句子解码仅含一个或零个错误。研究还发现准确率随数据量对数增长,暗示未来可通过数据扩展进一步逼近侵入式方法的效果。Meta 同时开源了 v1 和 v2 的训练代码,合作方 BCBL 发布了 v1 数据集。社区评论聚焦于隐私担忧——Meta 作为广告公司研发脑机接口令人警惕,有人呼吁制定严格的神经数据隐私法律;也有评论认为应关注残障人士的实际应用价值,以及如何降低 MEG 设备的成本门槛。
No.18
Ante: A new way to blend borrow checking and reference counting
Ante:融合借用检查与引用计数的新系统编程语言
85 分
20 条评论
作者: g0xA52A2A
Ante 声称实现了业界首个将引用计数与借用检查无缝融合的方案,且无运行时崩溃。传统语言如 Rust 使用 Rc<RefCell<T>> 时仍可能 panic,Swift 的独占检查也有运行时开销。Ante 通过「形状稳定性」概念实现这一突破:指向稳定形状数据的引用,在其他变量被修改时始终有效,从而允许多个可变借用同时指向同一结构。开发者可用 `shared` 关键字让类型自动引用计数,需要高性能时用借用检查。文章展示了平衡红黑树的代码,声称比 Rust 和 C++ 等效实现更简洁。评论中有人质疑多线程安全性和语法可读性,Ante 作者澄清语言继承 Rust 的 Send/Sync 机制确保线程安全。
No.19
Tokyo has only two barley tea makers, we visited one to see how mugicha is made
东京仅存两家大麦茶制造商,我们实地探访了解麦茶制作工艺
125 分
24 条评论
作者: zdw
东京仅有两家大麦茶(麦茶/mugicha)制造商,文章探访了位于江户川区的Ogawa Sangyo。大麦茶实际上不含任何茶叶成分,纯由大麦制成。Ogawa Sangyo坚持使用国产大麦(主要来自茨城县、栃木县、富山县),为追求更丰富的风味,采用两种不同品种的大麦。烘烤环节尤为讲究:使用直接火烤而非热风对流,并用沙子辅助均匀传热。两阶段烘烤——先在250度下烘1分钟,再以180度烘1分钟。经两次烘烤后的大麦粒膨胀变色,散发着类似爆米花的香气,尝起来还有刺激的松脆感。茶包装环节每分钟可封装50个茶包,三角茶包因内部空间更大、热水流动更充分,风味优于矩形茶包。工厂温度比室外高出约10度,工人的辛劳可想而知。
No.20
Homemade Transistor from Cadmium Sulfide Photocell (2009)
用硫化镉光敏电阻自制场效应晶体管
5 分
3 条评论
作者: thenthenthen
2009年文章,作者用常见硫化镉光敏电阻(购自Radio Shack)自制出场效应晶体管(FET)。方法是:在光敏电阻表面贴透明胶带绝缘,再滴水滴作为导电门极,金属丝接触水滴作为门电极。由于光敏电阻在正常光线下已饱和,实验必须在暗室中进行。施加75-175V门极电压时,漏极电流(9-175V电池驱动)发生明显变化,证明晶体管效应。该器件属增强耗尽型绝缘栅FET,门极阻抗极高(仅通过胶带微漏电流),功耗增益可观,但电压增益极低(约1/10)。作者用60Hz人体感应电信号测试,成功放大可闻声响。评论者关注:是否可用黑色胶带降低漏光影响,打磨光敏电阻涂层能否将驱动电压降至9V实用水平,以及此类自制器件的教育价值。
No.21
I built a mmWave material classification radar (2025)
我用毫米波雷达检测建筑材料中的石棉
177 分
46 条评论
作者: GL26
作者在欧洲从事硬件创业,开发了一款用于检测建筑石棉的毫米波调频连续波(FMCW)雷达。系统采用德州仪器 IWRL6432 芯片,通过 Capon 波束成形提取材料密度谱,经 CNN 分类器识别材料表面。项目中利用开源 OpenEMS(FDTD 方法)设计天线,并通过卷积操作将仿真时间从 1 小时压缩至 2 分钟。实验对木材、石材、塑料等材料组合进行分类验证,但因无法获取含石棉标样,最终仅验证了普通材料分类能力。该项目因缺乏资金和市场认可而停滞——投资人要求先有监管审批和成熟产品,客户则不愿在摸到实物前签发意向书。技术层面证明可行,但商业路径无法跑通。
No.22
Building a custom octocopter from scratch with no prior hardware experience
从零开始造八旋翼无人机:零经验到 RL 控制的完整历程
360 分
76 条评论
作者: noleary
作者 Karolina 分享了她从零硬件经验开始,在 2.5 周内完成自定义八旋翼无人机设计、制造与首飞的全过程。无人机用 Fusion 360 设计,CNC 切割 G10 fiberglass 和碳纤维板,手工组装。最终目标是将 RL 训练的控制器部署到硬件,实现单、双、四电机故障时仍能维持飞行。RL 训练阶段遇到两个关键 bug:一是高斯策略输出的动作被硬截断后无法获得 corrective gradient 导致动作持续卡住,修复方案是通过 tanh 压缩动作输出;二是存活奖励与高度惩罚相互抵消导致训练无信号,修复将 r_survive 从 0.1 提升到 1.0。最终策略是 43.4k 参数的 MLP,能处理单、双、三电机故障,甚至对未经训练的三电机故障场景也能撑 7.2 秒而非直接坠毁。她选择将 RL 策略直接编译进 Betaflight 固件(STM32H743),而非外挂微控制器,以降低延迟。
No.23
Hatari – Online Atari ST/STE/TT/Falcon Emulator
Hatari 浏览器版发布:可在线运行 Atari ST/STE/TT/Falcon 模拟器
61 分
6 条评论
作者: gregsadetsky
Hatari 是一款历史悠久的 Atari ST/STE/TT/Falcon 模拟器,近日其开发团队将其移植到 Web 平台,用户可直接在浏览器中运行这一经典 16 位计算机系统。文章内容较为简短,主要展示了在线版的基本功能界面,包括下载选项和画布大小调整等基础操作。社区对此反应不一:有用户指出 Hatari 模拟器本身已存在十余年,此次 Web 版本并无太多创新,界面体验(UX)也显得过时;也有用户认为「复古计算」热潮反映了人们对传统确定性计算模式逐渐消逝的怀念;另有评论提到,经过与庞大代码库的搏斗后,能够驾驭一个「能装进脑子」的小系统是一种乐趣,暗示复古系统的简约之美。整体而言,这更像是一个技术展示而非深度讨论。
No.24
Meta is adding rate limits and soft paywall to smart glasses
Meta 智能眼镜加入速率限制与软付费墙,本地运行功能也被限
27 分
14 条评论
作者: Exoristos
Meta 宣布其智能眼镜的 Conversation Focus 功能(使用设备本地芯片增强对话音量)即将被限速:免费用户每月仅限 3 小时,付费 19.99 美元的 Meta One Premium 可升至 15 小时。该功能实为本地运行,不经过 Meta 服务器,断网测试证实完全可用,因此评论者认为这一限制毫无技术依据,纯属「 bogus 」收费借口。Meta 近期因 AI 投资压力裁减约 10% 员工(约 8000 人),此前还将 Ray-Ban 联名款降价 80 美元以促销。Meta 发言人回应称「大多数人不会触及月度上限」,订阅面向「希望扩展访问权限和额外福利的高级用户」,但未排除未来将更多本地功能纳入付费墙的可能。评论普遍批评 Meta 此举过于激进、侵蚀用户信任,甚至有人指出产品热销的真正原因竟是用户可以拆掉录制指示灯偷偷录像做低俗内容。
No.25
Stroustrup's Rule (2024)
Stroustrup 法则:编程语言的显式与简洁之争
93 分
20 条评论
作者: bmacho
本文探讨 Bjarne Stroustrup 提出的语法设计法则:对于新特性,人们需要显式冗长的语法来建立心理模型;对于成熟特性,人们偏好简洁语法以提高解析效率。以 Rust 错误处理演进为例,Option type 的 match 到 try! 宏再到 ? 操作符,体现了这一规律。文章指出社区层面也存在类似现象:语言初期新手占多数,成熟后专家比例上升,推动语言向「专家友好」方向演进。Python walrus 操作符(:=)的争论正是典型案例——专家认为更优雅,教师和新手觉得增加学习难度。作者强调教学中需主动对抗此法则,例如 TLA+ 中用显式的 \A w \in Workers 测试而非简洁的函数集合表示法。新手需要显式语法,专家视之为视觉噪音。
No.26
Scaling Laws, Carefully
扩展定律的深度解析
55 分
15 条评论
作者: tehnub
本文由Lilian Weng撰写,深入探讨深度学习中的扩展定律。扩展定律指训练损失L随模型规模N、数据规模D和计算量C扩大而遵循幂律曲线下降的现象。文章梳理了从Amari等人(1992)的贝叶斯学习曲线理论,到Hestness等人(2017)关于泛化误差与模型/数据规模关系的实证研究,再到Rosenfeld等人(2020)将误差建模为N和D联合函数的进展。Kaplan等人(2020)的著名研究确立了损失与N、D、C的幂律关系,并得出「计算预算固定时,训练超大模型并提前停止比训练到收敛更高效」的结论,建议模型规模增速应快于数据集规模。然而后来的Chinchilla论文反驳了这一观点,认为这会导致大模型训练不足,建议数据规模应与模型规模成比例增长。文章指出架构变化只改变幂律的截距而不改变指数,暗示斜率是问题领域的固有属性而非模型架构决定。
No.27
Long Island's decommissioned nuclear power plant
探访长岛废弃核电站:建了12年、从未满载运行的遗迹
123 分
60 条评论
作者: mkmk
作者探访了位于东肖勒姆的长岛唯一核电站——肖勒姆核电站。该电站于1973年开始建造GE沸水反应堆,1985年竣工并仅以5%容量试运行,此后再未提升出力。由于三里岛事故(1979)和切尔诺贝利悲剧(1986)引发的公众反对,州和县政府拒绝批准其紧急疏散路线方案,导致无法获得运营许可。1992年,这座耗资60亿美元的设施被以1美元出售给州政府(成本以电费3%附加费形式转嫁给长岛纳税人)。1994年 decommission 完成,移除了500万磅放射性废料和560组辐照燃料棒,此后一直空置至今。作者记录了核岛控制室(布满按钮、开关、指示灯,日历定格在1994年11月8日)、反应堆围阻体(双层混凝土防护,厚达7英尺)、汽轮机厂房(两台机组已售出)及辐射防护设施等内部场景,该站点现作为影视拍摄场地开放。
No.28
Single header Parser Combinators for C
C语言单头文件解析器组合库
15 分
1 条评论
作者: steve-chavez
CParseC 是一个专为 C 语言设计的单一头文件解析器组合库(Parser Combinators)。该项目允许开发者通过组合小型解析函数来构建复杂的解析器,提供了一种函数式风格的解析方式。代码完全使用 C 编写,不依赖外部库,体现了经验丰富的 C 工程师对内存管理和代码优雅性的把控。该库以极简的设计著称——所有代码集中在一个头文件中,便于集成到任何 C 项目。解析器组合器模式源自函数式编程,核心思想是将简单解析器组合成复杂解析器,此前在 Haskell 等语言中较为常见,此库将其引入 C 语言生态,为需要文本解析的 C 项目提供了轻量级解决方案。
No.29
Have you restarted your computer this week?
你本周重启电脑了吗?
164 分
287 条评论
作者: surprisetalk
作者分享了他周六早上重启 Mac 的习惯,认为这是一种「抛下责任和理智」的生活方式仪式。他享受强制退出应用程序时弹出的各类警告,仿佛在与系统进行一场小小的对抗。文章指出,大多数工作已云端备份(OneDrive)、个人文件通过 Emacs 同步,重启实际上几乎不会丢失数据;同时援引IT行业的经验——重启是解决电脑问题的经典良方。评论区则呈现两极分化:一方认为在 SSD 时代开机只需数秒、每晚关机更节能省电;另一方提到 macOS Sonoma 等系统长期运行会出现光标异常、磁盘空间逐渐流失等问题,重启后明显改善;还有用户从安全角度指出全盘加密必须关机,服务器则保持长时间运行。
No.30
Segmenting Robot Video into Actionable Subtasks
WGO-Bench:机器人视频子任务分割基准
14 分
2 条评论
作者: tomaspduarte
文章来自 macrodata.co,介绍了机器人视频子任务自动标注的 benchmark 与最佳 pipeline。为解决机器人学习长时程任务时弱监督信号不足的问题,作者推出 WGO‑Bench,包含 100 个视频片段、743 个标注段、62 个高阶任务指令,覆盖头戴式、第三方视角和 egocentric 三种摄像头类型。通过 60 余组实验发现:最佳分割方法达 0.306 F1,最佳标注方法准确率 61.0%,端到端 pipeline 达 0.168 F1。Gemini 系列模型显著优于其他模型,Gemini 3.5 Flash 比最好的非 Gemini 模型 GPT‑5.5 高出 24.5%。最终方案采用 contact sheets 将成本压至每视频小时 2.64 美元,约为人工标注成本的 1/19。全部代码开源至 Refiner 框架,可直接运行于自有数据。
评论精华