
一句话版:过去一周我一直在测试 Fable(Mythos),它用起来不像我用过的任何一个模型。无论体感还是定价,它都像是下一代模型。同时,它也确实有一些怪脾气。
好的地方
Workflow mode(工作流模式)是最突出的地方。我让它做一次「完整代码审查」,然后看着它并行拉起了几百个 agent。它基本上给我应用里的每个文件都分配了一个独立 agent。它在整个应用里找出了 bug、边界情况、缺失文档和 UX 改进点。而且同一个 prompt 我也给过其他模型,它们找出来的问题远没有这么多。
它的自主性也强得离谱。跟之前任何 Claude 或 GPT 模型比,它都更愿意独自连续工作几个小时。最重要的是,我相信它能完成我设定的目标。为了做到这一点,它会很乐意烧掉大量 token。每次我启动 Fable,都感觉它是冲着接下一个大型项目去的。
我更敢把庞大、复杂的任务交给 Fable。比我用过的任何模型都更敢。我想不出有什么问题会让它卡住。而且它给人的感觉是,它非常渴望接这些大型任务。
这正是这个模型脱颖而出的地方——长周期任务。很难想象它的时间跨度上限在哪里。
不过它不是神级模型。它还有一些需要改进的地方。
怪脾气
它话非常多。解释很快就会钻到特别细的细节里。我更新了自己的 claude.md 来约束它,但即便这样也不够。我一直得让它解释得简单一点。不只是话多的问题,还有信息密度的问题。它解释事情的方式,真的会让我觉得自己很笨。
关于信息密度补充一句——我之前没有意识到这件事有多重要。在固定 token 预算里,能传达的信息越多,就等于让模型用更低成本变得更聪明。这也有力说明了为什么未来 agent 可能会发明自己的超高密度语言。
Fable 很爱问澄清问题。一个 prompt 会变成:先提问题,然后总结我的回答,然后让我确认总结,然后写 spec,然后让我确认 spec,然后确认 agent 的执行方式(并行还是串行),最后才开始构建。我希望它替我做这些决定。Anthropic 告诉我,这个问题会通过新版系统 prompt 修掉。
它感觉很慢。比之前的 Opus 模型慢,甚至比 GPT 还慢。启动慢,处理问题时也不紧不慢。这和我喜欢 Opus 的地方正好相反。对我来说,Opus 一直感觉比 GPT-5.5 更快,体现在两个方面:原始 tokens/sec,以及它能找到更短的解法路径。Fable 在这两点上都不一样。哪怕是简单任务,它也会慢吞吞地爬。我会看着计时器不断往上走,而输出 token 数停着不动,五分钟过去也只用了几千个 token。它想尽可能彻底,而这需要时间。
结论
小建议:把 effort level 调低,比你以为需要的还要低。即使在中等设置下,它也会想很多。哪怕是低 effort,它也非常能干,而且仍然会思考一阵子。
这些怪脾气都是可以修的——通过模型优化和增加算力来提速,通过更多微调/RL 和系统 prompt 调整来改善话多、以及过于谨慎不替我做决定的问题。
结论:MYTHOS 非常强,我还在摸索怎样把它用到最好。它给人的感觉是,它想要我最难的任务,低于这个难度都配不上它。这是一次全新训练 run 的首次亮相,而它已经是我用过的最强模型。
这是我一直忘不掉的部分。