斯坦福 STORM 方法:如何让 Claude 在几分钟内像博士一样做研究

大多数人把 Claude 当搜索框用。提问,拿答案,关标签页。他们把最好的功能锁在里面没用起来。

收藏一下 :)

斯坦福做了一个叫 STORM 的研究系统。在同行评审测试中,它产出的文章比第二好的方法组织性高出 25%。它是开源的,免费。几乎没人知道,你可以用 4 条 prompt 在 Claude 里跑同一套思路。

不用软件。不用 GitHub。不用配置。直接粘贴。5 分钟后,你对这个主题的了解会超过那些花了好几天阅读的人。

完整方法如下。


阶段 1:STORM 到底是什么

STORM 是 Synthesis of Topic Outlines through Retrieval and Multi perspective Question Asking 的缩写,意思是通过检索和多视角提问来综合主题大纲。它由斯坦福 OVAL Lab 发表在 NAACL 2024 上。

你可以在 storm.genie.stanford.edu 试用在线版本。免费。无需注册。输入一个主题,看它在你面前写出一篇带来源的文章。

这里有一段 12 分钟的演示视频:YouTube 上的 STORM by Stanford。值得看一次。

完整代码在 github.com/stanford-oval/storm。MIT 许可证。愿意的话,你可以在自己的笔记本上跑。

但真正的重点在这里。这些你都不需要。 斯坦福的方法本质上是一种思考方式。你可以用 4 条复制粘贴的 prompt,在 Claude 里跑同一套思考方式。

这就是本文后面要讲的内容。


阶段 2:为什么一条 prompt 永远不够

当你问 Claude“告诉我 X 是什么”时,你得到的是多数派观点。最常见的框架。表层信息。

你得不到的是每天都在和 X 打交道的实践者;认为这个领域走错了的怀疑者;追踪资金流向的经济学家;见过类似模式重演的历史学家;真正读过那些研究的学者。

这五种声音看到的东西都不一样。博士生做的就是这种事。他们不是只问一个问题,而是问五个。

斯坦福论文用数字证明了这一点。由多视角构建的文章,比常规方式构建的文章组织性高出 25%,覆盖面宽 10%。整个突破就在这里。多视角提问能抓住单 prompt 研究永远看不到的盲点。

一次博士级研究需要人类阅读 40 到 60 小时。大多数人抽不出这个时间。STORM 把它压缩了。下面四条 prompt 进一步压缩它。总共五分钟。


阶段 3:Prompt 1,多视角扫描

这是整套方法的核心。把下面这段粘到 Claude 里。替换第 1 行里的主题。

I need to research [YOUR TOPIC].
Simulate 5 different expert perspectives on this topic:
1. THE PRACTITIONER: works with this daily.
What do they know that academics miss?
What practical realities are usually ignored?
2. THE ACADEMIC: has studied this for years.
What does the peer reviewed evidence actually say?
Where does the evidence contradict popular belief?
3. THE SKEPTIC: thinks the mainstream view is wrong.
What is the strongest counterargument?
What evidence do proponents conveniently ignore?
4. THE ECONOMIST: follows the money.
Who profits from the current narrative?
What financial incentives shape the research?
5. THE HISTORIAN: has seen similar patterns before.
What historical parallels exist?
What can we learn from how those played out?
For each perspective give me:
- Their core position in 2 sentences
- The strongest evidence supporting their view
- The one thing they would tell me that no other perspective would

返回结果会是什么: 对同一个主题的五种截然不同的解读。实践者看到学者漏掉的东西。怀疑者挑战实践者默认接受的前提。经济学家揭示学者忽略的激励。历史学家提供经济学家看不到的模式。

这只需要 60 秒,却能抓住一条 prompt 永远找不到的东西。


阶段 4:Prompt 2,矛盾地图

现在让 Claude 找出这 5 种声音在哪里打架。真正的理解就藏在这些冲突里。

Based on the 5 perspectives above, map the contradictions:
1. Where do two or more perspectives directly contradict
each other? List each conflict with the specific claims
that clash.
2. Which perspective has the strongest evidence?
Which has the weakest? Why?
3. What is the one question that, if answered, would
resolve the biggest contradiction?
4. What does EVERY perspective agree on?
(This is likely true. Even opponents confirm it.)
5. What topic did NONE of the perspectives address?
(This is the blind spot in the whole field.
Often the most valuable finding.)

返回结果会是什么: 一张专家在哪里分歧、为什么分歧的地图。大多数人会跳过这一步。但正是这一步,把表层理解和真正的专业理解分开。

如果 5 个视角都同意,那大概率是真的。如果没人提到某个主题,你就找到了整个领域的缺口。


阶段 5:Prompt 3,综合

现在让 Claude 把所有内容整合成一份研究简报。

Synthesize everything from the 5 perspectives and the
contradiction map into a research briefing:
1. THE ONE PARAGRAPH SUMMARY: explain this topic as if
briefing a CEO who has 60 seconds and needs nuance,
not just the headline.
2. THE 5 KEY FINDINGS: most important things I now know,
ranked by reliability. For each, note which perspectives
support it and which challenge it.
3. THE HIDDEN CONNECTION: one non obvious link between
findings that only shows up when you look at all 5
perspectives together.
4. THE ACTIONABLE INSIGHT: based on all the evidence,
what should someone in [YOUR ROLE] actually DO
differently? Be specific.
5. THE FRONTIER QUESTION: the one question that, if
answered, would change everything about how we
understand this topic.

返回结果会是什么: 一份任何单个专家都写不出来的简报。它覆盖每个角度,点名矛盾,给可靠性排序,最后落到一个具体行动上。这是一名博士生 48 小时后会交出的东西。你 90 秒就拿到了。


阶段 6:Prompt 4,同行评审

STORM 有一个已知弱点。斯坦福自己的研究者也指出过:这个系统不会自我批判。来源偏差事实错配会混进来。这条 prompt 通过让 Claude 给自己的工作打分来修补这个问题。

Now peer review your own research briefing:
1. CONFIDENCE SCORES: rate each of the 5 key findings
on a 1 to 10 scale for reliability. Explain each score.
2. WEAKEST LINK: which claim are you least confident in?
What specific info would you need to verify it?
3. BIAS CHECK: which perspective might be overrepresented
in your synthesis? Did one voice dominate?
4. MISSING PERSPECTIVE: is there a 6th angle I should
have included that would change the conclusions?
5. OVERALL GRADE: if a Stanford professor reviewed this
briefing, what grade would they give and why?
What would they tell me to fix?

返回结果会是什么: 对你自己的研究的一次诚实检查。哪些主张强,哪些主张弱,有哪些偏差,缺了哪些角度。真正的同行评审要花几个月。你 60 秒就做完了。


阶段 7:5 分钟工作流

第 1 分钟: Prompt 1。你拿到 5 个专家视角。

第 2 到第 3 分钟: Prompt 2。你拿到一张矛盾地图。

第 3 到第 4 分钟: Prompt 3。你拿到一份研究简报。

第 5 分钟: Prompt 4。你知道什么可靠,什么不可靠。

总耗时:5 分钟。输出:一份多视角简报,包含矛盾分析、综合结论、具体行动和可靠性评分。

一名博士生手工产出这份东西需要 40 到 60 小时。不是因为他们慢,而是因为从 5 个角度阅读、绘制矛盾、综合信息、自我批判,对一个人脑来说确实是一项 40 小时的工作。


阶段 8:今天就能开始用的 7 种场景

1. 写任何文章或报告之前。 跑这 4 条 prompt。你的文章会覆盖别人没想到的角度。

2. 做重大商业决策之前。 拿到全部 5 个视角。实践者告诉你现实中什么可行。怀疑者告诉你哪里可能出问题。经济学家告诉你谁会获利。

3. 面试之前。 用 5 分钟从 5 个角度研究这家公司。实践者视角给你内部语言。怀疑者视角给你尖锐问题。你会比房间里任何人都准备得更充分。

4. 投资之前。 多头理由、空头理由、历史相似案例、激励地图、学术证据。5 分钟搞定。矛盾地图会告诉你真正的风险在哪里。

5. 学一项新技能之前。 从 5 个角度梳理这个领域。实践者告诉你先学什么。学者告诉你理论。怀疑者告诉你什么被过度炒作。你可以跳过杂音。

6. 谈判之前。 从 5 个视角研究对方。理解他们的激励、弱点和历史行为。你会带着结构性优势进场。

7. 做任何演示之前。 对你的主题跑 STORM。你的幻灯片会在观众提出异议之前先回答它们。你的 Q&A 会显得游刃有余。


人格画像

你是一个会阅读的人。你会问难题。你不想要一段 200 字、听起来聪明但什么也没说的摘要。

你想真正理解事情。快速地。有来源地。像斯坦福研究生那样。但不用交六年的学费。

这套方法就是给这样的人用的。

如果你就是这样的人,收藏这篇文章。用这 4 条 prompt。看看差别。


那个不太舒服的真相

有件事没人明说。

斯坦福团队在 2024 年发表了这项工作。论文经过同行评审。代码开源。在线工具免费。方法就是四条 prompt。但几乎没人用它。

我们正处在一个 18 个月的窗口期。学会正确用 AI 做研究的人,会远远超过还没学会的人。不是因为他们更聪明,而是因为别人还在读 Google 的第一条结果时,他们已经在跑 5 个视角、矛盾地图、综合和同行评审。

18 个月后,这类工作流会内置到每个工具里。优势会消失。今天,它仍然是一个摆在明面上的秘密。

选一个你最需要研究的主题。打开 Claude。粘贴 Prompt 1。

五分钟后,你会比那些花了好几天阅读的人知道得更多。

Prompt 都在上面。斯坦福证明了这个方法。剩下的取决于你。

希望这对你有用。Nav ❤️