
这篇文章会介绍 Jev 和 System One 模型。这是一种新型 AI 模型:它完全不生成文本,只做出可由软件直接使用的快速决策。我们还会看到系统 1 与系统 2 思维分别是什么,为什么用普通 LLM 处理小型决策既慢又不可靠,Jev 如何在一次处理过程中同时回答多个问题,而不是逐词生成;什么是有类型约束的答案;如何让每个答案所附的概率如实反映模型把握;为什么说 Jev 不会产生幻觉;以及它擅长和不擅长哪些场景。
本文会讨论以下内容:
- 什么是 System One 模型?
- 系统 1 思维与系统 2 思维
- 使用 LLM 做决策的问题
- 什么是 Jev?
- Jev 如何工作
- 类型化答案:选择、评分与是/否
- 校准与 RLCD
- Jev 为什么不会产生幻觉
- Jev 与 LLM 对比
- Jev 擅长什么,又会在哪里失效
- 应该使用哪一种
我是 Amit Shekhar,Outcome School 创始人。我教过并辅导过许多开发者,他们凭自己的努力获得了高薪技术岗位;我也帮助许多科技公司解决过各自独特的问题,并创建了多个被顶级公司采用的开源库。我热衷于通过开源、博客和视频分享知识。
我在 Outcome School 教授 AI and Machine Learning。
我们开始吧。
什么是 System One 模型?
System One 模型是一种查看当前情况并返回决策、而非文本的 AI 模型。
简单说,我们给它一些信息和一份固定的候选答案列表。它从中选出一个答案,同时给出一个数字,表示自己有多大把握。
假设我们经营一家网店。客户发来消息:“我的卡被扣了两次款。”我们想知道应该由哪个团队处理。候选答案是 billing、technical 和 account。System One 模型读完消息后,会返回 billing,概率为 0.97,也就是有 97% 的把握。
就这么简单。它不会替客户写回复,也不会解释自己的思考过程,只负责做决定。
System One 模型 = System One + 模型
这里的“System One”源自一个关于人脑如何思考的著名理论,“模型”则指 AI 模型。因此,System One 模型就是一种模仿人脑系统 1 思维方式的 AI 模型。
在介绍 Jev 之前,我们必须先了解系统 1 和系统 2 思维是什么。
系统 1 思维与系统 2 思维
诺贝尔奖得主、心理学家 Daniel Kahneman 认为,我们的大脑有两种思考方式。
系统 1 快速、自动,几乎不费力。看到朋友的脸,我们立刻就知道对方是谁。有人问“2 + 2 等于几?”,我们不假思索就会回答“4”,不需要坐下来计算,答案自然就出来了。
系统 2 缓慢、谨慎,需要投入精力。有人问“17 × 24 等于几?”时,我们会停下来逐步思考并算出结果,这需要时间和精力。
两者都有用。系统 1 每天处理成千上万个小决策,系统 2 则负责难题。
注意: Kahneman 写作 System 1 和 System 2;TypeSafe 则把模型名称写成 System One。两者表达的是同一个概念。
下面把这个理论与 AI 联系起来。
LLM 是 Large Language Model(大语言模型)的缩写,也是 ChatGPT 等聊天机器人的底层 AI 模型。它会把文本拆成一个个小片段,依次生成。即使我们只问一个简单的是非题,它也要经历这个缓慢的写作过程。更新的推理模型更进一步,会先逐步写出思考过程,再给出最终答案。这属于系统 2 式工作:能力强大,但速度慢、成本高。
然而,真实软件内部的大多数决策既小又重复:这封邮件是不是垃圾邮件?这张工单应该交给哪个团队?这条评论是正面还是负面?这个答案能否安全地展示给用户?这些都属于系统 1 式决策。我们需要立即获得答案,而且每天要做数百万次。
所以问题来了:为什么要用缓慢的系统 2 式模型,处理快速的系统 1 式决策?
System One 模型正是为了解决这个问题而构建的。
如果想深入学习大语言模型(LLM)、推理模型和自回归模型,可以查看 Outcome School 的 AI and Machine Learning Program。
使用 LLM 做决策的问题
通过例子最容易理解这个问题。
假设我们有一套客服系统,要把每张新工单发送给正确的团队。今天,大多数人会像下面这样使用 LLM:
prompt = """
Classify this support ticket into one of: billing, technical, account.
Reply with only the category name.
Ticket: My card was charged twice.
"""
response = llm.generate(prompt)
category = response.text.strip()
这里,我们要求 LLM 阅读工单,并且只回复类别名称。看起来很简单,问题却不少。
问题 1:它逐个 token 写出答案。
token 是一小段文本,大致相当于一个词或词的一部分。LLM 会逐个 token写出答案。为了写出“billing”,它先预测“bill”,再预测“ing”,依此继续。每一步都要让庞大的模型完整运行一遍。因此,即使只回答一个词,也需要许多步;如果模型决定补充解释,步骤还会更多。
问题 2:我们无法信任输出格式。
我们明明只要求类别名称,模型却可能回答“The category is billing.”、“Billing.”、“billing, let me know if you need anything else.”,甚至给出候选列表中根本不存在的“refund”。于是,我们还得编写额外代码清理输出,而且编写这类清理代码时经常会出错,并以意想不到的方式崩坏。
问题 3:我们不知道它有多大把握。
模型回答“billing”,但它的把握究竟是 99% 还是 51%?我们无从得知,也就无法判断什么时候可以相信它,什么时候应该把工单交给人工。
问题 4:速度慢、成本高。
前沿 LLM,也就是目前规模最大、能力最强的一类模型,完成这种调用也要花几秒。如果每天有 100 万张工单,等待时间和费用都会迅速累积。
我们需要一种只负责决策的模型:立即完成决策,始终返回有效答案,还能告诉我们它有多大把握。
Jev 正是为此而来。
什么是 Jev?
Jev 是第一个 System One 模型,由 TypeSafe AI 公司开发。
它于 2026 年 9 月 15 日发布。TypeSafe AI 由 ChatGPT 背后的参与者之一 Diogo Almeida 创立,团队花了约两年时间,低调研发一种新的模型训练方法,Jev 就是这项工作的成果。
Jev 最令人意外的一点是:它完全不生成文本。
我们无法与 Jev 聊天,也不能让它写邮件或代码。它接收当前情况作为输入,输出带有概率的类型化决策,仅此而已。
下面看看它如何工作。
Jev 如何工作
Jev 接收两类输入:
- 状态(State):关于当前情况的信息。状态只是“模型为了了解眼下情况所需的一切信息”的简称,内容始终是文本,可以是普通字符串、文本列表或 JSON 对象。JSON 对象是一种用标签和值表示数据的简单方式。例如,可以输入客户消息、客户最近几笔交易,以及退款政策。
- 带候选答案的问题:我们想做什么决策,以及哪些答案有效。例如问题是“应该交给哪个团队?”,候选答案为
billing、technical和account。
它会返回:
- 类型化答案:每个问题一个答案,而且一定从候选答案中选出。
- 概率:每个答案都会附带一个 0 到 1 之间的数字,表示模型有多大把握。
来看一段代码。为了便于理解,下面进行了简化,并不是准确的 API:
result = jev.decide(
state={
"message": "My card was charged twice.",
"recent_transactions": ["$49 on Sep 10", "$49 on Sep 10"]
},
questions={
"team": ["billing", "technical", "account"],
"is_urgent": "yes_no",
"frustration": {"min": 0, "max": 2}
}
)
结果是:
{
"team": { "answer": "billing", "probability": 0.97 },
"is_urgent": { "answer": true, "probability": 0.88 },
"frustration": { "answer": 1, "probability": 0.74 }
}
这里可以注意到几点:
- 一次调用提出三个问题,也得到了三个答案。
- 每个答案都来自候选列表。
team只能是billing、technical或account,永远不会是“refund”或一句话。 - 每个答案都附带一个概率。
最重要的是:Jev 在一次并行处理过程中回答所有问题。
这里的“并行”指同时进行,“一次处理”指模型只运行一遍。可以用一个类比来理解。
LLM 就像一个拿笔写文章的人。每个词都要等前一个词写完,不可能在第九个词之前先写第十个词。
Jev 则像一个在表格中勾选复选框的人。它把整个状态读一遍,再同时勾选所有答案,不需要等待“下一个词”。这正是 System One 模型的优势。
因此,Jev 速度极快。同一项决策,前沿 LLM 可能要用 3 秒到几分钟,Jev 只需约 70~500 毫秒,也就是不到一秒。TypeSafe 称,在这类任务上,Jev 比智能水平相当的 LLM 快 40~200 倍。在其自有评估中,Jev 处理决策任务的速度最多可达 Claude Sonnet 5 的 193 倍。
由于没有文本输出,输出侧也就没有费用。Jev 每百万输入 token 收费 0.042 美元,输出免费。
因此,它能立即完成决策,始终返回有效答案,告诉我们自己有多大把握,而且费用极低。前面提到的 LLM 方案四个问题,全都得到了解决。
以上就是 Jev 的工作方式。下面解释“类型化”是什么意思,因为这是 Jev 的核心。
类型化答案:选择、评分与是/否
在编程中,类型决定一个值可以保存什么内容。布尔类型的变量只能是 true 或 false,绝不可能是“maybe”。这称为类型安全:程序甚至无法表示类型错误的值。TypeSafe 这家公司也因此得名。
Jev 把同样的理念带到了 AI 答案中。每个问题都有类型,答案必须符合该类型。Jev 支持三种类型化答案:
选择(Choice):从固定列表中选择一项。例如 billing、technical 或 account。Jev 的一份列表最多支持 255 个选项。
评分(Score):从固定范围中选择一个数字。例如,沮丧程度从 0 到 2,或质量评分从 1 到 5。
是/否(Yes/No):答案为 true 或 false。例如:“这件事紧急吗?”
每一种答案都会附带概率。
那么,Jev 如何确保答案始终符合类型?
答案是:Jev 不把答案写成文本,而是给候选项评分。为了便于理解,可以这样想:对于有三个选项的选择题,Jev 会为每个选项给出一个概率,三个概率之和为 1。答案就是概率最高的选项。由于根本没有第四个位置,它也不可能输出第四种选项。
这与要求 LLM“用 JSON 回复”截然不同。LLM 仍然逐 token 写出 JSON,我们只能寄希望于最终格式有效;Jev 则在模型运行之前,就已经固定了答案的形状。
给你的一点提示
无论从事哪个技术领域,都应该熟悉以下主题:
- LLM
- RAG
- MCP
- Agent
- Fine-tuning
- Quantization
我们在一个视频里把它们串了起来:
AI Engineering Explained: LLM, RAG, MCP, Agent, Fine-Tuning, and Quantization
不用停下来现在就看,先收藏,之后有时间再看。未来的你会感谢现在的自己。
下面回到主题。
校准与 RLCD
到目前为止,我们知道 Jev 会为每个答案返回概率。接下来最重要的问题是:这个概率值得相信吗?
这正是**校准(calibration)**要解决的问题。
当模型给出的概率与现实相符时,就称模型经过了校准。 简单说,如果把模型声称“我有 90% 把握”的所有答案放在一起,那么其中约 90% 应该确实正确。不是 60%,也不是 99%,而是大约 90%。
假设天气应用在 100 个不同的日子里都预报“降雨概率为 70%”。如果其中约 70 天下了雨,它就经过了良好校准;如果只下了 30 天,那么它没有校准好,所说的 70% 也毫无意义。
大多数 LLM 并没有为此训练。它们的训练目标是写出人类喜欢的文本。因此,当 LLM 说“我很有把握”时,它只是在写听起来很自信的话。
Jev 的训练方式不同,采用了 TypeSafe 所称的 RLCD。
RLCD = Reinforcement Learning for Calibrated Decisions(面向校准决策的强化学习)
我们把它拆开来看。
**强化学习(Reinforcement Learning)**是一种训练方式:模型做出决策;结果好就获得奖励,结果差就受到惩罚。经过数百万次尝试,模型逐渐学会做出更好的决策。
**面向校准决策(For Calibrated Decisions)**意味着奖励不只取决于答案是否正确,还取决于模型是否如实表达自己的把握。来看一个例子:
- 模型说有 99% 把握,而且答对:高额奖励。
- 模型说有 99% 把握,却答错:高额惩罚。
- 模型说有 55% 把握,而且答对:少量奖励。
- 模型说有 55% 把握,却答错:少量惩罚。
因此,模型想取得好成绩,唯一办法就是:真正很可能答对时给出高概率,没有把握时给出低概率。概率由此变得可信。
这种可信的概率对我们很有用。现在可以编写以下代码:
if result["team"]["probability"] > 0.9:
route_to(result["team"]["answer"])
else:
send_to_human()
Jev 把握很大时,我们就相信它;把握不足时,则把工单交给人工。普通 LLM 从未提供过这样一个可信的数字,所以我们无法用它写出这几行逻辑。Jev 让这件事变得很简单。
注意: 校准并不表示每个答案都正确。概率为 90% 的答案仍有 10% 的可能出错。校准只说明这个数字诚实可信,让我们知道应该在多大程度上相信它。
如果想深入学习 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)、奖励模型和近端策略优化(Proximal Policy Optimization,PPO),Outcome School 的 AI and Machine Learning Program 提供了完整课程。
Jev 为什么不会产生幻觉
你一定听说过 LLM 会产生幻觉。简单说,幻觉就是模型自信地说出不真实或不存在的内容。它可能虚构一本从未有人写过的书、一个不存在的函数,或候选列表里没有的类别。
TypeSafe 提出了一个很强的主张:Jev 不会产生幻觉。这里很容易产生误解,所以要准确理解它的含义。
要求模型做决策时,它可能犯两类错误:
类型错误(Type error):答案甚至不属于有效类型。我们要求从 billing、technical 或 account 中选择,模型却回答“refund”,或写了一整段话。
答案错误(Wrong answer):答案形式有效,但选错了。工单讨论的是登录问题,模型却选择 billing。
Jev 永远不会犯类型错误。这是数学保证,不是一句承诺。答案始终是候选项之一,因为模型只给候选项评分,模型内部没有生成其他内容的路径。TypeSafe 甚至表示,只要找到一个反例,就足以推翻这项主张。
Jev 仍然可能给出错误答案。但由于模型经过校准,没有把握时返回的概率会更低。因此,我们可以通过概率拦截大多数错误答案,再把这些情况交给人工。
这里所说的“不会产生幻觉”是指:它永远不会虚构一个不存在的答案,而且没有把握时会如实告诉我们。
还有一点值得注意。通常,我们认为系统 1 很快但容易出错,系统 2 很慢但可靠。TypeSafe 颠倒了这种印象:对于这类决策任务,System One 模型可以比缓慢的替代方案更加可靠,因为从设计上说,它的答案只能来自候选项;从训练上说,它的置信度也如实可信。
Jev 与 LLM 对比
详细了解 Jev 后,下面把它与 LLM 放在一起比较。
为了便于理解,用表格列出两者的差异。
| 方面 | Jev(System One 模型) | LLM |
|---|---|---|
| 输出 | 带概率的类型化决策 | 自由形式文本 |
| 回答方式 | 一次并行处理得出所有答案 | 逐个 token 生成 |
| 能否编写文本、代码和回复 | 否 | 是 |
| 能否逐步推理 | 否 | 是 |
| 输出格式保证 | 设计上始终有效 | 必须由代码清理和检查 |
| 置信度 | 每个答案都有经过校准的概率 | 不提供,或并不可信 |
| 速度 | 70~500 毫秒 | 数秒到数分钟 |
| 成本 | 每百万输入 token 0.042 美元,输出免费 | 高得多,输出 token 还要另行计费 |
| 输入 | 文本、JSON、文本列表 | 文本、图片、音频等 |
| 最适合 | 分类、路由、评分、检查、决策 | 聊天、写作、编程、推理、解释 |
Jev 擅长什么,又会在哪里失效
擅长的场景:
- 路由:应该由哪个团队、哪个模型或哪套工作流处理?
- 分类:是不是垃圾邮件、是正面还是负面、属于哪个类别?
- 评分:这份文档有多相关,或这个答案有多好,评分为 1~5 中的多少?
- Guardrail,也就是安全检查:这份 LLM 输出是否安全、切题且正确?Jev 可以在用户看到答案前,用不到一秒完成检查。
- 实时决策:面向用户的应用中,任何不能等待数秒的决策。
- 大型数据集:对数百万行数据重复执行相同决策,此时成本和速度最为重要。
不擅长的场景:
- 编写任何内容:Jev 无法撰写回复、邮件、摘要或代码,因为它根本没有文本输出。
- 开放式推理:如果任务需要多步思考,例如求解困难的数学问题,Jev 就不是正确工具。
- 解释:Jev 只给出答案和概率,不说明理由。
- 图片和音频:目前 Jev 只接受文本。
- 非常大的候选列表:一个选择题最多支持 255 个选项。
如果想掌握编排与路由、LLM-as-a-Judge,以及 LLM 和 Agent 评估,可以查看 Outcome School 的 AI and Machine Learning Program。
应该使用哪一种
最简单的规则是:
如果答案是一项决策,就使用 Jev;如果答案是一段文本,就使用 LLM。
在真实系统中,两者通常配合使用。假设我们正在构建一套自动回复客户的客服系统。
首先,Jev 阅读工单,判断应交给哪个团队、是否紧急,以及自动回复是否安全。这只需不到一秒。
然后,如果 Jev 非常确定自动回复是安全的,就由 LLM 撰写回复。
之后,Jev 检查回复,在发送前判断内容是否正确、礼貌。
这里,LLM 完成系统 2 工作,也就是写作和推理;Jev 完成系统 1 工作,也就是快速、反复地做决策。两者各自发挥所长。
这种由一步决定路径、另一步完成工作的流程,是一种常见模式。AI Orchestration 一文端到端介绍了这些模式。
现在,我们应该已经理解了 Jev 和 System One 模型:它们如何模仿人脑快速的系统 1 思维;如何在一次处理中回答所有问题,而不是逐 token 生成;类型化答案如何杜绝错误格式;RLCD 如何让概率变得可信;以及应该如何与 LLM 配合使用。
准备 AI Engineering 面试:AI Engineering Interview Questions
今天就到这里。
谢谢。
Amit Shekhar
Outcome School 创始人