Jev 与 System One 模型详解

---
title: "Jev 与 System One 模型详解"
author: "Amit Shekhar"
source_url: "https://outcomeschool.com/blog/jev-and-system-one-models-explained"
published_at: "2026-09-17T00:00:00.000Z"
fetched_at: "2026-09-17T15:53:33Z"
updated_at: "2026-09-17T15:53:33Z"
language: "zh"
review_status: "draft"
---

# Jev 与 System One 模型详解

![](https://outcomeschool.com/static/images/blog/jev-and-system-one-models-explained.png)

这篇文章会介绍 Jev 和 System One 模型。这是一种新型 AI 模型:它完全不生成文本,只做出可由软件直接使用的快速决策。我们还会看到系统 1 与系统 2 思维分别是什么,为什么用普通 LLM 处理小型决策既慢又不可靠,Jev 如何在一次处理过程中同时回答多个问题,而不是逐词生成;什么是有类型约束的答案;如何让每个答案所附的概率如实反映模型把握;为什么说 Jev 不会产生幻觉;以及它擅长和不擅长哪些场景。

本文会讨论以下内容:

- 什么是 System One 模型?
- 系统 1 思维与系统 2 思维
- 使用 LLM 做决策的问题
- 什么是 Jev?
- Jev 如何工作
- 类型化答案:选择、评分与是/否
- 校准与 RLCD
- Jev 为什么不会产生幻觉
- Jev 与 LLM 对比
- Jev 擅长什么,又会在哪里失效
- 应该使用哪一种

我是 **Amit Shekhar**,[Outcome School](https://outcomeschool.com) 创始人。我教过并辅导过许多开发者,他们凭自己的努力获得了高薪技术岗位;我也帮助许多科技公司解决过各自独特的问题,并创建了多个被顶级公司采用的开源库。我热衷于通过开源、博客和视频分享知识。

我在 Outcome School 教授 [AI and Machine Learning](https://outcomeschool.com/program/ai-and-machine-learning)。

我们开始吧。

## 什么是 System One 模型?

**System One 模型是一种查看当前情况并返回决策、而非文本的 AI 模型。**

简单说,我们给它一些信息和一份固定的候选答案列表。它从中选出一个答案,同时给出一个数字,表示自己有多大把握。

假设我们经营一家网店。客户发来消息:“我的卡被扣了两次款。”我们想知道应该由哪个团队处理。候选答案是 `billing`、`technical` 和 `account`。System One 模型读完消息后,会返回 `billing`,概率为 0.97,也就是有 97% 的把握。

就这么简单。它不会替客户写回复,也不会解释自己的思考过程,只负责做决定。

**System One 模型 = System One + 模型**

这里的“System One”源自一个关于人脑如何思考的著名理论,“模型”则指 AI 模型。因此,System One 模型就是一种模仿人脑系统 1 思维方式的 AI 模型。

在介绍 Jev 之前,我们必须先了解系统 1 和系统 2 思维是什么。

## 系统 1 思维与系统 2 思维

诺贝尔奖得主、心理学家 Daniel Kahneman 认为,我们的大脑有两种思考方式。

**系统 1** 快速、自动,几乎不费力。看到朋友的脸,我们立刻就知道对方是谁。有人问“2 + 2 等于几?”,我们不假思索就会回答“4”,不需要坐下来计算,答案自然就出来了。

**系统 2** 缓慢、谨慎,需要投入精力。有人问“17 × 24 等于几?”时,我们会停下来逐步思考并算出结果,这需要时间和精力。

两者都有用。系统 1 每天处理成千上万个小决策,系统 2 则负责难题。

**注意:** Kahneman 写作 System 1 和 System 2;TypeSafe 则把模型名称写成 System One。两者表达的是同一个概念。

下面把这个理论与 AI 联系起来。

LLM 是 Large Language Model(大语言模型)的缩写,也是 ChatGPT 等聊天机器人的底层 AI 模型。它会把文本拆成一个个小片段,依次生成。即使我们只问一个简单的是非题,它也要经历这个缓慢的写作过程。更新的[推理模型](https://outcomeschool.com/blog/large-reasoning-models)更进一步,会先逐步写出思考过程,再给出最终答案。这属于系统 2 式工作:能力强大,但速度慢、成本高。

然而,真实软件内部的大多数决策既小又重复:这封邮件是不是垃圾邮件?这张工单应该交给哪个团队?这条评论是正面还是负面?这个答案能否安全地展示给用户?这些都属于系统 1 式决策。我们需要立即获得答案,而且每天要做数百万次。

所以问题来了:为什么要用缓慢的系统 2 式模型,处理快速的系统 1 式决策?

System One 模型正是为了解决这个问题而构建的。

如果想深入学习大语言模型(LLM)、推理模型和自回归模型,可以查看 Outcome School 的 [AI and Machine Learning Program](https://outcomeschool.com/program/ai-and-machine-learning)。

## 使用 LLM 做决策的问题

通过例子最容易理解这个问题。

假设我们有一套客服系统,要把每张新工单发送给正确的团队。今天,大多数人会像下面这样使用 LLM:

```python
prompt = """
Classify this support ticket into one of: billing, technical, account.
Reply with only the category name.

Ticket: My card was charged twice.
"""

response = llm.generate(prompt)
category = response.text.strip()
```

这里,我们要求 LLM 阅读工单,并且只回复类别名称。看起来很简单,问题却不少。

**问题 1:它逐个 token 写出答案。**

[token](https://outcomeschool.com/blog/bpe-in-llms) 是一小段文本,大致相当于一个词或词的一部分。LLM 会[逐个 token](https://outcomeschool.com/blog/autoregressive-models)写出答案。为了写出“billing”,它先预测“bill”,再预测“ing”,依此继续。每一步都要让庞大的模型完整运行一遍。因此,即使只回答一个词,也需要许多步;如果模型决定补充解释,步骤还会更多。

**问题 2:我们无法信任输出格式。**

我们明明只要求类别名称,模型却可能回答“The category is billing.”、“Billing.”、“billing, let me know if you need anything else.”,甚至给出候选列表中根本不存在的“refund”。于是,我们还得编写额外代码清理输出,而且编写这类清理代码时经常会出错,并以意想不到的方式崩坏。

**问题 3:我们不知道它有多大把握。**

模型回答“billing”,但它的把握究竟是 99% 还是 51%?我们无从得知,也就无法判断什么时候可以相信它,什么时候应该把工单交给人工。

**问题 4:速度慢、成本高。**

前沿 LLM,也就是目前规模最大、能力最强的一类模型,完成这种调用也要花几秒。如果每天有 100 万张工单,等待时间和费用都会迅速累积。

我们需要一种只负责决策的模型:立即完成决策,始终返回有效答案,还能告诉我们它有多大把握。

Jev 正是为此而来。

## 什么是 Jev?

**Jev 是第一个 System One 模型,由 TypeSafe AI 公司开发。**

它于 2026 年 9 月 15 日发布。TypeSafe AI 由 ChatGPT 背后的参与者之一 Diogo Almeida 创立,团队花了约两年时间,低调研发一种新的模型训练方法,Jev 就是这项工作的成果。

Jev 最令人意外的一点是:**它完全不生成文本。**

我们无法与 Jev 聊天,也不能让它写邮件或代码。它接收当前情况作为输入,输出带有概率的类型化决策,仅此而已。

下面看看它如何工作。

## Jev 如何工作

Jev 接收两类输入:

- **状态(State)**:关于当前情况的信息。状态只是“模型为了了解眼下情况所需的一切信息”的简称,内容始终是文本,可以是普通字符串、文本列表或 JSON 对象。JSON 对象是一种用标签和值表示数据的简单方式。例如,可以输入客户消息、客户最近几笔交易,以及退款政策。
- **带候选答案的问题**:我们想做什么决策,以及哪些答案有效。例如问题是“应该交给哪个团队?”,候选答案为 `billing`、`technical` 和 `account`。

它会返回:

- **类型化答案**:每个问题一个答案,而且一定从候选答案中选出。
- **概率**:每个答案都会附带一个 0 到 1 之间的数字,表示模型有多大把握。

来看一段代码。为了便于理解,下面进行了简化,并不是准确的 API:

```python
result = jev.decide(
    state={
        "message": "My card was charged twice.",
        "recent_transactions": ["$49 on Sep 10", "$49 on Sep 10"]
    },
    questions={
        "team": ["billing", "technical", "account"],
        "is_urgent": "yes_no",
        "frustration": {"min": 0, "max": 2}
    }
)
```

结果是:

```json
{
  "team": { "answer": "billing", "probability": 0.97 },
  "is_urgent": { "answer": true, "probability": 0.88 },
  "frustration": { "answer": 1, "probability": 0.74 }
}
```

这里可以注意到几点:

- 一次调用提出三个问题,也得到了三个答案。
- 每个答案都来自候选列表。`team` 只能是 `billing`、`technical` 或 `account`,永远不会是“refund”或一句话。
- 每个答案都附带一个概率。

最重要的是:**Jev 在一次并行处理过程中回答所有问题。**

这里的“并行”指同时进行,“一次处理”指模型只运行一遍。可以用一个类比来理解。

LLM 就像一个拿笔写文章的人。每个词都要等前一个词写完,不可能在第九个词之前先写第十个词。

Jev 则像一个在表格中勾选复选框的人。它把整个状态读一遍,再同时勾选所有答案,不需要等待“下一个词”。这正是 System One 模型的优势。

因此,Jev 速度极快。同一项决策,前沿 LLM 可能要用 3 秒到几分钟,Jev 只需约 70~500 毫秒,也就是不到一秒。TypeSafe 称,在这类任务上,Jev 比智能水平相当的 LLM 快 40~200 倍。在其自有评估中,Jev 处理决策任务的速度最多可达 Claude Sonnet 5 的 193 倍。

由于没有文本输出,输出侧也就没有费用。Jev 每百万输入 token 收费 0.042 美元,输出免费。

因此,它能立即完成决策,始终返回有效答案,告诉我们自己有多大把握,而且费用极低。前面提到的 LLM 方案四个问题,全都得到了解决。

以上就是 Jev 的工作方式。下面解释“类型化”是什么意思,因为这是 Jev 的核心。

## 类型化答案:选择、评分与是/否

在编程中,**类型**决定一个值可以保存什么内容。布尔类型的变量只能是 `true` 或 `false`,绝不可能是“maybe”。这称为**类型安全**:程序甚至无法表示类型错误的值。TypeSafe 这家公司也因此得名。

Jev 把同样的理念带到了 AI 答案中。每个问题都有类型,答案必须符合该类型。Jev 支持三种类型化答案:

**选择(Choice)**:从固定列表中选择一项。例如 `billing`、`technical` 或 `account`。Jev 的一份列表最多支持 255 个选项。

**评分(Score)**:从固定范围中选择一个数字。例如,沮丧程度从 0 到 2,或质量评分从 1 到 5。

**是/否(Yes/No)**:答案为 `true` 或 `false`。例如:“这件事紧急吗?”

每一种答案都会附带概率。

那么,Jev 如何确保答案始终符合类型?

答案是:Jev 不把答案写成文本,而是给候选项评分。为了便于理解,可以这样想:对于有三个选项的选择题,Jev 会为每个选项给出一个概率,三个概率之和为 1。答案就是概率最高的选项。由于根本没有第四个位置,它也不可能输出第四种选项。

这与要求 LLM“用 JSON 回复”截然不同。LLM 仍然逐 token 写出 JSON,我们只能寄希望于最终格式有效;Jev 则在模型运行之前,就已经固定了答案的形状。

**给你的一点提示**

无论从事哪个技术领域,都应该熟悉以下主题:

- LLM
- RAG
- MCP
- Agent
- Fine-tuning
- Quantization

我们在一个视频里把它们串了起来:

[AI Engineering Explained: LLM, RAG, MCP, Agent, Fine-Tuning, and Quantization](https://www.youtube.com/watch?v=lnfWvX66FUk)

不用停下来现在就看,先收藏,之后有时间再看。未来的你会感谢现在的自己。

下面回到主题。

## 校准与 RLCD

到目前为止,我们知道 Jev 会为每个答案返回概率。接下来最重要的问题是:这个概率值得相信吗?

这正是**校准(calibration)**要解决的问题。

**当模型给出的概率与现实相符时,就称模型经过了校准。** 简单说,如果把模型声称“我有 90% 把握”的所有答案放在一起,那么其中约 90% 应该确实正确。不是 60%,也不是 99%,而是大约 90%。

假设天气应用在 100 个不同的日子里都预报“降雨概率为 70%”。如果其中约 70 天下了雨,它就经过了良好校准;如果只下了 30 天,那么它没有校准好,所说的 70% 也毫无意义。

大多数 LLM 并没有为此训练。它们的训练目标是[写出人类喜欢的文本](https://outcomeschool.com/blog/reinforcement-learning-from-human-feedback-rlhf)。因此,当 LLM 说“我很有把握”时,它只是在写听起来很自信的话。

Jev 的训练方式不同,采用了 TypeSafe 所称的 **RLCD**。

**RLCD = Reinforcement Learning for Calibrated Decisions(面向校准决策的强化学习)**

我们把它拆开来看。

**[强化学习(Reinforcement Learning)](https://outcomeschool.com/blog/reinforcement-learning)**是一种训练方式:模型做出决策;结果好就获得奖励,结果差就受到惩罚。经过数百万次尝试,模型逐渐学会做出更好的决策。

**面向校准决策(For Calibrated Decisions)**意味着奖励不只取决于答案是否正确,还取决于模型是否如实表达自己的把握。来看一个例子:

- 模型说有 99% 把握,而且答对:高额奖励。
- 模型说有 99% 把握,却答错:高额惩罚。
- 模型说有 55% 把握,而且答对:少量奖励。
- 模型说有 55% 把握,却答错:少量惩罚。

因此,模型想取得好成绩,唯一办法就是:真正很可能答对时给出高概率,没有把握时给出低概率。概率由此变得可信。

这种可信的概率对我们很有用。现在可以编写以下代码:

```python
if result["team"]["probability"] > 0.9:
    route_to(result["team"]["answer"])
else:
    send_to_human()
```

Jev 把握很大时,我们就相信它;把握不足时,则把工单交给人工。普通 LLM 从未提供过这样一个可信的数字,所以我们无法用它写出这几行逻辑。Jev 让这件事变得很简单。

**注意:** 校准并不表示每个答案都正确。概率为 90% 的答案仍有 10% 的可能出错。校准只说明这个数字诚实可信,让我们知道应该在多大程度上相信它。

如果想深入学习 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)、奖励模型和近端策略优化(Proximal Policy Optimization,PPO),Outcome School 的 [AI and Machine Learning Program](https://outcomeschool.com/program/ai-and-machine-learning) 提供了完整课程。

## Jev 为什么不会产生幻觉

你一定听说过 LLM 会产生幻觉。简单说,幻觉就是模型自信地说出不真实或不存在的内容。它可能虚构一本从未有人写过的书、一个不存在的函数,或候选列表里没有的类别。

TypeSafe 提出了一个很强的主张:Jev 不会产生幻觉。这里很容易产生误解,所以要准确理解它的含义。

要求模型做决策时,它可能犯两类错误:

**类型错误(Type error)**:答案甚至不属于有效类型。我们要求从 `billing`、`technical` 或 `account` 中选择,模型却回答“refund”,或写了一整段话。

**答案错误(Wrong answer)**:答案形式有效,但选错了。工单讨论的是登录问题,模型却选择 `billing`。

Jev 永远不会犯类型错误。这是数学保证,不是一句承诺。答案始终是候选项之一,因为模型只给候选项评分,模型内部没有生成其他内容的路径。TypeSafe 甚至表示,只要找到一个反例,就足以推翻这项主张。

Jev 仍然可能给出错误答案。但由于模型经过校准,没有把握时返回的概率会更低。因此,我们可以通过概率拦截大多数错误答案,再把这些情况交给人工。

这里所说的“不会产生幻觉”是指:**它永远不会虚构一个不存在的答案,而且没有把握时会如实告诉我们。**

还有一点值得注意。通常,我们认为系统 1 很快但容易出错,系统 2 很慢但可靠。TypeSafe 颠倒了这种印象:对于这类决策任务,System One 模型可以比缓慢的替代方案更加可靠,因为从设计上说,它的答案只能来自候选项;从训练上说,它的置信度也如实可信。

## Jev 与 LLM 对比

详细了解 Jev 后,下面把它与 LLM 放在一起比较。

为了便于理解,用表格列出两者的差异。

| 方面 | Jev(System One 模型) | LLM |
| --- | --- | --- |
| 输出 | 带概率的类型化决策 | 自由形式文本 |
| 回答方式 | 一次并行处理得出所有答案 | 逐个 token 生成 |
| 能否编写文本、代码和回复 | 否 | 是 |
| 能否逐步推理 | 否 | 是 |
| 输出格式保证 | 设计上始终有效 | 必须由代码清理和检查 |
| 置信度 | 每个答案都有经过校准的概率 | 不提供,或并不可信 |
| 速度 | 70~500 毫秒 | 数秒到数分钟 |
| 成本 | 每百万输入 token 0.042 美元,输出免费 | 高得多,输出 token 还要另行计费 |
| 输入 | 文本、JSON、文本列表 | 文本、图片、音频等 |
| 最适合 | 分类、路由、评分、检查、决策 | 聊天、写作、编程、推理、解释 |

## Jev 擅长什么,又会在哪里失效

**擅长的场景:**

- **路由**:应该由哪个团队、[哪个模型](https://outcomeschool.com/blog/llm-routing)或哪套工作流处理?
- **分类**:是不是垃圾邮件、是正面还是负面、属于哪个类别?
- **评分**:这份文档有多相关,或[这个答案有多好](https://outcomeschool.com/blog/llm-as-a-judge),评分为 1~5 中的多少?
- **[Guardrail](https://outcomeschool.com/blog/how-do-llm-guardrails-work)**,也就是安全检查:这份 LLM 输出是否安全、切题且正确?Jev 可以在用户看到答案前,用不到一秒完成检查。
- **实时决策**:面向用户的应用中,任何不能等待数秒的决策。
- **大型数据集**:对数百万行数据重复执行相同决策,此时成本和速度最为重要。

**不擅长的场景:**

- **编写任何内容**:Jev 无法撰写回复、邮件、摘要或代码,因为它根本没有文本输出。
- **开放式推理**:如果任务需要多步思考,例如求解困难的数学问题,Jev 就不是正确工具。
- **解释**:Jev 只给出答案和概率,不说明理由。
- **图片和音频**:目前 Jev 只接受文本。
- **非常大的候选列表**:一个选择题最多支持 255 个选项。

如果想掌握编排与路由、LLM-as-a-Judge,以及 LLM 和 Agent 评估,可以查看 Outcome School 的 [AI and Machine Learning Program](https://outcomeschool.com/program/ai-and-machine-learning)。

## 应该使用哪一种

最简单的规则是:

**如果答案是一项决策,就使用 Jev;如果答案是一段文本,就使用 LLM。**

在真实系统中,两者通常配合使用。假设我们正在构建一套自动回复客户的客服系统。

首先,Jev 阅读工单,判断应交给哪个团队、是否紧急,以及自动回复是否安全。这只需不到一秒。

然后,如果 Jev 非常确定自动回复是安全的,就由 LLM 撰写回复。

之后,Jev 检查回复,在发送前判断内容是否正确、礼貌。

这里,LLM 完成系统 2 工作,也就是写作和推理;Jev 完成系统 1 工作,也就是快速、反复地做决策。两者各自发挥所长。

这种由一步决定路径、另一步完成工作的流程,是一种常见模式。[AI Orchestration](https://outcomeschool.com/blog/ai-orchestration) 一文端到端介绍了这些模式。

现在,我们应该已经理解了 Jev 和 System One 模型:它们如何模仿人脑快速的系统 1 思维;如何在一次处理中回答所有问题,而不是逐 token 生成;类型化答案如何杜绝错误格式;RLCD 如何让概率变得可信;以及应该如何与 LLM 配合使用。

准备 AI Engineering 面试:[AI Engineering Interview Questions](https://github.com/amitshekhariitbhu/ai-engineering-interview-questions)

今天就到这里。

谢谢。

**Amit Shekhar**  
[Outcome School](https://outcomeschool.com) 创始人