Jev 与 System One 模型详解

这篇文章会介绍 Jev 和 System One 模型。这是一种新型 AI 模型:它完全不生成文本,只做出可由软件直接使用的快速决策。我们还会看到系统 1 与系统 2 思维分别是什么,为什么用普通 LLM 处理小型决策既慢又不可靠,Jev 如何在一次处理过程中同时回答多个问题,而不是逐词生成;什么是有类型约束的答案;如何让每个答案所附的概率如实反映模型把握;为什么说 Jev 不会产生幻觉;以及它擅长和不擅长哪些场景。

本文会讨论以下内容:

  • 什么是 System One 模型?
  • 系统 1 思维与系统 2 思维
  • 使用 LLM 做决策的问题
  • 什么是 Jev?
  • Jev 如何工作
  • 类型化答案:选择、评分与是/否
  • 校准与 RLCD
  • Jev 为什么不会产生幻觉
  • Jev 与 LLM 对比
  • Jev 擅长什么,又会在哪里失效
  • 应该使用哪一种

我是 Amit ShekharOutcome School 创始人。我教过并辅导过许多开发者,他们凭自己的努力获得了高薪技术岗位;我也帮助许多科技公司解决过各自独特的问题,并创建了多个被顶级公司采用的开源库。我热衷于通过开源、博客和视频分享知识。

我在 Outcome School 教授 AI and Machine Learning

我们开始吧。

什么是 System One 模型?

System One 模型是一种查看当前情况并返回决策、而非文本的 AI 模型。

简单说,我们给它一些信息和一份固定的候选答案列表。它从中选出一个答案,同时给出一个数字,表示自己有多大把握。

假设我们经营一家网店。客户发来消息:“我的卡被扣了两次款。”我们想知道应该由哪个团队处理。候选答案是 billingtechnicalaccount。System One 模型读完消息后,会返回 billing,概率为 0.97,也就是有 97% 的把握。

就这么简单。它不会替客户写回复,也不会解释自己的思考过程,只负责做决定。

System One 模型 = System One + 模型

这里的“System One”源自一个关于人脑如何思考的著名理论,“模型”则指 AI 模型。因此,System One 模型就是一种模仿人脑系统 1 思维方式的 AI 模型。

在介绍 Jev 之前,我们必须先了解系统 1 和系统 2 思维是什么。

系统 1 思维与系统 2 思维

诺贝尔奖得主、心理学家 Daniel Kahneman 认为,我们的大脑有两种思考方式。

系统 1 快速、自动,几乎不费力。看到朋友的脸,我们立刻就知道对方是谁。有人问“2 + 2 等于几?”,我们不假思索就会回答“4”,不需要坐下来计算,答案自然就出来了。

系统 2 缓慢、谨慎,需要投入精力。有人问“17 × 24 等于几?”时,我们会停下来逐步思考并算出结果,这需要时间和精力。

两者都有用。系统 1 每天处理成千上万个小决策,系统 2 则负责难题。

注意: Kahneman 写作 System 1 和 System 2;TypeSafe 则把模型名称写成 System One。两者表达的是同一个概念。

下面把这个理论与 AI 联系起来。

LLM 是 Large Language Model(大语言模型)的缩写,也是 ChatGPT 等聊天机器人的底层 AI 模型。它会把文本拆成一个个小片段,依次生成。即使我们只问一个简单的是非题,它也要经历这个缓慢的写作过程。更新的推理模型更进一步,会先逐步写出思考过程,再给出最终答案。这属于系统 2 式工作:能力强大,但速度慢、成本高。

然而,真实软件内部的大多数决策既小又重复:这封邮件是不是垃圾邮件?这张工单应该交给哪个团队?这条评论是正面还是负面?这个答案能否安全地展示给用户?这些都属于系统 1 式决策。我们需要立即获得答案,而且每天要做数百万次。

所以问题来了:为什么要用缓慢的系统 2 式模型,处理快速的系统 1 式决策?

System One 模型正是为了解决这个问题而构建的。

如果想深入学习大语言模型(LLM)、推理模型和自回归模型,可以查看 Outcome School 的 AI and Machine Learning Program

使用 LLM 做决策的问题

通过例子最容易理解这个问题。

假设我们有一套客服系统,要把每张新工单发送给正确的团队。今天,大多数人会像下面这样使用 LLM:

prompt = """
Classify this support ticket into one of: billing, technical, account.
Reply with only the category name.

Ticket: My card was charged twice.
"""

response = llm.generate(prompt)
category = response.text.strip()

这里,我们要求 LLM 阅读工单,并且只回复类别名称。看起来很简单,问题却不少。

问题 1:它逐个 token 写出答案。

token 是一小段文本,大致相当于一个词或词的一部分。LLM 会逐个 token写出答案。为了写出“billing”,它先预测“bill”,再预测“ing”,依此继续。每一步都要让庞大的模型完整运行一遍。因此,即使只回答一个词,也需要许多步;如果模型决定补充解释,步骤还会更多。

问题 2:我们无法信任输出格式。

我们明明只要求类别名称,模型却可能回答“The category is billing.”、“Billing.”、“billing, let me know if you need anything else.”,甚至给出候选列表中根本不存在的“refund”。于是,我们还得编写额外代码清理输出,而且编写这类清理代码时经常会出错,并以意想不到的方式崩坏。

问题 3:我们不知道它有多大把握。

模型回答“billing”,但它的把握究竟是 99% 还是 51%?我们无从得知,也就无法判断什么时候可以相信它,什么时候应该把工单交给人工。

问题 4:速度慢、成本高。

前沿 LLM,也就是目前规模最大、能力最强的一类模型,完成这种调用也要花几秒。如果每天有 100 万张工单,等待时间和费用都会迅速累积。

我们需要一种只负责决策的模型:立即完成决策,始终返回有效答案,还能告诉我们它有多大把握。

Jev 正是为此而来。

什么是 Jev?

Jev 是第一个 System One 模型,由 TypeSafe AI 公司开发。

它于 2026 年 9 月 15 日发布。TypeSafe AI 由 ChatGPT 背后的参与者之一 Diogo Almeida 创立,团队花了约两年时间,低调研发一种新的模型训练方法,Jev 就是这项工作的成果。

Jev 最令人意外的一点是:它完全不生成文本。

我们无法与 Jev 聊天,也不能让它写邮件或代码。它接收当前情况作为输入,输出带有概率的类型化决策,仅此而已。

下面看看它如何工作。

Jev 如何工作

Jev 接收两类输入:

  • 状态(State):关于当前情况的信息。状态只是“模型为了了解眼下情况所需的一切信息”的简称,内容始终是文本,可以是普通字符串、文本列表或 JSON 对象。JSON 对象是一种用标签和值表示数据的简单方式。例如,可以输入客户消息、客户最近几笔交易,以及退款政策。
  • 带候选答案的问题:我们想做什么决策,以及哪些答案有效。例如问题是“应该交给哪个团队?”,候选答案为 billingtechnicalaccount

它会返回:

  • 类型化答案:每个问题一个答案,而且一定从候选答案中选出。
  • 概率:每个答案都会附带一个 0 到 1 之间的数字,表示模型有多大把握。

来看一段代码。为了便于理解,下面进行了简化,并不是准确的 API:

result = jev.decide(
    state={
        "message": "My card was charged twice.",
        "recent_transactions": ["$49 on Sep 10", "$49 on Sep 10"]
    },
    questions={
        "team": ["billing", "technical", "account"],
        "is_urgent": "yes_no",
        "frustration": {"min": 0, "max": 2}
    }
)

结果是:

{
  "team": { "answer": "billing", "probability": 0.97 },
  "is_urgent": { "answer": true, "probability": 0.88 },
  "frustration": { "answer": 1, "probability": 0.74 }
}

这里可以注意到几点:

  • 一次调用提出三个问题,也得到了三个答案。
  • 每个答案都来自候选列表。team 只能是 billingtechnicalaccount,永远不会是“refund”或一句话。
  • 每个答案都附带一个概率。

最重要的是:Jev 在一次并行处理过程中回答所有问题。

这里的“并行”指同时进行,“一次处理”指模型只运行一遍。可以用一个类比来理解。

LLM 就像一个拿笔写文章的人。每个词都要等前一个词写完,不可能在第九个词之前先写第十个词。

Jev 则像一个在表格中勾选复选框的人。它把整个状态读一遍,再同时勾选所有答案,不需要等待“下一个词”。这正是 System One 模型的优势。

因此,Jev 速度极快。同一项决策,前沿 LLM 可能要用 3 秒到几分钟,Jev 只需约 70~500 毫秒,也就是不到一秒。TypeSafe 称,在这类任务上,Jev 比智能水平相当的 LLM 快 40~200 倍。在其自有评估中,Jev 处理决策任务的速度最多可达 Claude Sonnet 5 的 193 倍。

由于没有文本输出,输出侧也就没有费用。Jev 每百万输入 token 收费 0.042 美元,输出免费。

因此,它能立即完成决策,始终返回有效答案,告诉我们自己有多大把握,而且费用极低。前面提到的 LLM 方案四个问题,全都得到了解决。

以上就是 Jev 的工作方式。下面解释“类型化”是什么意思,因为这是 Jev 的核心。

类型化答案:选择、评分与是/否

在编程中,类型决定一个值可以保存什么内容。布尔类型的变量只能是 truefalse,绝不可能是“maybe”。这称为类型安全:程序甚至无法表示类型错误的值。TypeSafe 这家公司也因此得名。

Jev 把同样的理念带到了 AI 答案中。每个问题都有类型,答案必须符合该类型。Jev 支持三种类型化答案:

选择(Choice):从固定列表中选择一项。例如 billingtechnicalaccount。Jev 的一份列表最多支持 255 个选项。

评分(Score):从固定范围中选择一个数字。例如,沮丧程度从 0 到 2,或质量评分从 1 到 5。

是/否(Yes/No):答案为 truefalse。例如:“这件事紧急吗?”

每一种答案都会附带概率。

那么,Jev 如何确保答案始终符合类型?

答案是:Jev 不把答案写成文本,而是给候选项评分。为了便于理解,可以这样想:对于有三个选项的选择题,Jev 会为每个选项给出一个概率,三个概率之和为 1。答案就是概率最高的选项。由于根本没有第四个位置,它也不可能输出第四种选项。

这与要求 LLM“用 JSON 回复”截然不同。LLM 仍然逐 token 写出 JSON,我们只能寄希望于最终格式有效;Jev 则在模型运行之前,就已经固定了答案的形状。

给你的一点提示

无论从事哪个技术领域,都应该熟悉以下主题:

  • LLM
  • RAG
  • MCP
  • Agent
  • Fine-tuning
  • Quantization

我们在一个视频里把它们串了起来:

AI Engineering Explained: LLM, RAG, MCP, Agent, Fine-Tuning, and Quantization

不用停下来现在就看,先收藏,之后有时间再看。未来的你会感谢现在的自己。

下面回到主题。

校准与 RLCD

到目前为止,我们知道 Jev 会为每个答案返回概率。接下来最重要的问题是:这个概率值得相信吗?

这正是**校准(calibration)**要解决的问题。

当模型给出的概率与现实相符时,就称模型经过了校准。 简单说,如果把模型声称“我有 90% 把握”的所有答案放在一起,那么其中约 90% 应该确实正确。不是 60%,也不是 99%,而是大约 90%。

假设天气应用在 100 个不同的日子里都预报“降雨概率为 70%”。如果其中约 70 天下了雨,它就经过了良好校准;如果只下了 30 天,那么它没有校准好,所说的 70% 也毫无意义。

大多数 LLM 并没有为此训练。它们的训练目标是写出人类喜欢的文本。因此,当 LLM 说“我很有把握”时,它只是在写听起来很自信的话。

Jev 的训练方式不同,采用了 TypeSafe 所称的 RLCD

RLCD = Reinforcement Learning for Calibrated Decisions(面向校准决策的强化学习)

我们把它拆开来看。

**强化学习(Reinforcement Learning)**是一种训练方式:模型做出决策;结果好就获得奖励,结果差就受到惩罚。经过数百万次尝试,模型逐渐学会做出更好的决策。

**面向校准决策(For Calibrated Decisions)**意味着奖励不只取决于答案是否正确,还取决于模型是否如实表达自己的把握。来看一个例子:

  • 模型说有 99% 把握,而且答对:高额奖励。
  • 模型说有 99% 把握,却答错:高额惩罚。
  • 模型说有 55% 把握,而且答对:少量奖励。
  • 模型说有 55% 把握,却答错:少量惩罚。

因此,模型想取得好成绩,唯一办法就是:真正很可能答对时给出高概率,没有把握时给出低概率。概率由此变得可信。

这种可信的概率对我们很有用。现在可以编写以下代码:

if result["team"]["probability"] > 0.9:
    route_to(result["team"]["answer"])
else:
    send_to_human()

Jev 把握很大时,我们就相信它;把握不足时,则把工单交给人工。普通 LLM 从未提供过这样一个可信的数字,所以我们无法用它写出这几行逻辑。Jev 让这件事变得很简单。

注意: 校准并不表示每个答案都正确。概率为 90% 的答案仍有 10% 的可能出错。校准只说明这个数字诚实可信,让我们知道应该在多大程度上相信它。

如果想深入学习 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)、奖励模型和近端策略优化(Proximal Policy Optimization,PPO),Outcome School 的 AI and Machine Learning Program 提供了完整课程。

Jev 为什么不会产生幻觉

你一定听说过 LLM 会产生幻觉。简单说,幻觉就是模型自信地说出不真实或不存在的内容。它可能虚构一本从未有人写过的书、一个不存在的函数,或候选列表里没有的类别。

TypeSafe 提出了一个很强的主张:Jev 不会产生幻觉。这里很容易产生误解,所以要准确理解它的含义。

要求模型做决策时,它可能犯两类错误:

类型错误(Type error):答案甚至不属于有效类型。我们要求从 billingtechnicalaccount 中选择,模型却回答“refund”,或写了一整段话。

答案错误(Wrong answer):答案形式有效,但选错了。工单讨论的是登录问题,模型却选择 billing

Jev 永远不会犯类型错误。这是数学保证,不是一句承诺。答案始终是候选项之一,因为模型只给候选项评分,模型内部没有生成其他内容的路径。TypeSafe 甚至表示,只要找到一个反例,就足以推翻这项主张。

Jev 仍然可能给出错误答案。但由于模型经过校准,没有把握时返回的概率会更低。因此,我们可以通过概率拦截大多数错误答案,再把这些情况交给人工。

这里所说的“不会产生幻觉”是指:它永远不会虚构一个不存在的答案,而且没有把握时会如实告诉我们。

还有一点值得注意。通常,我们认为系统 1 很快但容易出错,系统 2 很慢但可靠。TypeSafe 颠倒了这种印象:对于这类决策任务,System One 模型可以比缓慢的替代方案更加可靠,因为从设计上说,它的答案只能来自候选项;从训练上说,它的置信度也如实可信。

Jev 与 LLM 对比

详细了解 Jev 后,下面把它与 LLM 放在一起比较。

为了便于理解,用表格列出两者的差异。

方面 Jev(System One 模型) LLM
输出 带概率的类型化决策 自由形式文本
回答方式 一次并行处理得出所有答案 逐个 token 生成
能否编写文本、代码和回复
能否逐步推理
输出格式保证 设计上始终有效 必须由代码清理和检查
置信度 每个答案都有经过校准的概率 不提供,或并不可信
速度 70~500 毫秒 数秒到数分钟
成本 每百万输入 token 0.042 美元,输出免费 高得多,输出 token 还要另行计费
输入 文本、JSON、文本列表 文本、图片、音频等
最适合 分类、路由、评分、检查、决策 聊天、写作、编程、推理、解释

Jev 擅长什么,又会在哪里失效

擅长的场景:

  • 路由:应该由哪个团队、哪个模型或哪套工作流处理?
  • 分类:是不是垃圾邮件、是正面还是负面、属于哪个类别?
  • 评分:这份文档有多相关,或这个答案有多好,评分为 1~5 中的多少?
  • Guardrail,也就是安全检查:这份 LLM 输出是否安全、切题且正确?Jev 可以在用户看到答案前,用不到一秒完成检查。
  • 实时决策:面向用户的应用中,任何不能等待数秒的决策。
  • 大型数据集:对数百万行数据重复执行相同决策,此时成本和速度最为重要。

不擅长的场景:

  • 编写任何内容:Jev 无法撰写回复、邮件、摘要或代码,因为它根本没有文本输出。
  • 开放式推理:如果任务需要多步思考,例如求解困难的数学问题,Jev 就不是正确工具。
  • 解释:Jev 只给出答案和概率,不说明理由。
  • 图片和音频:目前 Jev 只接受文本。
  • 非常大的候选列表:一个选择题最多支持 255 个选项。

如果想掌握编排与路由、LLM-as-a-Judge,以及 LLM 和 Agent 评估,可以查看 Outcome School 的 AI and Machine Learning Program

应该使用哪一种

最简单的规则是:

如果答案是一项决策,就使用 Jev;如果答案是一段文本,就使用 LLM。

在真实系统中,两者通常配合使用。假设我们正在构建一套自动回复客户的客服系统。

首先,Jev 阅读工单,判断应交给哪个团队、是否紧急,以及自动回复是否安全。这只需不到一秒。

然后,如果 Jev 非常确定自动回复是安全的,就由 LLM 撰写回复。

之后,Jev 检查回复,在发送前判断内容是否正确、礼貌。

这里,LLM 完成系统 2 工作,也就是写作和推理;Jev 完成系统 1 工作,也就是快速、反复地做决策。两者各自发挥所长。

这种由一步决定路径、另一步完成工作的流程,是一种常见模式。AI Orchestration 一文端到端介绍了这些模式。

现在,我们应该已经理解了 Jev 和 System One 模型:它们如何模仿人脑快速的系统 1 思维;如何在一次处理中回答所有问题,而不是逐 token 生成;类型化答案如何杜绝错误格式;RLCD 如何让概率变得可信;以及应该如何与 LLM 配合使用。

准备 AI Engineering 面试:AI Engineering Interview Questions

今天就到这里。

谢谢。

Amit Shekhar
Outcome School 创始人