展开目录
#TypeSafe#Jev#AI模型#AI Agent#深度分析

Jev:一个不会聊天的模型,把「判断」变成代码里的一句 if

ChatGPT 共同发明人 Diogo Almeida 结束两年 stealth,发布 System One 模型 Jev:它不生成文本,只返回带校准概率的类型化决策。70–500ms、$0.042/百万 token、输出免费,官方称在结构化判断上比前沿模型快 193.6 倍、便宜 444.6 倍。但它也有官方自己承认的 9 类失败模式。

预计阅读 15 分钟

一句话总结

一家藏在 stealth 里两年的公司 TypeSafe AI 在 9 月 15 日放出了 Jev——一个「给软件用、不给人看」的模型:你送进去一段状态(文本或 JSON)加几个带选项的问题,它返回的是选项、分数和校准过的概率,而不是一段需要你再解析的自然语言。官方给的口径是同一类判断上快 40–200 倍、便宜 40–400 倍;代价是它只会做「一秒内的直觉判断」,凡是需要算术、日期比较或多跳推理的场景,都得你自己在代码里解决。

数据来源:TypeSafe AI 官方发布帖《Introducing System One Models & Jev》(2026-09-15)与官方文档(docs.typesafe.ai 的 Models / Primitives / Confidence / AI primer / Jev 1.13 jaggedness 页面)、The Register(2026-09-16)、Vercel Changelog 与 AI Gateway 模型页、DCVC 融资公告与 BusinessWire 新闻稿、Hacker News 讨论帖(1901 分、约 500 条评论)、Forkast 分析。


一个不会写字的模型,四天刷屏

先把场景摆出来。你写过一个客服工单的分流逻辑:调一次大模型,让它判断这条消息该去「退款」「技术」「销售」哪个队列,然后在代码里写个 if。为了这个 if,你顺手写了三样东西——一个解析返回 JSON 的 parser、一个校验选项是否在枚举里的检查、一个失败重试。parser 存在的唯一原因,是模型只会写字。

Jev 押的就是这批「其实只是一个 if 语句」的模型调用。

它的发布方 TypeSafe AI 由 Diogo Almeida 创办,按官方文档的说法,他是 InstructGPT 论文作者之一,也是 RLHF(基于人类反馈的强化学习)的共同发明人——也就是 ChatGPT 那套「让模型听话」的方法的研究源头。他在发布帖里的开场问题很直接:“Models have been superhuman at chat for years, so where is all the automation?”(模型在聊天上超越人类好几年了,那自动化在哪里?)

发布当日,公司同时宣布完成了 4000 万美元种子轮(DCVC 领投),Forkast 报道其估值约 2 亿美元。三天之内,这条消息从 The Register 的报道走到 Vercel AI Gateway 上线,再走进 Hacker News 首页——发帖当天冲到 1900 分上下、近 500 条评论。

TypeSafe AI 官网首屏

配图:TypeSafe AI 官网(typesafe.ai)首屏,页面顶部公告条指向 9 月 15 日的发布帖,主标题写着 “The First (Public) System One”。图片为官网截图,版权归 TypeSafe AI 所有。

它到底在做什么:状态进去,类型化决策出来

官方的定义只有一句话:unstructured state in, typed probabilistic decisions out(无结构状态进,带概率的类型化决策出)。

和 LLM 的差别落在四个地方,官方发布帖自己列了一张对比表:

官方发布帖里的对比表:Existing LLMs vs System One + Jev

配图:官方发布帖中的对比表,逐项比较训练目标、输入、输出、采样方式、成本、速度、置信度与适用场景。图片来自 TypeSafe AI 官方发布帖,版权归 TypeSafe AI 所有。

  • 训练目标不同:LLM 用 RLHF(优化人类偏好的回复)或 RLVR(优化可程序化验证的奖励);Jev 用的是 RLCD——Reinforcement Learning for Calibrated Decisions,优化目标写得很明确:让「概率 0.8 的结果,在大量预测里约 80% 是对的」。
  • 采样方式不同:LLM 逐 token 顺序生成;Jev 在一次查询里并行产出所有答案,这也是它速度与成本优势的主要来源。
  • 输出契约不同:可能出现的取值在请求里就定死了,模型不可能返回枚举之外的值——所以官方敢说「零类型错误」。
  • 成本结构不同:输入 $0.042/百万 token,输出 token 免费,因为根本没有输出 token 可数。

官方文档 AI primer 中的三条后训练路径

配图:官方文档 AI primer 里的训练路径图——预训练语言模型在 RLHF 之后走向对话模型(ChatGPT、Claude),在 RLVR 之后走向推理模型(o1、o3),而 RLCD 是一条被官方高亮出来的第三条路。图片来自 TypeSafe 官方文档,版权归 TypeSafe AI 所有。

官方对 RLHF 的批评也写在文档里:偏好优化会奖励「说人爱听的话」,并导致 mode dropping——模型把概率质量集中到被奖励的那种风格上,其它可能的回答被丢掉。

官方文档中的 mode dropping 示意

配图:官方文档用一张分布图解释 mode dropping——基底模型 p(x) 的多个峰,在 RLHF 之后只剩下被奖励的那一个峰(π(x) 被削得又尖又高)。图片来自 TypeSafe 官方文档,版权归 TypeSafe AI 所有。

三个原语:Choice / Score / Noul

工程接口只有三个「问题类型」,官方叫 AI primitives:

原语回答什么返回什么
Choice从给定选项里选一个(最多 255 个选项)choice + 全量概率分布 + confidence
Score按你定义的档位打分,可落在两档之间score + legend + 概率分布 + confidence
Noul某个判断是真还是假noul:0–1 的「是」的概率(无独立 confidence)

三个原语可以混在同一次调用里,各自独立针对同一份 state 并行求值——官方强调加问题几乎不增加延迟,也不会互相串扰(no context rot)。

三个原语与 confidence 门控流程

配图:Jev 的三个原语与 confidence 门控流程(依据官方文档 Primitives 与 Confidence 章节整理)。判断交给模型,决定权留在代码里——这也是整个 System One 设计的核心主张。

官方文档 Primitives 页面

配图:官方文档 Primitives 页面,其中反复强调一条设计纪律:「Ask for one snap judgment per question」——一个问题只问一个能在几秒内做出的判断,多因素判断要拆成多个问题、再用代码加权组合。图片为 TypeSafe 官方文档截图,版权归 TypeSafe AI 所有。

官方文档给的标准用法长这样:

from typesafe_sdk import Noul, Choice

resp = client.system_one(
    state="我的卡被扣了两次,麻烦看一下。",
    questions={
        "refund_requested": Noul(instructions="客户是否要求退款?"),
        "queue": Choice(
            instructions="这条工单应该交给哪个队列?",
            criteria={"billing": "账单问题", "technical": "技术问题", "other": "其它"},
        ),
    },
)

ans = resp.answers["queue"]
if ans.confidence < 0.5:
    route_to_human(state)          # 模型自己说「不确定」,就不要再猜
elif ans.choice == "billing":
    handle_billing(state)

confidence 是官方推荐的关键杠杆:高置信自动执行、中置信先确认、低置信转人工——阈值按风险分级,官方文档给的原则是「read-only 操作的门槛可以低,破坏性操作的门槛要高」。

硬指标(截至 2026-09-19,模型版本 jev-1.13)

项目数值
模型 IDjev-1.13.0(别名 jev-latest / jev-preview),统一走 POST /v1/systemone
价格输入 $0.042/百万 token($42/十亿),输出免费
限速25 万 token/秒、1200 请求/分钟(官方称随 GPU 到位动态调整)
上下文单次请求 64k token;其中 state + 最长的问题合计不超过 32k
输入模态仅文本(字符串 / JSON 对象 / 文本数组),不支持图像、音频、视频
延迟官方口径 70–500ms(自测跑在美西的服务器上)
定制不做客户数据微调/LoRA,所有账号共用同一份权重;领域知识放进 state,规则放进 instructionscriteria

把它换算成日常感受:官方那个 Doom demo 让 Jev 以约 每秒 10 次判断控制游戏里的机器人,跑一小时花约 7 美元——官方员工原话是「比我们预想的便宜」。作为对照,媒体在报道里拿 GPT-5.6 Terra 的价格做比较:输入 $2/百万、输出 $12/百万 token。

名字的出处:杰文斯悖论

Jev 这个名字来自 19 世纪经济学家 William Stanley Jevons。他观察到一个反直觉的现象:蒸汽机效率提高、单位煤炭消耗下降之后,英国的煤炭总消耗量反而上升——因为便宜下来的能源解锁了更多用途。

杰文斯悖论与「便宜到可以到处用」

配图:官方 FAQ 里对名字由来的解释与杰文斯悖论的示意(成本与用量曲线为示意,非实测数据;说明文字来自官方发布帖)。

TypeSafe 把这个逻辑平移到智能上:每降一个数量级的成本,就会解锁多一个数量级的使用场景。这也解释了它为什么不打算和前沿 LLM 抢同一块地盘——它的赌注是:未来绝大多数 AI 调用根本不是给人看的聊天,而是软件内部一个廉价、快速、可校验的判断。

官方给出的证据,以及官方自己标出的边界

发布帖里最硬的两张图,一张讲「类型错误」,一张讲「性价比」。

结构化输出错误率与工具调用错误率对比

配图:官方发布帖中的两张误差对比图——左为结构化输出错误率,右为工具调用错误率,Jev 均为 0%,对比对象包括 OpenAI、Anthropic、Google 的多个模型。图片来自 TypeSafe AI 官方发布帖,版权归 TypeSafe AI 所有。

准确率 vs 成本的帕累托前沿

配图:官方发布帖中「4 条工作流的平均:准确率 vs 成本」图,Jev 以约 68% 的准确率、$0.0005 量级的单次成本占据帕累托前沿左侧。图片来自 TypeSafe AI 官方发布帖,版权归 TypeSafe AI 所有。

需要留意的是,官方把这些数字的边界写得非常清楚(这点在 AI 发布里并不常见):

官方发布帖的 Evidence 章节与 nuance 说明

配图:官方发布帖 Evidence 章节开头与 side-by-side 演示的说明。图片来自 TypeSafe AI 官方发布帖,版权归 TypeSafe AI 所有。

  • 0% 类型错误不是实测结果,而是架构保证——官方原话是「这很容易用一个反例证伪,但它在数学上不可能发生」;它保证的是「不会吐出不存在的第 6 个枚举值」,不保证「选出来的那个判断是对的」。
  • 速度与成本的 193.6× / 444.6× 来自官方自家 4 条工作流的评测,官方主动补了三条弱化说明:评测机器是美西的笔记本、参考基线用 GPT-6 Astra 与 Fable 5.1 的平均值(偏向 OpenAI/Anthropic,可能低估了自己)、「我们无法证明这个价格没有补贴」。
  • 评测工作流由官方团队自己构造,不在训练分布里,但不排除存在偏向

已经落地的地方

  • Vercel AI Gateway:9 月 16 日上线,模型 ID typesafe-ai/jev,通过 AI SDK 7 的 experimental_evaluate 调用;官方 changelog 特别标注它支持 Zero Data Retention 与 No Training(逐请求开启)。
  • 智能工作流:官方给的典型形态是「智能 if」——分类、路由、打分、抽取、分支。文档示例覆盖客服工单路由、告警分诊、发票与回执核对、RAG 段落相关性筛选。
  • 验证与护栏:给 LLM 的输出/推理链打分、判断是否越狱、做审核前置开关。
  • 实时交互:Doom(10 QPS)、Wikipedia 跳转游戏 Wikiracing(官方特意说明这个 demo 里 Jev 的优势缩小了,因为对比对象是各家模型的非推理模式)。

官方示例:安全告警分诊工作流

配图:官方发布帖中 4 条评测工作流里最简单的一条——安全告警的 triage / disposition / containment / playbook 四段判断链,每一步都是 Jev 的 Choice 或 Score 问题。图片来自 TypeSafe AI 官方发布帖,版权归 TypeSafe AI 所有。

官网演示的基准面板

配图:TypeSafe 官网首页的基准对比面板(动效截图):Jev 显示 193.6× / $0.39,其余对比模型为 6.2×–1.0×、$176–$3 量级。图片为官网截图,版权归 TypeSafe AI 所有。

官方自己承认的短板:9 类失败模式

Jev 1.13 的文档里有一页专门叫 jaggedness(凹凸不平之处),是这次发布里最值得读的部分之一:官方把已知的失败模式一条条列出来,并给出替代做法。

官方文档 Jev 1.13 jaggedness 页面

配图:官方文档 Jev 1.13 jaggedness 页面,9 条失败模式与推荐替代做法。图片为 TypeSafe 官方文档截图,版权归 TypeSafe AI 所有。

#失败模式官方建议
1字面理解(只回答你写的字面问题)把精确条件、边界情形写进 instructions 与 criteria
2数学与数字算术留在代码里
3日期与时间比较拆出年月日等成分,比较交给代码
4多跳推理(间接指代、双重否定)减少跳跃层级,直接点名 state 里的字段
5state 里塞满无关细节先在代码里过滤,只送问题需要的字段
6对抗性内容(prompt 注入式操控)明确写清 criteria,上线前测边界用例
7instructions 与 criteria 相互矛盾把 criteria 当作 instructions 的延伸,措辞对齐
8「常识性结构不变量」不成立别指望 Noul 与 Choice 之间的概率能互相换算
9生成要生成文本,就去找生成模型

其中第 8 条尤其值得记:官方实测,同一个问题「客户是否要求退款?」用 Noul 问得到 0.22,用二值 Choice 问得到 yes 0.01 / no 0.99(confidence 0.97);换个提问方式,P(退款) = 0.72P(非退款) = 0.47,两者相加 1.19。也就是说,别把 Noul 上调好的阈值直接搬到 Choice 上,也别指望模型满足概率上的恒等式。

文档还明确点出 Jev 存在 context rot:state 越长、无关内容越多,准确率越低。

争议:1900 分底下,大家在拆什么

Hacker News 的讨论同时是这次发布最热烈的传播和最集中的批评现场。三类质疑最有代表性:

第一类:拆「不能幻觉」这个说法。 官方口径是「Jev 不给字符串、只返回类型安全的取值,所以不会幻觉」。评论区立刻在语义上做了分割:如果模型可以给出 0.95 的置信度然后判错,那和「自信地胡说」有什么区别?也有人站官方那边——「幻觉」指凭空造出无依据的内容,而 Jev 连造这个词的能力都没有;判断错了就是判断错了。官方自己在文档里的措辞其实更严谨:零类型错误是架构性质,校准说的是「0.8 的预测在大量样本里约 80% 正确」,不构成对单次答案的保证。

第二类:这不就是结构化输出吗? 反对意见认为主流模型的 JSON schema / 约束解码已经能给出合法枚举,Jev 只是更快更便宜;支持方的回应是——结构化输出给你一个值,Jev 给你值的分布,有了分布才能做「自动执行 or 转人工」的门控,这才是它能进生产系统的地方。

第三类:算不算「前沿模型」。 有评论认为把它放进 frontier 一栏是营销称谓;也有评论说它探索的是一条不同的刻度——不是「更聪明」,而是「单位时间能做出多少可依赖的判断」。

另有一种更宏观的读法(Forkast 的分析):Jev 的价值不在取代 LLM,而在押注未来的 agent 栈是模块化的——高频、低复杂度的判断交给专用原语,前沿 LLM 只负责真正需要推理的少数调用。

四天时间线

配图:从 9 月 15 日发布到 HN 争议的时间线,依据官方发布帖、The Register 报道、官方文档与 HN 讨论帖整理。

该不该上手:一份判断清单

适合先试的:任何一个你现在用 LLM 做的、输出是「几个选项里的一个」或「一个分数」的调用——工单分流、告警定级、内容审核前置、发票/回执字段核对、RAG 段落相关性过滤、给别的模型输出打分。这类调用通常占账单的比例不小,但复杂度低、失败可兜底,是最划算的试点。

先别碰的:需要推理与生成的任务(写代码、写文档、总结长文)、需要算术与日期比较的任务、需要模型自己规划多步的任务、以及需要图像/音频输入的场景(Jev 目前只吃文本)。

上线前务必做的三件事:① 把宽泛的判断拆成原子问题,用代码做加权组合,而不是把一长串要求塞进一条 instructions;② 把 confidence 门控写进流程——低置信直接转人工,别让它「猜」;③ 用你自己的数据先跑一批,观察校准是否成立(官方也承认阈值要按你的领域调)。

结语

Jev 不会写邮件、不会总结文档、不会解释报错栈——它连一个句子都不会造。它要做的是把过去两年里大量「用大炮打蚊子」的 AI 调用,换成一种软件真正能依赖的接口:明确的取值、诚实的概率、毫秒级的响应和便宜到可以到处用的价格。

它现在还很小:只吃文本,上下文有限,数学要你自己算,官方自己列了 9 条失败模式,第三方评测也还来不及出现。但它的方向值得记一笔——如果连判断本身都能变成一个类型,那 AI 走进普通软件的方式,可能不是聊天窗口,而是一行 if


数据来源:TypeSafe AI 官方发布帖《Introducing System One Models & Jev》(2026-09-15);TypeSafe 官方文档(Jev 1.13 jaggedness / Primitives / Confidence / AI primer / Models 页面,docs.typesafe.ai);The Register《TypeSafe AI debuts model for machines that plays Doom》(2026-09-16);Vercel Changelog 与 AI Gateway 模型页(2026-09-16);DCVC 融资公告与 BusinessWire 新闻稿;Hacker News 讨论帖(1901 分、约 500 条评论);Forkast 分析《TypeSafe AI’s Jev Is Not an LLM — And That May Be the Point》;Techmeme、SiliconANGLE、WindowsForum 等媒体报道。文中所有性能与价格数字均来自官方公开口径,尚未有独立的第三方复现。

配图说明:官网/文档截图与官方发布帖图表均下载自 TypeSafe AI 官方站点(typesafe.ai / docs.typesafe.ai / jevai 相关页面),版权归 TypeSafe AI 所有,此处用于新闻报道与评论;流程图、杰文斯悖论示意图、时间线与封面为本站自制。

Related

相关文章

延伸阅读

查看全部 →