Jev 模型是什么?
Jev 把文本或 JSON 状态转换为类型化选择、评分和概率;它面向软件内部决策,不用于聊天或自由文本生成。
Jev 模型是 TypeSafe AI 推出的第一个 System One Model。它专门处理可由软件直接消费的窄范围结构化判断:输入文本或 JSON state,同时评估一个或多个有明确类型的问题,再返回选择、评分、概率与置信度。
这让 Jev 很适合分类、路由、排序、验证和 Guardrail,但它不是聊天模型、编程模型、计算器或确定性业务规则的替代品。
核验日期:2026 年 9 月 19 日。 Jev 于 9 月 15 日以 early access 形式发布,当前官方文档记录的版本是 jev-1.13.0。本文的价格、限制、延迟和能力数字均来自 TypeSafe 发布文章与官方文档。我们没有获得非公开简报,没有运行可计费的 Jev benchmark,也没有独立复现 TypeSafe 的速度与质量宣传。
Jev 模型一览
| 项目 | 当前官方记录 |
|---|---|
| 开发者 | TypeSafe AI |
| 模型类别 | System One Model |
| 当前版本 ID | jev-1.13.0 |
| 稳定别名 | jev-latest |
| API 端点 | POST https://api.typesafe.ai/v1/systemone |
| 输入 | 仅文本,可放在字符串、JSON 对象或文本数组中 |
| 输出 | 类型化 Choice、Score 与 Noul 答案 |
| 上下文 | 每请求 64K token;state 加最长问题不得超过 32K |
| 直连 API 价格 | 每 100 万输入 token 为 $0.042;当前输出免费 |
| 默认速率限制 | 250,000 输入 token/s、1,200 请求/分钟,可能动态调整 |
| 厂商延迟宣传 | 端到端 70–500 ms |
| 发布状态 | Early access |
官方拼写是 Jev,并不是需要逐字母展开的 J-E-V 缩写。TypeSafe 表示,这个名字来自经济学家 William Stanley Jevons;“System One”则借用了 Daniel Kahneman 在《思考,快与慢》中推广的快速直觉式 System 1 概念。
Jev 到底做什么?
可以把 Jev 理解成一个带概率的语义函数:
非结构化或结构化状态
+ 预先定义的问题与答案空间
-> 类型化决策与概率分布
普通 LLM 的核心任务是延续 token 序列并生成字符串。即使开启 JSON mode,应用仍是在要求生成式模型“写出”一份答案。Jev 放弃自由生成:调用方先定义允许的输出形状,模型再针对同一份状态评估所有问题。
TypeSafe 把它的训练方法称为 Reinforcement Learning for Calibrated Decisions(RLCD,面向校准决策的强化学习)。目标不仅是选答案,还要让概率在一组相似预测上反映真实正确率。理想情况下,模型给出 0.8 的一批判断应约有 80% 正确。但校准是群体统计性质,不能保证某一次 0.8 的答案一定正确。
Choice、Score 与 Noul
Jev 提供三种问题类型。它们是 API 的核心原语,不是生成完成后附加的格式化选项。
| 原语 | 问题形状 | 返回内容 | 适合场景 |
|---|---|---|---|
Choice | 哪个选项最符合? | 被选选项、每个选项的概率、置信度 | 意图路由、分类、封闭集合排序 |
Score | 在描述好的等级中处于哪里? | 加权分数、各等级概率、置信度 | 严重度、质量、紧急程度、风险区间 |
Noul | 这句话是否成立? | 0 到 1 的概率 | 检测、验证、二元门控 |
一个 Choice 最多可包含 255 个选项;一个 Score 可定义 2–10 个有文字描述的等级。Noul 不另带 confidence 字段,因为它的 0–1 数值本身就是“是”的概率。
同一请求中的多个问题会针对相同 state 独立、并行评估。这适合一次拿到多组信号,但也意味着一个答案不会自动影响另一个答案。如果问题 B 依赖问题 A,应该由代码明确表达这种依赖。
一个 Jev API 请求
下面的精简示例沿用 TypeSafe 官方请求结构:一次调用同时判断客服消息该由谁处理、用户有多不满,以及是否紧急。
curl https://api.typesafe.ai/v1/systemone \
-H "Authorization: Bearer $TYPESAFE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"state": "我的付款已经连续三天失败,正在损失订单,请马上帮忙。",
"model": "jev-latest",
"questions": {
"department": {
"type": "choice",
"instructions": "应该由哪个团队处理?",
"criteria": {
"billing": "付款、账单或退款",
"technical": "Bug、故障或集成问题",
"sales": "价格、升级或新账户"
}
},
"frustration": {
"type": "score",
"instructions": "客户有多不满?",
"criteria": ["平静", "不满但克制", "非常生气"]
},
"is_urgent": {
"type": "noul",
"instructions": "这条消息是否表达了紧急性?"
}
}
}'
响应会保留同样的问题 ID。department 返回三个允许值之一,以及三个选项的完整概率分布;frustration 可能是小数,因为它是各等级位置按概率计算的加权结果;is_urgent 只返回“是”的概率。
具体数值会随输入、判定标准和模型版本变化。最终由代码而不是模型决定,多高的概率才足以执行动作。
Jev 与 LLM、传统分类器有什么不同?
Jev 处在两者之间一个很有用的位置,但边界不能混淆。
| 维度 | Jev | 生成式 LLM | 传统分类器 |
|---|---|---|---|
| 主要任务 | 有边界的语义判断 | 生成自由文本或进行开放推理 | 预测为单个固定任务训练的标签 |
| 输出空间 | 每次请求定义 | 开放,即使可用 Schema 约束 | 训练时固定 |
| 新判定标准 | 在请求中描述 | 修改 Prompt 或工具 Schema | 通常需要数据与重新训练 |
| 概率 | API 的一等输出 | 通常不可用或校准较弱 | 模型支持时很常见 |
| 文本生成 | 不支持 | 支持 | 不支持 |
| 最佳角色 | 工作流中的语义分支 | 创作、解释、编程、多步推理 | 有标注数据的稳定大规模任务 |
说 Jev “只是分类器”会忽略它能在请求时动态定义答案空间;说它是“更快的 LLM”则会忽略它不能解释、写邮件、写代码,也不能创造你没有提供的新答案。
JSON mode 也不是同一个合同。JSON mode 约束生成文本的语法;Jev 约束的是答案空间本身,并返回用于决策的完整概率分布。只有当问题能被拆成有边界的判断时,这种差异才真正有价值。
价格、上下文与吞吐限制
TypeSafe 当前为 Jev 1.13 标出的价格是每 100 万输入 token 为 $0.042,即每 10 亿 token 为 $42。输出目前免费,官方称其“便宜到无需计量收费”,不过响应仍会记录 output token 用量。
| 输入量 | Jev 直连输入成本 |
|---|---|
| 10,000 token | $0.00042 |
| 100 万 token | $0.042 |
| 1 亿 token | $4.20 |
| 10 亿 token | $42.00 |
这些只是按公布单价计算的算术结果,不是账单实测。它们不包含重试、预处理、级联中的其它模型、存储、工程成本与未来价格变化。
上下文合同包含两个同时生效的限制:全部状态与问题合计不得超过 64K token;状态加单个最长问题不得超过 32K。上下文越长并不一定越好,TypeSafe 自己的 jaggedness 文档明确写着,无关细节会让准确率下降。
官方公布的 250,000 token/s 和 1,200 请求/分钟是账户速率限制,不是单次请求速度保证。TypeSafe 也明确提醒,这些限制在 early access 阶段仍会动态调整。
速度宣传应该怎样理解?
TypeSafe 报告的 Jev 端到端响应时间为 70–500 ms,并称在“System One 形状”的问题上,以相近智能水平比较时可比前沿模型快 40–200 倍。发布材料还重点展示了一组工作流评测:Jev 快 193.6 倍、便宜 444.6 倍。
这些是厂商结果,不是中立 benchmark。TypeSafe 主动披露了几个重要限制:
- 延迟测试通常从公司成员位于美国西海岸的笔记本发起,当时服务也部署在西海岸。
- 工作流由 TypeSafe 模型能力团队制作,因此可能存在选题偏差。
- 参考答案取 GPT-6 Astra 与 Fable 5.1 的平均值,可能偏向这两个模型家族。
- 对比 LLM 通过 OpenRouter 和 TypeSafe 的结构化 wrapper 调用。
- TypeSafe 自己也称 193.6 倍与 444.6 倍属于预期真实收益的高位。
因此,更稳妥的结论是:受限输出和并行评估让 Jev 在有边界的决策任务上具备极低延迟与成本的可信路径;这些数字不能证明它在所有任务上都快 40–200 倍、拥有与前沿 LLM 等价的通用智能,或更擅长生成与多步推理。
“零幻觉”必须先定义清楚
TypeSafe 宣传 Jev 不会产生幻觉。其中最可辩护的是结构安全:Choice 不会凭空编出第四个选项,代码期待数字时,服务也不应该突然返回一段散文。TypeSafe 表示,这类输出匹配是结构保证,不是靠抽样测出的零错误率。
但类型正确的答案仍可能在语义上错误。TypeSafe 自己的 Jev 1.13 文档列出了这些失败模式:
- 对字面表述过度敏感,错过隐含意图;
- 计数、算术、日期和数值精度不可靠;
- 不擅长多跳间接推理;
- 状态里混入大量无关内容后准确率下降;
- 可能受对抗内容或 Prompt Injection 影响;
- 指令与判定标准矛盾时容易混乱;
- 分开问出的概率不一定满足人们直觉中的数学恒等式;
- 不适合任何需要生成文本的任务。
所以实际可采用的说法是:不会生成 Schema 之外的输出,不等于不会做错决策。生产代码仍需自有评测集、保守阈值、确定性校验与升级路径。
Jev 适合放在哪里?
当三个条件同时成立时,Jev 值得测试:答案空间有边界;问题是语义判断而不是精确计算;结果将由另一段软件消费。
| 工作负载 | 为什么可能适合 Jev | 关键保护措施 |
|---|---|---|
| 客服工单路由 | 团队集合封闭,且不确定性很有用 | 加入 other;低置信度转人工 |
| RAG 段落过滤 | 可评估相关性、冲突和注入风险 | 原文核验仍放在模型之外 |
| LLM 输入输出 Guardrail | 多个窄检查可在一轮并行执行 | 把对抗输入作为正式威胁模型测试 |
| 实体匹配 | 可判断两条记录是否指向同一对象 | 精确 ID 与不变量由代码保证 |
| 内容审核 | 标签与严重度等级可预先定义 | 按不同伤害类型分别调阈值 |
| Agent 动作路由 | 可选工具或判断是否需要某个 Skill | 权限和破坏性操作确认仍由代码控制 |
写作、摘要、代码生成、开放式抽取、精确算术、日期比较和长链因果推理都不应默认使用 Jev。精确逻辑交给普通代码;需要创造输出时,使用生成式或推理模型。
生产接入清单
- 确定性工作留在代码里。 日期解析、计数、金额计算和权限检查不需要模型。
- 每次只问一个原子问题。 把“要不要批准”拆成真正决定它的独立事实。
- 写清所有边界。
Choice不穷尽时加入other或none,并为Score写具体等级。 - 用自己的数据测试。 英语是主要训练语言;TypeSafe 明确表示中文等 CJK 语言表现并不完全相同。
- 按动作风险校准。 可逆 UI 路由与高影响自动化不能共用一个置信度阈值。
- 阈值稳定后固定版本。
jev-latest会移动;应记录响应中的版本 ID,并主动迁移阈值。 - 为不确定性准备出口。 模糊案例转人工或更慢的推理模型,不要强迫系统自动决定。
- 衡量每个验收任务的总成本。 把重试、误判、人工复核和下游 LLM 调用都算进去。
OmniaKey 现在能调用 Jev 吗?
截至核验日期不能。我们没有在 OmniaKey 当前模型目录或代码库中找到 Jev 路由。本文出现的端点与价格属于 TypeSafe 直连 API;发布这篇介绍不代表 OmniaKey 已经完成接入。
实际可用模型请以 OmniaKey 实时模型目录为准。如果目标是开放式编程和 Agent 工作,编程 Agent 模型指南介绍的是技术栈中另一层的生成式模型。
最终结论
理解 Jev 最好的方式,是把它看成一种新的语义决策接口,而不是万能 LLM 的替代品。它最有价值的想法很简单:模糊判断交给模型;输出限定为程序理解的类型;把不确定性显式暴露出来;组合与精确逻辑继续由代码控制。
当前 API 的纸面价格非常低,整个接口也围绕低延迟设计。但模型仍处于 early access,只支持文本,英语效果最好,并且官方已明确记录它在数学、日期、间接推理、无关上下文和对抗输入上的弱点。在出现同条件独立测试前,速度与智能对比应视为厂商证据。
常见问题
Jev 是 LLM 吗?
TypeSafe 把 Jev 称为 System One Model,而不是 LLM。它能理解自然语言状态,但不生成自由文本。本文核验的公开资料尚未披露足够的架构细节,无法独立判断它的底层网络与传统语言模型究竟有多接近。
Jev 能替代 GPT 或 Claude 吗?
不能。Jev 不会写作、解释、编程或做开放式生成。它可以作为生成模型的补充,用来路由请求、检查输出、评分证据,或判断何时值得调用更慢的推理模型。
Choice、Score 和 Noul 分别是什么?
Choice 从封闭集合中选择并返回所有选项概率;Score 把状态放到 2–10 个已描述等级之间;Noul 返回一个是非命题成立的概率。
Jev 真的零幻觉吗?
它不会返回声明类型之外的值,因此消除了大量解析与 Schema 错误;但它仍可能选择错误的合法选项,或给出误导性的概率。类型安全不等于语义正确。
Jev API 多少钱?
TypeSafe 当前为 Jev 1.13 标价每 100 万输入 token 为 $0.042,输出免费。Early access 阶段的直连价格与速率限制都可能变化。
Jev 支持图片或中文吗?
它只支持文本。字符串、JSON 对象和数组最终都必须承载文本。中文等 CJK 文字可以输入,但 TypeSafe 表示英语效果目前最好,非英语工作负载必须用自己的数据评测。
一手来源
- TypeSafe:Introducing System One Models & Jev
- TypeSafe 文档:Introduction
- TypeSafe 文档:System One
- TypeSafe 文档:模型与价格
- TypeSafe 文档:HTTP API 参考
- TypeSafe 文档:Confidence
- TypeSafe 文档:Jev 1.13 jaggedness
证据于 2026 年 9 月 19 日核验。Jev 在 early access 阶段变化很快,生产接入前请重新核对版本 ID、价格、限制、语言表现与数据条款。