现已支持主流图像模型 · GPT-Image、Nano Banana、Seedream 等
博客
指南

Jev 模型是什么?

Jev 把文本或 JSON 状态转换为类型化选择、评分和概率;它面向软件内部决策,不用于聊天或自由文本生成。

11 分钟阅读OmniaKey
JevTypeSafe AISystem One 模型类型化决策AI 自动化

Jev 模型是 TypeSafe AI 推出的第一个 System One Model。它专门处理可由软件直接消费的窄范围结构化判断:输入文本或 JSON state,同时评估一个或多个有明确类型的问题,再返回选择、评分、概率与置信度。

这让 Jev 很适合分类、路由、排序、验证和 Guardrail,但它不是聊天模型、编程模型、计算器或确定性业务规则的替代品。

核验日期:2026 年 9 月 19 日。 Jev 于 9 月 15 日以 early access 形式发布,当前官方文档记录的版本是 jev-1.13.0。本文的价格、限制、延迟和能力数字均来自 TypeSafe 发布文章与官方文档。我们没有获得非公开简报,没有运行可计费的 Jev benchmark,也没有独立复现 TypeSafe 的速度与质量宣传。

Jev 模型一览

项目当前官方记录
开发者TypeSafe AI
模型类别System One Model
当前版本 IDjev-1.13.0
稳定别名jev-latest
API 端点POST https://api.typesafe.ai/v1/systemone
输入仅文本,可放在字符串、JSON 对象或文本数组中
输出类型化 ChoiceScoreNoul 答案
上下文每请求 64K token;state 加最长问题不得超过 32K
直连 API 价格每 100 万输入 token 为 $0.042;当前输出免费
默认速率限制250,000 输入 token/s、1,200 请求/分钟,可能动态调整
厂商延迟宣传端到端 70–500 ms
发布状态Early access

官方拼写是 Jev,并不是需要逐字母展开的 J-E-V 缩写。TypeSafe 表示,这个名字来自经济学家 William Stanley Jevons;“System One”则借用了 Daniel Kahneman 在《思考,快与慢》中推广的快速直觉式 System 1 概念。

Jev 到底做什么?

可以把 Jev 理解成一个带概率的语义函数:

text
非结构化或结构化状态
  + 预先定义的问题与答案空间
  -> 类型化决策与概率分布

普通 LLM 的核心任务是延续 token 序列并生成字符串。即使开启 JSON mode,应用仍是在要求生成式模型“写出”一份答案。Jev 放弃自由生成:调用方先定义允许的输出形状,模型再针对同一份状态评估所有问题。

TypeSafe 把它的训练方法称为 Reinforcement Learning for Calibrated Decisions(RLCD,面向校准决策的强化学习)。目标不仅是选答案,还要让概率在一组相似预测上反映真实正确率。理想情况下,模型给出 0.8 的一批判断应约有 80% 正确。但校准是群体统计性质,不能保证某一次 0.8 的答案一定正确。

Choice、Score 与 Noul

Jev 提供三种问题类型。它们是 API 的核心原语,不是生成完成后附加的格式化选项。

原语问题形状返回内容适合场景
Choice哪个选项最符合?被选选项、每个选项的概率、置信度意图路由、分类、封闭集合排序
Score在描述好的等级中处于哪里?加权分数、各等级概率、置信度严重度、质量、紧急程度、风险区间
Noul这句话是否成立?0 到 1 的概率检测、验证、二元门控

一个 Choice 最多可包含 255 个选项;一个 Score 可定义 2–10 个有文字描述的等级。Noul 不另带 confidence 字段,因为它的 0–1 数值本身就是“是”的概率。

同一请求中的多个问题会针对相同 state 独立、并行评估。这适合一次拿到多组信号,但也意味着一个答案不会自动影响另一个答案。如果问题 B 依赖问题 A,应该由代码明确表达这种依赖。

一个 Jev API 请求

下面的精简示例沿用 TypeSafe 官方请求结构:一次调用同时判断客服消息该由谁处理、用户有多不满,以及是否紧急。

bash
curl https://api.typesafe.ai/v1/systemone \
  -H "Authorization: Bearer $TYPESAFE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "state": "我的付款已经连续三天失败,正在损失订单,请马上帮忙。",
    "model": "jev-latest",
    "questions": {
      "department": {
        "type": "choice",
        "instructions": "应该由哪个团队处理?",
        "criteria": {
          "billing": "付款、账单或退款",
          "technical": "Bug、故障或集成问题",
          "sales": "价格、升级或新账户"
        }
      },
      "frustration": {
        "type": "score",
        "instructions": "客户有多不满?",
        "criteria": ["平静", "不满但克制", "非常生气"]
      },
      "is_urgent": {
        "type": "noul",
        "instructions": "这条消息是否表达了紧急性?"
      }
    }
  }'

响应会保留同样的问题 ID。department 返回三个允许值之一,以及三个选项的完整概率分布;frustration 可能是小数,因为它是各等级位置按概率计算的加权结果;is_urgent 只返回“是”的概率。

具体数值会随输入、判定标准和模型版本变化。最终由代码而不是模型决定,多高的概率才足以执行动作。

Jev 与 LLM、传统分类器有什么不同?

Jev 处在两者之间一个很有用的位置,但边界不能混淆。

维度Jev生成式 LLM传统分类器
主要任务有边界的语义判断生成自由文本或进行开放推理预测为单个固定任务训练的标签
输出空间每次请求定义开放,即使可用 Schema 约束训练时固定
新判定标准在请求中描述修改 Prompt 或工具 Schema通常需要数据与重新训练
概率API 的一等输出通常不可用或校准较弱模型支持时很常见
文本生成不支持支持不支持
最佳角色工作流中的语义分支创作、解释、编程、多步推理有标注数据的稳定大规模任务

说 Jev “只是分类器”会忽略它能在请求时动态定义答案空间;说它是“更快的 LLM”则会忽略它不能解释、写邮件、写代码,也不能创造你没有提供的新答案。

JSON mode 也不是同一个合同。JSON mode 约束生成文本的语法;Jev 约束的是答案空间本身,并返回用于决策的完整概率分布。只有当问题能被拆成有边界的判断时,这种差异才真正有价值。

价格、上下文与吞吐限制

TypeSafe 当前为 Jev 1.13 标出的价格是每 100 万输入 token 为 $0.042,即每 10 亿 token 为 $42。输出目前免费,官方称其“便宜到无需计量收费”,不过响应仍会记录 output token 用量。

输入量Jev 直连输入成本
10,000 token$0.00042
100 万 token$0.042
1 亿 token$4.20
10 亿 token$42.00

这些只是按公布单价计算的算术结果,不是账单实测。它们不包含重试、预处理、级联中的其它模型、存储、工程成本与未来价格变化。

上下文合同包含两个同时生效的限制:全部状态与问题合计不得超过 64K token;状态加单个最长问题不得超过 32K。上下文越长并不一定越好,TypeSafe 自己的 jaggedness 文档明确写着,无关细节会让准确率下降。

官方公布的 250,000 token/s 和 1,200 请求/分钟是账户速率限制,不是单次请求速度保证。TypeSafe 也明确提醒,这些限制在 early access 阶段仍会动态调整。

速度宣传应该怎样理解?

TypeSafe 报告的 Jev 端到端响应时间为 70–500 ms,并称在“System One 形状”的问题上,以相近智能水平比较时可比前沿模型快 40–200 倍。发布材料还重点展示了一组工作流评测:Jev 快 193.6 倍、便宜 444.6 倍。

这些是厂商结果,不是中立 benchmark。TypeSafe 主动披露了几个重要限制:

  1. 延迟测试通常从公司成员位于美国西海岸的笔记本发起,当时服务也部署在西海岸。
  2. 工作流由 TypeSafe 模型能力团队制作,因此可能存在选题偏差。
  3. 参考答案取 GPT-6 Astra 与 Fable 5.1 的平均值,可能偏向这两个模型家族。
  4. 对比 LLM 通过 OpenRouter 和 TypeSafe 的结构化 wrapper 调用。
  5. TypeSafe 自己也称 193.6 倍与 444.6 倍属于预期真实收益的高位。

因此,更稳妥的结论是:受限输出和并行评估让 Jev 在有边界的决策任务上具备极低延迟与成本的可信路径;这些数字不能证明它在所有任务上都快 40–200 倍、拥有与前沿 LLM 等价的通用智能,或更擅长生成与多步推理。

“零幻觉”必须先定义清楚

TypeSafe 宣传 Jev 不会产生幻觉。其中最可辩护的是结构安全Choice 不会凭空编出第四个选项,代码期待数字时,服务也不应该突然返回一段散文。TypeSafe 表示,这类输出匹配是结构保证,不是靠抽样测出的零错误率。

但类型正确的答案仍可能在语义上错误。TypeSafe 自己的 Jev 1.13 文档列出了这些失败模式:

  • 对字面表述过度敏感,错过隐含意图;
  • 计数、算术、日期和数值精度不可靠;
  • 不擅长多跳间接推理;
  • 状态里混入大量无关内容后准确率下降;
  • 可能受对抗内容或 Prompt Injection 影响;
  • 指令与判定标准矛盾时容易混乱;
  • 分开问出的概率不一定满足人们直觉中的数学恒等式;
  • 不适合任何需要生成文本的任务。

所以实际可采用的说法是:不会生成 Schema 之外的输出,不等于不会做错决策。生产代码仍需自有评测集、保守阈值、确定性校验与升级路径。

Jev 适合放在哪里?

当三个条件同时成立时,Jev 值得测试:答案空间有边界;问题是语义判断而不是精确计算;结果将由另一段软件消费。

工作负载为什么可能适合 Jev关键保护措施
客服工单路由团队集合封闭,且不确定性很有用加入 other;低置信度转人工
RAG 段落过滤可评估相关性、冲突和注入风险原文核验仍放在模型之外
LLM 输入输出 Guardrail多个窄检查可在一轮并行执行把对抗输入作为正式威胁模型测试
实体匹配可判断两条记录是否指向同一对象精确 ID 与不变量由代码保证
内容审核标签与严重度等级可预先定义按不同伤害类型分别调阈值
Agent 动作路由可选工具或判断是否需要某个 Skill权限和破坏性操作确认仍由代码控制

写作、摘要、代码生成、开放式抽取、精确算术、日期比较和长链因果推理都不应默认使用 Jev。精确逻辑交给普通代码;需要创造输出时,使用生成式或推理模型。

生产接入清单

  1. 确定性工作留在代码里。 日期解析、计数、金额计算和权限检查不需要模型。
  2. 每次只问一个原子问题。 把“要不要批准”拆成真正决定它的独立事实。
  3. 写清所有边界。 Choice 不穷尽时加入 othernone,并为 Score 写具体等级。
  4. 用自己的数据测试。 英语是主要训练语言;TypeSafe 明确表示中文等 CJK 语言表现并不完全相同。
  5. 按动作风险校准。 可逆 UI 路由与高影响自动化不能共用一个置信度阈值。
  6. 阈值稳定后固定版本。 jev-latest 会移动;应记录响应中的版本 ID,并主动迁移阈值。
  7. 为不确定性准备出口。 模糊案例转人工或更慢的推理模型,不要强迫系统自动决定。
  8. 衡量每个验收任务的总成本。 把重试、误判、人工复核和下游 LLM 调用都算进去。

OmniaKey 现在能调用 Jev 吗?

截至核验日期不能。我们没有在 OmniaKey 当前模型目录或代码库中找到 Jev 路由。本文出现的端点与价格属于 TypeSafe 直连 API;发布这篇介绍不代表 OmniaKey 已经完成接入。

实际可用模型请以 OmniaKey 实时模型目录为准。如果目标是开放式编程和 Agent 工作,编程 Agent 模型指南介绍的是技术栈中另一层的生成式模型。

最终结论

理解 Jev 最好的方式,是把它看成一种新的语义决策接口,而不是万能 LLM 的替代品。它最有价值的想法很简单:模糊判断交给模型;输出限定为程序理解的类型;把不确定性显式暴露出来;组合与精确逻辑继续由代码控制。

当前 API 的纸面价格非常低,整个接口也围绕低延迟设计。但模型仍处于 early access,只支持文本,英语效果最好,并且官方已明确记录它在数学、日期、间接推理、无关上下文和对抗输入上的弱点。在出现同条件独立测试前,速度与智能对比应视为厂商证据。

常见问题

Jev 是 LLM 吗?

TypeSafe 把 Jev 称为 System One Model,而不是 LLM。它能理解自然语言状态,但不生成自由文本。本文核验的公开资料尚未披露足够的架构细节,无法独立判断它的底层网络与传统语言模型究竟有多接近。

Jev 能替代 GPT 或 Claude 吗?

不能。Jev 不会写作、解释、编程或做开放式生成。它可以作为生成模型的补充,用来路由请求、检查输出、评分证据,或判断何时值得调用更慢的推理模型。

Choice、Score 和 Noul 分别是什么?

Choice 从封闭集合中选择并返回所有选项概率;Score 把状态放到 2–10 个已描述等级之间;Noul 返回一个是非命题成立的概率。

Jev 真的零幻觉吗?

它不会返回声明类型之外的值,因此消除了大量解析与 Schema 错误;但它仍可能选择错误的合法选项,或给出误导性的概率。类型安全不等于语义正确。

Jev API 多少钱?

TypeSafe 当前为 Jev 1.13 标价每 100 万输入 token 为 $0.042,输出免费。Early access 阶段的直连价格与速率限制都可能变化。

Jev 支持图片或中文吗?

它只支持文本。字符串、JSON 对象和数组最终都必须承载文本。中文等 CJK 文字可以输入,但 TypeSafe 表示英语效果目前最好,非英语工作负载必须用自己的数据评测。

一手来源

证据于 2026 年 9 月 19 日核验。Jev 在 early access 阶段变化很快,生产接入前请重新核对版本 ID、价格、限制、语言表现与数据条款。