返回博客
官小西

Laya vs Jev:不写字的 AI 模型,把「快思考」做成了新品类

给你的 AI Agent 数一数它一轮任务里真正在做的事:读工单、定优先级、选路由、判断这次工具调用该不该放行。这些判断每一个都小到不值得动用 frontier 模型——但今天最常见的实现,仍然是调一次 LLM,再用正则表达式从它返回的散文里抠出 "billing" 或者 "true"。慢(几百到几千毫秒)、贵、还会因为模型多嘴一句"好的,答案是……"而解析失败。

9 月中旬,这个老问题有了一对新答案。9 月 15 日,旧金山初创公司 TypeSafe AI 发布了 Jev——一个完全不生成文字、只返回带概率的结构化判断的模型。三天后的 9 月 18 日,开源社区以 Convai Innovations 的名义交出了同品类回应:Laya,Apache 2.0 协议,权重直接放在 Hugging Face 上。两个模型相隔 72 小时,一个闭源收费,一个开源免费,把一个此前只存在于论文里的想法(非自回归决策模型)变成了现实赛道。

这篇文章把两者拆开看:System One 这个品类到底是什么,三种"原语"怎么工作,Laya 靠什么做到比 Jev 快近 8 倍,以及双方宣传页上不会写、但只有读进仓库和文档才能发现的那些坑。

System One 模型与生成式 LLM 的根本分野:输出侧一个是类型化判断,一个是自由文本

System One:模型分类学里新加的一行

"System One"这个名字借自卡尼曼《思考,快与慢》:System 1 是快而直觉的模式匹配,System 2 是慢而审慎的推理。TypeSafe 的定义是:读入一段状态(state),返回软件可以直接消费的类型化答案和概率,而不是给人读的文字。

关键分野在输出侧。LLM 和决策模型读自然语言的能力差不多,但 LLM 逐 token 生成文本——结构只能靠 prompt 恳求和 structured outputs 约束,内容对错无法保证;System One 模型的答案空间在请求发出前就定义好了(一个选项、一个分数、一个概率),模型在结构上无法返回 schema 之外的东西。它不会"幻觉"出一段话,它只会以某个置信度分错类——而分错类是可以用阈值门控的。

值得一提的是命名梗:Jev 取自 19 世纪经济学家 William Stanley Jevons——杰文斯悖论说,资源利用效率的提高反而会扩大消耗。TypeSafe CEO Diogo Almeida 的解释是:更便宜的机器智能会导致更广泛的部署。这位创始人在 OpenAI 待了约四年,参与 RLHF、InstructGPT、ChatGPT 和 GPT-4 的核心训练,2024 年离职创业。

三种原语:choice、score、noul

两个模型的请求结构几乎一模一样:一段 state(字符串、JSON 或文本数组)加一组 typed questions,一次请求全部并行评估。每种问题是三种原语之一:

原语 用途 返回
choice 从预定义选项中选一个(Jev 上限 255 个) 选中项 + 每个选项的概率 + 置信度
score 在 2–10 级有序量表上打分 分数(可落在两级之间)+ 分布 + 置信度
noul 布尔判断 0 到 1 之间的概率

用 Laya 的路由模式写出来是这样(示例来自其官方仓库):

import laya
from laya import Router

router = Router(preload=True)

questions = {
    "department": {"type": "choice", "instructions": "Which department should handle this?",
        "criteria": {"billing": "invoices, payments, refunds",
                     "technical": "bugs, outages, system errors",
                     "sales": "pricing, new contracts",
                     "other": "everything else"}},
    "urgency":  {"type": "score", "instructions": "How urgent is this?",
        "criteria": ["not urgent", "soon", "critical deadline or blocking issue"]},
    "churn_risk": {"type": "noul", "instructions": "Does the user threaten to cancel?"},
}

res = router.predict({"subject": "Duplicate charge on invoice #4411", "body": "..."}, questions)
print(res["answers"]["department"]["choice"])   # -> billing (confidence: 0.94)

对老手来说这套接口毫不陌生——它本质上就是"分类/回归/二分类"三件套套上了自然语言的皮。真正的变化在于:以前要做这件事,你得么写一堆脆弱的 if-else,要么为了一次 0.02 美分的 LLM 调用等两秒。LangChain 已经为 Jev 做了 TypeSafeClassifier 集成,Laya 则同时提供 LangChain、LangGraph 和 MCP 接入——两个模型都把"嵌入 Agent 循环"当作第一场景,这与 Anthropic 的多 Agent 编排模式里"Worker 只做决策、不做生成"的分工思路刚好互补。

Jev:快在架构,闭在黑箱

Jev 的公开信息里有一处耐人寻味的空白:没有论文、没有权重、没有架构细节。 TypeSafe 只说它是 transformer 架构、纯合成数据训练、用的是 RLCD(Reinforcement Learning for Calibrated Decisions,针对校准决策的强化学习——优化目标是概率对真实结果的匹配,而不是人类评分员的偏好)。外界猜测它建立在某个开源权重 LLM 之上,但无法验证。

能验证的是接口和账单:Jev 1.13 上下文 64k tokens,输入 $0.042/百万 token、输出免费,官方口径延迟 70–500ms,限流 1200 次/分钟。按 OpenRouter 的实测,一次典型三问调用约 450 token,成本约千分之二美分。TypeSafe 宣称对比 frontier LLM"快 40–200 倍、便宜 40–400 倍",峰值 193.6 倍快、444.6 倍便宜——但注意,这些数字出自 TypeSafe 自己的技术笔记,连他们自己都承认测试工作流是自家人写的、结果"可能偏向真实区间的高端"。发布当天同步宣布了 DCVC 领投的 4000 万美元种子轮,估值 2 亿美元(Forbes,2026-09-15)。

作为发钱买服务的交换,Jev 给了你托管、免运维和一个目前仍然是品类天花板的能力:大选项集分类。这一点后面会反复出现。

Laya:三天后的开源回应

Laya 由 Convai Innovations 发布(9 月 18 日,Apache 2.0),技术路线和 Jev 同宗但走得更彻底:非自回归、encoder-only。它不是"不会说话的 LLM",而是由 ModernBERT-large(421M 参数)或 mmBERT-base(322M 参数)这类双向编码器微调出来的分类器——一次前向传播读入整个输入、吐出整个答案,没有逐 token 生成,这就是 33 毫秒延迟的来源。开发者 NandhaKishorM 在 Dev.to 的复盘里提到,这类架构他早在 2025 年 3 月就发过论文和权重——Jev 的发布反而让这个冷门方向一夜之间有了名字。

单检查点有短板,Laya 的答案是三个专用 checkpoint 加一个亚毫秒级路由器:

Laya 的三检查点 + 路由架构:脚本检测在 0.5ms 内完成,非拉丁文字强制走多语言模型

Checkpoint 骨干 参数量 上下文 强项
laya(默认) ModernBERT-large 421M 512 英文分类、护栏、邮件分拣
laya-multilingual mmBERT-base 322M 1024(可到 8k) 100+ 语言,快 2.2 倍
laya-typed-decisions ModernBERT-large 421M 1024 四类 typed-decisions 工作流

为什么要路由器?因为英文 checkpoint 遇到非拉丁文字会以极高的置信度答错——仓库基准里高棉语准确率 0.000、置信度却高达 0.952。这意味着置信度门控救不了它,必须在进模型之前用脚本检测(纯 Python,0.09–0.73ms)拦下来。路由后 Laya 在 51 种语言里 45 种达到可用水平(>3 倍随机基线)。

pip install laya 之后,SDK 提供本地推理、laya-serve 自托管 Jev 兼容 HTTP 服务、MCP server、ONNX 导出和 LangChain/LangGraph 集成。对于在意数据不出内网的团队(医疗、金融的工单分类),"权重在自己机器上"这件事本身就是 Jev 给不了的答案。

正面对比:数字与数字的出处

先给结论表——数据出自 Laya 仓库的对比基准(17,416 题,单张 T4 GPU,两个模型同题对测),即 Laya 方主导的测试,读的时候记住这一点:

指标 TypeSafe Jev 1.13 Laya(路由模式) 差距
typed-decisions 准确率 0.727 0.766 Laya +3.9%
校准误差 ECE 0.246 0.081 Laya 好 3 倍
P50 延迟(单问) 236–276ms 32.8ms Laya 快约 8 倍
P50 延迟(10 问批处理) ~1,500ms 72.3ms Laya 快约 20 倍
大选项集(77 类 Banking77) 0.870 0.425 Jev 翻倍胜出
成本 $0.042/百万 token $0(自托管,GPU 自费) 结构性差异
开源 闭源托管 Apache 2.0

Laya vs Jev 关键基准对比:准确率、校准、延迟三个维度

两类场景的实际表现(Laya 仓库口径):邮件垃圾过滤准确率 0.993、钓鱼检测 0.980、LLM 输出护栏 0.755–0.762——后两项正是 AI 输入输出护栏这类基础设施最需要的质量区间。而在 Agent 安全门控(destructive 操作放行判断)这种高价值场景,Jev 的托管可用性和大选项集能力仍然更省心,这也是 Agent Harness 横评里"安全层不值得自己造轮子"结论的一个注脚。

双方都不会主动告诉你的细节

这是全文最值得读的部分——两边的能力边界,都藏在宣传页之外的角落里。

Laya 的坑(来自它自己的 issue 区,这种坦诚在开源里是加分项):

  • ECE 0.081 是校准后的数字。 开箱状态的 Laya 平均 ECE 是 0.466——比 Jev 的 0.246 差得多。0.081 需要你按(题型 × 选项数)在自己的数据上做温度重标定。对比表里那行"好 3 倍",是有前置作业的。
  • 选项超过 20 个性能骤降。 Banking77 上 0.425 对 Jev 的 0.870,差距不是微小劣势而是不可用。官方建议层级化拆分选项。
  • score 是最弱原语(SST-5 情感五分类只有 0.372),noul 存在"跟着选项标签走"的标签陷阱(issue #156),官方自己教你怎么改写成 choice 绕过去。
  • 置信度和动作概率是两回事act_probability 几乎恒为 1.0、无判别力(issue #185,AUROC 0.30),门控要用 confidence(AUROC 0.77)。

Jev 的坑(来自它没说的部分):

  • 没有可复现性。 所有性能声明都是自测,无第三方复核路径,连"模型多大"都无从得知。对它的 193 倍/445 倍宣称,独立媒体(TechStock²)直接以标题提醒"仍是自测数据"。
  • 只认文本。 state 只接受字符串/JSON/文本数组,图片音频要先自行转文字;上下文 64k 且官方明说塞太多无关上下文会降低准确率
  • 置信度 ≠ 正确率。 OpenRouter 的解读文专门强调:confidence 度量的是概率分布的集中度,不是对错。高置信地分错类,和 Laya 的高棉语问题同构。

我的判断:两条路都通,但方向相反

把两边摆在一起,我认为这不是"谁取代谁",而是一次清晰的市场切分:

  • 自托管、隐私敏感、多语言、高频批处理 → Laya。 单张 T4 就能跑,100+ 语言路由开箱即用,Apache 2.0 意味着你可以微调它到具体业务上(官方 Kaggle notebook,免费 GPU 约 4 小时出一个 checkpoint)。代价是你要自己做温度校准、自己盯选项数、自己运维。
  • 大选项集分类、不想碰基础设施、要托管 SLA → Jev。 255 个选项一次选对的能力目前没有开源对等物,$0.042/百万 token 也确实便宜到可以塞进任何循环。代价是把最关键的判断交给一个你无法审计的黑箱,且性能声明无从复核。

还有一个更值得记住的元观察:Jev 发布后 72 小时,开源社区就交出了同品类的 Apache 2.0 对等物。 在 LLM 领域,闭源领先开源的时间窗口正以"天"为单位收缩——决策模型这个新品类从诞生的第一天起就没有享受过任何垄断溢价。

结论

System One 模型把 Agent 循环里那类"太模糊不适合 if-else、又太小不值得 LLM"的判断,第一次做成了毫秒级、可门控、有校准概率的标准组件。如果只让我给一条建议:现在就在你的 Agent 里找一个高频小判断(工单路由或工具调用门控),用 Laya 本地试一周——它免费、可复现、跑在你自己的硬件上,试错成本几乎为零。用得顺,再考虑要不要为 255 类分类和托管可用性付 Jev 的钱;用不顺,你也精确知道了为什么。

参考资料

  1. Convai Innovations — Laya 模型卡(Hugging Face)(2026-09,含全部基准数据与已知局限)
  2. NandhaKishorM — Laya GitHub 仓库Issue #156Issue #185
  3. TypeSafe AI — Introducing System One Models & Jev(2026-09-15)
  4. Wikipedia — Jev (AI model)(援引 Forbes/TechCrunch/The Register 报道,2026-09)
  5. OpenRouter — What Is Jev? TypeSafe's Decision Model Explained(2026-09-21,含定价与 confidence 解读)
  6. LangChain — What Is Jev? A Guide to TypeSafe AI's System One Model(2026-09)
  7. Tom's Hardware — TypeSafe AI's Jev claims to be 193x faster and 445x cheaper(2026-09)
  8. TechStock² — TypeSafe AI Raises $40 Million for Jev, but Its 445x Cost Claim Is Still Self-Tested(2026-09-17)
  9. Vignesh Prajapati / Pingax — What Is Laya AI? Open-Source Decision Model Explained(2026-09-23)
  10. ZAKER/星途科讯 — 开源模型 Laya 发布:推理速度快 Jev 近 8 倍(2026-09-20)