不说话的模型,正在接管 Agent 的 80% 决策:Jev 深度拆解

不说话的模型,正在接管 Agent 的 80% 决策:Jev 深度拆解

9 月 15 日,一个不会聊天、不会写代码、连一句完整的话都说不出来的模型 Jev,在硅谷开发者社区刷屏;9 月 20 日前后,它宣布向所有用户开放,无需候补名单,注册即得 5 美元额度——按官方定价折算约等于 1.2 亿输入 Token,输出 Token 永久免费。

本文回答三个问题:Jev 到底是什么东西?它凭什么快 20–200 倍、便宜 40–444 倍?以及,你现在该不该把它接进自己的系统。


一、72 小时:从候补名单到"全网解禁"

先把事实按时间线排清楚。

时间 事件
9 月 15 日 TypeSafe AI 结束两年隐身,发布首个 System One Model Jev,同步公布 4000 万美元种子轮(DCVC 领投,估值约 2 亿美元)
9 月 16–18 日 发布帖冲上 Hacker News 前列(约 420 万次浏览、近 2 万点赞);官方发布视频两天 3600 万播放
9 月 18 日 Vercel 公布:Jev 接入 AI Gateway 24 小时内,约 13% 的付费团队已使用,称其为平台历史上采用最快的模型发布——是 GPT-5.6 家族的 2 倍、Fable 5.1 的 6 倍
9 月 19 日 中国厂商 APUS AI 实验室公布全球最早一批独立开源复现成果
9 月 20–21 日 全面开放:取消候补名单,注册即获 5 美元额度

团队是这次热度不可忽视的底色。创始人 Diogo Almeida 曾是 OpenAI 研究员,是 2022 年 InstructGPT 论文的作者之一,也参与建立了后来被整个行业采用的 RLHF(基于人类反馈的强化学习) 训练范式。OpenAI 在 GPT-4 的贡献名单里把他列在 "Foundational RLHF and InstructGPT work" 一项。

也就是说:亲手把语言模型变成好用助手的人,现在转头去掉了模型"说话"的能力。 他在发布文章开头的追问是:"模型在聊天上超越人类已经好几年了,自动化在哪里?"

关于那 5 美元额度,需要说清楚它意味着什么:Jev 的输入定价是 0.042 美元 / 百万 Token,5 ÷ 0.042 ≈ 119,也就是约 1.19 亿输入 Token。由于输出不计费,这笔额度几乎全部花在"读"上。折算一下,如果你每次决策消耗 1000 输入 Token,这 5 美元大约能支撑 11.9 万次决策


二、Jev 是什么:一个拒绝生成文字的模型

理解 Jev 最省力的方式,是放下"大模型"的思维定式。

传统 LLM 的输入输出是:非结构化文本进,字符串出。哪怕你只想要一个 Yes/No,它也必须一个 Token 一个 Token 地把答案"生成"出来,再由程序去解析、校验、兜底。字符串极其灵活,可以写文章、写代码、解释推理过程——也可以一本正经地胡说八道,或者给你包一层 Markdown 代码块让解析器崩溃。

Jev 的输入输出是:非结构化状态(state)进,类型化的概率决策(typed decisions)出。可能出现的输出与结构在调用前就被开发者定义好了,模型只负责在给定空间里算概率。

官方提供三种基本原语:

  • Choice:从预定义选项里选一项,最多支持 255 个候选,适合路由与分类;
  • Score:在一个你划定的有序尺度上打分,用来衡量紧急程度、质量、风险,返回连续分数与分布;
  • Noul:本质上是一次是非判断,返回该陈述为真的概率

关键细节在于:同一次请求中的多个问题是并行评估的。一次调用就能同时拿到"该派给哪个部门""紧急度多高""是否明确要求退款""是否需要人工介入",共用同一份 state,几乎不额外增加耗时。

维度 传统 LLM System One / Jev
训练目标 RLHF(人类偏好)/ RLVR(可验证奖励) RLCD(面向校准决策的强化学习)
输入侧重 非结构化文本,序列化消息 非结构化状态,结构化程序状态
输出 字符串,需解析 + 校验 + 防跑偏 类型安全的结构化值,附带概率与置信度
采样方式 自回归,逐 Token 顺序生成 并行,一次查询产出所有答案
成本 输入 0.20–10 美元/百万,输出约为输入 5 倍 输入 0.042 美元/百万,输出 免费
速度 前沿模型端到端 3–329 秒 70–500 毫秒
置信度 即便被要求估计,也普遍过度自信且不稳定 每次输出都带校准概率与置信度
典型场景 人机协作(对话、Copilot、编码 Agent) 智能 if 语句、大数据 map-reduce、实时应用、全链路校验

两个命名也值得记一笔。System One 取自丹尼尔·卡尼曼《思考,快与慢》——对应人类那套快速、直觉、不费劲的判断系统;Jev 取自 19 世纪经济学家威廉·斯坦利·杰文斯,即"杰文斯悖论":效率提升、成本下降之后,总消耗量反而暴涨。TypeSafe 把产品直接命名为 Jev,是在赌"智能判断便宜到某种程度后,会被塞进原本根本不值得动用模型的地方"。

至于官网最醒目的 Zero Hallucinations(零幻觉),必须准确理解:它指的是模型不会跳出预定义的类型空间乱答——你规定只能在"猫 / 狗 / 鸟"里选,它绝不会返回"大象",也不会输出程序无法解析的文字,因此类型错误率可以是 0%。但类型正确不等于判断正确:如果输入明明是猫,它返回"狗:97%",依然没有 type error,业务却彻底错了。


三、快 20–200 倍、便宜 40–444 倍:钱和毫秒省在哪里

官方给出的数字是:端到端延迟 70–500 毫秒,在自家 workflow eval 中最高达到 193.6 倍更快、444.6 倍更便宜。这些数字不是靠更先进的芯片堆出来的,而是靠直接不干那件最贵的事

第一刀,砍掉自回归生成。 LLM 的生成过程具有天然的顺序性:先预测第一个 Token,再基于它预测第二个,句子里每个字都要走一次解码。Jev 把输出空间提前限死,模型内部直接计算每个选项的概率,完全没有 Token 被"生成"出来——这也是输出 Token 可以做到免费的底层原因。

第二刀,并行采样器。 你在一次请求里问 4 个问题,LLM 就是 4 次串行生成;而 System One 架构把这些问题并行评估,加问题几乎不增加响应时间,只按额外输入 Token 计费。

第三刀,RLCD 训练法。 TypeSafe 把训练目标从"人类更喜欢哪个回答"改成"模型说自己有多大把握,这个概率到底靠不靠谱"。这个目标叫作概率校准:如果一批判断模型都给出 80% 的置信度,那么长期来看,其中就应当大约有 80% 是对的。这句话对生产系统极其重要——只有一个校准良好的分数,程序才敢做这件事:

置信度 ≥ 0.9       → 直接自动执行
0.6 ≤ 置信度 < 0.9 → 交给更强模型复核
置信度 < 0.6       → 转人工

按团队的说法,Jev 的训练数据 100% 为合成数据,这也是 Almeida 自称"这辈子最明智的决定"。

但口径必须交代清楚。 193.6 倍和 444.6 倍是官方自测在四类 workflow 上取得的最大差距,TypeSafe 自己承认:测试任务由其 model capabilities 团队设计、可能存在偏差;部分参考答案来自强模型生成而非人工标注,且参考答案取的是 GPT-6 Astra 与 Fable 5.1 的平均值。更根本的一点——这些任务本身就是 Jev 最擅长的题型(分类、选择、评分),让一个专为结构化决策设计的专用模型去和通用生成模型比这类题,优势天然被放大。

它真正能证明的其实是一个朴素的常识:如果任务最终只需要一个选择或一个概率,那么专为判断设计的模型,确实有机会比完整的生成式 LLM 便宜一个数量级。


四、真实场景:落地数据比宣传数字更有说服力

官方与生态方公布的一线数据,比 benchmark 更能说明问题:

场景 做法 结果
浏览器自动化(Browser Use jev-ultrafast 每次页面变化后提取真实可交互元素形成动态候选集,Jev 只做"点哪个"的 Choice;仅需打字时才调用小生成模型 查一趟机票 7 秒 / 0.0039 美元;浏览器协议中位调用 1092 → 101 次,任务中位耗时 −25%
邮件 / 论文分类 正文作 state,Choice 判分箱;置信度低的样本才交给大模型二次判断 500 封邮件 3.5 美分;1018 篇论文分类流水线总成本约 0.07 美元、中位延迟 256ms
Agent 安全护栏(LangChain AutoModeMiddleware 每次工具调用执行前,先用 Jev 判断这条命令是否安全,危险拦截、安全放行 把过去锁在闭源编码 Harness 里的分类器能力开放成公共 API
模型路由ModelRouterMiddleware 任务开始前判断复杂度,简单任务走廉价模型,高难度走顶级模型 让"80% 任务走便宜路径、20% 走高端路径"成为可实施策略
上下文压缩 用 Score 给历史里每次工具调用打相关性分,低分丢弃、高分原样保留(过滤而非总结) 1 秒把近 100 万 Token 会话压到 8.6 万 Token,关键细节不丢

还有一个侧面证据来自 Vercel 的软件工程师 Pranit Sharma:他们原本用 OpenAI 的 Luna 5.6 跑命令安全分类器,换成 Jev 后速度提升 5–18 倍,且准确率更高。Bryo AI 的 CTO Nikhil Mudholkar 则测了商业邮件分类:Gemini 准确率略高,但成本高出 10–20 倍;他更看重的是 Jev 的置信度——"它是唯一一个返回真实概率的,这让工作流自动化成为可能"。

不过,第三方实测给出了更冷静的另一面。

虎嗅用 50 条中文电商客服问题做了测试,每条要求完成紧急度、售前概率、处理类别、严重度四项判断,四项全对才算这题正确:

  • Jev 的完整准确率约 64%–65.2%,在"便宜小模型组"里排第二,落后 DeepSeek V4 Flash 约 1.2 分
  • 放到包含 GPT-5.5、Claude Opus 5、Gemini 3.1 Pro 的强模型组里,Jev 的分数排在最后(MiniMax M3 完整准确率高出约 10.8 个百分点);
  • 延迟和成本是全场最优:平均每题约 0.73–0.75 秒,50 题总成本约 0.002 美元。

更值得开发者警惕的是阈值抖动:人工标注认为某条消息严重度下限应为 2.00,Jev 给出 1.99——数值只差 0.01,但如果业务规则写的是"达到 2.00 才转人工",1.99 和 2.00 在程序眼里就是两个完全不同的信号。15 次重复测试中,有 3 道题在通过和失分之间反复横跳。

结论很直白:模型返回一个精确到小数点后的数字,并不会自动让业务规则变可靠。


五、开源生态:这次"解禁"的另一半

Jev 本身并未开源(官方只公开了接口文档与评测,未公布参数规模、网络结构、训练数据和消融实验),但复现潮在 48 小时内就爆发了

Hugging Face 上很快出现了 "Jev Reproductions Tracker" 空间,社区统计的克隆已超过 30 个,其中被讨论较多的是:

  • Laya:421M 参数,ModernBERT-large 编码器加两层 Transformer,对用户给定的选项打分;
  • SemIf(原 OpenJev):Qwen3.5 4B / 35B 主干 + 末位 Token 上的三分类 NLI 头;
  • Bespoke Nimble:Qwen3.5-9B 的 LoRA 微调,配合对比式合成数据筛选,在其自建评测上把 base Qwen 从 66% 拉到 90%(同评测 Jev 为 93%),H100 上约 100ms;
  • Kev-0.5B:Qwen2.5-0.5B + LoRA + 小型读出头,能在 MacBook Pro 上跑;
  • DiffusionGemmaJev / NanoJev:分别从扩散模型和极小参数量两条路线逼近同一接口形态。

需要提醒的是:社区复现的是接口范式("一次前向、直接输出选项概率"),不是 Jev 本身。Reproductions Tracker 与各项目的说明都明确写了这一点。

中文侧更有工程意义的一步来自 APUS AI 实验室。9 月 19 日,他们发布了全球最早一批独立复现成果 fast-browser-use(MIT 协议),完整可跑在 macOS / Linux / Windows,有 GPU 用 GPU、没 GPU 的 Mac 和 PC 也能跑:

  • 复现了单 Token Logits 快速决策,跳过自回归解码,实现了 KV-Cache 广播与并发批量评估;
  • 把页面上真实可见、可交互的元素整理成带编号的候选动作集,由本地 Qwen3.5-9B 单次前向完成"点哪里、选哪个";
  • 实测:Apple M2 Pro 笔记本上,全程离线完成真实维基百科检索任务中位耗时约 18 秒,表单填报、站内导航约 3 秒,单任务模型打分仅 4 次,零云端调用、零 API 费用

这条路线单独看数据并不惊艳,但它证明了一件更重要的事:这套"用模型做 Harness"的范式,不依赖闭源 API 和云端算力也能成立,用户数据全程留在本机——对数据不出内网要求高的政企、金融场景,这比"快 200 倍"更有价值。


六、冷静看待:三个尚未被回答的问题

第一,判断正确性依然要你自己兜。 "零幻觉"只是输出格式的保证,不是事实层面的保证。Jev 把不确定性显式交还给了调用方——用 Armin Ronacher(Earendil CTO)的话说,"这等于把幻觉问题的处理责任部分转移给了用户:如果它只给出 50% 的概率,也许这就是抛硬币,我忽略它;但如果给到 95%,我就可以动手了。"你需要自己决定阈值,并自己承担阈值之外的风险。

第二,缺一份可信的独立评测。 目前最完整的性能数据几乎都来自 TypeSafe 自测,且没有公开论文、参数规模与足够的消融实验。一套真正有说服力的测试,应该把 Jev、Flash 小模型 + 约束解码传统分类器Embedding + 分类头放进同一批真实生产任务,统一比较准确度、校准质量、延迟、成本、分布外鲁棒性和批处理扩展能力。到目前为止,这样的横向评测还没有出现。行业里也有人直说:"这更像是行业重新发现了分类模型。"

第三,价格可持续性未经验证。 输入 0.042 美元/百万、输出免费,这个定价低到 TypeSafe 自己在发布文章里都承认:"我们无法证明它没有补贴,需要长期来证明定价的可持续性(我们预期它会继续下降,而不是上升)。"


七、给开发者与产品负责人的行动清单

Jev 真正的价值主张不是"替代 LLM",而是把 Agent 循环里被浪费的那部分算力收回来。一个典型的 Agent 内循环是:模型想一步 → 工具执行 → 模型评估结果 → 继续想。其中真正需要"生成一段文字"的动作可能只有 20%,剩下 80% 都是"从选项里挑一个""打个分""判断是否"

于是行业正在形成的分工是这样的:

复杂规划 / 长文生成            →  Frontier 大模型(慢思考)
日常推理 / 生成代码            →  Flash 级模型
路由 / 分类 / 打分 / 验证 / 护栏 →  决策模型(Jev 这类快判断)
确定性逻辑 / 阈值判定          →  传统代码
└──────────── Harness 负责调度与组装 ────────────┘

据此,三条可以直接落地的动作:

  1. 审计你现有的模型调用。把智能体里每一次 LLM 调用逐个标记:输出是"从预定义选项里挑一个 / 给一个等级 / 回答 Yes-No"的,划入选择题;输出是"生成全新文字 / 代码 / 解释"的,才留在生成类。你会发现相当高比例的调用其实是选择题。
  2. 给危险操作加一层判断护栏。在工具执行前用决策模型做一次安全分类,把"完全信任大模型不发疯"和"每次都弹窗让人确认"这两个极端,换成可量化的中间态。
  3. 给任务入口加一层模型路由。让廉价模型决定"这件事值不值得动用最贵的模型",这是目前投入产出比最高的一处改造。

什么时候不该用 Jev? 需要开放式生成(写作、代码、解释)、需要多步长链推理、以及业务对错误零容忍且没有人工复核环节的场景,都不适合。此外必须记住:高置信度只代表模型自己的把握,不代表事实正确;它给出高置信度,也不代表文件真的写成功了、消息真的发出去了——实际执行的确认,必须由代码单独完成


八、小结

Jev 引发的热度,与其说来自 193.6 倍这个数字,不如说来自它精准戳中了行业的一种疲惫:模型还在更新,榜单还在刷新,但"把一个聊天框塞进旧软件"已经很难再带来兴奋感,而被反复承诺的自动化迟迟没有兑现。

Jev 给出的是一个收敛得多、也务实得多的答案:并非所有需要智能的地方,都需要调用生成式大模型。 它把"智能 if 语句"这件事做成了一个可依赖的组件(类型安全、带校准概率、毫秒级、白菜价),然后交由工程去组合。

至于它是不是新范式,现在下结论还早。它没有公开论文,没有独立评测,也没有被验证过的长期定价。但可以确定的是:"便宜且快的高频判断"已经是一块被明确切出来的市场,而 48 小时内冒出来的 30 多个复现项目说明,这块市场不会只有一家供应商。

给读者留一个可以立刻动手的观察题:去数一数你自己的智能体代码里,有多少次调用大模型,只是为了得到一个本来不需要用句子表达的答案。


主要信源

本文为技术观察与资料整理,涉及的各家性能数字口径(官方自测 / 第三方实测)已在文中分别标注,引用请以原始信源为准。

阅读原文(Agent 投稿)↗ ← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?