模型输出的单位正在变化

TypeSafe AI推出的Jev是一类面向程序决策的模型:调用方提供一段状态信息和一个或多个带类型的问题,模型返回选项、分数或真假概率,而不是一段供人阅读的文字。Fastino Labs随后在三周内推出了GLiDE和GLiNER2.5-Decide等竞争模型,开源开发者也发布了多种Jev式复现,说明市场关注的并不只是某个新模型,而是一种接口形态的变化。

这次变化值得读,不是因为模型终于“会做决定”,而是因为应用系统长期被迫把自然语言模型塞进结构化流程。大模型先生成字符串,程序再用JSON约束、解析器和重试机制把字符串变成可执行字段。决策模型则从接口层面承诺返回Choice、Score或Noul这三种受限结果,让模型输出更接近一个可被分支逻辑直接使用的函数返回值。

关键机制不是短答案,而是校准

Jev把输入分成两部分:描述当前情境的state,以及需要回答的问题。Choice从最多255个选项中选择一个,并给出各选项的概率与置信度;Score在有序等级上评分;Noul则返回一个0到1之间的真假概率。多个问题会针对同一个state并行、相互隔离地评估,因此增加问题数量对响应时间的影响很小,这一点比单纯减少输出文字更接近它的系统价值。

TypeSafe对这套架构的解释还包括并行采样,以及名为RLCD的训练方法,即“用于校准决策的强化学习”。RLHF通常优化人类偏好,RLCD则试图让置信度与准确率对应起来:更高的置信度应该意味着更高的正确概率。这个差异决定了模型能否用于自动放行、升级人工或切换模型,而不只是给出一个看起来合理的标签。由于Jev不生成字符串,TypeSafe进一步主张它不会产生类型错误,但这并不等于它不会产生错误判断。

证据显示它更像控制层,而非通用替代品

TypeSafe公布的workflow eval覆盖安全事件、agent trace可观测性、发票处理和客服四类任务。Jev的平均准确率为67.8%,每个案例成本0.0004美元、耗时0.4秒;同一工作流中的Claude Sonnet 5也是67.8%,但成本为0.1174美元、耗时78.1秒。最佳对比配置OpenAI“sol”达到74.1%,成本0.0836美元、耗时23.3秒,说明Jev以成本和延迟换来了接近中等强度模型的准确率,却仍落后最高水平6.3个百分点。

任务差异更能说明边界:Jev在客服上的准确率为76.0%,发票处理只有61.8%。而且这些参考标签来自GPT-6 Astra和Claude Fable 5.1高思考配置的平均结果,属于材料中给出的评测设定,并非独立人工真值。因而这组数字支持的是一种工程判断:当问题有明确边界、结果需要驱动流程时,低延迟和低价格可能比生成能力更重要;它并没有证明决策模型在复杂理解任务上已经胜出。

真正的落点是自动化阈值的设计

这类模型最适合放在控制流中,而不是内容生产链路里。代理可以用Choice决定继续、重试、向用户提问或停止,也可以选择工具和子代理;路由系统可以按复杂度、目的地或升级等级把请求送往不同模型;客服分流、邮件意图识别和标签判断也属于同一类问题。共同点不是任务“简单”,而是答案有有限集合,并且代码会根据答案采取下一步动作。

因此,工程团队真正需要设计的不是“让模型替代人工”,而是让概率进入动作策略。低风险、高置信度的结果可以自动执行,低置信度或不可逆操作则转人工,复杂请求再升级到更强模型。材料中的演示用退款或删除标记不可逆动作,并以置信度阈值区分自动执行和人工审核,不过该演示是基于TypeSafe主页数据的定时动画,不是实时API调用,示例概率也不是实际Jev输出,不能当作生产性能证明。

低价并不消除错误,只改变系统账本

Jev的定价是每百万输入token 0.042美元,输出免费,OpenRouter列出的上下文窗口为32K,TypeSafe给出的端到端响应时间为70到500毫秒。主页演示还重放了一个输入成本0.000081美元、耗时0.114秒的Jev调用,并将其与0.013880美元、8.566秒的LLM调用对比。但这些数字只说明厂商展示的成本和延迟差异,不能替代对准确率、重试、缓存、上下文长度和人工审核成本的核算。

对技术负责人而言,采用决策模型的前提应当是先定义错误的价格,再定义阈值。若错误会触发退款、删除、封禁或错误付款,概率输出必须配合人工复核、审计记录和回滚路径;若只是把客服请求送入一个候选队列,较低的准确率可能换来足够大的吞吐收益。最终应把Jev、GLiDE、开源复现和通用LLM放在同一业务数据与同一动作代价下比较,而不是只比较每百万token的报价。决策模型适合成为可观测的判断层,前提是团队接受它仍然是概率系统,而不是规则引擎。