先看证据
把模型放进控制流,接口先变了
OpenAI在2026年9月29日的DevDay公布了Decisions API,面向需要让模型回答有限问题、并把结果交给程序处理的开发者。10月6日,Simon Willison发布了 `llm-openai-decisions 0.1a0`,把这个API接入自己的 `llm` 命令行工具。API当时处于限量预览阶段,插件也被标为预发布版,所以这次发布更像一个早期接入入口,而不是成熟度已经得到验证的生产方案。
变化的关键不是模型开始“会判断”,而是应用可以把答案空间事先限定下来。传统做法往往让模型写一段话,再由应用从文字里抽取结论,或要求它遵守某种输出格式。Decisions API则把问题类型和结构化答案作为接口的一部分,减少了应用解析自由文本的工作,也让模型更容易进入分类、请求分流等控制环节。它没有因此消除判断错误,只是把错误更直接地交到了程序手里。
三种问题类型,边界由调用方设定
Decisions API提供 `predicate`、`choice` 和 `score` 三类问题。`predicate`判断某个条件是否成立并返回概率,`choice`从开发者给定的选项中选择并返回选项概率与confidence,`score`则按预设等级评分,也会返回相应的概率和confidence。三者的共同点,是调用方先定义“什么算可能的答案”,模型再在这个范围里作答,而不是自行扩展成开放式对话。
这个设计对工程接入有实际好处。分类器可以把有限标签交给模型选择,分流器可以定义候选队列,评分流程则可以给出预先约定的等级。评分问题至少要有两个等级,三个等级时score范围为0到2。结构化字段让结果更方便被代码读取,但选项和等级仍须由产品与工程团队定义,模型不会替团队决定哪些标签足以覆盖真实业务。
请求组织决定它是不是工作流
一次请求可以携带共享输入和按顺序排列的多个问题,API会依照问题顺序返回答案。官方建议把彼此独立的问题放进同一次请求。这样做可以让同一段文本或同一组图片同时接受多个互不依赖的检查,而不用为每个检查重复组织输入。
但如果第二个问题要根据第一个答案改变内容,就不能把它们当作一组并列任务。官方建议把这种依赖关系拆成多次请求,流程如何继续仍由应用编排。这条边界很重要:一个接口能接收多个问题,并不等于它会自动规划下一步,更不等于它就是完整的智能体。技术负责人仍需明确重试、分支、失败回退和动作授权由哪一层负责。
图像示例展示入口,不证明判断可靠
Willison用一张鹈鹕图片展示了视觉输入。他通过 `llm -m openai-decisions/gpt-6-luna` 选择模型,用 `-a` 附加图片,再用 `-s` 提问“图中是否包含哺乳动物”。示例返回 `predicate` 类型的结果,概率为 `0.0`。这说明图片可以成为有限判断的上下文,也说明插件能把API包进已有命令行习惯,但一个示例不能证明模型在不同图像、边界案例或生产数据上的表现。
官方参考资料规定,图片须以data URL提供,单次请求最多可带128张。插件的安装命令是 `llm install llm-openai-decisions`,作者称自己让GPT-6 Astra阅读新API文档,并参照已有的 `llm-typesafe` 插件构建它。这条路径让熟悉 `llm` 的开发者更容易试用,插件本身却只是调用层的包装。应用仍要负责构造输入、处理错误、检查结果,并决定哪些判断可以触发自动动作。
结构化输出之外,价格与概率仍待核实
价格比较看起来简单,实际口径并不明朗。Willison在发布介绍中称,Decisions按输入计费、不收输出费,OpenAI价格为每百万输入token 0.10美元。他同时给出Jev每百万输入token 0.042美元,按这两个数字计算,OpenAI的输入单价约为Jev的2.4倍。若只比较这组发布介绍中的数字,Decisions并不是更便宜的选择。
不过,现有材料不能把这组说法直接当成已核实的专项定价。OpenAI变更日志列出的GPT-6 Luna通用API价格还包括每百万输出token 0.50美元,而现有官方Decisions说明没有独立列出专项价格。两者可能对应不同计费口径,因此接入前应确认Decisions请求实际如何计费,尤其不要把“作者称输出免费”写进成本模型而不复核。对于高频调用,输入量、图片和请求组合都可能改变实际账单。
概率和confidence也需要同样谨慎。材料说明API会返回这些字段,却没有提供概率校准证据,也没有说明它们在业务数据上的错误分布。团队可以先用代表性文本和图像评估误判类型、阈值表现与成本,再决定哪些结果适合自动分流,哪些必须回退或人工确认。考虑到API当时仍是限量预览、插件为0.1a0预发布版,当前更可执行的判断是小范围试用、保留替代路径,并在扩大部署前核实可用性、专项价格和错误表现。