先看证据

2026年10月6日以公开Beta发布。关键事实
目前仅支持gpt-6-luna,且仅能调用托管API。关键事实
OpenAI称其比Responses API快约10倍。关键事实
报道给出的单次决策约150毫秒,常规Luna约1.6秒。关键事实
公开资料未提供准确率或概率校准数据。关键事实
Luna上下文窗口为1,050,000 token。关键事实

从解析一段话,到直接接收一个判断

OpenAI 已将 Decisions API 开放公测。这是一个面向文本、图像或两者组合的托管 API:应用提交共享输入和一组问题,接口返回带类型的答案,供代码据此分支;它针对的,是先让大模型用自然语言回答、再从文字里解析标签的常见做法。目前唯一支持的模型是 gpt-6-luna,调用入口为 POST /v1/decisions。

值得读的变化不是模型突然学会了分类,而是分类任务开始以专用接口的形式交付。以往开发者要处理提示词、输出格式、解析失败和重试,Decisions 把其中一部分收进请求协议,直接返回概率、选项或分数。OpenAI 称它比 Responses API 快约 10 倍;这改变了接入成本,却不能单独证明判断质量更高。

三种答案类型,各自解决不同的分支

一次请求由 model、input 和 questions 三部分组成。每个问题带有唯一名称、类型和指令,共享的输入可以是文本,也可以包含图像;响应中的 answers 按名称对应问题。这种组织方式适合一次提供同一份证据、询问多个判定,而不必把每个标签都写成一次独立调用。

三类问题并不是三种说法相近的输出。predicate 判断条件是否成立,给出 0 到 1 的概率;choice 从调用方提供的选项中选一个,并附上各选项概率和 confidence;score 则在有序等级上评分,也返回概率和 confidence。比如严重程度分成三个等级,概率分别为 0.1、0.7、0.2 时,接口示例给出的加权分数是 1.1,含义是结果落在第二级附近,而不是模型发现了一个精确的物理量。

类型化减少解析工作,不会自动校准模型

Decisions 的边界与另外两种接口用途不同。需要判断概率、从固定集合中做选择,或按等级评分时,使用 Decisions;需要填充自定义 JSON schema 或生成解释文字时,OpenAI 指向 Structured Outputs;需要模型提出带参数的工具调用时,则应使用 function calling。它不是通用结构化输出的替代品,而是把有限几种判定操作做成明确契约。

这个契约能让应用少写一层文本解析,却不会替团队回答“概率 0.8 是否足够可靠”或“某个分数对应什么行动”。现有材料没有提供该端点的准确率或校准数据,也没有独立评测;OpenAI 文档建议用应用自身的标注样本设定阈值。因此,返回 probability 或 confidence 应被当作待验证的信号,而不是经过验证的风险保证。若阈值会触发拒绝服务、拦截交易或其他高代价动作,误判成本必须进入本地评估。

速度和账单都更直接,部署选择却很窄

速度证据目前主要是厂商声明。OpenAI 称响应速度约为 Responses API 的 10 倍,DevDay 相关报道给出的对照是一次决策接近 150 毫秒、常规 Luna 调用约 1.6 秒;这类数字足以说明团队为何会想试,但材料没有交代可独立复现的评测条件,也不能直接代表特定应用的端到端时延。网络、输入规模和后续业务逻辑仍会影响实际等待时间。

价格结构则相对清楚:gpt-6-luna 输入为每百万 token 0.10 美元,不收输出 token、缓存读取或缓存写入费用;超过 272K token 的提示按两倍输入费率计价,区域处理还可能产生溢价。模型卡列出 1,050,000 token 的上下文窗口,但模型参数量未披露。调用只能走 OpenAI 托管 API,没有开放权重或自托管路径;SDK 也有最低版本要求,包括 Python 3.26.0、JavaScript 7.30.0、Go 3.73.0、Ruby 0.101.0 和 Java 4.78.0。材料还列出符合条件客户可使用 Zero Data Retention 与 HIPAA,并支持美国和欧洲经济区及瑞士的数据驻留。

适合把判定做薄,不适合把责任外包

对技术负责人来说,合适的试点不是“把现有模型全面换掉”,而是找一个已有明确标签、选项或等级、且输出会进入代码分支的任务。比如对产品照片判断是否存在裂纹、撕裂或凹痕,predicate 能让应用直接拿概率做后续处理;是否自动拦截,则仍应由团队用标注样本和误判代价来定。这样的试点可以分别检查端到端时延、解析与重试是否减少,以及不同输入下概率是否足以支持既定阈值。

边界也很具体:目前只有一个模型,处于公测,没有独立评测,且必须接受托管部署。若团队需要可自托管、可对照多个模型、或已经依赖长文本和区域处理,那么价格与部署约束应和接口收益一起衡量。Decisions 把“模型说了什么”改写成了程序可消费的答案;它没有把“该不该据此行动”变成 API 能替你承担的问题。