先看证据

评测覆盖法律、商业和采购领域11项任务关键事实
有经验用户每项任务约需30至40分钟关键事实
每项任务按复杂度设8至50条评估标准关键事实
Astra得分55.0%,Sol得分41.6%关键事实
Astra平均分比Sol高32%关键事实
Astra每次尝试估时19.2分钟,Sol为37.0分钟关键事实

考题从合同审阅变成流程配置

2026年10月6日,OpenAI公布了与合同软件公司Ironclad的研究合作,目标是训练和评估能在专业软件中处理复杂工作的智能体。双方把合同、商业和采购流程中的实际任务带入研究,GPT-6 Astra是首个基于Ironclad任务训练的前沿模型。它要面对的不是单份合同里的问答,而是在软件里配置协议、审批和可复用法律条款,并检查最终设置是否满足原始要求。

这与Ironclad在2023年推出的AI Assist有不同的工作边界。早期工具帮助用户识别合同异常、建议红线修改或公司预先批准的条款,用户仍需决定是否接受建议。此次研究把目标推进到多步骤执行:智能体既要操作软件,也要在操作过程中保留规则,判断不同条件下流程是否都走对。变化值得技术负责人留意,因为专业软件自动化的难点正在从“能不能点”转向“能不能把业务规则贯穿到底”。

把业务要求拆成整项任务来验收

双方先由Ironclad员工和OpenAI内部的Ironclad使用者挑选了11项法律、商业和采购任务。例子包括设置保密协议、建立采购审批流程,以及根据请求人选择的司法辖区更新可复用条款。OpenAI估计,经验丰富的用户平均完成每项任务需要30至40分钟。这个基准说明任务涉及实际配置工作,但它是估计值,不是对所有企业流程的实测耗时。

每项任务根据复杂程度设置8至50条评估标准,检查的不只是单个操作是否成功。比如采购流程可能要求超过某个金额时由财务审批,特定请求还要经过安全审查,非标准条款则交由法务处理。智能体需要把这些条件放进表单、模板和审批规则,并确认阈值上下的请求都进入正确路径。以整项流程而非一次点击计分,能暴露模型是否在长链路中遗漏要求,但评测结果仍取决于任务设计和标准覆盖了哪些情形。

训练环境贴近软件,数据边界仍需看清

Ironclad提供其产品的托管软件环境,让模型可以在真实软件形态中练习这些任务。OpenAI围绕代表性工作流制作合成训练任务,再通过强化学习和反馈改进模型。这个组合把懂业务的人对“什么算完成”的判断、可重复执行的任务,以及模型练习的环境连接起来,比只测试通用界面操作更贴近合同工作。

训练材料的来源和边界也需要一并理解。OpenAI称,合成任务来自美国证券交易委员会EDGAR数据库中的公开合同,训练和评估没有使用OpenAI客户数据、OpenAI内部合同或Ironclad非公开客户数据与合同。这降低了依赖客户私有合同进行训练的顾虑,却没有证明模型能自动理解每家公司的内部政策、授权关系和例外规则。公开合同可以提供条款与文件结构的素材,企业流程能否迁移仍是另一个需要单独验证的问题。

得分提高,用时下降,但口径不是生产收益

在11项任务的研究评估中,GPT-6 Astra平均得分为55.0%,GPT-5.6 Sol为41.6%。OpenAI将前者概括为高32%,按分数直接相减则相差13.4个百分点。比较时还要注意推理设置不同:Astra使用其得分最高的Max,Sol使用其得分最高的High。因此这组结果说明各自最佳设置下的表现差异,不是把两个模型放在完全相同推理配置中的单变量对照。

用时数据也不是客户实测。OpenAI估算Astra每次尝试平均需要19.2分钟,Sol需要37.0分钟,称Astra低48%,并说明该时间按模型处理和生成速度推算。一个展示任务中,Astra约用20分钟满足约94%的标准,Sol约用32分钟满足约85%,但这是单项示例,不能替代11项任务的平均结果。另有一个用于研发Astra的内部模型得分63.7%,公开材料没有提供模型名称和更多评估细节。这些数字显示进步方向,却不足以推出实际节省工时或可靠完成复杂合同工作的结论。

把评测带回自有流程,而不是直接交出控制权

对技术负责人而言,这项研究最可复用的部分,是把难以自动化的业务规则变成可重复评测的任务。可以从一条审批流程开始,明确金额阈值、角色权限、例外情形和最终验收条件,再记录智能体在哪些标准上失败、需要多少人工介入,以及真实完成时间是否变化。这样的评测能把“模型看起来会操作”转化为可定位的工程问题,也能帮助团队决定哪些步骤适合自动执行,哪些仍需人工确认。

但现有证据不能支持把Ironclad研究结果直接外推到所有合同流程。公开材料没有说明研究成果是否已经进入Ironclad客户产品,也没有报告独立第三方复核、11项任务对真实客户工作的代表性,或模型在这些任务之外的表现。55%的平均分意味着相当一部分标准尚未满足,而用时优势又是速度推算。现阶段更稳妥的判断是把这类智能体作为受监督的流程助手,在本地规则和异常路径上逐步验证,再依据失败记录扩大权限,而不是将合同工作整体交给它独立托管。