How we will do better for Australia — Cover
来源材料 查看原始材料 ↗
Lenfest AI Collaborative expansion — September 2026 — cover
来源材料 查看原始材料 ↗
Source figure
来源材料 查看原始材料 ↗

先看证据

Basis用GPT-6 Astra完成税表快2倍关键事实
相比GPT-5.6 Sol少用时50%关键事实
测试对象是50页税务工作簿关键事实
工作簿包含50个标签页关键事实
Basis内部评测分数提升约20%关键事实
Astra早期决策更好、纠错更少关键事实

一张工作簿暴露了长流程的真实瓶颈

OpenAI在2026年9月28日发布的案例中介绍了Basis与GPT-6 Astra的合作测试。Basis开发面向会计工作的AI智能体,希望自动处理日常手工任务。测试要求GPT-6 Astra和GPT-5.6 Sol准确、可靠地完成一份复杂税务工作簿,这份工作簿包含50个标签页。结果显示,Astra完成任务所需时间比Sol少50%,也就是Basis所说的速度达到两倍。

这个数字首先说明的并不是某个单独税务答案更快生成,而是长流程任务的耗时可能主要消耗在路径选择和错误修正上。一个智能体如果在开头误判用户要达成的目标,后面即使每一步都能生成合格内容,也可能不断回退、重做和补充说明。Basis观察到Astra在任务早期做出的决定更好,并因此减少了纠错,这为“少用时”提供了比单纯输出速度更具体的解释。

优势发生在任务开始之前

Basis对Astra的描述,核心不只是“推理更强”,而是它更能理解用户真正想完成的问题。模型可以从更广的上下文中判断任务目标,识别什么时候应该提问,哪些地方需要标记假设,以及用户指令应该如何落实。对于税务智能体来说,这些判断往往发生在填表、计算或查找资料之前,却决定了后续工作会沿哪条路径展开。

这改变了智能体系统的优化对象。过去,团队容易把精力放在提示词、工具调用和单步答案的质量上,再用大量规则补齐模型没有明确表达的业务要求。Astra让Basis看到另一种可能性:如果模型能从上下文推断出模板遵循、查阅税务原始资料和完成自检等要求,系统就不必为每一种情形编写一条单独规则。规则数量减少并不等于系统变得简单,而是部分控制逻辑从外部配置转移到了模型的上下文理解能力上。

动态推理把能力差异变成成本差异

Astra的另一项机制更直接地连接了模型能力与运行成本。Basis表示,模型可以随着任务推进,根据当前步骤的难度调整推理量。困难步骤增加计算,简单步骤减少计算,而且调整过程中可以保持缓存不丢失。对一份包含50个标签页的工作簿而言,这意味着系统不必用同样的推理强度处理每一个环节。

这种设计的价值不在于让所有步骤都更快,而在于避免把昂贵的计算平均摊到简单步骤上。长任务通常同时包含资料定位、格式处理、判断、复核和例外处理,它们需要的计算强度并不相同。若模型能够保留此前上下文,又能在难点处临时增加计算,理论上就能同时压低响应时间和成本。材料没有披露Astra的具体计费方式,也没有给出每份工作簿的绝对成本,因此目前能确认的是运行机制和方向,而不是一份完整的经济性证明。

内部评测的提升,指向的是可控行为

Basis还报告称,使用Astra后内部评测分数提升约20%。这套评测不只看最终答案是否正确,也检查智能体是否遵循模板、是否针对税务问题查阅原始来源,以及是否完成自检。换句话说,评测关注的是一个工作流能不能按照业务预期运行,而不是模型能不能在某个孤立问题上给出漂亮回答。

这一点对技术负责人尤其重要,因为企业部署最难维护的通常不是一条提示词,而是大量边界行为。什么时候应该停下来询问用户,什么时候必须暴露假设,什么时候需要引用来源,什么时候要拒绝在证据不足时继续推进,这些行为构成了智能体的操作规范。Astra如果能从更广上下文中推断这些要求,确实可能减少逐情形维护规则的压力,也可能让系统覆盖内部测试没有穷举的情况。但“更少显式规则”同时意味着更多行为依赖模型判断,评测体系必须足够具体,才能发现这种依赖何时失效。

“快两倍”仍然不是部署结论

这项案例最有价值的地方,是把模型选型从单步答案质量拉回到完整任务的经营指标。对于税务智能体,团队可以同时记录任务完成时间、返工次数、提问是否及时、原始资料引用是否正确、模板遵循度、自检结果和单位任务成本。Astra的表现提示,早期规划和动态推理应该成为这些指标的一部分,而不是只在模型基准分数里寻找答案。

但现有证据仍然有明确边界。50%少用时来自Basis对一份50标签页税务工作簿的测试,不能外推为所有税务流程都能提速一倍,也不能等同于准确率、合规性或端到端投资回报提升一倍。Basis没有在材料中披露Astra动态推理的计费细节,也没有说明税务引用准确性的独立验证结果。实际部署可以从受控的长流程开始,用相同输入和审计标准比较不同模型,把速度收益与错误代价放在同一张账上。对企业而言,最稳妥的判断不是“模型更强所以全面替换”,而是确认它是否能在自己的流程中更早选对路径,并且在选错时留下足够清晰的证据。