先看证据

81.4%WANDR软召回
93.9%DeepSearchQA F1
58.9%WideSearch行级F1

把机制串起来

输入先把素材压到可处理的规模

深度研究不只是搜到网页,而是把问题拆成多个子问题,分别检索、交叉核验,再汇总成带引用的答案。列表型任务还要关注召回率:目标是尽量找全符合条件的实体,而不是只给出几个看似相关的结果。所谓多代理,是让多个子代理并行探索不同领域,再由系统路由模型和合并结果。

机制再把计算集中到关键步骤

Ultra会把原始任务拆成多个研究子任务,让子代理同时覆盖不同网站、行业或实体维度,并把已有列表作为排除项以继续扩展。系统不会对每一步都使用最强模型,而是把需要复杂判断的步骤路由给前沿模型,把简单步骤交给更快模型,从而控制成本。高努力模式的核心代价是更长的检索深度、更多工具调用和更高延迟,通常约需30分钟,极难任务可达3小时。它适合以召回和证据完整性为首要目标的任务,不适合必须秒级返回或严格固定成本的交互。基准中的“找到多少”还取决于搜索内容工具、去重策略和评分器,因此高分不

结果最后落到可验证的工作结果

['适合批量建公司、论文、工具清单并附证据URL', '金融尽调、KYC和账户扩展适合高努力模式', '先传入已有行,可减少重复发现', '不适合秒级问答或无法接受3小时延迟的流程']

问题从“答对”变成“别漏掉”

Exa发布的Agent Ultra,是Exa Agent API中最高投入等级的托管模式,面向大规模列表构建、实体补全,以及需要检索数千个来源的问题。它不是一个可以下载和自托管的开放权重模型,而是通过API提供的长时运行研究服务。调用时把effort设为“ultra”,系统就会按这一模式执行任务。

这一定义带来了一个重要转向。传统问答系统通常围绕“给出一个足够好的答案”优化,而列表研究更像一个开放集合问题:用户想找出某类公司的尽可能完整集合,或者为每个实体补上成立条件、产品属性和可核验链接。此时,一个看似正确但漏掉大量候选项的答案,实际价值可能低于一个表述没那么漂亮、却覆盖更广的结果集。

它如何把研究任务摊开

Exa Agent的基本机制是把一个任务拆成多个子任务,再让子代理并行研究不同领域或来源。系统会把需要更强推理能力的步骤路由给前沿模型,把简单步骤交给更快的模型。Ultra并没有改变这个基本结构,而是提高了允许使用的计算量、运行时间和搜索深度,目标是让研究持续到更接近“耗尽”。

这意味着“多代理”本身不是完整的解释。真正的系统取舍包括如何划分子任务,怎样避免多个代理重复搜索,如何合并冲突信息,以及何时判断搜索已经足够。材料没有披露这些调度和停止策略的具体实现,因此不能仅凭“subagent swarm”推断它在所有任务上都能稳定扩大召回率。可以确认的是,复杂任务通常约需30分钟,极难任务最长可达3小时。

数字显示优势,但不是独立结论

Exa在发布材料中报告,Ultra在四项研究基准上超过了以最高投入模式运行的Opus 5.5、GPT-6 Astra和Perplexity Agent。关键结果是:WANDR软召回率81.4%,DeepSearchQA的F1为93.9%,WideSearch的行级F1为58.9%,Company Find-All每项任务平均通过实体数为2451。对照组在这些指标上的结果分别为72.3%、77.6%、51.6%和146,具体对手在不同基准上有所变化。

这些数字足以说明Exa把产品目标压在了宽覆盖和实体发现上,但不能直接当成跨系统的定论。Exa说明,WANDR使用了Perplexity的公开评测框架,并替换了内容工具和传输逻辑,判断模型使用gpt-6-luna。WANDR和DeepSearchQA最多评估200项任务,WideSearch和Company Find-All各评估100项,且各提供商实际被评分的任务数并不完全相同。所有结果都由厂商报告,尚未得到独立复现。

真正的成本是时间、预算和可运营性

Agent Ultra的产品价值,与它不适合即时交互同样紧密相连。它使用标准Agent运行接口,支持outputSchema、input.data和流式输出,默认每次运行的费用上限为20美元。调用方可以把maxCostDollars设在1到100美元之间,把maxDurationSeconds设在300到10800秒之间,也可以中途停止运行并保留已有结果,同时按已经消耗的用量计费。

这些控制项让Ultra更像一个可编排的后台研究作业,而不是聊天窗口中的搜索按钮。SDK默认轮询超时为1小时,但Ultra最长可以运行3小时,因此生产系统需要主动调整超时或改用事件流。对需要批量建立市场地图、做尽调或补全销售账户的团队,长时间换取更高召回可能是合理交易。对需要秒级响应、严格固定成本或频繁重试的应用,这种模式则会把延迟和预算管理变成主要工程问题。

适合哪些工作,边界又在哪里

Exa列出的主要用户包括模型提供商、金融服务机构和市场拓展团队。模型团队可以搜索实现某项技术的论文和代码仓库,并核验“发布了权重而不是只提供API”之类的条件。金融机构可以构建尽调市场地图,在公告、法院记录等材料中开展KYC研究。销售团队则可以生成账户清单,为每一行补充带引用链接的判断字段,或者把已有列表作为输入,要求系统排除已知实体后继续扩展。

但“找全”始终依赖定义边界,而不是只依赖计算量。什么算一家符合条件的公司,哪些来源足以证明某个属性,重复实体如何合并,网页失效或相互矛盾时谁拥有最终解释权,这些都决定结果能否进入业务流程。更稳妥的部署方式,是把Ultra放在候选发现和证据收集层,再用确定性的规则、人工抽查或专门的核验流程处理高风险结论。它可以减少研究人员遗漏的概率,却不能替组织承担口径定义、证据责任和最终决策。