先看证据

输入$2、输出$6/M4.7沿用4.6价格

同价升级,竞争从榜首转向单位任务成本

SpaceXAI发布了Grok 4.7,将其定位为面向编码、代理任务和知识工作的旗舰模型。它不是在Grok 4.6上简单增加一个推理档位,而是换用了更大的新基座,并针对需要数小时完成的困难任务延长了强化学习训练。Grok 4.7目前以托管模型形式提供,可通过xAI API、Cursor、Grok Build、OpenRouter、Vercel和Cloudflare调用。

这次发布值得读,不是因为新模型又刷新了一组榜单,而是因为价格没有随能力一起上调。Grok 4.7沿用每百万输入token 2美元、输出6美元的定价,与Grok 4.6相同。对需要持续调用工具、反复修改代码或批量运行知识工作代理的团队来说,决定模型能否落地的指标往往不是单次回答最高分,而是完成一个任务要花多少钱、失败后是否值得重试,以及是否能稳定嵌入现有开发环境。

基座与训练目标都在向长任务倾斜

SpaceXAI列出的变化有四项:更大的全新基座、面向更难长任务的更长强化学习、自验证与长上下文处理,以及对Grok Bot harness的原生支持。这个组合透露出训练目标的变化。模型要处理的,不再只是一次生成中能否给出正确片段,而是能否在较长执行链中保持上下文、检查中间结果,并把任务推进到收尾。

公开规格也支持这种定位。Grok 4.7拥有50万token上下文窗口,支持文本和图像输入、文本输出,并提供low、medium、high和xhigh四档推理努力级别。API支持Responses和Chat Completions,同时提供函数调用、网页搜索、X搜索和代码执行。对代理系统而言,这些能力的组合比“更聪明的聊天”更具体:它可以把较长的仓库、工作材料和工具反馈放进同一执行过程,但上下文更大并不自动等于任务更可靠,真正的瓶颈仍可能出现在工具调用、错误恢复和最终验收上。

数据表显示提升明显,但不是全面登顶

在SpaceXAI给出的对比表中,Grok 4.7以xHigh effort对比Grok 4.6的High effort,并与GPT-5.6 Sol Max和Fable 5.1 Max比较。Grok 4.7在CursorBench 4.0上为46.3%,高于4.6的40.4%;DeepSWE v1.1为71.0%,高于65.2%;EEBench为64.0%,比上一代高11个百分点,也是表中最高分。AA Briefcase为1657,对比4.6的1546,Harvey Legal Agent Benchmark则为19.6%,高于4.6的15.8%和Fable 5.1 Max的6.7%。

但这不是一张“低价模型全面击败高价模型”的表。Terminal-Bench 4.0从20.3%提升到38.0%,提升最显眼,却仍低于Fable 5.1 Max的57.9%。DeepSWE的最高分属于GPT-5.6 Sol Max,为72.7%,而HealthBench Professional上,Grok 4.7的56.7%也低于GPT-5.6 Sol Max的60.5%和Fable 5.1 Max的62.1%。这些结果更适合被解释为能力结构发生了改善,而不是某个通用模型已经完成替代。

从发布到试点,部署路径已经被铺好

Grok 4.7的产品设计明显偏向嵌入式使用。它在Cursor的所有套餐中可用,在Grok Build中作为默认模型,同时也通过公共API和多个云平台提供服务。Grok 4.7 Fast是同一模型运行在更快基础设施上的版本,输出速度翻倍,但价格也翻倍,而且目前只在Cursor和Grok Build中提供,不进入公开xAI API,也不包含在Grok Build免费层中。

对技术负责人来说,这意味着可以把评估拆成不同层次。Cursor适合观察模型在真实代码编辑和仓库任务中的行为,Grok Build适合验证默认代理体验,API和云平台则适合测量并发、缓存和成本。需要美国境内推理的团队可以使用us.api.x.ai/v1,但需支付10%的溢价;文档还建议设置prompt_cache_key以获得更可靠的缓存命中。上述差异说明,标称单价只是预算起点,速度、区域、缓存和宿主平台同样会改变每个任务的实际成本。

安全能力的提升伴随着更窄的部署余量

SpaceXAI称Grok 4.7采用全新的安全防护栈,并在其测试中拥有最强的拒答和越狱抵抗能力。它在LatchBio生物安全基准上达到62.4%。在SpaceXAI自有的HackerBench v0.3上,面向风险和恶意网络安全任务的双用途提示有3.3%被放行,公司同时强调模型很少拦截合法的安全工作,并向部分网络安全合作方提供受邀的红队能力访问。

这套取舍对企业部署很关键。减少对合法安全研究的误拦截,可以提高代码审计、漏洞复现和防御研究的可用性,但也意味着不能只用“拒答率”判断风险。技术团队需要把模型放进带权限边界的工具环境,区分只读分析、代码执行和网络操作,并记录被放行的高风险请求。由于材料中的安全数据主要来自厂商自报,3.3%也不能直接转换为事故概率;它更适合作为需要重点设计审计和隔离机制的信号。