Grok 4.7来了,不用官方工具,升级可能变退步?

  出品 | 网易智能

  作者 | 小扣

  编辑 | 王凤枝

  把最新模型换进旧工作流,表现反而退步了。

  9 月 21 日,SpaceXAI 发布 Grok 4.7。新模型已经进入 xAI API、Grok Build 和 Cursor,并开始向 GitHub Copilot 用户开放。它支持 50 万 token 上下文窗口,可处理文本和图像,并提供从 low 到 xhigh 四档推理强度。

  安全公司 XBOW 在 50 项漏洞测试中发现,Grok 4.7 的早期候选版接进原有框架时略逊于 4.6;换到基于 Grok Build 的系统,结果才反转。

  两套工具得出了相反结果,差别不只在模型够不够聪明,还在 Agent 怎样保存上下文、调用工具,以及失败后如何重试。Grok 4.7 偏爱短步骤、频繁获取反馈,Grok Build 恰好顺着这种方式设计。

  这次进步,要和 Agent 工具一起看

  按 SpaceXAI 的说法,Grok 4.7 采用了更大的基础模型,强化学习时间更长,训练任务也更偏向需要数小时才能完成的问题。公司还加强了模型检查自身工作和管理长上下文的能力。

  Artificial Analysis 分别以 xhigh 档和 high 档测试 Grok 4.7 与 4.6,两代分数不作直接比较。单看 4.7,它的综合指数为 46 分,在模拟律师、金融分析师等专业人士完成长时间工作的 AA-Briefcase 中为 1657 Elo。

  更能直接比较的是代码 Agent 测试。Grok 4.7 与 Grok Build 组合后的指数为 56 分,比同样使用 Grok Build 和 xhigh 档的 4.6 高 9 分。三项子测试全部上升,其中 Terminal-Bench 从 18% 升至 33%。这项测试看的,是模型能不能在终端里连续操作,把问题一步步解决掉。

  图:代码 Agent 指数,同用 Grok Build 及 xhigh 档,4.7 为 56 分,4.6 为 47 分。

  图:三项子测试均有提升;图中成绩均为模型与对应 Agent 工具的组合表现。

  这 9 分是 Grok 4.7 和 Grok Build 共同取得的。现有公开数据还不能拆清,多少来自模型本身,多少来自它与框架的配合。

  运行时,Grok 4.7 负责判断下一步怎么走,Grok Build 负责保存上下文、调用终端和其他工具,并在失败后安排重试。对需要连续操作的代码任务,这些环节都会影响最终结果。

  离开 Grok Build,4.7 未必更强

  离开 Grok Build,结果就变了。XBOW 拿到 Grok 4.7 的早期版本后,把它接进原有的漏洞利用框架,运行 50 项测试,每项重复 10 次。在固定迭代次数下,4.7 略逊于 4.6;不少任务需要多跑几轮才能得到相同结果,token 效率也没有明显优势。

  XBOW 发现,4.7 喜欢发出简短的终端命令,每走一步就拿回结果,再决定下一步;它不太愿意一次写出同时完成多项操作的长脚本。Grok Build 适合这种短而连续的动作,XBOW 原有的框架和这种工作方式不够合拍。

  换成基于 Grok Build 的系统,结果随即反转。等权平均后,使用 4.6 时,这套系统一次典型运行找到 42 项真实问题;换成 4.7 后,数量增至 68 项。

  图:旧框架中的完成率与迭代次数、Token 用量:4.7 并未全面优于 4.6。

  图:等权平均后的真实问题数:Build 系统中,4.6 为 42 项,4.7 为 68 项;下方另列误报率。

  42 项到 68 项的反转,说明 Grok Build 并非可有可无。眼下,Grok 4.7 正在进入更多第三方 Agent 工具。GitHub Copilot 正向个人和企业用户逐步开放,企业管理员可以单独决定是否启用。

  图:GitHub 官方发布图展示了 Copilot 中的 Grok 4.7 模型选项。

  用户在 Cursor 和 GitHub Copilot 中选中 Grok 4.7 后,模型会进入各自的 Agent 流程。Grok Build 上的提升能不能带过去,要看这些工具怎样管理上下文、调用工具和处理失败。

  单价没涨,一项任务可能更贵

  Grok 4.7 延续了上一代的标准 API 价格。单次请求的输入不满 20 万 token 时,每百万输入、缓存输入和输出 token 分别收费 2 美元、0.5 美元和 6 美元;达到 20 万 token 后,三项价格分别升至 4 美元、1 美元和 12 美元。第三方渠道 Vercel AI Gateway 也已接入,并为 4.7 提供截至 9 月 27 日的限时六折调用价。

  单价没变,完成一项任务的费用却可能拉开。Artificial Analysis 记录到,4.7 的 xhigh 档平均每项任务输出约 8.1 万 token,4.6 同档约为 3.8 万。该机构还测得,4.7 在长提示下每秒大约输出 188 个 token,Intelligence Index 中的单项任务平均用时约 7.1 分钟。公开页面没有进一步拆分模型生成与工具执行各用了多少时间。

  图:每项任务平均输出:4.7 约 8.1 万 token,4.6 约 3.8 万 token,两者均为 xhigh 档。

  输出 token 只是账单的一部分。XBOW 的测试显示,4.7 每轮输出更短,却有时需要更多轮交互;多轮任务还可能反复带上部分上下文。框架能否命中缓存、单次输入会不会越过 20 万 token 的价格门槛,都会改变费用。现有公开测试没有披露输入 token 总量和缓存命中情况,因此还不能把成本增加全部归因于输出变多。

  一名 Cursor Ultra 用户连续两天运行同一项任务,4.6 和 4.7 都使用 xhigh 档,并关闭 Fast 模式。按套餐额度下降速度估算,4.7 的消耗约为 4.6 的 2.5 倍。这 2.5 倍只是 Cursor 套餐中一个项目的额度变化,不能直接换算成 xAI API 费用。但 4.7 消耗更快,与 Artificial Analysis 测到的输出 token 增加方向一致。

  更多 token 也可能换来更少的返工。另一名开发者用相同提示词,让 4.6 和 4.7 制作同一个加密应用网站。两版初稿都不理想,但他认为 4.7 的 3D 视觉效果更好、生成也更快。他估计,4.7 继续修改一两轮便可能接近目标,4.6 还需要三四轮。这些后续修改并没有实际跑完,因此只能说明潜在收益,还不能证明省下的人工足以抵消额外消耗。