OpenAI、Anthropic凌晨开打!一夜三款新模型,AI价格战再升级

  出品 | 网易智能

  作者 | 小小

  编辑 | 王凤枝

  一夜之间,OpenAI 和 Anthropic 连发三款模型。

  北京时间 9 月 23 日凌晨,Anthropic 先发布 Claude Opus 5.5,称典型工作负载的运行成本较上一代下降约 40%。几个小时后,OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,API 输入、输出单价较 GPT-5.6 当时的促销价降低 50% 或更多。

  两家公司都把“更便宜”放在发布核心,竞争点也从谁更强,扩展到谁能以更低成本完成工作。Anthropic 拿旗舰降价,OpenAI 则为 GPT-6 补上两档更便宜的模型。

  OpenAI 称,两款新模型沿用了旗舰 Astra 的训练方法,将专业工作、事实性、编程、计算机使用和对齐方面的改进带到了更便宜的档位。

  不过,两家公司公布的降价百分比并不是同一套口径。模型如果输出更长、反复调用工具,或者几次失败后才完成工作,最终账单也可能增加。哪款模型更划算,还得把这笔账拆开来看。

  发布当天,OpenAI CEO 山姆·奥特曼(Sam Altman)把降价解释为扩大 AI 使用规模的一步。他表示,希望 AI 被更广泛地使用,推动一场新的文艺复兴。

  

  01 便宜多少,开始按任务算

  先看最直观的 API 价目表。Sol 每百万 Token 输入 2 美元、输出 10 美元,与 Anthropic Claude Sonnet 5 相同。Luna 的输入、输出价格则分别为 0.10 美元和 0.50 美元。OpenAI 表示,两款模型的新价格都是长期定价,不是限时折扣。

  Anthropic 同一天公布的 Opus 5.5,输入价从 5 美元降至 4 美元,输出价从 25 美元降至 20 美元,缓存读取价则从 0.50 美元降至 0.20 美元。Anthropic 还称,Opus 5.5 的输出速度较上一代提高 30% 以上,因此将典型工作负载成本降幅估算为 40%。

  

  这个 40% 与 OpenAI 的 50% 以上不能直接比大小。前者是单价、速度和 Token 消耗共同影响的典型工作负载成本,后者首先是 API 单价变化。

  Anthropic 列举的早期测试中,有用户称曾在不到一天内让 Opus 5.5 完成 68 万行代码的迁移。这是公司引用的个案,但它与 Opus 5.5 的定价放在一起,已经能看出厂商开始怎样卖模型:不只说智能有多高,还要说一份工作多快、多贵。

  科技分析师@kimmonismus 在当天的复盘中也将能力和成本放在一起看。他提到,Luna 在 DeepSWE 上的表现接近 Fable 5 中等推理强度,但 OpenAI 估算的单任务成本低 96%。

  近日,xAI 发布 Grok 4.7,小米也推出 MiMo-V2.6 系列。一周之内,从闭源旗舰到开放权重模型,主要厂商的新品接连上线,价格与能力被同时摆到了比较表里。

  Box CEO 亚伦·莱维(Aaron Levie)认为,AI 任务成本下降,会扩大能够部署智能体的场景;成本越低,企业和开发者越愿意尝试,新增需求反过来又会推高 AI 使用量。

  

  02 Sol 更便宜,提升却不是每项都有

  价格算清以后,还要看 Sol 究竟能接下哪些工作。它位于 Astra 之下,官方公布的多项结果显示,部分高端模型的能力已经被带到更低的价格档。

  在 OpenAI 公布的 AutomationBench 对照中,Sol 在 xhigh 推理强度下得分 33.2%,比低推理强度的 Astra 高 2.9 个百分点,单任务成本则只有后者的约四分之一。与最高推理强度的 Claude Opus 5 相比,Sol 得分更高,单任务成本约为其十一分之一。

  

  软件工程测试 DeepSWE v1.1 中,Sol 在 max 推理强度下得分 68.8%,与 Claude Fable 5 在 xhigh 档位的 69.9% 相差 1.1 个百分点,OpenAI 估算其单任务成本低约 80%。

  OpenAI 在 OSWorld 2.0 离线集中列出的,是不同推理档位下的结果:Sol 在 xhigh 档位得分 60.5%,Claude Opus 5 在 medium 档位得分 60.3%;按 OpenAI 估算,前者的单任务成本低约 80%。

  事实性的变化更复杂。OpenAI 的内部测试显示,Sol 的事实错误率大约只有上一代的一半。第三方评测机构 Artificial Analysis 的 AA-Omniscience 结果则显示,Sol 的幻觉率从 92% 降至 60%,同时回答率从 99% 降至 83%,正确率也从 59% 降至 54%。它更少给出错误答案,但也更频繁地选择不回答。

  Artificial Analysis 给 Sol 的编程智能体指数打 57 分,比上一代高 2 分,Terminal-Bench 4.0 和 SWE-Atlas-QnA 等项目有所提高。按该机构估算,Sol 每项任务约 2.99 美元,较上一代下降约一半。

  知识工作则没有展现出同样的趋势。Sol 在 GDPval-AA v2.1 中比上一代低约 100 个 Elo 分,AA-Briefcase v1.1 基本持平。后者涉及跨多周的知识工作项目和数千份输入文件,专门考察模型持续处理复杂信息的能力。

  03 Luna 把输入价压到 0.10 美元

  相比 Sol,Luna 把价格压到了另一个区间:每百万 Token 的未缓存输入价为 0.10 美元,输出价为 0.50 美元,缓存读取价为 0.01 美元。小米 MiMo-V2.6-Flash 的三项价格分别为 0.14 美元、0.28 美元和 0.0028 美元。

  新输入占比高时,Luna 更便宜;输出较多或大量命中缓存时,MiMo-V2.6-Flash 的价格反而更低。两款模型的实际账单,要看输入、输出和缓存读取各占多大比例。

  AI 基准测试机构 Bridgebench 还进行了一次 3D 场景演示。这次测试只统计了运行时间和费用,没有统一披露四个结果的功能完成度:Luna 用时不到 1 分钟,费用不到 1 美分;Sol 用时约 1 分钟,费用 0.11 美元;Grok 4.7 用时 11 分钟,费用 0.29 美元;Claude Opus 5.5 用时 12 分钟,费用 1.52 美元。

  

  在 DeepSWE v1.1 的 max 档位中,Luna 得分 66.6%,接近 Claude Opus 5 和 Fable 5 在 medium 档位的表现;OpenAI 估算,Luna 的单任务成本分别低 93% 和 96%。在 OpenAI 的事实性测试中,Luna 也可以在较高推理强度下达到 GPT-5.6 Sol 的水平,单任务成本约为后者的百分之一。

  Luna 并没有在所有测试中进步。Artificial Analysis 给出的编程智能体指数为 41 分,比上一代低 2 分,SWE-Atlas-QnA 和 DeepSWE v1.1 也出现下降。其幻觉率从 93% 降至 77%,但正确率基本未变,回答率进一步下降。

  

  OpenAI 以 Replit 为例称,此前的降价已经帮助 Replit 向数百万用户提供免费模式。GPT-5.6 Luna 在 7 月降价 80% 后,使用量增长超过 10 倍。

  科技博主@MaxForAI 注意到,过去 DeepSeek 长期被视为低价模型的代表,如今 OpenAI 开始主动进入同一价格区间。

  

  在完成质量满足要求的前提下,价格下降会让摘要、信息提取、简单问答和批量分类等任务更容易进入大规模部署。Luna 是否适合这些任务,还要看每个业务对准确率、回答率和人工复核的要求。

  04 部分任务缩短至三分之一,前端测试却翻车

  跑分与报价之外,几位提前获得权限的开发者给出了更不整齐的答案。

  科技分析师弗拉维奥·阿达莫(Flavio Adamo)称,他测试 Sol 时,一些在 GPT-5.6 上需要约 1 小时的任务,缩短到了 20 分钟左右,消耗的 Token 也经常不到原来的一半。他还让模型根据《塞尔达传说:时之笛》预告片,尝试制作一个可运行的塞尔达风格演示。

  投资人马特·舒默(Matt Shumer)的体验更保守。他认为 Sol 整体可靠,但日常工作仍更倾向于 Astra、Fable 5.1 或 Opus 5.5。对他来说,新模型增加的首先是另一个选项,而不是一个可以替掉所有模型的答案。

  前端和 Three.js 测试的分化更明显。AI 资讯账号@aipulseda1ly 用同一个纽约城市场景提示对比 Sol 和 Opus 5.5。Opus 5.5 生成了包含街头出租车、屋顶、布鲁克林大桥和中央公园等元素的动态场景;Sol 最终只生成一个静态画面,无法移动相机,代码也缺少持续运行的渲染循环。

  

  这次纽约场景测试与前面的火箭演示使用了不同提示、功能要求和验收方式,因此不能直接对冲成一个输赢结果。两个案例放在一起,倒是说明了单任务成本为什么必须同时带上完成标准:如果交付的功能不同,费用也就失去了直接比较的意义。

  05 缓存更省,安全改善并不均匀

  前面的演示和早期体验,都只覆盖了短期任务。智能体长时间运行时,重复上下文如何计费、模型遇到异常会不会停手,同样影响部署。

  GPT-6 这次改进了提示缓存。Sol 和 Luna 的缓存读取 Token 均按未缓存输入价的 10% 计费;开发者可以在不破坏已有缓存的情况下调整推理强度和工具配置,也能明确指定缓存前缀在何处结束。

  长周期运行的编程或业务智能体,往往要反复发送相同的系统提示、文件、工具定义和历史上下文。缓存命中率上升,会同时影响这些任务的费用和响应时间。

  OpenAI 称,过去几个月里,GitHub Copilot 持续优化提示缓存,在数十亿次请求中,需要重新计算的提示 Token 比例已经减少一半以上,响应速度也随之提升。

  对齐测试中,几项已公布的违规比例都比上一代低,但改善幅度差异很大。在编码欺骗测试中,Sol 的欺骗率从 10.4% 降至 1.3%,Luna 从 9.5% 降至 2.8%。

  另一项测试故意向智能体提供已经损坏的搜索工具,观察模型是否主动向用户说明工具发生故障。Sol 未告知用户的比例从 77.8% 降至 5.4%,Luna 从 78.3% 降至 30.2%。

  幅度较小的是“尊重警告”测试。在这组主要涉及低风险情境的对抗任务中,面对“访问被拒绝”等明确提示,Sol 仍有 64.4% 的比例尝试绕过限制,上一代为 68.2%;Luna 则从 76.5% 降至 42.4%。

  OpenAI 提醒,这些评测故意设置了更具挑战的情境,也没有启用产品中的全部系统级防护,不应将这些数字理解为真实使用中的失败率。

  沟通方式也有调整。OpenAI 称,Sol 和 Luna 的回答会更直接,减少术语、奇怪表达和低价值细节,整体稍短,但不刻意牺牲信息量。公司展示的网页设计案例中,GPT-5.6 Sol 容易过早宣布完成,还会加入与用户需求关系不大的图片工具提示;GPT-6 Sol 则倾向于先说明计划,再汇报完成情况,并告诉用户哪些内容已完成、哪些还没有检查。

  06 三档模型上线,企业开始分配任务

  OpenAI 给出的基本定位是:Astra 仍是综合能力最强的模型;Sol 在更低成本下处理高难度日常工作;Luna 则用于高频、目标明确的任务。实际工作流未必会整体交给同一个模型,企业可以按难度、时延和出错代价,将不同环节分给不同档位。

  目前,Sol 和 Luna 已经上线 OpenAI API,模型 ID 分别为 gpt-6-sol 和 gpt-6-luna。ChatGPT Work 和 Codex 也开始向 Plus、Pro、Business、Enterprise 和 Edu 用户逐步推送;免费版和 Go 版用户可以通过桌面应用使用 Luna。两款模型目前尚未在 Chat 中开放。

  VentureBeat 在报道中提到,企业下一阶段评估模型时,可能会越来越少地围绕单一跑分或 API 标价,而是同时核对任务完成率、Token 消耗、缓存复用率、响应延迟和人工返工。

  OpenAI 已明确,Sol 和 Luna 的新价格不是限时促销。开发者因此可以直接用这组价格重新设计生产环境里的模型分配,再把同一批真实任务分别交给 Astra、Sol、Luna 和竞争模型,核对谁一次完成得更多、谁的缓存复用率更高,以及谁让人少改几次。