梦晨发自凹非寺
量子位 | 公众号 QbitAI
GPT-6 Sol、Luna 深夜上线,API 价格直接砍半!

Astra改进的训练方法这两款也都用上了,所以也继承了 Astra 在计算机使用等方面的提升。
那还有啥好说的,等于5. 6 系列直接被斩杀了呗。

现在系列里 Astra 负责当以前的 Sol,Sol 负责当以前的Terra,Luna 还是以前的 Luna。
Terra 生态位直接被挤没了。
与 5.6 系列相比,6 系列的 API 定价直接砍50%,其中 Luna 的输出砍得比50%还多一点。
而且 Luna 的输入价格比DeepSeek-V4.1 Flash的梁文谷价格($0.15)还便宜一点了,就是不知道缓存命中率有没有的比。

为啥升级还便宜了?
OpenAI 称这得益于缓存和推理环节的效率提升,省下来的成本直接让利给用户和开发者。

这不得尊奥特曼一声奥特之王(限时 24 小时)。

用一成价格,盯着 Fable 打
整个发布公告看下来,我先学会一招,用 GPT-6 Sol 最好别开 Max。
这回好多跑分 Max 都神秘的比 xHigh 掉分了,OpenAI 也没解释原因。
什么你不知道怎么在 Codex 里开 Max?
在设置里可以选,默认是没选的,这下知道为什么没选了。

按照 AutomationBench 这个榜,GPT-6 Sol 的 high 和 xhigh 两个档位已经摸到了 Astra 的 light 和 medium 的水平。

AutomationBench 测的是 AI 在销售、营销、运营、客服、财务和人力资源六大领域47 个工具上执行端到端业务流程的能力。
作为对比,Claude Opus 5在 max effort 下得分和 GPT-6 Sol 的 medium 差不多,但单任务成本是 Sol 的11. 1 倍。
Claude Fable 5.1,成本是 Sol 的8. 9 倍以上,而且这还没算上约40%任务触发 Opus 5 回退产生的额外开销。

为测试 GPT-6 Sol 的计算机使用能力,我让它在图表中把隔壁新发的Opus5.5成绩也画上去。
Opus5.5的 Max 档达到了GPT-6 Astra水平,价格也达到了 Astra 水平。

换 Agents' Last Exam,这次转考长周期任务,覆盖55 个子行业。
GPT-6 Sol 在 max effort 下得分56. 4%,超过 Claude Opus 5 在该测试中的最高分,成本还低了60%。

编程是这次重点展示的方向。
OpenAI 透露了一组内部数据:公司内部的 Coding Agent 使用量呈指数级增长,按 API 价格折算,中位数研究员每天的 token 消耗已超过600 美元,90 分位的研究员超过7000 美元。
随着编程 agent 承担的任务越来越长、越来越复杂,持续使用的成本变得更加关键,这正是 Sol 和 Luna 要解决的问题。
在 DeepSWE v1.1(测试 AI 在真实代码库中解决复杂软件工程任务)上,GPT-6 Sol 其实并没有比5. 6 Sol更好,但确实便宜不少。
GPT-6 Luna在 max effort 下得分66. 6%,与 Claude Opus 5 和Fable 5在 medium effort 下水平相当,成本分别低了93%和96%。

在 Cognition 推出的 FrontierCode(评估 AI 编写的代码是否达到可合并进真实代码库的标准)上,GPT-6 Sol 相比GPT-5.6 Sol同样有明显提升,能以更低成本匹配 Claude Fable 5.1 xhigh 的表现。
这个榜 6 Sol 的 Ultra 终于不掉分了,但是隔壁 Claude 的档位又乱了起来。

计算机操作,这块还是 Astra 比较权威。
GPT-6 Sol 也仅仅是比 5.6 Sol 便宜了,high 档位以上水平其实没超过 5.6 多少。
GPT-6 Luna 在 max effort 下超过了 GPT-5.6 Sol 在 medium effort 下的表现,成本仅为后者的十分之一。

事实准确性方面,OpenAI 用一组从真实ChatGPT对话中提取的、用户曾标记过事实错误的案例进行了测试。
结果是 GPT-6 Sol 的错误率大约是上一代的一半,接近 Astra 的水平。GPT-6 Luna 在较高 effort 下能匹配 GPT-5.6 Sol 的准确度,而成本只有百分之一。

缓存命中率提升,重置马上来
模型能力之外,OpenAI 对 GPT-6 的基础设施也做了几项改进。
首先是提示词缓存。
改进后的缓存机制默认提供更高的命中率,缓存命中的输入 token 可享受90%的价格折扣。
OpenAI 还上线了缓存监控面板和诊断工具,开发者可以查看缓存使用情况、定位未命中的原因并针对性优化。
还有这样一个实用的改动:调整推理 effort 级别或开关工具时,不再会打断之前的缓存上下文。
GitHub 已经在用这套方案。据 OpenAI 披露,过去几个月里这些优化让 GitHub Copilot 需要重新处理的提示 token 比例下降了超过50%,涉及数十亿次请求。
终于能在任务的不同任务灵活切换配置了。
之前看已经有人做出来,搭配Jev可以在任务中途毫秒级切换。

然后是对话风格。
OpenAI 把 Astra 上改进过的沟通方式带到了 Sol 和 Luna 上,在技术和编程对话中感知会尤为明显,表现为更清晰、更少术语、更少无效细节、回复整体更简短但不丢失关键信息。
OpenAI 在博客中展示了同一个网页开发任务下 GPT-5.6 Sol 和 GPT-6 Sol 的对比回复。
5. 6 会主动复述用户已知的信息并使用含糊措辞,6 则更直接,会说明自己检查了什么、没检查什么。

对齐方面,Sol 和 Luna 在测试中优于 GPT-5.6 同级模型,包括在编程任务中做出误导性声明的比率更低。OpenAI 强调,这些对齐测试专门挑选了容易诱发不诚实行为的场景,正常使用中出现此类问题的概率远低于测试数据。
最后,关于额度重置。
总之是周二,具体时间未定,醒来的朋友们可以开蹬了。

参考链接:
[1]https://openai.com/index/introducing-gpt-6-sol-and-luna/#alignment-reviewer-bypass
[2]https://x.com/miu21590/status/2101857866378362926?s=20
