
新智元报道
战况好激烈的一晚!
就在刚刚,GPT-6 Sol 和 Luna 也发布了!
而就在几小时前,Opus 5.5 前脚才刚发。

这次,GPT-6 全家桶同时端上来 GPT-6 Sol 与 GPT-6 Luna。

如果说 Astra 体现了 AI 智力的巅峰,那 Sol 和 Luna 则是 OpenAI 亲手打造的、应用于千行百业的工业级放大器。
它们完美继承了 Astra 在专业推理、代码编写与人类对齐上的前沿性能,代表着两个方向的实用场景。
Sol 是「超级大脑」,用于破解极度复杂的代码逻辑与超长线的智能体工作流;
Luna 是「效率狂魔」,速度快,资源占用极低,针对一切专注型、高频吞吐的日常任务。
不仅如此,它们在 API 定价上,相比上一代直接腰斩 50%!从此,百万级 Token 的消耗不再让人心惊肉跳。


奥特曼表示,GPT-6 Sol 和 Luna 两款模型按任务定价衡量,在市场上没有竞争对手
正如 OpenAI 所言:「用 Sol 构建,用 Luna 扩展,向着生产环境与更广阔的未来进发。」

站在巨人 Astra 的肩膀上
这次,Sol 和 Luna 是用与 GPT-6 Astra 相似的训练方法打造的,它们汲取了 Astra 在专业工作、事实准确性、代码编写、计算机视觉操作以及人类对齐上的最先进成果。
GPT-6 Sol:复杂工作流的「超级大脑」
Sol 的定位是处理极其困难、需要深度思考和逻辑推理的任务。
它专门为复杂的代码重构、长逻辑链的商业决策、以及需要多步规划的 Agent 工作流而设计。
总之,适用于那种「难啃的硬骨头」。
GPT-6 Luna:专注、神速的「效率狂魔」
Luna 则是为了高吞吐量、极其专注的任务而生。
比如瞬间从几百页的 PDF 中提取特定的发票数据,或者实时翻译海量的用户聊天记录。
Luna 速度极快,成本低到几乎可以忽略不计,专为企业级批量处理任务而打造。
API 价格直接「腰斩」
此前的 GPT-6 Astra 虽然强大,但我们日常的大部分工作,并不需要这种昂贵的模型。
GPT-6 Sol 和 Luna 的诞生,就是让 Astra 的前沿智能,通过极致的成本控制,让普通人可以日常使用。
得益于在缓存和推理底座架构上的巨大改进,OpenAI 成功把成本打下来了!而且,没有中间商赚差价。
相比于 GPT-5.6 的促销价,GPT-6 Sol 和 Luna 的 API 价格整整降低了 50%!

对于每 100 万 Token,价格如下。
GPT-6 Sol(对标复杂推理)
输入价格:从 4 美元降至 2 美元!
输出价格:从 20 美元降至 10 美元!
GPT-6 Luna(对标高频吞吐)
输入价格:从 0.20 美元降至 0.10 美元!
输出价格:从 1.20 美元降至 0.50 美元!
现在,用白菜价,就可以买到顶级「赛博打工人」了,额度更高,成本更低!

Tibo 特意强调,这次是永久降价,原来的限时价再打对折
跑分把 Claude 按在地上摩擦
官方博客里的跑分,几乎每一项都拿 Claude 做对照,而且每张图的横轴都是每任务成本。
OpenAI 强调的,是「同样的分花多少钱」。

Artificial Analysis 评价: GPT-6 Sol 和 Luna 将成本效率前沿推向了新高度
首先,是真实工作环境。
在AutomationBench(商业工作流跨应用测试)中,GPT-6 Sol(xhigh 级别)拿到 33.2%,每任务成本 0.27 美元,直接超越 Fable 5.1(max 级别),每项任务的报告成本降低了惊人的 88%!
Claude Opus 5 的最高分是 26.9%,成本是 Sol 的 11.1 倍。

OpenAI 特别指出,Fable 5.1 拿了 31.4%,但有约 40% 的任务转给了 Opus 5 兜底,这部分成本没有算,所以被低估了。

在Agents' Last Exam(智能体终极考试)中,考的是 55 个细分行业里的长链条专业任务。
Sol 在最高强度下拿到 56.4%,高于 Opus 5 的最好成绩,每任务成本低 60%。

在事实准确性上,Sol 犯的事实错误比上一代少了一半左右,接近 Astra。
Luna 在高强度档追平了 GPT-5.6 Sol,成本大约是后者的百分之一。

然后,重点就在编程场景。
FrontierCode中,GPT-6 Sol 相比前代实现了巨大飞跃。它追平了 Fable 5.1 的最高档,成本却低得多。
不仅仅是写对代码,还包括了代码风格、测试质量和对现有代码库的遵循度。

在DeepSWE中,考的是真实代码库里的复杂软件工程任务。
Sol 的 max 级别得分高达 68.8%!Fable 5 在这项上的最高分是 69.9%,虽然两者差 1.1 个百分点,Sol 完成每项任务的成本比 Claude 足足低了 80%!
Luna 在 max 级别下得分 66.6%,直接与 Opus 5 和 Fable 5(中等强度度)打平,但成本却狂降 93% 和 96%。

接下来,是电脑操作。
在 OSWorld 2.0 离线测试中,GPT-6 Sol 用仅仅 20% 的成本,就打平了 Claude Opus 5。
而 Luna 更是用十分之一的成本,直接超越了前代的 GPT-5.6 Sol!

在人类对齐上,OpenAI 专门测了模型会不会在编程时撒谎。
在「欺骗性代码测试」(故意引诱 AI 说谎的测试)中,GPT-5.6 Sol 的欺骗率是 10.4%,GPT-6 Sol 降到 1.3%、

另外,他们还测了搜索工具坏掉时,模型会不会瞒着用户硬编。
GPT-5.6 Sol 有 77.5% 的情况选择不说,GPT-6 Sol 降到 4.9%,Luna 从 78.3% 降到 28.7%。

底层细节大优化:告别 AI 味,缓存输入 Token 打一折
OpenAI 特意透露,这次他们在底层细节上做了不少优化。
首先,是两个模型告别了 AI 味和爹味说教。
GPT-6 Sol 和 Luna 极其清晰,没有废话;拒绝生僻专业术语和奇怪的句式;回答更短,但干货满满。
比如,当被问及网站结构时,GPT-6 Sol 不会啰嗦,而是直奔主题,用词精准,不含糊其辞。

之所以生成速度更快,Token 更少,就是因为 GPT-6 这次史诗级强化的 Prompt 缓存技术。
在过去,AI 每次都会把所有前置上下文重新阅读一遍,而在 GPT-6 中,缓存命中率大幅提高。
更疯狂的是:命中的缓存输入 Token,直接打 1 折!
现在,开发者有超高控制权。
可以随时调整模型的「推理力度」,遇到难题调高,遇到简单问题调低,这个过程不会打断缓存!
可以随时开启或关闭工具,依然不会打断缓存!
甚至可以手动设置「断点」,精确控制缓存的位置。
GitHub 报告称:对数十亿次 API 请求的监控中,需要重新处理的提示词 token 占比暴降 50% 以上。
首轮实测来了
GPT-6 硬刚 Opus 5.5
既然同一天撞上了 Opus 5.5,这届看热闹不嫌事大的网友,怎么可能放过「世纪神仙打架」。
第一波实测,已经新鲜出炉了!
Bridgebench 上手,邀请四大新模型,一同生成一个火箭发射台。
GPT 6 Lun 仅在 65 秒内搭建完毕,成本仅 0.01 美金。其余三个模型的成本和时间如下:
GPT 6 Sol:$0.11,1 分钟;
Grok 4.7:$0.29,11 分钟
Claude Opus 5.5:1.52 美元,12 分钟

GPT 6 Sol 和 Opus 5.5 的另一轮对决,选在 SVG 的战场上。
开发者 Angel 一句话直戳痛点,「常言道,一图胜千言」。

下面这个测试中,明显可以看出两款模型,在场景理解和细节上有明显差异。

还有位开发者 Azazide 整了一个更硬的绝活,把 Opus 5.5 和 GPT-6 Sol 扔去管火星基地。
规则极其残酷,100 名殖民者,生死倒计时 90 秒,全程 0 人类介入。
它们接手的是一个濒临崩溃的火星殖民地——氧气管路泄漏、蓄电池起火、超强沙尘暴压境、电力全面瘫痪,而手里能调动的只有区区 3 台维修漫游车。
两边 AI 都得在毫秒间做「电车难题」。
令人意外的是,它们通过各自的策略,稳稳保住了 100 名殖民者的生命。

一段预告片,做出能玩的「塞尔达」
开发者 Flavio Adamo 提前上手了 Sol,测完第一感受,「模型效率极高,速度和 token 用量都很惊人」。
输入《塞尔达传说:时之笛》一段预告片之后,Sol 直接手搓一个可玩版游戏。

网友 Chetan Ankola 用 GPT-6 解锁的动漫风格的网页生成。

马上体验!GPT-6 全平台解锁
好消息是,两大模型今天就可以用了!
ChatGPT 平台:GPT-6 Sol 和 Luna 将在 ChatGPT Work 中向 Plus、Pro、Business、Enterprise 和 Edu(教育版)用户全量推送!
Codex 平台:两大模型同步上线。免费薅羊毛通道:广大的 Free 和 Go 用户,也可以在桌面端 App 中,抢先体验 GPT-6 Luna。
开发者 API:模型已在 API 后台开放,名称分别为 gpt-6-sol 和 gpt-6-luna。
这一晚,ASI 双雄的对决太过激烈。
开发者们都别睡了,赶快蹬起来!
参考资料:
http://xn--https-uf5io91m//x.com/OpenAI/status/2102460975790137662?s=20
https://x.com/ChatGPT/status/2102462020339613966?s=20
https://openai.com/index/introducing-gpt-6-sol-and-luna/
编辑:Aeneas 摩西桃子
