
新智元报道
太疯狂了,短短两天,竟然冒出了 4 个新模型!
前脚,老马的 xAI 才刚发完 Grok 4.7。
紧接着,OpenAI 突然甩出 GPT-6 Sol 和 Luna,价格直接腰斩。同一天,Anthropic 也把 Claude Opus 5.5 拍在了桌上,比上一代硬生生便宜 40%。
9 月 22 日,一张动图在X上被转疯,浏览量狂飙近百万。

2023 年,大模型 73 天一更,到了 2026 年,18 天一更。
从 ChatGPT 上线算起,OpenAI 和 Anthropic 已经狂轰滥炸了 42 个重磅模型(算上当天发的 GPT-6 Sol 和 Luna 是 44 个)。
几小时后,Stability AI 创始人 Emad Mostaque 转发了这张图,还加了一句预言。
「就像 Alex 说的,照这个速度,明年年初就是每天一个。」

两大巨头,卷出「半月一更」
其实,「18 天一更」这个数还算保守,因为它只算了 OpenAI 和 Anthropic 两家。
今年初到 9 月 22 日,Anthropic 发了 8 个旗舰模型,OpenAI 发了 6 个,14 个模型摊进 265 天,平均 19 天一个。
同一时间段里,国内十家主要大模型厂商又发了至少 28 个旗舰,平均 9 天多一个。
有几回还是扎堆发的,春节前一周,4 家接连甩出新旗舰;4 月 20 日到 24 日,5 天里又是 4 家轮番上阵。
两边加在一起,平均 6 天多就冒出一个新旗舰,离 Emad 说的「一天一个」已经不算远了。

Anthropic 的提速肉眼可见。
上半年它平均 46 天发一个模型,下半年压到了 26 天。Opus 4.8 是 5 月 28 日,Opus 5 是 7 月 24 日,Opus 5.5 是 9 月 22 日。
OpenAI 走的则是「憋大招,然后一套带走」的路线。
9 月 3 日 GPT-6 Astra 刚把全网炸翻,才隔了 19 天,Sol 和 Luna 就跟着下场。
下周还有 DevDay 大会,Altman 感慨,这是他记忆里 OpenAI 头一回在备战发布会时喊出「要发的东西太多了」。

发布为什么越来越密,Anthropic 在一份报告里给出了答案,AI 已经在帮着造下一代 AI。
今年 2 月,Claude 能独立主导的 AI 研发工作还不到1%,之后几乎一个月上一个台阶,5 月 12%,7 月 22%,到了 8 月已经达到了 26%。

OpenAI 那边,截至 8 月中旬,AI 智能体投入的工作日,已经是人类研究员的 3.1 倍(按每天 8 小时折算)。
在 Anthropic,造模型的活,四分之一已经交给了 Claude 自己。下一个模型,只会一个接一个地来。
排队的已经堵到了门口。Anthropic 的 Mike Krieger 放话,Sonnet 5.5 和 Haiku 5.5 未来几周就到。

谷歌的 Gemini 4 早在 7 月就开始了「迄今最有野心的一次预训练」,外界普遍押在年底前后亮相。国内也至少有两家官宣了下一代旗舰,只差一个发布日期。
辛辛苦苦攒的「玄学」
两个月直接报废
大模型跑得越快,在下游写代码的人就越狼狈。
你 7 月底熬了几个通宵,刚把应用迁到 Opus 5,参数一项项调得如丝般顺滑。两个月后 Opus 5.5 横空出世,你满心欢喜地一换接口——咔,一部分请求直接报错。
把这两家最近的官方提示词指南翻一遍,会发现他们在传达同一个事实,你给上一代模型写的那些祖传 Prompt,很多都成了废纸。
头一件事是做减法。
OpenAI 在 Astra 指南里明说,以前太细的流程指令,现在反而会拖后腿,「改代码前先通读文档」「切记跑测试」这种话,统统可以删掉。

Anthropic 的指南也是这个意思。
以前的提示词里常要加一句「做完检查一遍」,可 Opus 5 已经会自己检查,这句不删,它反而会过度检查。
到了 Opus 5.5,聊天场景里「回答前仔细想想」这种 PUA 话术也建议删掉,删了之后回复快了,质量也没有明显下降。
删完旧的,还得补新的,因为每一代都有新脾气。
Opus 5.5 在多轮对话里老爱回头琢磨已经答完的问题,白白浪费算力,官方给了一句补丁,「已经答过的,就当过去了。」

参数和默认值也在悄悄变。
在 Opus 5.5 上,关掉思考模式的写法直接报错 400;不写 effort 参数,默认档位从 high 降到了 medium,成本和效果跟着洗牌。
对此,官方的建议是重新跑一遍 effort 测试,别把 Opus 5 的老设置直接搬过来。
一套提示词加一套参数,每一代都得扒层皮。调没调过,账单能差出一大截。
Anthropic 的 Lance Martin 在视频里演示过,一份给 Opus 4.8 写的老提示词,每张工单成本 2.45 美分,直接换上 Opus 5.5 是 2.02 美分;再用官方工具洗一遍,准确率拉到 92.0%,成本压到了 1.83 美分。

除了这些,模型本身的寿命也在缩短。
今年 OpenAI 已经发了 9 次弃用公告,涉及 40 多个模型和功能。
其中,4 月 23 日刚发的 GPT-5.5,10 月 14 日就要从 ChatGPT 和 Codex 下架,活了不到半年。
甚至,就连 OpenAI 自家的 Evals 评测平台,也要在 11 月底关门。

刷榜?一套新考题,半年就被锤穿了
人跟不上就算了,现在连「考卷」都不够用了。
今年 3 月,号称专治 AI、考智商不考背题的 ARC-AGI-3 上线。当时排第一的 Gemini 3.1 Pro 只拿了 0.37%,人类是 100%。
9 月 3 日,GPT-6 Astra 杀进考场,标准测试拿下 62.7%,换上特定框架直接到了 99.9%。在 96% 的关卡里,它用的步数比人类还少。

一套新考题,半年就被打穿,ARC 官方已经开始琢磨下一代评测该怎么出。
写代码榜单(Next.js)上,Sol、Opus 5.5 和 Fable 5.1 全是 97%,并列第一;写作榜单上,Opus 5.5 断层领先第二名 307 分。
这一分数是榜单有史以来最大的一次单次跳跃,博主看完直呼离谱,差点以为是自己的基准出了 bug!

新模型每来一个,开发者就得像西西弗斯一样,把测试流程从头再推一遍。
照现在这个节奏,明年要是真到了「一天一更」的地步,你今天调好的提示词、配好的 Agent 链路,寿命可能都撑不过一个星期。
模型换代的速度,第一次彻底超过了人类适应它的速度。
如今跑得最慢的,竟然是使用 AI 的人。
参考资料:
https://x.com/EMostaque/status/2102614902393241950?s=20
编辑:摩西
