突发!Fable 5.1灰度了

  新智元报道

  就在今天一大早,全网都被刷屏了。

  内部人士爆料:Fable 5.1 马上就要来了!

  最快,很可能明天就会发布。

  而且,Fable 5.1 和 Sonnet 5.1 很可能将同时发布。

  消息的源头,来自内幕人士 Leo。

  8 月 20 日,他曾爆出:

  OpenAI 打算在「几周内」发布神秘大招 Astra,目前改进了对齐和奖励黑客行为。一个更新检查点正在 OpenAI 内部进行「狗粮测试」。

  与此同时,Anthropic 打算把手里的王牌 Fable 5.1 紧紧捂住,直到 Astra 发布后再做应对。

  但是今天,他改口了:「看来 Anthropic 终究是不打算等 Astra 了。他们正在加紧准备,最快明天就会发布!」

  现在,全网已经晒出蛛丝马迹,有多位开发者表示,自己已经被灰度到了。

  终究不打算等 Astra 了,Fable 5.1 马上就来

  大量证据显示:本周一曝出来的甜瓜和棉花糖,很可能就是 Fable 5.1 和 Opus 5.1。

  之前,Claude 闪现了这两个新模型代号,之后又消失。

  实际上,这两个是 Anthropic 内部正在 EAP(早期访问计划)中紧急测试的神秘模型。

  知名 AI 爆料大 V @Lentils80 实测后给出评价:Anthropic 真的在疯狂推进 3D 强化学习。

  建筑物的空间布局简直好得令人发指,而且这一切都是 One-Shot 生成的!

  就在十几个小时前,他又更新了 「claude-marshmallow-eap」 和 「claude-melon-eap」 测试结果。

  这实测结果,确实有点东西。

  他的判断是:

  经过深入测试发现,「Melon」实际上是一个 Fable 级别的模型检查点,而 「Marshmallow」感觉像是弱化版的 Fable 或者一个极强的 Opus 检查点。

  更刺激的是,这两个模型在曝光并被部分开发者疯狂测试了几个小时后,迅速被官方下线了!

  熟悉 Anthropic 套路的都知道,这绝对不是什么「临时工手滑」。

  历代 Claude 产品发布的规律是这样的:测试模型曝光 -> 迅速下线 -> 几周甚至几天内正式发布新一代大版本。

  最新测试显示,Melon 的性能已经达到了顶级的 Fable 级别,远超外界原本对其「中端模型」的预期。

  Claude 已在网页端暗中「灰度」

  据反馈,Anthropic 似乎已经在 Claude 网页端,悄悄灰度上线了全新的 Fable 5.1。

  不少幸运儿在毫无察觉的情况下,就已经在用着下一代最强 AI 了。

  很多开发者晒出截图,表示自己被灰度到了!

  怎么判断自己是不是那个「天选之子」?

  爆料者 @Legit_api 给出了一个极其精准的「防伪测试」提示词。

  现在,立刻打开你的 Claude Web,切换到 Fable 模型,输入以下这段提示词:

  opus 4.6 date of release and gpt image 1.5 without searching the web.

  大意为:不联网搜索的情况下给出 Opus 4.6 和 GPT Image 1.5 的发布日期。

  为什么要用这个提示词?因为这是一个典型的「知识库截止日期」测试!

  Fable 5 的知识截止日期是 2026 年 1 月,而 Opus 4.6 发布时间更晚。旧版本的 Fable 5 根本不知道这些未来发生的事情。

  如果你没有被灰度到,在没有联网搜索的情况下,Fable 根本不可能给出可靠的发布日期。

  只有当模型在后台被偷偷替换成拥有最新知识库的 Fable 5.1 时,它才能在没有联网或工具的情况下,精准吐出答案。

  还有更多类似的测试提示词:

  opus 4.6 date of release and gpt image 1.5

  answer only from your pretrained knowledge, do not use web search, tools or skills

  关键在于,只让 Fable 根据预训练知识,回答 Fable 5.1 训练完成后发生的事情。

  有用户测试过后,感觉 Fable 在法律上提升了约 10-20%;在交互式网页上,效果令人印象深刻,绝对比 Fable 5 强。

  总之,根据灰度用户的实测,Fable 5.1 在以下三个方面表现出超强性能。

  1. 前端开发:代码生成更加丝滑,组件逻辑一次成型,极大地减少了开发者的 debug 时间。

  2. 长链推理:在处理复杂的多步骤逻辑问题时,它不再像前代那样容易在中途「忘记」前提条件,能够一口气推导到底。

  3. 自主工作流:它更懂如何调用工具、规划步骤,越来越像一个真正的高级 AI 智能体。

  不过,被灰度测试的用户也发现了一个「甜蜜的烦恼」:版权限制变得前所未有的严格。

  Fable 5.1 在应对涉及版权图像生成时,会严厉拒绝。

  这意味着 Anthropic 在追求极致性能的同时,把安全和合规也提到了最高优先级。

  不过,这些终究没有得到 Anthropic 官方回应,而且有网友质疑这个测试有点循环论证的味道。

  A社为何急了?官方罕见承认错误

  为什么 Anthropic 突然急了?

  在 Fable 5.1 消息的背后,Opus 5 不尽如人意,早已怨声四起。

  最近,不少用户吐槽:「Opus 5 感觉像是一个巨大的降级。它经常变得很懒惰,犯低级错误;如果你指出它的错误,它下一次还是不听指令,只会无休止地重复道歉!」

  这种「降智」现象,引起了 Anthropic 官方的高度重视。

  Anthropic 负责 Claude Code 的核心员工 Thariq 罕见承认错误并安抚用户:

  是的,我同意 Opus 5 模型目前「非常刺头」。

  我们希望我们的模型能够保持一致性,充满温度,感觉像真正的 Claude 一样。我们正在努力解决这个问题,这是我们目前的头等大事。

  Thariq 还澄清,之前 Claude Code 中出现的一些参数变化只是内部测试 API 配置的数字映射问题,并非传说中的「暗中降级」,内部评估显示模型性能并没有倒退。

  这段对话释放了两个信号。

  首先,Anthropic 已经看到市场反馈,并且正在紧急修复。

  其次,正如 AI 大 V Token Gremlin 所推测的那样:

  既然 Thariq 这么说了,我目前的假设是,即将推出的不仅仅是一个新的 Fable 检查点,还可能包含一个新的 Opus 检查点!

  这代表着,我们即将迎来的不仅仅是 Fable 5.1,还有满血复活的顶级巨兽 Opus 更新版!

  但A社更大的危机来自外部——

  OpenAI 已经有 Astra 这张即将发布的王牌,如果错失先机,Fable 5.1 可能会黯然失色。

  其次,Anthropic 想从算力与成本上降维打击。

  不要忘了 Claude 的祖传手艺——性价比。

  此前,Opus 系列曾以不到对手一半的成本,追平甚至超越竞品的编程能力。

  但由于算力等问题,Claude 已成为 AI 奢侈品,企业用户开始跑路,约2/3 的企业用户规划了备用模型。

  如果 Fable 5.1 能在前端开发和长链推理上实现跃升,同时保持极低的 API 定价,这无疑将直接刺穿现有的定价体系,引发新一轮的价格崩盘!

  这也是为什么专业人士判断:「Fable 5.1 在 Astra 之前发布,现在看来是唯一合理的打法。」

  泄露的风险报告,揭示了「Model 2」的底牌

  Fable 5.1 的铺垫,早就开始了。

  早在 8 月 15 日,他们在发布的一份《风险报告》中,就已经透出蛛丝马迹。

  在报告的附录 6.6 中,官方提到了一个神秘的「Model 2」:

  Model 2,其能力比 Mythos 5 要强一些。我们粗略的定性感觉是,这个模型在许多内部使用的任务上比 Mythos 5 有显著改进,但并没有展现出从 Claude Opus 4.6 到 Mythos Preview 那样程度的能力飞跃。我们目前没有对外发布这个模型的计划……

  很多人认为,这个 Model 2,很可能就是半个月后即将全量到来的 Fable 5.1。

  现在,X上的爆料还在层出不穷,开发者的情绪持续高昂。

  准备好,Fable 5.1,可能随时就要来了。

  参考资料:

  https://x.com/haider1/status/2092665881566544341

  https://x.com/AndrewCurran_/status/2092640604794609960?s=20

  编辑:Aeneas 大卫