
新智元报道
家人们,听说了么?
OpenAI 下一代 Astra 采用了一种「循环深度」(recurrent depth)全新推理方法。
思考 Token 大幅减少,性能反而直线拉爆!

怪不得灰测的 Astra 实力那么强,原来 OpenAI 手握了一张真正的技术王牌。
但是代价是,Astra 的思考过程完全「隐身」了。就连 OpenAI 自己都难以看清 AI 大脑,监控更是「南上加南」。
消息一爆出来,全网都陷入了恐慌。

OpenAI 首席科学家 Jakub Pachocki,第一时间做出了回应——内部目前最前沿的模型(包括 Astra),它的计算图深度顶多也就 GPT-4 的两倍,没外界传的那么玄乎。

几乎同一时间,有大V爆料称,gpt-6-astra 的名字已在 OpenAI API 上现身了。
看这架势,GPT-6 预计明天就会上线。

它背后的新架构,究竟是什么来头?
「循环 Transformer」,火遍全网
「循环深度」还有另外一个名字,叫「循环 Transformer」(Looped Transformer)。
实际上,这一概念并不是由 OpenAI 首次提出。
在此之前,整个业界都在「循环 Transformer」上做过不少研究。

要看懂 Astra 变在哪,得先看传统大模型是怎么干活的。
传统的 Transformer 像一栋只能走一遍的高楼,数据从第一层一路爬到最后一层,做完固定次数的运算,吐出下一个 Token。
你想让它推理得更深?那就只能把楼盖得更高、参数堆得更大。代价就是极其高昂的算力和显存开销。

循环 Transformer 换了个极其暴力的思路:让它转起来。
信息不再是单向穿过网络一次,而是把同一组 Transformer 层反复循环使用。
第一圈算出的隐藏状态(Hidden States),直接送回起点继续加工,转上好几轮,最后才吐出结果。

它就像一段盘旋向上的楼梯——还是那几级台阶,但只要多绕几圈,照样能到达顶层。
这条路,学界早就走通了。
谷歌在 2025 年发表的一篇论文 Reasoning with Latent Thoughts,给出了一个非常直观的结果——
一个包含k层、循环L次的 Transformer,在不少推理任务上,可以接近拥有k×L层的普通模型。
参数量没有同步扩大,有效计算深度却被拉长了。

今年 2 月,一篇关于「潜在推理」(latent reasoning)的论文,也完美展示了这种架构的杀伤力。
研究人员拿一个 35 亿参数的小模型,中间的核心块反复循环跑。当转的圈数足够多时,这个 3.5B 的小身板,竟然打出了相当于 500 亿大模型的成绩。
这相当于,给「测试时算力」开了一个超频开关。
不加参数,不占额外显存,光靠在原有的权重里多跑几圈(拿时间换空间),能力就能越级狂飙。
对于刚被 Anthropic 在营收上反超、急需一个断层式大跃进的 OpenAI 来说,这种技术的诱惑力,根本无法拒绝。
思考是怎么「隐身」的
在此前爆火的「AI 2027」一文中,曾将这一方向称之为「神经语循环」。
Astra 仍会通过语言来思考问题,但那些言语之间的更多思考,现在可能是无声的。

Astra 的进化直接打破了 AI 2027 的预言
「循环深度」的危险就在于,它把思考逼进了盲区。
在此之前,业界必须接受一个反直觉的现实:对于现在的推理模型来说,CoT 是模型真正用来打草稿的工作记忆。
过去,模型想得再深,也必须从「输出下一个 Token」这个狭窄的漏斗里挤出来。
正是这一挤,把抽象的计算逼成了人类能读懂的文字。这也是过去两年,人们唯一能「看透」AI 脑子里在想什么的底气。
但另一方面,「循环深度」拓宽了内部的计算管道。
固定层数的模型,每吐一个 Token 前能做的串行推理是有限的。
而现在,模型在中间的循环块里转了r圈,每个 Token 背后就塞进了r倍的串行计算。原本必须挤在字面上的长链条推理,现在能在向量世界里默默转完,全程不吐一个字。
省下的 Token,恰好省在了那些没写出来的思考上。更麻烦的是,它在潜空间里「想」的,未必是人话。

正如 Meta 早前在「连续思维链」(Coconut)研究中指出的:
模型用数字、用向量去推理,可能比被逼着用人类语言更准、更省。
这背后的逻辑很简单,大模型理解概念的方式,本来就是数学向量,强迫它每一步都翻译成人话,只会损失信息。

Coconut 和 CoT 对比
这项技术的杀伤力在于,可以让一个小体积的模型,发挥出超大模型的实力,成本骤降,还能省下内存、带宽。
不过,它在省下了算力成本的同时,也彻底关上了人类的视线。
Astra 真正王牌,就是新 Transformer
对于数学和编程来说,「循环 Transformer」架构极有吸引力。
许多真实任务本就依赖「多次迭代」:先提出方案,再检查错误,更新中间状态,继续求解。
「循环 Transformer」,天然适合执行这种算法。

它也给模型带来了一种全新的「推理时 Scaling」方式。
过去,让模型多想一会儿,通常意味着让它生成更多思维链 Token。
现在,一部分计算可以在输出 Token 之前完成。模型表面上可能只停顿片刻,内部状态却已经迭代了很多轮。
Astra 的实力大家是有目共睹,虽还未正式发布,一些 demo 验证了其在前端领域的统治力。

而且,在计算机使用方面,奥特曼也承认,Astra 实力直接媲美人类水平。
正是基于这一架构的创新,Astra 还打通了「持续性智能体」,只要不喊停能连轴转数周。
如今全网都在屏息以待,Astra/GPT-6 总算要来了。
OpenAI 多位研究员,包括「赛博义父」也在疯狂暗示强大的 Astra。


今晚,就坐等 GPT-6 的发布了。
参考资料:
编辑:桃子摩西
