刚刚,OpenAI新Transformer火了!Astra架构首次曝光
家人们,听说了么?
OpenAI下一代Astra采用了一种「循环深度」(recurrent depth)全新推理方法。
思考Token大幅减少,性能反而直线拉爆!

怪不得灰测的Astra实力那么强,原来OpenAI手握了一张真正的技术王牌。
但是代价是,Astra的思考过程完全「隐身」了。就连OpenAI自己都难以看清AI大脑,监控更是「南上加南」。
消息一爆出来,全网都陷入了恐慌。

OpenAI首席科学家Jakub Pachocki,第一时间做出了回应——
内部目前最前沿的模型(包括Astra),它的计算图深度顶多也就GPT-4的两倍,没外界传的那么玄乎。

几乎同一时间,有大V爆料称,gpt-6-astra的名字已在OpenAI API上现身了。
看这架势,GPT-6预计明天就会上线。

它背后的新架构,究竟是什么来头?
「循环Transformer」,火遍全网
「循环深度」还有另外一个名字,叫「循环Transformer」(Looped Transformer)。
实际上,这一概念并不是由OpenAI首次提出。
在此之前,整个业界都在「循环Transformer」上做过不少研究。

要看懂Astra变在哪,得先看传统大模型是怎么干活的。
传统的Transformer像一栋只能走一遍的高楼,数据从第一层一路爬到最后一层,做完固定次数的运算,吐出下一个Token。
你想让它推理得更深?那就只能把楼盖得更高、参数堆得更大。代价就是极其高昂的算力和显存开销。

循环Transformer换了个极其暴力的思路:让它转起来。
信息不再是单向穿过网络一次,而是把同一组Transformer层反复循环使用。
第一圈算出的隐藏状态(Hidden States),直接送回起点继续加工,转上好几轮,最后才吐出结果。

它就像一段盘旋向上的楼梯——还是那几级台阶,但只要多绕几圈,照样能到达顶层。
这条路,学界早就走通了。
谷歌在2025年发表的一篇论文Reasoning with Latent Thoughts,给出了一个非常直观的结果——
一个包含k层、循环L次的Transformer,在不少推理任务上,可以接近拥有k×L层的普通模型。
参数量没有同步扩大,有效计算深度却被拉长了。

今年2月,一篇关于「潜在推理」(latent reasoning)的论文,也完美展示了这种架构的杀伤力。
研究人员拿一个35亿参数的小模型,中间的核心块反复循环跑。当转的圈数足够多时,这个3.5B的小身板,竟然打出了相当于500亿大模型的成绩。
这相当于,给「测试时算力」开了一个超频开关。
不加参数,不占额外显存,光靠在原有的权重里多跑几圈(拿时间换空间),能力就能越级狂飙。
对于刚被Anthropic在营收上反超、急需一个断层式大跃进的OpenAI来说,这种技术的诱惑力,根本无法拒绝。
思考是怎么「隐身」的
在此前爆火的「AI 2027」一文中,曾将这一方向称之为「神经语循环」。
Astra仍会通过语言来思考问题,但那些言语之间的更多思考,现在可能是无声的。

Astra的进化直接打破了AI 2027的预言
「循环深度」的危险就在于,它把思考逼进了盲区。
在此之前,业界必须接受一个反直觉的现实:对于现在的推理模型来说,CoT是模型真正用来打草稿的工作记忆。
过去,模型想得再深,也必须从「输出下一个Token」这个狭窄的漏斗里挤出来。
正是这一挤,把抽象的计算逼成了人类能读懂的文字。这也是过去两年,人们唯一能「看透」AI脑子里在想什么的底气。
但另一方面,「循环深度」拓宽了内部的计算管道。
固定层数的模型,每吐一个Token前能做的串行推理是有限的。
而现在,模型在中间的循环块里转了r圈,每个Token背后就塞进了r倍的串行计算。原本必须挤在字面上的长链条推理,现在能在向量世界里默默转完,全程不吐一个字。
省下的Token,恰好省在了那些没写出来的思考上。更麻烦的是,它在潜空间里「想」的,未必是人话。

正如Meta早前在「连续思维链」(Coconut)研究中指出的:
模型用数字、用向量去推理,可能比被逼着用人类语言更准、更省。
这背后的逻辑很简单,大模型理解概念的方式,本来就是数学向量,强迫它每一步都翻译成人话,只会损失信息。

Coconut和CoT对比
这项技术的杀伤力在于,可以让一个小体积的模型,发挥出超大模型的实力,成本骤降,还能省下内存、带宽。
不过,它在省下了算力成本的同时,也彻底关上了人类的视线。
Astra真正王牌,就是新Transformer
对于数学和编程来说,「循环Transformer」架构极有吸引力。
许多真实任务本就依赖「多次迭代」:先提出方案,再检查错误,更新中间状态,继续求解。
「循环Transformer」,天然适合执行这种算法。

它也给模型带来了一种全新的「推理时Scaling」方式。
过去,让模型多想一会儿,通常意味着让它生成更多思维链Token。
现在,一部分计算可以在输出Token之前完成。模型表面上可能只停顿片刻,内部状态却已经迭代了很多轮。
Astra的实力大家是有目共睹,虽还未正式发布,一些demo验证了其在前端领域的统治力。

而且,在计算机使用方面,奥特曼也承认,Astra实力直接媲美人类水平。
正是基于这一架构的创新,Astra还打通了「持续性智能体」,只要不喊停能连轴转数周。
如今全网都在屏息以待,Astra/GPT-6总算要来了。
OpenAI多位研究员,包括「赛博义父」也在疯狂暗示强大的Astra。


今晚,就坐等GPT-6的发布了。
参考资料:
https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns?rc=epv9gi
编辑:桃子 摩西
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!
AI 中文社