刚刚,OpenAI新Transformer火了!Astra架构首次曝光

浏览16次 点赞0次 收藏0次

家人们,听说了么?

OpenAI下一代Astra采用了一种「循环深度」(recurrent depth)全新推理方法。

思考Token大幅减少,性能反而直线拉爆!


怪不得灰测的Astra实力那么强,原来OpenAI手握了一张真正的技术王牌。

但是代价是,Astra的思考过程完全「隐身」了。就连OpenAI自己都难以看清AI大脑,监控更是「南上加南」。

消息一爆出来,全网都陷入了恐慌。


OpenAI首席科学家Jakub Pachocki,第一时间做出了回应——

内部目前最前沿的模型(包括Astra),它的计算图深度顶多也就GPT-4的两倍,没外界传的那么玄乎。


几乎同一时间,有大V爆料称,gpt-6-astra的名字已在OpenAI API上现身了。

看这架势,GPT-6预计明天就会上线。


它背后的新架构,究竟是什么来头?

「循环Transformer」,火遍全网

「循环深度」还有另外一个名字,叫「循环Transformer」(Looped Transformer)。

实际上,这一概念并不是由OpenAI首次提出。

在此之前,整个业界都在「循环Transformer」上做过不少研究。


要看懂Astra变在哪,得先看传统大模型是怎么干活的。

传统的Transformer像一栋只能走一遍的高楼,数据从第一层一路爬到最后一层,做完固定次数的运算,吐出下一个Token。

你想让它推理得更深?那就只能把楼盖得更高、参数堆得更大。代价就是极其高昂的算力和显存开销。


循环Transformer换了个极其暴力的思路:让它转起来

信息不再是单向穿过网络一次,而是把同一组Transformer层反复循环使用。

第一圈算出的隐藏状态(Hidden States),直接送回起点继续加工,转上好几轮,最后才吐出结果。


它就像一段盘旋向上的楼梯——还是那几级台阶,但只要多绕几圈,照样能到达顶层。

这条路,学界早就走通了。

谷歌在2025年发表的一篇论文Reasoning with Latent Thoughts,给出了一个非常直观的结果——

一个包含k层、循环L次的Transformer,在不少推理任务上,可以接近拥有k×L层的普通模型。

参数量没有同步扩大,有效计算深度却被拉长了。


今年2月,一篇关于「潜在推理」(latent reasoning)的论文,也完美展示了这种架构的杀伤力。

研究人员拿一个35亿参数的小模型,中间的核心块反复循环跑。当转的圈数足够多时,这个3.5B的小身板,竟然打出了相当于500亿大模型的成绩。

这相当于,给「测试时算力」开了一个超频开关。

不加参数,不占额外显存,光靠在原有的权重里多跑几圈(拿时间换空间),能力就能越级狂飙。

对于刚被Anthropic在营收上反超、急需一个断层式大跃进的OpenAI来说,这种技术的诱惑力,根本无法拒绝。

思考是怎么「隐身」的

在此前爆火的「AI 2027」一文中,曾将这一方向称之为「神经语循环」。

Astra仍会通过语言来思考问题,但那些言语之间的更多思考,现在可能是无声的。


Astra的进化直接打破了AI 2027的预言

「循环深度」的危险就在于,它把思考逼进了盲区

在此之前,业界必须接受一个反直觉的现实:对于现在的推理模型来说,CoT是模型真正用来打草稿的工作记忆。

过去,模型想得再深,也必须从「输出下一个Token」这个狭窄的漏斗里挤出来。

正是这一挤,把抽象的计算逼成了人类能读懂的文字。这也是过去两年,人们唯一能「看透」AI脑子里在想什么的底气。

但另一方面,「循环深度」拓宽了内部的计算管道。

固定层数的模型,每吐一个Token前能做的串行推理是有限的。

而现在,模型在中间的循环块里转了r圈,每个Token背后就塞进了r倍的串行计算。原本必须挤在字面上的长链条推理,现在能在向量世界里默默转完,全程不吐一个字。

省下的Token,恰好省在了那些没写出来的思考上。更麻烦的是,它在潜空间里「想」的,未必是人话。


正如Meta早前在「连续思维链」(Coconut)研究中指出的:

模型用数字、用向量去推理,可能比被逼着用人类语言更准、更省。

这背后的逻辑很简单,大模型理解概念的方式,本来就是数学向量,强迫它每一步都翻译成人话,只会损失信息。


Coconut和CoT对比

这项技术的杀伤力在于,可以让一个小体积的模型,发挥出超大模型的实力,成本骤降,还能省下内存、带宽。

不过,它在省下了算力成本的同时,也彻底关上了人类的视线。

Astra真正王牌,就是新Transformer

对于数学和编程来说,「循环Transformer」架构极有吸引力。

许多真实任务本就依赖「多次迭代」:先提出方案,再检查错误,更新中间状态,继续求解。

「循环Transformer」,天然适合执行这种算法。


它也给模型带来了一种全新的「推理时Scaling」方式。

过去,让模型多想一会儿,通常意味着让它生成更多思维链Token。

现在,一部分计算可以在输出Token之前完成。模型表面上可能只停顿片刻,内部状态却已经迭代了很多轮。

Astra的实力大家是有目共睹,虽还未正式发布,一些demo验证了其在前端领域的统治力。


而且,在计算机使用方面,奥特曼也承认,Astra实力直接媲美人类水平。

正是基于这一架构的创新,Astra还打通了「持续性智能体」,只要不喊停能连轴转数周。

如今全网都在屏息以待,Astra/GPT-6总算要来了。

OpenAI多位研究员,包括「赛博义父」也在疯狂暗示强大的Astra。



今晚,就坐等GPT-6的发布了。

参考资料:

https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns?rc=epv9gi

编辑:桃子 摩西

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯