刚刚,神话级Fable 5.1来了!

浏览17次 点赞0次 收藏0次

一觉醒来,Anthropic再次改写了机器智能的坐标系。

今天,Claude Fable 5.1全平台上线,人人可用

战力全开的Mythos 5.1,则被锁在白名单内,专供受审核的网安与生命科学团队调遣。



从重构复杂的工程代码,到攻坚战线极长的高维科研,这对孪生大脑正在重新定义什么是顶级的「赛博脑力劳动者」。

它们最擅长的,就是啃下那些过去人类专家都感到棘手的长链路复杂任务。

按老规矩先看成绩单,这一次,新模型的跑分直接拉出了断层式的代差。


  • 科研探索(Terminal-Bench-Science 0.1)

Fable 5.1直接拿下了52.6%。要知道,上一代Fable 5和OpenAI的GPT-5.6 Sol,成绩分别只有24.7%和22.4%。

  • 代码工程(Terminal-Bench 4.0)

Fable 5.1从前代的42.0%一路飙升至55.8%;在放开护栏的Mythos 5.1手中,这个数字更是被推到了惊人的60.9%。

  • 复杂脑力与综合认知

在知识工作基准GDPval-AA中,Fable 5.1获得了1853的高分;在被称为「人类最后的考试」的高难基准上,带工具实测更是跨过了65.0%的门槛。

哪怕你把「思考程度」调至最低,它照样能以极低的Token消耗跑出超越前代的效果。





左右滑动查看

更绝的是,在能力实现跃迁的同时,算力门槛也被砸了下来。

基础定价方面,Fable 5.1和上一代一模一样:输入每百万Token 10美元,输出50美元。

但在最吃资源的「缓存读取」上,它直接从1美元砍到了0.25美元,降幅高达75%

放到真实任务中,普通场景总成本能降25%;对于重度跑Agent的长战线任务,最高能省下45%。

对比之下,GPT-5.6 Sol目前的短上下文促销价是:输入2美元、输出10美元、缓存0.2美元。



跑分与降价证明了它的强悍,但这只是表象。

真正的分水岭在于,从这一代开始,AI彻底褪去了辅助工具的外衣——

它开始亲自下场,自己做科学了。

Claude双王攻入科研

重绘金星、手搓GPU代码

为了证明这对「双王」在真实世界的杀伤力。

Anthropic直接端出了三个比榜单直观得多的前沿案例。

  • 重绘三分之一个金星

30多年前,NASA的麦哲伦号给金星拍过一轮雷达。

但它的高程数据分辨率只有10-20公里。换算到地球上,就是一整座城市只占几个像素。

过去,人类只把其中五分之一的区域做成了高程图。

而Fable 5.1拿着这批数据,训练了一个神经网络,重新生成了覆盖金星约三分之一面积的高分辨率地形图。

新图把细节推进到2至3公里,高度估计的准确性最高提升25%。



  • 分子与蛋白质设计,命中率50%

相比处理静态的地表数据,设计生物蛋白的难度更大。

许多现代药物的原理,是设计一个小蛋白,精准锁定体内某个目标靶点,进而阻断或激活特定反应。

结合得够不够紧密,学名叫结合亲和力。亲和力越高,药物在低剂量下见效的可能性就越大。

在调用开源设计工具后,Mythos 5.1交出的设计稿被直接送往外部机构,在真实世界里做了湿实验。

结果是目前测过的最强一档。在EGFR、Nipah G等三个靶点上,亲和力直接达到Adaptyv Bio竞赛最佳方案的10倍。

在12个靶点上的总体命中率,更是逼近50%。要知道,今天该领域的常态命中率,也就一成到一成半。


  • 手写GPUKernel,生信模型提速2.5倍

第三个案例,甚至可以说是改写了科研机构的算力账单。

基因组和蛋白质研究经常要在GPU上重复运行专用深度学习模型。

一次全基因组分析,可能要测试每个基因附近的大量突变,推理会执行成千上万次。单次慢一点,累计成本就会迅速放大。

给这些模型做优化、手写GPU Kernel,通常是顶尖性能工程师的活。一个团队得干好几周,学术实验室往往根本请不起这种人。

而Mythos 5.1只拿着公开的源代码,几天就干完了。

而且,它不仅一口气为7个开源生物模型手写了GPU Kernel,速度还最高提升了2.5倍。

最关键的是,输出结果与原版完全一致,

换算成账单的话,一项扫三百万个变异的分析,用Evo 2那个大模型跑,成本从1.8万美元直接砍到了8千美元。



七个开源蛋白质与基因组学模型在NVIDIA H100上的推理加速比,以及优化前后的预估GPU成本

全球最强编程AI,实力狂飙14%

Fable 5.1能亲自下场做科学,底气源自它极其硬核的代码逻辑。

现在的Agent不怕写代码,怕的是连跑数小时、调用几十个工具后忘了最初的目标,或是报错后摸不到真正的病根。

Fable 5.1强化的,正是这样一条完整的动作闭环:

读取仓库文档→拆解任务→执行修改→运行测试→检查结果→定位失败→继续下一轮。

用Anthropic的话说,Fable 5.1在遇到障碍时会明确指出卡在哪里,极少再去走那些「看似完成、实则留下隐患」的捷径。


在衡量真实IDE编码水平的CursorBench 3.2上,它以73.4%刷新了内部纪录;在商业工作流AutomationBench中,成绩更跃升至31.4%,几近翻倍

靠着这种长程稳定性,它甚至帮对冲基金Millennium解决了一个潜伏四五年的天坑Bug。

面对百万次一崩的幽灵报错,它一路追到外部、反汇编了第三方库,将别人地盘里的病根连根拔起。

这一次,Fable 5.1真正做到了长链路任务的「一次完整交付」。


第一波编码实测

Fable 5.1全面上线之后,紧跟着一波实测也出来了。


Fable 5.1登顶AAAI

从AI/ML API放出的实测对比demo,还是可以明显看出Fable 5.1和GPT-5.6 Sol的差距。

都喂给它们同一个提示词,一次性输出。

Fable 5.1花费5.69 美元,GPT-5.6 Sol仅用了0.88美元。

Fable更追求写实,海浪、景深、岛屿周围的沙环更逼真。Sol则是简洁风,而且它的风格在全部5个场景中始终如一,从未崩坏。

Anthropic研究员Alex Albert在一次测试中,直接丢给Fable 5.1一张地皮的照片。

它能自主完成房屋设计、高质量渲染,甚至直接生成了一段电影级的漫游导览大片。

下面这段硬核演示中,Fable 5.1直接手搓了一个全交互式的人脑模型。

它不仅用代码精准复刻了大脑皮层的每一道沟回,还能让你亲眼看到「递一下盐」这句话在脑神经里跑通的全过程。


生成ARC生存游戏,Fable 5.1直接一把过。


能挖漏洞,拒绝蒸馏

Anthropic这次在安全上的动作,主打一个「一松一紧」。

松,是护栏不再那么「神经质」了。

以前程序员拿Claude审自家代码,动不动就被当成黑客拦截。现在Fable 5.1终于放开权限,允许去识别代码漏洞了,网络安全的误报直接降了六成。

但底线依然卡得很死:只能找漏洞,绝不许写利用漏洞的攻击代码。渗透测试这类高危操作,照样得交给管得更严的Opus。

紧,则是把护城河直接变成了「反蒸馏机制」

为了彻底堵死以前那种在多轮对话里修改上下文、趁机套取Claude「思维链」的路子,Fable 5.1干脆在API底层上了锁。

从现在起,API会严查上下文。

只要你提交的提示词跟生成思维块时不一致,API要么直接报错拦截,要么把整个思维块全部抽走,绝不留半点空子。

目前,这套机制先拿8月31日之后注册的API新账号开刀。

但官方已经放话,对于未来的所有新模型,这把锁将对全员强制生效。



硅谷的顶尖研究者们曾反复提及一个愿景:AI最大的价值,将几十年的生物医学与基础科学进程,压缩到几年之内。

从重绘金星地图,到在试管里把蛋白命中率翻上数倍,这对孪生大脑正在让这个预言变成现实。

科学发现的门槛,正肉眼可见地往下塌。

只是别忘了,那只递出火种的手,也在同一时刻,悄悄用「反蒸馏」抽走了身后的梯子。

参考资料:

https://www.anthropic.com/claude-fable-and-mythos-5-1

https://www.anthropic.com/news/enterprise-frontier-safeguards

编辑:摩西 桃子

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯