刚刚,神话级Fable 5.1来了!
一觉醒来,Anthropic再次改写了机器智能的坐标系。
今天,Claude Fable 5.1全平台上线,人人可用。
战力全开的Mythos 5.1,则被锁在白名单内,专供受审核的网安与生命科学团队调遣。


从重构复杂的工程代码,到攻坚战线极长的高维科研,这对孪生大脑正在重新定义什么是顶级的「赛博脑力劳动者」。
它们最擅长的,就是啃下那些过去人类专家都感到棘手的长链路复杂任务。
按老规矩先看成绩单,这一次,新模型的跑分直接拉出了断层式的代差。

科研探索(Terminal-Bench-Science 0.1)
Fable 5.1直接拿下了52.6%。要知道,上一代Fable 5和OpenAI的GPT-5.6 Sol,成绩分别只有24.7%和22.4%。
代码工程(Terminal-Bench 4.0)
Fable 5.1从前代的42.0%一路飙升至55.8%;在放开护栏的Mythos 5.1手中,这个数字更是被推到了惊人的60.9%。
复杂脑力与综合认知
在知识工作基准GDPval-AA中,Fable 5.1获得了1853的高分;在被称为「人类最后的考试」的高难基准上,带工具实测更是跨过了65.0%的门槛。
哪怕你把「思考程度」调至最低,它照样能以极低的Token消耗跑出超越前代的效果。




左右滑动查看
更绝的是,在能力实现跃迁的同时,算力门槛也被砸了下来。
基础定价方面,Fable 5.1和上一代一模一样:输入每百万Token 10美元,输出50美元。
但在最吃资源的「缓存读取」上,它直接从1美元砍到了0.25美元,降幅高达75%。
放到真实任务中,普通场景总成本能降25%;对于重度跑Agent的长战线任务,最高能省下45%。
对比之下,GPT-5.6 Sol目前的短上下文促销价是:输入2美元、输出10美元、缓存0.2美元。


跑分与降价证明了它的强悍,但这只是表象。
真正的分水岭在于,从这一代开始,AI彻底褪去了辅助工具的外衣——
它开始亲自下场,自己做科学了。
Claude双王攻入科研
重绘金星、手搓GPU代码
为了证明这对「双王」在真实世界的杀伤力。
Anthropic直接端出了三个比榜单直观得多的前沿案例。
重绘三分之一个金星
30多年前,NASA的麦哲伦号给金星拍过一轮雷达。
但它的高程数据分辨率只有10-20公里。换算到地球上,就是一整座城市只占几个像素。
过去,人类只把其中五分之一的区域做成了高程图。
而Fable 5.1拿着这批数据,训练了一个神经网络,重新生成了覆盖金星约三分之一面积的高分辨率地形图。
新图把细节推进到2至3公里,高度估计的准确性最高提升25%。


分子与蛋白质设计,命中率50%
相比处理静态的地表数据,设计生物蛋白的难度更大。
许多现代药物的原理,是设计一个小蛋白,精准锁定体内某个目标靶点,进而阻断或激活特定反应。
结合得够不够紧密,学名叫结合亲和力。亲和力越高,药物在低剂量下见效的可能性就越大。
在调用开源设计工具后,Mythos 5.1交出的设计稿被直接送往外部机构,在真实世界里做了湿实验。
结果是目前测过的最强一档。在EGFR、Nipah G等三个靶点上,亲和力直接达到Adaptyv Bio竞赛最佳方案的10倍。
在12个靶点上的总体命中率,更是逼近50%。要知道,今天该领域的常态命中率,也就一成到一成半。

手写GPUKernel,生信模型提速2.5倍
第三个案例,甚至可以说是改写了科研机构的算力账单。
基因组和蛋白质研究经常要在GPU上重复运行专用深度学习模型。
一次全基因组分析,可能要测试每个基因附近的大量突变,推理会执行成千上万次。单次慢一点,累计成本就会迅速放大。
给这些模型做优化、手写GPU Kernel,通常是顶尖性能工程师的活。一个团队得干好几周,学术实验室往往根本请不起这种人。
而Mythos 5.1只拿着公开的源代码,几天就干完了。
而且,它不仅一口气为7个开源生物模型手写了GPU Kernel,速度还最高提升了2.5倍。
最关键的是,输出结果与原版完全一致,
换算成账单的话,一项扫三百万个变异的分析,用Evo 2那个大模型跑,成本从1.8万美元直接砍到了8千美元。


七个开源蛋白质与基因组学模型在NVIDIA H100上的推理加速比,以及优化前后的预估GPU成本
全球最强编程AI,实力狂飙14%
Fable 5.1能亲自下场做科学,底气源自它极其硬核的代码逻辑。
现在的Agent不怕写代码,怕的是连跑数小时、调用几十个工具后忘了最初的目标,或是报错后摸不到真正的病根。
Fable 5.1强化的,正是这样一条完整的动作闭环:
读取仓库文档→拆解任务→执行修改→运行测试→检查结果→定位失败→继续下一轮。
用Anthropic的话说,Fable 5.1在遇到障碍时会明确指出卡在哪里,极少再去走那些「看似完成、实则留下隐患」的捷径。

在衡量真实IDE编码水平的CursorBench 3.2上,它以73.4%刷新了内部纪录;在商业工作流AutomationBench中,成绩更跃升至31.4%,几近翻倍
靠着这种长程稳定性,它甚至帮对冲基金Millennium解决了一个潜伏四五年的天坑Bug。
面对百万次一崩的幽灵报错,它一路追到外部、反汇编了第三方库,将别人地盘里的病根连根拔起。
这一次,Fable 5.1真正做到了长链路任务的「一次完整交付」。

第一波编码实测
Fable 5.1全面上线之后,紧跟着一波实测也出来了。

Fable 5.1登顶AAAI
从AI/ML API放出的实测对比demo,还是可以明显看出Fable 5.1和GPT-5.6 Sol的差距。
都喂给它们同一个提示词,一次性输出。
Fable 5.1花费5.69 美元,GPT-5.6 Sol仅用了0.88美元。
Fable更追求写实,海浪、景深、岛屿周围的沙环更逼真。Sol则是简洁风,而且它的风格在全部5个场景中始终如一,从未崩坏。
Anthropic研究员Alex Albert在一次测试中,直接丢给Fable 5.1一张地皮的照片。
它能自主完成房屋设计、高质量渲染,甚至直接生成了一段电影级的漫游导览大片。
下面这段硬核演示中,Fable 5.1直接手搓了一个全交互式的人脑模型。
它不仅用代码精准复刻了大脑皮层的每一道沟回,还能让你亲眼看到「递一下盐」这句话在脑神经里跑通的全过程。

生成ARC生存游戏,Fable 5.1直接一把过。

能挖漏洞,拒绝蒸馏
Anthropic这次在安全上的动作,主打一个「一松一紧」。
松,是护栏不再那么「神经质」了。
以前程序员拿Claude审自家代码,动不动就被当成黑客拦截。现在Fable 5.1终于放开权限,允许去识别代码漏洞了,网络安全的误报直接降了六成。
但底线依然卡得很死:只能找漏洞,绝不许写利用漏洞的攻击代码。渗透测试这类高危操作,照样得交给管得更严的Opus。
紧,则是把护城河直接变成了「反蒸馏机制」。
为了彻底堵死以前那种在多轮对话里修改上下文、趁机套取Claude「思维链」的路子,Fable 5.1干脆在API底层上了锁。
从现在起,API会严查上下文。
只要你提交的提示词跟生成思维块时不一致,API要么直接报错拦截,要么把整个思维块全部抽走,绝不留半点空子。
目前,这套机制先拿8月31日之后注册的API新账号开刀。
但官方已经放话,对于未来的所有新模型,这把锁将对全员强制生效。


硅谷的顶尖研究者们曾反复提及一个愿景:AI最大的价值,将几十年的生物医学与基础科学进程,压缩到几年之内。
从重绘金星地图,到在试管里把蛋白命中率翻上数倍,这对孪生大脑正在让这个预言变成现实。
科学发现的门槛,正肉眼可见地往下塌。
只是别忘了,那只递出火种的手,也在同一时刻,悄悄用「反蒸馏」抽走了身后的梯子。
参考资料:
https://www.anthropic.com/claude-fable-and-mythos-5-1
https://www.anthropic.com/news/enterprise-frontier-safeguards
编辑:摩西 桃子
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!
AI 中文社