今天一睁眼,Anthropic把Claude Fable 5.1端上来了。
一起推出的还有Mythos 5.1,参加玻璃翼计划的合作伙伴可以用,两者底层是同一套模型,Mythos护栏更松,主要服务网络安全和生命科学研究,,这个先放一边,毕竟普通人连门票都没见过。。。

科研Agent的Terminal-Bench-Science从上代24.7%冲到52.6%,直接翻倍。业务自动化的AutomationBench从17.1%涨到31.4%,终端编程也从42%升到55.8%。

你会发现,涨得最凶的都是长任务,步骤多,中间还会失败。
它更像一个能在代码库或实验室里连续折腾几十小时的高级工程师,会查资料、调工具、撞墙后换条路继续跑,Ramp甚至让它无人值守干了38小时,最后找出此前的机器学习结果其实是标签伪影,还顺手跑了6组实验。

越来越强离谱了。
不过你先别急,Fable 5.1的 Humanity's Last Exam无工具只从57.8%涨到60.9%,CursorBench从70.5%到73.4%,SWE-bench Pro大约从80.3%到81.2%。CodeRabbit拿105个已知问题测试代码审查,召回率还轻微下降,只是废话少了、精确度高了,同时慢了49%。

综合看下来,Fable 5.1在长程Agent上猛进,日常编码和知识工作则更稳、更克制。它很强,但没有强到每个角落都换了地基。
然后就到了大家关心的部分,价格。
不过这个看起来聊胜于无的降价也并非完全无用——Claude Code和各种Agent会反复读取系统提示、代码库和历史上下文,缓存读取有时也会占不少费用。
官方按真实负载估算,典型任务便宜约25%,重度Agent最高省45%,有开发者拿三次超长Claude Code会话重算,账单确实下降了42%到48%。

emmmm,也算是比之前会算账了。
当然,只学会了半本,
Artificial Analysis把effort拉满后,5.1虽然以66分拿下智能指数第一,单任务却要3.76美元,比上代贵约20%。降价的原因也找到了——它吐出的输出token大约是上代1.7倍,缓存省下的钱,又被这块吃回去一块。

Fable 5.1 这次在反蒸馏上也加入了新的限制,的新API账户如果带回旧思考块,就不能再偷偷改它前面的系统提示、工具或消息,否则直接报错。

Fable 5.1目前的情况依然不该当所有人的默认模型。
Anthropic自己的文档都建议,大多数工作先用价格只有一半的Opus 5,真遇到Opus加大effort还啃不动的硬骨头,再请Fable出场。
手机APP也可见Fable5.1了,但我们目前Premium给的额度实在是太少

一个昂贵的专家。
这大概就是Fable 5.1真正重要的地方,依然是价格最昂贵的一批模型,但能力也是最强的,在现在这个Agents时代,模型能力只要对得起其价格,依然有人愿意付钱。
欢迎来到一个AI不那么美好的AI时代。
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
