今天一睜眼,Anthropic把Claude Fable 5.1端上來了。
一起推出的還有Mythos 5.1,參加玻璃翼計劃的合作伙伴可以用,兩者底層是同一套模型,Mythos護欄更松,主要服務網絡安全和生命科學研究,,這個先放一邊,畢竟普通人連門票都沒見過。。。

科研Agent的Terminal-Bench-Science從上代24.7%衝到52.6%,直接翻倍。業務自動化的AutomationBench從17.1%漲到31.4%,終端編程也從42%升到55.8%。

你會發現,漲得最兇的都是長任務,步驟多,中間還會失敗。
它更像一個能在代碼庫或實驗室裏連續折騰幾十小時的高級工程師,會查資料、調工具、撞牆後換條路繼續跑,Ramp甚至讓它無人值守幹了38小時,最後找出此前的機器學習結果其實是標籤僞影,還順手跑了6組實驗。

越來越強離譜了。
不過你先別急,Fable 5.1的 Humanity's Last Exam無工具只從57.8%漲到60.9%,CursorBench從70.5%到73.4%,SWE-bench Pro大約從80.3%到81.2%。CodeRabbit拿105個已知問題測試代碼審查,召回率還輕微下降,只是廢話少了、精確度高了,同時慢了49%。

綜合看下來,Fable 5.1在長程Agent上猛進,日常編碼和知識工作則更穩、更剋制。它很強,但沒有強到每個角落都換了地基。
然後就到了大家關心的部分,價格。
不過這個看起來聊勝於無的降價也並非完全無用——Claude Code和各種Agent會反覆讀取系統提示、代碼庫和歷史上下文,緩存讀取有時也會佔不少費用。
官方按真實負載估算,典型任務便宜約25%,重度Agent最高省45%,有開發者拿三次超長Claude Code會話重算,賬單確實下降了42%到48%。

emmmm,也算是比之前會算賬了。
當然,只學會了半本,
Artificial Analysis把effort拉滿後,5.1雖然以66分拿下智能指數第一,單任務卻要3.76美元,比上代貴約20%。降價的原因也找到了——它吐出的輸出token大約是上代1.7倍,緩存省下的錢,又被這塊喫回去一塊。

Fable 5.1 這次在反蒸餾上也加入了新的限制,的新API賬戶如果帶回舊思考塊,就不能再偷偷改它前面的系統提示、工具或消息,否則直接報錯。

Fable 5.1目前的情況依然不該當所有人的默認模型。
Anthropic自己的文檔都建議,大多數工作先用價格只有一半的Opus 5,真遇到Opus加大effort還啃不動的硬骨頭,再請Fable出場。
手機APP也可見Fable5.1了,但我們目前Premium給的額度實在是太少

一個昂貴的專家。
這大概就是Fable 5.1真正重要的地方,依然是價格最昂貴的一批模型,但能力也是最強的,在現在這個Agents時代,模型能力只要對得起其價格,依然有人願意付錢。
歡迎來到一個AI不那麼美好的AI時代。
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
