AI大模型別無腦開最高檔

VulcanBench 發了第三輪評測的排行榜。

這輪評測的性質:全是真實的工程任務,代碼都來自真實倉庫。沒有腦筋急轉彎,沒有數學題,也沒有那種花裏胡哨的冷門架構。就是你和我每天上班乾的那些活。

這次的排行榜有個特別的地方:它沒有按"哪個模型最強"來排,而是把每個模型在所有努力檔位(effort level)下跑了一遍,然後標出哪個檔位給出的準確率最高。

爲什麼要這麼幹?因爲現在太多團隊拿到模型就無腦開 High 或者 Max,總覺得檔位拉滿準確率就一定最好。

但現實是,對大多數日常工程任務來說,這純屬浪費。你公司爲這些多燒掉的 token 錢,換來的準確率和低檔位一模一樣,只是慢了一大截。

看看這輪的結果:

Grok 4.5 High 還是榜首,90 分

Fable 5 Low 緊隨其後,89 分

DeepSeek V4-Flash Max 第三,88 分

注意,第二名是 Low 檔跑出來的,第三名是 Max 檔。同一個模型,檔位差好幾個,分數卻咬得很緊。

更有意思的是另外兩個例子:

Grok 4.6 的甜點位在 Medium,不是更高也不是更低。

而那個最近被吐槽最多的 Opus 5——你要是習慣性給它開 High,那恰恰是最差的選擇,它反而在 Low 檔表現更好。

所以這事沒那麼簡單。檔位不是越高越好,也不是越低越好,得看模型本身的特性。找到每個模型的甜點位,省下的 token 是實打實的錢。

努力很重要,但努力的方向(和檔位)更重要。

Live long and benchmark 🖖

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com