VulcanBench 發了第三輪評測的排行榜。
這輪評測的性質:全是真實的工程任務,代碼都來自真實倉庫。沒有腦筋急轉彎,沒有數學題,也沒有那種花裏胡哨的冷門架構。就是你和我每天上班乾的那些活。
這次的排行榜有個特別的地方:它沒有按"哪個模型最強"來排,而是把每個模型在所有努力檔位(effort level)下跑了一遍,然後標出哪個檔位給出的準確率最高。
爲什麼要這麼幹?因爲現在太多團隊拿到模型就無腦開 High 或者 Max,總覺得檔位拉滿準確率就一定最好。
但現實是,對大多數日常工程任務來說,這純屬浪費。你公司爲這些多燒掉的 token 錢,換來的準確率和低檔位一模一樣,只是慢了一大截。
看看這輪的結果:
Grok 4.5 High 還是榜首,90 分
Fable 5 Low 緊隨其後,89 分
DeepSeek V4-Flash Max 第三,88 分
注意,第二名是 Low 檔跑出來的,第三名是 Max 檔。同一個模型,檔位差好幾個,分數卻咬得很緊。
更有意思的是另外兩個例子:
Grok 4.6 的甜點位在 Medium,不是更高也不是更低。
而那個最近被吐槽最多的 Opus 5——你要是習慣性給它開 High,那恰恰是最差的選擇,它反而在 Low 檔表現更好。
所以這事沒那麼簡單。檔位不是越高越好,也不是越低越好,得看模型本身的特性。找到每個模型的甜點位,省下的 token 是實打實的錢。
努力很重要,但努力的方向(和檔位)更重要。
Live long and benchmark 🖖
![]()
![]()
![]()
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
