VulcanBench 发了第三轮评测的排行榜。
这轮评测的性质:全是真实的工程任务,代码都来自真实仓库。没有脑筋急转弯,没有数学题,也没有那种花里胡哨的冷门架构。就是你和我每天上班干的那些活。
这次的排行榜有个特别的地方:它没有按"哪个模型最强"来排,而是把每个模型在所有努力档位(effort level)下跑了一遍,然后标出哪个档位给出的准确率最高。
为什么要这么干?因为现在太多团队拿到模型就无脑开 High 或者 Max,总觉得档位拉满准确率就一定最好。
但现实是,对大多数日常工程任务来说,这纯属浪费。你公司为这些多烧掉的 token 钱,换来的准确率和低档位一模一样,只是慢了一大截。
看看这轮的结果:
Grok 4.5 High 还是榜首,90 分
Fable 5 Low 紧随其后,89 分
DeepSeek V4-Flash Max 第三,88 分
注意,第二名是 Low 档跑出来的,第三名是 Max 档。同一个模型,档位差好几个,分数却咬得很紧。
更有意思的是另外两个例子:
Grok 4.6 的甜点位在 Medium,不是更高也不是更低。
而那个最近被吐槽最多的 Opus 5——你要是习惯性给它开 High,那恰恰是最差的选择,它反而在 Low 档表现更好。
所以这事没那么简单。档位不是越高越好,也不是越低越好,得看模型本身的特性。找到每个模型的甜点位,省下的 token 是实打实的钱。
努力很重要,但努力的方向(和档位)更重要。
Live long and benchmark 🖖
![]()
![]()
![]()
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
