对标Claude4.7,Cursor 发布超高性价比模型

今天,Cursor 把 Composer 2.5 放出来了。

我第一眼注意到的是什么——SWE-Bench Multilingual,79.8%。


和 Anthropic Opus 4.7 持平!

你敢信?


SWE-Bench 是把它丢进真实项目里修 bug、读上下文、改文件的测试,所以 79.8% 这个数字真正刺激人的地方,不只是高。


是它高得有点出乎意料。


Cursor 自己对 Composer 2.5 的定位很清晰,即能胜任长时间任务、更能遵循复杂指令、会协作的模型。

这个说法听着有点产品稿味,但放到 coding agent 里其实很关键,因为我们现在用 Cursor、Claude Code、Codex,最烦的就是这些模型跑着跑着忘了目标,或者小修一下就端出一整套重构大礼包。


Composer 2.5 这次的改进,就是对着这个痛点来的。


更复杂的 RL 环境,合成任务数据比 Composer 2 多了 25 倍,以及他们还推出了 Targeted RL with Textual Feedback(利用文本反馈进行定向强化学习)。


这个改进你可以把它理解成,老师改卷子,不只是打对错,还在你错的地方写了正确的解题思路,你作为学生,就问你看了爽不爽?

以前一个 agent 跑几十万 token,到头来任务失败了,奖励模型只能说,兄弟你这把不行。


但具体是哪一步不行,是工具调错了,还是风格跑偏了,它很难知道,Cursor 现在做的是,在出问题的局部上下文里塞一条短反馈。


这就很像一个资深工程师带新人。


但说到这里,还有一点各位要知道:


Composer 2.5 并不是 Cursor 从零炼出来的全新大模型。


它基于月之暗面的 Kimi K2.5 构建,Cursor 在这个底座上做了大量 post-training 和 RL,大约 85% 的计算资源花在自己主导的 RL 和后训练阶段。


这件事比单纯吹自研更有意思。


现在做 coding model,不一定要从第一块砖开始盖楼,你大可以先拿一个足够强、商业上能跑通的 base model,再把贴近场景的部分做到极致。


月之暗面提供 Kimi K2.5 这个强基座,Cursor 通过 Fireworks AI 做授权商业合作,然后把自己的产品场景和 RL 训练能力压上去。

可以说是集两家之长。


btw,可能有朋友可能会问,不是 Kimi K2.6 已经出来了,为什么 Composer 2.5 不直接用 K2.6?


这个问题答案其实很简单。


Kimi K2.6 正式发布于上个月20号(4月20,我们当时还提前一周体验到了 K2.6),就算 Cursor 比我们还早点,到今天算一算也才一个月多点,那时 Composer 2.5 的训练大概率已经走到中后段了,你这时候换底座,真不是换个模型名字挪一点文件那么简单,大量 post-training 和稳定性验证都要重跑。

另外,K2.5 已经被 Composer 2 跑过一轮真实用户场景,稳定性、授权、推理成本都更确定,K2.6 确实更强,但不等于立刻能变成有效提升。


对了,Composer 2.5 的标准价格是每百万输入 token 0.50 美元,每百万输出 token 2.50 美元,用少得多的钱,买到和 Opus 4.7 差不多的性能,性价比是真的不错。

这个价格无论是放到哪里,都是相当有竞争力的价格,不过目前 2.5 仅在 Cursor 中可供调用,不知道后续是否会开放。


便宜不只是便宜,便宜会改变人的使用习惯。


以前你可能会想,这个任务值不值得开 Opus,现在如果 Composer 2.5 能接近顶级模型,同时成本压低一大截,开发者会更愿意把它当默认劳动力。


说到底,Composer 2.5 最让我兴奋的,不只是它证明 Cursor 可以做出一个某些能力可以和 Opus 4.7 持平的模型,它还证明了一条很现实的路线:


拿强开放底座,叠深垂直场景,做狠后训练,再用一个开发者真的能负担得起的价格打出来。

真正的战场,不止是性能,还有价格。

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com