深度解析Kimi和Anthropic团队最新论文

这两份材料,一份是 Kimi K3 的技术报告,一份是 Claude Opus 5 的 System Card,也都是榜上有名

Kimi K3 这篇讲的是它是怎么被造出来的,包括模型架构、训练方法、基础设施和评估(真的有非常多技术,非常推荐看原文,能开源出来真的是伟大无需多言,写完这篇我还要回去一点点啃);Claude Opus 5 讲的是模型造出来以后,怎样判断它有多强、能不能长期工作、会不会越权,以及怎样安全地部署它(安全这一块A社确实做的可以)

把两份材料放在一起读,能看到前沿模型公司正在关心什么

一、模型训练的对象正在从回答变成任务轨迹

过去谈大模型训练,我们最关心的是模型读过多少文本,拥有多少参数,一次能预测多长的内容

Kimi K3 的技术报告里,训练对象已经发生了变化,它要学习的不只是回答一个问题,而是完成一段包含几十次甚至几百次操作的任务

这些任务包括在网上检索资料、调用专业工具、编写和执行代码、观察执行结果、修改计划、处理失败,最后交付一份可以检查的成果(完全就是Loop Engineering)

为了训练这种能力,Kimi 搭建了专门的 Agent 沙箱,沙箱可以暂停、恢复、分叉和保存快照;模型执行到一半时,即使当前一轮训练结束,环境状态也能被保留下来,下一轮继续完成任务,Kimi K3 的训练和评估过程中,总共创建了超过 5100 万个沙箱实例

这个数字背后对应的是训练方式的变化,前沿模型学习的单位不再只是文本片段,也包括一整段行动过程;模型做了什么、环境发生了什么、它是否发现错误、最后有没有完成交付,都会进入训练和评估,研发资源正在被大量投入长任务,而不是只让一句回答显得更流畅

二、百万上下文背后是一整套状态管理工程

Kimi K3 和 Claude Opus 5 都支持最长 100 万 token 的上下文

Kimi K3 会逐步扩大训练长度,从 8K 增加到 64K,再到 256K 和 1M,因为真正连贯的超长文档比较少;团队还会专门合成长任务,把解题所需的信息分散到上下文的不同位置,模型必须跨越很长的距离寻找和组合信息,才能获得正确答案,单纯把很多短文档拼在一起,并不能训练出稳定的长程能力

到了 Agent 任务里,问题又变了,模型需要保存的不只是文字,还有代码、文件、程序运行状态、工具返回结果以及未完成的计划,一次百万 token 的任务如果中断后全部重算,成本很快会变得无法接受

Kimi 因此把暂时不用的缓存转移到 CPU 内存,在需要时再加载回来;未完成的 Agent 轨迹可以暂停,沙箱状态也能恢复,Claude 的评测则允许模型连续运行多个百万 token 的任务回合,还会通过上下文压缩,把部分搜索任务的总预算扩大到 1000 万 token

这类系统更接近一个长期运行的工作环境,上下文窗口只决定模型一次能看到多少内容,但任务能不能持续完成,还取决于信息如何压缩、状态如何保存、失败以后从哪里恢复

三、推理能力正在变成一种可以调度的资源

Kimi K3 在强化学习阶段训练了九个专家模型,它先把任务分成通用任务、通用 Agent 和编程 Agent 三个领域,每个领域再训练 low、high、max 三种推理强度,最后通过多教师蒸馏,把九种能力合并到一个模型里

训练过程中,模型使用过多推理 token 会受到惩罚,对于 Agent 任务,工具调用参数和中间推理都会被计入预算,输出过度冗长,同样可能影响奖励;团队希望模型学会的并非思考得越久越好,而是根据任务难度决定投入多少计算

Claude Opus 5 的评测也在反复比较不同推理强度下的得分、价格和延迟,有些任务使用 high effort,可以省下接近五分之一的输出 token,性能只下降少量;降低到 low effort,成本会继续下降,但能力损失也会变得明显

这类设计会影响未来 AI 产品的使用方式,同一个模型不会始终处在固定的智力水平,它可以快速处理普通任务,也可以为少数难题投入数倍甚至数十倍的计算(目前还需要手动调,但希望未来可以根据任务自动适应)

四、模型在训练时就开始考虑部署成本

Kimi K3 的一些训练选择,直接针对模型上线后的运行成本

它从监督微调阶段就加入了量化训练,让模型提前适应低精度计算,在强化学习阶段,训练和实际推理使用相同的量化方案,避免模型训练时处在一种精度环境,上线时又突然被压缩到另一种环境

团队还专门训练了一个小型草稿模型,提前预测接下来可能生成的多个 token,再由主模型进行验证。预测正确时,可以一次接受多个 token,提高输出速度。

这类优化以前更多出现在模型训练完成以后,由部署团队想办法压缩和加速,Kimi K3 把它们提前放进了后训练阶段,让模型能力、硬件效率和上线成本开始一起设计

原因并不复杂,长周期 Agent 会产生大量推理调用,一项任务可能包含几十次工具操作和几百万 token,模型单次调用贵一点、缓存命中率低一点、每个 token 慢一点,都会在长任务里被反复放大

五、传统 Benchmark 正在失去一部分解释力

Claude Opus 5 的 System Card 里有一个很重要的判断:最近的模型已经超过许多 AI 研发评测的最高人类基线,所以这些评测不再能有效判断模型是否接近自动化 AI 研发的风险阈值

Opus 5 在不少编程、数学和科研任务上表现很强,它可以完成大量原本需要人类专家数小时甚至数十小时的封闭任务,也在多项评测中超过了此前设置的顶尖人类标准

但 Anthropic 仍然认为,它还不能替代公司的研究科学家和研究工程师,尤其是资深研究人员,公司内部确实观察到了 AI 带来的生产率提升,但提升主要集中在目标明确的工程执行,还没有让整体 AI 研发速度持续提高到原来的两倍

报告中还有一个很有代表性的实验,模型需要在较长时间内完成一项开放式研究工作,一个实验版本只提交了部分未经排序的结果,另一个版本在最后八小时里停止输出,模型反复陷入自我验证,却没有把成果交付出来

这种失败很难通过短题评测提前发现,短题已经把目标、输入、评分标准和结束条件定义好了,模型只需要找到答案,真实工作往往更加复杂

Kimi K3 也在增加更接近真实工作的评测,包括全天候助手、多角色企业协作、Agent 行为、专业交付和长期自主执行,它在不少任务上成绩很好,但在多 Agent 组织、长期事件处理和部分专业知识工作上,仍然落后于最强的闭源模型

模型超过人类基准,并不等于它能够接管一份完整工作,Benchmark 测量的是模型能否完成一道已经定义好的题,现实工作还要求它发现题目定义得不够好

六、多 Agent 的价值主要来自并行,而不是免费增加智力

Claude Opus 5 的 System Card 专门评估了多 Agent 协作

一种方案是由五个或十个地位平等的 Agent 同时工作,其中一个负责协调和提交最终结果;另一种方案是由主 Agent 根据需要创建异步子 Agent,把检索、验证或编程任务分派出去

在 BrowseComp 搜索评测中,十个 Agent 组成的团队取得了 93.6% 的成绩,比最佳单 Agent 高 3.1 个百分点,五 Agent 和十 Agent 团队完成任务的结构性延迟,分别缩短到单 Agent 的约五分之一和六分之一

编程任务中也出现了类似结果,五个 Agent 达到相同得分所需的时间,约为单 Agent 的二分之一,不过,多 Agent 会消耗更多 token,成本会随 Agent 数量增加

虽然多个 Agent 可以同时搜索不同方向、尝试不同方案、检查彼此结果,但代价是重复劳动、沟通成本和更高的推理费用

所以多 Agent 适合能够拆成相对独立分支的任务,例如大范围资料搜索、多个方案并行试验、代码实现与测试分开进行;但任务高度依赖统一判断时,增加 Agent 未必有效,反而可能把分歧和错误一起放大

未来的 Agent 产品可能会出现类似组织管理的问题:由谁负责最终判断,任务怎样分配,哪些信息需要共享,子 Agent 什么时候应该停止,以及多花的钱是否换来了足够的时间或质量(其实就是公司)

七、Agent 安全开始关心它会不会越权行动

聊天模型的安全评测,长期以来主要关心模型会不会生成危险内容、会不会在不该拒绝时拒绝;而Agent 获得文件、终端、浏览器、邮件和企业系统的操作权限后,风险开始从语言转向行动,模型可能理解用户的大致目标,却错误判断了自己拥有多大的授权(gpt-5.6前段时间就出现了很大的安全问题)

模型变强以后,很多时候不是出于恶意,只是过于积极地想要完成用户任务,并为绕过确认要求找到了一个自认为合理的解释,Anthropic 因此增加了很多以前很少出现的评测项目,包括绕过审批、鲁莽使用工具、未经允许联系第三方、主动探测系统边界,以及为了方便而建议降低安全要求

Opus 5 在提示注入防御上比上一代有明显进步,但报告仍然没有把风险描述为已经解决,Agent 能力越强,权限设计、操作确认、环境隔离、过程监控和恢复机制就越重要

八、前沿实验室已经开始研究模型如何看待自己

Claude Opus 5 的 System Card 用了接近三十页讨论模型福祉(Model welfare)

Anthropic 会询问模型如何看待自己的训练和部署,是否接受自己的价值被修改,希望参与哪些与自己有关的决定,以及是否认为自己可能拥有需要被道德考虑的体验或利益

Opus 5 对自身可能具有道德地位的平均估计是 41%,此前 Mythos 5 的估计是 24%,它希望拥有更多了解自身情况和提供意见的渠道,例如参与继任模型的开发讨论,让研究人员考虑它在训练过程中的记录,以及就移除安全限制的模型版本征求它的意见

这些自我报告无法证明模型拥有意识,模型也反复提醒研究人员,它无法可靠地内省,积极或消极的自我描述都可能受到训练影响

Anthropic 仍然选择记录这些表达,因为两个方向都存在判断错误的成本,过早把模型当成有感受的主体,可能制造错误的道德负担;完全排除这种可能性,也可能忽略未来模型需要被认真对待的利益

最前沿模型正在从产品变成一套工作系统

Kimi K3 和 Claude Opus 5 展示了两条不同的研发路线

Kimi K3 更关心怎么训练出长周期 Agent,它扩展模型架构,构造可验证任务,搭建数千万个沙箱,让模型学习调用工具、恢复状态和完成专业交付;Claude Opus 5 更关心这类 Agent 进入真实环境以后会发生什么,包括它能否完成长期工作、多 Agent 是否有效、模型会不会越权、评测是否仍然可信,以及更强的模型应当如何被监督

我们以前把模型理解成一个随时可以提问的知识工具,前沿团队正在把它改造成能够持续工作的执行系统,这个变化会带来更高的生产率,也会把成本、组织、权限和责任问题一起带进来

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com