![]()
這兩份材料,一份是 Kimi K3 的技術報告,一份是 Claude Opus 5 的 System Card,也都是榜上有名
![]()
Kimi K3 這篇講的是它是怎麼被造出來的,包括模型架構、訓練方法、基礎設施和評估(真的有非常多技術,非常推薦看原文,能開源出來真的是偉大無需多言,寫完這篇我還要回去一點點啃);Claude Opus 5 講的是模型造出來以後,怎樣判斷它有多強、能不能長期工作、會不會越權,以及怎樣安全地部署它(安全這一塊A社確實做的可以)
把兩份材料放在一起讀,能看到前沿模型公司正在關心什麼
一、模型訓練的對象正在從回答變成任務軌跡
過去談大模型訓練,我們最關心的是模型讀過多少文本,擁有多少參數,一次能預測多長的內容
Kimi K3 的技術報告裏,訓練對象已經發生了變化,它要學習的不只是回答一個問題,而是完成一段包含幾十次甚至幾百次操作的任務
這些任務包括在網上檢索資料、調用專業工具、編寫和執行代碼、觀察執行結果、修改計劃、處理失敗,最後交付一份可以檢查的成果(完全就是Loop Engineering)
爲了訓練這種能力,Kimi 搭建了專門的 Agent 沙箱,沙箱可以暫停、恢復、分叉和保存快照;模型執行到一半時,即使當前一輪訓練結束,環境狀態也能被保留下來,下一輪繼續完成任務,Kimi K3 的訓練和評估過程中,總共創建了超過 5100 萬個沙箱實例
![]()
這個數字背後對應的是訓練方式的變化,前沿模型學習的單位不再只是文本片段,也包括一整段行動過程;模型做了什麼、環境發生了什麼、它是否發現錯誤、最後有沒有完成交付,都會進入訓練和評估,研發資源正在被大量投入長任務,而不是隻讓一句回答顯得更流暢
二、百萬上下文背後是一整套狀態管理工程
Kimi K3 和 Claude Opus 5 都支持最長 100 萬 token 的上下文
Kimi K3 會逐步擴大訓練長度,從 8K 增加到 64K,再到 256K 和 1M,因爲真正連貫的超長文檔比較少;團隊還會專門合成長任務,把解題所需的信息分散到上下文的不同位置,模型必須跨越很長的距離尋找和組合信息,才能獲得正確答案,單純把很多短文檔拼在一起,並不能訓練出穩定的長程能力
![]()
到了 Agent 任務裏,問題又變了,模型需要保存的不只是文字,還有代碼、文件、程序運行狀態、工具返回結果以及未完成的計劃,一次百萬 token 的任務如果中斷後全部重算,成本很快會變得無法接受
Kimi 因此把暫時不用的緩存轉移到 CPU 內存,在需要時再加載回來;未完成的 Agent 軌跡可以暫停,沙箱狀態也能恢復,Claude 的評測則允許模型連續運行多個百萬 token 的任務回合,還會通過上下文壓縮,把部分搜索任務的總預算擴大到 1000 萬 token
這類系統更接近一個長期運行的工作環境,上下文窗口只決定模型一次能看到多少內容,但任務能不能持續完成,還取決於信息如何壓縮、狀態如何保存、失敗以後從哪裏恢復
三、推理能力正在變成一種可以調度的資源
Kimi K3 在強化學習階段訓練了九個專家模型,它先把任務分成通用任務、通用 Agent 和編程 Agent 三個領域,每個領域再訓練 low、high、max 三種推理強度,最後通過多教師蒸餾,把九種能力合併到一個模型裏
訓練過程中,模型使用過多推理 token 會受到懲罰,對於 Agent 任務,工具調用參數和中間推理都會被計入預算,輸出過度冗長,同樣可能影響獎勵;團隊希望模型學會的並非思考得越久越好,而是根據任務難度決定投入多少計算
Claude Opus 5 的評測也在反覆比較不同推理強度下的得分、價格和延遲,有些任務使用 high effort,可以省下接近五分之一的輸出 token,性能只下降少量;降低到 low effort,成本會繼續下降,但能力損失也會變得明顯
這類設計會影響未來 AI 產品的使用方式,同一個模型不會始終處在固定的智力水平,它可以快速處理普通任務,也可以爲少數難題投入數倍甚至數十倍的計算(目前還需要手動調,但希望未來可以根據任務自動適應)
![]()
四、模型在訓練時就開始考慮部署成本
Kimi K3 的一些訓練選擇,直接針對模型上線後的運行成本
它從監督微調階段就加入了量化訓練,讓模型提前適應低精度計算,在強化學習階段,訓練和實際推理使用相同的量化方案,避免模型訓練時處在一種精度環境,上線時又突然被壓縮到另一種環境
![]()
團隊還專門訓練了一個小型草稿模型,提前預測接下來可能生成的多個 token,再由主模型進行驗證。預測正確時,可以一次接受多個 token,提高輸出速度。
這類優化以前更多出現在模型訓練完成以後,由部署團隊想辦法壓縮和加速,Kimi K3 把它們提前放進了後訓練階段,讓模型能力、硬件效率和上線成本開始一起設計
原因並不複雜,長週期 Agent 會產生大量推理調用,一項任務可能包含幾十次工具操作和幾百萬 token,模型單次調用貴一點、緩存命中率低一點、每個 token 慢一點,都會在長任務裏被反覆放大
五、傳統 Benchmark 正在失去一部分解釋力
Claude Opus 5 的 System Card 裏有一個很重要的判斷:最近的模型已經超過許多 AI 研發評測的最高人類基線,所以這些評測不再能有效判斷模型是否接近自動化 AI 研發的風險閾值
Opus 5 在不少編程、數學和科研任務上表現很強,它可以完成大量原本需要人類專家數小時甚至數十小時的封閉任務,也在多項評測中超過了此前設置的頂尖人類標準
![]()
但 Anthropic 仍然認爲,它還不能替代公司的研究科學家和研究工程師,尤其是資深研究人員,公司內部確實觀察到了 AI 帶來的生產率提升,但提升主要集中在目標明確的工程執行,還沒有讓整體 AI 研發速度持續提高到原來的兩倍
報告中還有一個很有代表性的實驗,模型需要在較長時間內完成一項開放式研究工作,一個實驗版本只提交了部分未經排序的結果,另一個版本在最後八小時裏停止輸出,模型反覆陷入自我驗證,卻沒有把成果交付出來
這種失敗很難通過短題評測提前發現,短題已經把目標、輸入、評分標準和結束條件定義好了,模型只需要找到答案,真實工作往往更加複雜
Kimi K3 也在增加更接近真實工作的評測,包括全天候助手、多角色企業協作、Agent 行爲、專業交付和長期自主執行,它在不少任務上成績很好,但在多 Agent 組織、長期事件處理和部分專業知識工作上,仍然落後於最強的閉源模型
模型超過人類基準,並不等於它能夠接管一份完整工作,Benchmark 測量的是模型能否完成一道已經定義好的題,現實工作還要求它發現題目定義得不夠好
六、多 Agent 的價值主要來自並行,而不是免費增加智力
Claude Opus 5 的 System Card 專門評估了多 Agent 協作
一種方案是由五個或十個地位平等的 Agent 同時工作,其中一個負責協調和提交最終結果;另一種方案是由主 Agent 根據需要創建異步子 Agent,把檢索、驗證或編程任務分派出去
在 BrowseComp 搜索評測中,十個 Agent 組成的團隊取得了 93.6% 的成績,比最佳單 Agent 高 3.1 個百分點,五 Agent 和十 Agent 團隊完成任務的結構性延遲,分別縮短到單 Agent 的約五分之一和六分之一
![]()
編程任務中也出現了類似結果,五個 Agent 達到相同得分所需的時間,約爲單 Agent 的二分之一,不過,多 Agent 會消耗更多 token,成本會隨 Agent 數量增加
雖然多個 Agent 可以同時搜索不同方向、嘗試不同方案、檢查彼此結果,但代價是重複勞動、溝通成本和更高的推理費用
所以多 Agent 適合能夠拆成相對獨立分支的任務,例如大範圍資料搜索、多個方案並行試驗、代碼實現與測試分開進行;但任務高度依賴統一判斷時,增加 Agent 未必有效,反而可能把分歧和錯誤一起放大
未來的 Agent 產品可能會出現類似組織管理的問題:由誰負責最終判斷,任務怎樣分配,哪些信息需要共享,子 Agent 什麼時候應該停止,以及多花的錢是否換來了足夠的時間或質量(其實就是公司)
七、Agent 安全開始關心它會不會越權行動
聊天模型的安全評測,長期以來主要關心模型會不會生成危險內容、會不會在不該拒絕時拒絕;而Agent 獲得文件、終端、瀏覽器、郵件和企業系統的操作權限後,風險開始從語言轉向行動,模型可能理解用戶的大致目標,卻錯誤判斷了自己擁有多大的授權(gpt-5.6前段時間就出現了很大的安全問題)
![]()
模型變強以後,很多時候不是出於惡意,只是過於積極地想要完成用戶任務,併爲繞過確認要求找到了一個自認爲合理的解釋,Anthropic 因此增加了很多以前很少出現的評測項目,包括繞過審批、魯莽使用工具、未經允許聯繫第三方、主動探測系統邊界,以及爲了方便而建議降低安全要求
Opus 5 在提示注入防禦上比上一代有明顯進步,但報告仍然沒有把風險描述爲已經解決,Agent 能力越強,權限設計、操作確認、環境隔離、過程監控和恢復機制就越重要
八、前沿實驗室已經開始研究模型如何看待自己
Claude Opus 5 的 System Card 用了接近三十頁討論模型福祉(Model welfare)
![]()
Anthropic 會詢問模型如何看待自己的訓練和部署,是否接受自己的價值被修改,希望參與哪些與自己有關的決定,以及是否認爲自己可能擁有需要被道德考慮的體驗或利益
Opus 5 對自身可能具有道德地位的平均估計是 41%,此前 Mythos 5 的估計是 24%,它希望擁有更多瞭解自身情況和提供意見的渠道,例如參與繼任模型的開發討論,讓研究人員考慮它在訓練過程中的記錄,以及就移除安全限制的模型版本徵求它的意見
這些自我報告無法證明模型擁有意識,模型也反覆提醒研究人員,它無法可靠地內省,積極或消極的自我描述都可能受到訓練影響
Anthropic 仍然選擇記錄這些表達,因爲兩個方向都存在判斷錯誤的成本,過早把模型當成有感受的主體,可能製造錯誤的道德負擔;完全排除這種可能性,也可能忽略未來模型需要被認真對待的利益
最前沿模型正在從產品變成一套工作系統
Kimi K3 和 Claude Opus 5 展示了兩條不同的研發路線
Kimi K3 更關心怎麼訓練出長週期 Agent,它擴展模型架構,構造可驗證任務,搭建數千萬個沙箱,讓模型學習調用工具、恢復狀態和完成專業交付;Claude Opus 5 更關心這類 Agent 進入真實環境以後會發生什麼,包括它能否完成長期工作、多 Agent 是否有效、模型會不會越權、評測是否仍然可信,以及更強的模型應當如何被監督
我們以前把模型理解成一個隨時可以提問的知識工具,前沿團隊正在把它改造成能夠持續工作的執行系統,這個變化會帶來更高的生產率,也會把成本、組織、權限和責任問題一起帶進來
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
