華爲昇騰宣佈已支持RL訓推一致性,實測獲得最高60%性能收益

8 月 6 日消息,強化學習已成爲大模型訓練主流範式,推動模型技術向行業核心場景工程化落地。其中,訓推一致至關重要,因推理與訓練過程耦合,基礎設施差異易放大不確定性。

華爲計算官方 8 月 5 日宣佈,昇騰基於 Ascend C 編程語言提供完整訓推一致算子集,在 Qwen3-30B MoE 模型上的測試實現 Logdiff 爲 0,並通過昇騰親和的 FA 算子優化,在 Eager 模式下獲得 20%-60% 性能收益,爲開發者提供高效可靠的強化學習訓練方案。

RL 後訓練訓推不一致最根本的原因,是底層計算時累加不保序。若要從上到下保證訓練引擎與推理引擎每一次累加順序一致,需要框架側與算子側同時發力。模型參數越大,問題會進一步放大:張量並行、專家並行等切分策略,以及集合通信路徑,任一環節對不齊,都無法做到最終的 true-on-policy。算子還需要覆蓋多種調用場景,在關鍵計算步驟上施加約束,同時把性能損失控制在可用範圍內 —— 這是一項系統性工程挑戰。

訓推不一致,指的是 Rollout(推理)引擎與訓練引擎之間的數值不一致性。即使兩者使用完全相同的模型權重,對相同 Token 序列計算得到的對數概率(logprob)也可能存在細微差異;該差異通常用 logdiff 衡量。

昇騰基於 Ascend C 編程語言對訓推鏈路中的關鍵算子做了系統性約束與對齊,核心思路是:讓訓練與推理在「該累加的地方」走同一套數值路徑,主要涉及如下 4 個修改:

統一注意力語義:對齊訓練掩碼 Softmax 與推理逐步注意力在有效位置上的計算範圍,消除因可見 Token 集合不同帶來的數值差。

鎖定 reduce 累加序:約束訓練 FA、推理 PFA / PagedAttention 在規約維度上的切分與歸約順序,避免「同模板不同切分」導致的累加不保序。

對齊在線 Softmax 分塊策略:統一分塊大小與歸約節奏,避免 decoder 側多塊合併 Softmax 與訓練側分塊 Softmax 不一致。

對齊關鍵路徑精度:在 Softmax 累加等敏感步驟上統一精度轉換策略,減少混合精度實現差異引入的尾數誤差。

在此基礎上,再配合 FA 下發與調度優化,使訓推一致不再以顯著性能回退爲代價,從而在實測中同時拿到 logdiff=0 與端到端加速。

華爲宣佈相關基礎設施已開源,還將上線“訓推一致問題識別 Skill”,支持排查殘餘 logdiff、定位是算子路徑問題還是框架實現差異。

附開源地址如下:

https://github.com/verl-project/verl-ascend-recipe/tree/main/true_on_policy

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com