DeepSeek 開源昇騰全套基礎組件,聯合華爲推進 128 卡超節點

有了國產 AI 芯片,怎麼才能把它的算力真正用起來?DeepSeek 這次開源,補上了一批關鍵的軟件工具。

他們面向華爲昇騰平臺,開放了高級編程語言工具、計算庫和分佈式通信庫,與此前英偉達平臺上的開源組件一一對應。

爲什麼這些東西重要?

你可以把 AI 芯片想成一座工廠。硬件決定工廠裏有多少機器,軟件決定任務怎麼分、數據怎麼送、機器能不能高效運轉。機器再強,調度跟不上,也可能一邊忙、一邊等。

阿梨調整任務分配,讓芯片工廠的機器協同運轉

這次的核心工具,叫 TileLang

開發者寫一個計算任務,既要表達“算什麼”,還要考慮“怎麼讓芯片算得快”。TileLang 希望用更簡單的編程方式,降低寫高性能代碼的難度,同時保留針對芯片特點進行優化的能力。它已經正式支持昇騰 950

TileLang 項目說明

根據 DeepSeek 的公告,TileLang 已經承載了 V4 系列模型訓練中大部分算子的實現。所謂算子,可以理解成模型運行時的一道道計算工序。 這次的昇騰版本,對底層 Ascend C 指令進行了封裝。按照公告,目前 DeepSeek 訓練中用到的每一個 TileLang 算子,在昇騰上都有對應的高性能實現

TileLang 簡化算子編寫,同時保留面向昇騰的優化能力

除了方便開發,還需要把具體的計算和通信做好。

DeepGEMM 負責加速矩陣運算,這是大模型計算中的基礎工作。DeepEP 負責跨設備通信,讓多張芯片協作時,更高效地交換數據。畢竟,一張卡算得快,很多張卡一起工作,還得看數據傳得快不快。DeepGEMM、DeepEP

另外,TileKernels 提供常規的向量計算和數據讀寫算子;FlashMLA 提供稀疏注意力算子,幫助提高長上下文處理效率;DeepSelect 則負責高效篩選數據。TileKernels、FlashMLA、DeepSelect

DeepSeek 表示,在多項關鍵測試用例中,這些組件的計算和通信性能,已經接近硬件上限。這裏說的是特定測試中的表現,實際效果還要結合具體任務來看。

研發過程中,他們也與華爲合作,推進了基於昇騰 950 的一百二十八卡超節點方案,並對計算和通信進行了深度優化。

多卡協作需要同時優化計算和數據交換

所以,這次開源值得關注的,是開發者多了一套可以複用、研究和繼續改進的基礎工具。 從寫計算代碼,到讓多張芯片協同工作,這些環節越完善,國產算力就越容易轉化成實際可用的能力。芯片的潛力,需要軟件一步步把它釋放出來。

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com