有了國產 AI 芯片,怎麼才能把它的算力真正用起來?DeepSeek 這次開源,補上了一批關鍵的軟件工具。
他們面向華爲昇騰平臺,開放了高級編程語言工具、計算庫和分佈式通信庫,與此前英偉達平臺上的開源組件一一對應。
爲什麼這些東西重要?
你可以把 AI 芯片想成一座工廠。硬件決定工廠裏有多少機器,軟件決定任務怎麼分、數據怎麼送、機器能不能高效運轉。機器再強,調度跟不上,也可能一邊忙、一邊等。
![]()
這次的核心工具,叫 TileLang
開發者寫一個計算任務,既要表達“算什麼”,還要考慮“怎麼讓芯片算得快”。TileLang 希望用更簡單的編程方式,降低寫高性能代碼的難度,同時保留針對芯片特點進行優化的能力。它已經正式支持昇騰 950
根據 DeepSeek 的公告,TileLang 已經承載了 V4 系列模型訓練中大部分算子的實現。所謂算子,可以理解成模型運行時的一道道計算工序。 這次的昇騰版本,對底層 Ascend C 指令進行了封裝。按照公告,目前 DeepSeek 訓練中用到的每一個 TileLang 算子,在昇騰上都有對應的高性能實現
![]()
除了方便開發,還需要把具體的計算和通信做好。
DeepGEMM 負責加速矩陣運算,這是大模型計算中的基礎工作。DeepEP 負責跨設備通信,讓多張芯片協作時,更高效地交換數據。畢竟,一張卡算得快,很多張卡一起工作,還得看數據傳得快不快。DeepGEMM、DeepEP
另外,TileKernels 提供常規的向量計算和數據讀寫算子;FlashMLA 提供稀疏注意力算子,幫助提高長上下文處理效率;DeepSelect 則負責高效篩選數據。TileKernels、FlashMLA、DeepSelect
DeepSeek 表示,在多項關鍵測試用例中,這些組件的計算和通信性能,已經接近硬件上限。這裏說的是特定測試中的表現,實際效果還要結合具體任務來看。
研發過程中,他們也與華爲合作,推進了基於昇騰 950 的一百二十八卡超節點方案,並對計算和通信進行了深度優化。
![]()
所以,這次開源值得關注的,是開發者多了一套可以複用、研究和繼續改進的基礎工具。 從寫計算代碼,到讓多張芯片協同工作,這些環節越完善,國產算力就越容易轉化成實際可用的能力。芯片的潛力,需要軟件一步步把它釋放出來。
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
