AMD 買下"把模型蝕刻進硅片"的公司:1.7萬 token/s,快 GPU 48 倍

AMD 週四收盤後官宣收購 Taalas——一家把 AI 模型權重直接蝕刻進硅片的公司。沒披露金額,但確認是真收購不是"買團隊"。這波對標的是去年 12 月 Nvidia 花 200 億美元跟 Groq 籤的授權協議:都是給 AI agent 場景做"高端推理"。

傳統 GPU 推理的瓶頸在帶寬:權重存顯存裏,每生成一個 token 都要去取一遍,取權重比算數還慢。

Taalas 的思路反着來:權重直接蝕刻進硅片(mask-ROM),取權重這一步直接不存在了。芯片分兩塊:蝕刻權重的 mask-ROM 區域 + 存 KV cache 和微調的 SRAM 區域。

📰 The Register 原文:"Initial benchmarks saw the chip serve Meta's Llama 3.1 8B at a blistering 16,960 tokens a second — when announced last February, that was 48x faster than Nvidia's GPUs and 8.5x faster than Cerebras' accelerators." 翻譯:"實測這顆芯片跑 Llama 3.1 8B 達到每秒 16,960 token——去年 2 月公佈時,比 Nvidia GPU 快 48 倍,比 Cerebras 快 8.5 倍。"

這不是 PPT:Taalas 去年 2 月就在 TSMC 6nm 上流片了第一顆測試芯片 HC1,數據是實打實跑出來的。第二顆 HC2 今年夏天出,單芯片 20B 參數,50 顆拼起來能頂萬億參數模型。

AMD 的打算:Helios 機架(Instinct GPU)跑 prompt 處理,Taalas 芯片跑 token 生成——各幹各的強項。OpenAI、Anthropic、Meta 都是 Instinct 客戶,推理服務商直接在隔壁。

但有個要命的代價:芯片鎖死模型。 權重蝕刻進去就改不了了,模型一更新就得重新流片。緩解方案:re-spin 只改兩層金屬層,蝕刻一個模型比訓練它便宜 100 倍——所以只有"模型穩定 + 海量部署"才划算。

HN 吵翻了:有人說"模型 churn 這麼快,硅片出來時模型都過時幾代了",有人反駁"企業要的是完全私有的盒子,把 GLM 5.2 塞進去賣不要太香"。最騷的猜想是這句——"未來就是基礎模型 ASIC + 物理 LoRA 適配卡,換模型像給顯卡插拔卡"。

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com