昨天,OpenAI在Hot Chips上端出了一顆辣椒。
真辣椒倒不至於,是它第一顆自研推理芯片Jalapeño(墨西哥辣椒)。

名字不錯,成績很兇——在GPT-OSS、DeepSeek R1和Kimi K2.5上,它的峯值每瓦吞吐是對比系統的1.5到1.9倍,端到端時延低了1.7到3.6倍,持續功耗還沒超過550W。

不知道你黃叔叔看到這成績,心頭是否會一緊。

但這顆芯片依然很有意思。
首先,這張卡不是通用GPU(簡單理解就不是你可以插上去打遊戲的那種),這張卡的目標就是伺候大模型推理,尤其是Agent。
Jalapeño這次在設計上,把KV cache儘量留在本地,少搬數據,還用一套架構照顧prefill和decode。OpenAI甚至用Codex和GPT-Astra寫kernel,部分選定模塊比專家版本快1.5到1.8倍。
AI設計芯片,芯片再回來養AI,OpenAI也是把之前訓練模型左腳踩右腳昇天那套拿過來了。
而且,想自己掌勺的遠不止OpenAI。

谷歌的Greq,TPU,已經做了十多年,現在第八代已經拆成訓練用的8t和推理用的8i。微軟有Maia,亞馬遜有Trainium和Inferentia,Meta也真的在造,MTIA已經從推薦系統一路發展到了生成式AI推理。
Anthropic倒沒有自己造芯片,它的玩法更像同時辦了好幾張健身卡,AWS Trainium、谷歌TPU、英偉達GPU都用,最近又和AMD簽了最高2GW的MI450系列合作,還讓Claude幫AMD優化ROCm。

連補軟件生態這件苦差事,都開始讓AI自己上了。
那問題來了,大家爲什麼都要自己造卡?
天下苦黃仁勳久矣。

做AI離不開英偉達,難點從來不只是一塊芯片。
回到國內,這種苦又多了一層。
海外廠商主要嫌貴、怕被一家拿住議價權,國內還要面對買不到。所以華爲昇騰的價值,先是能供貨、能組超節點、能把CANN生態做起來,再談單卡跑分。阿里平頭哥的真武、寒武紀的MLU也在往前頂。

沐曦、壁仞、燧原、海光、崑崙芯都有人在做,,,礪算走的是圖形GPU和本地推理路線,不能硬塞進萬卡訓練的擂臺,但從指令集開始重寫一張國產GPU,本身也夠難了。

我並不期待明天突然出現一張卡,把英偉達掀翻在地。
但只要TPU、Maia、Trainium、MTIA、Jalapeño、昇騰和真武們真能分走一部分份額,讓算力便宜一點,讓排隊少一點,讓開發者多一個選擇,我就覺得這是好事。
一家獨佔的鏟子再好,也不如工具棚裏多掛幾把。
希望這盤辣椒,真能炒起來。
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
