Qwen3.8-Max:2.4T旗艦,開源前夜

今天,阿里通義千問團隊正式發佈 Qwen3.8-Max。

圖片

2.4T 參數、95B 激活的 MoE 架構,原生多模態,下週開源。正式版定價 $2/$6 每百萬 tokens,從上個月19號上海的 WAIC 的預告到8月3日定檔,只隔了15天。

參數什麼的我們其實都看煩了,先看看官方博客放出的最有趣的案例,是一個叫 oh-my-cli 的代碼 Agent CLI。

圖片

16天裏無人干預,從空文件夾到完整產品,累計265次提交、127個 PR、151個 Issue。倉庫還設計了"自治契約",用 CODEOWNERS 和 GitHub workflows 把 Bot 權限鎖死,治理層歸 qqqys 賬戶。

這人一看就不會寫代碼.jpg --豐川祥子

圖片

這種把 AI 當員工還附贈 HR 制度的實驗,Devin 和 AutoGPT 都沒做到這個完整度,這波是真的不錯。

再來看看社區的反饋。

澳大利亞開發者 Thomas Wiegold 跑了4個真實編碼任務,得出一個矛盾結論——

咖啡店落地頁 Qwen 寫了30多分鐘,是同款測試裏最慢的一次;德州撲克 Go 模擬跑了1小時20分鐘,one-shot 完成,此前能做到的只有 Claude Fable 5 和 Grok 4.5。

圖片

很好,但很慢。(就像前段時間的Kimi K3一樣,強但是慢)

慢,但能跟這幾位同桌喫飯。

慢的原因官方沒解釋。。。可能是2.4T 推理開銷,可能是首日服務器擠壓,也可能是思考階段反覆推演(千問如果你試過,會發現這玩意是真的喜歡思考半天)。

據紅迪 LocalLLaMA 社區反饋,簡單任務思考20分鐘是常態,Thomas 的觀察更具體,模型反覆用 Playwright 測試每個按鈕,像按次計費一樣認真——強迫症產出了紮實的前端代碼,但對快速迭代場景就是災難。

更關鍵的是,千問系列過去幾年沒少在被人吐槽過"高分低能"的質疑裏打轉。

Qwen2.5-Max 公開 benchmark 名列前茅,真實編碼常被吐槽不如 Claude Sonnet;Qwen3 系列也走過類似劇情,這次 Qwen3.8-Max 乾脆不放 benchmark,只放真實項目,姿態上像在迴避刷榜質疑。

圖片

Trilogy AI 的 StackPerf 盲測裏 Qwen3.8-Max 拿了80分,落後 Kimi K3 的83分,樣本只有一次。

圖片

2026年7-8月這個窗口,旗艦市場擠成一團。

Claude Fable 5 貴且限定,ChatGPT 5.6、Grok 4.5、Kimi K3 相繼發佈。Qwen3.8-Max 的差異化是 2.4T、多模態、開源三個標籤打包。。能不能真正咬住第一梯隊,要等開源後社區實測。

還有幾個老問題沒解。

一個是內容檢查相對其他模型更加嚴格,做編碼無所謂,做內容相關業務就要謹慎;二是老問題,思考過長、幻覺、部分任務不如預期,這些反饋仍在等正式版回應。

至於能否商業使用,那還得等下週開源時看具體的開源協議。

Qwen3.8-Max 的真正價值是把 2T 旗艦、原生多模態、開源三件原本互斥的事放進同一個產品。這件事比單純刷榜難得多。

如果下週承諾兌現,2026下半年本地 AI 生態會迎來洗牌;如果只是又一次"高分低能",那真就只有呵呵了。

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com