今天,阿里通義千問團隊正式發佈 Qwen3.8-Max。

2.4T 參數、95B 激活的 MoE 架構,原生多模態,下週開源。正式版定價 $2/$6 每百萬 tokens,從上個月19號上海的 WAIC 的預告到8月3日定檔,只隔了15天。
參數什麼的我們其實都看煩了,先看看官方博客放出的最有趣的案例,是一個叫 oh-my-cli 的代碼 Agent CLI。

16天裏無人干預,從空文件夾到完整產品,累計265次提交、127個 PR、151個 Issue。倉庫還設計了"自治契約",用 CODEOWNERS 和 GitHub workflows 把 Bot 權限鎖死,治理層歸 qqqys 賬戶。
這人一看就不會寫代碼.jpg --豐川祥子

這種把 AI 當員工還附贈 HR 制度的實驗,Devin 和 AutoGPT 都沒做到這個完整度,這波是真的不錯。
再來看看社區的反饋。
澳大利亞開發者 Thomas Wiegold 跑了4個真實編碼任務,得出一個矛盾結論——
咖啡店落地頁 Qwen 寫了30多分鐘,是同款測試裏最慢的一次;德州撲克 Go 模擬跑了1小時20分鐘,one-shot 完成,此前能做到的只有 Claude Fable 5 和 Grok 4.5。

很好,但很慢。(就像前段時間的Kimi K3一樣,強但是慢)
慢,但能跟這幾位同桌喫飯。
慢的原因官方沒解釋。。。可能是2.4T 推理開銷,可能是首日服務器擠壓,也可能是思考階段反覆推演(千問如果你試過,會發現這玩意是真的喜歡思考半天)。
據紅迪 LocalLLaMA 社區反饋,簡單任務思考20分鐘是常態,Thomas 的觀察更具體,模型反覆用 Playwright 測試每個按鈕,像按次計費一樣認真——強迫症產出了紮實的前端代碼,但對快速迭代場景就是災難。
更關鍵的是,千問系列過去幾年沒少在被人吐槽過"高分低能"的質疑裏打轉。
Qwen2.5-Max 公開 benchmark 名列前茅,真實編碼常被吐槽不如 Claude Sonnet;Qwen3 系列也走過類似劇情,這次 Qwen3.8-Max 乾脆不放 benchmark,只放真實項目,姿態上像在迴避刷榜質疑。

Trilogy AI 的 StackPerf 盲測裏 Qwen3.8-Max 拿了80分,落後 Kimi K3 的83分,樣本只有一次。

2026年7-8月這個窗口,旗艦市場擠成一團。
Claude Fable 5 貴且限定,ChatGPT 5.6、Grok 4.5、Kimi K3 相繼發佈。Qwen3.8-Max 的差異化是 2.4T、多模態、開源三個標籤打包。。能不能真正咬住第一梯隊,要等開源後社區實測。
還有幾個老問題沒解。
一個是內容檢查相對其他模型更加嚴格,做編碼無所謂,做內容相關業務就要謹慎;二是老問題,思考過長、幻覺、部分任務不如預期,這些反饋仍在等正式版回應。
至於能否商業使用,那還得等下週開源時看具體的開源協議。
Qwen3.8-Max 的真正價值是把 2T 旗艦、原生多模態、開源三件原本互斥的事放進同一個產品。這件事比單純刷榜難得多。
如果下週承諾兌現,2026下半年本地 AI 生態會迎來洗牌;如果只是又一次"高分低能",那真就只有呵呵了。
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
