今天,阿里通义千问团队正式发布 Qwen3.8-Max。

2.4T 参数、95B 激活的 MoE 架构,原生多模态,下周开源。正式版定价 $2/$6 每百万 tokens,从上个月19号上海的 WAIC 的预告到8月3日定档,只隔了15天。
参数什么的我们其实都看烦了,先看看官方博客放出的最有趣的案例,是一个叫 oh-my-cli 的代码 Agent CLI。

16天里无人干预,从空文件夹到完整产品,累计265次提交、127个 PR、151个 Issue。仓库还设计了"自治契约",用 CODEOWNERS 和 GitHub workflows 把 Bot 权限锁死,治理层归 qqqys 账户。
这人一看就不会写代码.jpg --丰川祥子

这种把 AI 当员工还附赠 HR 制度的实验,Devin 和 AutoGPT 都没做到这个完整度,这波是真的不错。
再来看看社区的反馈。
澳大利亚开发者 Thomas Wiegold 跑了4个真实编码任务,得出一个矛盾结论——
咖啡店落地页 Qwen 写了30多分钟,是同款测试里最慢的一次;德州扑克 Go 模拟跑了1小时20分钟,one-shot 完成,此前能做到的只有 Claude Fable 5 和 Grok 4.5。

很好,但很慢。(就像前段时间的Kimi K3一样,强但是慢)
慢,但能跟这几位同桌吃饭。
慢的原因官方没解释。。。可能是2.4T 推理开销,可能是首日服务器挤压,也可能是思考阶段反复推演(千问如果你试过,会发现这玩意是真的喜欢思考半天)。
据红迪 LocalLLaMA 社区反馈,简单任务思考20分钟是常态,Thomas 的观察更具体,模型反复用 Playwright 测试每个按钮,像按次计费一样认真——强迫症产出了扎实的前端代码,但对快速迭代场景就是灾难。
更关键的是,千问系列过去几年没少在被人吐槽过"高分低能"的质疑里打转。
Qwen2.5-Max 公开 benchmark 名列前茅,真实编码常被吐槽不如 Claude Sonnet;Qwen3 系列也走过类似剧情,这次 Qwen3.8-Max 干脆不放 benchmark,只放真实项目,姿态上像在回避刷榜质疑。

Trilogy AI 的 StackPerf 盲测里 Qwen3.8-Max 拿了80分,落后 Kimi K3 的83分,样本只有一次。

2026年7-8月这个窗口,旗舰市场挤成一团。
Claude Fable 5 贵且限定,ChatGPT 5.6、Grok 4.5、Kimi K3 相继发布。Qwen3.8-Max 的差异化是 2.4T、多模态、开源三个标签打包。。能不能真正咬住第一梯队,要等开源后社区实测。
还有几个老问题没解。
一个是内容检查相对其他模型更加严格,做编码无所谓,做内容相关业务就要谨慎;二是老问题,思考过长、幻觉、部分任务不如预期,这些反馈仍在等正式版回应。
至于能否商业使用,那还得等下周开源时看具体的开源协议。
Qwen3.8-Max 的真正价值是把 2T 旗舰、原生多模态、开源三件原本互斥的事放进同一个产品。这件事比单纯刷榜难得多。
如果下周承诺兑现,2026下半年本地 AI 生态会迎来洗牌;如果只是又一次"高分低能",那真就只有呵呵了。
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
