一、這次到底測了哪些模型?
滿分均爲100分 測試模型爲:
GPT-5.5(殺死比賽)
Claude Opus 4.8(法務AI)
Gemini 3.5 Pro(小吉米)
grok4.3(AI女友)
DeepSeek V4 Pro(鯨魚)
Kimi K2.6(哈基米)
Qwen3.7-Max(阿里太子)
GLM-5.2(特靠“譜”)
Qwen3.6-Max(阿里太子)
豆包2.1付費版(“豆”戰勝佛)
Claude Fable 5(寓言5)
Llama 4(羊駝 4)
Nemotron 3 Super(牛魔)
MiniMax M3(M3)
雷達圖與分數並非對比,而是相較於自身對應的能力(50%靠權威的AI模型綜合排行網站,10%來着模型的官方文檔,35%來着國內外用戶的真實體驗討論,剩下5%個人體驗)
GPT-5.5(OpenAI) OpenAI綜合全能旗艦,AA Intelligence Index全球第二。推理、代碼、多模態與Agent四項維度全部突破滿分邊界,創意寫作是目前全球公認的基準水準,綜合均衡性極強,幾乎沒有明顯軟肋。適合英文環境下需要一站式處理複雜任務的高級用戶、內容創作者與全棧開發者。中文理解明顯偏弱是最大短板,國內用戶體驗打折;定價$5/$30在主流前沿中偏高。近期已在代碼、Agent等維度被Claude Fable 5追平甚至超越,但整體仍處頂級行列。(GPT5.6普通用戶用不了)
![]()
Claude Opus 4.8(Anthropic) Anthropic工程向旗艦,AA Intelligence Index全球第一。代碼與Agent雙突破邊界,SWE-Pro 69.2%領先GPT-5.5,是重型編程任務與複雜工作流自動化的頂級選擇,尤其適合職業開發者和AI工程師。短板非常明顯:多模態僅66分是同級最低,中文能力極弱;創意寫作比Opus 4.6/4.7系列更趨保守,有明顯退步。推理也突破邊界,但均分因多模態拉低。若主力場景是代碼與Agent,沒有更好的選擇;若需要多模態或中文,則幾乎不適用。
![]()
Gemini 3.5 Pro(Google) Google多模態旗艦,2026年5月I/O大會發布,目前仍處Vertex有限預覽階段。多模態維度突破滿分邊界(106分),是當前視覺、音頻、圖文混合理解最強的模型之一;2M超長上下文目前全球最長。最適合多模態內容理解、超長文檔分析、跨模態研究場景,以及需要Google生態深度集成的開發者。中文能力偏弱,代碼能力中等。正式GA尚未到來,穩定性與可用性待驗證,現階段只推薦願意嚐鮮的技術用戶提前上手。
![]()
Grok 4.3(xAI) 馬斯克旗下xAI出品,主打差異化路線。私密內容生成維度獨家突破邊界(118分),是所有主流大模型中內容尺度最大的選擇;推理能力BenchLM全球第六。數學AIME接近滿分但評分體系保守,實際數學能力被低估。整體偏科明顯,多模態偏弱,中文理解是14個模型中最弱。適合對內容自由度有要求的英語成人內容創作者、以及需要長上下文(93分)推理的英文用戶。國內用戶除非有明確的特定內容需求,否則性價比不高。
![]()
DeepSeek V4 Pro(深度求索) 國內深度求索出品的純文本旗艦,數學與推理雙雙突破滿分邊界,IMO 2025金牌級水準。完全無多模態能力(0分)是最明顯短板,但對純文本場景幾乎沒有影響。開源路線配合極低API定價,令全球開發者追捧。中文與多語言理解紮實(89分),是雙語場景的高性價比之選。最適合學術研究者、數學/科研場景、追求低成本高性能的開發團隊。AI自行判斷力偏弱(72分),複雜Agent任務建議謹慎。綜合而言是純文本場景最高性價比選擇之一。
![]()
Kimi K2.6(月之暗面) 月之暗面出品,專攻代碼與Agent方向。SWE-Bench Verified 80.2%,BenchLM編程全球第七(89.8分);最亮眼的是Agent Swarm架構支持300子代理並行,BrowseComp 86.3%,是多代理協同任務的國內最強選手。中文與多語言能力紮實(82分)。多模態幾乎空白(48分),推理偏弱(68分),上下文256K在180K後質量明顯衰減。最適合國內代碼開發者、多Agent工作流工程師與需要高性價比代碼能力的中文用戶,是DeepSeek以外最值得關注的國產開發者工具。
![]()
Qwen3.7 Max thinking(阿里巴巴) 阿里通義系列思考模式旗艦,AA Intelligence Index全球第五(56.6分)。中文理解與多語言能力全球一流(91分),是最適合華語用戶的前沿模型;推理、代碼(97分)、Agent三端全面均衡出色。35小時持續自主編碼任務驗證了1M上下文的實際可用性。完全無多模態能力(0分),API獨家閉源不開放權重。最適合中文內容創作、雙語研究、代碼輔助與智能體場景的國內專業用戶。若你主要用中文且需要頂級推理能力,Qwen3.7 Max是目前最優先的國產選擇。
![]()
GLM-5.2(智譜 Z.AI) 智譜AI出品,BenchLM全球第四(91分),MIT協議開源是最大亮點。Code Arena百萬用戶真實盲測全球第一,代表工程實戰場景中最被認可的代碼能力;AIME 99.2%數學接近滿分,1M上下文真實經過驗證可用。代碼、推理、數學、長上下文四維全面均衡,Agent也突破邊界(102分)。完全無多模態,推理速度偏慢是主要體驗瓶頸。最適合追求開源+高能力的企業開發團隊與高校研究機構,私有化部署友好,是目前開源陣營綜合實力最接近頂尖閉源模型的選手。
![]()
豆包seed2.1 付費版(字節跳動) 字節跳動出品,中國月活用戶最多(3.45億),是最具本土化深度的AI產品。多模態視覺理解多項全球最佳(82分),HLE-text 54.2全球最高,是國內多模態任務的首選。中文與多語言理解紮實(80分),AI自行判斷力中等(84分)。主要短板是Agent能力(34分,全系最低)、推理(69分)與代碼(61分),在專業開發者場景中明顯落後前沿。最適合普通中國用戶的日常對話、圖片分析與中文內容生成,付費版68-500元/月分三檔。想要順手好用的中文AI助手,豆包是最成熟的選項。
![]()
Claude Fable 5(Anthropic) Anthropic Mythos系列首個公開模型,當前全球代碼能力毫無爭議第一。SWE-Pro 80.3%,領先第二名整整11個百分點;BenchLM全球第二(95分);推理、代碼、數學、判斷力、Agent五項維度全部突破滿分邊界,是均衡性與峯值同時達到頂點的旗艦。適合最頂級需求的代碼工程師、AI研究人員與追求極限性能的企業。關鍵限制:6月12日因美國出口管制暫停全球訪問,恢復時間未知;定價$10/$50是所有模型中最高。中文與多語言偏弱(62分)。解除管制後將是無可爭議的全球最強。
![]()
Llama 4 Maverick(Meta) Meta開源旗艦,BenchLM僅17分(全球#118),2026年已嚴重落後前沿,代碼23分、推理35分、數學35分均墊底。若單看能力,是14個模型中最弱的選手。真正的價值在開源生態:400B總參/17B活躍的MoE架構開放權重,支持完全本地化私有部署,無API調用費用。適合對能力要求不高但需要數據安全/私有部署的傳統企業,以及在意開源許可的研究者。1M上下文理論值但質量差,多模態有但極弱。下一代Behemoth旗艦遲遲未發,Meta在前沿競爭中已大幅落後。
![]()
Nemotron 3 Super(NVIDIA) NVIDIA推出的開源代碼特化模型,120B總參/12B活躍MoE架構。開源模型中SWE-V 60.47%目前最高,是純開源陣營代碼基準分最好的選手;Mamba-2混合架構帶來5倍推理吞吐量,算力效率突出。完全無多模態(0分),推理(65分)與數學(55分)偏弱,多語言僅40分是明顯短板。完全免費開源。最適合追求極致吞吐效率、以代碼推理爲主、GPU算力充裕的本地化部署團隊,是NVIDIA佈局大模型推理生態的重要戰略產品,對NVIDIA硬件用戶有額外的適配優化優勢。
![]()
MiniMax M3(MiniMax) MiniMax出品,首個同時具備前沿代碼+1M上下文+原生多模態三項能力的開源模型,MIT協議。打破了開源模型"三選二"的長期困境,BenchLM全球第25(78分);SWE-V 80.5%成績亮眼,SWE-Pro 59.0%。定價極低$0.30/$1.20,是同等能力中最便宜的選項之一。各維度均衡但峯值不突出,沒有任何一項能力處於全球前列。最適合預算有限、需要一個模型覆蓋代碼+長文本+視覺多種場景的中小企業和獨立開發者。若你只能選一個低價全能開源模型,MiniMax M3目前是最成熟的方案。
![]()
MiMo-V2.5 Pro(小米) 小米AI生態核心旗艦,整體能力均衡紮實。Agent智能體(93分)與推理(86分)、代碼(86分)三端均衡領先同級競品,TAU2 94.2%,1M上下文已實測可用。GPQA 86.6%科學推理中上,定價$1/$3極具競爭力。完全無多模態能力(0分)是唯一明顯短板,中文與多語言中等(75分)。最適合小米生態用戶、追求低成本純文本中文場景的個人開發者與初創團隊。在國產中等規模純文本模型中綜合性價比最爲突出,若預算有限又需要穩定的推理與Agent能力,是被低估的優質選擇。
![]()
AI智能綜合分析指數
![]()
不要小瞧幾分之差 AI模型每差1分,背後都是幾萬次推理的碾壓,都是各有所長
分數是片面的 只有自己用的感受纔是最重要的!沒有標準答案
![]()
以上就是2026年6月國內外14個AI模型的權威數據對比分析。所有數據分爲實際測試和官方數據、反覆校驗,耗時良久整理。
如果這份詳細對比對你有參考價值,懇請大家關注支持。你的每一份認可,都是我持續深耕AI數據調研、輸出高質量內容的最大動力,衷心感謝!(^🙏^)
後續的DeepSeek v4.1、GPT5.6、可能凱旋歸來的Claude Fable 5 我將第一時間報告
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
