再見ChatGpt&Claude|AI綜合評價|節省token|Deepseek v4.1

我的文章, 僅以個人獨立開發者的視角出發, 不適用於企業級用戶

9月第二篇文章 | 新遊戲火速開發中 | 從0開始Agent構建代碼庫 | 多AI評價 | Deepseek v4.1 flash

本篇文章大概內容:

  1. ChatGpt | Claude 仍然是最強的雙子星, 但我還是停止續費了.

  2. top2 之後的AI評價 | 國產AI 最新評價

  3. Deepseek v4.1 Flash評價

  4. Vibe Code 到底如何省錢

近期高強度使用的AI:

國外:

  • Grok4.6

  • Gemini 3.8 Flash

國內:

  • Qwen3.8 Max

  • Kimi k3

  • GLM 5.3 Flash

  • Deepseek v4.1 Flash

前言

明確:

#####################

每個模型, 都有各自的強項, 我口中的 強|弱 都只是針對 個人獨立開發者分別的 策劃任務 | 代碼任務

例如之前文章提到的 kimi k3 強, 僅僅是針對, 策劃任務

#####################

"面試造火箭, 工作擰螺絲" 不是一句調侃

高難度代碼是僞命題,

即使把 12306, 微信, 支付寶的代碼庫打開, 95%以上的代碼, 也都是簡單的基礎代碼, 輪子的複用.

#####################

Claude

這個放在前面罵, 也是因爲可以說的內容不多(罵累了)

Claude在各種榜單還是屠榜的存在, 所以我寧願相信他是檢測到簡體中文所以才降智

IP如果有問題大不了直接給我封號, 但是也沒封號, 就純噁心人來的. 如果你的opus沒降智, 那還可以用.

ChatGpt

一句話: 很強, 過於強了, 用起來很累.

  • GPT 6 Astra 的確很強, 但是很貴, 20$訂閱, 兩條10分鐘的任務5小時額度就空了

  • GPT 5.6 Sol 也很強, 但是其他AI 已經幾乎可以平替了

GPT 6價格貴, 並不是取消訂閱的原因. 只是剛好讓我放鬆思考, 到底是否還有必要繼續用GPT

GPT 仍然是極其聰明, 能力極其強, 絕對的頂級模型, 但是當前他的能力, 已經超出了一個個人開發者的上限, 

簡單來說, 限制ChatGpt所花費的精力 已經超過 讓其他AI更聰明所花費的精力.

我只需要 80分的代碼, ChatGpt會寫出120分的代碼, 我需要花40分的精力去限制

其他AI, 能寫出70分的代碼, 我只需要花費10分的精力, 就可以出滿意的代碼

其他AI

主力開發:

  • 60% -> Grok4.6

  • 20% -> Deepseek v4.1 Flash

  • 20% -> GLM 5.3 Flash

Grok 4.6

之前一直有人問, 高強度vibe code, 一個月500以內是怎麼做到的.

Cursor 仍然是目前, 綜合'能力, 價格, 速度', 潑水式開發的最優選擇.

搭建好整個項目的 MVP原型, 月度25%的額度就能完成, 且代碼速度極快, 可以大幅度節省時間

最關鍵: 沒有5小時限額

Deepseek v4.1 Flash

極快的速度, 極低的價格, 代碼能力據說達到 GPT5.6 Sol 的水平.

日常使用沒有太大感覺, 沒有感覺很牛, 也沒有感覺到哪裏有問題, 但其實能做到這點, 然後結合價格, 可以說一句很強了.

但是剛出不久, 還有待觀察是否會降智.

任何模型公佈的第一週一般都是極強的

GLM 5.3 Flash

與 Deepseek v4.1 Flash 評價一致, 速度很快, 價格很低, 沒感覺好, 也沒感覺到壞.

然後結合價格和速度, 就很強.

Qwen3.8 Max | Gemini 3.8 Flash

只用來構建遊戲的UI, 繪製 svg, 基本不用來寫邏輯代碼. 因此也只針對這個維度進行評價.

視覺識別能力, 審美能力的頂級模型

可以跟 fable5 | GPT 6 坐一桌的模型

沒討論綜合代碼能力, 僅討論審美能力, 識別截圖->設計或優化遊戲界面的能力

kimi k3

仍然只用來使用策劃任務, 文檔編輯任務

代碼任務不做評價, 沒用過, 而且跑代碼價格貴出天

幻覺極低, 上下文的遵守很讓人滿意. (反面案例是 Gemini, 50%的上下文使用量, 前面提到的內容基本就開始錯亂了)

在 創意性 和 胡亂鬼扯胡編亂造 之間, 平衡度比較好.

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com