再见ChatGpt&Claude|AI综合评价|节省token|Deepseek v4.1

我的文章, 仅以个人独立开发者的视角出发, 不适用于企业级用户

9月第二篇文章 | 新游戏火速开发中 | 从0开始Agent构建代码库 | 多AI评价 | Deepseek v4.1 flash

本篇文章大概内容:

  1. ChatGpt | Claude 仍然是最强的双子星, 但我还是停止续费了.

  2. top2 之后的AI评价 | 国产AI 最新评价

  3. Deepseek v4.1 Flash评价

  4. Vibe Code 到底如何省钱

近期高强度使用的AI:

国外:

  • Grok4.6

  • Gemini 3.8 Flash

国内:

  • Qwen3.8 Max

  • Kimi k3

  • GLM 5.3 Flash

  • Deepseek v4.1 Flash

前言

明确:

#####################

每个模型, 都有各自的强项, 我口中的 强|弱 都只是针对 个人独立开发者分别的 策划任务 | 代码任务

例如之前文章提到的 kimi k3 强, 仅仅是针对, 策划任务

#####################

"面试造火箭, 工作拧螺丝" 不是一句调侃

高难度代码是伪命题,

即使把 12306, 微信, 支付宝的代码库打开, 95%以上的代码, 也都是简单的基础代码, 轮子的复用.

#####################

Claude

这个放在前面骂, 也是因为可以说的内容不多(骂累了)

Claude在各种榜单还是屠榜的存在, 所以我宁愿相信他是检测到简体中文所以才降智

IP如果有问题大不了直接给我封号, 但是也没封号, 就纯恶心人来的. 如果你的opus没降智, 那还可以用.

ChatGpt

一句话: 很强, 过于强了, 用起来很累.

  • GPT 6 Astra 的确很强, 但是很贵, 20$订阅, 两条10分钟的任务5小时额度就空了

  • GPT 5.6 Sol 也很强, 但是其他AI 已经几乎可以平替了

GPT 6价格贵, 并不是取消订阅的原因. 只是刚好让我放松思考, 到底是否还有必要继续用GPT

GPT 仍然是极其聪明, 能力极其强, 绝对的顶级模型, 但是当前他的能力, 已经超出了一个个人开发者的上限, 

简单来说, 限制ChatGpt所花费的精力 已经超过 让其他AI更聪明所花费的精力.

我只需要 80分的代码, ChatGpt会写出120分的代码, 我需要花40分的精力去限制

其他AI, 能写出70分的代码, 我只需要花费10分的精力, 就可以出满意的代码

其他AI

主力开发:

  • 60% -> Grok4.6

  • 20% -> Deepseek v4.1 Flash

  • 20% -> GLM 5.3 Flash

Grok 4.6

之前一直有人问, 高强度vibe code, 一个月500以内是怎么做到的.

Cursor 仍然是目前, 综合'能力, 价格, 速度', 泼水式开发的最优选择.

搭建好整个项目的 MVP原型, 月度25%的额度就能完成, 且代码速度极快, 可以大幅度节省时间

最关键: 没有5小时限额

Deepseek v4.1 Flash

极快的速度, 极低的价格, 代码能力据说达到 GPT5.6 Sol 的水平.

日常使用没有太大感觉, 没有感觉很牛, 也没有感觉到哪里有问题, 但其实能做到这点, 然后结合价格, 可以说一句很强了.

但是刚出不久, 还有待观察是否会降智.

任何模型公布的第一周一般都是极强的

GLM 5.3 Flash

与 Deepseek v4.1 Flash 评价一致, 速度很快, 价格很低, 没感觉好, 也没感觉到坏.

然后结合价格和速度, 就很强.

Qwen3.8 Max | Gemini 3.8 Flash

只用来构建游戏的UI, 绘制 svg, 基本不用来写逻辑代码. 因此也只针对这个维度进行评价.

视觉识别能力, 审美能力的顶级模型

可以跟 fable5 | GPT 6 坐一桌的模型

没讨论综合代码能力, 仅讨论审美能力, 识别截图->设计或优化游戏界面的能力

kimi k3

仍然只用来使用策划任务, 文档编辑任务

代码任务不做评价, 没用过, 而且跑代码价格贵出天

幻觉极低, 上下文的遵守很让人满意. (反面案例是 Gemini, 50%的上下文使用量, 前面提到的内容基本就开始错乱了)

在 创意性 和 胡乱鬼扯胡编乱造 之间, 平衡度比较好.

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com