我的文章, 仅以个人独立开发者的视角出发, 不适用于企业级用户
9月第二篇文章 | 新游戏火速开发中 | 从0开始Agent构建代码库 | 多AI评价 | Deepseek v4.1 flash
![]()
本篇文章大概内容:
ChatGpt | Claude 仍然是最强的双子星, 但我还是停止续费了.
top2 之后的AI评价 | 国产AI 最新评价
Deepseek v4.1 Flash评价
Vibe Code 到底如何省钱
近期高强度使用的AI:
国外:
Grok4.6
Gemini 3.8 Flash
国内:
Qwen3.8 Max
Kimi k3
GLM 5.3 Flash
Deepseek v4.1 Flash
前言
明确:
#####################
每个模型, 都有各自的强项, 我口中的 强|弱 都只是针对 个人独立开发者分别的 策划任务 | 代码任务
例如之前文章提到的 kimi k3 强, 仅仅是针对, 策划任务
#####################
"面试造火箭, 工作拧螺丝" 不是一句调侃
高难度代码是伪命题,
即使把 12306, 微信, 支付宝的代码库打开, 95%以上的代码, 也都是简单的基础代码, 轮子的复用.
#####################
Claude
这个放在前面骂, 也是因为可以说的内容不多(骂累了)
Claude在各种榜单还是屠榜的存在, 所以我宁愿相信他是检测到简体中文所以才降智
IP如果有问题大不了直接给我封号, 但是也没封号, 就纯恶心人来的. 如果你的opus没降智, 那还可以用.
![]()
ChatGpt
一句话: 很强, 过于强了, 用起来很累.
GPT 6 Astra 的确很强, 但是很贵, 20$订阅, 两条10分钟的任务5小时额度就空了
GPT 5.6 Sol 也很强, 但是其他AI 已经几乎可以平替了
![]()
GPT 6价格贵, 并不是取消订阅的原因. 只是刚好让我放松思考, 到底是否还有必要继续用GPT
GPT 仍然是极其聪明, 能力极其强, 绝对的顶级模型, 但是当前他的能力, 已经超出了一个个人开发者的上限,
简单来说, 限制ChatGpt所花费的精力 已经超过 让其他AI更聪明所花费的精力.
我只需要 80分的代码, ChatGpt会写出120分的代码, 我需要花40分的精力去限制
其他AI, 能写出70分的代码, 我只需要花费10分的精力, 就可以出满意的代码
![]()
其他AI
主力开发:
60% -> Grok4.6
20% -> Deepseek v4.1 Flash
20% -> GLM 5.3 Flash
Grok 4.6
之前一直有人问, 高强度vibe code, 一个月500以内是怎么做到的.
Cursor 仍然是目前, 综合'能力, 价格, 速度', 泼水式开发的最优选择.
搭建好整个项目的 MVP原型, 月度25%的额度就能完成, 且代码速度极快, 可以大幅度节省时间
最关键: 没有5小时限额
![]()
Deepseek v4.1 Flash
极快的速度, 极低的价格, 代码能力据说达到 GPT5.6 Sol 的水平.
日常使用没有太大感觉, 没有感觉很牛, 也没有感觉到哪里有问题, 但其实能做到这点, 然后结合价格, 可以说一句很强了.
但是刚出不久, 还有待观察是否会降智.
任何模型公布的第一周一般都是极强的
![]()
GLM 5.3 Flash
与 Deepseek v4.1 Flash 评价一致, 速度很快, 价格很低, 没感觉好, 也没感觉到坏.
然后结合价格和速度, 就很强.
![]()
Qwen3.8 Max | Gemini 3.8 Flash
只用来构建游戏的UI, 绘制 svg, 基本不用来写逻辑代码. 因此也只针对这个维度进行评价.
视觉识别能力, 审美能力的顶级模型
可以跟 fable5 | GPT 6 坐一桌的模型
没讨论综合代码能力, 仅讨论审美能力, 识别截图->设计或优化游戏界面的能力
![]()
![]()
kimi k3
仍然只用来使用策划任务, 文档编辑任务
代码任务不做评价, 没用过, 而且跑代码价格贵出天
幻觉极低, 上下文的遵守很让人满意. (反面案例是 Gemini, 50%的上下文使用量, 前面提到的内容基本就开始错乱了)
在 创意性 和 胡乱鬼扯胡编乱造 之间, 平衡度比较好.
![]()
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
