GPT-6 Astra来了,欢迎来到AGI!

昨晚,整个AI圈集体爆炸了。。。

图片

ChatGPT、Claude、Grok、Gemini,全球各大AI,几乎在同一时刻集体宕机(更准确讲应该是性能下降,不至于完全用不了),,,现在我们知道了,这是各家AI为了Astra的发布放烟花。。


接着凌晨3点32分,OpenAI把GPT-6 Astra端了出来。

图片

在发布前的媒体闭门会上,OpenAI总裁Greg Brockman最后只留了一句话。

> Welcome to the AGI era.

欢迎来到AGI时代。

图片

在没有看到Astra的能力之前,我先是想,这玩意怎么又来了。


这几年AGI这个词不时被人提起,从24年说未来GPT-5就是AGI,再到去年各种说自己登顶,实现AGI之类的,在我看来这个词有时候甚至是一个笑话,,,不过这次看完Astra的数据后,我有点笑不出来了。

图片

先看基础信息。


图片

不愧是全球最智能、最对齐的模型,,能力对齐,价格对齐甚至超越。

图片


行吧,等用上了实际体验体验再说。


价格之外,最让我感慨的一点是,OpenAI这次没有去随大流做一个coding强化的模型,这次的Astra更像是一个跟Fable类似的通识专家类模型,且这次还专门点了电脑操作的技能点。

图片

OpenAI称它是目前世界上最好的电脑操作模型,它能看屏幕、点鼠标、敲键盘,自己在Excel、Power BI、KiCad、Blender甚至UE5里干活。OSWorld 2.0里,它拿到72.6%,高于Sol的65.7%,单个任务平均耗时还从75分钟压到了40分钟。

图片

这块太重要了。


现实里的绝大多数工作,没有现成API,也没有给AI用的MCP,几十年前的系统里那个藏在三级菜单后的导出按钮,老旧后台里颜色快褪掉的提交框,才是普通人的真实世界(国内还有那么多Win7甚至98在服役)。。。谁能真正看懂屏幕、接管鼠标和键盘,谁才有机会从聊天框里走出来。

图片

不只是会点。


Astra这次的视觉判断力也涨了一大截,做PPT、排文档、搭网站、做游戏和3D渲染,它会顺着模板、品牌和视觉层级继续往下做,部分情况下,它甚至会跟着你内容的语气变化去改变一些设计风格。

图片

BenchCAD上,它从Sol的83.3%冲到了95.9%。

图片

然后是幻觉。


OpenAI内部评测里,幻觉率从Sol的12.2%降到4.2%,差不多只剩三分之一,,更关键的是,它开始知道什么时候该自己判断,什么时候必须停下来问人。


图片

说了这么多,这一次我觉得真正吓人的,还是ARC-AGI-3。


这个测试会把模型扔进一个没有说明书、没有规则、连目标都不告诉你的陌生环境里,让它自己试、自己理解,再建立一套世界模型,Sol只有7.8%,Claude Opus 5是30.2%,Astra跑到了99.9%。

图片

在这个测试中,Astra会自己发明一套简写,记录物体、坐标和规则,在96%的关卡里,它用的操作步数比人类中位数还少。


太夸张了。


它像是真的在一个陌生世界里,先看,试一下,吃一次亏,然后逐渐弄懂这里到底怎么运转。


当然,ARC Prize自己也提醒,打满封闭测试不等于证明AGI,OpenAI的官方发布页同样也没有对此大书特书,Brockman说的是他的个人判断,而且AGI本来就没有一条所有人都认的终点线。


图片

但这一次,我觉得Astra搞不好真的行。


ARC-AGI-3的99.9太抽象可能说服力不足,但你可以看到Astra已经可以在没有标准接口、没有完整信息、没有现成规则的地方,自己看懂,自己判断,再把事情做完。


这才是AGI,或者说AGI的味道。


只不过,新时代到了,新时代的账号权限还没到。


目前Astra只向少量组织开放,Plus、Pro、Business、Enterprise和API都要在未来几天陆续上线。也就是说,OpenAI学会了科技圈最让人心痒的发布方式,正式发布,但暂时不给你用,,,不过好在OpenAI还有Tibo这个营销鬼才👇。

图片

我chovy奥特曼,我买你Pro 20x,你给我开好的呀!

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com