GPT-6 Astra來了,歡迎來到AGI!

昨晚,整個AI圈集體爆炸了。。。

圖片

ChatGPT、Claude、Grok、Gemini,全球各大AI,幾乎在同一時刻集體宕機(更準確講應該是性能下降,不至於完全用不了),,,現在我們知道了,這是各家AI爲了Astra的發佈放煙花。。


接着凌晨3點32分,OpenAI把GPT-6 Astra端了出來。

圖片

在發佈前的媒體閉門會上,OpenAI總裁Greg Brockman最後只留了一句話。

> Welcome to the AGI era.

歡迎來到AGI時代。

圖片

在沒有看到Astra的能力之前,我先是想,這玩意怎麼又來了。


這幾年AGI這個詞不時被人提起,從24年說未來GPT-5就是AGI,再到去年各種說自己登頂,實現AGI之類的,在我看來這個詞有時候甚至是一個笑話,,,不過這次看完Astra的數據後,我有點笑不出來了。

圖片

先看基礎信息。


圖片

不愧是全球最智能、最對齊的模型,,能力對齊,價格對齊甚至超越。

圖片


行吧,等用上了實際體驗體驗再說。


價格之外,最讓我感慨的一點是,OpenAI這次沒有去隨大流做一個coding強化的模型,這次的Astra更像是一個跟Fable類似的通識專家類模型,且這次還專門點了電腦操作的技能點。

圖片

OpenAI稱它是目前世界上最好的電腦操作模型,它能看屏幕、點鼠標、敲鍵盤,自己在Excel、Power BI、KiCad、Blender甚至UE5裏幹活。OSWorld 2.0裏,它拿到72.6%,高於Sol的65.7%,單個任務平均耗時還從75分鐘壓到了40分鐘。

圖片

這塊太重要了。


現實裏的絕大多數工作,沒有現成API,也沒有給AI用的MCP,幾十年前的系統裏那個藏在三級菜單後的導出按鈕,老舊後臺裏顏色快褪掉的提交框,纔是普通人的真實世界(國內還有那麼多Win7甚至98在服役)。。。誰能真正看懂屏幕、接管鼠標和鍵盤,誰纔有機會從聊天框裏走出來。

圖片

不只是會點。


Astra這次的視覺判斷力也漲了一大截,做PPT、排文檔、搭網站、做遊戲和3D渲染,它會順着模板、品牌和視覺層級繼續往下做,部分情況下,它甚至會跟着你內容的語氣變化去改變一些設計風格。

圖片

BenchCAD上,它從Sol的83.3%衝到了95.9%。

圖片

然後是幻覺。


OpenAI內部評測裏,幻覺率從Sol的12.2%降到4.2%,差不多隻剩三分之一,,更關鍵的是,它開始知道什麼時候該自己判斷,什麼時候必須停下來問人。


圖片

說了這麼多,這一次我覺得真正嚇人的,還是ARC-AGI-3。


這個測試會把模型扔進一個沒有說明書、沒有規則、連目標都不告訴你的陌生環境裏,讓它自己試、自己理解,再建立一套世界模型,Sol只有7.8%,Claude Opus 5是30.2%,Astra跑到了99.9%。

圖片

在這個測試中,Astra會自己發明一套簡寫,記錄物體、座標和規則,在96%的關卡里,它用的操作步數比人類中位數還少。


太誇張了。


它像是真的在一個陌生世界裏,先看,試一下,喫一次虧,然後逐漸弄懂這裏到底怎麼運轉。


當然,ARC Prize自己也提醒,打滿封閉測試不等於證明AGI,OpenAI的官方發佈頁同樣也沒有對此大書特書,Brockman說的是他的個人判斷,而且AGI本來就沒有一條所有人都認的終點線。


圖片

但這一次,我覺得Astra搞不好真的行。


ARC-AGI-3的99.9太抽象可能說服力不足,但你可以看到Astra已經可以在沒有標準接口、沒有完整信息、沒有現成規則的地方,自己看懂,自己判斷,再把事情做完。


這纔是AGI,或者說AGI的味道。


只不過,新時代到了,新時代的賬號權限還沒到。


目前Astra只向少量組織開放,Plus、Pro、Business、Enterprise和API都要在未來幾天陸續上線。也就是說,OpenAI學會了科技圈最讓人心癢的發佈方式,正式發佈,但暫時不給你用,,,不過好在OpenAI還有Tibo這個營銷鬼才👇。

圖片

我chovy奧特曼,我買你Pro 20x,你給我開好的呀!

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com