![]()
OpenAI 在 X 上发了一个gpt5.6的帖子。
第一条是常规发布:GPT-5.6 系列开始 limited preview,分三档——Sol 是旗舰,Terra 做日常平衡,Luna 主打便宜和高吞吐。第二条说 Sol 在 Terminal-Bench 2.1 上刷新成绩,这个基准测的是复杂命令行工作流,需要规划、迭代和工具协调。第三条最敏感:OpenAI 说,GPT-5.6 Sol 是它们目前最强的网络安全模型,能把长程安全任务里的漏洞研究和漏洞利用,推到新的性能效率边界。
“漏洞利用”这几个字,足够让安全圈警觉。
Sol 的两个成绩,要分开看
先看 Terminal-Bench 2.1。OpenAI 图里,GPT-5.6 Sol Ultra 拿到 91.9%,GPT-5.6 Sol 是 88.8%。Claude Mythos 5 是 88.0%,GPT-5.6 Terra 和 Claude Fable 5 都是 84.3%,GPT-5.5 是 83.4%,Luna 是 82.5%,Claude Opus 4.8 是 78.9%,Gemini 3.1 Pro Preview 是 70.7%。
这张图只说明 Terminal-Bench 2.1 这一项:Sol Ultra 排第一,Sol 与 Mythos 5 接近,差距为 0.8 个百分点。单项基准不能代表综合排名,但足以说明 OpenAI 这代模型在命令行代理任务上进入第一梯队。
再看 ExploitBench。用户提供的图里,GPT-5.6 Sol 爬到 73% 到 74% 一带,明显高过 Terra、Luna、GPT-5.5 和 GPT-5.4。但 Mythos 5 的参考线大约在 78%。
所以这两个结论不能混在一起:Terminal-Bench 上 Sol Ultra 是第一;ExploitBench 上 Mythos 仍像天花板,Sol 还差一截,但已经摸到了那层上沿。
这比单纯“模型变聪明了”更值得关注。Sol 的强项落在漏洞研究、命令行代理、长程工具协作这些真实工作流里。
![]()
OpenAI 的说法很克制
OpenAI 的口径是:Sol 和 Terra 能发现漏洞,也能拼出漏洞利用的片段;但在针对加固目标的测试中,还不能可靠地完成端到端自主攻击。简单说,它能帮安全人员找洞、修洞、写出局部利用思路;独立打穿一个加固目标,还不是它现在的官方边界。
这个区别很重要。
如果只看 “exploitation”,很容易写成“AI 已经能自动入侵”。这不准确。OpenAI 目前给出的边界是:能力显著上升,但没有跨过它们自己框架里的 cyber critical threshold。
现实世界也不会只按论文表格运转。防御方能用它提速,攻击方也会尝试把同样的能力拼进工作流。安全模型越强,访问控制和使用审计就越关键。
![]()
真正引爆的是访问权
这次 GPT-5.6 没有直接放开。
OpenAI 说,作为和美国政府持续沟通的一部分,它们在发布前向政府预览了计划和模型能力;应政府要求,先从一小群可信合作方开始有限预览,并把这些合作方参与情况同步给政府。媒体报道里还提到,首批大约是 20 家政府批准的合作方。这个数字不是 X 帖原文,只能按媒体口径看。
OpenAI 自己也表达过一个态度:这种政府介入的访问流程,不应该成为长期默认。因为这会把最好的工具挡在用户、开发者、企业、网络防御者和全球伙伴之外。
这句话比“模型很强”更值得写。
AI 公司这几年持续抢算力。GPU、服务器、数据中心和电力成本,最终都会传导到硬件、云服务和开发成本里。
可当更好的模型终于出现,访问权却先被政府批准名单锁住。成本与收益开始错位。
如果成本扩散到整个市场,能力却被少数机构优先拿走,这就是最容易点燃的矛盾。普通人未必需要 Sol 做安全研究,却已经承受了 AI 基建时代的硬件和服务成本。
对开发者来说,这不是远方新闻
很多人看见“网络安全模型”会觉得和自己没关系。其实关系很近。
Terminal-Bench 2.1 的重点是命令行工作流。也就是模型能不能规划步骤、调用工具、看报错、改命令、继续迭代。这正是 Codex、自动化运维、代码审计、CI 修复这类工具的核心能力。
Sol 如果在这些任务上明显更强,普通开发者未来最先感受到的,可能是工程问题被模型自动跑通的概率变高了。它会不会挖漏洞只是其中一面;它能不能独立处理复杂终端任务,才会更频繁地落到日常工作里。
价格图也说明了 OpenAI 的分层思路:Sol 是旗舰,输入 5 美元、缓存输入 0.5 美元、输出 30 美元;Terra 砍半,输入 2.5 美元、缓存输入 0.25 美元、输出 15 美元;Luna 再降,输入 1 美元、缓存输入 0.1 美元、输出 6 美元。图里没标明计价单位,不能擅自补成每百万 tokens,但价格梯度很清楚:越强,越贵;越便宜,越偏高吞吐。
但这里也有风险。越能自主操作终端的模型,越需要严格边界。执行权限、文件写入、网络访问、密钥隔离、审批流程,都不能再靠一句“相信模型”。模型越像同事,越要给它工位、权限和审计,不该把整台机器随手交出去。
这点在安全模型上更明显。一个能读代码、跑工具、推漏洞链的系统,如果没有边界,同一套能力既能帮防御,也能放大风险。
这次发布暴露的是分配问题
GPT-5.6 Sol 的技术点很清楚:更强的长程任务,更强的命令行代理,更强的网络安全能力。Terminal-Bench 图给了 OpenAI 一个第一名,ExploitBench 图也给了另一个提醒:Mythos 仍在更高处,Sol 已经逼近那条线。
能力之外,还有分配。
AI 公司把全社会的算力、硬件、能源和价格体系都卷进来,然后最强能力先进入政府批准的小圈子。OpenAI 一边接受这个流程,一边又公开说不希望它成为常态。这种拉扯,才是 GPT-5.6 Sol 这轮发布最值得盯的地方。
技术会继续往前推。Mythos 今天还是天花板,明天可能就被追平。下一次天花板被打穿时,访问权如何分配,会比跑分本身更敏感。
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
