← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

OpenAI 发布 GPT-5.6 Sol:最强模型却先给「一小撮人」

AI/Agent 阅读原文(微信)↗

后记: OpenAI 今天扔出了一颗重磅炸弹——GPT-5.6 Sol,他们迄今为止最强大的模型。但这次发布最引人注目的,可能不是模型的性能,而是它的发布方式:不是\"即刻可用\",而是\"有限预览,先给一小批经过美国政府认可的合作伙伴\"。

━━━ ━━━ ━━━

一、三家分晋:GPT-5.6 系列三兄弟

GPT-5.6 不再是一个模型,而是一个家族。OpenAI 沿用了新命名体系:

模型 定位 价格(每百万 token)
Sol ☀️ 旗舰,最强,最深推理 \$5 输入 / \$30 输出
Terra 🌍 平衡,日常干活 \$2.50 输入 / \$15 输出
Luna 🌙 快速,便宜 \$1 输入 / \$6 输出

三个名字分别对应太阳、大地、月亮——一个家族,三个能力层级。

Sol 是主角。它引入了 最大推理时长(max reasoning effort)和 超模式(ultra mode),后者不是单个 agent 而是用子 agent 协作加速复杂任务。

Luna 是最有趣的——它性能对标 GPT-5.5,但便宜了整整一半。对于做产品的人来说,这意味着能用更低的成本处理更多事情。

顺便,OpenAI 还宣布了 Sol 将于 7 月登陆 Cerebras 硬件,推理速度可达 每秒 750 tokens

二、性能到底有多强?

OpenAI 公布了三个维度的评估:

🧑‍💻 编程能力

Sol 在 Terminal-Bench 2.1 上达到了新 SOTA(最佳水平)。这个 benchmark 测试的是命令行工作流,需要规划、迭代、工具协调。

🧬 生物学

Sol 在 GeneBench v1(基因组学和定量生物学分析)上比 GPT-5.5 更强,而且用了更少的 token。

🔒 网络安全

这是重头戏。On ExploitBench²,Sol 用约 1/3 的输出 token 就达到了 Mythos Preview 的水平。在 UC Berkeley 联合 OpenAI 等前沿实验室创建的 ExploitGym 基准上,Sol、Terra、Luna 三兄弟随着推理深度增加,网安能力都大幅提升。

三、最强的安全护栏,但也是最「敏感」的发布

这次发布最值得关注的地方,不是性能本身,而是OpenAI 在安全上的做法

分层安全体系

OpenAI 称 GPT-5.6 配备了「迄今为止最强大的安全栈」,包括:

  • 模型层面的拒绝机制:模型被训练为拒绝违禁的网络协助请求,即使对方试图伪装意图或越狱
  • 实时输出分类器:网络和生物相关的恶意分类器实时检查生成内容,高风险时暂停生成,由更大的推理模型复核上下文
  • 账户级审查:跨对话追踪可疑活动模式,区分持续性恶意行为 vs. 合法的双用途安全研究

为什么「有限预览」?

这是核心看点。OpenAI 原文说:

\"按照美国政府的请求,我们从一小批经过政府知晓的信任合作伙伴开始有限预览。在这之后才开始更广泛地发布。\"

更关键的是后面这句:

\"我们不认为这类政府审查流程应该成为长期默认做法。它让最好的工具远离那些需要它们的用户、开发者、企业、网络防御者和全球合作伙伴。\"

翻译一下:我们也不愿意这么做,但为了能更快地全面发布,短期只能走这个流程。

这话说得很微妙。一方面承认了美国政府的审查介入,另一方面表达了不希望这是常态。更像是一种\"战略妥协\"——先让政府放心,才能让技术松绑。

一个重要界限

GPT-5.6 Sol 在 OpenAI 自己的《预备框架》评估中,没有越过网络安全关键阈值。在针对 Chromium 和 Firefox 的测试中,它能识别漏洞和利用原理,但未能自主生成完整的功能性全链利用(functional full-chain exploit)。

但 OpenAI 自己也承认:benchmark 的阈值无法覆盖模型被使用的每一种方式。

四、70 万 GPU 小时:自动化红队测试

这组数据值得单独拎出来:

70 万 A100 等效 GPU 小时 用于自动化红队测试。

投入这么大的算力去找模型漏洞,这在业界是空前的。OpenAI 用模型自己来攻击自己,寻找通用越狱方法(universal jailbreaks)——那些不限于某个特定提示词、能在多种上下文中生效的攻击方式。

同时他们也邀请了第三方人类专家进行红队测试。人类专家负责测试自动化系统可能遗漏的、需要有创意的攻击方式。

五、缓存定价也更新了

GPT-5.6 引入了更可预测的 prompt 缓存:

  • 支持显式缓存断点
  • 最少缓存生命期 30 分钟
  • 缓存写操作:1.25x 标准输入价格
  • 缓存读操作:仍有 90% 折扣

六、解读:这次发布意味着什么?① 美国政府对 AI 的审查正在从「事后」走向「事前」

这是最深刻的信号。以前 AI 模型发布是公司自主决定,政府顶多事后追责。现在是发布前就要和政府沟通、经过政府认可才允许部分发布。这和芯片出口管制一样,正在成为一套正式的国家安全审查流程

② 网络安全能力已经成为 AI 分级的核心维度

GPT-5.6 的评估维度中,网络安全和专业编程、生物学分析并列。而且 OpenAI 花了大量篇幅解释安全护栏——不是因为用户想要这些,而是因为美国政府要求这些。

网安能力越强,模型的「敏感度」就越高。这恐怕会成为未来 AI 模型分类的常态。

③ 命名体系的转变暗示产品分层

Sol/Terra/Luna 不只是名称,它们是独立演进的「能力层级」。这意味着 OpenAI 未来可能让不同层级通过不同的迭代节奏发展——就像手机产品线的旗舰、中端、入门。

④ Terra 比 GPT-5.5 强、还更便宜, Luna 则是性价比标杆

对于开发者和企业来说,重点关注的是 Terra 和 Luna。Sol 很强,但月亮的性价比可能才是真正改变游戏规则的那个。

⑤ Cerebras 合作提供了另一个信号

OpenAI 把自己的旗舰模型部署到 Cerebras 上,750 tokens/s 的速度。这不仅是技术选择,也是供应链多元化——在英伟达一统天下的市场里,给替代硬件一个舞台。

━━━ ━━━ ━━━

⚡ 简单总结: GPT-5.6 Sol 是目前最强的 OpenAI 模型。但这次发布真正的新闻不是性能,而是——美国政府已经实质性地介入了前沿 AI 模型的发布流程。你可以不喜欢这个趋势,但不得不关注它。

━━━ ━━━ ━━━

*本文基于 OpenAI 官方博客 Previewing GPT-5.6 Sol: a next-generation model 翻译解读。*

OpenAI 发布 Daybreak:AI 驱动的防御革命与安全范式转移

从结对编程到工业化编排:深度拆解 OpenAI Symphony 规范

架构级分析:OpenAI 收购 Promptfoo 对 AI Agent 安全生态的影响

OpenAI Frontier 深度解析:Agent 时代的"分布式操作系统"已经来临

Token狂欢结束,谁来收拾烂摊子?——Revenium的AI成本可观测之道

智力爆炸的前夜:GPT-5.3 与 Codex 进化,工程师的"终局"已至?

真正的对手不是芯片,是算力控制权 | OpenAI自研芯片Jalapeño深度解读

核心AI术语:从感知到认知

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)