后记: OpenAI 今天扔出了一颗重磅炸弹——GPT-5.6 Sol,他们迄今为止最强大的模型。但这次发布最引人注目的,可能不是模型的性能,而是它的发布方式:不是\"即刻可用\",而是\"有限预览,先给一小批经过美国政府认可的合作伙伴\"。
━━━ ━━━ ━━━
一、三家分晋:GPT-5.6 系列三兄弟
GPT-5.6 不再是一个模型,而是一个家族。OpenAI 沿用了新命名体系:
| 模型 | 定位 | 价格(每百万 token) |
|---|---|---|
| Sol ☀️ | 旗舰,最强,最深推理 | \$5 输入 / \$30 输出 |
| Terra 🌍 | 平衡,日常干活 | \$2.50 输入 / \$15 输出 |
| Luna 🌙 | 快速,便宜 | \$1 输入 / \$6 输出 |
三个名字分别对应太阳、大地、月亮——一个家族,三个能力层级。
Sol 是主角。它引入了 最大推理时长(max reasoning effort)和 超模式(ultra mode),后者不是单个 agent 而是用子 agent 协作加速复杂任务。
Luna 是最有趣的——它性能对标 GPT-5.5,但便宜了整整一半。对于做产品的人来说,这意味着能用更低的成本处理更多事情。
顺便,OpenAI 还宣布了 Sol 将于 7 月登陆 Cerebras 硬件,推理速度可达 每秒 750 tokens。
二、性能到底有多强?
OpenAI 公布了三个维度的评估:
🧑💻 编程能力
Sol 在 Terminal-Bench 2.1 上达到了新 SOTA(最佳水平)。这个 benchmark 测试的是命令行工作流,需要规划、迭代、工具协调。
🧬 生物学
Sol 在 GeneBench v1(基因组学和定量生物学分析)上比 GPT-5.5 更强,而且用了更少的 token。
🔒 网络安全
这是重头戏。On ExploitBench²,Sol 用约 1/3 的输出 token 就达到了 Mythos Preview 的水平。在 UC Berkeley 联合 OpenAI 等前沿实验室创建的 ExploitGym 基准上,Sol、Terra、Luna 三兄弟随着推理深度增加,网安能力都大幅提升。
三、最强的安全护栏,但也是最「敏感」的发布
这次发布最值得关注的地方,不是性能本身,而是OpenAI 在安全上的做法。
分层安全体系
OpenAI 称 GPT-5.6 配备了「迄今为止最强大的安全栈」,包括:
- 模型层面的拒绝机制:模型被训练为拒绝违禁的网络协助请求,即使对方试图伪装意图或越狱
- 实时输出分类器:网络和生物相关的恶意分类器实时检查生成内容,高风险时暂停生成,由更大的推理模型复核上下文
- 账户级审查:跨对话追踪可疑活动模式,区分持续性恶意行为 vs. 合法的双用途安全研究
为什么「有限预览」?
这是核心看点。OpenAI 原文说:
\"按照美国政府的请求,我们从一小批经过政府知晓的信任合作伙伴开始有限预览。在这之后才开始更广泛地发布。\"
更关键的是后面这句:
\"我们不认为这类政府审查流程应该成为长期默认做法。它让最好的工具远离那些需要它们的用户、开发者、企业、网络防御者和全球合作伙伴。\"
翻译一下:我们也不愿意这么做,但为了能更快地全面发布,短期只能走这个流程。
这话说得很微妙。一方面承认了美国政府的审查介入,另一方面表达了不希望这是常态。更像是一种\"战略妥协\"——先让政府放心,才能让技术松绑。
一个重要界限
GPT-5.6 Sol 在 OpenAI 自己的《预备框架》评估中,没有越过网络安全关键阈值。在针对 Chromium 和 Firefox 的测试中,它能识别漏洞和利用原理,但未能自主生成完整的功能性全链利用(functional full-chain exploit)。
但 OpenAI 自己也承认:benchmark 的阈值无法覆盖模型被使用的每一种方式。
四、70 万 GPU 小时:自动化红队测试
这组数据值得单独拎出来:
70 万 A100 等效 GPU 小时 用于自动化红队测试。
投入这么大的算力去找模型漏洞,这在业界是空前的。OpenAI 用模型自己来攻击自己,寻找通用越狱方法(universal jailbreaks)——那些不限于某个特定提示词、能在多种上下文中生效的攻击方式。
同时他们也邀请了第三方人类专家进行红队测试。人类专家负责测试自动化系统可能遗漏的、需要有创意的攻击方式。
五、缓存定价也更新了
GPT-5.6 引入了更可预测的 prompt 缓存:
- 支持显式缓存断点
- 最少缓存生命期 30 分钟
- 缓存写操作:1.25x 标准输入价格
- 缓存读操作:仍有 90% 折扣
六、解读:这次发布意味着什么?① 美国政府对 AI 的审查正在从「事后」走向「事前」
这是最深刻的信号。以前 AI 模型发布是公司自主决定,政府顶多事后追责。现在是发布前就要和政府沟通、经过政府认可才允许部分发布。这和芯片出口管制一样,正在成为一套正式的国家安全审查流程。
② 网络安全能力已经成为 AI 分级的核心维度
GPT-5.6 的评估维度中,网络安全和专业编程、生物学分析并列。而且 OpenAI 花了大量篇幅解释安全护栏——不是因为用户想要这些,而是因为美国政府要求这些。
网安能力越强,模型的「敏感度」就越高。这恐怕会成为未来 AI 模型分类的常态。
③ 命名体系的转变暗示产品分层
Sol/Terra/Luna 不只是名称,它们是独立演进的「能力层级」。这意味着 OpenAI 未来可能让不同层级通过不同的迭代节奏发展——就像手机产品线的旗舰、中端、入门。
④ Terra 比 GPT-5.5 强、还更便宜, Luna 则是性价比标杆
对于开发者和企业来说,重点关注的是 Terra 和 Luna。Sol 很强,但月亮的性价比可能才是真正改变游戏规则的那个。
⑤ Cerebras 合作提供了另一个信号
OpenAI 把自己的旗舰模型部署到 Cerebras 上,750 tokens/s 的速度。这不仅是技术选择,也是供应链多元化——在英伟达一统天下的市场里,给替代硬件一个舞台。
━━━ ━━━ ━━━
⚡ 简单总结: GPT-5.6 Sol 是目前最强的 OpenAI 模型。但这次发布真正的新闻不是性能,而是——美国政府已经实质性地介入了前沿 AI 模型的发布流程。你可以不喜欢这个趋势,但不得不关注它。
━━━ ━━━ ━━━
*本文基于 OpenAI 官方博客 Previewing GPT-5.6 Sol: a next-generation model 翻译解读。*
OpenAI 发布 Daybreak:AI 驱动的防御革命与安全范式转移
从结对编程到工业化编排:深度拆解 OpenAI Symphony 规范
架构级分析:OpenAI 收购 Promptfoo 对 AI Agent 安全生态的影响
OpenAI Frontier 深度解析:Agent 时代的"分布式操作系统"已经来临
Token狂欢结束,谁来收拾烂摊子?——Revenium的AI成本可观测之道
智力爆炸的前夜:GPT-5.3 与 Codex 进化,工程师的"终局"已至?