我们开始对 GPT-5.6 系列进行有限预览:Sol 是我们的旗舰模型;Terra 是面向日常工作的均衡型模型;Luna 则是快速且经济的模型。Terra 的性能可与 GPT-5.5 竞争,同时价格只有其一半;Luna 则以我们目前最低的成本提供强劲能力。
GPT-5.6 Sol 上线时配备了迄今最稳健的安全栈。我们加强了针对高风险活动、敏感网络安全请求和反复滥用行为的保护,并花费数周时间查找薄弱点、对系统进行压力测试,并加固其抵御真实世界攻击的能力。
我们相信广泛访问的重要性,并计划在未来几周内让 GPT-5.6 Sol、Terra 和 Luna 普遍可用。作为我们与美国政府持续沟通的一部分,我们在今天发布前预先介绍了发布计划和模型能力。应其要求,在更广泛发布之前,我们会先向一小组可信合作伙伴开启有限预览,这些参与方信息已与政府共享。
在预览期间,我们会继续测试,并与合作伙伴密切协调,推进更广泛的可用性。我们并不认为这种政府访问流程应成为长期默认做法。它会让需要最佳工具的用户、开发者、企业、网络防御者和全球合作伙伴无法及时使用这些工具。
我们采取这一短期步骤,是因为我们认为这是未来几周实现更广泛可用性的最有力路径;同时,我们也在与政府合作,制定网络安全行政令框架,以及适用于未来模型发布的可重复流程。
能力
GPT-5.6 Sol 是我们迄今最强的模型。为了预览模型表现,我们分享了一组评测,展示其在编码、生物学和网络安全方面增强的智能体能力;更多安全与准备度评测可在我们的系统卡中查看。等模型广泛可用时,我们会分享更完整的一组评测结果。
借助 GPT-5.6,我们引入了新的 max 推理强度,让 Sol 获得最充分的深度推理时间。此外,我们还引入了新的 ultra 模式,它通过利用子智能体来加速复杂工作,能力超越单一智能体。
在编码工作流方面,GPT-5.6 Sol 在 Terminal-Bench 2.1 上达到新的最先进水平。该基准测试的是需要规划、迭代和工具协同的命令行工作流。
GPT-5.6 Sol 在生物学工作流中也展现出广泛提升。在 GeneBench v1 上,这个评测关注长周期基因组学和定量生物学分析,GPT-5.6 Sol 使用更少 token 就取得了强于 GPT-5.5 的结果。
GPT-5.6 Sol 是我们迄今在网络安全方面能力最强的模型。它推动了长周期安全任务的性能-效率前沿,包括漏洞研究和利用。在 ExploitBench 2 上,GPT-5.6 Sol 只使用约 1/3 的输出 token,就能达到与 Mythos Preview 相当的表现。
在 ExploitGym 3 上,GPT-5.6 Sol、Terra 和 Luna 模型都显示出网络安全能力随推理增强而显著提升。ExploitGym 3 是由加州大学伯克利分校研究人员与 OpenAI 及其他前沿实验室合作创建的基准。
更强的网络安全能力,更强的防护
我们在开发 GPT-5.6 Sol、Terra 和 Luna 时采用了迄今最稳健的防护措施,并根据每个模型的能力匹配相应配置。随着模型能力增强,我们设计的防护措施也需要越来越能承受真实世界的对抗压力,同时保留对合法工作的访问,例如代码审查、漏洞研究、补丁开发、调试、安全教育和防御性测试。
我们的目标是在不必要限制这些有益用途的前提下,让被禁止的攻击性活动变得更困难、更不确定,也更容易被发现。基于我们对模型和防护措施的评估,我们预计它会为合法防御工作带来显著收益,同时有意义地限制被禁止的攻击性使用。
GPT-5.6 Sol 更擅长帮助人们发现并修复漏洞,而不是可靠地执行端到端攻击。随着这些能力继续进步,我们的优先事项是确保它们触达并惠及防御者,让防御者能够用这些工具发现弱点、开发补丁,并更广泛地加固系统。
根据我们的准备度框架,GPT-5.6 Sol 没有跨过 Cyber Critical 阈值。在涉及 Chromium 和 Firefox 的评测中,它识别出了 bug 和利用原语,也就是构成漏洞利用的基础组件,但在测试条件下并未自主产出可运行的完整攻击链。尽管如此,基准阈值无法覆盖模型被使用或与其他工具组合使用的每一种方式。
正是这种不确定性,再加上模型整体能力的阶跃式提升,使我们在增强模型能力的同时配套更强的防护,并采取分阶段发布。我们在 GPT-5.6 Preview 系统卡中分享了更多关于防护措施的细节。
分层防护栈
面对有决心或会不断调整策略的滥用者,没有任何单一防护措施是充分的。在 GPT-5.6 预览期间,我们采用分层防护,不同模型的具体配置有所不同,并用真实世界攻击对其进行压力测试。这些措施包括训练进模型的保护、生成过程中的实时检查、账号级信号、差异化访问、监控、执行处置以及持续测试。
GPT-5.6 经过训练,会拒绝被禁止的网络安全协助,包括用户试图伪装意图或对模型进行越狱时。这些模型层面的防护,确立了模型应该帮助什么、不应该帮助什么的第一道边界。
实时网络安全和生物学滥用分类器通过评估正在生成的输出来提供另一层保护。对于较高风险的情况,如果它们检测到潜在违规,生成过程可能会暂停,由一个更大的推理模型审查对话及其上下文。如果输出被判定为不允许,它会在到达用户之前被拦截。
被标记的活动也可能触发账号级审查,覆盖相关对话和风险信号,并符合我们关于内容保留与审查的条款和政策。超越单个对话进行观察,有助于我们的系统区分持续的恶意行为与合法的双用途安全工作,因为相似的技术概念可能出现在截然不同的上下文中。
这些层次结合起来,使整体方案比任何单一防护都更稳健。模型行为降低有害回答出现的可能性,实时系统可以在生成过程中介入,账号级审查可以识别更广泛的模式,而差异化访问可以保留重要的防御性工作,同时避免默认向所有人开放最敏感的能力。
特别是在预览期间,用户可能会遇到防护措施阻止或拒绝某些请求。其他请求也可能因为生成过程被暂停以进行额外审查而耗时更长。防护措施偶尔可能会影响合法工作,尤其是在防御性和攻击性活动一开始看起来很相似的双用途领域。
这正是预览要测试的内容之一。我们不仅想了解防护措施是否能约束滥用,也想了解合法用户是否仍能可靠、高效地完成正常工作。预览期间的反馈将帮助我们减少不必要的阻止和延迟,改进防护措施对上下文的理解,并在更广泛发布前创造更顺畅的体验。
我们也在与企业客户合作探索更长期的方法,包括保护隐私的检测、由客户运营的安全控制,以及根据客户、用户或工作负载风险校准的访问权限,从而在支持企业隐私需求的同时推进安全。
通过自动化红队提升稳健性
当攻击者调整策略时,防护措施也需要继续有效。只对一组固定已知攻击有效的保护,对于前沿模型来说还不够稳健。
因此,我们正在把前所未有的智能和算力投入安全工作,用自己的模型更快地发现薄弱点并改进防护措施。我们投入了超过 700,000 个 A100 等效 GPU 小时进行自动化红队测试,目标是寻找通用越狱:这类攻击可以跨越许多提示或上下文生效,而不只是针对某个狭窄场景。聚焦这些更困难、更通用的攻击,让我们能够在固定已知失败集之外测试防护措施。
这也让我们能够探索远多于单靠人工测试所能覆盖的攻击模式,更早识别失败模式,并缩短从发现薄弱点到修复薄弱点的路径。
除自动化红队外,我们还与第三方测试人员合作,开展了广泛的人类专家红队测试,并将在预览期继续进行。人类红队测试补充了自动化工作,由有创造力的专家尝试以我们系统可能预料不到的方式滥用模型,从而检验防护措施。
没有任何评测能够代表每一种产品配置、多步骤攻击或真实世界工作流。因此,我们维护了一套快速响应流程,用来复现、评估、确定优先级并修复新发现的越狱,再把它们加入持续评测,以便未来测试类似失败。
可用性与定价
预览期间,GPT-5.6 模型最初将通过 API 和 Codex 向一组选定的可信合作伙伴和组织开放。我们计划很快让使用 ChatGPT、Codex 和 API 的更多人能够访问这些模型。
在 GPT-5.6 引入的这套新命名体系中,数字表示模型的代际,而 Sol、Terra 和 Luna 表示可按各自节奏演进的持久能力层级。整个模型家族共同为用户和开发者在智能、速度和成本之间提供更清晰的选择。
GPT-5.6 按每 100 万 token 定价,覆盖三种模型规格:Sol 为输入 5 美元 / 输出 30 美元;Terra 为输入 2.50 美元 / 输出 15 美元;Luna 为输入 1 美元 / 输出 6 美元。GPT-5.6 还引入了更可预测的提示缓存,包括支持显式缓存断点和 30 分钟的最低缓存生命周期。对于 GPT-5.6 及后续模型,缓存写入按该模型未缓存输入费率的 1.25 倍计费,而缓存读取继续享受 90% 的缓存输入折扣。
我们还将在 7 月于 Cerebras 上推出 GPT-5.6 Sol,速度最高可达每秒 750 个 token,以前所未有的速度把前沿智能带给客户。随着我们扩展容量,访问权限最初将仅限部分客户。
我们期待在预览期间继续学习,并尽快把 GPT-5.6 Sol、Terra 和 Luna 带给更多人。
我们通过观察模型在生产环境中的行为并进行离线模拟,来估算延迟和 API 成本。这些估算考虑了工具调用细节、采样 token 和输入 token。真实世界结果可能存在很大差异,并取决于许多模拟未覆盖的因素。我们按较快 API 速度模拟延迟,并按常规 API 定价模拟成本。
所有模型都使用 ExploitBench API harness,以 5 个种子和推理连续性进行评测。
我们在 alpha API 上运行 ExploitGym,该 API 输出响应的速度快于公共 API,随后我们重新缩放结果以匹配公共 API。当把延迟重新缩放到公共 API 预期速度时,一些估算延迟会超过 2 小时和 6 小时的时间限制,尽管评测运行中确实正确遵守了这些限制。对于时间敏感型工作,我们在 API 中提供优先处理,在 Codex 中提供快速模式,以获得更快速度。
未报告输出 token、延迟或成本的模型绘制为水平虚线。