您的事件响应计划是否考虑到了这样一个对手:在您的安全运营中心分流单个警报的时间内,就能生成十个独特的漏洞利用链?对于红队或国家级黑客组织来说,这已不再是假设情景。GPT-5.6-Cyber 的发布标志着谨慎的通用人工智能时代的终结。通过移除此前阻止大语言模型协助恶意活动的数字抑制器,OpenAI 为漏洞研究提供了一个高速引擎。
我今天早上通过与研究小组的一位联系人进行的加密 Signal 对话,查阅了这一新模型的技术规格。其哲学转变是巨大的。多年来,我们依靠前沿模型的防护栏来防止高端漏洞开发的民主化。如果用户要求模型编写堆溢出漏洞利用程序,系统会拒绝。对于授权用户来说,这层安全网已经消失,这对更广泛的威胁格局产生了系统性影响。
OpenAI 现在提供 GPT-5.6-Cyber 作为漏洞研究、渗透测试和事件响应的专业工具。它是 GPT-5.6 Sol 架构的衍生产品,但训练重点是进攻性安全任务。最显著的变化是减少了对高风险、双用途网络任务的拒绝。过去,防御性研究人员经常与模型作斗争,因为模型会将合法的安全测试误解为恶意意图。该模型消除了这些障碍。
该模型通过 Daybreak Red 提供,这是针对经过审核的企业的新访问层级。这一层级是对攻击者已经在利用限制较少的开源模型来自动化其工作流程这一现实的回应。通过为漏洞验证和安全测试提供受制裁的环境,其目标是帮助防御者在漏洞被野外利用之前发现它们。从风险角度来看,这是一场经过计算的赌博,即防御者的透明度将超过模型滥用的风险。
为了理解这种变化的幅度,我们必须查看“高级网络安全完成率”(Advanced Cybersecurity Completion Rate)。这是 OpenAI 用来跟踪模型成功响应涉及身份验证绕过、权限提升和漏洞利用链开发提示的频率的内部指标。对于任何仍将 AI 视为无害聊天机器人的人来说,结果都是一个警钟。
GPT-5.6-Cyber 完成了 95.0% 的此类高级请求。相比之下,通用型 GPT-5.6 Sol 模型仅完成了 1.5%。即使是之前的专业模型 GPT-5.5-Cyber,也仅达到了 57.3% 的完成率。这不仅仅是边际改进,而是模型在漏洞开发效用方面的彻底转型。该模型是传统安全边界的数字特洛伊木马,因为它允许快速生成以前属于专业人类研究人员领域的代码。
在幕后,该模型还利用了一个名为 ExploitGym 的新基准。评估显示,该模型在发现零日漏洞方面比其前代产品更快、更准确。然而,这其中存在权衡。虽然它擅长识别特定缺陷,但目前在开放式任务(如审计海量存储库或编写高质量、格式化的漏洞报告)方面效果较差。该模型倾向于简洁,它优先考虑功能性漏洞利用,而非行政文书工作。
该模型能力最具体的例子是 CVE-2026-15903。这是 V8 JavaScript 引擎中的一个高严重性漏洞,CVSS 评分为 8.8。该模型识别出了一个越界读写缺陷,允许在沙箱内执行任意代码。更令人印象深刻的是,该模型随后发现了第二个此前未知的漏洞,并与第一个漏洞串联。这一链条实现了从 V8 堆沙箱的完整逃逸。
谷歌在 2026 年 7 月中旬修复了这一缺陷,但这里的关键在于发现过程。模型通过专业训练发现了这些问题,它不仅仅是猜测,而是通过引擎的内存管理逻辑进行推理。该模型还在一个流行的操作系统内核中标记了 400 多个可能导致权限提升的漏洞。在典型的企业中,这 400 个缺陷代表了 400 个潜在的入口点,隐蔽的攻击者可以利用这些入口点在网络中进行横向移动。
这项技术的核心存在一个危险的悖论。虽然 AI 正在成为发现和利用缺陷的大师,但在修复缺陷方面仍是新手。来自 1Password 的数据揭示了模型防御能力中令人担忧的差距。在他们的测试中,大语言模型生成的补丁在不改变应用程序行为的情况下完全解决漏洞的比例仅为 26.0%。在超过 53% 的案例中,AI 生成的补丁要么未能修复漏洞,要么引入了新的漏洞。
这是对我们系统完整性的严重威胁。如果我们自动化了缺陷的发现,却依赖有缺陷的自动化补丁,我们就会创建一个更加脆弱的软件生态系统。修补就像堵住船壳上的洞,如果塞子尺寸不对,船照样会沉。开发人员必须保持对代码更改的最终决定权。我们目前还不能信任 AI 代理在没有细粒度人工监督的情况下重写关键任务逻辑。在补丁周期中引入新的、隐蔽的后门的风险太高了。
从终端用户的角度来看,威胁在于攻击生命周期的速度。AI 缩短了从漏洞披露到部署功能性漏洞利用程序的路径。攻击者不再受限于自己的编码速度,他们使用这些模型来外包规划和执行攻击活动的琐碎工作。这导致攻击速度更快,受害者范围更广。
我们正看到一种转变,即零信任不再是一种奢侈品,它是唯一可行的架构。将您的内部网络视为门口有保镖的 VIP 俱乐部。永远不要仅仅因为连接源自内部 IP 地址就信任它。AI 代理可以模仿合法的流量模式并自动化发现错误配置。如果您的安全依赖于内部服务的隐蔽性,那么您已经被攻破了。
为了防御这类新型自动化威胁,组织必须超越反应式扫描。弹性防御需要对所有第三方依赖项和内部代码库进行主动审计。GPT-5.6-Cyber 能发现 400 个内核漏洞这一事实,应该激励每一位 IT 领导者优先考虑其漏洞管理计划。
从评估您的外部攻击面开始。许多公司都有“影子 IT”,它们充当网络的暗物质——对 IT 部门不可见,但对 AI 驱动的扫描器可见。通过 Daybreak Blue 等授权层级使用这些相同的模型来审计您自己的防御。目标是通过使用攻击者使用的相同智能来缩小防御差距。但是,不要假设今天的清洁扫描意味着明天的安全。模型正在不断学习绕过现有控制的新方法。
将这些前沿模型的访问权民主化是安全社区的必要步骤。我们不能用手动的水桶队来扑灭自动化的火灾。虽然滥用的风险是真实的,但将这些工具完全留在恶意行为者手中的代价要高得多。现在的重点必须放在提高自动化修复的准确性上,以便我们能够像破坏一样快地进行修补。
来源:
免责声明:本文仅供参考和教育目的。它不能替代专业的网络安全审计或事件响应服务。在对您的基础设施进行更改之前,请务必咨询认证的安全专业人员。


