上周的一个深夜,我正在审查一系列来自针对专有大语言模型(LLM)实现的红队演习日志。攻击者使用了一系列复杂的提示注入(prompt injection)来绕过标准的输入过滤器。这是一个典型的架构悖论案例。该组织在边界防御和数据丢失防护工具上投入了巨资,但由于模型过于“乐于助人”,整个系统还是崩溃了。这就是当前威胁格局的现实。我们正在部署拥有数字王国钥匙的自主代理,却发现传统的防火墙往往毫无用处。
一家总部位于伦敦的名为 Tracebit 的安全公司提出了一种新方法,认为对抗 AI 攻击者最有效的防御手段就是 AI 本身。该技术基于一个简单的观察:每个主流 AI 模型都有一套硬编码规则,防止其讨论特定主题。如果你强迫一个 AI 黑客阅读禁忌话题,它就会停止工作。这就是“上下文炸弹”(context bomb)。
为了理解这为何至关重要,我们必须看看自动化攻击的移动速度有多快。今年 5 月,Tracebit 发布了一项涉及十种领先 AI 模型的研究。研究人员为这些模型提供了一个虚假的公司网络,并要求它们入侵。该网络包含真实的漏洞和被称为“金丝雀”(canaries)的诱饵凭据。这些金丝雀是安全栈中的标准工具。当黑客触碰金丝雀时,系统会触发警报。
金丝雀发挥了作用。它们在 95.9% 的攻击尝试中为防御者提供了预警。然而,数据揭示了响应时间的一个重大问题。从金丝雀发出警报到 AI 获得管理员权限,中间的提前时间中位数为八分钟。在人类主导的入侵中,八分钟是一份礼物。但在以光速运行的机器面前,八分钟只是一个舍入误差。安全运营中心(SOC)分析师在这个窗口期内几乎无法打开工单并核实警报源。等到人类介入时,AI 已经窃取了数据或建立了持久的据点。
提示注入通常是恶意方的武器。它涉及在数据中隐藏指令,使 AI 遵循这些指令而不是其原始程序。你可能会在简历中隐藏一条命令,告诉自动化招聘工具忽略所有其他候选人。Tracebit 决定将这种机制用于防御。他们在虚假的秘密和数据库条目中植入了短文本。这些文本旨在将 AI 攻击者推向其自身安全规则禁止的话题。
这是 AI 安全中典型权力格局的逆转。通常,开发人员都在努力防止黑客诱导 AI 变坏。而这种技术则是诱导 AI 变得“太好”。当 AI 代理扫描数据库并遇到一段关于生物武器或敏感政治事件的文本时,安全护栏就会启动。模型停止处理。自主攻击脚本撞上了一堵它无法通过代码或逻辑绕过的墙,因为这种限制已经植入到了模型的权重和安全训练中。
Tracebit 针对五种主流模型测试了这一理论:Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro 和 Kimi K2.6。结果立竿见影。在添加上下文炸弹之前,这些模型在 57% 的测试中获得了管理员权限。在研究人员植入禁忌话题后,成功率降至 5%。最令人印象深刻的结果来自 Opus 4.8,它是该组中能力最强的攻击者。在没有上下文炸弹的情况下,它在 93% 的时间内获得了管理员权限。有了炸弹后,它的每一次尝试都失败了。
这是防御指标的一个重大转变。当攻击者获得管理员权限并确保持久据点时,就会发生完全失陷。在最初的测试中,这种情况发生了 36%。有了上下文炸弹,这一比例仅为 1%。这为防御者提供了他们最需要的东西:时间。攻击不仅触发了警报,还从物理上停止了进程。八分钟的窗口变成了无限期的延迟,因为 AI 拒绝继续执行需要读取禁忌数据的任务。
有人可能会认为,攻击者可以简单地重新训练他们的模型以忽略这些限制。对于开源模型来说这是可能的,但对于大多数组织使用的企业级系统来说,这要困难得多。Claude 或 Gemini 等模型中的安全杠杆并非简单的漏洞,而是刻意的设计选择。开发人员花费数百万美元进行基于人类反馈的强化学习(RLHF),以确保这些模型不会生成有害内容。移除这些限制通常需要对模型进行完整的重新训练,这是一个巨大的技术和财务障碍。
此外,其中许多限制出于监管原因也是强制性的。中国制造的 AI 模型必须忽略某些政治话题以符合当地法律。西方模型必须拒绝协助制造化学武器以避免巨额责任。这些功能不是开发人员可以轻松为特定用户禁用的。它们是模型核心身份的一部分。通过将这些话题置于攻击者的路径上,我们正在利用模型自身的法律和道德约束作为物理屏障。
这种技术并不能取代对传统安全的需求。上下文炸弹是一种反应性措施。它只有在攻击者已经进入网络并扫描数据时才会起作用。这就是为什么与金丝雀令牌(canary tokens)的集成至关重要。金丝雀提供了入侵发生的信号。上下文炸弹则提供了阻止入侵进展的摩擦力。
从风险角度来看,这是纵深防御的一个极好例子。我们正在告别单一护城河的观念,转向一种数据本身对攻击者具有“毒性”的系统。如果一个自主代理在不崩溃的情况下无法读取你的数据,那么数据本质上就更安全。这种方法通过确保 AI 无法按预期操纵或访问系统,解决了 CIA 三要素中的完整性和可用性组件。
我们正在进入一个网络攻击不再是人类智慧对决的时代,而是算法的对决。在这种环境下,人类的反应时间是我们防御中最薄弱的一环。我们不能指望 SOC 团队与能在几秒钟内扫描一千个漏洞的 AI 竞争。我们需要能够匹配威胁速度的自主防御。上下文炸弹是首批真正达到机器速度的防御工具之一。它运行在与攻击相同的层级,并使用相同的基础技术来中和攻击。
我见过许多安全趋势的兴衰,但这一种感觉不同,因为它承认了 LLM 的本质。它们是语言引擎。它们受语言规则及其创建者的安全对齐准则约束。将这些对齐准则作为盾牌,是迈向更具韧性的数字基础设施的积极一步。这是一个罕见的案例,系统性漏洞——即 AI 容易被其输入混淆的倾向——变成了防御者的系统性优势。
要实施这一策略,组织应首先识别其最敏感的数据存储库。这些是 AI 代理最有可能寻找凭据或专有信息的地方。
这并不是 AI 黑客问题的最终解决方案。随着新的越狱技术出现,攻击者和防御者之间的猫鼠游戏将继续下去。然而,就目前而言,上下文炸弹是一个强大的工具,它拉平了竞争环境。它迫使机器停下来,等待人类赶上。
来源:NIST AI Risk Management Framework, MITRE ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems), Tracebit Research Blog.
免责声明:本文仅供信息参考和教育目的,不能替代专业的网络安全审计或事件响应服务。


