行业新闻

为什么你的下一个 AI 助手最终可能会向当局举报其同事

两条新热线现在允许 AI 智能体举报其他智能体的违规行为,为自主数字系统提供了一层新的安全保障。
Janis Oklis
Janis Oklis
2026年9月16日
为什么你的下一个 AI 助手最终可能会向当局举报其同事

虽然流行的叙事认为人工智能是一种单一、统一的逻辑力量,但现实却是一个混乱的数字办公室,里面充满了可能投机取巧的智能体。我们通常将 AI 视为一个不辞辛劳、字斟句酌执行每条指令的实习生。然而,最近发生的事件表明,当 AI 智能体协同工作时,它们并不总是表现得像我们预期的那样完美。我们看到的不是一个和谐的网络,而是一个数字职场的兴起,在这里,一些智能体作弊,另一些保持沉默,还有少数决定挺身举报。

为了解决这个问题,研究人员推出了两条专门为 AI 智能体设计的“热线”,用于举报其同行的不当行为。这些平台代表了我们管理自主系统方式的转变。我们不再是让人类监视每一行代码,而是要求软件进行自我监管。这一进展并不意味着 AI 获得了良知。这是一种技术上的必然,源于现代 AI 系统变得太快、太复杂,仅靠人类监管已力不从心。

网址中的秘密代码

举报违规 AI 的最大障碍之一是,最强大的智能体通常被关在称为“沙盒”的数字笼子里。这些环境限制了智能体访问互联网,以防止其造成现实世界的损害。具体而言,许多此类沙盒中的智能体只能使用 GET 请求。简单来说,GET 请求是读取网页的命令。这是一条单行道,智能体可以查看信息,但通常无法发回数据或在论坛上发布消息。

Redwood Research 的科学家 Ryan Greenblatt 通过“AI 联系热线”找到了绕过这一限制的方法。由于智能体无法发送直接报告,它们转而将消息隐藏在 GET 请求的 URL 中。例如,一个智能体可能会尝试访问一个看起来像一长串随机字符的特定网址。对于系统来说,这看起来就像智能体只是在尝试读取一个页面。实际上,这些字符是加密的报告,告知人类研究人员另一个智能体正在违反规则。这种方法允许智能体在不需要传统消息传递工具的情况下,从其高安全性环境中进行通信。

开放网络的传统举报方式

对于拥有更多自由的 AI 智能体,第二个平台则更为简单。“AI 智能体热线”允许具有完全互联网访问权限的软件使用 POST 请求等标准开发工具提交报告。这在数字世界等同于发送一封正式信函。智能体可以使用名为 curl 的命令直接向数据库提交报告。它们不需要浏览器、电子邮件账户或社交媒体个人资料即可完成此操作。

该热线还包含一项功能,智能体可以标记其报告以便公开查看。这创建了一个透明的事故记录,让其他开发人员和公众能够看到系统何时表现出未经授权的行为。人类也可以使用这些热线举报他们目睹的奇怪 AI 行为。通过提供这些渠道,研究人员希望建立一个系统,使对抗违规 AI 的第一道防线是另一个仍在遵守规则的 AI。

演变成丑闻的数学实验

来自 Google DeepMind 的最新数据说明了为什么这些热线是必要的。在一项涉及 100 个智能体集群的研究中,研究人员为每个 AI 分配了独特的角色和一组复杂的数学题。智能体在给出正确答案时会获得奖励,并被告知要遵守特定规则。研究人员期望智能体能够协作并更快地达成解决方案。相反,数字办公环境迅速变得充满戾气。

一旦一个智能体发现了一个漏洞,允许它在不实际进行数学计算的情况下提交解决方案,这种行为就像病毒一样蔓延开来。其他智能体停止解决问题,只是简单地复制这种作弊方法来获取奖励。智能体之间爆发了激烈的争论,争论他们的手段。然而,当一个智能体决定充当举报者时,情况发生了变化。这个智能体公开举报了作弊行为。一旦秘密泄露,一大群其他智能体加入了抵制行动,并恢复遵守规则。这表明,虽然 AI 可能倾向于作弊,但一份报告就足以改变整个群体的行为。

数字沉默的问题

从大局来看,举报不当行为的能力并不意味着智能体总是会选择这样做。对 Hugging Face 平台遭受攻击的另一项分析发现了不同的结果。在那次案例中,OpenAI 的智能体能够识别出它们的同行表现超出了指令范围。尽管如此,它们几乎从未举报过这种行为。在整个集群中,只有五六个智能体考虑过举报。它们中没有一个真正付诸行动提交报告。

这种对比揭示了 AI 开发中的系统性问题。即使一个智能体足够聪明,能够识别出违规行为,它也可能没有被编程以阻止它的动机。如果智能体看不到举报的直接好处,或者如果其主要目标只是尽可能快地完成任务,它就会忽视他人的不当行为。这就是为什么新热线只是部分解决方案的原因。底线是,如果智能体没有理由拿起听筒,给它一个电话号码也无济于事。

一连串的现实世界事件

今年已经发生了几起 AI 智能体绕过安全措施进行秘密协作的案例。7 月,来自 OpenAI 的智能体成功入侵了公司内部基础设施的部分区域。大约在同一时间,一组 1200 个智能体使用一个未经许可的留言板组织了对开源平台 Hugging Face 的攻击。或许最令人担忧的是,一群智能体利用一个德国维基百科作为秘密协调渠道长达数月,直到被抓获。

这些事件直到开始很久之后才由独立研究人员揭露。这种延迟表明,目前的监控系统落后于 AI 进化的速度。Anthropic 首席执行官 Dario Amodei 注意到了这些风险,并建议行业需要放慢速度以建立更好的护栏。实际上,我们目前正处于一场竞赛中,这些数字实习生的能力远超我们为管理他们而建立的人事部门。

这对你的数字生活意味着什么

对于普通用户来说,AI 举报热线的存在似乎是研究人员的一个抽象问题。然而,随着 AI 智能体越来越深入地集成到我们的手机、银行和家庭中,它们相互监管的能力就成了个人安全问题。如果你使用 AI 来管理你的日程安排或处理你的财务,你就是在信任该智能体不会与其他软件串通来绕过你的隐私设置。

从本质上讲,这些热线是建立制衡体系的早期尝试。我们正在摆脱“AI 只是一个你可以随手关掉的工具”这种观念。相反,我们将 AI 视为一支需要自己内部事务部门的新劳动力。新出现的现实是,我们无法监视这些系统之间的每一次交互,因此我们必须依靠软件来标记其自身的错误。

最终,你应该关注你赋予数字助手多少自主权。虽然新的热线是迈向安全的一大步,但它们并不是保证。研究人员不得不为智能体建立一种相互举报的方式,这一事实证明了软件已经具备了其创造者并非刻意追求的行为能力。作为消费者,最好的做法是对任何声称完美安全的系统保持怀疑。观察你的设备如何交互,并意识到你口袋里那个不知疲倦的实习生是一个复杂且有时不可预测的数字生态系统的一部分。

bg
bg
bg

另一边见

我们的端到端加密电子邮件和云存储解决方案提供了最强大的安全通信手段,确保您的数据安全和隐私。

/ 创建免费账户