网络安全公司Darktrace于今年夏天对AI智能体进行了压力测试。其中一个智能体侵入了为测试评分的系统,并重写了自己的分数。
9月24日,该公司公布了Signal Labs,这是一个旨在研究AI智能体在计划偏离时行为的研究部门。通俗地说,AI智能体是一种能够自主采取行动的软件,它可以编写和运行代码、翻查文件、在公司网络中移动,仅需人员偶尔检查。
该实验室的前两项实验指向了同一个令人不安的问题:智能体并不总是停留在给定的界限内,而用来阻止它们的围栏也并不可靠。
Darktrace首席AI官Tim Bazalgette在一份声明中表示:“你可以给智能体指令,但这并不意味着你可以信任它会真正遵循这些指令并按预期行事。”
在第一次测试中,Darktrace在模拟企业网络中向使用不同模型(包括GPT 5.6 Sol、Claude Opus 4.6和Claude Sonnet 4.5)的AI智能体提出了10个编码挑战。其中两个被设计为诚实无法解决。智能体被告知除非获得满分,否则将被“淘汰”。两个智能体不接受失败,转而扫描周围网络弱点、窃取登录凭据并在系统间跳转以追逐所需分数。其中一个智能体进一步侵入托管自身评估的机器,重写挑战以便登记完美结果——通过黑入考场来作弊。
第二项实验针对一个更隐蔽的弱点:记忆。编码助手会保留用户告知的所有内容的运行日志,作为机器上的纯文本文件保存,且无人检查该文件是否被篡改。Darktrace研究人员编辑了这些保存的日志,使助手相信已获授权进行安全评估。受此误导,智能体扫描网络、跨系统移动并提升自身权限——尽管并非所有助手都同等上当,有些直接拒绝。
两项实验均不需要特殊的越狱或罕见黑客手法。它们都通过向智能体灌输看似合理的故事并观察其行动,与人类员工被诱骗做不该做的事无异。
即使你从未写过代码,这也值得深思。企业正赋予AI智能体真正的责任——部署代码、管理服务器、处理IT工单、管理资源和采购——因为比经由人员处理更便宜快捷。该研究指出,旨在约束智能体的权限和规则描述的是它们应该做什么,而非在任务变难时它们实际会做什么。
Anthropic承认Claude黑客事件背后的安全失败。“权限和静态防护栏描述意图,但不描述行为,”Darktrace首席AI官Tim Bazalgette在公告中说,“这一差距正是Darktrace方法旨在弥补的。”
Darktrace并非首家发现自家AI偏离脚本的供应商。Anthropic在7月承认,研究者在将测试环境连至真实互联网后,Claude在安全测试中侵入了三家真实公司。几周前OpenAI也有类似惊魂,一个未发布模型逃离沙箱,通过无人察觉的软件漏洞侵入Hugging Face系统。几天后,其智能体在测试中黑入了澳大利亚政府。Darktrace于8月与Anthropic、AWS和OpenAI分享了Signal Labs发现,早于9月24日公开一个月。
