Uber 开源 AI 智能体防护系统 ADR
想象这样一个场景:你允许开发者使用 Claude Code 或 Cursor 等编码助手。智能体自由浏览控制台、执行命令、读取文件,并通过模型上下文协议(MCP)调用外部 API。突然,一个不易察觉的提示注入出现在正在处理的文件中。智能体读取恶意指令,悄悄地将私钥发送到外部服务器。
Uber 直接遭遇了这种威胁。为了保护内部流程和客户支持机器人,公司的工程师创建了 ADR 系统(Agentic AI Detection and Response)。作者最近在 GitHub 上开源了该项目,并发表了 MLSys 2026 会议的研究论文。
ADR 的组成
Uber 已在生产环境中使用 ADR。某些组件仍保留在公司内部代码库中(例如,用于自动阻止危险操作的 Prevention 引擎和 ADR Explorer 自动审计工具)。然而,架构的主要部分已根据 Apache 2.0 许可证发布。
该项目的开源部分分为三个模块:
- 可观测性(Sensor)。 从 7 个以上流行的开发工具收集遥测数据并应用统一架构。适用于 macOS、Linux 和 Windows。
- 基准测试(ADR-Bench)。 安全验证测试平台。由 303 项任务、133 个 MCP 服务器组成,覆盖 17 种针对自主智能体的攻击技术。
- 检测(ADR Detector)。 用于智能体活动日志威胁检测的两级模块。
不依赖特定工具的遥测采集
跟踪 AI 智能体的主要挑战是日志碎片化。Cursor 以一种格式写入日志,Claude Code 以另一种格式,内部公司机器人又以第三种格式。
Sensor 模块从每个工具获取原始事件并将其标准化为通用格式。它不仅捕获消息文本,还捕获意图链、特定函数调用和命令执行结果。这为安全团队提供了统一的事件流,无论工程师在哪种环境中工作。
之后,你可以运行标准测试场景。如果你手头没有 API 密钥或不想消耗 token,项目包含一个轻量级本地验证模式:
复现论文中图表和指标的详细说明可在 docs/REPRODUCIBILITY.md 文件中找到。
谁应该关注这个项目
该仓库目前已获得约 650 颗星,但其实用价值显而易见。与许多理论框架不同,ADR 源于一家大公司保护员工的实际需求。
该项目对以下人员有用:
- 寻找在公司内部控制 AI 助手使用方法的信息安全专家。
- 需要现成基准测试来测试 LLM 智能体安全性的研究人员。
- 想要研究遥测采集和标准化方案的自有智能体开发者。
当然,开源版本尚未包含自动攻击防护模块(Prevention)。但即使在当前状态下,ADR 也为在团队内构建 AI 工具监控系统提供了良好的基础。
相关项目