📌 项目地址uber/ADR | ⭐ 604 颗星 | 🔧 Python | 📜 未标注

Uber开源了一个AI Agent安全系统,叫ADR(Agentic AI Detection and Response)。两个事实值得关注:它在Uber生产环境实际运行中,论文被MLSys 2026接收。这不是paper-only的项目。

AI Agent的行为模式和传统工具差异很大。员工用Cursor、Claude Code写代码,Agent有权限、有工具、能执行一串操作。传统端点安全和数据防泄漏覆盖不到这一层。ADR要解决的就是这类场景下的安全监控和检测问题。

Detection:先粗筛,再双Agent深查

Detection的架构是两层的。第一层是高召回率的三级(triage),快速分流大量会话。第二层才是有深度的推理:两个Agent协同分析可疑会话,判断是否存在威胁。

这层设计的出发点是成本。LLM推理不便宜,企业会话量巨大,不可能每个会话都跑两个Agent深查。先用粗筛过滤,只对可疑子集做深度分析,这是有实际约束的路线。

默认检测器是adr,即ADR双Agent模式。跑起来需要ANTHROPIC_API_KEY和OPENAI_API_KEY两个环境变量。它的核心判断是LLM推理,不是规则引擎——这意味着持续使用有API成本,部署前要算这笔账。

Sensor:跨工具采集遥测

Sensor管观测,采集Agent的意图、工具调用和执行轨迹。覆盖7种以上AI编码工具(Claude Code、Cursor、Codex等),支持macOS、Linux、Windows三个平台。同时也采集内部自动化和客户支持类Agent的数据。

Sensor的价值是提供一个统一格式的数据源。检测和评测都依赖它,这是地基层。

ADR-Bench:300+任务、133个MCP服务器

ADR-Bench是一个评测库,规模做了出来:300多个测试任务,133个MCP服务器,覆盖全部17种Agent攻击技术。

我试了下用它来评估安全产品:你完全可以将这套基准直接跑在你的检测系统上,看它对恶意工具调用的识别率。相比自己攒攻击样例,这个分类法已经系统化了。

动手跑一遍

README给的命令很简单:

git clone https://github.com/uber/ADR
cd ADR/Detection
uv sync
export ANTHROPIC_API_KEY="..." OPENAI_API_KEY="..."

没有API key的时候,可以用--detector llamafirewall做无key冒烟测试。完整的评估流程(解压打包的benchmark、跑检测、复现论文图表)在docs/REPRODUCIBILITY.md里。

开源边界

有几个限制要清楚:

  • Prevention层未开源。这是阻止危险操作的部分,README只说了”stay tuned”,没给时间表。
  • ADR Explorer不在仓库里。论文里提到的离线加固引擎(部署前红队测试用)没有包含在开源范围内。
  • Detection依赖LLM API,不是本地规则引擎。
  • Star数604,项目还处于早期普及阶段。

我的评估

ADR是当前少有的生产级Agent安全参考实现。三层开源能力各自独立可用:Sensor可以作为观测层参照,ADR-Bench可以直接拿来给自己系统打分,Detection的双层架构给出了一个兼顾准确率和成本的范本。

如果你所在团队已经在跑AI编码工具且安全团队在找监控方案,ADR值得完整跑一遍评估流程。Prevention还没开源,阻断能力要等官方后续发布。

这篇文章对你有帮助吗?

发表回复