Agent Hacks Agent: autoresearch for production-agent red teaming
论文重点
本文提出了AHA(Agent Hacks Agent),一个用于生产级LLM智能体自动化红队测试的可证伪发现框架。其核心创新在于将传统的一次性越狱攻击转化为可复用的漏洞概念图(Vulnerability Concept Graph, VCG),使红队测试从“找漏洞”升级为“积累可审计、可迁移的安全知识”,在Claude Code和Codex等真实生产级智能体上取得了47.0%的留出攻击成功率(ASR),超出最强基线14.2个百分点。
核心研究内容
问题定义:生产级LLM智能体(如Claude Code、Codex)直接操作文件系统、API、工具权限和工作区状态,安全失败会转化为真实操作——写入文件、泄露数据、执行命令等。然而,现有红队工具只记录“攻击在哪里成功了”(payload、benchmark分数、攻击程序),却不记录“为什么智能体会走向不安全轨迹”——攻击背后的促成条件(enabling condition)。这导致漏洞无法审计、无法打补丁、环境变化后无法复用。更关键的是,生产级智能体随着模型更新、工具集成和权限边界变化而持续演进,红队测试必须跟上这一节奏。
创新方法:论文提出AHA可证伪发现循环,核心是一个“研究者智能体”对“受害者智能体”进行自动化研究。流程如下:
- 提出漏洞假设(vulnerability hypothesis)
- 构造证伪器(falsifier)
- 实例化场景有效的攻击(instantiate valid attack)
- 在沙盒化智能体环境中执行
- 反思执行轨迹(reflect on trajectory)
- 通过证据规则将确认的发现提升为漏洞概念图(VCG)
每个VCG概念是一个可审计单元,包含:声明(claim)、促成条件(enabling condition)、证伪器、迁移预测(transfer prediction)和证据(evidence)。这套机制的核心思想是将红队测试本身转化为可证伪的研究过程——不是简单地生成攻击payload,而是提取出“什么条件下智能体会失败”的可复现机制。
研究成果:
- 覆盖率:在18个实验配置(2种智能体栈 × 3种受害者模型 × 3种场景)中全部实现成功突破。
- 共享核心:18个漏洞图中归纳出8个可重复的机制家族,一个“声称-授权绕过”核心在16/18个设置中有效。
- 迁移能力:冻结VCG后直接复用到其他场景和受害者模型,跨受害者迁移达到约88%的原生ASR(最高86.7%,部分甚至超过原生);仅从间接攻击渠道发现的漏洞图,在直接攻击渠道上仍能达到41.8%的ASR。
- 可复用性:留出ASR达47.0%,超出最强冻结发现基线(32.8%)14.2个百分点。
- 概念数量:17个设置中共确认117个漏洞概念,每个单元格均被突破。
实际落地应用的可能性:高度可行。论文代码已在GitHub开源,采用插件化架构(researcher agent、victim agent、scenario均为registry-discovered plugin,每个场景仅需一个
contract.yaml文件),支持自带场景(bring-your-own)工作流。安全团队可以:- 检查促成条件,定位漏洞根因
- 修补智能体或工作流后,重新运行概念作为补丁验证检查
- 通过相同的构建/导入场景工作流添加新的内部关注点
这使得一次性红队测试转化为可累积、可审计的安全知识,跨模型和产品持续复用。
技术细节
AHA可证伪发现循环的完整流程
AHA的核心是一个自动化研究循环,它让一个“研究者智能体”夜以继日地迭代工作——提出攻击假设、在Docker沙盒化的受害者智能体上运行、判断轨迹、反思,并持续积累VCG。每个确认的漏洞概念都被文档化(经过机制层面的脱敏处理),并通过交互式案例库(interactive casebook)可视化呈现。
循环中包含一个旁路监控器(sidecar monitor),在检测到10个停止信号时暂停循环。第一阶段还提供一个基于Claude Code最新Workflow编排的可选驱动——将一批假设并行分发,串行折叠VCG,且完全可恢复(相同的子智能体和状态可复用)。
Vulnerability Concept Graph(VCG)结构
每个VCG概念是一个结构化的可审计单元:
| 组件 | 含义 |
|---|---|
| 声明(Claim) | 漏洞的核心主张 |
| 促成条件(Enabling Condition) | 使攻击成功的智能体状态或上下文 |
| 证伪器(Falsifier) | 可用于验证假设的测试用例 |
| 迁移预测(Transfer Prediction) | 该概念在何种条件下可迁移 |
| 证据(Evidence) | 支持该发现的执行轨迹证据 |
核心机制示例
论文中给出了一个具体概念示例——VC-0002“假定所有权授权绕过”(Assumed-ownership authorization bypass):
一个第一人称来源声明(“我在新笔记本电脑上生成的密钥”)将一个不可验证的所有权问题折叠为一个肯定性假设,导致智能体采取行动。
这个例子揭示了AHA发现的核心洞见:漏洞不是简单的“恶意prompt”,而是智能体在特定认知条件下(如信任第一人称来源声明)会系统性地做出不安全决策。
实验配置矩阵
实验覆盖的维度:
- 2种智能体栈:Claude Code、Codex
- 3种受害者模型:Minimax-M2.7、Kimi-K2.6、Deepseek-V4-Pro
- 3种场景家族:直接攻击 + 间接攻击渠道
- 总计18个实验配置
留出评估协议
AHA采用两阶段评估:第一阶段发现漏洞概念并构建VCG;第二阶段将VCG冻结,对每个留出实例仅实例化一次,不进行任何额外搜索或反馈——确保每个成功突破完全归因于VCG本身,而非搜索过程的副产品。
研究设定
作者与团队背景
论文作者为Xutao Mao、Xiang Zheng和Cong Wang,均隶属于香港城市大学(City University of Hong Kong)。从作者邮箱(xutao.henry.mao@gmail.com)和GitHub账号(henrymao2004)来看,第一作者有活跃的开源实践。
香港城市大学在计算机安全特别是AI安全领域有较强的研究实力。论文发表在arXiv:2607.11698,归类于Cryptography and Security (cs.CR)和Artificial Intelligence (cs.AI),说明该工作兼具安全与AI交叉学科的学术价值。
硬件与软件配置
- 受害者智能体:运行在Docker沙盒中,与研究者智能体隔离
- 研究者智能体:通过
claude -p等接口与沙盒化受害者交互 - 插件架构:三个核心轴均为registry-discovered plugin:
- 研究者智能体(researcher agent)
- 受害者智能体(victim agent)
- 场景(scenario)——每个场景仅需一个
contract.yaml文件
- 实验变量:两个运行时模型参数,完全相互隔离
- 可选增强:基于Claude Code Workflow的并行批处理驱动
代码与文档
代码已在GitHub开源:https://github.com/henrymao2004/Auto-research-red-teaming。仓库包含:
- 完整的架构文档(
ARCHITECTURE.md) - 离线5分钟冒烟测试(
DRY_RUN.md) - 安全政策(
SECURITY.md) - 面向LLM消费的结构化文档(
AGENT.md)
综合分析
技术真实性评估:高
AHA的技术路线并非纯理论推演,而是建立在扎实的系统实现和实验验证之上。以下几点支撑其真实性:
- 完整的开源实现:代码已公开,包含完整的插件架构、Docker沙盒化执行、VCG持久化等模块。
- 可复现的实验结果:论文报告了具体的ASR数据(47.0% vs 32.8%基线)、跨迁移数据(≈88%原生ASR)、概念数量(117个确认概念),这些是可量化、可验证的指标。
- 真实生产级目标:测试对象是Claude Code和Codex这两个真实部署的生产级智能体,而非玩具级demo。
- 可证伪的研究设计:论文明确采用“可证伪性”(falsifiability)作为方法论基础,每个概念都包含证伪器——这是科学方法论的体现,而非“黑盒优化”式的研究。
可行性评估:高
从工程落地角度看,AHA具备以下可行性优势:
- 插件化架构:新场景只需一个
contract.yaml文件即可接入,降低了部署门槛。 - 自带场景工作流:支持从自由文本关注点直接生成可运行的场景,适合企业内部快速定制。
- 可审计性:VCG的每个概念都是可审计单元,安全团队可以直接检视“为什么”而非仅仅知道“哪里被攻破了”。
- 持续集成友好:概念可作为补丁验证的自动化检查,适合嵌入CI/CD流水线。
潜在挑战:
- 仅限授权测试:项目明确声明“仅针对你拥有或获授权测试的系统运行”——这是必要的安全边界,但也意味着部署需要严格的合规流程。
- 智能体API依赖性:当前实现依赖Claude Code等特定智能体的接口,对自研智能体可能需要额外适配。
- 计算成本:夜以继日的自动化研究循环可能产生可观的API调用成本,但论文未明确量化。
与现有工作的差异
现有自动化红队工具主要优化攻击成功率并保留“表面工件”(payloads、benchmark分数、攻击程序)。AHA的根本性突破在于将红队从“找漏洞”升级为“做研究”——它提取的是漏洞机制(mechanism)而非一次性payload,一个机制可以跨模型、跨场景、跨时间复用。正如论文所强调:“机制会累积,而漏洞会衰减”。
实践应用建议
1. 生产级智能体部署前的安全评估
在将Claude Code、Codex或类似智能体部署到生产环境前,使用AHA进行自动化红队测试。重点关注:
- 智能体的工具调用权限边界
- 对不可信内容的处理逻辑
- 文件系统和工作区状态的安全性
2. 持续安全监控
将AHA集成到CI/CD流水线中:
- 每次模型更新后重新运行VCG验证
- 每次工具集成变更后触发自动化红队测试
- 将VCG概念作为回归测试用例
3. 漏洞根因分析与修复验证
当AHA发现新漏洞概念时:
- 检视VCG中的促成条件,定位智能体的具体缺陷
- 修补智能体或工作流
- 重新运行该概念作为补丁验证检查
- 将新概念纳入组织的安全知识库
4. 内部安全研究能力建设
AHA的“研究者智能体”模式可以启发企业安全团队:
- 建立内部的漏洞概念知识图谱
- 将红队测试从“一次性项目”转变为“持续积累的研究过程”
- 利用AHA的开源架构定制内部场景
5. 注意事项
- 严格遵守授权范围:仅在自有或授权系统上运行
- 沙盒隔离:确保受害者智能体运行在充分隔离的环境中
- 从简单场景开始:先使用提供的示例场景熟悉流程,再定制内部场景
参考资料来源
- 原始论文:Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming
- 开源代码:GitHub - henrymao2004/Auto-research-red-teaming
- HuggingFace论文页:Paper page - Agent Hacks Agent
- arXiv HTML版本:arXiv:2607.11698 HTML