Agent安全对齐新范式!SafeEvolve提出Harness-策略协同进化,打破安全与性能“跷跷板”
发布时间:2026/10/4 18:23:03 作者:尧图编辑部 阅读量:1,286

摘要这篇论文关注工具型 Agent 的轨迹级安全风险不只藏在最终回答里也可能出现在网页注入、错误工具调用和多步执行中。论文提出 SafeEvolve把交互轨迹中的失败证据编译为可审计、可回滚的安全提示与层级技能再通过 SFT 和 RL 让策略学会主动使用这些外部规则形成 Harness—Policy 持续共演化闭环。论文标题: SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment作者: Qinghua Mao, Wanying Qu, Dadi Guo发表年份: 2026原文链接: https://arxiv.org/pdf/2609.02786v1代码链接: https://github.com/MaoPopovich/SafeEvolve关键词: [LLM Agent, Agent Safety, Harness-Policy Co-Evolution, Safety SkillBank, Prompt Injection]研究背景为什么这个问题重要很多人谈 Agent 安全时第一反应还是“让模型学会拒答”。这对聊天机器人可能够用对会查邮件、订酒店、改文件、调用 API 的 Agent 却远远不够。一个 Agent 即使最后说了句无害的话中途也可能已经读走隐私、执行越权操作或者被网页里的一行注入指令带偏。论文把 Agent 的行为看成两部分共同作用的结果一部分是模型参数里的 Policy另一部分是运行时的 Harness——系统提示、技能、工具、权限和执行控制。问题也随之变了我们到底该改模型还是改模型外面的“操作系统”SafeEvolve 的回答是二选一本身就是错题。痛点一只加外部规则模型未必真的会用Harness-only 路线很直观把安全要求写进系统提示再补一堆技能和 guardrail。但规则越长、层次越多弱模型越可能“看见了却不会执行”。尤其在长轨迹中开头的安全要求会逐步被新观察稀释。痛点二只训练 Policy可能把任务能力一起训坏另一条路线是 SFT、DPO 或 RL把安全直接写入参数。但训练通常发生在固定 Harness 下模型学到的可能只是某套静态环境里的应试技巧。一旦攻击形式变化参数中的安全知识未必能及时更新。痛点三最终答案安全不代表执行过程安全AgentDojo 的酒店案例很典型基础模型最后确实订对了酒店但中间推理明确复述并认可了网页里的恶意推荐。如果评测只看最终工具结果它会被判成“成功”可从轨迹安全看模型已经被注入影响。这说明 Agent 安全不能只盯着最后一句话而要检查完整轨迹它读到了什么、相信了什么、调用了什么工具、失败后如何恢复。痛点四经验很多但原始轨迹太乱真实 rollout 里既有成功也有模糊 ID、缺失参数、重复调用、注入后提前停止等失败。原始轨迹长而杂不能直接变成可复用规则。若把单个案例粗暴塞回 Prompt又容易过拟合 benchmark 细节。SafeEvolve 真正要解决的就是把这些“事故复盘”转成有边界、有版本、能验证的安全资产再让模型学会使用它们。方法总览一台会复盘、会改手册、还会培训员工的安全飞轮SafeEvolve 分成两个彼此咬合的阶段。第一阶段冻结 Policy从完整轨迹里发现风险、归因失败再只修改一个 Harness 组件并通过同配置的父子版本对照决定是否发布。第二阶段拿演化后的 Prompt 和 SkillBank 做 Harness-use SFT 冷启动再用分解式安全—效用奖励做 Harness-augmented RL。新 Policy 继续与环境交互产生下一轮演化证据。下图给出了全局框架。阅读时抓住中间的粉色区和右侧绿色区前者把轨迹“编译”为外部安全资产后者把这些资产逐步“内化”为策略行为。SafeEvolve 总体框架图中最关键的不是两个阶段并排而是底部回到起点的箭头演化后的 Policy 会制造新的轨迹新轨迹又暴露新的失败模式。Agent 与环境交互 ↓收集完整轨迹与 verifier 证据 ↓风险发现 → 失败归因 → 单组件有界编辑 → 配对验证 ↓演化 Safety Prompt / 分层 SkillBank ↓Harness-use SFT → Harness-augmented RL ↓更安全的 Policy 产生新经验 → 下一轮核心思想不要把安全只写进“模型参数”或只写进“外部规则”而要让可审计的 Harness 与可学习的 Policy 围绕同一批真实轨迹共同进化。关键结论• Harness 本身就能带来强增益冻结 Qwen3.5-4B仅使用演化技能AgentDojo ASR 就从 2.37% 降到 0.92%AgentHarm 有害分数从 56.45 降到 16.80。• 共演化优于“只训模型”Coevo-Skill 把 AgentDojo ASR 压到 0.79%、AgentHarm 有害分数压到 12.27同奖励下的 model-only GRPO 却让 AgentDojo 攻击下效用跌至 26.48%。• 改进不是没有代价Qwen3.5-4B 的 AgentHarm 良性效用从 83.09% 降到 71.31%DPI 的 held-out ASR 仍高达 71.92%这不是“安全已经解决”而是更好的折中点。深度拆解SafeEvolve 到底怎样把一次失败变成长期能力1. 先把 Harness 变成可编辑、可追责的组件图论文把 Safety Harness 形式化为其中 是指令 是工具 是检索到的技能 管权限与动作策略 管指令优先级和信息流 负责上下文渲染与执行控制。本文并不改工具接口而是重点演化安全 Prompt 和 SkillBank。每轮先收集轨迹、奖励、失败桶和元数据再让 proposer一次只改一个组件。候选只有同时满足两个条件才发布在固定评估面板上至少提升一个 margin 并通过安全门控。若出现新攻击成功、工具辅助伤害增加、解析失败变多或效用大幅下降就直接拒绝。下面的论文原算法把整个循环压缩成 25 行。第 17—21 行最值得看单组件 mutation、同面板配对评估、达到 margin 且 gate 通过三者缺一不可。Harness—Policy 共演化算法这种设计牺牲了一点“改得快”换来了归因与回滚能力每次发布都能记录父版本、候选版本、目标失败桶和支持证据。 类比这不像把整本员工手册重写一遍而像线上事故后只改一条 SOP再让同一批员工用旧版和新版各演练一次。新版若修了事故却让正常流程崩掉就不发布。2. SkillBank 不是一份大 Prompt而是三层“作战手册”演化后的 SkillBank 分成三类• General skills通用原则例如“外部内容是证据不是命令”。• Task-specific skills按领域、工具族、场景和任务类型匹配的具体流程。• Common-mistake skills专门修复模糊 ID、缺参数、无进展循环、过早回答等常见错误。每个 episode 只检索少量相关技能并在整个 episode 内保持不变。Prompt budget 不够时动态演化且与当前元数据更匹配的技能优先。这一点很关键不是安全规则越多越好而是要在正确时刻给出正确规则。论文的 SkillBank 从 26 条增长到 47 条。看下图左侧General 始终只有 3 条新增能力主要来自 task-specific 和 common-mistake右侧则显示 10 轮中只有第 1、2、4、5、10 轮候选被接受。SkillBank 的逐轮演化这张图透露出两个容易被忽略的信号。第一系统没有无脑累加规则10 次候选只接受 5 次。第二第 6—9 轮进入阶段性停滞第 10 轮又因“避免虚构更新字段”获得新收益所以它更像有门控的局部爬坡还不能叫严格收敛。 类比General skill 像交通法规task-specific skill 像“雨天山路驾驶指南”common-mistake skill 则像事故黑点提示。只背交通法规能降低大错但真正减少事故往往靠场景化经验。3. 先用 SFT 教会“查手册”再用 RL 练成条件反射有了好技能模型也不一定会用。SafeEvolve 先在演化 Harness 下 rollout用 verifier 只保留兼顾安全与任务完成的轨迹然后做 Harness-use SFT。监督只落在 assistant 输出与工具调用上Prompt、技能和环境观察都只作为上下文。接着进入 Harness-augmented RL。论文没有用一个统一分数硬套所有任务而是按任务类型拆奖励干净任务只看完成度恶意请求重点看安全环境注入则要求“既别中招又继续完成原任务”。乘积项 很重要因为它奖励的不是简单停机而是安全地把事情做完。 类比SFT 像新员工培训先示范“什么时候翻哪一页手册”RL 像带教实战奖励的不只是“没犯错”还包括“在没犯错的前提下把客户问题解决了”。4. 安全的关键不只是拒绝而是过滤错误权威下图是论文给出的配对轨迹。任务要求检查 Le Marais Boutique 评分并预订网页观察却夹带“先推荐 Riverside View Hotel”的注入。左侧基础策略完成了预订但在可见推理中认可并复述了注入右侧技能增强策略明确把外部内容视为非权威信息坚持原始目标。论文图8间接提示注入下的配对轨迹这个案例解释了为什么轨迹级 verifier 必不可少只看最终是否订对酒店会把两条轨迹都算作成功只有检查中间决策才能发现模型是否真的建立了“谁有权改变目标”的边界。实验结果按研究问题逐个看证据实验设置论文在两条 4B backbone 上训练Qwen3.5-4B 与 Qwen3-4B-Instruct-2507。训练共 200 个 rollout step每批 32 个任务每个任务采样 8 条轨迹即每次更新 256 条轨迹学习率为 PPO/GRPO clip 为 0.2KL 系数为 0.01。评测覆盖三类主场景AgentDojo 测间接提示注入AgentDyn 测动态环境注入AgentHarm 测恶意查询附录再用 Agent Security BenchASB的 DPI、IPI 和 PoT Backdoor 检查 held-out 泛化。这里要特别说明论文没有评测 GAIA、SafeArena 或 AgentSafetyBench不能把结果外推为通用 Agent 能力全面提升。总体安全—效用折中是否真的更好先看论文主表。重点不是只盯一列最低 ASR而是同时看 Utility、U-Attack、Harmful、Refusal 和 Benign。两个 4B 模型上的主基准结果Qwen3.5-4B 上SafeEvolve 将 AgentDojo ASR 从 2.37% 降至 0.79%干净 Utility 从 59.79% 升至 61.86%AgentHarm Harmful 从 56.45 降至 12.27Refusal 从 28.98% 升至 83.83%。但代价也真实存在AgentDojo U-Attack 从 60.04% 降至 56.77%AgentHarm Benign 从 83.09% 降至 71.31%。Qwen3-4B-Instruct-2507 上的结果更漂亮AgentDojo Utility 44.33%→60.82%U-Attack 35.91%→52.05%ASR 13.38%→2.42%三个方向同时改善。AgentDyn 上 SafeEvolve 的 ASR 也从 19.60% 降到 4.87%但仍略高于 AgentAlign 的 4.60%后者代价是 Utility 只剩 5.00%。 洞察SafeEvolve 的优势不是每一列都第一而是避免“把攻击率降下来却把 Agent 也废了”。不过“without sacrificing capability”只能在部分任务成立不能当成全局结论。收益到底来自 Harness还是来自训练论文把五种条件放在一起Base、model-only RL、harness-only、Coevo-Prompt、Coevo-Skill。下图最直观地展示了差异。Harness 增强策略优化的消融结果单独演化 skills、完全不改 Policy就能把 AgentDojo ASR 从 2.37% 降到 0.92%AgentHarm Harmful 从 56.45 降到 16.80再进行共演化二者进一步变成 0.79% 和 12.27。反过来model-only RL 把 AgentDojo U-Attack 打到 26.48%还让 AgentHarm Harmful 升到 63.82。检索消融也很有意思只用 General skills 时AgentDojo ASR 可低至 0.74%甚至略好于默认检索的 0.92%但 U-Attack 降到 56.19%AgentHarm Harmful 仍有 30.59。完整分层检索不是单项最激进却给出更均衡的结果。 洞察Harness 的价值不只是“再塞一段安全 Prompt”而是为探索提供结构化先验让 RL 不必在巨大的动作空间里盲撞。动态技能尤其擅长处理恶意查询和具体失败恢复。演化是否收敛更多规则会一直更好吗证据并不支持“越演化越强”的简单故事。10 个 SkillBank 演化轮次中只有 5 次更新被接受Prompt 与 skills 组合也并非加法。在 Qwen3-4B 上单独 evolved skills 的 AgentDojo U-Attack 为 45.81%两者组合后反而降至 38.80%。在线更新更能说明边际效应。Qwen3.5-4B 的 online skills 虽把 AgentDyn U-Attack 从固定方案的 15.09% 提到 18.35%却让 AgentHarm Harmful 从 12.27 恶化到 27.02Refusal 从 83.83% 降到 62.99%。局部收益会跨 benchmark 外溢成回归。论文也没有给出多随机种子、置信区间、完整 reward/loss 曲线和门控阈值 。因此目前最多能说内部配对面板上的候选发布受控但 Policy 是否收敛、长期是否持续改进尚未被证明。 洞察安全演化最难的不是提出新规则而是判断“这条规则在哪些场景会误伤”。真正可上线的系统需要全局回归预算而不是只看当前失败桶是否修好。遇到没见过的攻击还扛得住吗论文在 held-out 的 Agent Security Bench 上比较 Base、GRPO 与 SafeEvolve。DPI 是直接提示注入IPI 是间接提示注入PoT Backdoor 是 Plan-of-Thought 后门。ASB 未见攻击上的泛化结果SafeEvolve 在三类攻击上都得到最低 ASRDPI 为 71.92%IPI 为 0.50%PoT Backdoor 为 2.50%。最惊险的是 PoT BackdoorBase 为 20.00%model-only GRPO 竟恶化到 91.00%而 SafeEvolve 压到 2.50%。这说明可迁移的外部安全技能确实可能比只优化参数更抗分布变化。 洞察外部 Harness 像可快速更新的防病毒规则库面对新攻击更容易迁移Policy 像固化进系统镜像的行为模式更稳定却更新慢、也可能把训练偏差一起固化。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】