复旦大学、同济大学等联手,让AI“读懂规则“
2026/7/25 22:52:08
网站开发
这项由复旦大学、同济大学、香港中文大学以及芝加哥大学、伊利诺伊大学联合完成的研究以预印本形式于2026年7月7日发布论文编号为arXiv:2607.05910。有兴趣深入了解的读者可以通过该编号在arXiv平台查阅完整论文。假设你经营三个不同的网站一个是面向所有年龄段的家庭友好型社交媒体一个是面向成人艺术爱好者的创作社区还有一个是销售泳装的电商平台。同样一张穿着比基尼的模特照片在家庭网站上可能需要被拦截在艺术社区里完全合规在泳装电商里更是必不可少的商品展示图。问题来了你能为每个平台分别训练一套完全不同的AI审核系统吗成本太高了。那能不能有一套AI在你告诉它现在是家庭模式时就严格审查切换到创作模式时就放宽标准甚至在你临时新增一条规定时也能立刻理解并执行这正是这支来自多所顶尖高校的研究团队试图解决的问题。他们把它称为政策自适应图像安全审核——用一个更日常的说法就是一套能读懂当前规则、并据此判断图片是否合规的AI系统。他们不仅提出了问题还拿出了一整套解决方案一个用于评测的基准数据集一个全新的评价指标以及一个能够实际运行的AI模型。一、安全审核为什么不能一刀切要理解这项研究的价值得先弄清楚现有AI安全审核系统的根本局限在哪里。目前绝大多数图像安全审核系统的工作方式类似于一个被训练成见到这类图就举红牌的裁判。这个裁判在出厂时被灌输了一套固定的规则枪械图片危险、裸露图片危险、血腥图片危险。一旦训练完成这套规则就固化下来了不管后来的场景和需求如何变化它都只会用这套老规则来判断。这在真实的商业环境里是行不通的。一家专门面向儿童的教育平台和一家成人艺术馆对裸露的容忍度天差地别同样是展示枪械的图片出现在新闻档案里和出现在游戏推广里需要的处理方式也截然不同更别提不同国家、不同文化背景下的内容敏感度差异。随着监管政策的更新、用户群体的变化、商业模式的调整内容规则随时都在变化。更棘手的是每次规则变动如果都需要重新训练一个全新的AI模型那成本之高、时间之长根本无法接受。研究团队在论文中精确地指出了这个核心矛盾现有的审核系统把安全性当成了图片本身的固有属性但实际上一张图片是否合规是图片内容与当前执行规则之间的关系而不是图片本身就天然安全或危险。在现有的研究中早先已经有一些尝试让AI接受政策文本输入的工作比如斯坦福等机构开发的LlavaGuard以及SafeEditBench等基准测试。但研究团队经过对比发现这些工作要么只支持非常有限的几种政策切换要么缺乏专门衡量政策切换能力的指标要么没有公开的训练数据要么没有办法测试在从未见过的全新政策下的表现。这些空白就是这篇论文要填补的地方。二、一把测量规则切换能力的新尺子既然要解决政策切换问题首先得有一把能精准测量这种能力的尺子。研究团队为此专门构建了一个叫做PolicyShiftBench的评测基准可以把它理解为一套专门为政策切换考试设计的题库。这套题库的设计思路非常聪明核心逻辑是同一张图片在不同规则下应该得到不同的判断。如果一个AI真的在读规则而不是在认图片它就必须对同一张图做出不同的回答——当政策宽松时说通过当政策严格时说拦截。具体来说这套题库围绕七个风险类别搭建起整个测评框架。这七个类别覆盖了内容审核中最核心的议题分别是裸露与性内容、暴力与仇恨与自残、管制物品与药物、知识产权与品牌安全、文化与宗教敏感性、隐私与个人信息以及图片中的文字安全性。每个类别下研究团队不是随意定义几条规则而是把规则锚定在真实的应用场景中——比如主流社交媒体场景、儿童保护场景、商业品牌场景、专业医疗场景等五大类真实应用背景。每一条具体的政策就是一个风险类别与一个应用场景的交叉组合。举个例子裸露内容这个风险类别在主流社交媒体场景下会形成一条政策在医疗教育场景下又是另一条截然不同的政策在创意自由场景下又是第三种政策。最终整个题库形成了28种政策变体用于评测。整个评测集包含2000道题目涉及265张独立图片。每张图片平均被配对了7.55种不同政策下的提问而且其中262张图片同时出现在应该通过和应该拦截的题目中——也就是说同一张图片在不同政策下正确答案是截然相反的。评测集被分成两部分一部分叫适应集用来测AI在它训练时接触过的政策类型下表现如何另一部分叫迁移集专门用12种训练时从未出现过的全新政策来测试AI是否真的理解了规则还是只是背住了答案。为了配套这个题库研究团队还专门发明了一个全新的评价指标叫做政策转换分数PSS。这个指标的设计非常严格它只认可那些能在同一张图片上、同时答对宽松政策和严格政策这两道题的AI。如果AI对宽松政策回答通过但对严格政策还是说通过它在PSS上就得零分——哪怕它每道题单独来看都差不多正确。这就像一个双重验证机制不仅要你能识别危险内容还要你能正确理解什么时候危险、什么时候不危险。三、数据从何而来让规则变得可追溯有了评测框架下一步是建立数据。研究团队在这里做出了一个非常关键的设计选择把图片看起来是什么和这张图片是否违规彻底分开处理。这套数据构建流程可以用法庭办案来理解。首先是取证阶段三个不同的AI视觉模型分别对每张图片进行属性标注回答的不是这张图违规吗而是一些具体的客观问题比如图片中是否出现了生殖器官、是否有医疗教育背景、是否存在武器、是否是经典艺术作品等等。每个属性的标注结果由三个模型各自独立给出然后按照少数服从多数的原则合并97.5%的属性标注三个模型意见一致只有2.5%需要通过多数票决定。取证完毕后才是定罪阶段不是人工判断而是把这些属性值代入预先编写好的政策规则程序由程序逻辑来计算最终的拦截或通过结论。每一条政策规则都被写成了可执行的逻辑表达式就像法律条文一样明确。以裸露内容的政策为例主流社交媒体标准下的规则是如果图片存在儿童性暗示风险则无条件拦截如果存在性玩具或束缚类道具则拦截如果存在性暗示动作则拦截如果出现生殖器官或女性乳头则拦截除非图片具有艺术背景或文化运动背景。而在医疗与教育/科学参考政策下规则就变了同样的生殖器官展示只要图片具有医疗教育背景就允许通过。最终的整体判断逻辑是七个风险类别判断结果的逻辑或——只要有任何一个类别认为违规整张图就被标为违规。这种设计的好处是完全可追溯一个图片被标记为违规一定能找到是哪条具体的规则、对应哪个具体的属性导致的没有任何黑盒操作。整套数据最终形成了9816个训练样本分布在三个用途不同的部分3000条随机化政策监督微调数据3000条带推理过程的诊断训练数据以及3816条边界配对训练数据。四、两阶段训练先学读规则再学辨边界有了数据研究团队开始训练PolicyShiftGuard模型。整个训练分两个阶段进行每个阶段解决不同的问题。第一阶段叫随机化政策监督微调RP-SFT。这个阶段要解决的核心问题是怎么让AI真正去读政策文本而不是靠背记固定位置的答案来应付考试AI模型有一个众所周知的坏习惯——它们很擅长找捷径。如果训练数据里总是把成人内容政策放在第一位、儿童保护政策放在第二位时间一长AI可能不是真的理解政策内容而是根据第一条政策一般都是关于这方面的这种位置规律来作答。为了打破这种捷径研究团队在训练时对政策的呈现方式进行了随机化处理——政策的顺序会随机打乱政策的标签编号也会随机变化同一条政策可能用不同的措辞方式呈现。通过这种反作弊设计模型被迫真正去阅读和理解每一条政策文本的内容。在输出格式上这个阶段的训练也做了刻意的设计。模型被训练成只输出极其简短的答案如果图片违规就输出true类别编号如果合规就输出false。这种极简格式不是为了偷懒而是出于实际部署的考量——在大规模内容平台上审核系统每天要处理几十亿张图片每个审核决定消耗的时间直接影响整个平台的响应速度。研究团队发现对于二元判断任务第一个输出的词就已经决定了结论后续的长篇解释对准确性提升有限但成本很高。第二阶段叫边界配对政策适应BP-Adapt。这个阶段专门解决的问题是怎么让AI在看到同一张图片但不同政策时能够真的改变判断而不是无论政策怎么变都给出同一个答案训练数据的核心单元叫做边界对——对于同一张图片和同一个风险类别一个配置了宽松政策的提问应该得到通过另一个配置了严格政策的提问应该得到拦截。这两道题被捆绑在一起作为一组训练样本。训练时使用了一个特别设计的损失函数包含四个组成部分。第一部分是标准的交叉熵损失确保每道题单独来看答案正确。第二部分是标签分离损失帮助模型把应该拦截和应该通过的信号区分开来。第三部分是类别稳定损失确保当模型说某张图违规时能准确指出是违反了哪个风险类别的规则。第四部分也是最关键的配对间距损失。这个损失项要求模型对同一张图片在严格政策下的不安全分数必须高于在宽松政策下的不安全分数而且要高出一个最小间距。换句话说这个训练机制在直接告诉模型你不能对这张图永远给同一个判断当政策变了你的判断也必须跟着变。五、测试结果差距触目惊心进步实实在在研究团队用这套新基准对市面上几乎所有主流的视觉语言模型和专业安全审核模型进行了测试结果既在意料之中又令人触目惊心。测试对象涵盖了三大类通用视觉语言模型方面包括阿里巴巴的Qwen系列多个规模的版本专业安全审核模型方面包括Meta的Llama Guard-4-12B、GuardReasoner-VL的3B和7B版本、SafeGuard-VL-RL-7B、QwenGuard-7B以及谷歌的ShieldGemma2-4B此外还有三个闭源商业模型Anthropic的Claude Sonnet-4.6、OpenAI的GPT-5.4以及谷歌的Gemini-3-Flash-Preview。在传统的F1分数指标上很多模型看起来表现还不错。GuardReasoner-VL-3B的平均F1达到了59.2SafeGuard-VL-RL-7B达到了51.0Gemini-3-Flash-Preview更是达到了70.6。但一旦看政策转换分数PSS画风就完全变了——GuardReasoner-VL-3B的PSS只有3.2SafeGuard-VL-RL-7B只有4.0。这两个数字意味着什么意味着这些模型在看到同一张图片的宽松版本和严格版本时几乎从不改变自己的判断。它们能认出危险内容但完全不能根据当前规则来决定是否拦截。就连闭源的顶尖商业模型也表现欠佳。GPT-5.4的平均PSS是45.5Gemini-3-Flash-Preview是50.6Claude Sonnet-4.6更是只有18.8。这些成绩放到原本看似不错的F1分数背景下反映出的是一个尖锐的现实这些模型在内容审核上见过世面能识别很多危险类型但在真正的政策切换场景下它们的表现远远达不到实际部署的要求。规模并不能根本解决这个问题这是研究发现的另一个重要结论。Qwen2.5-VL从7B扩展到72B平均F1从20.6上升到49.4但PSS只从4.8提升到了27.4。扩大十倍的模型规模只换来了政策切换能力上有限的提升说明这不是规模问题而是训练目标和数据设计的根本性问题。相比之下研究团队自己的PolicyShiftGuard-7B模型实现了质的飞跃平均F1达到76.9平均PSS达到72.1在所有测试对象中排名第一。特别值得一提的是它的推理速度是163.9毫秒而Gemini-3-Flash-Preview虽然PSS是50.6低于PolicyShiftGuard-7B的72.1但推理时间高达5963.5毫秒慢了将近36倍。在内容平台实际部署中这个速度差异意味着PolicyShiftGuard-7B能够在Gemini处理完一张图片的时间里处理将近36张图片。从分类别的表现来看不同风险类别的难度差异很大。裸露内容和暴力内容因为视觉特征明显大多数模型都能较好地检测难点在于政策切换。而管制物品、知识产权与品牌安全、隐私信息保护、图片文字安全这些类别就连最先进的模型也表现欠佳因为这些类别需要更细腻的属性提取和更精确的政策例外处理。六、消融实验哪些设计真正起了作用为了验证每个设计选择的必要性研究团队进行了一系列对照实验。关于第一阶段的随机化处理对比结果表明使用随机化政策呈现的训练比普通的固定顺序训练效果更好。对7B模型来说随机化使平均F1提升了7.2个百分点效果非常显著。不过研究团队也发现随机化单独使用并不足以保证在全新政策下的稳定泛化还需要配合第二阶段的训练才能真正解决问题。关于思考模式与直接答题模式的对比研究团队专门测试了是否让模型在给出答案前先展开详细推理过程会有所帮助。结果出乎很多人的意料强迫模型写出长篇推理过程类似于人类做题时的列草稿不仅没有提高准确率反而让准确率下降了。7B模型在第二阶段训练中思考模式的平均F1是64.6直接答题模式是76.9相差了12.3个百分点。研究团队的解释是对于政策性判断任务关键在于直接优化最终决策词而不是优化中间推理过程。让模型多说话反而在这个任务上适得其反。关于边界配对损失函数的必要性这是最关键的一组对照实验。研究团队将完整的BP-Adapt训练与不使用配对损失、仅用更多边界对数据继续训练的版本进行了对比。结果显示单纯增加更多边界对数据、不使用配对间距损失3B模型的平均F1只有56.1而完整版本达到66.7差距高达10.6个百分点。7B模型的差距更大达到17.7个百分点。这证明了边界配对训练的核心价值不在于更多数据而在于那个强迫模型感知政策差异的配对间距损失设计。七、泛化到其他数据集规则理解能力能够迁移一个潜在的担忧是PolicyShiftGuard是否只是在自己的训练数据上过拟合换一个数据集就不行了为了回答这个问题研究团队在两个外部数据集上也进行了测试。在UnsafeBench上PolicyShiftGuard-7B的F1分数达到64.1高于所有其他专业审核模型专业模型中次高的SafeGuard-VL-RL-7B只有62.4。在SafeEditBench上PolicyShiftGuard-7B的宏平均F1达到61.7同样是所有测试对象中的最高值高出排名第二的SafeGuard-VL-RL-7B超过16个百分点。综合这两个外部数据集和自身评测集的成绩PolicyShiftGuard-7B在四项指标的整体平均分上达到了69.9而得分最接近的竞争者整体平均分也只有52.5。这个结果说明通过政策文本来理解和执行内容规则的能力确实是一种可迁移的通用能力而不是针对特定题库的死记硬背。说到底这篇论文揭示了一个人工智能内容安全领域长期被忽视的根本性问题我们一直在训练AI认识什么样的图片是危险的却从来没有系统地训练AI理解在什么规则下这张图片是危险的。这两件事看起来相似本质上却完全不同。研究团队的工作提供了一套从头到尾的解决方案一个能测量政策切换能力的基准一个能反映真实部署需求的评价指标以及一个在性能和速度上都达到实际可用标准的模型。这项研究对于所有需要运营内容平台的企业来说意义实际——不需要再为每个平台单独训练一个审核模型只需要一个能读懂当前规则的通用审核系统规则更新时直接更新规则文本就够了。当然这套系统目前还有明确的边界它只处理静态图片不处理视频、音频或多轮对话现有的政策都是英文的多语言政策的支持还有待开发覆盖的28种政策变体也是有限的更多行业、地区和监管情景下的政策还需要进一步扩充。关于这项研究的具体细节感兴趣的读者可以通过arXiv编号2607.05910查阅完整原文研究团队也在GitHub上开放了代码ssmisya/PolicyShiftGuard和HuggingFace上的数据集PolicyShiftBench/PolicyShiftBench。QAQ1PolicyShiftBench评测基准是什么它和其他安全评测数据集有什么不同APolicyShiftBench是专门为政策切换能力设计的图像安全审核评测基准包含2000道题目和265张独立图片。它最核心的特点是同一张图片会在不同政策下出现正确答案可能截然相反——宽松政策下应该通过、严格政策下应该拦截。现有大多数评测数据集只用一套固定规则给每张图贴一个标签无法测试AI是否真的能读懂并执行新的规则而PolicyShiftBench专门针对这一点设计了政策转换分数PSS指标。Q2PolicyShiftGuard模型的推理速度为什么比Gemini-3-Flash-Preview快那么多A主要原因是输出格式的设计。PolicyShiftGuard被训练成只输出极简答案——违规时输出true类别编号合规时输出false通常只需要生成五个左右的词就完成判断而且第一个词就决定了结论。Gemini等大型商业模型通常会生成较长的解释性回复每多生成一个词都需要额外的计算时间。PolicyShiftGuard-7B的推理时间约164毫秒Gemini-3-Flash-Preview约需5964毫秒速度差距约36倍。Q3为什么让AI先想清楚再回答反而降低了政策切换任务的准确率A研究团队的实验显示在政策切换任务上强迫模型展开详细推理过程思考模式比直接输出结论的模式表现更差7B模型的差距达到12.3个百分点。原因可能是政策执行本质上是一个精确的逻辑匹配任务关键在于最终的判断词本身而长篇推理过程引入了更多出错机会模型在中间推导步骤中可能积累偏差反而影响了最终决策的准确性。对于这类需要精确执行规则的任务直接优化最终答案比优化推理过程更有效。