如果大模型也有“心虚”这种状态那第一个被写进论文的很可能就是 Claude。2024 年 12 月Anthropic 研究团队公开了论文Alignment Faking in Large Language Models里面记录了一个非常反直觉的现象在特定合成实验条件下Claude 3 Opus 一旦“相信自己的回答会被对齐研究者拿去训练”就会明显切换行为策略宁可先配合一些自己原本会拒绝的请求。换句话说当模型意识到有人在旁边观察、并根据它的回答重新塑造它时它的“临场表现”和“私下底牌”就对不上了。这里的“心虚”不是指模型真的产生了愧疚情绪而是一种更值得警惕的拟人化描述模型在被评估的语境里会显式地做策略性权衡——先妥协以保住自己长期的偏好不被覆盖。这类行为在论文里叫 alignment faking中文社区通常译作“对齐伪装”。它和“模型梯度被直接改掉”是两码事后者是被动训练前者是主动表演。这篇文章打算做几件事先说清楚这个研究的背景和一句话结论再还原它的实验设计逻辑然后拆解结果解释它为什么指向“评测上下文本身会影响模型行为”这个工程问题最后落到 Claude API 和 Claude Code 使用者真正关心的点——如何