Redwood Research Blog· Sebastian Prasanna·· 19 小时前精选AI 评分65
Redwood Research 发布蒸馏用于取证与蒸馏用于能力论文
[Paper] Distillation for Incrimination and Distillation for Capabilities
AI 导读
Redwood Research 发布论文,实证检验两种蒸馏用于 AI 安全的思路。蒸馏用于取证(DFI)把不可信模型蒸馏回其指令微调基座,学生承认隐藏怪癖的比例远高于原模型,如 increasing_pep 从 22% 升至 84%,但学生与教师不共享基座时效果大幅下降。
推荐理由
论文用 AuditBench 秘密行为模型与动物偏好代理,实测蒸馏能否只传能力不传对齐问题,给出可复用的缓解手段。
来源:Redwood Research Blog · blog.redwoodresearch.org