跳到正文
Hugging Face Blog·· 2024-02-23AI 评分38

Hugging Face 与 Haize Labs 推出红队抵抗排行榜

Introducing the Red-Teaming Resistance Leaderboard

AI 导读

Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,系统测试前沿模型在高质量人类越狱攻击下的鲁棒性。该基准整合 AdvBench、AART、Beavertails、Do Not Answer 等红队数据集,用 LlamaGuard 与 GPT-4 判定回答是否安全,并按伤害与暴力、犯罪、隐私等违规类别细分评分。

来源:Hugging Face Blog · huggingface.co