跳到正文
Hugging Face Blog·· 2023-02-24AI 评分40

Hugging Face 解读大语言模型红队测试:方法、风险与最佳实践

Red-Teaming Large Language Models

AI 导读

红队测试通过构造自然语言提示词诱导大语言模型暴露有害输出,与对抗攻击不同,其提示词对人类可读。GPT3 早期版本曾表现出性别歧视与针对穆斯林的偏见,微软 Tay 和 Bing 的 Sydney 是缺乏红队评估导致灾难性后果的真实案例。

来源:Hugging Face Blog · huggingface.co