OpenAI 发布识别 AI 生成文本的分类器
OpenAI 发布一款经过训练的分类器,用于区分 AI 生成文本与人类写作文本。
推荐理由:OpenAI 官方发布区分 AI 与人类写作的分类器,可了解其早期检测思路与官方定位。
技术方向
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
208 条精选近 30 天 55 条共收录 1,036 条
OpenAI 发布一款经过训练的分类器,用于区分 AI 生成文本与人类写作文本。
推荐理由:OpenAI 官方发布区分 AI 与人类写作的分类器,可了解其早期检测思路与官方定位。
Hugging Face 博客梳理了让对话智能体变得有用的关键技术,包括指令微调(IFT)、监督微调(SFT)、思维链(CoT)和基于人类反馈的强化学习(RLHF)。
推荐理由:梳理 IFT、SFT、CoT 与 RLHF 在对话智能体中的作用,并对比多家早期聊天机器人的训练与评测差异。
OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还发现,模型规模越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升。
推荐理由:OpenAI 训练批评写作模型辅助人类发现摘要缺陷,为 AI 监督 AI 提供了一种可参考的思路。
Anthropic 宣布完成 5.8 亿美元 B 轮融资,由 FTX CEO Sam Bankman-Fried 领投,Caroline Ellison、Jaan Tallinn 等参与。
推荐理由:官方披露 B 轮融资规模与资金用途,可了解 Anthropic 早期在可解释性与对齐方向的研究布局。
OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,采用其对齐研究中的技术并引入人类参与训练。这些模型现已作为 OpenAI API 的默认语言模型部署。
推荐理由:OpenAI 官方说明 InstructGPT 的指令跟随与对齐改进,并交代其已成为 API 默认模型。
OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何影响模型行为,也暴露了标注偏好与研究者预期的偏差。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
推荐理由:OpenAI 联合多家机构用近一年时间梳理 AI 被恶意利用的可能路径与防范思路,可作为 AI 安全治理早期讨论的参照。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要的目标。OpenAI 称,构建安全 AI 系统的一步是免去人类手写目标函数,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。