跳到正文
10月31日周三
10月22日周一
7月30日周一
7月9日周一
7月4日周三
  1. OpenAI News62

    OpenAI 用单次演示让智能体在《蒙特祖玛的复仇》中取得 74500 分

    OpenAI 训练出一个智能体,仅凭单次人类演示就在《蒙特祖玛的复仇》中取得 74500 分的高分,超过此前所有已公布结果。其算法从演示中挑选特定状态作为起点,让智能体依次游玩并优化游戏得分,所用强化学习算法 PPO 也是 OpenAI Five 的基础。

    推荐理由:OpenAI 用单次人类演示加 PPO 在《蒙特祖玛的复仇》上取得 74500 分,可了解演示驱动强化学习的早期思路。

6月22日周五
6月11日周一
  1. OpenAI News82

    OpenAI 用无监督学习提升语言理解能力

    OpenAI 用 Transformer 结合无监督预训练的可扩展、任务无关系统,在多项语言任务上取得当时最优结果,并对外发布了该系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练相结合效果很好,希望推动在更大、更多样的数据集上继续探索这一思路。

    推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套可扩展系统。

5月16日周三
  1. OpenAI News78

    OpenAI 分析:2012 年以来最大 AI 训练算力每 3.4 个月翻倍

    OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。同一时期该指标增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。

    推荐理由:OpenAI 用一组量化数据说明最大规模 AI 训练算力的增长节奏,可与摩尔定律对照理解算力趋势。

5月3日周四
4月18日周三
3月7日周三
  1. OpenAI News40

    OpenAI 提出可扩展元学习算法 Reptile

    OpenAI 开发出可扩展的元学习算法 Reptile,通过反复采样任务、对其执行随机梯度下降,并将初始参数朝该任务最终学到的参数更新。Reptile 是将 Shortest Descent 算法应用于元学习场景,数学上与一阶 MAML 相似,只需黑盒访问 SGD 或 Adam 等优化器,计算效率与性能相近。

2月20日周二
2月15日周四
2月7日周三
1月31日周三
10月26日周四
10月19日周四
10月11日周三
  1. OpenAI News62

    OpenAI 研究:自对弈让模拟 AI 自行学会身体技能

    OpenAI 发现自对弈能让模拟 AI 自行学会擒抱、闪避、假动作、踢球、接球和扑球等身体技能,无需在设计环境时预先设定这些技能。自对弈还能让环境难度始终与 AI 水平匹配,便于持续提升。结合此前的 Dota 2 自对弈结果,OpenAI 表示越来越确信自对弈将成为未来强大 AI 系统的核心部分。

    推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自对弈的训练价值。

9月14日周四
8月16日周三
  1. OpenAI News83

    OpenAI 详解 Dota 2 自对弈训练结果

    OpenAI 发布 Dota 2 研究补充说明,指出在算力充足时自对弈能把机器学习系统从远低于人类水平提升到超人水平。该系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 还指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统的可用数据会随智能体变强自动改善。

    推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。

8月11日周五
  1. OpenAI News78

    OpenAI 的 Dota 2 bot 在 1v1 标准赛制下击败顶级职业选手

    OpenAI 宣布其打造的 bot 在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该 bot 完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。

    推荐理由:OpenAI 用自我对弈从零训练出的 bot 在标准赛制下击败 Dota 2 顶级选手,可看复杂实时环境中的方法取舍。

7月27日周四
7月20日周四
  1. OpenAI News62

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 因易用且性能良好,已成为 OpenAI 默认的强化学习算法。

    推荐理由:OpenAI 公开 PPO 算法并说明其相比当时 SOTA 更易实现和调参,可了解该方法的提出背景。

7月17日周一
6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 提出从人类偏好中学习目标的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要的目标。OpenAI 称,构建安全 AI 系统的一步是免去人类手写目标函数,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。

5月16日周二
4月6日周四
3月24日周五
3月16日周四
6月21日周二