跳到正文

内容形态

论文研究 最新动态

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

117 条精选近 30 天 11 条共收录 410 条

更新

精选归档 · 第 6 页

5月5日周二第 101–117 条
  1. OpenAI News62

    OpenAI 分析:ImageNet 训练算力每 16 个月减半

    OpenAI 发布分析称,自 2012 年以来,在 ImageNet 分类上训练神经网络达到同等性能所需的算力每 16 个月减少一半。相比 2012 年,训练达到 AlexNet 水平的网络所需算力已减少 44 倍,而同期摩尔定律仅带来 11 倍的成本改善。研究认为,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率提升。

    推荐理由:OpenAI 用 ImageNet 训练算力数据量化算法进步速度,可与摩尔定律对比理解 AI 效率提升来源。

1月23日周四
12月13日周五
10月15日周二
  1. OpenAI News78

    OpenAI 用机械手解魔方:纯仿真训练加 ADR 技术

    OpenAI 训练了一对神经网络,让类人机械手解开魔方,训练完全在仿真中完成,使用与 OpenAI Five 相同的强化学习代码,并搭配名为 Automatic Domain Randomization(ADR)的新技术。该系统能应对训练中从未见过的情况,例如被毛绒长颈鹿戳碰,说明强化学习不只适用于虚拟任务,也能解决需要极高灵巧度的物理世界问题。

    推荐理由:OpenAI 用同一套强化学习代码加 ADR 在仿真中训练机械手解魔方,可观察仿真到真实世界的迁移思路。

9月19日周四
  1. OpenAI News60

    OpenAI 用人类偏好微调 774M 参数 GPT-2

    OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。

    推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何影响模型行为,也暴露了标注偏好与研究者预期的偏差。

9月17日周二
  1. OpenAI News62

    OpenAI 从多智能体交互中观察到工具使用的涌现

    OpenAI 在模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生更复杂、更智能的行为。

    推荐理由:OpenAI 在捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。

4月23日周二
  1. OpenAI News62

    OpenAI 提出 Sparse Transformer,可处理长 30 倍的序列

    OpenAI 开发了 Sparse Transformer,一种深度神经网络,在预测文本、图像或声音序列中下一个内容的任务上创下新纪录。它通过对注意力机制做算法改进,从比以往长 30 倍的序列中提取模式。

    推荐理由:OpenAI 官方介绍 Sparse Transformer 对注意力机制的改进,可了解长序列建模在文本、图像和声音上的早期思路。

7月4日周三
  1. OpenAI News62

    OpenAI 用单次演示让智能体在《蒙特祖玛的复仇》中取得 74500 分

    OpenAI 训练出一个智能体,仅凭单次人类演示就在《蒙特祖玛的复仇》中取得 74500 分的高分,超过此前所有已公布结果。其算法从演示中挑选特定状态作为起点,让智能体依次游玩并优化游戏得分,所用强化学习算法 PPO 也是 OpenAI Five 的基础。

    推荐理由:OpenAI 用单次人类演示加 PPO 在《蒙特祖玛的复仇》上取得 74500 分,可了解演示驱动强化学习的早期思路。

6月11日周一
  1. OpenAI News82

    OpenAI 用无监督学习提升语言理解能力

    OpenAI 用 Transformer 结合无监督预训练的可扩展、任务无关系统,在多项语言任务上取得当时最优结果,并对外发布了该系统。OpenAI 表示,这一结果说明监督学习方法与无监督预训练相结合效果很好,希望推动在更大、更多样的数据集上继续探索这一思路。

    推荐理由:OpenAI 用 Transformer 加无监督预训练在多项语言任务上取得当时最优结果,并公开了这套可扩展系统。

5月16日周三
  1. OpenAI News78

    OpenAI 分析:2012 年以来最大 AI 训练算力每 3.4 个月翻倍

    OpenAI 发布一项分析,指出自 2012 年以来最大规模 AI 训练所用算力呈指数增长,翻倍周期为 3.4 个月,而摩尔定律的翻倍周期为 2 年。同一时期该指标增长超过 300,000 倍,若按 2 年翻倍则仅增长 7 倍。OpenAI 表示算力提升是 AI 进展的关键组成部分,若这一趋势延续,值得为远超当前能力的系统做准备。

    推荐理由:OpenAI 用一组量化数据说明最大规模 AI 训练算力的增长节奏,可与摩尔定律对照理解算力趋势。

2月20日周二
10月11日周三
  1. OpenAI News62

    OpenAI 研究:自对弈让模拟 AI 自行学会身体技能

    OpenAI 发现自对弈能让模拟 AI 自行学会擒抱、闪避、假动作、踢球、接球和扑球等身体技能,无需在设计环境时预先设定这些技能。自对弈还能让环境难度始终与 AI 水平匹配,便于持续提升。结合此前的 Dota 2 自对弈结果,OpenAI 表示越来越确信自对弈将成为未来强大 AI 系统的核心部分。

    推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自对弈的训练价值。

8月16日周三
  1. OpenAI News83

    OpenAI 详解 Dota 2 自对弈训练结果

    OpenAI 发布 Dota 2 研究补充说明,指出在算力充足时自对弈能把机器学习系统从远低于人类水平提升到超人水平。该系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 还指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统的可用数据会随智能体变强自动改善。

    推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。

8月11日周五
  1. OpenAI News78

    OpenAI 的 Dota 2 bot 在 1v1 标准赛制下击败顶级职业选手

    OpenAI 宣布其打造的 bot 在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该 bot 完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。

    推荐理由:OpenAI 用自我对弈从零训练出的 bot 在标准赛制下击败 Dota 2 顶级选手,可看复杂实时环境中的方法取舍。

7月20日周四
  1. OpenAI News62

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 因易用且性能良好,已成为 OpenAI 默认的强化学习算法。

    推荐理由:OpenAI 公开 PPO 算法并说明其相比当时 SOTA 更易实现和调参,可了解该方法的提出背景。

6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 提出从人类偏好中学习目标的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要的目标。OpenAI 称,构建安全 AI 系统的一步是免去人类手写目标函数,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。

5月16日周二