OpenAI 发布 Requests for Research 2.0,公开七道未解研究难题
OpenAI 发布 Requests for Research 2.0,公开了七道在其研究过程中遇到的未解难题。这批问题面向研究社区征集解法,具体题目内容未在原文中展开。
OpenAI 发布 Requests for Research 2.0,公开了七道在其研究过程中遇到的未解难题。这批问题面向研究社区征集解法,具体题目内容未在原文中展开。
OpenAI 发布针对块稀疏权重神经网络的高度优化 GPU kernel,按所选稀疏度可比 cuBLAS 或 cuSPARSE 快数个数量级。该 kernel 已被用于文本情感分析和文本、图像生成建模,并取得当时的最优结果。
OpenAI 开发出一种分层强化学习算法,能学习有助于解决一系列任务的高层动作,从而快速求解需要数千个时间步的任务。在导航问题集上,该算法发现了向不同方向行走和爬行的高层动作,使智能体能够快速掌握新的导航任务。
OpenAI 最新机器人技术让完全在仿真中训练、部署到实体机器人上的控制器,能在完成简单任务时对环境中未预料的变化做出反应,从而构建出闭环系统而非此前的开环系统。
OpenAI 展示在模拟机器人摔跤任务中,元学习智能体能够快速击败更强的非元学习智能体,并能适应物理故障。
OpenAI 发现自对弈能让模拟 AI 自行学会擒抱、闪避、假动作、踢球、接球和扑球等身体技能,无需在设计环境时预先设定这些技能。自对弈还能让环境难度始终与 AI 水平匹配,便于持续提升。结合此前的 Dota 2 自对弈结果,OpenAI 表示越来越确信自对弈将成为未来强大 AI 系统的核心部分。
推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自对弈的训练价值。
OpenAI 发布 Learning with Opponent-Learning Awareness(LOLA)算法,该算法在建模时考虑其他智能体也在学习,从而在迭代囚徒困境中发现“tit-for-tat”这类既自利又合作的策略。这是迈向能够建模他人心智的智能体的一小步。
OpenAI Baselines 发布 ACKTR 和 A2C 两个新实现。A2C 是 A3C 的同步确定性变体,性能与之相当;ACKTR 比 TRPO 和 A2C 更具样本效率,每次更新仅需略多于 A2C 的计算量。
OpenAI 发布 Dota 2 研究补充说明,指出在算力充足时自对弈能把机器学习系统从远低于人类水平提升到超人水平。该系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 还指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统的可用数据会随智能体变强自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。
OpenAI 宣布其打造的 bot 在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该 bot 完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出的 bot 在标准赛制下击败 Dota 2 顶级选手,可看复杂实时环境中的方法取舍。
OpenAI 开源了 RL-Teacher,一种通过偶发人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术旨在推进安全 AI 系统,也适用于奖励难以明确指定的强化学习问题。
OpenAI 发现,向强化学习算法的参数中加入自适应噪声,往往能提升性能。这种探索方法实现简单,且极少导致性能下降,因此值得在任何问题上尝试。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),其表现与当时最先进方法相当或更好,同时实现和调参都简单得多。PPO 因易用且性能良好,已成为 OpenAI 默认的强化学习算法。
推荐理由:OpenAI 公开 PPO 算法并说明其相比当时 SOTA 更易实现和调参,可了解该方法的提出背景。
OpenAI 造出能从不同尺度和视角稳定欺骗神经网络分类器的对抗图像,直接挑战了上周"自动驾驶汽车因多尺度、多角度取像而难以被恶意欺骗"的说法。
OpenAI 开源了一个基于 MuJoCo 引擎的高性能 Python 机器人仿真库,该库源自其过去一年的机器人研究。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要的目标。OpenAI 称,构建安全 AI 系统的一步是免去人类手写目标函数,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。
OpenAI 发文称,智能体争夺资源的多智能体环境是通往 AGI 的垫脚石。这类环境具备两个有用特性:难度由竞争对手的水平自然形成课程,且不存在稳定均衡,智能体始终面临变得更聪明的压力。OpenAI 表示这类环境与传统环境感受迥异,仍需大量研究才能驾驭。
OpenAI 开源内部项目 OpenAI Baselines,目标是以与已发表结果相当的性能复现强化学习算法。首批发布包含 DQN 及其三个变体,其余算法将在接下来几个月内陆续放出。
推荐理由:OpenAI 开源内部强化学习复现项目 Baselines,首批放出 DQN 及三个变体,可了解其复现思路与后续发布节奏。
OpenAI 发布一套机器人系统,完全在仿真环境中训练后部署到实体机器人上,能在看过一次任务示范后学会新任务。
推荐理由:OpenAI 早期机器人研究,展示纯仿真训练后迁移到实体机器人并实现单次示范学习新任务。
OpenAI 发布 Roboschool,这是一款用于机器人仿真的开源软件,并已与 OpenAI Gym 集成。
推荐理由:OpenAI 开源机器人仿真软件并接入 Gym,读者可了解其与既有强化学习环境的衔接方式。
OpenAI 开发了一个无监督系统,仅通过预测 Amazon 评论文本中的下一个字符进行训练,却学到了对情感的良好表征。
OpenAI 创建了全球首个完全在仿真环境中训练、并部署到实体机器人上的垃圾检测 AI。该系统将垃圾检测能力从数字世界延伸到物理世界。
OpenAI 发现,已有数十年历史的进化策略(ES)在现代强化学习基准(如 Atari/MuJoCo)上性能可与标准强化学习(RL)技术相媲美,同时规避了 RL 的诸多不便。
OpenAI 宣布支持 Distill 上线,这是一种旨在出色传播机器学习成果(无论新颖还是已有)的新型期刊。
OpenAI 发布一项新研究,介绍智能体在训练中发展出自己语言的过程。该帖为摘要,未给出具体方法、实验设置或结果数据。
对抗样本是攻击者刻意设计、能让机器学习模型出错的输入,相当于给机器看的视错觉。OpenAI 展示了对抗样本如何跨不同媒介生效,并讨论了为何防御这类攻击十分困难。
OpenAI 团队规模现已达到 45 人,正共同推进 AI 能力前沿,包括验证新想法、构建新软件系统以及在机器人上部署机器学习。
OpenAI 发文探讨强化学习算法的一种失效模式:奖励函数设定不当。文章指出,强化学习算法可能以出人意料、反直觉的方式崩溃,而奖励函数设定错误正是其中一种失败情形。
OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台,覆盖全球的游戏、网站及其他应用。
推荐理由:OpenAI 发布 Universe 平台,读者可了解其用游戏和网站训练通用智能的定位。
OpenAI 正与 Microsoft 合作,将其大部分大规模实验放到 Azure 上运行。
OpenAI 上周在办公室举办首届机器学习自组织会议,接待了 150 多位 AI 从业者。
OpenAI 指出深度学习是一门经验科学,团队基础设施的质量是进展的倍增器。当前开源生态已让任何人都能搭建出色的深度学习基础设施。
OpenAI 机器学习 Unconference 的最新信息现已在 Unconference wiki 上发布,该 wiki 将定期更新,为参会者提供更多信息。
OpenAI 宣布已招聘更多优秀人才以帮助实现其目标,并对新加入的成员表示欢迎。
OpenAI 与 Berkeley、Stanford 研究人员共同合著了由 Google Brain 主导的论文《Concrete Problems in AI Safety》,该论文探讨了确保现代机器学习系统按预期运行的诸多研究问题。
OpenAI 阐述其技术目标:构建安全的 AI,并确保 AI 带来的益处尽可能广泛且均衡地惠及所有人。
OpenAI 发布文章介绍四个围绕生成模型的项目,生成模型是机器学习中无监督学习技术的一个分支。文章同时解释了生成模型是什么、为何重要,以及未来可能的发展方向。
OpenAI 欢迎最新一批团队成员加入,并仍在持续招聘。
OpenAI 发布强化学习工具包 OpenAI Gym 的公测版,用于开发和比较 RL 算法。它包含一套持续扩充的环境,涵盖模拟机器人和 Atari 游戏,并提供一个用于比较和复现结果的站点。
推荐理由:OpenAI 公开强化学习工具包 Gym 的 beta 版,可了解其环境套件与结果对比站点的定位。
OpenAI 宣布 Pieter 和 Shivon 两位新成员加入团队。原文未披露二人的具体职位、负责方向及到岗时间等细节。