Hugging Face 发布 Agents.js:用 JavaScript 为 LLM 提供工具调用
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,通过 npm install @huggingface/agents 安装。
推荐理由:原文给出库的安装方式、代码示例与自定义工具接口,读者可据此判断如何在浏览器或服务端为 LLM 接入工具。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,通过 npm install @huggingface/agents 安装。
推荐理由:原文给出库的安装方式、代码示例与自定义工具接口,读者可据此判断如何在浏览器或服务端为 LLM 接入工具。
Hugging Face 发布教程,用 Node.js 结合 WizardCoder-15B 与 Inference Endpoints API 构建流式生成 HTML 的 Web 应用生成器。模型通过 textGenerationStream 边生成边渲染,配合 TailwindCSS 提示词让页面即时成型,也可改用免费的 Inference API 运行较小模型。
OpenAI 宣布为 ChatGPT 实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或调用第三方服务。
推荐理由:OpenAI 官方给出 ChatGPT 插件机制的初步支持,读者可据此了解模型接入外部信息与服务的早期形态。
Hugging Face 发布开源工具 AI vs. AI,用于在多智能体环境中对强化学习模型进行排名。该工具托管于 Spaces,通过匹配算法让模型持续对战,并基于 ELO 评分系统(初始 1200 分)在 Leaderboard 上展示排名,用户将训练好的模型推送到 Hub 即可参与评估。
Hugging Face 博客"AI for Game Development"系列第 5 篇展示了用 ChatGPT 为农场游戏生成剧情:先让模型写故事梗概,结果与《星露谷物语》高度雷同,经多轮要求"更有原创性"并去除魔法元素后才可用。作者指出语言模型易复现已有故事、长文本易重复,直接使用 AI 输出可能带来法律、伦理与商业风险,建议仅用于头脑风暴,最终内容手写。
Hugging Face 博客系列教程第二部分展示如何用 ChatGPT 辅助游戏设计,作者以 5 天开发农场游戏为例,让 ChatGPT 以专业游戏设计师身份给出作物多样性、进阶系统、社交玩法等建议,并据此灰盒实现了前两项。文章同时说明 ChatGPT 基于 Transformer 与 RLHF,常言之凿凿却出错,宜作头脑风暴与加速工具而非开发流程的替代品。
OpenAI 正利用 GPT-3 创建新一代 AI 驱动的角色。
OpenAI 训练神经网络通过 Video PreTraining(VPT)在大量无标注的人类 Minecraft 游玩视频上学习,仅使用少量标注承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动这类原生人类交互接口,具有较强通用性,是迈向通用计算机操作智能体的一步。
推荐理由:OpenAI 用大量无标注游戏视频预训练网络,仅少量标注数据微调即可完成钻石工具制作,为通用计算机操作智能体提供了一条路径。
Hugging Face 深度强化学习课程第三单元讲解 Deep Q-Learning,用神经网络替代 Q-table 来近似每个动作的 Q 值,并在 Space Invaders 等 Atari 环境上训练智能体。该方法将输入降采样为 84x84 灰度图并堆叠 4 帧以捕捉时序信息,再经三层卷积层和全连接层输出 Q 值,训练使用 RL-Zoo 框架。
Hugging Face 将离线强化学习方法 Decision Transformer 集成进 transformers 库和 Hugging Face Hub,并发布九个 Gym 环境连续控制任务的预训练模型 checkpoint,覆盖 Hopper、Walker2D 和 Halfcheetah,Atari 环境 checkpoint 即将推出。
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,原文链接为 https://openai.com/index/dota-2-with-large-scale-deep-reinforcement-learning。
OpenAI 在模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生更复杂、更智能的行为。
推荐理由:OpenAI 在捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI Five 在周末的 Finals 上连续两局击败 Dota 2 世界冠军战队 OG,成为首个战胜电竞世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 都曾在私下击败高水平职业选手,但在直播的职业比赛中落败,因此这也是 AI 首次在直播中战胜电竞职业选手。
推荐理由:OpenAI Five 在直播中连胜 Dota 2 世界冠军 OG,可对照 AlphaStar 此前直播落败的节点理解 AI 竞技进展。
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境,支持在持久、开放式任务中容纳数量可变的大量智能体。该平台通过引入众多智能体与物种,带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI Five 本周在温哥华 The International 上对阵顶尖 Dota 2 选手,两局均告负,但在两局的前 20 至 35 分钟内都保持了较高的取胜机会。
OpenAI 宣布其由五个神经网络组成的团队 OpenAI Five 已在 Dota 2 中开始战胜业余人类队伍。该团队由五个神经网络构成,此次公布的是这一阶段性对战结果。
推荐理由:OpenAI 公开了由五个神经网络组成的 OpenAI Five 在 Dota 2 中开始战胜业余人类队伍这一阶段性结果。
OpenAI 开发出一种分层强化学习算法,能学习有助于解决一系列任务的高层动作,从而快速求解需要数千个时间步的任务。在导航问题集上,该算法发现了向不同方向行走和爬行的高层动作,使智能体能够快速掌握新的导航任务。
OpenAI 发现自对弈能让模拟 AI 自行学会擒抱、闪避、假动作、踢球、接球和扑球等身体技能,无需在设计环境时预先设定这些技能。自对弈还能让环境难度始终与 AI 水平匹配,便于持续提升。结合此前的 Dota 2 自对弈结果,OpenAI 表示越来越确信自对弈将成为未来强大 AI 系统的核心部分。
推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自对弈的训练价值。
OpenAI 发布 Learning with Opponent-Learning Awareness(LOLA)算法,该算法在建模时考虑其他智能体也在学习,从而在迭代囚徒困境中发现“tit-for-tat”这类既自利又合作的策略。这是迈向能够建模他人心智的智能体的一小步。
OpenAI 发布 Dota 2 研究补充说明,指出在算力充足时自对弈能把机器学习系统从远低于人类水平提升到超人水平。该系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 还指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统的可用数据会随智能体变强自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。
OpenAI 宣布其打造的 bot 在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该 bot 完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出的 bot 在标准赛制下击败 Dota 2 顶级选手,可看复杂实时环境中的方法取舍。
OpenAI 发布一项新研究,介绍智能体在训练中发展出自己语言的过程。该帖为摘要,未给出具体方法、实验设置或结果数据。
OpenAI 发布 Universe,一个用于衡量和训练 AI 通用智能的软件平台,覆盖全球的游戏、网站及其他应用。
推荐理由:OpenAI 发布 Universe 平台,读者可了解其用游戏和网站训练通用智能的定位。