OpenAI 发布 deep research 智能体
OpenAI 发布 deep research,一个用推理综合大量在线信息并完成多步研究任务的智能体。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。
推荐理由:OpenAI 官方公布 deep research 的定位与开放节奏,可据此判断哪些用户能先用上这一研究型智能体。
技术方向
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
181 条精选近 30 天 35 条共收录 493 条
OpenAI 发布 deep research,一个用推理综合大量在线信息并完成多步研究任务的智能体。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。
推荐理由:OpenAI 官方公布 deep research 的定位与开放节奏,可据此判断哪些用户能先用上这一研究型智能体。
Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图像可在 agent.run 时通过 images 参数一次性传入,也可借助 step_callbacks 在每步把截图写入 ActionStep 的 observation_images 动态注入。
推荐理由:官方给出在 smolagents 中接入视觉语言模型的两条路径,并附可运行的浏览器智能体示例代码。
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即让智能体用代码而非 JSON 编写动作,并支持通过 E2B 在沙箱中执行。
推荐理由:Hugging Face 官方发布轻量智能体库,给出代码写动作的设计取舍与开源模型对比,可据此判断自建智能体的成本。
Mistral AI 为免费生成式 AI 助手 le Chat 推出多项 beta 新功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、文档与图像理解、图像生成以及可共享的 Agent。
推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与图像生成,并给出与主流助手的逐项对比。
Hugging Face 用基于 transformers.agents 的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:Hugging Face 用 Code Agent 在 GAIA 上取得领先,并公开了工具、执行沙箱与规划策略的实现细节。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体类型之外新增可基于历史观察迭代的 ReactAgent 等两类智能体,并加入共享功能。
推荐理由:官方给出新智能体框架的模块划分与 GAIA 榜单成绩,可据此判断开源智能体方案的可用性。
Mistral AI 发布对话助手 Le Chat,作为与 Mistral 各模型交互的对话入口,底层可调用 Mistral Large、Mistral Small 或原型模型 Mistral Next。同时推出面向企业的 Le Chat Enterprise,支持自部署和细粒度审核机制。Le Chat 目前无法联网,可能给出不准确或过时的信息,现以 beta 形式开放注册。
推荐理由:Mistral 官方发布对话助手 Le Chat 及企业版,可了解其底层模型选择与自部署、审核机制。
Hugging Face 发布博客,介绍如何用 LangChain 新集成的 ChatHuggingFace 封装把开源模型搭建成 ReAct 智能体,并给出完整代码示例。
推荐理由:原文给出 ReAct 智能体的完整搭建代码与开源模型对比基准,可据此判断哪些模型适合驱动智能体工作流。
OpenAI 发布 GPTs,用户现在可以创建自定义版本的 ChatGPT,将指令、额外知识和任意技能组合在一起。
推荐理由:OpenAI 官方发布 GPTs,用户可组合指令、额外知识和技能定制 ChatGPT 版本。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,通过 npm install @huggingface/agents 安装。
推荐理由:原文给出库的安装方式、代码示例与自定义工具接口,读者可据此判断如何在浏览器或服务端为 LLM 接入工具。
OpenAI 宣布为 ChatGPT 实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或调用第三方服务。
推荐理由:OpenAI 官方给出 ChatGPT 插件机制的初步支持,读者可据此了解模型接入外部信息与服务的早期形态。
OpenAI 训练神经网络通过 Video PreTraining(VPT)在大量无标注的人类 Minecraft 游玩视频上学习,仅使用少量标注承包商数据。经微调后,模型能学会制作钻石工具,这一任务通常需要熟练人类花费 20 分钟以上、约 24000 次操作。模型使用键盘按键和鼠标移动这类原生人类交互接口,具有较强通用性,是迈向通用计算机操作智能体的一步。
推荐理由:OpenAI 用大量无标注游戏视频预训练网络,仅少量标注数据微调即可完成钻石工具制作,为通用计算机操作智能体提供了一条路径。
OpenAI 发布关于 Dota 2 大规模深度强化学习的研究,原文链接为 https://openai.com/index/dota-2-with-large-scale-deep-reinforcement-learning。
OpenAI 在模拟捉迷藏环境中训练智能体,观察到它们逐步学会使用更复杂的工具,并形成六种不同的策略与反策略,其中一些策略是该环境原本未被设计支持的。OpenAI 认为,这种在简单环境中自监督涌现出的复杂性,说明多智能体共同适应未来可能产生更复杂、更智能的行为。
推荐理由:OpenAI 在捉迷藏模拟环境中观察到智能体自发形成六种策略与反策略,可了解多智能体协同演化的一种研究路径。
OpenAI Five 在周末的 Finals 上连续两局击败 Dota 2 世界冠军战队 OG,成为首个战胜电竞世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 都曾在私下击败高水平职业选手,但在直播的职业比赛中落败,因此这也是 AI 首次在直播中战胜电竞职业选手。
推荐理由:OpenAI Five 在直播中连胜 Dota 2 世界冠军 OG,可对照 AlphaStar 此前直播落败的节点理解 AI 竞技进展。
OpenAI Five 本周在温哥华 The International 上对阵顶尖 Dota 2 选手,两局均告负,但在两局的前 20 至 35 分钟内都保持了较高的取胜机会。
OpenAI 宣布其由五个神经网络组成的团队 OpenAI Five 已在 Dota 2 中开始战胜业余人类队伍。该团队由五个神经网络构成,此次公布的是这一阶段性对战结果。
推荐理由:OpenAI 公开了由五个神经网络组成的 OpenAI Five 在 Dota 2 中开始战胜业余人类队伍这一阶段性结果。
OpenAI 发现自对弈能让模拟 AI 自行学会擒抱、闪避、假动作、踢球、接球和扑球等身体技能,无需在设计环境时预先设定这些技能。自对弈还能让环境难度始终与 AI 水平匹配,便于持续提升。结合此前的 Dota 2 自对弈结果,OpenAI 表示越来越确信自对弈将成为未来强大 AI 系统的核心部分。
推荐理由:OpenAI 用自对弈让模拟 AI 自行涌现出擒抱、假动作等身体技能,可与 Dota 2 结果对照理解自对弈的训练价值。
OpenAI 发布 Dota 2 研究补充说明,指出在算力充足时自对弈能把机器学习系统从远低于人类水平提升到超人水平。该系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,此后仍在持续提升。OpenAI 还指出,监督式深度学习系统的上限受训练数据集限制,而自对弈系统的可用数据会随智能体变强自动改善。
推荐理由:OpenAI 用 Dota 2 结果说明自对弈在算力充足时能把系统从远低于人类提升到超人水平。
OpenAI 宣布其打造的 bot 在标准锦标赛规则下的 Dota 2 1v1 对战中击败了世界顶级职业选手。该 bot 完全通过自我对弈从零学习游戏,未使用模仿学习或树搜索。OpenAI 称这是迈向在涉及真实人类的混乱复杂情境中完成明确目标的一步。
推荐理由:OpenAI 用自我对弈从零训练出的 bot 在标准赛制下击败 Dota 2 顶级选手,可看复杂实时环境中的方法取舍。