OpenAI 升级 Codex,提升速度与实时协作能力
OpenAI 宣布升级 Codex,使其更快、更可靠,并增强实时协作和独立处理任务的能力。升级后的 Codex 可在终端、IDE、网页乃至手机等多种开发环境中使用。
推荐理由:Codex 在速度、可靠性和实时协作上的升级,覆盖终端、IDE、网页和手机多个开发入口。
技术方向
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
181 条精选近 30 天 35 条共收录 493 条
OpenAI 宣布升级 Codex,使其更快、更可靠,并增强实时协作和独立处理任务的能力。升级后的 Codex 可在终端、IDE、网页乃至手机等多种开发环境中使用。
推荐理由:Codex 在速度、可靠性和实时协作上的升级,覆盖终端、IDE、网页和手机多个开发入口。
OpenAI 在 GPT-5 系统卡增补中发布新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。该模型会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。
推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的新模型,读者可了解其动态调整思考投入的机制。
Mistral 在 Le Chat 中发布 20+ 个基于 MCP 的安全连接器目录(beta),覆盖数据、生产力、开发、自动化与商务等类别,支持接入 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并可添加自定义 MCP 连接器或连接任意远程 MCP 服务器。
推荐理由:官方给出连接器目录与记忆功能的开放范围,读者可据此判断企业工作流接入的可行路径。
OpenAI 发布开源权重模型家族 gpt-oss,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,两者均为 MoE 架构并采用 MXFP4 4-bit 量化,激活参数分别为 5.1B 和 3.6B,采用 Apache 2.0 许可。
推荐理由:Hugging Face 汇总了 gpt-oss 两个开源模型的参数、量化方案与各推理框架的适配情况,可据此判断本地部署门槛。
Mistral AI 发布 Codestral 25.08 代码模型,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。Codestral 25.08 相比前代补全接受率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,支持云、VPC 与本地部署。
推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 官方一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线的功能覆盖方向。
OpenAI 发布 ChatGPT agent 系统卡,介绍这一智能体模型整合了研究、浏览器自动化和代码工具,并在 Preparedness Framework 下配备安全防护措施。
推荐理由:OpenAI 官方系统卡披露 ChatGPT agent 的能力组合与安全框架,可了解其智能体设计与防护思路。
OpenAI 发布 ChatGPT agent,官方称其能够思考并行动,调用工具完成研究、预订和幻灯片等任务,全程由用户引导。
推荐理由:OpenAI 官方发布 ChatGPT agent,读者可据此了解其可调用工具完成研究、预订和幻灯片等任务的能力定位。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1,两款模型均强调对不同提示词和智能体框架的泛化能力。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
Hugging Face 发布 ScreenEnv,一个可在 Docker 容器中创建隔离 Ubuntu 桌面环境的 Python 库,用于测试和部署 GUI 智能体(Computer Use 智能体),支持 AMD64 与 ARM64,环境部署时间不到 10 秒。
推荐理由:ScreenEnv 把桌面智能体的运行环境收敛到 Docker 沙箱,并同时提供 MCP 与直连 API 两种接入方式,便于对照现有智能体框架的部署路径。
Hugging Face 发布 ScreenSuite,一个面向 GUI Agent 的评测套件,整合 13 项基准,覆盖感知、定位、单步动作和多步智能体四类能力。
推荐理由:Hugging Face 开源 GUI Agent 评测套件,读者可了解其 13 项基准覆盖的能力维度与纯视觉评测设定。
H Company 发布 Holo1 系列 Action VLM,包含 Holo1-3B 和 Holo1-7B,基于 Qwen2.5-VL 架构并已在 Hugging Face 开源,同时发布含 1,639 个类人 UI 任务的 WebClick 多模态定位基准。
推荐理由:原文给出开源模型规格、基准成绩与单任务成本,读者可据此判断网页自动化方案的落地门槛。
Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、Web 搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,可据此判断企业级智能体平台的搭建方式。
Hugging Face 将 JS 版 Tiny Agents 移植到 Python,并扩展 huggingface_hub 客户端 SDK 使其充当 MCP Client,可从 MCP 服务器拉取工具并在推理时传给 LLM。
推荐理由:原文给出约 70 行代码实现 MCP 智能体的完整路径,读者可据此理解工具调用循环的最小结构。
Mistral AI 与 All Hands AI 合作发布智能体 LLM Devstral,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SOTA 高出 6 个百分点以上,并以 Apache 2.0 许可开源。
推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。
OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。
推荐理由:官方系统卡补充说明 Codex 由 o3 衍生模型 codex-1 驱动,可了解其训练方式与编码定位。
Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,提供企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
推荐理由:Mistral 官方发布企业版助手,列出企业搜索、Agent 构建与混合部署等能力,可据此判断其企业落地路径。
Hugging Face 发布 Tiny Agents 教程,用约 50 行 TypeScript 代码在 InferenceClient 之上实现 MCP 客户端和智能体,智能体本质是工具调用循环。
推荐理由:作者以 Hugging Face 官方身份给出可运行的 MCP 客户端与智能体实现,读者可据此理解工具调用如何串起一个最小智能体。
Mistral 发布全新 le Chat AI 助手,同步上线 iOS 和 Android,并推出 Pro 与 Team 订阅层级,Enterprise 版进入私有预览。
推荐理由:官方一次性给出 le Chat 的移动端、Pro/Team 定价与企业私有预览,可据此判断 Mistral 在消费级助手上的产品布局。
Hugging Face 开源了复现 OpenAI Deep Research 的 Open DeepResearch 框架,在 GAIA 验证集上达到 55.15%,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research 并开源框架,给出了 GAIA 上的对比数字与代码智能体的取舍依据。