H Company 发布 Holo1 系列 GUI 自动化 VLM 与 WebClick 基准
H Company 发布 Holo1 系列 Action VLM,包含 Holo1-3B 和 Holo1-7B,基于 Qwen2.5-VL 架构并已在 Hugging Face 开源,同时发布含 1,639 个类人 UI 任务的 WebClick 多模态定位基准。
推荐理由:原文给出开源模型规格、基准成绩与单任务成本,读者可据此判断网页自动化方案的落地门槛。
技术方向
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
466 条精选近 30 天 131 条共收录 1,842 条
H Company 发布 Holo1 系列 Action VLM,包含 Holo1-3B 和 Holo1-7B,基于 Qwen2.5-VL 架构并已在 Hugging Face 开源,同时发布含 1,639 个类人 UI 任务的 WebClick 多模态定位基准。
推荐理由:原文给出开源模型规格、基准成绩与单任务成本,读者可据此判断网页自动化方案的落地门槛。
Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、Web 搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,可据此判断企业级智能体平台的搭建方式。
Hugging Face 将 JS 版 Tiny Agents 移植到 Python,并扩展 huggingface_hub 客户端 SDK 使其充当 MCP Client,可从 MCP 服务器拉取工具并在推理时传给 LLM。
推荐理由:原文给出约 70 行代码实现 MCP 智能体的完整路径,读者可据此理解工具调用循环的最小结构。
Anthropic 发布下一代 Claude 模型 Claude Opus 4 和 Claude Sonnet 4,主打编码、高级推理与 AI 智能体能力。
推荐理由:官方给出 Claude Opus 4 与 Sonnet 4 的基准成绩、定价和 API 新能力,可据此判断编码与智能体场景的选型。
Mistral AI 与 All Hands AI 合作发布智能体 LLM Devstral,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SOTA 高出 6 个百分点以上,并以 Apache 2.0 许可开源。
推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。
OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。
推荐理由:官方系统卡补充说明 Codex 由 o3 衍生模型 codex-1 驱动,可了解其训练方式与编码定位。
Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,提供企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
推荐理由:Mistral 官方发布企业版助手,列出企业搜索、Agent 构建与混合部署等能力,可据此判断其企业落地路径。
Hugging Face 发布 Tiny Agents 教程,用约 50 行 TypeScript 代码在 InferenceClient 之上实现 MCP 客户端和智能体,智能体本质是工具调用循环。
推荐理由:作者以 Hugging Face 官方身份给出可运行的 MCP 客户端与智能体实现,读者可据此理解工具调用如何串起一个最小智能体。
Anthropic 工程团队发布 Claude Code 智能体编码最佳实践指南,核心约束是上下文窗口会随对话、文件读取和命令输出快速填满并导致性能下降。指南给出验证闭环、先探索再规划再编码、CLAUDE.md 配置、权限与沙箱、MCP 与 hooks、子智能体、并行会话和常见失败模式等做法,并建议同一问题纠正超过两次后 /clear 重开。
推荐理由:Anthropic 官方把 Claude Code 的上下文约束拆成可复用的配置与验证流程,适合对照自己的会话习惯逐条调整。
Anthropic 发布面向高等教育机构的 Claude for Education,并推出 Learning mode,引导学生自己推理而非直接给出答案。该版本包含与东北大学、伦敦政治经济学院和 Champlain College 的全校接入协议,东北大学 13 个全球校区的 5 万名学生、教师和员工将获得 Claude 访问权限。
推荐理由:Anthropic 面向高校推出专用版本并给出 Learning mode 与三所大学的全校接入案例,可了解教育场景的落地方式。
Anthropic 介绍 think 工具,让 Claude 在生成回复过程中插入一个专门用于结构化思考的步骤,适用于长链工具调用、政策密集环境和顺序决策场景。
推荐理由:Anthropic 给出 think 工具的完整定义、适用场景与 τ-bench 实测数据,可直接迁移到自家智能体工具链。
Anthropic 发布 Claude 3.7 Sonnet,称其为市场上首个混合推理模型,可在标准回答与可见的扩展思考模式间切换,API 用户还能限制思考的 token 预算,上限为 128K。
推荐理由:Anthropic 官方给出混合推理模式的定价与开放范围,读者可据此判断推理预算控制在实际编码工作流中的取舍。
Anthropic 为 Claude 3.7 Sonnet 推出可开关的扩展思考模式,用户可切换是否让模型深入思考,开发者还能设置思考预算控制思考时长。该模式让同一模型自行分配更多时间与算力,而非切换到另一个模型,其原始思考过程对用户可见,官方将其定位为研究预览。
推荐理由:Anthropic 官方披露 Claude 3.7 Sonnet 扩展思考的可见推理机制,并给出 GPQA 与智能体评测数据。
Mistral 发布全新 le Chat AI 助手,同步上线 iOS 和 Android,并推出 Pro 与 Team 订阅层级,Enterprise 版进入私有预览。
推荐理由:官方一次性给出 le Chat 的移动端、Pro/Team 定价与企业私有预览,可据此判断 Mistral 在消费级助手上的产品布局。
Hugging Face 开源了复现 OpenAI Deep Research 的 Open DeepResearch 框架,在 GAIA 验证集上达到 55.15%,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research 并开源框架,给出了 GAIA 上的对比数字与代码智能体的取舍依据。
OpenAI 发布 deep research,一个用推理综合大量在线信息并完成多步研究任务的智能体。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。
推荐理由:OpenAI 官方公布 deep research 的定位与开放节奏,可据此判断哪些用户能先用上这一研究型智能体。
Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图像可在 agent.run 时通过 images 参数一次性传入,也可借助 step_callbacks 在每步把截图写入 ActionStep 的 observation_images 动态注入。
推荐理由:官方给出在 smolagents 中接入视觉语言模型的两条路径,并附可运行的浏览器智能体示例代码。
Modal 宣布 Sandboxes 结束一年 beta 正式可用,用于安全隔离运行来自 LLM、用户或第三方的不可信代码。Sandboxes 提供 exec API,可在运行时配置执行环境,并支持文件系统快照与端口转发、网络访问限制等能力,与 Functions 共用底层基础设施。
推荐理由:官方给出 Sandbox 正式版的能力边界与客户案例,可据此判断隔离执行环境在智能体场景中的落地方式。
Anthropic 升级版 Claude 3.5 Sonnet 在 SWE-bench Verified 上取得 49%,超过此前最优模型的 45%。文章介绍了围绕模型搭建的智能体脚手架,只用一个提示词、Bash Tool 和 Edit Tool 两个通用工具,尽量把控制权交给模型本身。
推荐理由:Anthropic 公开了让 Claude 3.5 Sonnet 在 SWE-bench Verified 拿到 49% 的智能体脚手架与工具设计细节,可供开发者复现。
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即让智能体用代码而非 JSON 编写动作,并支持通过 E2B 在沙箱中执行。
推荐理由:Hugging Face 官方发布轻量智能体库,给出代码写动作的设计取舍与开源模型对比,可据此判断自建智能体的成本。