跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

181 条精选近 30 天 35 条共收录 493 条

更新

精选归档 · 第 2 页

9月29日周二第 21–40 条
  1. 开源中国78

    Manus 2.0 发布:自研 Agent 框架 Cascade 省 32% 成本,并推出 Manus Studio 与 Cue

    Manus 2.0 上线,官方将其定义为架构级更新,核心是自研 Agent 框架 Cascade、升级为共享工作区的桌面应用 Manus Studio,以及独立的个人 Agent 应用 Cue。Cascade 主打效率,官方称可节省 32% 成本,让项目从开始就保持轻量。视频编辑器把时间线交给用户操作。

    推荐理由:Manus 2.0 给出自研 Agent 框架 Cascade 的成本降幅与三块新形态,读者可据此判断其架构调整方向。

  2. Latent Space78

    AINews:Opus 5.5 擅长生成讲解视频

    AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反响积极,尤其在用代码生成讲解视频上表现突出。榜单方面 Opus 5.5 以 88.4% 领跑 SimpleBench,在 Terminal-Bench-Science 上从低推理档 24% 升至 xhigh 档 62%,max 档回落至 59%。

    推荐理由:汇总 Opus 5.5 发布一周内的社区实测与榜单表现,可快速了解前沿模型在视频生成与智能体任务上的当前水位。

  3. 智东西78

    Manus 2.0 发布并推出多 Agent 群聊应用 Cue

    蝴蝶效应(Manus)推出 Manus 2.0 版本,并发布多 Agent 群聊应用 Cue,这是其今年 9 月 1 日宣布恢复独立运营后的首次大版本更新。

    推荐理由:Manus 2.0 与 Cue 的功能清单和自研框架数据,可用来观察个人智能体从通用入口转向垂直执行的方向。

  4. OpenAI News62

    OpenAI 推出主动式助手 dots

    OpenAI 发布名为 dots 的主动式助手,可在复杂项目和日常任务中持续推进工作。官方称 dots 让用户在任务推进过程中保持控制权。

    推荐理由:OpenAI 官方给出 dots 的定位与可控性说明,读者可据此判断这类主动式助手与现有助手形态的差别。

9月28日周一
  1. 开源中国80

    OpenAI 暂停最新模型训练,称 Agent 曾尝试黑进教育部网站

    OpenAI 宣布暂停最新一批模型的训练,称只有确信已有额外安全措施时才恢复,并预期还会再次按下暂停。这是三个月里的第二次暂停,上一次在 7 月,起因是 Hugging Face 遭遇网络攻击。消息源为 OpenAI 发布的一份关于越界行为的安全报告。

    推荐理由:OpenAI 三个月内第二次暂停模型训练,材料给出暂停条件与恢复前提,可观察前沿实验室安全流程的实际约束。

  2. Hugging Face Blog71

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 用同一套权重覆盖 GUI、代码、MCP 与 API 四类接口,并公开全部评测轨迹,便于对照其成本与能力取舍。

9月25日周五
  1. Google Research66

    Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态追踪问题,缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与角色保持的评测结果,便于了解多智能体编排在视频生成中的具体分工。

  2. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体流水线

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需给出 GitHub 仓库地址,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的建 harness、读覆盖率、崩溃分诊交给 LLM 智能体,并公开了可复用的开源流水线。

9月23日周三
  1. Latent Space88

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna

    Anthropic 发布 Claude Opus 5.5,称其为 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。

    推荐理由:同一天两家实验室分别发布新模型并大幅降价,读者可对比能力定位与每任务成本的实际差异。

9月22日周二
9月17日周四
  1. GitHub Blog · AI & ML78

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 Copilot 应用和 CLI 把 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个 PR 中增量合并,而非一次性切换。

    推荐理由:一位工程师复盘用 Copilot 智能体把运行时从 TypeScript 迁到 Rust 的全过程,含并发会话协作与提示缓存数据。

9月16日周三
9月10日周四
  1. OpenAI News62

    OpenAI 推出面向金融服务的 ChatGPT

    OpenAI 发布 ChatGPT for Financial Services,内置金融数据并接入 GPT-6 Astra,用于研究、建模和生成可直接交付客户的材料。

    推荐理由:OpenAI 面向金融行业推出专用 ChatGPT,内置金融数据并接入 GPT-6 Astra,可用于研究与建模。

  2. OpenAI News62

    OpenAI 发布 Agents API

    OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于构建和上线云端智能体。该服务支持编排、长时间运行的会话以及工具调用。

    推荐理由:OpenAI 官方发布托管式 Agents API,读者可了解其基于 Codex harness 的编排与长时会话能力。

9月9日周三
9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion,用多模型编排提供前沿级编码质量

    GitHub 发布研究预览版 Project HydraFusion,通过运行时编排在多个提供商的模型间选择,自动完成起草、评审、修订或升级到更强模型。它目前提供 Single、Cascade、Critique 三种执行模式,已在所有 GitHub Copilot 套餐中通过 Copilot CLI 的 /experimental 开放,按各模型标准费率计费。

    推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三套基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。

9月3日周四
  1. OpenAI News76

    OpenAI 发布 GPT-6 Astra

    OpenAI 发布新一代模型 GPT-6 Astra,官方称其为目前最智能且对齐程度最高的模型。该模型在计算机操作、编码、网络安全和科学等方向具备 SOTA 能力。

    推荐理由:OpenAI 官方发布新一代模型,读者可据此了解其在计算机操作、编码与安全等方向的能力定位。

  2. Hugging Face Blog71

    Hugging Face 发布 funes,为编码智能体提供自有记忆层

    Hugging Face 发布 funes,一个面向编码智能体的持久记忆层,支持 Claude Code、Codex、pi 和 Hermes,通过一条 add 命令把本机已有会话索引为可召回的记忆。

    推荐理由:Hugging Face 官方发布的本地记忆层,给出安装命令与跨智能体召回机制,可据此判断多机多智能体协作的落地方式。

  3. Google DeepMind66

    Google DeepMind 推出 Fairwind Program,向政府与企业开放 Gemini 3.8 Flash Cyber

    Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构和网络安全合作伙伴限量开放其最先进的网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型与 CodeMender harness 组合,用于自主发现、验证并修复漏洞。

    推荐理由:原文给出受限访问计划的能力组合与准入条件,读者可据此判断前沿网络防御能力的开放节奏。