跳到正文
  1. 智东西82

    谷歌发布 Gemini 4 Argon,输出上限提至 100 万 Token

    谷歌发布新一代旗舰模型 Gemini 4 Argon,面向软件工程、法律金融等企业知识工作与网络安全防御,输出 Token 上限从此前 6.4 万提升至 100 万。

    推荐理由:谷歌发布 Gemini 4 Argon,披露了输出上限、基准成绩和 API 定价,可据此判断其企业级 Agent 任务的定位与成本。

  2. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。

  1. 爱范儿78

    OpenAI DevDay 2026 发布 dots、ChatGPT Space 与 GPT-6.1 Sol 等 20 多项更新

    OpenAI 在 DevDay 2026 上发布 20 多项功能和产品更新,包括由 GPT-6 Astra 驱动的 24 小时在线智能体助理 dots、协作空间 ChatGPT Space、云端 Codex Cloud,以及新模型 GPT-6.1 Sol。

    推荐理由:梳理 DevDay 2026 的 20 多项更新,并点出 ChatGPT 从对话工具转向企业工作流服务这条主线。

  2. AWS Machine Learning Blog62

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和日常专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,单任务成本约为后者的五分之一,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。

    推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比变化。

  1. OpenAI News76

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其在编码、电脑操作和专业工作方面接近 Astra 的智能水平,标准 API 输入与输出 token 价格仅为 Astra 的五分之一。

    推荐理由:OpenAI 发布 GPT-6.1 Sol,价格降至 Astra 标准 API 的五分之一,可据此判断编码与电脑操作场景的成本变化。

  2. 开源中国82

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30%、Agent 编程评测从 10% 升至 70%

    Anthropic 发布 Claude 5.5 家族第二个成员 Claude Sonnet 5.5,定位为 Opus 5.5 的快而省互补款,主打高频日常任务、修 bug、文档和表格。官方称其比 Sonnet 5 速度快 30% 以上,多数任务成本低 30%,Agent 编程评测成绩从 10% 提升到 70%。

    推荐理由:Anthropic 新模型在 Agent 编程评测上的大幅跃升,可作为观察 Sonnet 系列定位与能力边界的参照。

  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion,用多模型编排提供前沿级编码质量

    GitHub 发布研究预览版 Project HydraFusion,通过运行时编排在多个提供商的模型间选择,自动完成起草、评审、修订或升级到更强模型。它目前提供 Single、Cascade、Critique 三种执行模式,已在所有 GitHub Copilot 套餐中通过 Copilot CLI 的 /experimental 开放,按各模型标准费率计费。

    推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三套基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。

  1. OpenAI News76

    OpenAI 发布 GPT-6 Astra

    OpenAI 发布新一代模型 GPT-6 Astra,官方称其为目前最智能且对齐程度最高的模型。该模型在计算机操作、编码、网络安全和科学等方向具备 SOTA 能力。

    推荐理由:OpenAI 官方发布新一代模型,读者可据此了解其在计算机操作、编码与安全等方向的能力定位。

  2. Google DeepMind85

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,前者面向长时程编码与自主智能体,后者面向漏洞发现与自动修补。

    推荐理由:官方给出两款 Flash 变体的基准、定价与开放渠道,可据此判断长时程编码与安全场景的选型取舍。

  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。

    推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本收益。

  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。

    推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的对比数据,可据此判断专用小模型在漏洞挖掘上的性价比。

  1. OpenAI News62

    OpenAI 预告下一代模型 GPT-5.6 Sol

    OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全技术栈。

    推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可据此了解其在编码、科学与网络安全上的能力方向。

  1. Hugging Face Blog85

    智谱发布 GLM-5.2,面向长程任务支持 1M 上下文

    智谱发布旗舰模型 GLM-5.2,主打长程任务能力,首次在 1M token 上下文下稳定支撑长程工作,并采用 MIT 开源许可。

    推荐理由:GLM-5.2 把 1M 上下文与编码智能体能力结合,并给出与闭源前沿模型的基准对比,可据此判断开源模型在长程任务上的位置。

  1. Mistral AI80

    Mistral 将 Le Chat 升级为统一智能体 Vibe,推出 Work Mode 与 Code Mode

    Mistral 宣布将 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖工作与编码场景,原有对话、设置和订阅方案全部保留。

    推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此判断工作与编码两类长任务如何被同一入口承接。

  1. Mistral AI80

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,并支撑 Vibe 的云端远程编码智能体与 Le Chat 的 Work 模式预览。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管编码智能体的可行边界。

  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量的取舍是否成立。

  1. Google DeepMind71

    Google DeepMind 发布 AlphaEvolve 一年落地成果

    Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果,覆盖数学、量子物理、基因组、电网与 AI 基础设施等领域。

    推荐理由:官方汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、TPU 与量子模拟,可据此判断编码智能体的跨领域迁移边界。

  1. OpenAI News62

    OpenAI 将 GPT 模型、Codex 与 Managed Agents 上线 AWS

    OpenAI 的 GPT 模型、Codex 和 Managed Agents 现已在 AWS 上可用,企业可在自己的 AWS 环境中构建安全的 AI 应用。

    推荐理由:OpenAI 把 GPT 模型、Codex 与 Managed Agents 接入 AWS,读者可据此判断企业现有云环境能否直接落地。