谷歌发布 Gemini 4 Argon,输出上限提至 100 万 Token
谷歌发布新一代旗舰模型 Gemini 4 Argon,面向软件工程、法律金融等企业知识工作与网络安全防御,输出 Token 上限从此前 6.4 万提升至 100 万。
推荐理由:谷歌发布 Gemini 4 Argon,披露了输出上限、基准成绩和 API 定价,可据此判断其企业级 Agent 任务的定位与成本。
谷歌发布新一代旗舰模型 Gemini 4 Argon,面向软件工程、法律金融等企业知识工作与网络安全防御,输出 Token 上限从此前 6.4 万提升至 100 万。
推荐理由:谷歌发布 Gemini 4 Argon,披露了输出上限、基准成绩和 API 定价,可据此判断其企业级 Agent 任务的定位与成本。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
OpenAI 在 DevDay 2026 上发布 20 多项功能和产品更新,包括由 GPT-6 Astra 驱动的 24 小时在线智能体助理 dots、协作空间 ChatGPT Space、云端 Codex Cloud,以及新模型 GPT-6.1 Sol。
推荐理由:梳理 DevDay 2026 的 20 多项更新,并点出 ChatGPT 从对话工具转向企业工作流服务这条主线。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和日常专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,单任务成本约为后者的五分之一,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比变化。
OpenAI 发布 GPT-6.1 Sol,官方称其在编码、电脑操作和专业工作方面接近 Astra 的智能水平,标准 API 输入与输出 token 价格仅为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,价格降至 Astra 标准 API 的五分之一,可据此判断编码与电脑操作场景的成本变化。
Anthropic 发布 Claude 5.5 家族第二个成员 Claude Sonnet 5.5,定位为 Opus 5.5 的快而省互补款,主打高频日常任务、修 bug、文档和表格。官方称其比 Sonnet 5 速度快 30% 以上,多数任务成本低 30%,Agent 编程评测成绩从 10% 提升到 70%。
推荐理由:Anthropic 新模型在 Agent 编程评测上的大幅跃升,可作为观察 Sonnet 系列定位与能力边界的参照。
GitHub 发布研究预览版 Project HydraFusion,通过运行时编排在多个提供商的模型间选择,自动完成起草、评审、修订或升级到更强模型。它目前提供 Single、Cascade、Critique 三种执行模式,已在所有 GitHub Copilot 套餐中通过 Copilot CLI 的 /experimental 开放,按各模型标准费率计费。
推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三套基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。
OpenAI 发布新一代模型 GPT-6 Astra,官方称其为目前最智能且对齐程度最高的模型。该模型在计算机操作、编码、网络安全和科学等方向具备 SOTA 能力。
推荐理由:OpenAI 官方发布新一代模型,读者可据此了解其在计算机操作、编码与安全等方向的能力定位。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,前者面向长时程编码与自主智能体,后者面向漏洞发现与自动修补。
推荐理由:官方给出两款 Flash 变体的基准、定价与开放渠道,可据此判断长时程编码与安全场景的选型取舍。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本收益。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款新模型。
推荐理由:官方给出三款新模型的定价、token 效率与多项基准对比,可据此判断智能体工作流的成本与选型。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的对比数据,可据此判断专用小模型在漏洞挖掘上的性价比。
OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全技术栈。
推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可据此了解其在编码、科学与网络安全上的能力方向。
OpenAI 推出新的 Daybreak 工具集,包括 Codex Security 和 GPT-5.5-Cyber,帮助各类组织大规模发现、验证并修补漏洞。
推荐理由:OpenAI 官方发布 Daybreak 安全工具集,读者可了解其面向漏洞发现与修复的产品定位。
智谱发布旗舰模型 GLM-5.2,主打长程任务能力,首次在 1M token 上下文下稳定支撑长程工作,并采用 MIT 开源许可。
推荐理由:GLM-5.2 把 1M 上下文与编码智能体能力结合,并给出与闭源前沿模型的基准对比,可据此判断开源模型在长程任务上的位置。
Mistral 宣布将 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖工作与编码场景,原有对话、设置和订阅方案全部保留。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此判断工作与编码两类长任务如何被同一入口承接。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,并支撑 Vibe 的云端远程编码智能体与 Le Chat 的 Work 模式预览。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管编码智能体的可行边界。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量的取舍是否成立。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果,覆盖数学、量子物理、基因组、电网与 AI 基础设施等领域。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、TPU 与量子模拟,可据此判断编码智能体的跨领域迁移边界。
OpenAI 的 GPT 模型、Codex 和 Managed Agents 现已在 AWS 上可用,企业可在自己的 AWS 环境中构建安全的 AI 应用。
推荐理由:OpenAI 把 GPT 模型、Codex 与 Managed Agents 接入 AWS,读者可据此判断企业现有云环境能否直接落地。