AI 正在改变开发者工作方式,GitHub 给出三项值得强化的技能
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
Chatham Financial 借助 Codex 和 GPT-5.6 构建技术并重构工作流,将交易验证时间从 30 分钟缩短到 4 分钟以内。该机构借此扩展其资本市场专业能力。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和日常专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,单任务成本约为后者的五分之一,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。
推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与成本对比,读者可据此判断智能体编码任务的性价比变化。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成代码仍需阅读和负责,但审查力度应随风险变化;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准;RAG 并未死亡,检索能让模型更接近答案并减少 token 消耗。节目还讨论了企业招聘中的 AI 使用判断力,以及微调需求可能反映代码库可维护性问题。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行并预览 AI 智能体生成的代码改动。diff 面板以绿色和红色高亮显示新增与删除行,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令,浏览器面板则通过 Pick & Polish 工具选中页面元素并让智能体调整。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并派出上百个智能体补文档,再以规划、编码、测试、审查加人工检查点的结构化流程逐模块迁移。Mistral 总结出三条经验:先建对齐测试再写迁移代码、先整理文档再交给智能体、结构化工作流加人工审查优于完全自主。
GitHub 发布研究预览版 Project HydraFusion,通过运行时编排在多个提供商的模型间选择,自动完成起草、评审、修订或升级到更强模型。它目前提供 Single、Cascade、Critique 三种执行模式,已在所有 GitHub Copilot 套餐中通过 Copilot CLI 的 /experimental 开放,按各模型标准费率计费。
推荐理由:GitHub 官方披露 HydraFusion 的三种编排模式与三套基准的成本质量对比,可据此判断多模型编排在编码任务上的取舍。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,前者面向长时程编码与自主智能体,后者面向漏洞发现与自动修补。
推荐理由:官方给出两款 Flash 变体的基准、定价与开放渠道,可据此判断长时程编码与安全场景的选型取舍。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出与 3.6 Flash 的多项基准对比和半价定价,可据此判断编码与智能体场景的成本收益。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber 三款新模型。
推荐理由:官方给出三款新模型的定价、token 效率与多项基准对比,可据此判断智能体工作流的成本与选型。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的对比数据,可据此判断专用小模型在漏洞挖掘上的性价比。
Hugging Face 发布 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间的跨框架迁移能力,包含 34 个应用、102 个框架实现、204 个迁移任务和 1,331 个专家测试。
智谱发布旗舰模型 GLM-5.2,主打长程任务能力,首次在 1M token 上下文下稳定支撑长程工作,并采用 MIT 开源许可。
推荐理由:GLM-5.2 把 1M 上下文与编码智能体能力结合,并给出与闭源前沿模型的基准对比,可据此判断开源模型在长程任务上的位置。
OpenAI 为 Codex 推出新插件、站点(sites)和标注(annotations)功能,面向分析师、营销人员、设计师、投资者等团队,帮助其用 AI 完成更多工作。原文未披露具体版本号、参数规模或可用性细节。
Braintrust 工程师借助 Codex 与 GPT-5.5 加快实验与编码速度,将客户需求直接转化为代码。
Mistral 宣布将 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖工作与编码场景,原有对话、设置和订阅方案全部保留。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此判断工作与编码两类长任务如何被同一入口承接。
Endava 借助 Codex 构建智能体组织,将需求分析周期从数周缩短至数小时,并加速软件交付。该案例展示了 Codex 在企业级软件工程流程中的落地方式。
Cisco 与 OpenAI 正用 Codex 重塑企业工程,帮助 Cisco 规模化 AI 原生开发、加速 AI Defense 工作并自动化缺陷修复。
OpenAI、Thrive 和 Crete 用 Codex 构建了一个可自我改进的税务智能体,用于自动完成报税、提升准确性并加速工作流。该方案展示了 Codex 在税务申报自动化场景中的落地方式。
Warp 正基于 GPT-5.5 及 OpenAI 模型,在本地、云端和开源开发流程中协调多个编码智能体。该工具将 GPT-5.5 用于跨环境的编码智能体调度,以支持开源协作开发。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,并支撑 Vibe 的云端远程编码智能体与 Le Chat 的 Work 模式预览。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管编码智能体的可行边界。
OpenAI 在 2026 年 Gartner 企业级 AI 编程智能体魔力象限中被评为领导者,旗下 Codex 因创新能力和企业级规模部署获得认可。
Virgin Atlantic 借助 Codex 在固定的假日出行截止期限前完成移动应用改版,实现接近全覆盖的单元测试和零 P1 缺陷。
Ramp 工程师借助 Codex 与 GPT-5.5 进行代码审查并推进改进,将实质性反馈的获取时间从数小时缩短至数分钟。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量的取舍是否成立。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果,覆盖数学、量子物理、基因组、电网与 AI 基础设施等领域。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、TPU 与量子模拟,可据此判断编码智能体的跨领域迁移边界。
OpenAI 的 GPT 模型、Codex 和 Managed Agents 现已在 AWS 上可用,企业可在自己的 AWS 环境中构建安全的 AI 应用。
推荐理由:OpenAI 把 GPT 模型、Codex 与 Managed Agents 接入 AWS,读者可据此判断企业现有云环境能否直接落地。
OpenAI 发布开源规范 Symphony,用于 Codex 编排,可把 issue tracker 变成常驻的智能体系统。该规范旨在提升工程产出并减少上下文切换。
OpenAI 推出 Codex Labs,并与埃森哲、普华永道、Infosys 等合作,帮助企业在软件开发全生命周期中部署和扩展 Codex。OpenAI 同时公布 Codex 周活跃用户达到 400 万。
推荐理由:OpenAI 公布 Codex 周活 400 万并联合埃森哲、普华永道等推企业落地服务,可观察编码智能体的企业采用路径。
OpenAI 更新 macOS 和 Windows 版 Codex 应用,新增电脑操作、应用内浏览、图像生成、记忆和插件功能,用于加速开发者工作流。
推荐理由:原文列出 Codex 桌面端新增的电脑操作、应用内浏览、图像生成、记忆与插件,读者可据此判断开发工作流的变化。
OpenAI 为 ChatGPT Business 和 Enterprise 版 Codex 新增按量付费(pay-as-you-go)定价,让团队能以更灵活的方式起步并扩展使用规模。
Mistral AI 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可。
推荐理由:Mistral Small 4 把推理、多模态与编码智能体能力合并进单一开源模型,并给出可配置推理强度与部署门槛。
Mistral 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。
推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出了与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。
Mistral 基于其开源编码助手 Vibe 构建了一个自动生成和改进 Rails RSpec 测试的智能体,可在 CI/CD 中无人干预运行。
推荐理由:Mistral 公开了用 Vibe 构建 Rails 测试智能体的完整方法,包括 AGENTS.md 规划、分文件类型技能和自定义工具,可迁移到其他代码库。
OpenAI 宣布不再使用 SWE-bench Verified 评测,理由是这一基准正日益受到污染,无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷和训练数据泄漏问题,并建议改用 SWE-bench Pro。
推荐理由:OpenAI 说明 SWE-bench Verified 存在污染与测试缺陷,并给出替代基准建议,可供关注编码评测的人参考。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15 倍,支持 128k 上下文。该模型目前面向 ChatGPT Pro 用户开放研究预览。
推荐理由:OpenAI 发布首个实时编码模型,给出 15 倍生成速度与 128k 上下文,可据此判断实时编码场景的可用性。
OpenAI 技术人员 Ryan Lopopolo 提出 harness engineering,探讨在智能体优先的世界中如何利用 Codex。文章聚焦于围绕 AI 智能体构建工程实践,而非单纯依赖模型本身的能力。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生智能体,将前沿编码能力与通用推理结合,面向长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生智能体模型,读者可据此了解其在编码与通用推理上的定位。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型将 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理及专业知识能力结合在一起。
推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。