OpenAI 发布 GPT-5.3-Codex
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生智能体,将前沿编码能力与通用推理结合,面向长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生智能体模型,读者可据此了解其在编码与通用推理上的定位。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生智能体,将前沿编码能力与通用推理结合,面向长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生智能体模型,读者可据此了解其在编码与通用推理上的定位。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型将 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理及专业知识能力结合在一起。
推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。
OpenAI 发布 macOS 版 Codex 应用,定位为 AI 编码与软件开发的指挥中心,支持多个智能体、并行工作流和长时间运行的任务。
推荐理由:OpenAI 官方发布 Codex 桌面应用,读者可了解其多智能体并行与长任务编排的定位。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式,CLI 修复持续自动更新。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能与定价变化,可据此判断终端编码智能体的能力边界与成本。
OpenAI 技术详解 Codex 智能体循环,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。
OpenAI 发布 GPT-5.2-Codex,称其为自家最先进的编码模型。该模型主打长程推理、大规模代码转换以及增强的网络安全能力。
推荐理由:OpenAI 官方发布新一代编码模型,读者可据此了解其在长程推理与大规模代码改写上的定位。
OpenAI 发布 GPT-5.2 系统卡增补文件,涉及 GPT-5.2-Codex。该页面正文未能抓取,目前仅可确认标题与发布来源。
OpenAI 借助 Codex 在 28 天内完成 Android 版 Sora 的交付。团队通过 AI 辅助的规划、翻译与并行编码工作流,实现了快速且可靠的开发。
Mistral 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,均开源,前者采用修改版 MIT 许可,后者采用 Apache 2.0。
推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。
JetBrains 正在将 GPT-5 集成到旗下编码工具中,帮助数百万开发者更快地设计、推理和构建软件。
OpenAI 发布 GPT-5.1-Codex-Max,一款面向 Codex 的更快、更智能的智能体编码模型。该模型针对长时间运行的项目级任务设计,强化了推理能力与 token 效率。
推荐理由:OpenAI 发布面向 Codex 的智能体编码模型,读者可据此了解其在长时项目任务上的定位与效率取向。
Google DeepMind 发布 Gemini 3,其中 Gemini 3 Pro 在各项主要 AI 基准上超过此前版本,编码能力也强于 2.5 Pro。
推荐理由:官方给出 Gemini 3 Pro 的基准成绩、API 定价与配套开发平台,便于开发者判断迁移成本。
Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。
推荐理由:Gemini 3 Pro 在多项基准上刷新成绩并同步接入搜索、Gemini 应用与开发者平台,可据此判断多模态与智能体能力的当前水位。
Google 发布智能体开发平台 Antigravity,即日起免费公开预览,提供 Gemini 3 Pro 的宽松速率限制。该平台在传统 AI IDE 之外新增以智能体为中心的 Manager 界面,可并行编排多个工作区中的智能体,并支持浏览器控制与异步交互。
推荐理由:Google 把 IDE 改造成以智能体为中心的开发平台,读者可据此判断异步编排与 Artifacts 验证会怎样改变编码工作流。
GPT-5.1 已在 API 中开放,带来更快的自适应推理、扩展的提示词缓存和改进的编码表现。同时新增 apply_patch 和 shell 两个工具。
推荐理由:GPT-5.1 进入 API,开发者可据此判断自适应推理、缓存与编码能力的升级幅度。
BigCode 项目发布 BigCodeArena,这是首个通过实际执行代码来评测代码生成模型的人类参与平台,用户可提交编程任务、对比两个模型的生成结果并运行代码后投票。
推荐理由:BigCodeArena 把代码执行结果引入人类投票评测,读者可据此了解代码模型评测为何需要运行而非只看源码。
OpenAI Codex 现已正式可用,面向开发者新增 Slack 集成、Codex SDK,以及用量看板和工作区管理等管理工具。官方称这些功能让 Codex 更易使用,也更容易在规模化场景下管理。
推荐理由:Codex 从预览走向正式可用,新增 Slack 集成、SDK 与管理后台,读者可据此判断团队规模化使用的门槛变化。
OpenAI 宣布升级 Codex,使其更快、更可靠,并增强实时协作和独立处理任务的能力。升级后的 Codex 可在终端、IDE、网页乃至手机等多种开发环境中使用。
推荐理由:Codex 在速度、可靠性和实时协作上的升级,覆盖终端、IDE、网页和手机多个开发入口。
OpenAI 在 GPT-5 系统卡增补中发布新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。该模型会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。
推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的新模型,读者可了解其动态调整思考投入的机制。
OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。
推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。
OpenAI 发布文章介绍 GPT-5 在编码与设计上的新可能,但 feed 仅提供摘要,未给出具体功能、示例或数据。
OpenAI 发文介绍 Cursor 如何使用 GPT-5。原文未披露具体功能细节、参数或性能数据。
OpenAI 发布 GPT-5,称其为迄今最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。官方称 GPT-5 在编码、数学、写作、健康、视觉感知等方面达到 SOTA 表现。
推荐理由:OpenAI 官方发布 GPT-5,给出其在编码、数学、写作、健康与视觉感知上的能力定位。
Hugging Face 推出 3LM(علم),一个评估阿拉伯语 LLM 在 STEM 与代码生成任务上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成高难度选择题,以及翻译自 HumanEval+ 和 MBPP+ 的阿拉伯语代码基准。
Mistral AI 发布 Codestral 25.08 代码模型,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。Codestral 25.08 相比前代补全接受率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,支持云、VPC 与本地部署。
推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1,两款模型均强调对不同提示词和智能体框架的泛化能力。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量与气隙本地 GPU 部署,代码留在企业边界内。
推荐理由:官方给出企业级编码助手的模型组合、部署形态与首批客户,可据此判断私有化编码方案的落地路径。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
推荐理由:官方给出代码嵌入模型在检索基准上的对比与按维度裁剪的存储成本权衡,可据此评估代码 RAG 的选型。
CodeRabbit 采用 OpenAI 的 o3、o4-mini 和 GPT-4.1 模型改造代码审查流程,提升审查准确率并加快 PR 合并速度。该方案帮助开发者更快交付代码,减少 bug 并提高投资回报率。
Mistral AI 与 All Hands AI 合作发布智能体 LLM Devstral,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SOTA 高出 6 个百分点以上,并以 Apache 2.0 许可开源。
推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。
OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。
推荐理由:官方系统卡补充说明 Codex 由 o3 衍生模型 codex-1 驱动,可了解其训练方式与编码定位。
Mistral AI 发布 Mistral Medium 3,称其在基准测试中达到 Claude Sonnet 3.7 九成以上水平,定价为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价与对标基准,读者可据此判断企业级模型的成本与部署门槛。
OpenAI 在 API 中发布 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解上有全面提升,并首次推出 nano 模型。该系列即日起面向全球开发者开放。
推荐理由:OpenAI 在 API 上线 GPT-4.1 系列并首次推出 nano 版本,读者可据此了解模型家族的新分层与编码、长上下文能力提升。
DeepSeek-V3-0324 本周上线 Hugging Face Hub,架构与初代 DeepSeek-V3 相同,但许可从自定义协议改为 MIT,改进重点是指令遵循、代码与数学能力。
推荐理由:DeepSeek-V3-0324 的基准提升与 MIT 许可变化,能帮读者判断开源基座模型的迭代节奏。
Hugging Face 发布教程,介绍如何在本地通过 LM Studio 运行 OlympicCoder 7B 的 4bit GGUF 量化版,并接入 VS Code 的 Continue 扩展实现代码补全、生成、解释、重构和写测试。
Hugging Face 的 Open R1 项目发布第三期更新,公开了约 10 万条由 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集、基于 2024 国际信息学奥林匹克(IOI)的 IOI 基准,以及微调 Qwen2.5 Coder Instruct 7B 和 32B 得到的 OlympicCoder-7B 与 OlympicCoder-32B。
推荐理由:Open R1 复现计划公开了数据集、基准与 7B/32B 模型,并给出五条蒸馏训练经验,可迁移到自建推理模型。
OpenAI 发布 SWE-Lancer 基准,用于测试前沿 LLM 能否完成价值 100 万美元的真实自由职业软件工程任务。该基准以真实外包项目为题目,考察模型在实战软件工程中的能力与变现潜力。
Mistral 发布全新 le Chat AI 助手,同步上线 iOS 和 Android,并推出 Pro 与 Team 订阅层级,Enterprise 版进入私有预览。
推荐理由:官方一次性给出 le Chat 的移动端、Pro/Team 定价与企业私有预览,可据此判断 Mistral 在消费级助手上的产品布局。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文及多项 FIM 基准对比,可据此判断其在代码补全场景的位置。
Answer.AI 与 LightOn 发布 ModernBERT,一个仅编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个版本,支持 8192 token 上下文,可作 BERT 类模型的直接替换。
推荐理由:ModernBERT 以 8k 上下文和更快推理替换 BERT 类编码器,读者可据此判断 RAG 与代码检索的升级空间。