跳到正文

技术方向

AI 编码 最新动态

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

108 条精选近 30 天 11 条共收录 226 条

更新

精选归档 · 第 5 页

5月22日周四第 81–100 条
5月21日周三
  1. Mistral AI71

    Mistral AI 发布智能体编码模型 Devstral

    Mistral AI 与 All Hands AI 合作发布智能体 LLM Devstral,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SOTA 高出 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。

5月16日周五
  1. OpenAI News65

    OpenAI 发布 o3 与 o4-mini 系统卡补充说明:Codex

    OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。

    推荐理由:官方系统卡补充说明 Codex 由 o3 衍生模型 codex-1 驱动,可了解其训练方式与编码定位。

5月7日周三
4月14日周一
  1. OpenAI News80

    OpenAI 在 API 中发布 GPT-4.1 系列模型

    OpenAI 在 API 中发布 GPT-4.1 系列模型,官方称其在编码、指令遵循和长上下文理解上有全面提升,并首次推出 nano 模型。该系列即日起面向全球开发者开放。

    推荐理由:OpenAI 在 API 上线 GPT-4.1 系列并首次推出 nano 版本,读者可据此了解模型家族的新分层与编码、长上下文能力提升。

3月27日周四
3月12日周三
  1. Hugging Face Blog62

    Open R1 更新第三期:发布 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型

    Hugging Face 的 Open R1 项目发布第三期更新,公开了约 10 万条由 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集、基于 2024 国际信息学奥林匹克(IOI)的 IOI 基准,以及微调 Qwen2.5 Coder Instruct 7B 和 32B 得到的 OlympicCoder-7B 与 OlympicCoder-32B。

    推荐理由:Open R1 复现计划公开了数据集、基准与 7B/32B 模型,并给出五条蒸馏训练经验,可迁移到自建推理模型。

2月24日周一
  1. Anthropic News88

    Anthropic 发布 Claude 3.7 Sonnet 与 Claude Code

    Anthropic 发布 Claude 3.7 Sonnet,称其为市场上首个混合推理模型,可在标准回答与可见的扩展思考模式间切换,API 用户还能限制思考的 token 预算,上限为 128K。

    推荐理由:Anthropic 官方给出混合推理模式的定价与开放范围,读者可据此判断推理预算控制在实际编码工作流中的取舍。

2月7日周五
1月13日周一
  1. Mistral AI62

    Mistral AI 发布 Codestral 25.01 代码模型

    Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。

    推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文及多项 FIM 基准对比,可据此判断其在代码补全场景的位置。

12月19日周四
  1. Hugging Face Blog73

    Answer.AI 与 LightOn 发布 ModernBERT,替代 BERT 的编码器模型

    Answer.AI 与 LightOn 发布 ModernBERT,一个仅编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个版本,支持 8192 token 上下文,可作 BERT 类模型的直接替换。

    推荐理由:ModernBERT 以 8k 上下文和更快推理替换 BERT 类编码器,读者可据此判断 RAG 与代码检索的升级空间。

10月29日周二
  1. Anthropic News62

    Claude 3.5 Sonnet 上线 GitHub Copilot

    Anthropic 宣布新版 Claude 3.5 Sonnet 开始在 GitHub Copilot 上滚动推出,开发者可在 Visual Studio Code 和 GitHub.com 中选择该模型写代码,面向 GitHub 超过 1 亿开发者。

    推荐理由:Anthropic 官方说明 Claude 3.5 Sonnet 接入 GitHub Copilot 的可用范围与编码场景,可据此判断开发者何时能用上。

8月13日周二
  1. OpenAI News60

    OpenAI 发布 SWE-bench Verified

    OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,用于更可靠地评估 AI 模型解决真实软件问题的能力。

    推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,可用于更可靠地比较模型解决真实软件问题的能力。

7月16日周二
  1. Mistral AI72

    Mistral 发布 Codestral Mamba 代码模型

    Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,官方在最高 256k tokens 的上下文检索能力上做了测试。

    推荐理由:Mistral 官方发布 Mamba 架构代码模型,给出参数量、上下文测试长度与部署方式,可对比 Transformer 路线的取舍。

6月21日周五
  1. Anthropic News88

    Anthropic 发布 Claude 3.5 Sonnet 并推出 Artifacts 功能

    Anthropic 发布 Claude 3.5 Sonnet,这是 Claude 3.5 模型家族的首个版本,在 GPQA、MMLU、HumanEval 等评测上超过 Claude 3 Opus,速度约为 Opus 的两倍,定价为每百万输入 token 3 美元、每百万输出 token 15 美元,上下文窗口 200K token。

    推荐理由:官方给出 Claude 3.5 Sonnet 的定价、上下文窗口与智能体编码评测数据,可据此判断其相对 Claude 3 Opus 的速度与成本取舍。

5月29日周三
  1. Mistral AI71

    Mistral 发布首款代码模型 Codestral

    Mistral 发布首款代码模型 Codestral,22B 开放权重,支持 80+ 编程语言,上下文窗口 32k,采用 fill-in-the-middle 机制补全代码和写测试。

    推荐理由:Mistral 首款代码模型给出 22B 参数、32k 上下文与 80+ 语言支持,并附免费 API 与主流 IDE 集成入口。

4月29日周一
4月17日周三
  1. Mistral AI82

    Mistral 发布开源模型 Mixtral 8x22B

    Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅 39B 激活参数,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。

    推荐理由:Mixtral 8x22B 以 39B 激活参数和 Apache 2.0 许可发布,读者可据此判断开源模型的性能与成本取舍。

4月9日周二
  1. Hugging Face Blog62

    Google 发布 CodeGemma 代码模型系列,含 2B 与 7B 三个版本

    Google 发布 CodeGemma 代码专用模型系列,基于预训练的 2B 和 7B Gemma checkpoint 继续训练 5000 亿 token,包含 2B 基座、7B 基座和 7B instruct 三个开源版本,上下文均为 8K token。

    推荐理由:CodeGemma 三个规格的定位、基准对比和 FIM 提示格式都写清了,可据此判断它适合哪类代码补全场景。

2月26日周一
  1. Mistral AI82

    Mistral AI 发布旗舰模型 Mistral Large 与 Mistral Small

    Mistral AI 发布旗舰文本生成模型 Mistral Large,通过 la Plateforme 和 Azure 提供,官方称其推理能力达到顶级水平,是 API 可用的全球第二强模型(仅次于 GPT-4)。

    推荐理由:官方给出 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其旗舰定位与多语言、函数调用能力。