跳到正文

技术方向

开源生态 最新动态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

317 条精选近 30 天 15 条共收录 784 条

更新

精选归档 · 第 9 页

5月21日周三第 161–180 条
  1. Mistral AI71

    Mistral AI 发布智能体编码模型 Devstral

    Mistral AI 与 All Hands AI 合作发布智能体 LLM Devstral,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SOTA 高出 6 个百分点以上,并以 Apache 2.0 许可开源。

    推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。

5月15日周四
  1. Hugging Face Blog62

    Hugging Face 将 Transformers 定位为跨框架模型定义标准

    Hugging Face 在博客中表示,未来目标是让 Transformers 成为各框架之间的模型定义中枢,模型架构只要被 Transformers 支持,就能在生态其他工具中获得支持。

    推荐理由:Hugging Face 官方说明 Transformers 将作为跨框架模型定义中枢,读者可据此理解模型接入与部署链路的变化。

4月26日周六
  1. Hugging Face Blog62

    ServiceNow 开源 PipelineRL:用 inflight 权重更新兼顾推理吞吐与 on-policy 训练

    ServiceNow 开源实验性 RL 实现 PipelineRL,核心是在 RL 训练中做 inflight 权重更新,推理不中断即可接收新权重,从而维持高推理吞吐并减少 rollout 权重与最新模型权重之间的滞后。

    推荐理由:原文给出开源仓库与训练契约设计,读者可据此判断大规模 RL 训练中吞吐与 on-policy 数据如何兼顾。

4月25日周五
4月14日周一
4月5日周六
  1. Hugging Face Blog88

    Meta 发布 Llama 4 Maverick 与 Scout,上线 Hugging Face

    Meta 发布 Llama 4 Maverick(约 400B 总参数)和 Llama 4 Scout(约 109B 总参数)两款原生多模态 MoE 模型,均为 17B 激活参数,权重已上线 Hugging Face 的 meta-llama 组织。

    推荐理由:Meta 发布 Llama 4 两款 MoE 多模态模型,Hugging Face 同步给出架构细节与部署方式,便于判断长上下文与端侧部署取舍。

3月27日周四
3月18日周二
  1. Hugging Face Blog66

    NVIDIA 在 GTC 2025 发布 Cosmos Transfer、Physical AI Dataset 与 Isaac GR00T N1

    NVIDIA 在 GTC 2025 上发布三款面向物理 AI 的开源成果:世界基础模型 Cosmos Transfer、Physical AI Dataset 以及人形机器人基础模型 NVIDIA Isaac GR00T N1。

    推荐理由:NVIDIA 在 GTC 2025 一次性开源世界模型、数据集与人形机器人基础模型,读者可据此了解物理 AI 开发可用的工具链。

  2. Hugging Face Blog62

    Hugging Face 将 Xet 存储上线 Hub,首批仓库完成迁移

    Hugging Face 的 Xet 团队已将首批模型和数据集仓库从 LFS 迁移到 Xet 存储,迁移量约 4.5 TB,占 Hub 下载流量约 6%。Xet 采用内容定义分块(约 64KB)做字节级去重,改动小部分数据时只上传变化的块,官方举例称一个约 5 GB 的 SQLite 数据库追加 1 MB 数据,上传耗时从 LFS 下的 13 分钟降到 0.1 秒。

    推荐理由:Hugging Face 官方复盘 Xet 存储首次迁移,给出块级去重带来的传输收益与迁移中暴露的工程问题。

3月17日周一
  1. Mistral AI71

    Mistral 发布 Mistral Small 3.1,支持 128k 上下文与多模态理解

    Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,采用 Apache 2.0 许可。

    推荐理由:Mistral 官方给出小模型在文本、多模态与长上下文上的对比数据,可据此判断端侧部署的选型空间。

3月12日周三
  1. Hugging Face Blog82

    Google 发布 Gemma 3 开源多模态模型,覆盖 1B 至 27B 四种尺寸

    Google 发布 Gemma 3 系列开放权重模型,包含 1B、4B、12B、27B 四种尺寸,均有预训练和指令微调版本。4B、12B、27B 支持图像与文本输入及 140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k(1B 为 32k)。

    推荐理由:梳理 Gemma 3 的四种尺寸、多模态与 128k 上下文等规格,并给出 transformers 与端侧推理的可用路径。

  2. Hugging Face Blog62

    Open R1 更新第三期:发布 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型

    Hugging Face 的 Open R1 项目发布第三期更新,公开了约 10 万条由 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集、基于 2024 国际信息学奥林匹克(IOI)的 IOI 基准,以及微调 Qwen2.5 Coder Instruct 7B 和 32B 得到的 OlympicCoder-7B 与 OlympicCoder-32B。

    推荐理由:Open R1 复现计划公开了数据集、基准与 7B/32B 模型,并给出五条蒸馏训练经验,可迁移到自建推理模型。

3月11日周二
  1. Hugging Face Blog76

    Hugging Face 与 Yaak 发布 L2D 开源自动驾驶数据集

    Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,称其为全球最大的开源自动驾驶数据集,R4 版本包含 100 万条 episode、5000+ 小时驾驶数据、90+ TB 规模,来自德国 30 座城市 60 辆驾校车辆的 6 路环视摄像头与车辆状态数据。

    推荐理由:L2D 以 90TB 多模态驾驶数据接入 LeRobot 训练管线,可对比现有开源自驾数据集在规模与动作标注上的差异。

3月4日周二
2月25日周二
2月20日周四
2月14日周五
2月12日周三