跳到正文
4月24日周五
  1. Hugging Face Blog87

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。

    推荐理由:原文给出 V4 在长上下文推理成本与智能体后训练上的具体设计,可据此判断开源模型做长任务智能体的可行性。

2月3日周二
  1. Hugging Face Blog38

    从 DeepSeek 到 AI+:全球开源 AI 生态的未来走向

    Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构近期的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k,远超 Llama 的 27k 和 DeepSeek 的 6k;腾讯自 2025 年 5 月起以混元品牌加速开源视觉、视频与 3D 模型,百度则通过 Ernie 4.5 系列和 PaddlePaddle 重返开源生态。

1月27日周二
1月20日周二
10月29日周三
  1. Hugging Face Blog66

    Hugging Face 分析全球算力格局变化:中国开源模型与国产芯片的相互牵引

    Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,算力稀缺也促使 DeepSeek 的 MLA、GRPO 等效率创新走向开源,并推动 CUDA 之外的软件生态成形。

    推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,可看到算力受限如何反过来塑造模型架构与部署生态。

7月17日周四
  1. Hugging Face Blog40

    Hugging Face 推出 FutureBench:评估 AI 智能体预测未来事件的能力

    Hugging Face 发布 FutureBench,用真实预测市场与新闻生成任务,评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周约产出 5 个新闻类问题,另从 Polymarket 每周引入约 8 个问题。其设计使数据污染不可能发生,结果可随时间客观验证。

3月27日周四
3月12日周三
  1. Hugging Face Blog62

    Open R1 更新第三期:发布 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 模型

    Hugging Face 的 Open R1 项目发布第三期更新,公开了约 10 万条由 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集、基于 2024 国际信息学奥林匹克(IOI)的 IOI 基准,以及微调 Qwen2.5 Coder Instruct 7B 和 32B 得到的 OlympicCoder-7B 与 OlympicCoder-32B。

    推荐理由:Open R1 复现计划公开了数据集、基准与 7B/32B 模型,并给出五条蒸馏训练经验,可迁移到自建推理模型。

2月11日周二
  1. Hugging Face Blog72

    Open R1 项目发布 OpenR1-Math-220k 数学推理数据集

    Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个解答,经 Math Verify 与 Llama3.3-70B-Instruct 双重过滤后保留 22 万道有正确推理轨迹的题目。

    推荐理由:Open R1 项目公开了 22 万条数学推理数据集的构建流程与蒸馏对比结果,可了解复现 R1 训练管线的具体做法。

2月2日周日
  1. Hugging Face Blog66

    Open-R1 更新:复现 DeepSeek-R1 评测与训练管线进展

    Hugging Face 的 Open-R1 项目发布首周进展,在 MATH-500 上复现了 DeepSeek-R1 蒸馏系列模型的评测分数,例如 DeepSeek-R1-Distill-Qwen-32B 得 95.0、DeepSeek-R1-Distill-Llama-70B 得 93.4。

    推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的 MATH-500 评测分数,并公开了合成数据生成与 GRPO 训练的工程细节。

1月31日周五
1月30日周四
1月28日周二
11月20日周三
  1. Hugging Face Blog40

    BAAI 推出 FlagEval Debate:首个多语言 LLM 辩论竞赛平台

    BAAI 推出 FlagEval Debate 平台,让大模型以辩论形式正面对抗,目前支持中文、英文、阿拉伯文和韩文四种语言。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义参数功能,以解决静态评测和 Chatbot Arena 类平台缺乏区分度、模型孤立生成及投票偏差等问题。2024 年 Q3 的实验显示,当前多数模型已具备参与辩论的能力。

10月3日周四
  1. Hugging Face Blog30

    中国 AI 出海全球扩张简析

    非凡研究 6 月报告显示,全球 1500 家活跃 AI 公司中 751 家位于中国,其中 103 家已出海扩张。腾讯云、华为、阿里等巨头聚焦东南亚与中东的云和 AI 基础设施,字节跳动七个月内推出 11 款海外应用,CapCut 月活超 3 亿、累计移动端收入达 1.25 亿美元。