跳到正文
6月7日周五
6月6日周四
5月29日周三
  1. Mistral AI62

    Mistral AI 发布非生产许可证 MNPL

    Mistral AI 推出非生产许可证 MNPL,允许开发者将自家技术用于非商业用途并支持研究工作,商业使用则需另循公平可持续的方式。Codestral 于同日在该许可证下发布,Mistral 表示仍会继续以 Apache 2.0 发布模型和代码,并逐步整合 Apache 2.0 与 MNPL 两条产品线。

    推荐理由:Mistral 推出非生产许可证,读者可据此理解开源模型厂商在开放与商业化之间的授权取舍。

5月24日周五
5月21日周二
5月14日周二
  1. Hugging Face Blog62

    Google 发布开源视觉语言模型 PaliGemma

    Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。

    推荐理由:Google 开源视觉语言模型 PaliGemma 的完整发布说明,含架构、三种 checkpoint 与微调路径,便于判断适用场景。

5月9日周四
5月5日周日
4月18日周四
4月16日周二
4月11日周四
  1. Hugging Face Blog62

    视觉语言模型解析:从原理、选型到用 TRL 微调

    Hugging Face 发布视觉语言模型入门文章,介绍其图像编码器、嵌入投影层与文本解码器的典型结构,并汇总 LLaVA 1.6、DeepSeek-VL、CogVLM、Qwen-VL 等开源模型的分辨率与能力差异。

    推荐理由:系统梳理视觉语言模型的组成、选型榜单与微调流程,并给出可直接运行的 transformers 与 TRL 代码示例。

4月10日周三
4月9日周二
  1. Hugging Face Blog62

    Google 发布 CodeGemma 代码模型系列,含 2B 与 7B 三个版本

    Google 发布 CodeGemma 代码专用模型系列,基于预训练的 2B 和 7B Gemma checkpoint 继续训练 5000 亿 token,包含 2B 基座、7B 基座和 7B instruct 三个开源版本,上下文均为 8K token。

    推荐理由:CodeGemma 三个规格的定位、基准对比和 FIM 提示格式都写清了,可据此判断它适合哪类代码补全场景。

4月4日周四
  1. Hugging Face Blog40

    Hugging Face 与 Wiz Research 合作提升 AI 安全

    Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台安全短板,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。

4月2日周二
3月22日周五
3月20日周三
3月4日周一
2月29日周四
2月27日周二
2月23日周五
2月21日周三
  1. Hugging Face Blog78

    Google 发布开源大模型 Gemma,Hugging Face 全面接入

    Google 发布开源大模型系列 Gemma,包含 2B 和 7B 两个尺寸,各有基础版和指令微调版,上下文长度 8K tokens,可运行在消费级硬件上。Hugging Face 宣布全面支持,提供 Transformers 集成、Google Cloud 与 Inference Endpoints 部署,以及用 TRL 在单卡上微调的示例。

    推荐理由:Google 开源 Gemma 系列并同步接入 Hugging Face 生态,读者可了解其规格、许可与部署路径。

2月20日周二
2月16日周五
  1. Hugging Face Blog60

    Hugging Face 教程:用开源 LLM 合成数据训练定制模型,成本降至 2.7 美元

    Hugging Face 发布教程,演示如何用开源 Mixtral-8x7B-Instruct-v0.1 为金融新闻情感分类生成合成数据,再通过 AutoTrain 蒸馏出约 0.13B 参数的 RoBERTa-base 模型。

    推荐理由:用开源 LLM 生成合成数据再蒸馏小模型,给出了成本、延迟与碳排放的完整对比,方法可直接迁移到其他分类任务。

2月14日周三
2月8日周四
1月25日周四
1月24日周三
12月11日周一
  1. Hugging Face Blog52

    Hugging Face 详解混合专家模型 MoE

    Hugging Face 发布《Mixture of Experts Explained》长文,系统讲解 MoE 的构成、训练方式与推理权衡。文章指出 MoE 用稀疏层加门控网络替代部分 FFN 层,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 稠密参数。

12月5日周二
12月1日周五
  1. Hugging Face Blog36

    Open LLM Leaderboard 深度解析 DROP 基准评分异常

    Hugging Face 对 Open LLM Leaderboard 新增的 DROP 基准进行深度排查,发现多数模型 f1-score 低于 10 分源于评测实现问题:数字后跟非空格空白字符时归一化失效,且以 . 作为停止符会截断浮点答案、让高质量模型因生成过长反而得分更低。改用 \n 作为停止符重新计算后,分数与模型整体表现的相关性明显改善。

11月7日周二
10月27日周五
10月4日周三
9月29日周五