跳到正文
9月12日周四
8月14日周三
8月12日周一
  1. Hugging Face Blog62

    TII 发布 Falcon Mamba:首个强性能无注意力 7B 模型

    阿布扎比 TII 发布 Falcon Mamba 7B,称其为首个大规模通用纯 Mamba 模型,采用开放许可并已上线 Hugging Face 生态。该模型基于原始 Mamba 架构并加入额外 RMS 归一化层以稳定大规模训练,用约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,单张 A10 24GB GPU 即可运行。

    推荐理由:TII 发布首个大规模纯 Mamba 架构 7B 模型,并给出与同规模 Transformer 的基准和长序列内存对比。

7月23日周二
  1. Hugging Face Blog88

    Meta 发布 Llama 3.1:8B、70B 与 405B,支持多语言和长上下文

    Meta 发布 Llama 3.1 系列开源模型,包含 8B、70B、405B 三种规模,各有基础版和指令微调版,上下文长度从 8K 提升到 128K token,支持英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语 8 种语言。

    推荐理由:Meta 发布 Llama 3.1 三档开源模型,128K 上下文与工具调用能力配合更宽松的许可证,读者可据此判断开源模型在合成数据与蒸馏上的可用边界。

7月16日周二
  1. Mistral AI72

    Mistral 发布 Codestral Mamba 代码模型

    Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,官方在最高 256k tokens 的上下文检索能力上做了测试。

    推荐理由:Mistral 官方发布 Mamba 架构代码模型,给出参数量、上下文测试长度与部署方式,可对比 Transformer 路线的取舍。

7月11日周四
  1. Hugging Face Blog60

    NuminaMath 如何赢得首届 AIMO 进步奖

    Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 两阶段微调,先做 CoT 数据训练,再用 GPT-4 生成的约 6 万个工具集成推理样本训练模型调用 Python REPL。

    推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛或微调任务。

7月3日周三
6月4日周二
5月21日周二
4月30日周二
4月23日周二
4月18日周四
4月17日周三
  1. Mistral AI82

    Mistral 发布开源模型 Mixtral 8x22B

    Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅 39B 激活参数,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。

    推荐理由:Mixtral 8x22B 以 39B 激活参数和 Apache 2.0 许可发布,读者可据此判断开源模型的性能与成本取舍。

2月29日周四
2月26日周一
  1. Mistral AI82

    Mistral AI 发布旗舰模型 Mistral Large 与 Mistral Small

    Mistral AI 发布旗舰文本生成模型 Mistral Large,通过 la Plateforme 和 Azure 提供,官方称其推理能力达到顶级水平,是 API 可用的全球第二强模型(仅次于 GPT-4)。

    推荐理由:官方给出 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其旗舰定位与多语言、函数调用能力。

2月2日周五
1月30日周二
12月20日周三
  1. Hugging Face Blog62

    用投机解码让 Whisper 推理提速 2 倍

    Hugging Face 博客介绍如何用投机解码将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。在 LibriSpeech 基准上,Whisper large-v2 的 73 个样本推理时间从 73 秒降至 33 秒,WER 保持 3.5%;荷兰语 VoxPopuli 上从 117 秒降至 62 秒,WER 保持 12.8%。

    推荐理由:原文给出可复用的投机解码实现与基准数据,读者可据此在现有 Whisper 流程中获得约 2 倍加速。

12月11日周一
  1. Hugging Face Blog52

    Hugging Face 详解混合专家模型 MoE

    Hugging Face 发布《Mixture of Experts Explained》长文,系统讲解 MoE 的构成、训练方式与推理权衡。文章指出 MoE 用稀疏层加门控网络替代部分 FFN 层,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 稠密参数。

12月5日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Optimum-NVIDIA,一行代码加速 LLM 推理

    Hugging Face 发布 Optimum-NVIDIA 推理库,只需将 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒,首 token 延迟最高降低 3.3 倍。

    推荐理由:Hugging Face 与 NVIDIA 联合推出的推理库,用一行代码替换即可获得最高 28 倍吞吐提升,适合关注 LLM 部署成本的读者。

11月7日周二
9月27日周三
  1. Mistral AI78

    Mistral AI 发布 7.3B 参数开源模型 Mistral 7B

    Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在所有基准上超过 Llama 2 13B,并在多项基准上超过 Llama 1 34B,采用 Apache 2.0 许可可无限制使用。

    推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并采用 Apache 2.0 开源,读者可据此判断小模型的能力边界与部署成本。

9月15日周五
8月30日周三
8月2日周三
7月4日周二
6月16日周五
6月5日周一
5月31日周三
  1. OpenAI News65

    OpenAI 用过程监督提升数学推理能力

    OpenAI 训练了一个模型,通过奖励每一步正确的推理过程(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督不仅提升了性能,还带来对齐收益:直接训练模型产出被人类认可的思维链。

    推荐理由:OpenAI 用过程监督替代结果监督训练数学推理模型,读者可了解这一训练思路及其对齐收益。

5月16日周二
5月15日周一
5月11日周四
  1. Hugging Face Blog62

    Hugging Face 提出辅助生成解码方法,可将文本生成延迟降低最多 10 倍

    Hugging Face 发布辅助生成(assisted generation)解码方法,通过小模型生成候选 token、大模型一次前向验证,在消费级硬件上最多降低 10 倍延迟。

    推荐理由:Hugging Face 官方详解辅助生成解码原理与 Transformers 用法,读者可据此判断低延迟文本生成的可行路径。

3月28日周二
3月10日周五