跳到正文
6月27日周四
  1. Hugging Face Blog78

    Google 发布开源模型 Gemma 2,含 9B 与 27B 两个版本

    Google 发布开源大模型 Gemma 2,提供 9B 和 27B 两个参数规模,各有预训练基础版与指令微调版,上下文长度 8K tokens,采用与初代相同的宽松许可,允许再分发、微调和商用。

    推荐理由:原文给出 Gemma 2 的两种参数规模、训练数据量与评测对比,可据此判断开源小模型的能力位置。

6月25日周二
  1. Hugging Face Blog22

    XLSCOUT 推出 ParaEmbed 2.0:面向专利与 IP 的嵌入模型,获 Hugging Face 专家支持

    XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于 Hugging Face 专家支持计划合作,在多领域专利数据上微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。该模型用于专利撰写、无效检索和新颖性比对,借助 Hugging Face Inference Endpoints 与 TEI,嵌入吞吐从约 300 个/秒提升至约 2700 个/秒。

5月29日周三
  1. Mistral AI71

    Mistral 发布首款代码模型 Codestral

    Mistral 发布首款代码模型 Codestral,22B 开放权重,支持 80+ 编程语言,上下文窗口 32k,采用 fill-in-the-middle 机制补全代码和写测试。

    推荐理由:Mistral 首款代码模型给出 22B 参数、32k 上下文与 80+ 语言支持,并附免费 API 与主流 IDE 集成入口。

5月24日周五
5月14日周二
  1. Hugging Face Blog62

    Google 发布开源视觉语言模型 PaliGemma

    Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。

    推荐理由:Google 开源视觉语言模型 PaliGemma 的完整发布说明,含架构、三种 checkpoint 与微调路径,便于判断适用场景。

5月13日周一
  1. OpenAI News82

    OpenAI 发布新旗舰模型 GPT-4o

    OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间进行实时推理。

    推荐理由:OpenAI 官方发布新旗舰模型,读者可据此了解其在音频、视觉与文本上的实时推理定位。

4月29日周一
4月18日周四
4月17日周三
  1. Mistral AI82

    Mistral 发布开源模型 Mixtral 8x22B

    Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅 39B 激活参数,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。

    推荐理由:Mixtral 8x22B 以 39B 激活参数和 Apache 2.0 许可发布,读者可据此判断开源模型的性能与成本取舍。

4月15日周一
  1. Hugging Face Blog62

    Hugging Face 发布 8B 多模态模型 Idefics2

    Hugging Face 发布 Idefics2,一个 8B 参数、Apache 2.0 许可的多模态模型,可接受任意文本与图像序列输入并生成文本回复,支持图像问答、文档信息抽取和基础算术。

    推荐理由:8B 参数、Apache 2.0 许可并同步放出多模态指令微调数据集,读者可据此判断开源多模态的可用起点。

4月9日周二
  1. Hugging Face Blog62

    Google 发布 CodeGemma 代码模型系列,含 2B 与 7B 三个版本

    Google 发布 CodeGemma 代码专用模型系列,基于预训练的 2B 和 7B Gemma checkpoint 继续训练 5000 亿 token,包含 2B 基座、7B 基座和 7B instruct 三个开源版本,上下文均为 8K token。

    推荐理由:CodeGemma 三个规格的定位、基准对比和 FIM 提示格式都写清了,可据此判断它适合哪类代码补全场景。

3月29日周五
2月28日周三
  1. Hugging Face Blog74

    BigCode 发布 StarCoder2 系列代码模型与 The Stack v2 数据集

    BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,全部基于新的高质量代码数据集 The Stack v2 训练。

    推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型在参数规模与训练数据上的最新配置。

2月26日周一
  1. Mistral AI82

    Mistral AI 发布旗舰模型 Mistral Large 与 Mistral Small

    Mistral AI 发布旗舰文本生成模型 Mistral Large,通过 la Plateforme 和 Azure 提供,官方称其推理能力达到顶级水平,是 API 可用的全球第二强模型(仅次于 GPT-4)。

    推荐理由:官方给出 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其旗舰定位与多语言、函数调用能力。

2月21日周三
  1. Hugging Face Blog78

    Google 发布开源大模型 Gemma,Hugging Face 全面接入

    Google 发布开源大模型系列 Gemma,包含 2B 和 7B 两个尺寸,各有基础版和指令微调版,上下文长度 8K tokens,可运行在消费级硬件上。Hugging Face 宣布全面支持,提供 Transformers 集成、Google Cloud 与 Inference Endpoints 部署,以及用 TRL 在单卡上微调的示例。

    推荐理由:Google 开源 Gemma 系列并同步接入 Hugging Face 生态,读者可了解其规格、许可与部署路径。

1月4日周四
12月11日周一
11月6日周一
9月27日周三
  1. Mistral AI78

    Mistral AI 发布 7.3B 参数开源模型 Mistral 7B

    Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在所有基准上超过 Llama 2 13B,并在多项基准上超过 Llama 1 34B,采用 Apache 2.0 许可可无限制使用。

    推荐理由:Mistral 7B 以 7.3B 参数在多项基准上超过 Llama 2 13B,并采用 Apache 2.0 开源,读者可据此判断小模型的能力边界与部署成本。

9月13日周三
9月6日周三
  1. Hugging Face Blog78

    TII 的 Falcon 180B 上线 Hugging Face

    TII 发布 Falcon 180B 并上线 Hugging Face,模型有 1800 亿参数,在 3.5 万亿 token 的 RefinedWeb 数据上预训练,是当时最大的公开可用语言模型。

    推荐理由:原文给出 Falcon 180B 的参数量、训练数据与评测对比,可据此判断开源大模型当时的规模上限。

8月22日周二
  1. Hugging Face Blog75

    Hugging Face 发布 IDEFICS:Flamingo 的开源复现视觉语言模型

    Hugging Face 发布开源视觉语言模型 IDEFICS,基于 DeepMind 未公开的 Flamingo 复现,仅使用公开数据和模型(LLaMA v1 与 OpenCLIP),提供 9B 和 80B 两个参数规模,各有基础版和指令微调版。

    推荐理由:IDEFICS 用公开数据和模型复现了未开源的 Flamingo,读者可据此了解开源多模态模型当时的能力边界与训练数据构成。

8月1日周二
  1. Hugging Face Blog60

    Segmind 开源 SD-Small 与 SD-Tiny 知识蒸馏代码和权重

    Segmind 开源了压缩版 Stable Diffusion 模型 SD-Small 和 SD-Tiny 的权重与蒸馏训练代码,两者参数量分别比基础模型少 35% 和 55%,同时保持接近的图像保真度。

    推荐理由:Segmind 开源了 SD-Small 与 SD-Tiny 的蒸馏代码和权重,并给出参数量、加速比与使用方式,便于复现和二次微调。

7月18日周二
  1. Hugging Face Blog88

    Meta 发布 Llama 2,Hugging Face 全面接入

    Meta 发布开源大语言模型家族 Llama 2,包含 7B、13B、70B 三种规模的预训练与微调版本,采用允许商用的社区许可。Hugging Face 同步完成集成,提供模型卡、transformers 支持、Text Generation Inference 与 Inference Endpoints 部署,并给出用 PEFT 在单张 GPU 上微调 7B 版本的示例。

    推荐理由:Meta 开源 Llama 2 并同步接入 Hugging Face 生态,读者可了解其许可、规模与推理微调路径。

6月5日周一
5月4日周四
  1. Hugging Face Blog78

    BigCode 发布 StarCoder 代码大模型

    BigCode 发布 StarCoder 与 StarCoderBase 两个代码大模型,基于 GitHub 宽松许可数据训练,覆盖 80 多种编程语言,参数规模约 15B、训练 1 万亿 token。

    推荐理由:BigCode 公开了 StarCoder 的权重、训练数据与评测结果,读者可据此判断开源代码模型当时的能力水位。

3月14日周二
  1. OpenAI News92

    OpenAI 发布多模态大模型 GPT-4

    OpenAI 发布 GPT-4,称其为扩展深度学习的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本,在多项专业和学术基准上达到人类水平表现,但在许多真实场景中能力仍不及人类。

    推荐理由:OpenAI 官方公布 GPT-4 的模型定位与多模态输入能力,可据此了解其与人类基准表现的差距。

  2. OpenAI News93

    OpenAI 发布 GPT-4

    OpenAI 发布 GPT-4,官方介绍其可在创意与技术写作任务中与用户生成、编辑和迭代内容,例如作曲、写剧本或学习用户的写作风格。

    推荐理由:OpenAI 官方发布 GPT-4,读者可据此了解新模型在创意与技术写作上的生成、编辑和迭代能力。

3月6日周一
  1. Hugging Face Blog62

    Kakao Brain 与 Hugging Face 发布 ViT 和 ALIGN 模型及 COYO 数据集

    Kakao Brain 与 Hugging Face 联合发布开源图文数据集 COYO(7 亿图文对)以及基于该数据集训练的 ViT 和 ALIGN 视觉语言模型,这是 ALIGN 模型首次免费开源,也是 ViT 和 ALIGN 首次附带训练数据集发布。

    推荐理由:Kakao Brain 开源了首个可复现的 ALIGN 模型及配套 7 亿图文对数据集,读者可据此了解开放数据对视觉语言模型复现的意义。

12月16日周五
12月15日周四
  1. OpenAI News62

    OpenAI 发布新版嵌入向量模型

    OpenAI 宣布推出新的嵌入向量模型,称其在能力上显著更强、成本更低且更易使用。官方未在摘要中给出模型名称、版本号或具体评测数据。

    推荐理由:OpenAI 官方发布新版嵌入向量模型,仅给出更强、更便宜、更易用三点定位,可据此了解其嵌入模型线的更新方向。

11月30日周三
  1. OpenAI News99

    OpenAI 发布对话式模型 ChatGPT

    OpenAI 发布对话式模型 ChatGPT,以对话形式与用户交互。官方称该对话格式让 ChatGPT 能回答追问、承认自身错误、质疑错误前提并拒绝不当请求。

    推荐理由:OpenAI 官方发布对话式模型 ChatGPT,读者可据此了解其对话交互定位与追问、纠错等能力。

10月5日周三
9月21日周三
7月12日周二
  1. Hugging Face Blog82

    Hugging Face 发布 176B 参数开源多语言模型 BLOOM

    Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,对西班牙语、法语、阿拉伯语等多数语言是首个超过 100B 参数的语言模型。

    推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言并公开训练中间检查点,为研究大模型内部机制提供了少见的开放样本。

3月15日周二