跳到正文

内容形态

模型发布 最新动态

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

226 条精选近 30 天 17 条共收录 269 条

更新

精选归档 · 第 9 页

12月18日周三第 161–180 条
  1. Hugging Face Blog62

    IBM 等联合发布 Bamba-9B 混合 Mamba2 模型

    IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个基于完全开放数据训练的混合 Mamba2 模型,训练数据量 2.2T tokens。

    推荐理由:原文给出混合 Mamba2 架构在 vLLM 中的吞吐与延迟实测数据,以及开放权重和训练配方,便于判断该架构的推理效率取舍。

12月17日周二
  1. OpenAI News62

    OpenAI 发布 o1 模型及多项开发者工具更新

    OpenAI 发布 o1 模型,并同步带来 Realtime API 改进和一种新的微调方法等面向开发者的更新。官方仅给出上述概要,未披露具体参数、价格或可用范围。

    推荐理由:OpenAI 官方一次性公布 o1 模型与开发者工具更新,可据此了解其面向开发者的能力布局。

12月9日周一
  1. OpenAI News62

    OpenAI 发布 Sora 视频生成模型系统卡

    OpenAI 发布 Sora 系统卡,介绍这是其视频生成模型,可接收文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 系列模型的经验构建,定位是为用户提供更丰富的叙事与创意表达工具。

    推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形态与模型来源,可据此了解其视频生成能力边界。

12月5日周四
  1. Hugging Face Blog62

    Google 发布 PaliGemma 2 视觉语言模型,提供 3B 到 28B 三种规格

    Google 发布新一代视觉语言模型 PaliGemma 2,用 Gemma 2 替换前代的文本解码器,保留 SigLIP 图像编码器,提供 3B、10B、28B 三种参数规模,均支持 224x224、448x448、896x896 三种输入分辨率,而前代 PaliGemma 仅有 3B 版本。

    推荐理由:Google 开源视觉语言模型 PaliGemma 2 提供 3B 到 28B 多规格与三种分辨率,读者可据此判断微调选型空间。

11月26日周二
  1. Hugging Face Blog60

    Hugging Face 发布 2B 视觉语言模型 SmolVLM

    Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方与工具均以 Apache 2.0 协议开源。

    推荐理由:原文给出 2B 视觉语言模型的显存占用、吞吐对比和完整开源训练流程,便于判断端侧多模态的落地空间。

11月18日周一
10月24日周四
10月16日周三
  1. Mistral AI62

    Mistral 发布 Ministral 3B 与 8B 端侧模型

    Mistral AI 在 Mistral 7B 发布一周年之际推出两款端侧模型 Ministral 3B 和 Ministral 8B,面向本地隐私优先推理场景。

    推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出了 128k 上下文、定价与对标基准,可据此判断边缘场景的选型空间。

9月25日周三
  1. Hugging Face Blog80

    Llama 3.2 发布:多模态视觉模型与 1B/3B 端侧文本模型上线 Hugging Face

    Meta 发布 Llama 3.2,共 10 个开放权重模型,包括 11B 和 90B 两个尺寸的视觉模型(各含 base 与指令微调版)以及 1B、3B 端侧文本模型,均已上线 Hugging Face Hub。

    推荐理由:Meta 与 Hugging Face 同步放出 10 个开放权重模型,含 11B/90B 视觉版与 1B/3B 端侧文本版,可据此判断本地多模态与端侧部署的可行边界。

9月17日周二
  1. Mistral AI70

    Mistral 发布 Pixtral 12B 多模态模型

    Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用 400M 参数从头训练的视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与 128k token 上下文窗口内的多图输入。

    推荐理由:官方给出架构细节、MMMU 等基准对比和 Apache 2.0 许可,可据此判断开源多模态模型的当前水位。

9月12日周四
8月12日周一
  1. Hugging Face Blog62

    TII 发布 Falcon Mamba:首个强性能无注意力 7B 模型

    阿布扎比 TII 发布 Falcon Mamba 7B,称其为首个大规模通用纯 Mamba 模型,采用开放许可并已上线 Hugging Face 生态。该模型基于原始 Mamba 架构并加入额外 RMS 归一化层以稳定大规模训练,用约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,单张 A10 24GB GPU 即可运行。

    推荐理由:TII 发布首个大规模纯 Mamba 架构 7B 模型,并给出与同规模 Transformer 的基准和长序列内存对比。

7月31日周三
  1. Hugging Face Blog62

    Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope

    Google 在 Gemma 2 发布一个月后扩充模型阵容,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版),适合端侧使用,并可与 Gemma 2 27B 搭配做辅助生成,官方称可获得最高 3 倍加速且不损失质量。

    推荐理由:Gemma 2 新增 2B 小模型与安全分类器、可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。

7月24日周三
  1. Mistral AI78

    Mistral AI 发布 Mistral Large 2,123B 参数支持 128k 上下文

    Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和指令遵循做了优化。

    推荐理由:Mistral Large 2 以 123B 参数实现单节点高吞吐,并给出与 GPT-4o、Claude 3 Opus 的对比数据,便于判断开源模型的性能成本位置。

7月23日周二
  1. Hugging Face Blog88

    Meta 发布 Llama 3.1:8B、70B 与 405B,支持多语言和长上下文

    Meta 发布 Llama 3.1 系列开源模型,包含 8B、70B、405B 三种规模,各有基础版和指令微调版,上下文长度从 8K 提升到 128K token,支持英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语 8 种语言。

    推荐理由:Meta 发布 Llama 3.1 三档开源模型,128K 上下文与工具调用能力配合更宽松的许可证,读者可据此判断开源模型在合成数据与蒸馏上的可用边界。

7月18日周四
7月16日周二
  1. Mistral AI72

    Mistral 发布 Codestral Mamba 代码模型

    Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的代码模型,采用 Apache 2.0 许可,可免费使用、修改和分发。该模型为指令模型,参数量 7,285,403,648,具备线性时间推理能力,官方在最高 256k tokens 的上下文检索能力上做了测试。

    推荐理由:Mistral 官方发布 Mamba 架构代码模型,给出参数量、上下文测试长度与部署方式,可对比 Transformer 路线的取舍。