跳到正文
热点事件持续更新

从零训练并开源Apex-2 MoE模型

1 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年10月4日,有开发者在 r/LocalLLaMA 发帖称,其从零训练并开源了一个小型 MoE 模型 Apex-2,未使用任何外部基础权重。据该帖,Apex-2 总参数 3.87B、每 token 激活 1.45B,预训练仅用 86.5B tokens,采用 Qwen3 tokenizer、16 专家 top-4、上下文长度 4096;预训练算力从单张 GH200 起步,后以 DiLoCo 扩展到两张 GH200。模型发布在 Hugging Face(YOON1v/Apex-2),可通过 transformers / vLLM 以 Qwen3MoeForCausalLM 映射加载。开发者还提到,使用 220k 对、长度归一化的 DPO 后,回答明显变长,并损害了代码、数学与 IFEval 表现。以上均为该开发者自述,尚无其他来源独立验证。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月4日
  1. r/LocalLLaMA
    从零训练 3.87B MoE(1.45B 激活)模型 Apex-2,仅用 86.5B tokens

    开发者从零训练了 MoE 模型 Apex-2,总参数 3.87B、每 token 激活 1.45B,仅用 86.5B tokens 预训练,采用 Qwen3 tokenizer、16 专家 top-4、4096 上下文。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。