从零训练并开源Apex-2 MoE模型
热点事件持续更新
从零训练并开源Apex-2 MoE模型
1 篇报道1 个报道来源13 小时前更新
先了解这件事
AI 综述
2026年10月4日,有开发者在 r/LocalLLaMA 发帖称,其从零训练并开源了一个小型 MoE 模型 Apex-2,未使用任何外部基础权重。据该帖,Apex-2 总参数 3.87B、每 token 激活 1.45B,预训练仅用 86.5B tokens,采用 Qwen3 tokenizer、16 专家 top-4、上下文长度 4096;预训练算力从单张 GH200 起步,后以 DiLoCo 扩展到两张 GH200。模型发布在 Hugging Face(YOON1v/Apex-2),可通过 transformers / vLLM 以 Qwen3MoeForCausalLM 映射加载。开发者还提到,使用 220k 对、长度归一化的 DPO 后,回答明显变长,并损害了代码、数学与 IFEval 表现。以上均为该开发者自述,尚无其他来源独立验证。
AI 根据报道生成 · 1 小时前更新
最新进展10月4日 23:50
从零训练 3.87B MoE(1.45B 激活)模型 Apex-2,仅用 86.5B tokens报道时间线
沿着报道,了解事件的不同侧面。
10月4日
- r/LocalLLaMA从零训练 3.87B MoE(1.45B 激活)模型 Apex-2,仅用 86.5B tokens
开发者从零训练了 MoE 模型 Apex-2,总参数 3.87B、每 token 激活 1.45B,仅用 86.5B tokens 预训练,采用 Qwen3 tokenizer、16 专家 top-4、4096 上下文。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。