在 M3 Max 上对比四种本地推理引擎速度
热点事件持续更新
在 M3 Max 上对比四种本地推理引擎速度
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月5日,r/LocalLLaMA 用户 /u/Hyungsun 发布在 36 GB M3 Max 上对四款本地推理引擎的实测对比。测试对象为 oMLX 0.7.0、Rapid-MLX 0.15.5、Splash 1.2.1、MTPLX 2.12.2,模型为 Qwen3.8-27B 与 Qwen3.6-35B-A3B,其中 Qwen3.6-35B-A3B 达到 110 tok/s。测试条件为:各引擎在 localhost 上服务,temperature 0、关闭 thinking;作者称端到端重跑后数字差异在 6% 以内,结果取 3 次运行的中位数。作者同时说明,四款引擎并非使用完全相同的权重文件,测试仅在一台笔记本、一个晚上完成。该机为 14 英寸 M3 Max(14 核 CPU / 30 核 GPU / 36 GB / 1 TB),作者称以约 2,498 美元购入。目前尚无其他来源跟进或验证该结果。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- r/LocalLLaMAM3 Max 36 GB 本地推理实测:oMLX vs Rapid-MLX vs Splash vs MTPLX,Qwen3.6-35B-A3B 达 110 tok/s
在 36 GB M3 Max 上实测 oMLX 0.7.0、Rapid-MLX 0.15.5、Splash 1.2.1、MTPLX 2.12.2 四款本地推理引擎。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。