跳到正文
热点事件持续更新

本地Agent从Qwen3.8 27B换Ornith 1.5 35B-A3B实测

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月5日,r/LocalLLaMA用户分享在双RTX 5070 Ti 16GB上把本地智能体从Qwen3.8 27B切换到Ornith 1.5 35B-A3B(Ollama库中ornith-1.5:35b,Q4_K_M)的实测。生成速度从约55-70 tok/s提升到约180 tok/s,两项自建测试均保持9/9和10/10。该用户称128K为默认上下文,256K按需切换;256K可运行,但因首块显卡还驱动显示器,约1.2GB落入系统内存,速度降至约139 tok/s。1M上下文(factor 4、q4 KV缓存)只有在允许llama-server的fit选项把部分专家推入系统内存后才加载成功,并在849K提示词中约720K处找到目标信息。该用户强调两项测试均满分,只能说明在其工作负载上不逊于27B,不能证明更聪明。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. r/LocalLLaMA
    本地智能体从 Qwen3.8 27B 换到 Ornith 1.5 35B-A3B:双 5070 Ti 上约 180 tok/s 对 60 tok/s,测试得分相同

    用户在两块 RTX 5070 Ti 16GB 上把本地智能体从 Qwen3.8 27B 换成 Ornith 1.5 35B-A3B(Ollama 库中 ornith-1.5:35b,Q4_K_M),生成速度从约 55-70 tok/s 提升到约 180 tok/s,两项自建测试均保持 9/9 和 10/10。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。