Mistral 发布 Ministral 3B 与 8B 端侧模型
Mistral AI 在 Mistral 7B 发布一周年之际推出两款端侧模型 Ministral 3B 和 Ministral 8B,面向本地隐私优先推理场景。
推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出了 128k 上下文、定价与对标基准,可据此判断边缘场景的选型空间。
Mistral AI 在 Mistral 7B 发布一周年之际推出两款端侧模型 Ministral 3B 和 Ministral 8B,面向本地隐私优先推理场景。
推荐理由:Mistral 在 7B 发布一周年推出两款端侧小模型,给出了 128k 上下文、定价与对标基准,可据此判断边缘场景的选型空间。
Meta 发布 Llama 3.2,共 10 个开放权重模型,包括 11B 和 90B 两个尺寸的视觉模型(各含 base 与指令微调版)以及 1B、3B 端侧文本模型,均已上线 Hugging Face Hub。
推荐理由:Meta 与 Hugging Face 同步放出 10 个开放权重模型,含 11B/90B 视觉版与 1B/3B 端侧文本版,可据此判断本地多模态与端侧部署的可行边界。
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署,减少依赖。
Google 在 Gemma 2 发布一个月后扩充模型阵容,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版),适合端侧使用,并可与 Gemma 2 27B 搭配做辅助生成,官方称可获得最高 3 倍加速且不损失质量。
推荐理由:Gemma 2 新增 2B 小模型与安全分类器、可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:原文给出把 Mistral 7B 转成 Core ML 并在 Mac 上以不到 4GB 内存运行的完整步骤,可迁移到其他模型转换。
Hugging Face 发布 SmolLM 系列小语言模型,包含 135M、360M 和 1.7B 三种参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:原文公开了 135M 到 1.7B 三档小模型的训练数据配方与评测对比,可据此判断端侧小模型的取舍。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成推理。
Hugging Face 发布 swift-transformers Swift 包及配套工具,让开发者在 Apple 设备上用 Core ML 本地运行 Llama 2、Falcon 等模型。
推荐理由:Hugging Face 放出在 Apple 设备本地跑 Llama 2 的 Swift 工具链,读者可据此了解端侧 LLM 的转换与优化路径。
Hugging Face 与 Apple 将 Stable Diffusion XL 移植到 Core ML,可在 Apple Silicon Mac 上本地运行,并发布混合比特调色板量化方案。
推荐理由:原文给出混合比特调色板量化的具体压缩比与 PSNR 数据,可据此判断本地跑 SDXL 的体积与质量取舍。
Hugging Face 介绍了借助 Core ML 新优化在 Apple 设备上加速 Stable Diffusion 的方法,核心是 6-bit palettization 量化,把权重从 16 位浮点压缩到每参数 6 bit,并在推理时逐层解压以降低内存占用。
推荐理由:原文给出 6-bit palettization 的量化转换流程与已上传的四个 Stable Diffusion 模型,读者可据此在 Apple 设备上自行部署。
Hugging Face 为 Mac 推出原生应用 🧨Diffusers 1.1,基于 Core ML 运行 Stable Diffusion 等文生图模型,生成速度最高提升至 2 倍。该版本会自动根据设备选择 GPU 或神经引擎(ANE)加速,并新增模型下载指示、复用 seed 等功能,已在 Mac App Store 上线且完全开源。
Hugging Face 联合 Apple 工程师把 Stable Diffusion 权重转换为 Core ML 格式并上传到 Hub,可在 Apple Silicon 的 CPU、GPU 和神经引擎上运行。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的完整流程与性能参考,可迁移到本地部署实践。