Mistral AI 发布内容审核 API
Mistral AI 发布新的内容审核 API,即其 Le Chat 审核服务所用的同一套接口,现开放给用户按自身应用和安全标准使用。该模型是一个 LLM 分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,并针对对话场景分类最后一条消息。模型原生支持多语言,训练语言包括阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
Mistral AI 发布新的内容审核 API,即其 Le Chat 审核服务所用的同一套接口,现开放给用户按自身应用和安全标准使用。该模型是一个 LLM 分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,并针对对话场景分类最后一条消息。模型原生支持多语言,训练语言包括阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
Hugging Face 与 PyCharm 完成集成,开发者可在代码中右键选择 "Insert HF Model",直接调用 Hugging Face Hub 上的模型。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),通过双向 tokenizer 转换让目标模型与任意模型族的助手模型配对,从而加速推理。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的通用辅助生成方法,读者可了解其如何让任意小模型充当助手并带来 1.5x-2.0x 推理加速。
Hugging Face 发布生成式 AI 服务 HUGS,基于 Text Generation Inference 和 Transformers 构建,提供零配置的优化推理微服务,可在自有基础设施上部署开源模型。
推荐理由:HUGS 把开源模型的优化推理部署压缩到零配置,读者可据此判断自托管开源模型的门槛与成本变化。
Hugging Face 发布 Speech-to-Speech(S2S)级联流水线,串联 VAD、STT、语言模型与 TTS,支持英语、法语、西班牙语、中文、日语和韩语,可用单语言模式或 auto 标志自动检测语言。由于本地运行对算力要求高、易出现延迟,官方给出用自定义 Docker 镜像将其部署到 Hugging Face Inference Endpoints 的分步指南。
Hugging Face 发布 Transformers.js v3,新增 WebGPU 支持,官方称比 WASM 快至多 100 倍,加载模型时设置 device: 'webgpu' 即可启用。
推荐理由:官方发布说明列出 WebGPU 加速、量化格式与 1200 多个预转换模型,可据此判断浏览器端推理的可用边界。
dottxt 与 Hugging Face 联合发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,已集成进 outlines 并放出 Python 绑定。
Stable Diffusion 3.5 已在 Hugging Face Hub 上线并可通过 Diffusers 使用,发布包含 8B 的 Large 模型和 8B 的 timestep-distilled 模型,后者支持 4-8 步少步推理。
推荐理由:Stable Diffusion 3.5 Large 已在 Hub 上线并接入 Diffusers,文中给出量化推理与 LoRA 训练的完整代码路径。
Keras 从 day 1 起就支持 Llama 3.2,可直接从 Hugging Face 的 safetensors checkpoint 加载,包括 3.2 版本,需要转换时会在运行中即时完成。
Hugging Face 与 AMD 合作验证了基于 Zen5 架构的第五代 EPYC(Turin)CPU 对 Hugging Face 生态的支持,在 Meta Llama 3.1 8B 推理测试中,128 核 Turin 相比 96 核 Genoa 在多数配置下吞吐量提升约 2 倍。
Hugging Face 与 Dask 结合,用 FineWeb-Edu 分类器对 FineWeb 数据集做教育价值打分,从本地 pandas 处理 100 行扩展到 Dask 在云端多 GPU 上并行处理 2.11 亿行。
Hugging Face 发布 Gradio 5 稳定版,开发者可用几行 Python 构建生产级机器学习 Web 应用,通过 pip install --upgrade gradio 升级。
推荐理由:Gradio 5 把 SSR、低延迟流式和安全审计打包进稳定版,可据此判断现有 ML 演示应用是否需要升级。
Intel Labs 与 Hugging Face 提出动态推测解码,通过按助手模型置信度动态调整每轮草稿 token 数量,文本生成最高提速 2.7 倍。该方法自 Transformers 4.45.0 起成为辅助生成的默认模式,在 Llama3.1-8B 搭配 Llama3.2-1B 上实现最高 1.52 倍加速,而启发式方法无明显提速。
Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了去重表现:追加 1 万行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量只去重 89%,需额外 230MB,删除一行则导致后半文件全部重写。团队提出改用相对偏移量、对行组做内容定义分块(CDC)等改进思路,并希望与 Apache Arrow 社区合作落地。
OpenAI 发布 Realtime API,开发者可将其接入应用,构建快速的语音到语音交互体验。
推荐理由:OpenAI 官方发布 Realtime API,开发者可据此判断语音到语音交互的接入方式。
OpenAI 在 API 中推出 Prompt Caching,对模型近期已见过的输入自动提供折扣。官方说明该机制面向重复出现的输入内容,具体折扣幅度与适用条件未在摘要中给出。
推荐理由:OpenAI 在 API 层面对近期出现过的输入自动打折,读者可据此判断长提示词与重复上下文的成本变化。
Hugging Face 与 Intel 合作的 Optimum-Intel 支持将 Transformers 模型导出为 OpenVINO IR,并通过 OpenVINO GenAI 的 LLMPipeline 在 C++ 或 Python 中部署,减少依赖。
Hugging Face 团队探索出把已有模型微调到 1.58bit 的方法,用 BitNet 的三值权重(-1、0、1)架构微调 Llama3 8B,并在 HF1BitLLM 组织下开源了三个模型。
Mistral 宣布 la Plateforme 推出免费额度,并对全线模型降价,其中 Mistral Small 与 Codestral 输入输出价格降幅达 80%,Mistral Large 降 33%。
推荐理由:Mistral 一次性公布免费额度、全线降价和新版小模型,读者可据此判断其 API 成本与部署选择的变化。
Mistral AI 发布 Pixtral 12B,一个原生多模态模型,采用 400M 参数从头训练的视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,支持可变图像尺寸与 128k token 上下文窗口内的多图输入。
推荐理由:官方给出架构细节、MMMU 等基准对比和 Apache 2.0 许可,可据此判断开源多模态模型的当前水位。
Hugging Face Hub 为数据集上线 SQL Console,点击数据集上的 SQL Console 徽标即可在浏览器内直接查询数据。该控制台由 DuckDB WASM 驱动,无需后端,支持完整 DuckDB SQL 语法、结果导出为 parquet 以及公开数据集查询结果链接分享。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。
Ada 借助 GPT-4 提升客户服务标准。该案例展示了 GPT-4 在客户服务场景中的实际应用。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积降至原始版本的 14%,最佳情况可达 0.2%,同时保持完整训练能力。解码单帧耗时与加载压缩图片相当,连续多帧解码仅为后者的 25%-50%,并原生集成 Hub 与可视化工具。
Hugging Face Hub 拥有超 85 万个公开模型、每月新增约 5 万个,但其中 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 五项工具常被忽视。
Hugging Face 发布教程,介绍如何在 Google Cloud Vertex AI 上以 FP8 量化版本部署 Meta Llama 3.1 405B Instruct,运行于配备 8 块 H100 GPU 的 A3 节点,并使用 Text Generation Inference(TGI)与 Hugging Face 深度学习容器(DLC)。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
Hugging Face 在 Transformers 中推出统一的工具调用 API,同一份代码可在 Mistral、Cohere、NousResearch 和 Llama 等模型家族间通用,几乎无需针对模型做改动。
推荐理由:原文给出跨模型统一工具调用接口与 Transformers 辅助函数,读者可据此判断迁移成本与复用方式。
Mistral AI 在 La Plateforme 上线模型定制功能,支持对 Mistral Large 2 和 Codestral 等旗舰及专用模型进行 base prompt、few-shot 提示或微调,并可自带数据集。
OpenAI 在 API 中推出结构化输出(Structured Outputs),模型输出现在可以可靠地遵循开发者提供的 JSON Schema。
推荐理由:OpenAI 在 API 中引入结构化输出,模型输出可稳定遵循开发者提供的 JSON Schema,便于判断对现有集成方式的影响。
Hugging Face 梳理了截至 2024 年 8 月 6 日 Hub 上的安全功能:面向所有用户的细粒度 token、2FA、commit 签名、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化安全扫描。Enterprise Hub 用户还可使用 SAML 2.0 与 OIDC 协议的 SSO、Resource Groups 等高级控制。
Hugging Face 展示如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散管线显存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟略增。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(无服务器),可在 Hugging Face Hub 内用标准化 API 对 Llama、Mistral 等开源模型运行推理。
Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和指令遵循做了优化。
推荐理由:Mistral Large 2 以 123B 参数实现单节点高吞吐,并给出与 GPT-4o、Claude 3 Opus 的对比数据,便于判断开源模型的性能成本位置。
Meta 发布 Llama 3.1 系列开源模型,包含 8B、70B、405B 三种规模,各有基础版和指令微调版,上下文长度从 8K 提升到 128K token,支持英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语 8 种语言。
推荐理由:Meta 发布 Llama 3.1 三档开源模型,128K 上下文与工具调用能力配合更宽松的许可证,读者可据此判断开源模型在合成数据与蒸馏上的可用边界。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:原文给出把 Mistral 7B 转成 Core ML 并在 Mac 上以不到 4GB 内存运行的完整步骤,可迁移到其他模型转换。
Hugging Face 为 TGI 推出 Multi-LoRA 服务,只需部署一次基础模型,即可根据请求中的 adapter_id 动态选择对应的 LoRA 适配器,官方称可服务 30 个模型。
推荐理由:原文给出 TGI Multi-LoRA 的部署方式与成本对比,读者可据此判断多微调模型能否合并到一次部署。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 300K+ 个 Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。KerasHub 模型可在 TensorFlow、JAX、PyTorch 后端间无缝切换,需将 keras 升级至 3.3.3 以上。
Hugging Face 宣布其 Inference Endpoints 和 Spaces 现已支持 Google Cloud TPU v5e,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Intel 与 MILA 将多模态蛋白质设计语言模型 ProtST 重新架构并发布在 Hugging Face Hub,可用 Optimum for Intel Gaudi 库在 Gaudi 2 上运行推理与微调。