Gradio 如何用 Reload Mode 快速构建 AI 应用
Gradio 推出 reload mode,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。
Gradio 推出 reload mode,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。
Ryght 正式公开发布面向生命科学知识工作者的免费安全平台 Ryght Preview,用于加速研究、分析与文档处理。
Zama 团队将基于全同态加密(FHE)的 Concrete ML 预编译模型部署到 Hugging Face Endpoints,用户可通过自定义 inference handler 一键部署并运行加密推理。
Hugging Face 推出 Deploy on Google Cloud 集成,可将数千个开源模型一键部署到 Google Cloud 的 Vertex AI 或 GKE,作为自有账号内的 API Endpoint。
MotherDuck 与 Numbers Station 推出 DuckDB-NSQL-7B,一个专为 DuckDB SQL 设计的大语言模型,基于 Meta Llama-2-7b 微调并进一步用 DuckDB text-to-SQL 数据对精调,可生成包括官方文档和扩展在内的多种有效 DuckDB SQL 语句。
Hugging Face 联合 Intel Labs 与 UKP Lab 开发的 SetFit 少样本微调框架,借助 Optimum Intel 在 Intel Xeon CPU 上通过训练后静态量化(PTQ)可将推理速度提升 7.8 倍。
Hugging Face Hub 推出 Deploy on Cloudflare Workers AI 集成,让开发者以无服务器 API 方式调用开源模型,由部署在 Cloudflare 边缘数据中心的 GPU 驱动,采用按请求计费。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型的统一接口,首个版本聚焦 3D 物体检测,可输出物体在三维空间中的 (x, y, z) 坐标。
Hugging Face 博客介绍嵌入向量的二值量化与标量(int8)量化,用于降低检索的内存、磁盘占用和成本。二值量化把 float32 值转为 1 bit,内存与存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化减少 4 倍,性能保留约 99.3%。
推荐理由:原文给出二值与标量量化的实测数据与代码示例,读者可据此评估检索成本与性能的取舍。
Hugging Face 发布面向非技术人群的 Transformers 入门指南,无需 Python 基础即可上手。教程以在 Hugging Face Space 的 JupyterLab 中运行微软 Phi-2 LLM 为例,需租用 NVIDIA A10G Small GPU(24GB 显存,每小时几美元)。文中还介绍了 Transformers 库、Hub 与 Spaces 的基本概念。
Hugging Face 与 Intel 合作,通过 Optimum Intel 中的 OpenVINO 集成对微软 Phi-2 模型权重做 4-bit 量化,并在搭载 Core Ultra 7 155H 的中端笔记本上完成推理。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重及 int8、float8 激活,可在 CUDA 和 MPS 等任意设备上运行。
Hugging Face 与 NVIDIA 合作推出 Train on DGX Cloud,Enterprise Hub 组织可在 Hugging Face Hub 内通过 AutoTrain 和 Spaces 以无代码方式创建训练任务,运行在 NVIDIA DGX Cloud 的 H100 GPU 上。
推荐理由:原文给出无代码训练入口、支持模型清单和按分钟计费价格,读者可据此估算在 H100 上微调的成本。
Hugging Face 发布教程,展示如何借助 Optimum Intel 与 IPEX 在英特尔 Xeon CPU 上加速 BGE 嵌入模型,并集成进 fastRAG 的 RAG 流程。优化聚焦 45M、110M、355M 参数的 BGE small、base、large 三款模型,通过 int8 量化、bf16 及 AMX 加速降低单条查询延迟并提升吞吐。
Hugging Face 发布基于 Optimum Habana 的自定义 pipeline 类,可在 Intel Gaudi 2 AI 加速器上用几行代码运行 Llama 2 系列(7b、13b、70b)文本生成。
Mistral AI 发布旗舰文本生成模型 Mistral Large,通过 la Plateforme 和 Azure 提供,官方称其推理能力达到顶级水平,是 API 可用的全球第二强模型(仅次于 GPT-4)。
推荐理由:官方给出 Mistral Large 的基准对比与 Azure 分发路径,可据此判断其旗舰定位与多语言、函数调用能力。
Google 发布开源大模型系列 Gemma,包含 2B 和 7B 两个尺寸,各有基础版和指令微调版,上下文长度 8K tokens,可运行在消费级硬件上。Hugging Face 宣布全面支持,提供 Transformers 集成、Google Cloud 与 Inference Endpoints 部署,以及用 TRL 在单卡上微调的示例。
推荐理由:Google 开源 Gemma 系列并同步接入 Hugging Face 生态,读者可了解其规格、许可与部署路径。
Hugging Face 的 PEFT 库新增了面向 LoRA 适配器的多种合并方法,包括 cat、linear、svd、ties、dare 和 magnitude_prune 等,可通过 add_weighted_adapter() 调用。
AMD 与 Hugging Face 联合启动 Pervasive AI Developer Contest,面向全球开发者开放生成式 AI、机器人 AI 和 PC AI 三个赛道,总奖金 16 万美元,单个获奖者最高可得 1 万美元,并提供 700 个 AMD 平台供参赛者使用。
Hugging Face 为 Text Generation Inference(TGI)和 Inference Endpoints 推出 Messages API。
推荐理由:Hugging Face 官方给出 TGI 兼容 OpenAI 接口的迁移路径与代码示例,读者可据此评估从闭源模型切换到开源模型的改造成本。
Hugging Face 宣布 Text Generation Inference(TGI)在 AWS Inferentia2 和 Amazon SageMaker 上正式可用,为生产级 LLM 部署提供 GPU 之外的替代方案。
Hugging Face 博客展示了在第四代 Intel Xeon 上通过 8bit/4bit 量化结合辅助生成(assisted generation),让 StarCoder-15B 推理加速超过 7 倍。
Hugging Face 宣布与 Google Cloud 建立战略合作,围绕开放科学、开源、云和硬件展开协作,帮助企业在 Hugging Face 开放模型与 Google Cloud 的 Vertex AI、TPU 等基础设施上构建自己的 AI。
Hugging Face 发布经 Olive 优化的 SD Turbo 和 SDXL Turbo 模型,在 NVIDIA GPU 上通过 ONNX Runtime CUDA 与 TensorRT 执行提供程序加速推理,吞吐量最高较 PyTorch 提升 229%(SDXL Turbo)和 120%(SD Turbo)。
Hugging Face 发布教程,介绍如何用 ComfyUI-to-Python-Extension 把 ComfyUI 工作流导出为纯 Python 脚本,再用 Gradio 封装成应用并部署到 Hugging Face Spaces 的 ZeroGPU 上免费运行。
推荐理由:教程给出把 ComfyUI 工作流导出为 Python、封装 Gradio 并部署到 ZeroGPU 的完整步骤,可迁移到自己的工作流。
Hugging Face 博客介绍社区开发的轻量库 Unsloth,与 transformers、PEFT、TRL 生态兼容,可将 LLM 微调速度提升约 2 倍并降低显存占用,精度相对标准 QLoRA 无下降。
推荐理由:原文给出 Unsloth 与 TRL 的集成方式和 59 次基准数据,读者可据此判断微调成本能降多少。
Hugging Face 博客介绍如何用投机解码将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。在 LibriSpeech 基准上,Whisper large-v2 的 73 个样本推理时间从 73 秒降至 33 秒,WER 保持 3.5%;荷兰语 VoxPopuli 上从 117 秒降至 62 秒,WER 保持 12.8%。
推荐理由:原文给出可复用的投机解码实现与基准数据,读者可据此在现有 Whisper 流程中获得约 2 倍加速。
Mistral AI 开放其首个平台服务 la plateforme 的 beta 访问,提供三个对话端点和一个嵌入端点。
推荐理由:Mistral AI 开放首个平台服务测试,给出三个对话端点和嵌入端点的模型、价格与基准表现,可据此判断其早期 API 能力边界。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型,在多数基准上超过 Llama 2 70B,推理速度快 6 倍,并在多数标准基准上追平或超过 GPT3.5。
推荐理由:官方给出稀疏 MoE 架构的参数量与推理成本对比,可据此判断开源模型在性价比上的位置。
Hugging Face 发布《Mixture of Experts Explained》长文,系统讲解 MoE 的构成、训练方式与推理权衡。文章指出 MoE 用稀疏层加门控网络替代部分 FFN 层,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 稠密参数。
Mistral 发布 Mixtral 8x7B,采用 MoE 架构,含基础版与 Instruct 版,支持 32k token 上下文,以 Apache 2.0 许可开放商用。
推荐理由:Hugging Face 官方给出 Mixtral 的架构说明、基准对比与量化部署路径,可据此判断 MoE 开源模型的落地成本。
Hugging Face 与 AMD 宣布在 AMD Instinct GPU 上实现开箱即用支持,所有 Transformers 模型和任务无需修改代码即可运行,示例代码与 NVIDIA GPU 上完全一致。
推荐理由:原文给出 AMD GPU 上无需改代码运行 Transformers 的支持范围与实测对比数据,可据此判断迁移成本。
Hugging Face 在 Hub 推理 API 中实现 LoRA 动态加载,让基础模型保持常驻、按请求即时加载和卸载适配器,把冷启动时间从 25 秒降到 3 秒,用户请求响应从 35 秒降到 13 秒。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需将 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒,首 token 延迟最高降低 3.3 倍。
推荐理由:Hugging Face 与 NVIDIA 联合推出的推理库,用一行代码替换即可获得最高 28 倍吞吐提升,适合关注 LLM 部署成本的读者。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出了 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的可用性。
Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 Llama 2 等 LLM 进行文本生成。用户可将 Llama-2-7b-hf 编译导出为 Neuron 格式,并选择 budget、latency、throughput 等不同配置,其中 7B 与 13B 模型均提供预编译版本,最大序列长度为 2048。
Hugging Face 面向 Enterprise Hub 客户推出 Storage Regions,允许组织选择模型和数据集的存储位置。目前支持 US 和 EU 两个区域,Asia-Pacific 即将上线;存储在欧洲的仓库可获得约 4-5 倍的上传和下载速度提升,并满足 GDPR 合规需求。非默认区域的仓库会直接显示 Region 标签。
Hugging Face 发布教程,展示如何用其 GitHub 组织前 10 个公开仓库的代码微调 StarCoder,训练出名为 HugCoder 的代码补全助手。
推荐理由:完整复现了从数据采集、QLoRA 微调到 VS Code 本地部署的全流程,并给出成本与效果对比,可迁移到自有代码库。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多种推理优化,未优化管线占用 28GB 显存、耗时 72.2 秒,改用 fp16 后降至 21.7GB 和 14.8 秒。
推荐理由:Hugging Face 官方给出 SDXL 在 Diffusers 中的显存与延迟实测数据,可直接对照选择优化组合。
作者复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。
推荐理由:作者复现 OpenAI 原始 RLHF 代码并逐条列出实现细节,其中 PyTorch 与 TensorFlow 版 Adam 的差异会直接影响训练稳定性。