Hugging Face 如何构建官方 MCP Server
Hugging Face 发布官方 MCP Server(hf.co/mcp),通过一个 URL 让 AI 助手访问 Hub 与 Spaces 上的数千个 AI 应用,并支持用户动态配置工具。生产环境采用 Streamable HTTP 传输的无状态 Direct Response 配置,开源代码同时支持 STDIO、SSE 和 Streamable HTTP 部署。
Hugging Face 发布官方 MCP Server(hf.co/mcp),通过一个 URL 让 AI 助手访问 Hub 与 Spaces 上的数千个 AI 应用,并支持用户动态配置工具。生产环境采用 Streamable HTTP 传输的无状态 Direct Response 配置,开源代码同时支持 STDIO、SSE 和 Streamable HTTP 部署。
Hugging Face 发布博客详解异步机器人推理,通过将动作预测与执行解耦,让机器人在 PolicyServer 计算下一段动作时持续执行当前动作队列,从而消除等待推理的空闲时间。该方案在 SmolVLA 上实现约 2 倍任务完成速度提升,任务成功率相当,PolicyServer 与 RobotClient 之间通过 gRPC 通信,性能约为同类 REST API 的 5 倍。
Hugging Face 与 AMD 合作,为 AMD MI300X 编写了三个开源自定义内核——融合残差连接/RMS norm/FP8 转换内核、融合 SwiGLU 激活/FP8 转换内核和 Skinny GEMM 内核,用于在 8 卡 MI300X 节点上通过 VLLM 加速 Llama 3.1 405B 的 FP8 推理。
Hugging Face Spaces 上的 Gradio 应用自 5.28.0 版本起支持 MCP 协议,使 Spaces 成为可搜索数千个 MCP server 的"应用商店"。用户可将 Flux.1 Kontext[dev] 等 Space 接入 Cursor、Claude Code、Cline 等 MCP 客户端,让 LLM 获得图像编辑等新能力,目前图像需通过公开 URL 访问。
Hugging Face 基础设施团队公开了支撑其生产环境的三大告警机制,分别覆盖 NAT 网关吞吐量、Hub 请求日志归档成功率等环节。NAT 网关告警在流量超过预设静态阈值时触发,用于发现异常流量峰值并优化网络路径成本;日志归档链路则通过 Filebeat、Logstash 与 Elasticsearch 完成采集、加工与存储。
Hugging Face 以 nanoVLM 项目为例,展示如何用五阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充阶段约 60% 的 batch 被无用 padding token 占据,团队随后引入全局最大长度约束,并借助背包问题(knapsack)实现贪心打包,将序列按 token 数尽量塞满每个 batch。
Sentence Transformers 现已支持训练和微调稀疏嵌入模型,可产出如 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq 这类低成本模型,尤其适合混合搜索或检索重排场景。
SGLang 新增 Hugging Face transformers 作为后端,可直接以高性能推理运行任意 transformers 兼容模型,无需原生支持。
Hugging Face 发布教程,介绍用 diffusers 库和 QLoRA 在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以下。在 RTX 4090 上,QLoRA 峰值显存约 9GB,标准 BF16 LoRA 需 26GB,700 步训练约 41 分钟。
推荐理由:原文给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,可据此复现低显存训练流程。
Groq 现已作为推理服务商接入 Hugging Face Hub,支持 Llama 4、Qwen QWQ-32B 等开源模型,并集成到 JS 和 Python 客户端 SDK。Groq 基于 LPU 提供低延迟、高吞吐的推理,采用按需付费模式,用户可用自有 API key 或通过 HF 路由调用。PRO 用户每月获 2 美元推理额度,官方 SDK 支持将在 v0.33.0 版本发布。
TNG 在 24 张 H100 上自托管多个大语言模型,服务超 50 个应用,日均消耗超 1 亿 token、生成超 1000 万 token。其分析指出,vLLM 默认的 chunked-prefill 会顺序调度不同请求的 prefill,单个长提示词请求即可阻塞后续请求,显著拉高首 token 延迟。
Featherless AI 现已作为 Inference Provider 接入 Hugging Face Hub,支持 DeepSeek、Meta、Google、Qwen 等最新开源文本与对话模型,并集成到 JS 和 Python 客户端 SDK。
Hugging Face 发布 Kernel Hub,允许通过 kernels 库的 get_kernel 从 Hub 直接加载预编译优化 kernel,无需本地编译。
Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成 AI 基础设施栈,涵盖 GPU、编排、API、产品与服务。
推荐理由:Mistral 把自建训练与推理基础设施对外产品化,读者可据此判断欧洲主权 AI 算力供给的另一种路径。
Hugging Face 与 NVIDIA 在 GTC Paris 宣布合作推出 Training Cluster as a Service,让全球研究机构更便捷地获取大型 GPU 集群,按训练运行时长付费。
推荐理由:原文给出按训练时长付费的 GPU 集群申请入口和 NVIDIA DGX Cloud Lepton 的接入方式,读者可据此判断算力获取路径的变化。
Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量与气隙本地 GPU 部署,代码留在企业边界内。
推荐理由:官方给出企业级编码助手的模型组合、部署形态与首批客户,可据此判断私有化编码方案的落地路径。
Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使生成速度提升 38%。nanoVLM 是一个用纯 PyTorch 训练自研视觉语言模型的轻量代码库,KV Cache 在 Attention 块、语言模型和生成循环三处启用,将生成从全序列重算改为增量更新。相关经验可推广到所有自回归语言模型生成。
Hugging Face 博客介绍 TRL 新增 vLLM 共置(colocate)模式,训练与推理共享同一批 GPU,不再需要单独的 vLLM 服务器进程。
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码数据检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
推荐理由:官方给出代码嵌入模型在检索基准上的对比与按维度裁剪的存储成本权衡,可据此评估代码 RAG 的选型。
Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、Web 搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,可据此判断企业级智能体平台的搭建方式。
用户测试 Liger GRPO loss 与 TRL 集成时,在 DeepSpeed ZeRO3、bf16 精度下使用 Qwen2.5-0.5B-Instruct 训练,触发形状不匹配报错。错误发生在 liger_kernel 的 fused_linear_ppo 前向计算中,经 torch._dynamo 编译后抛出。
Dell 在 Dell Tech World 上发布新版 Dell Enterprise Hub,提供 Meta Llama 4 Maverick、DeepSeek R1。
CodeRabbit 采用 OpenAI 的 o3、o4-mini 和 GPT-4.1 模型改造代码审查流程,提升审查准确率并加快 PR 合并速度。该方案帮助开发者更快交付代码,减少 bug 并提高投资回报率。
OpenAI 宣布推出 Stargate UAE,这是其 AI 基础设施平台 Stargate 的首次国际部署。
推荐理由:OpenAI 官方宣布 Stargate 首次落地海外,读者可据此了解其 AI 基础设施的国际化布局。
Hugging Face Diffusers 现已集成 bitsandbytes、GGUF、torchao、Quanto 和原生 FP8 等多种量化后端,并以 Flux-dev 为例展示其效果。
在 Microsoft Build 大会上,Satya Nadella 宣布扩大与 Hugging Face 的合作,Azure AI Foundry 的 Hugging Face Collection 现可一键部署 1 万多个开放模型,覆盖文本、音频和图像任务。
Hugging Face 在博客中表示,未来目标是让 Transformers 成为各框架之间的模型定义中枢,模型架构只要被 Transformers 支持,就能在生态其他工具中获得支持。
推荐理由:Hugging Face 官方说明 Transformers 将作为跨框架模型定义中枢,读者可据此理解模型接入与部署链路的变化。
Hugging Face 与 Kaggle 推出集成,让 Hugging Face 模型可直接在 Kaggle 上被发现和使用。
Hugging Face 在 Inference Endpoints 上线新版 OpenAI Whisper 部署方案,基于 vLLM 实现,性能较此前版本最高提升 8 倍。
OpenAI 面向亚洲客户推出数据驻留功能,建立在其企业级数据隐私、安全与合规项目之上。该功能旨在为全球客户提供支持。
Mistral AI 发布 Mistral Medium 3,称其在基准测试中达到 Claude Sonnet 3.7 九成以上水平,定价为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价与对标基准,读者可据此判断企业级模型的成本与部署门槛。
Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,提供企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
推荐理由:Mistral 官方发布企业版助手,列出企业搜索、Agent 构建与混合部署等能力,可据此判断其企业落地路径。
Gradio 官方发布教程,介绍如何用几行 Python 把 Gradio 应用变成 MCP Server,让 LLM 以工具形式调用其中的函数。
推荐理由:Gradio 官方给出把任意 Python 函数变成 MCP 工具的完整步骤,可据此把自家模型接口接入 LLM 工具调用。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,支持 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟。
ServiceNow 开源实验性 RL 实现 PipelineRL,核心是在 RL 训练中做 inflight 权重更新,推理不中断即可接收新权重,从而维持高推理吞吐并减少 rollout 权重与最新模型权重之间的滞后。
推荐理由:原文给出开源仓库与训练契约设计,读者可据此判断大规模 RL 训练中吞吐与 on-policy 数据如何兼顾。
TNG 在 24 块 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章解析 LLM 生成的两个阶段:prefill 阶段可并行处理全部输入 token,decode 阶段只能逐个生成输出 token,二者分别对应首 token 延迟和单 token 延迟两项指标。
Cohere 正式成为 Hugging Face Hub 上支持的 Inference Provider,也是首个直接在 Hub 上分享并托管自家模型的模型厂商。
Gradio 官方博客列出 17 个理由,说明它不只是 Python UI 库,而是同时提供 UI 与 API 的机器学习交互框架。所有 Gradio 应用自带 REST API 端点,并提供 Python(gradio_client)和 JavaScript(@gradio/client)官方 SDK 及 cURL 访问。
Hugging Face 与 Cloudflare 达成合作,让 FastRTC 开发者凭 Hugging Face token 即可接入 Cloudflare 覆盖 335 多个地点的全球 TURN 网络,构建低延迟实时语音与视频应用。
Gradio 月活开发者已超过 100 万,被 Automatic1111、LLaMA-Factory 等热门开源项目使用。Hugging Face 回顾其五年增长经验:坚持投入底层原语而非高层抽象,如今 gr.Blocks 占 Gradio 使用量的 80%;专注机器学习 Web 应用这一细分场景,并借助 share links 和 Hugging Face Spaces 实现病毒式传播。