用 Gradio MCP Servers 为 LLM 扩展新技能
Hugging Face Spaces 上的 Gradio 应用自 5.28.0 版本起支持 MCP 协议,使 Spaces 成为可搜索数千个 MCP server 的"应用商店"。用户可将 Flux.1 Kontext[dev] 等 Space 接入 Cursor、Claude Code、Cline 等 MCP 客户端,让 LLM 获得图像编辑等新能力,目前图像需通过公开 URL 访问。
Hugging Face Spaces 上的 Gradio 应用自 5.28.0 版本起支持 MCP 协议,使 Spaces 成为可搜索数千个 MCP server 的"应用商店"。用户可将 Flux.1 Kontext[dev] 等 Space 接入 Cursor、Claude Code、Cline 等 MCP 客户端,让 LLM 获得图像编辑等新能力,目前图像需通过公开 URL 访问。
OpenAI 与美国教师联合会(AFT)合作启动一项为期 5 年的计划,将帮助 40 万名 K-12 教育工作者在课堂上主导 AI 创新。
Hugging Face 发布 SmolLM3,一个完全开源的 3B 模型,在 11T token 上训练,支持 6 种语言和最长 128k 上下文,并提供 think / no_think 双模式推理。
推荐理由:Hugging Face 公开了 3B 模型的完整训练配方与数据配比,读者可据此复现或改进同规模模型。
Hugging Face 基础设施团队公开了支撑其生产环境的三大告警机制,分别覆盖 NAT 网关吞吐量、Hub 请求日志归档成功率等环节。NAT 网关告警在流量超过预设静态阈值时触发,用于发现异常流量峰值并优化网络路径成本;日志归档链路则通过 Filebeat、Logstash 与 Elasticsearch 完成采集、加工与存储。
Hugging Face 以 nanoVLM 项目为例,展示如何用五阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充阶段约 60% 的 batch 被无用 padding token 占据,团队随后引入全局最大长度约束,并借助背包问题(knapsack)实现贪心打包,将序列按 token 数尽量塞满每个 batch。
Hugging Face 上线 NeurIPS 2025 E2LM 竞赛,面向 LLM 早期训练阶段(约 200B tokens 以内)构建科学知识领域的评测基准,参赛者需基于 lm-evaluation-harness 通过 HuggingFace Space 提交方案。
Mistral AI 推出 AI for Citizens 协作计划,帮助各国政府和公共机构战略性地运用 AI 改造公共服务、推动创新并保障竞争力。该计划提供开放技术平台、自托管部署、数据主权保障及定制化研发,已与法国、卢森堡、新加坡、荷兰、英国、瑞士等国政府及公共部门合作。
Genspark 借助 GPT-4.1 和 OpenAI Realtime API 打造无代码个人智能体,45 天内做到 3600 万美元 ARR。
Sentence Transformers 现已支持训练和微调稀疏嵌入模型,可产出如 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq 这类低成本模型,尤其适合混合搜索或检索重排场景。
OpenAI 与 Mandala Partners 联合发布面向澳大利亚的 AI 经济蓝图,提出一份可落地的方案,帮助澳大利亚释放人工智能的经济与社会潜力。该蓝图发布之际,提升生产力已成为澳大利亚的国家优先事项。
NVIDIA 在 Hugging Face 发布 Llama Nemotron Nano VL,一个基于 Llama-3.1-8B-Instruct 和 C-RADIOv2-VLM-H 的 8B 视觉语言模型,面向发票、合同等复杂文档的智能文档处理与 OCR。
Retell AI 基于 GPT-4o 和 GPT-4.1 打造无代码语音自动化平台,帮助企业上线自然、实时的语音智能体,无需脚本或等待接通即可自动处理客户对话。该平台可降低通话成本、提升 CSAT,正被用于改造呼叫中心。
Gemma 3n 从 Google I/O 的预览版转为正式发布,已在 transformers、timm、MLX、llama.cpp、transformers.js、ollama 等主流开源库上线。
推荐理由:Gemma 3n 正式开源并接入主流推理库,读者可据此了解端侧多模态模型的硬件门槛与部署路径。
AI GTM 平台 Unify 采用 OpenAI 的 o3、GPT-4.1 和 CUA,自动化潜客挖掘、调研与外联流程。借助超个性化消息和全天候工作流,Unify 帮助团队规模化生成销售管道,同时聚焦高价值客户互动。
SGLang 新增 Hugging Face transformers 作为后端,可直接以高性能推理运行任意 transformers 兼容模型,无需原生支持。
Hugging Face 发布教程,介绍用 diffusers 库和 QLoRA 在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以下。在 RTX 4090 上,QLoRA 峰值显存约 9GB,标准 BF16 LoRA 需 26GB,700 步训练约 41 分钟。
推荐理由:原文给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,可据此复现低显存训练流程。
OpenAI 研究了大语言模型在错误回答上训练后出现更广泛错位行为的机制,并识别出一个驱动该行为的内部特征,该特征可通过极少量微调被逆转。
OpenAI 正在主动评估先进 AI 在生物学和医学领域的能力,并实施防护措施以防止其被滥用。先进 AI 虽能变革生物学与医学,但也带来了生物安全风险。
OpenAI 推出 OpenAI for Government 计划,面向美国公共服务人员提供其最先进的 AI 工具,支持美国政府采用一流技术并将这些工具用于公共服务。
Groq 现已作为推理服务商接入 Hugging Face Hub,支持 Llama 4、Qwen QWQ-32B 等开源模型,并集成到 JS 和 Python 客户端 SDK。Groq 基于 LPU 提供低延迟、高吞吐的推理,采用按需付费模式,用户可用自有 API key 或通过 HF 路由调用。PRO 用户每月获 2 美元推理额度,官方 SDK 支持将在 v0.33.0 版本发布。
TNG 在 24 张 H100 上自托管多个大语言模型,服务超 50 个应用,日均消耗超 1 亿 token、生成超 1000 万 token。其分析指出,vLLM 默认的 chunked-prefill 会顺序调度不同请求的 prefill,单个长提示词请求即可阻塞后续请求,显著拉高首 token 延迟。
Featherless AI 现已作为 Inference Provider 接入 Hugging Face Hub,支持 DeepSeek、Meta、Google、Qwen 等最新开源文本与对话模型,并集成到 JS 和 Python 客户端 SDK。
Hugging Face 发布 Kernel Hub,允许通过 kernels 库的 get_kernel 从 Hub 直接加载预编译优化 kernel,无需本地编译。
OpenAI 与 Mattel 达成合作,将 AI 整合进 Barbie、Hot Wheels 等经典品牌,用于提升创意开发、简化工作流程,并为粉丝创造新的互动方式。
NVIDIA 发布 Isaac GR00T N1.5,这是其开源人形机器人基础模型 GR00T N1 的首次重大更新,支持语言和图像多模态输入并可通过后训练适配不同本体。
推荐理由:原文给出从数据准备到真机部署的完整命令流程,读者可据此在低成本 SO-101 机械臂上复现微调。
Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成 AI 基础设施栈,涵盖 GPU、编排、API、产品与服务。
推荐理由:Mistral 把自建训练与推理基础设施对外产品化,读者可据此判断欧洲主权 AI 算力供给的另一种路径。
Hugging Face 与 NVIDIA 在 GTC Paris 宣布合作推出 Training Cluster as a Service,让全球研究机构更便捷地获取大型 GPU 集群,按训练运行时长付费。
推荐理由:原文给出按训练时长付费的 GPU 集群申请入口和 NVIDIA DGX Cloud Lepton 的接入方式,读者可据此判断算力获取路径的变化。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首款推理模型同时给出开源小杯和企业版,并公开训练论文与评测数据,可对比其推理路线。
OpenAI 发布 Outbound Coordinated Disclosure Policy,规范其如何负责任地报告第三方软件中的漏洞,强调诚信、协作与大规模主动安全。该政策面向对外披露场景,旨在以协调方式处理第三方软件安全问题。
Hugging Face 发布 ScreenSuite,一个面向 GUI Agent 的评测套件,整合 13 项基准,覆盖感知、定位、单步动作和多步智能体四类能力。
推荐理由:Hugging Face 开源 GUI Agent 评测套件,读者可了解其 13 项基准覆盖的能力维度与纯视觉评测设定。
OpenAI 正在就《纽约时报》及原告提出的法院命令进行抗辩,该命令要求无限期保留 ChatGPT 和 API 消费者用户数据。OpenAI 表示正努力在满足法律要求的同时维护用户隐私,并坚持其数据保护承诺。
OpenAI 发布最新报告,通过案例研究披露其检测和阻止 AI 恶意使用的方式。报告聚焦 OpenAI 如何发现并防范这类滥用行为。
Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量与气隙本地 GPU 部署,代码留在企业边界内。
推荐理由:官方给出企业级编码助手的模型组合、部署形态与首批客户,可据此判断私有化编码方案的落地路径。
Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使生成速度提升 38%。nanoVLM 是一个用纯 PyTorch 训练自研视觉语言模型的轻量代码库,KV Cache 在 Attention 块、语言模型和生成循环三处启用,将生成从全序列重算改为增量更新。相关经验可推广到所有自回归语言模型生成。
Arm 工程师 Michael Gamble 用 Stable Audio Open 模型、PyTorch 和 TorchAudio 搭建了一款完全在 Arm CPU 上本地运行的声音生成工具,无需 GPU 和云端推理,几秒内即可根据提示词生成 .wav 文件并直接导入 Ableton Live。
H Company 发布 Holo1 系列 Action VLM,包含 Holo1-3B 和 Holo1-7B,基于 Qwen2.5-VL 架构并已在 Hugging Face 开源,同时发布含 1,639 个类人 UI 任务的 WebClick 多模态定位基准。
推荐理由:原文给出开源模型规格、基准成绩与单任务成本,读者可据此判断网页自动化方案的落地门槛。
Hugging Face 博客介绍 TRL 新增 vLLM 共置(colocate)模式,训练与推理共享同一批 GPU,不再需要单独的 vLLM 服务器进程。
Hugging Face 发布 SmolVLA,一个 450M 参数的开源视觉-语言-动作(VLA)模型,可在 CPU、单张消费级 GPU 甚至 MacBook 上运行,仅用 lerobot 标签下社区共享数据集预训练。
推荐理由:450M 参数、消费级硬件可跑的开源 VLA,用不到 3 万条社区数据在仿真与真机上追平更大模型,并给出异步推理带来的速度差异。
OpenAI 封禁了一批疑似源自柬埔寨的账号,这些账号利用 AI 支持针对英国用户的任务诈骗流程。
OpenAI 封禁了一批与疑似伊朗关联的 STORM-2035 行动相关的账号,该行动利用 AI 生成针对美国、英国、爱尔兰和委内瑞拉政治的影响力内容。