Hugging Face 与 Google Cloud 达成新合作,共建开放模型生态
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业能在 Google Cloud 上用开放模型构建自己的 AI。
Hugging Face 宣布与 Google Cloud 建立更深层合作,让企业能在 Google Cloud 上用开放模型构建自己的 AI。
Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,算力稀缺也促使 DeepSeek 的 MLA、GRPO 等效率创新走向开源,并推动 CUDA 之外的软件生态成形。
推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,可看到算力受限如何反过来塑造模型架构与部署生态。
NVIDIA Isaac for Healthcare v0.4 发布基于 SO-ARM 的入门工作流,提供从仿真采集数据、微调 GR00T N1.5 到真机部署的端到端流程,用于构建自主手术辅助机器人。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端手术辅助机器人工作流,覆盖数据采集、训练与真机部署。该工作流用 LeRobot 采集仿真与真机数据,后训练 GR00T N1.5,并在 Isaac Lab 评估后部署到硬件,其中超过 93% 的训练数据由仿真合成生成。
推荐理由:原文给出从仿真采集、GR00T N1.5 后训练到真机部署的完整命令与硬件要求,可据此复现医疗机器人工作流。
IBM 发布 Granite 4.0 家族最小的 Granite 4.0 Nano,含 4 个 instruct 模型及对应 base 版本,参数规模 350M 与 1B,采用 hybrid-SSM 架构,另有传统 Transformer 版本。
Hugging Face 发布博客提出“语音同意门”(voice consent gate),让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动声音克隆,并提供了示例 Space 和配套代码。该方案由语言模型为每次授权生成一对全新句子,一句表达明确同意、一句提供语音多样性,从而把同意变成可追溯、可审计的系统前置条件。
Hugging Face 改进 datasets 库的流式加载,load_dataset(streaming=True) 的启动请求最多减少 100 倍、数据文件解析快 10 倍、流式速度最多快 2 倍,256 并发 worker 下无崩溃。
推荐理由:原文给出流式加载的具体优化项与实测倍数,读者可据此判断大规模训练的数据读取成本能降到什么程度。
Hugging Face 发布 huggingface_hub v1.0,这是该 Python 库五年来的首个大版本,引入破坏性变更。主要变化包括后端从 requests 迁移到 httpx、以基于 Typer 的 hf CLI 取代已弃用的 huggingface-cli、文件传输全面改用 hf_xet 替代 hf_transfer。
推荐理由:官方梳理了 v1.0 的破坏性变更与迁移路径,读者可据此判断升级自家依赖库的时机与成本。
Hugging Face 发布 LeRobot v0.4.0,为开源机器人学习带来 LeRobotDataset v3.0、PI0.5 与 GR00T N1.5 等 VLA 模型,以及硬件插件系统。
推荐理由:LeRobot v0.4.0 把数据集、仿真环境、VLA 策略与硬件插件整合进同一开源栈,读者可据此判断机器人学习工具链的成熟度。
Meta 与 Hugging Face 合作推出 OpenEnv Hub,一个面向智能体环境的开放社区共享平台,开发者可构建、分享和探索兼容 OpenEnv 的环境,用于训练和部署。
推荐理由:Meta 与 Hugging Face 联合推出智能体环境共享 Hub,并同步开放 0.1 规范草案,读者可据此了解智能体训练与部署的开放协作方式。
Sentence Transformers 从 TU Darmstadt 的 UKP Lab 转由 Hugging Face 维护,Hugging Face 的 Tom Aarsen 自 2023 年底起已负责维护并将继续领导该项目。
Hugging Face 宣布与威胁情报与恶意软件分析平台 VirusTotal 合作,即日起对 Hub 上 220 万以上公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动将文件哈希与 VirusTotal 威胁情报库比对,返回干净或恶意状态及检测数量等元数据,不向 VirusTotal 共享原始文件内容。
Hugging Face 发布指南,介绍如何用开源模型构建 OCR 流水线,并新增 Chandra 与 OlmOCR-2 两个模型及 OlmOCR 评测分数。指南覆盖当前 OCR 模型能力、微调与开箱即用的取舍、模型选型要点,以及用多模态检索和文档问答超越传统 OCR。
Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉能力,可在表格中查看、分析、提取图像信息,并生成和编辑图片,全程无需写代码。图像列支持描述分类、抽取结构化数据(如收据商户名、日期、金额)和添加元数据,文本列与图像列可在同一工作流中生成与转换内容,结果可导出为 CSV、Parquet 或上传至 Hub。
Hugging Face 发起 AI for Food Allergies 项目,计划建设首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生和患者。
Intel 与 Hugging Face 联合测试显示,在搭载 Intel Xeon 6 处理器(Granite Rapids)的 Google Cloud C4 虚拟机上运行 OpenAI GPT OSS 大模型,总拥有成本(TCO)较上一代 C3 实例提升 1.7 倍,即 70%。
Hugging Face 博客给出在 Intel CPU 上本地运行视觉语言模型(VLM)的三步流程:用 Optimum Intel 与 OpenVINO 将 SmolVLM2-256M-Video-Instruct 转换为 OpenVINO IR,再通过仅权重量化或静态量化压缩至 INT8,最后执行推理。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口、地理与文化分布的开放合成 Indic 人物数据集,采用 CC BY 4.0 许可。
BigCode 项目发布 BigCodeArena,这是首个通过实际执行代码来评测代码生成模型的人类参与平台,用户可提交编程任务、对比两个模型的生成结果并运行代码后投票。
推荐理由:BigCodeArena 把代码执行结果引入人类投票评测,读者可据此了解代码模型评测为何需要运行而非只看源码。
Hugging Face 博客发布三部分系列的第一篇,记录如何将 RedNote 的 3B OCR 模型 dots.ocr 转换为可在 Apple 设备端运行的 Core ML 模型。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用于评估 embedding 模型在真实应用中的检索准确率。该基准采用公开与私有数据集混合策略,私有部分由 MTEB 维护者评测,以检测模型在未见数据上的泛化能力,覆盖 20 种语言及法律、医疗、代码、金融等领域,默认榜单指标为 NDCG@10。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B,以 Qwen3-0.6B 作草稿模型进行投机解码,生成速度提升约 1.3 倍。
针对 Vibe Coding 游戏项目随规模增长而失控的问题,作者推出 VibeGame——一个基于 three.js、rapier 和 bitecs 构建的高层声明式游戏引擎,专为 AI 辅助游戏开发设计。
Hugging Face 的 Swift 库 swift-transformers 发布 1.0,为 Apple 平台本地模型推理提供 Tokenizers、Hub 及 Core ML 模型与生成模块。
Hugging Face 发布 Smol2Operator,基于 SmolVLM2-2.2B-Instruct 通过两阶段训练将其从零 GUI 定位能力打造成可执行点击、输入等操作的智能体式 GUI coder。第一阶段先建立界面元素定位能力,第二阶段用 SFT 增强智能体推理,在 ScreenSpot-v2 基准上评估,并开源全部训练配方、数据处理工具、模型、demo 与数据集。
Hugging Face 发布 SyGra,一个面向 LLM 和 SLM 的低代码/无代码数据构建框架,支持从 Q&A、SFT 到 DPO 偏好对、推理增强、多语言转换等数据集生成与转换。SyGra 提供 Python 库,兼容 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,可减少人工数据整理与工程投入。
Hugging Face 发布 GAIA 的后续基准 Gaia2,并配套开源 Meta Agents Research Environments(ARE)框架,用于运行、调试和评测智能体。
推荐理由:Gaia2 把智能体评测从只读检索扩展到读写交互,并给出可复现的开源环境与调试轨迹。
Hugging Face Hub 新增 Scaleway 为 Inference Provider,用户可直接在模型页调用 gpt-oss、Qwen3、DeepSeek R1、Gemma 3 等开源模型。
Hugging Face 博客宣布由 Cloud Security Alliance 和 Noma Security 主导、Haize Labs 与 Harmonic Security 参与贡献的 RiskRubric.ai,为模型提供标准化风险评估。
推荐理由:原文给出六个风险维度的评分框架与首批评测分布,读者可据此理解模型安全评估的标准化路径。
Hugging Face Hub 新增 Public AI 为 Inference Provider,用户可直接调用 Swiss AI Initiative、AI Singapore 等机构的公共与主权模型。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,并用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集下的文件系统瓶颈。
Hugging Face 在 Gradio 中内置可见水印功能,创建 Space 时只需添加 watermark 参数即可为图像和视频加水印,如 gr.Image(my_generated_image, watermark=my_watermark_image)。该功能支持文件名、图像或 numpy 数组作为水印,还支持 QR 水印,并可为 AI 生成文本添加水印,用户复制文本时自动附带署名。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两款经 CoT 训练的推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Hugging Face 发布博客,介绍为支持 OpenAI gpt-oss 系列而在 transformers 中做的多项升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口层与缓存、连续批处理与 Paged Attention,以及更快的模型加载。
推荐理由:Hugging Face 官方拆解了为 gpt-oss 引入 transformers 的七项工程改动,可据此了解量化、并行与缓存优化的落地方式。
Together AI 与 Hugging Face 联合推出新能力,Hugging Face Hub 上任意兼容的 LLM 均可通过 Together AI 基础设施微调,支持公开和私有仓库,训练完成后可自动回传至 Hub。
Hugging Face 发布 Jupyter Agent 项目,用约 2TB Kaggle notebook 经去重、教育性打分、QA 与轨迹生成,构建出 51k 合成 notebook、近 0.2B token 的数据集,微调 Qwen3-4B 做数据分析智能体。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在 3T+ tokens、1800 多种语言上训练,成为首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用 Gemma 2 tokenizer,训练分三阶段将语言数从 60 逐步扩展至 1833,并引入逆掩码率调度与退火语言学习等新技术。
Google 发布 EmbeddingGemma,一款面向端侧场景的多语言嵌入模型,308M 参数、2K 上下文窗口,支持 100 多种语言,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的可用边界。
SandboxAQ 在 Hugging Face 开源 SAIR 数据集,包含超 500 万个 AI 生成的蛋白质-配体 3D 结构,每个结构均配对 ChEMBL 或 BindingDB 的实验 IC₅₀ 数据,采用 CC BY 4.0 许可免费开放。
Hugging Face 介绍在 ZeroGPU Spaces 中使用 PyTorch 提前编译(AoT)的方法,通过 spaces 包的 aoti_capture、aoti_compile 和 aoti_apply 等接口,把模型编译一次后即时重载,避免 torch.compile 在短生命周期进程中反复编译。