跳到正文
9月22日周一
9月16日周二
9月15日周一
  1. Hugging Face Blog22

    Hugging Face 用 Gradio 为 AI 生成内容添加可见水印

    Hugging Face 在 Gradio 中内置可见水印功能,创建 Space 时只需添加 watermark 参数即可为图像和视频加水印,如 gr.Image(my_generated_image, watermark=my_watermark_image)。该功能支持文件名、图像或 numpy 数组作为水印,还支持 QR 水印,并可为 AI 生成文本添加水印,用户复制文本时自动附带署名。

9月12日周五
9月10日周三
9月9日周二
  1. Hugging Face Blog50

    Hugging Face 发布 mmBERT:基于 ModernBERT 的多语言编码器,覆盖 1800+ 语言

    Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在 3T+ tokens、1800 多种语言上训练,成为首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用 Gemma 2 tokenizer,训练分三阶段将语言数从 60 逐步扩展至 1833,并引入逆掩码率调度与退火语言学习等新技术。

9月3日周三
8月18日周一
8月14日周四
8月12日周二
8月8日周五
  1. Hugging Face Blog62

    Hugging Face 发布 AI Sheets:用开放模型处理数据集的无代码工具

    Hugging Face 发布开源无代码工具 AI Sheets,可在类电子表格界面中通过提示词新建列,用开放模型构建、转换和增强数据集。工具支持从 Hub 调用数千个开放模型或本地模型,也可从自然语言描述直接生成数据集,导入支持 XLS、TSV、CSV、Parquet,单次最多 1000 行。

    推荐理由:Hugging Face 官方开源的无代码表格工具,读者可了解如何用开放模型批量构建与增强数据集。

8月7日周四
8月5日周二
  1. OpenAI News82

    OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 两款开源权重模型

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开源权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开源模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。

    推荐理由:OpenAI 开源两款权重模型并给出尺寸与许可,读者可据此判断消费级硬件上的部署与推理选择。

  2. Hugging Face Blog83

    OpenAI 发布开源模型家族 gpt-oss,含 117B 与 21B 两个版本

    OpenAI 发布开源权重模型家族 gpt-oss,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,两者均为 MoE 架构并采用 MXFP4 4-bit 量化,激活参数分别为 5.1B 和 3.6B,采用 Apache 2.0 许可。

    推荐理由:Hugging Face 汇总了 gpt-oss 两个开源模型的参数、量化方案与各推理框架的适配情况,可据此判断本地部署门槛。

8月1日周五
7月30日周三
  1. Mistral AI62

    Mistral 发布 Codestral 25.08 及企业级编码栈

    Mistral AI 发布 Codestral 25.08 代码模型,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。Codestral 25.08 相比前代补全接受率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,支持云、VPC 与本地部署。

    推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。

7月29日周二
7月25日周五
7月23日周三
  1. Hugging Face Blog42

    TimeScope:你的视频大模型能看多长的视频?

    Hugging Face 开源长视频理解基准 TimeScope,通过在 1 分钟至 8 小时的视频中插入 5-10 秒的"needle"片段,评测模型的局部检索、信息综合与细粒度时序感知三项能力。结果显示,包括 Gemini 2.5-Pro 在内的领先视觉语言模型在真正的长视频时序理解上仍表现吃力,性能随视频变长明显下滑。

7月17日周四
7月16日周三
7月15日周二
  1. Mistral AI78

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

    Mistral 发布 Voxtral 语音理解模型,提供 24B 生产版和 3B 本地与端侧版,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备音频问答、摘要、多语言自动检测和语音直接触发函数调用能力,并保留 Mistral Small 3.1 的文本能力。

    推荐理由:Mistral 开源两款语音理解模型,给出 32k 上下文、多语言与函数调用能力及低于同类 API 一半的价格,可据此判断开源语音方案的可用边界。

7月11日周五
7月10日周四
  1. Hugging Face Blog60

    Numina 与 Kimi 团队发布 Kimina-Prover-72B 定理证明模型

    Numina 与 Kimi 团队发布基于 Qwen2.5-72B、采用 Kimi k1.5 RL 流程训练的定理证明模型 Kimina-Prover-72B,同时开源基于 Qwen3-8B 和 Qwen3-1.7B 的两个蒸馏版本。

    推荐理由:原文给出 Kimina-Prover 系列在 miniF2F 上的成绩与 TTRL 搜索、错误修复两项方法细节,可据此了解形式化定理证明的当前进展。

  2. Hugging Face Blog62

    Hugging Face 发布 ScreenEnv,在 Docker 中部署桌面智能体

    Hugging Face 发布 ScreenEnv,一个可在 Docker 容器中创建隔离 Ubuntu 桌面环境的 Python 库,用于测试和部署 GUI 智能体(Computer Use 智能体),支持 AMD64 与 ARM64,环境部署时间不到 10 秒。

    推荐理由:ScreenEnv 把桌面智能体的运行环境收敛到 Docker 沙箱,并同时提供 MCP 与直连 API 两种接入方式,便于对照现有智能体框架的部署路径。

  3. Hugging Face Blog50

    Hugging Face 详解异步机器人推理:解耦动作预测与执行

    Hugging Face 发布博客详解异步机器人推理,通过将动作预测与执行解耦,让机器人在 PolicyServer 计算下一段动作时持续执行当前动作队列,从而消除等待推理的空闲时间。该方案在 SmolVLA 上实现约 2 倍任务完成速度提升,任务成功率相当,PolicyServer 与 RobotClient 之间通过 gRPC 通信,性能约为同类 REST API 的 5 倍。

7月9日周三
7月8日周二
7月1日周二
6月28日周六
6月19日周四
  1. Hugging Face Blog62

    如何在消费级硬件上用 QLoRA 微调 FLUX.1-dev

    Hugging Face 发布教程,介绍用 diffusers 库和 QLoRA 在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以下。在 RTX 4090 上,QLoRA 峰值显存约 9GB,标准 BF16 LoRA 需 26GB,700 步训练约 41 分钟。

    推荐理由:原文给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,可据此复现低显存训练流程。

6月12日周四
6月10日周二
6月6日周五
6月4日周三
  1. Hugging Face Blog22

    nanoVLM 从零实现 KV Cache,生成速度提升 38%

    Hugging Face 的 nanoVLM 仓库从零实现了 KV Cache,使生成速度提升 38%。nanoVLM 是一个用纯 PyTorch 训练自研视觉语言模型的轻量代码库,KV Cache 在 Attention 块、语言模型和生成循环三处启用,将生成从全序列重算改为增量更新。相关经验可推广到所有自回归语言模型生成。