Hugging Face AI Sheets 新增图像支持
Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉能力,可在表格中查看、分析、提取图像信息,并生成和编辑图片,全程无需写代码。图像列支持描述分类、抽取结构化数据(如收据商户名、日期、金额)和添加元数据,文本列与图像列可在同一工作流中生成与转换内容,结果可导出为 CSV、Parquet 或上传至 Hub。
Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉能力,可在表格中查看、分析、提取图像信息,并生成和编辑图片,全程无需写代码。图像列支持描述分类、抽取结构化数据(如收据商户名、日期、金额)和添加元数据,文本列与图像列可在同一工作流中生成与转换内容,结果可导出为 CSV、Parquet 或上传至 Hub。
Hugging Face 发起 AI for Food Allergies 项目,计划建设首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生和患者。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口、地理与文化分布的开放合成 Indic 人物数据集,采用 CC BY 4.0 许可。
BigCode 项目发布 BigCodeArena,这是首个通过实际执行代码来评测代码生成模型的人类参与平台,用户可提交编程任务、对比两个模型的生成结果并运行代码后投票。
推荐理由:BigCodeArena 把代码执行结果引入人类投票评测,读者可据此了解代码模型评测为何需要运行而非只看源码。
针对 Vibe Coding 游戏项目随规模增长而失控的问题,作者推出 VibeGame——一个基于 three.js、rapier 和 bitecs 构建的高层声明式游戏引擎,专为 AI 辅助游戏开发设计。
Hugging Face 的 Swift 库 swift-transformers 发布 1.0,为 Apple 平台本地模型推理提供 Tokenizers、Hub 及 Core ML 模型与生成模块。
Hugging Face 发布 Smol2Operator,基于 SmolVLM2-2.2B-Instruct 通过两阶段训练将其从零 GUI 定位能力打造成可执行点击、输入等操作的智能体式 GUI coder。第一阶段先建立界面元素定位能力,第二阶段用 SFT 增强智能体推理,在 ScreenSpot-v2 基准上评估,并开源全部训练配方、数据处理工具、模型、demo 与数据集。
Hugging Face 发布 SyGra,一个面向 LLM 和 SLM 的低代码/无代码数据构建框架,支持从 Q&A、SFT 到 DPO 偏好对、推理增强、多语言转换等数据集生成与转换。SyGra 提供 Python 库,兼容 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,可减少人工数据整理与工程投入。
Hugging Face 发布 GAIA 的后续基准 Gaia2,并配套开源 Meta Agents Research Environments(ARE)框架,用于运行、调试和评测智能体。
推荐理由:Gaia2 把智能体评测从只读检索扩展到读写交互,并给出可复现的开源环境与调试轨迹。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,并用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集下的文件系统瓶颈。
Hugging Face 在 Gradio 中内置可见水印功能,创建 Space 时只需添加 watermark 参数即可为图像和视频加水印,如 gr.Image(my_generated_image, watermark=my_watermark_image)。该功能支持文件名、图像或 numpy 数组作为水印,还支持 QR 水印,并可为 AI 生成文本添加水印,用户复制文本时自动附带署名。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两款经 CoT 训练的推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Hugging Face 发布 Jupyter Agent 项目,用约 2TB Kaggle notebook 经去重、教育性打分、QA 与轨迹生成,构建出 51k 合成 notebook、近 0.2B token 的数据集,微调 Qwen3-4B 做数据分析智能体。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在 3T+ tokens、1800 多种语言上训练,成为首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用 Gemma 2 tokenizer,训练分三阶段将语言数从 60 逐步扩展至 1833,并引入逆掩码率调度与退火语言学习等新技术。
SandboxAQ 在 Hugging Face 开源 SAIR 数据集,包含超 500 万个 AI 生成的蛋白质-配体 3D 结构,每个结构均配对 ChEMBL 或 BindingDB 的实验 IC₅₀ 数据,采用 CC BY 4.0 许可免费开放。
Hugging Face 发布 kernel-builder 库,让开发者可在本地开发自定义 CUDA kernel,再为多种架构构建并发布到 Hugging Face Hub 供他人通过 get_kernel 直接调用。
Hugging Face 发布开源训练管线 kimina-prover-rl,用于 Lean 4 形式化定理证明,基于 DeepSeek-R1 启发的"先推理后生成"范式,并完全兼容 verl 框架。
Hugging Face 推出 FilBench 评测套件,覆盖 Tagalog、Filipino 和 Cebuano 三种菲律宾语言,包含文化知识、经典 NLP、阅读理解与生成四大类共 12 项任务,并已评测 20+ 个 SOTA LLM。
Hugging Face 发布开源无代码工具 AI Sheets,可在类电子表格界面中通过提示词新建列,用开放模型构建、转换和增强数据集。工具支持从 Hub 调用数千个开放模型或本地模型,也可从自然语言描述直接生成数据集,导入支持 XLS、TSV、CSV、Parquet,单次最多 1000 行。
推荐理由:Hugging Face 官方开源的无代码表格工具,读者可了解如何用开放模型批量构建与增强数据集。
Hugging Face 的 TRL 新增面向视觉语言模型的对齐能力,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 与 Online DPO 支持 VLM。
推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本与 notebook。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开源权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开源模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开源两款权重模型并给出尺寸与许可,读者可据此判断消费级硬件上的部署与推理选择。
OpenAI 发布开源权重模型家族 gpt-oss,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,两者均为 MoE 架构并采用 MXFP4 4-bit 量化,激活参数分别为 5.1B 和 3.6B,采用 Apache 2.0 许可。
推荐理由:Hugging Face 汇总了 gpt-oss 两个开源模型的参数、量化方案与各推理框架的适配情况,可据此判断本地部署门槛。
Hugging Face 推出 3LM(علم),一个评估阿拉伯语 LLM 在 STEM 与代码生成任务上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成高难度选择题,以及翻译自 HumanEval+ 和 MBPP+ 的阿拉伯语代码基准。
Mistral AI 发布 Codestral 25.08 代码模型,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。Codestral 25.08 相比前代补全接受率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,支持云、VPC 与本地部署。
推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。
Hugging Face 发布开源免费的实验追踪 Python 库 Trackio,提供本地 Gradio 仪表盘并支持同步到 Hugging Face Spaces 分享。
推荐理由:Hugging Face 官方开源实验追踪库,兼容 wandb API 且可同步到 Spaces 分享,读者可据此判断迁移成本。
Hugging Face 官方 CLI 从 huggingface-cli 正式更名为 hf,命令按资源分组为 hf auth、hf cache、hf repo 等,并保留 hf upload、hf download 在根层级。
Hugging Face 开源长视频理解基准 TimeScope,通过在 1 分钟至 8 小时的视频中插入 5-10 秒的"needle"片段,评测模型的局部检索、信息综合与细粒度时序感知三项能力。结果显示,包括 Gemini 2.5-Pro 在内的领先视觉语言模型在真正的长视频时序理解上仍表现吃力,性能随视频变长明显下滑。
Hugging Face 发布针对 Flux.1-Dev 的 LoRA 推理优化配方,结合 Flash Attention 3、torch.compile 与 FP8 量化,在 H100 上相比基线实现 2.23 倍加速。
推荐理由:原文给出可复用的 LoRA 推理优化配方与实测延迟数据,读者可据此判断热切换与量化在自有硬件上的取舍。
Gradio 5.38.0 为 MCP Server 带来五项改进:新增 "File Upload" MCP server 让智能体直接上传文件,支持实时进度通知,并可通过 gr.load_openapi 一行代码将 OpenAPI 规范转为 MCP 工具。此外新增 gr.Header 类型自动提取认证请求头,并支持用 api_description 参数自定义工具描述。
Consilium 是一个在 Gradio Agents & MCP Hackathon 期间构建的多 LLM 平台,让多个 AI 模型通过结构化辩论讨论复杂问题并达成共识,同时提供可视化 Gradio 界面和 MCP server 两种形态。
Hugging Face 发布 Ettin 套件,这是首个用完全相同的数据(2T tokens)、架构和训练配方训练的 SoTA 配对编码器与解码器模型系列,参数规模覆盖 17M 到 1B。
Mistral 发布 Voxtral 语音理解模型,提供 24B 生产版和 3B 本地与端侧版,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备音频问答、摘要、多语言自动检测和语音直接触发函数调用能力,并保留 Mistral Small 3.1 的文本能力。
推荐理由:Mistral 开源两款语音理解模型,给出 32k 上下文、多语言与函数调用能力及低于同类 API 一半的价格,可据此判断开源语音方案的可用边界。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1,两款模型均强调对不同提示词和智能体框架的泛化能力。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
Numina 与 Kimi 团队发布基于 Qwen2.5-72B、采用 Kimi k1.5 RL 流程训练的定理证明模型 Kimina-Prover-72B,同时开源基于 Qwen3-8B 和 Qwen3-1.7B 的两个蒸馏版本。
推荐理由:原文给出 Kimina-Prover 系列在 miniF2F 上的成绩与 TTRL 搜索、错误修复两项方法细节,可据此了解形式化定理证明的当前进展。
Hugging Face 发布 ScreenEnv,一个可在 Docker 容器中创建隔离 Ubuntu 桌面环境的 Python 库,用于测试和部署 GUI 智能体(Computer Use 智能体),支持 AMD64 与 ARM64,环境部署时间不到 10 秒。
推荐理由:ScreenEnv 把桌面智能体的运行环境收敛到 Docker 沙箱,并同时提供 MCP 与直连 API 两种接入方式,便于对照现有智能体框架的部署路径。
Hugging Face 发布官方 MCP Server(hf.co/mcp),通过一个 URL 让 AI 助手访问 Hub 与 Spaces 上的数千个 AI 应用,并支持用户动态配置工具。生产环境采用 Streamable HTTP 传输的无状态 Direct Response 配置,开源代码同时支持 STDIO、SSE 和 Streamable HTTP 部署。
Hugging Face 发布博客详解异步机器人推理,通过将动作预测与执行解耦,让机器人在 PolicyServer 计算下一段动作时持续执行当前动作队列,从而消除等待推理的空闲时间。该方案在 SmolVLA 上实现约 2 倍任务完成速度提升,任务成功率相当,PolicyServer 与 RobotClient 之间通过 gRPC 通信,性能约为同类 REST API 的 5 倍。
Hugging Face 与 Pollen Robotics 发布开源机器人 Reachy Mini,Lite 版 399 美元、带板载计算与电池的无线版 499 美元,预计约 90 天发货。
推荐理由:原文给出了开源桌面机器人的价格、硬件配置与 Python SDK 入口,读者可据此判断它能否用于机器人 AI 实验。
Hugging Face 与 AMD 合作,为 AMD MI300X 编写了三个开源自定义内核——融合残差连接/RMS norm/FP8 转换内核、融合 SwiGLU 激活/FP8 转换内核和 Skinny GEMM 内核,用于在 8 卡 MI300X 节点上通过 VLLM 加速 Llama 3.1 405B 的 FP8 推理。
Hugging Face 发布 SmolLM3,一个完全开源的 3B 模型,在 11T token 上训练,支持 6 种语言和最长 128k 上下文,并提供 think / no_think 双模式推理。
推荐理由:Hugging Face 公开了 3B 模型的完整训练配方与数据配比,读者可据此复现或改进同规模模型。