Intel 推出 AutoRound:面向 LLM 与 VLM 的先进量化工具
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,支持 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,支持 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟。
ServiceNow 开源实验性 RL 实现 PipelineRL,核心是在 RL 训练中做 inflight 权重更新,推理不中断即可接收新权重,从而维持高推理吞吐并减少 rollout 权重与最新模型权重之间的滞后。
推荐理由:原文给出开源仓库与训练契约设计,读者可据此判断大规模 RL 训练中吞吐与 on-policy 数据如何兼顾。
Hugging Face 发布 Tiny Agents 教程,用约 50 行 TypeScript 代码在 InferenceClient 之上实现 MCP 客户端和智能体,智能体本质是工具调用循环。
推荐理由:作者以 Hugging Face 官方身份给出可运行的 MCP 客户端与智能体实现,读者可据此理解工具调用如何串起一个最小智能体。
TNG 基于 olmOCR-7B-0225-preview 微调出忠实版 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,微调后模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。该模型已在 Hugging Face 开源。
Hugging Face 发布 HELMET(How to Evaluate Long-Context Models Effectively and Thoroughly),一个从多样性、可控性和可靠性三方面改进的长上下文语言模型评测基准,已评估 59 个近期 LCLM。
Cohere 正式成为 Hugging Face Hub 上支持的 Inference Provider,也是首个直接在 Hub 上分享并托管自家模型的模型厂商。
Gradio 官方博客列出 17 个理由,说明它不只是 Python UI 库,而是同时提供 UI 与 API 的机器学习交互框架。所有 Gradio 应用自带 REST API 端点,并提供 Python(gradio_client)和 JavaScript(@gradio/client)官方 SDK 及 cURL 访问。
Hugging Face 宣布收购已成立 9 年的开源机器人公司 Pollen Robotics,这是其第五次收购,此前曾收购 Gradio 和 XetHub。
推荐理由:Hugging Face 收购 Pollen Robotics 并开卖开源人形机器人,读者可了解其开源机器人布局与 Reachy 2 的定位。
Protect AI 与 Hugging Face 合作半年,已扫描 Hugging Face Hub 上 141 万个仓库中的 447 万个模型版本,在 5.17 万个模型中识别出 35.2 万个不安全或可疑问题。
Hugging Face 与 Cloudflare 达成合作,让 FastRTC 开发者凭 Hugging Face token 即可接入 Cloudflare 覆盖 335 多个地点的全球 TURN 网络,构建低延迟实时语音与视频应用。
Hugging Face 与 MBZUAI 合作上线 Arabic-Leaderboards Space,统一收录阿拉伯语 AI 评测,目前包含 AraGen-03-25 和 Arabic Instruction Following 两个榜单。
Meta 发布 Llama 4 Maverick(约 400B 总参数)和 Llama 4 Scout(约 109B 总参数)两款原生多模态 MoE 模型,均为 17B 激活参数,权重已上线 Hugging Face 的 meta-llama 组织。
推荐理由:Meta 发布 Llama 4 两款 MoE 多模态模型,Hugging Face 同步给出架构细节与部署方式,便于判断长上下文与端侧部署取舍。
Gradio 月活开发者已超过 100 万,被 Automatic1111、LLaMA-Factory 等热门开源项目使用。Hugging Face 回顾其五年增长经验:坚持投入底层原语而非高层抽象,如今 gr.Blocks 占 Gradio 使用量的 80%;专注机器学习 Web 应用这一细分场景,并借助 share links 和 Hugging Face Spaces 实现病毒式传播。
Hugging Face 将其已运营 3 年的 NLP Course 更名为 LLM Course,并新增微调 LLM、构建 Deepseek R1 等推理模型的章节。
TNG Technology Consulting 分享了自托管 LLM 服务中通过公平调度优化请求排队的方法:在 vLLM 等推理引擎前加一层 LLM-Server,为每个用户和模型维护独立队列,用轮询调度替代 FIFO,避免单个用户的大量请求阻塞其他人。
Hugging Face 将密钥管理从 AWS 单云方案迁移到 Infisical,以应对多云环境下的密钥散乱、权限管理和手动轮换难题。团队通过 Infisical Kubernetes Operator 自动同步密钥更新,并借助 Okta 集成实现细粒度 RBAC,同时用 CLI 替代本地 .env 文件。
Hugging Face 通过 PR #3091 将 Intel Gaudi 硬件支持原生集成进 Text Generation Inference(TGI),不再需要维护独立的 tgi-gaudi 分支。
DeepSeek-V3-0324 本周上线 Hugging Face Hub,架构与初代 DeepSeek-V3 相同,但许可从自定义协议改为 MIT,改进重点是指令遵循、代码与数学能力。
推荐理由:DeepSeek-V3-0324 的基准提升与 MIT 许可变化,能帮读者判断开源基座模型的迭代节奏。
Hugging Face 发布教程,介绍如何用 Sentence Transformers 库微调 reranker(Cross Encoder)模型,涵盖数据集、损失函数、训练参数、评估器与 Trainer 等组件。
Gradio 为 gr.Dataframe 组件发布大规模更新,6 周内关闭超 70 个 dataframe 相关问题。新功能包括多单元格选择、行号与列固定(pinned_columns)、复制与全屏按钮、行列选择、静态列(static_columns)、搜索与过滤(show_search)等。
Hugging Face 为 Inference Endpoints 更新分析仪表盘,指标数据改为实时更新,并重构后端以加快高流量端点的数据加载。新增可自定义时间范围与自动刷新功能,同时引入副本生命周期视图,可追踪每个副本从初始化到终止的每次状态转换。
Hugging Face 发布教程,介绍如何在本地通过 LM Studio 运行 OlympicCoder 7B 的 4bit GGUF 量化版,并接入 VS Code 的 Continue 扩展实现代码补全、生成、解释、重构和写测试。
Hugging Face 于 3 月 14 日向白宫 OSTP 的 AI 行动计划 RFI 提交回应,主张开源与开放科学是 AI 性能、采用与安全的基础。
NVIDIA 在 GTC 2025 上发布三款面向物理 AI 的开源成果:世界基础模型 Cosmos Transfer、Physical AI Dataset 以及人形机器人基础模型 NVIDIA Isaac GR00T N1。
推荐理由:NVIDIA 在 GTC 2025 一次性开源世界模型、数据集与人形机器人基础模型,读者可据此了解物理 AI 开发可用的工具链。
Hugging Face 的 Xet 团队已将首批模型和数据集仓库从 LFS 迁移到 Xet 存储,迁移量约 4.5 TB,占 Hub 下载流量约 6%。Xet 采用内容定义分块(约 64KB)做字节级去重,改动小部分数据时只上传变化的块,官方举例称一个约 5 GB 的 SQLite 数据库追加 1 MB 数据,上传耗时从 LFS 下的 13 分钟降到 0.1 秒。
推荐理由:Hugging Face 官方复盘 Xet 存储首次迁移,给出块级去重带来的传输收益与迁移中暴露的工程问题。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens 每秒,采用 Apache 2.0 许可。
推荐理由:Mistral 官方给出小模型在文本、多模态与长上下文上的对比数据,可据此判断端侧部署的选型空间。
Google 发布 Gemma 3 系列开放权重模型,包含 1B、4B、12B、27B 四种尺寸,均有预训练和指令微调版本。4B、12B、27B 支持图像与文本输入及 140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k(1B 为 32k)。
推荐理由:梳理 Gemma 3 的四种尺寸、多模态与 128k 上下文等规格,并给出 transformers 与端侧推理的可用路径。
Hugging Face 的 Open R1 项目发布第三期更新,公开了约 10 万条由 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集、基于 2024 国际信息学奥林匹克(IOI)的 IOI 基准,以及微调 Qwen2.5 Coder Instruct 7B 和 32B 得到的 OlympicCoder-7B 与 OlympicCoder-32B。
推荐理由:Open R1 复现计划公开了数据集、基准与 7B/32B 模型,并给出五条蒸馏训练经验,可迁移到自建推理模型。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,称其为全球最大的开源自动驾驶数据集,R4 版本包含 100 万条 episode、5000+ 小时驾驶数据、90+ TB 规模,来自德国 30 座城市 60 辆驾校车辆的 6 路环视摄像头与车辆状态数据。
推荐理由:L2D 以 90TB 多模态驾驶数据接入 LeRobot 训练管线,可对比现有开源自驾数据集在规模与动作标注上的差异。
Hugging Face 发布教程,讲解如何用 React Native 和 llama.rn 构建一个从 Hugging Face Hub 下载 GGUF 模型并在手机本地推理的聊天应用,代码开源在 EdgeLLM 仓库。
Cohere For AI 发布 Aya Vision 系列 8B 和 32B 参数视觉语言模型,覆盖 23 种语言,并以开放权重形式发布。
推荐理由:Cohere For AI 公开了 Aya Vision 的架构、训练流程与评测基准,读者可据此了解多语言多模态模型的技术路线与开源权重。
Hugging Face 宣布与 JFrog 合作,将 JFrog 扫描器集成到 Hugging Face Hub,用于检测模型权重中的恶意代码。JFrog 扫描器能解析并分析模型权重中的代码,比仅做模块名模式匹配的 picklescan 更进一步,可减少误报并覆盖 Keras Lambda 层等更多文件格式的漏洞。所有公开模型仓库在推送文件后将自动被扫描,无需额外操作。
Hugging Face 博客介绍如何用 Arize Phoenix 对基于 smolagents 构建的 Agent 进行追踪与评估,通过 OpenTelemetry 和 OpenInference 自动捕获每次 Agent 调用。
Hugging Face 与印度科学理工学院 IISc/ARTPARK 达成合作,提升开源多模态多语言数据集 Vaani 的可访问性与可用性。Vaani 目标采集超 150,000 小时语音和 15,000 小时转写文本,覆盖印度全部 773 个地区、54 种语言;目前已开源 790 小时转写音频,来自约 7 万名说话者。
Hugging Face 发布 FastRTC,一个用 Python 构建实时音频和视频 AI 应用的通信库,内置语音检测与轮次切换、Gradio WebRTC UI,并支持 WebSocket 和挂载到 FastAPI。
推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。
Hugging Face Diffusers 团队实验性推出 Remote VAE,将潜空间扩散模型的 VAE 解码过程委托给远程 Inference Endpoints,以降低高分辨率图像和视频生成对消费级 GPU 的显存压力。
Google 发布 SigLIP 2 多语言视觉语言编码器系列,在 SigLIP 的 sigmoid loss 基础上加入解码器、自蒸馏 Global-Local Loss 与 Masked Prediction Loss 等训练目标,在零样本分类、图文检索和视觉表征迁移上均优于前代。
Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三个参数规模,并称 500M 与 256M 是迄今最小的视频语言模型。
推荐理由:Hugging Face 发布三档小尺寸视频理解模型,并给出端侧与 MLX 的可用路径,可据此判断小模型做视频理解的实际边界。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家无服务器推理提供商,支持 DeepSeek-R1、Flux.1 等模型,并已集成 JS 和 Python 客户端 SDK。用户可在账户设置中配置自有 API key 或通过 HF 路由调用,PRO 用户每月获赠 2 美元推理额度。
Hugging Face Hub 新增 Fireworks.ai 作为推理服务商,可直接在模型页及整个 HF 生态中调用其无服务器推理。