LeRobot 社区数据集:机器人领域的“ImageNet”何时到来、如何实现?
Hugging Face 的 LeRobot 项目正推动社区共建机器人数据集,目标是打造机器人领域的“ImageNet”。目前 Hub 上的 lerobot 数据集数量快速增长,贡献主要集中在 So100 和 Koch 机械臂,聚焦操作任务。文章将泛化视为数据问题,呼吁通过简化录制流程、降低硬件成本来扩大数据多样性。
Hugging Face 的 LeRobot 项目正推动社区共建机器人数据集,目标是打造机器人领域的“ImageNet”。目前 Hub 上的 lerobot 数据集数量快速增长,贡献主要集中在 So100 和 Koch 机械臂,聚焦操作任务。文章将泛化视为数据问题,呼吁通过简化录制流程、降低硬件成本来扩大数据多样性。
Gradio 官方发布教程,介绍如何用几行 Python 把 Gradio 应用变成 MCP Server,让 LLM 以工具形式调用其中的函数。
推荐理由:Gradio 官方给出把任意 Python 函数变成 MCP 工具的完整步骤,可据此把自家模型接口接入 LLM 工具调用。
Qwen-3 的 chat template 相比 Qwen-2.5 和 QwQ 有四项关键变化:通过 enable_thinking 标志可将推理设为可选,而非像 QwQ 那样强制链式推理。
ServiceNow 开源实验性 RL 实现 PipelineRL,核心是在 RL 训练中做 inflight 权重更新,推理不中断即可接收新权重,从而维持高推理吞吐并减少 rollout 权重与最新模型权重之间的滞后。
推荐理由:原文给出开源仓库与训练契约设计,读者可据此判断大规模 RL 训练中吞吐与 on-policy 数据如何兼顾。
Hugging Face 发布 Tiny Agents 教程,用约 50 行 TypeScript 代码在 InferenceClient 之上实现 MCP 客户端和智能体,智能体本质是工具调用循环。
推荐理由:作者以 Hugging Face 官方身份给出可运行的 MCP 客户端与智能体实现,读者可据此理解工具调用如何串起一个最小智能体。
TNG 基于 olmOCR-7B-0225-preview 微调出忠实版 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,微调后模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。该模型已在 Hugging Face 开源。
TNG 在 24 块 H100 GPU 集群上自托管多个大语言模型,支撑 50 个应用、每小时超 5,000 次推理、每天生成超一千万 token。文章解析 LLM 生成的两个阶段:prefill 阶段可并行处理全部输入 token,decode 阶段只能逐个生成输出 token,二者分别对应首 token 延迟和单 token 延迟两项指标。
Gradio 官方博客列出 17 个理由,说明它不只是 Python UI 库,而是同时提供 UI 与 API 的机器学习交互框架。所有 Gradio 应用自带 REST API 端点,并提供 Python(gradio_client)和 JavaScript(@gradio/client)官方 SDK 及 cURL 访问。
Mistral 提出用 LLM as a Judge 配合结构化输出实现 RAG Triad 评估框架,从上下文相关性、有据性和答案相关性三个维度打分。该框架由 TruLens 提出,RAGAS 等类似方案也已出现,用于端到端评估 RAG 系统的检索与生成质量。Mistral 模型可同时充当生成器和评判器,结构化输出让评分标准可复用且易于机器读取。
Gradio 月活开发者已超过 100 万,被 Automatic1111、LLaMA-Factory 等热门开源项目使用。Hugging Face 回顾其五年增长经验:坚持投入底层原语而非高层抽象,如今 gr.Blocks 占 Gradio 使用量的 80%;专注机器学习 Web 应用这一细分场景,并借助 share links 和 Hugging Face Spaces 实现病毒式传播。
Hugging Face 将其已运营 3 年的 NLP Course 更名为 LLM Course,并新增微调 LLM、构建 Deepseek R1 等推理模型的章节。
TNG Technology Consulting 分享了自托管 LLM 服务中通过公平调度优化请求排队的方法:在 vLLM 等推理引擎前加一层 LLM-Server,为每个用户和模型维护独立队列,用轮询调度替代 FIFO,避免单个用户的大量请求阻塞其他人。
Hugging Face 将密钥管理从 AWS 单云方案迁移到 Infisical,以应对多云环境下的密钥散乱、权限管理和手动轮换难题。团队通过 Infisical Kubernetes Operator 自动同步密钥更新,并借助 Okta 集成实现细粒度 RBAC,同时用 CLI 替代本地 .env 文件。
Hugging Face 发布教程,介绍如何用 Sentence Transformers 库微调 reranker(Cross Encoder)模型,涵盖数据集、损失函数、训练参数、评估器与 Trainer 等组件。
Hugging Face 发布教程,介绍如何在本地通过 LM Studio 运行 OlympicCoder 7B 的 4bit GGUF 量化版,并接入 VS Code 的 Continue 扩展实现代码补全、生成、解释、重构和写测试。
Hugging Face 发布教程,讲解如何用 React Native 和 llama.rn 构建一个从 Hugging Face Hub 下载 GGUF 模型并在手机本地推理的聊天应用,代码开源在 EdgeLLM 仓库。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动的 PRDAgent 和 TicketCreationAgent 组成,可将会议转录自动生成 PRD 并转化为结构化开发工单,自动在 Linear、Jira 等项目管理工具中创建。
Hugging Face 博客介绍如何用 Arize Phoenix 对基于 smolagents 构建的 Agent 进行追踪与评估,通过 OpenTelemetry 和 OpenInference 自动捕获每次 Agent 调用。
Hugging Face 博客实测了 10 亿次分类与嵌入推理的成本:在 nvidia-L4($0.8/hr)上,135M 的 DistilBERT 分类模型处理 10 亿输入需 $253.82,149M 的 gte-modernbert-base 嵌入需 $409.44,2.21B 的 ColQwen2 视觉嵌入则高达 $44,496.51。
Hugging Face 发布了一套用于构建视频生成数据集的开源工具链,采用三阶段流水线:用 yt-dlp 下载视频并切分为短片段,再通过 LAION-5B-WatermarkDetection。
Hugging Face 开源了复现 OpenAI Deep Research 的 Open DeepResearch 框架,在 GAIA 验证集上达到 55.15%,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research 并开源框架,给出了 GAIA 上的对比数字与代码智能体的取舍依据。
OpenAI 展示如何基于 ChatGPT 构建自定义数学辅导工具,将 ChatGPT 用于个性化辅导场景。内容围绕 ChatGPT 与个性化辅导展开,说明如何把通用对话模型改造成面向数学学习的专属辅导助手。
这篇教程用 GRPO 和 Countdown Game 复现 DeepSeek R1 的 aha moment,基于 Qwen2.5-3B-Instruct 在 4x H100 上训练,450 步后解题成功率达 50%。
推荐理由:完整复现流程与训练观察记录,可看到小模型在 RL 下从文字推理转向程序化求解的过程。
Hugging Face 发布指南,介绍如何在 AWS 上部署和微调 DeepSeek-R1 系列模型。
Hugging Face Diffusers 团队梳理了开源视频生成模型的现状,列出 CogVideoX、Mochi-1、HunyuanVideo、Allegro、LTX Video 等开放模型与 Sora、Veo 2、Kling 等闭源模型的对照。
推荐理由:Diffusers 团队梳理开源视频生成模型现状,并给出显存优化与微调的实测数据,可据此评估本地部署门槛。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。该工具约 5 行代码即可用 bitsandbytes 完成量化,并支持 torch.compile 加速推理与 LoRA 适配器微调,微调后模型还能回到 timm 使用。
Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1,在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。
推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此判断低算力场景下嵌入推理的可行边界。
Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录显存快照、导出 profile.pkl 并在 pytorch.org/memory_viz 可视化,逐步拆解模型创建、前向、反向和优化器各阶段的显存变化。
推荐理由:原文给出 PyTorch 显存快照的可视化步骤与显存估算公式,读者可据此定位训练中的显存峰值来源。
NVIDIA 推出 LogitsProcessorZoo,一组模块化 logits 处理器,可在 Hugging Face Transformers 的 generate 方法中直接修改预测分数,实现控制序列长度、强制关键短语、引导多选题答案等任务。
Hugging Face 在 Google Cloud 的 N2 与 C4 实例上基准测试了文本嵌入和文本生成两类智能体 AI 负载,C4 的文本嵌入吞吐量是 N2 的 10x 至 24x,文本生成吞吐量是 N2 的 2.3x 至 3.6x。
Capital Fund Management(CFM)借助 Hugging Face Inference Endpoints 部署 Llama 3.1-70b-Instruct 生成标注、再用 Argilla 人工复核,微调出的小模型在金融命名实体识别上准确率最高提升 6.4%,推理成本较大模型低至 80 倍。
Hugging Face 发布开源开发者指南,解读已正式生效的欧盟 AI 法案(EU AI Act)。法案按风险分级监管,仅通用目的 AI(GPAI)模型被直接监管,训练算力超 10^25 FLOPs 的模型被认定存在系统性风险。多数开源项目只需提供清晰文档、模型信息披露并遵守现有版权与隐私规则,Hugging Face 提供模型卡、数据集卡、Gradio 水印及个人数据脱敏等工具协助合规。
Hugging Face 博客通过逐步改进位置编码方案,推导出 Llama 3.2 及多数现代 Transformer 使用的旋转位置编码(RoPE)。文章以 Llama 3.2 1B 为例,演示无位置信息时自注意力对同一 token 在不同位置输出完全相同,并提出位置编码应满足唯一性、线性关系、长度泛化、确定性生成和可扩展至多维等五项理想属性。
OpenAI 发布案例,展示如何用 GPT-4o 的视觉微调能力构建更智能的地图。
Hugging Face 博客介绍 LayerSkip 提出的自推测解码,用同一 LLM 的浅层生成 draft token、深层负责验证,无需额外小模型即可加速文本生成并降低显存占用。
Hugging Face 的 Xet 团队正用内容定义分块(CDC)把文件拆成可变大小的块,只传输和存储被修改的块,从而提升存储效率与迭代速度。在 CORD-19 数据集基准中,Xet 后端相比 Git LFS 平均下载时间从 51 分钟降至 19 分钟、上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),通过双向 tokenizer 转换让目标模型与任意模型族的助手模型配对,从而加速推理。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的通用辅助生成方法,读者可了解其如何让任意小模型充当助手并带来 1.5x-2.0x 推理加速。
CGIAR 与 Digital Green 在 Hugging Face 专家支持下为农业问答机器人 Farmer.chat 搭建了 LLM-as-a-Judge 评估体系,用于衡量 RAG 回答的质量、简洁度与准确性。
Hugging Face 发布 Speech-to-Speech(S2S)级联流水线,串联 VAD、STT、语言模型与 TTS,支持英语、法语、西班牙语、中文、日语和韩语,可用单语言模式或 auto 标志自动检测语言。由于本地运行对算力要求高、易出现延迟,官方给出用自定义 Docker 镜像将其部署到 Hugging Face Inference Endpoints 的分步指南。
Keras 从 day 1 起就支持 Llama 3.2,可直接从 Hugging Face 的 safetensors checkpoint 加载,包括 3.2 版本,需要转换时会在运行中即时完成。