Hugging Face 发布 transformers-to-mlx Skill 与测试框架
Hugging Face 发布一个 Skill 和配套测试框架,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:原文给出可复用的 Skill 与独立测试框架,读者可了解如何让智能体产出可被维护者接受的模型移植 PR。
内容形态
拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。
90 条精选近 30 天 2 条共收录 486 条
Hugging Face 发布一个 Skill 和配套测试框架,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:原文给出可复用的 Skill 与独立测试框架,读者可了解如何让智能体产出可被维护者接受的模型移植 PR。
Sentence Transformers 发布 v5.4,可在同一套 API 中编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索后重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA Nemotron、BGE-VL 等已支持模型。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。
Anthropic 正在限制 Pro/Max 订阅者在开放智能体平台中使用 Claude 模型,Hugging Face 提出两条迁移路径:通过 Hugging Face Inference Providers 调用开源模型,或在本地硬件上运行开源模型。
推荐理由:Anthropic 收紧 Claude 在开放智能体平台的访问后,文章给出托管与本地两条迁移路径和具体配置命令。
NVIDIA 发布一套基于 NeMo 的嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成领域专用模型,无需人工标注。流程包含用 LLM 从领域文档生成合成问答对、挖掘难负样本、多跳问题展开、对比学习微调、BEIR 评测以及导出为 ONNX/TensorRT 并用 NVIDIA NIM 部署六步。
推荐理由:原文给出从文档到部署的六步嵌入模型微调流程与实测指标,可迁移到自有领域语料。
Mistral 基于其开源编码助手 Vibe 构建了一个自动生成和改进 Rails RSpec 测试的智能体,可在 CI/CD 中无人干预运行。
推荐理由:Mistral 公开了用 Vibe 构建 Rails 测试智能体的完整方法,包括 AGENTS.md 规划、分文件类型技能和自定义工具,可迁移到其他代码库。
Hugging Face 发布对 16 个开源强化学习库的调研,比较它们如何把推理与训练拆分到不同 GPU 池、用 rollout buffer 连接并异步同步权重。
推荐理由:基于 16 个开源 RL 库的横向对比,梳理异步训练在权重同步、陈旧样本与部分 rollout 上的七类设计取舍。
Hugging Face 发布教程,介绍源自 Snowflake AI Research 的 Ulysses 序列并行如何通过注意力头切分把长序列训练分布到多张 GPU,并已集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。
推荐理由:原文给出 Ulysses 序列并行在 Hugging Face 生态的接入方式与实测数据,可据此判断长上下文训练的显存与吞吐取舍。
Hugging Face 发布博客,介绍 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端与专家并行三部分。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重构的加载、后端与专家并行设计,并给出 v4 与 v5 的加载耗时对比。
Hugging Face 发布教程,介绍如何通过 Claude Code、Codex 等编码智能体,用 Unsloth 和 Hugging Face Jobs 微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:原文给出可直接复用的 CLI 命令、Skill 安装步骤与按模型规模划分的 GPU 成本表,读者可据此估算小模型微调开销。
Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 Claude 等前沿 LLM 一次性生成前端、后端与状态管理,全部写在一个 Python 文件里,无需构建步骤即可部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.HTML 的三模板 API 与单文件示例,读者可据此让 LLM 一次性生成可部署的交互组件。
Meta 与 Hugging Face 联合推出开源框架 OpenEnv,用于让智能体连接真实工具与 API 而非模拟环境,采用 Gym 风格 API 和标准 MCP 工具调用接口。
推荐理由:Meta 与 Hugging Face 的 OpenEnv 框架及 Turing 日历环境给出了工具型智能体在权限与多步流程下的实测数据,可据此判断真实环境评测的难点。
OpenAI 介绍 Codex App Server,这是一个双向 JSON-RPC API,用于把 Codex 智能体嵌入到应用中。该接口支持流式进度、工具调用、审批和 diff 等能力。
推荐理由:OpenAI 官方拆解 Codex App Server 的 JSON-RPC 接口设计,可供开发者了解如何把 Codex 智能体嵌入自有应用。
Hugging Face 发布新工具 upskill,用 Claude Opus 4.5 等大模型生成并评测 agent skill,再交给更小或本地模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的可复用流程与评测命令,读者可据此降低推理成本。
Hugging Face 发布教程,展示如何让 OpenAI Codex 通过 HF Skills 仓库完成端到端机器学习实验,包括数据校验、硬件选择、提交 Hugging Face Jobs 训练、监控进度、评测并生成训练报告。
推荐理由:原文给出 Codex 调用 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。
Hugging Face 推出 Hugging Face Skills,让 Claude Code 等编码智能体直接提交云端 GPU 微调任务、监控进度并把模型推送到 Hub。
推荐理由:原文给出了一套可复用的技能包与完整操作流程,读者可据此让编码智能体接管微调全流程。
Tavily 分享其深度研究智能体的构建经验,通过上下文工程把工具输出蒸馏为反思而非在上下文中累积原始 token,相比 LangChain 的 Open Deep Research 减少 66% token 消耗,并在 DeepResearch Bench 上达到 SOTA。
推荐理由:Tavily 复盘自建深度研究智能体的架构取舍,给出上下文工程与 token 消耗对比的具体做法,可迁移到其他长任务智能体。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端手术辅助机器人工作流,覆盖数据采集、训练与真机部署。该工作流用 LeRobot 采集仿真与真机数据,后训练 GR00T N1.5,并在 Isaac Lab 评估后部署到硬件,其中超过 93% 的训练数据由仿真合成生成。
推荐理由:原文给出从仿真采集、GR00T N1.5 后训练到真机部署的完整命令与硬件要求,可据此复现医疗机器人工作流。
Hugging Face 发布博客,介绍为支持 OpenAI gpt-oss 系列而在 transformers 中做的多项升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口层与缓存、连续批处理与 Paged Attention,以及更快的模型加载。
推荐理由:Hugging Face 官方拆解了为 gpt-oss 引入 transformers 的七项工程改动,可据此了解量化、并行与缓存优化的落地方式。
Hugging Face 发布针对 Flux.1-Dev 的 LoRA 推理优化配方,结合 Flash Attention 3、torch.compile 与 FP8 量化,在 H100 上相比基线实现 2.23 倍加速。
推荐理由:原文给出可复用的 LoRA 推理优化配方与实测延迟数据,读者可据此判断热切换与量化在自有硬件上的取舍。
Hugging Face 发布教程,介绍用 diffusers 库和 QLoRA 在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以下。在 RTX 4090 上,QLoRA 峰值显存约 9GB,标准 BF16 LoRA 需 26GB,700 步训练约 41 分钟。
推荐理由:原文给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,可据此复现低显存训练流程。