Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛并以异步数据流连接,降低带宽需求并隔离硬件故障。
推荐理由:原文给出分布式训练在带宽、容错和跨代硬件上的实测结果,可据此判断大规模预训练基础设施的演进方向。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
239 条精选近 30 天 23 条共收录 717 条
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛并以异步数据流连接,降低带宽需求并隔离硬件故障。
推荐理由:原文给出分布式训练在带宽、容错和跨代硬件上的实测结果,可据此判断大规模预训练基础设施的演进方向。
OpenAI 推出 Codex Labs,并与埃森哲、普华永道、Infosys 等合作,帮助企业在软件开发全生命周期中部署和扩展 Codex。OpenAI 同时公布 Codex 周活跃用户达到 400 万。
推荐理由:OpenAI 公布 Codex 周活 400 万并联合埃森哲、普华永道等推企业落地服务,可观察编码智能体的企业采用路径。
Hugging Face 发布一个 Skill 和配套测试框架,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:原文给出可复用的 Skill 与独立测试框架,读者可了解如何让智能体产出可被维护者接受的模型移植 PR。
OpenAI 更新 Agents SDK,新增原生沙箱执行和模型原生 harness,帮助开发者在文件与工具之间构建安全、长时间运行的智能体。
推荐理由:官方给出 Agents SDK 的两项能力变化,读者可据此判断长时运行智能体的构建方式有何调整。
HCompany 发布 Chrome 扩展 HoloTab,让 Holo3 计算机操作模型直接在浏览器中自动完成网页任务,用户只需描述需求,智能体便自行导航界面、填写字段并做决策,无需任何配置或技术背景。HoloTab 支持 Routines 功能,用户录制一次操作过程(可边操作边口述),扩展会据此生成可重复运行或定时执行的例程。该扩展免费开放使用,已在 Chrome 应用商店上线。
推荐理由:HCompany 把此前发布的 Holo3 计算机操作模型封装成浏览器扩展,读者可了解其录制复用机制与零门槛定位。
Hugging Face 发布 gradio.Server,它扩展 FastAPI,让开发者用 React、Svelte 或原生 HTML/JS 等任意前端,同时复用 Gradio 的排队、并发控制、SSE 流式、MCP 支持和 Spaces 上的 ZeroGPU。
推荐理由:原文给出 gradio.Server 的完整后端示例,读者可据此判断自带前端与 Gradio 队列、ZeroGPU 如何配合。
Hugging Face 发布 TRL v1.0,将这一原本的研究代码库正式定位为有稳定性承诺的后训练库,目前实现超过 75 种后训练方法,月下载量 300 万次。
推荐理由:TRL v1.0 把稳定核心与实验层分开,并给出与同类后训练库的横向对比,便于判断选型与迁移成本。
Anthropic 正在限制 Pro/Max 订阅者在开放智能体平台中使用 Claude 模型,Hugging Face 提出两条迁移路径:通过 Hugging Face Inference Providers 调用开源模型,或在本地硬件上运行开源模型。
推荐理由:Anthropic 收紧 Claude 在开放智能体平台的访问后,文章给出托管与本地两条迁移路径和具体配置命令。
Google Research 提出 TurboQuant 压缩算法,并配套 QJL 和 PolarQuant 两种方法,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 发表。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度的前提下把 KV cache 压到 3 bit,并给出与基线的对比数据。
NVIDIA 发布一套基于 NeMo 的嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成领域专用模型,无需人工标注。流程包含用 LLM 从领域文档生成合成问答对、挖掘难负样本、多跳问题展开、对比学习微调、BEIR 评测以及导出为 ONNX/TensorRT 并用 NVIDIA NIM 部署六步。
推荐理由:原文给出从文档到部署的六步嵌入模型微调流程与实测指标,可迁移到自有领域语料。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统。Forge 支持预训练、后训练和强化学习等阶段,可训练模型理解内部术语、代码库与流程,并支持 dense 与 MoE 架构及多模态输入。该产品面向智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据,企业还能通过内部评测与强化学习持续改进模型。
推荐理由:原文给出企业用自有数据训练前沿模型的产品定位与训练流程,可据此判断企业自建模型与智能体的落地路径。
H Company 发布 Holotron-12B,一个基于 NVIDIA Nemotron-Nano-2 VL 后训练的多模态计算机操作模型,现已上线 Hugging Face,采用 NVIDIA Open Model License。
推荐理由:原文给出模型来源、混合 SSM 架构与吞吐对比数据,读者可据此判断其在长上下文智能体场景的部署取舍。
Google 宣布在 Flood Hub 上线城市山洪(flash flood)预报,可提前最多 24 小时预测城市区域的山洪风险。
推荐理由:Google 把洪水预报从河流扩展到城市内涝,并给出与 NWS 同口径的精度对比,可据此判断全球预警覆盖的差距。
Mistral 基于其开源编码助手 Vibe 构建了一个自动生成和改进 Rails RSpec 测试的智能体,可在 CI/CD 中无人干预运行。
推荐理由:Mistral 公开了用 Vibe 构建 Rails 测试智能体的完整方法,包括 AGENTS.md 规划、分文件类型技能和自定义工具,可迁移到其他代码库。
OpenAI 介绍如何用 Responses API、shell 工具和托管容器构建智能体运行时,让智能体在安全、可扩展的环境中处理文件、工具和状态。原文仅提供摘要,未给出具体版本号、开放时间或性能数据。
推荐理由:OpenAI 官方说明如何用 Responses API、shell 工具与托管容器搭建智能体运行时,可了解其安全与扩展思路。
Hugging Face 在 Hub 上推出 Storage Buckets,一种非版本化的 S3 式可变对象存储,可通过浏览器、Python 或 hf CLI 管理,地址形如 hf://buckets/username/my-training-bucket。
推荐理由:原文给出可变对象存储的定位与 Xet 去重、预热的机制,读者可据此判断它是否适合训练中间产物的存放。
Hugging Face 发布对 16 个开源强化学习库的调研,比较它们如何把推理与训练拆分到不同 GPU 池、用 rollout buffer 连接并异步同步权重。
推荐理由:基于 16 个开源 RL 库的横向对比,梳理异步训练在权重同步、陈旧样本与部分 rollout 上的七类设计取舍。
Hugging Face 发布教程,介绍源自 Snowflake AI Research 的 Ulysses 序列并行如何通过注意力头切分把长序列训练分布到多张 GPU,并已集成到 Accelerate、Transformers Trainer 和 TRL 的 SFTTrainer。
推荐理由:原文给出 Ulysses 序列并行在 Hugging Face 生态的接入方式与实测数据,可据此判断长上下文训练的显存与吞吐取舍。
LeRobot v0.5.0 发布,自 v0.4.0 以来合并 200 多个 PR、新增 50 多位贡献者,首次加入 Unitree G1 人形机器人支持,覆盖行走、操作、遥操作与全身控制。
推荐理由:LeRobot v0.5.0 一次性补齐人形机器人、自回归 VLA 与流式视频编码,可据此判断开源机器人栈的当前边界。
Hugging Face 发布 Modular Diffusers,用可复用的 block 组合扩散流水线,作为 DiffusionPipeline 的补充方案。
推荐理由:原文给出可组合模块的 API 与自定义块示例,读者可据此判断扩散流水线拆解后如何复用与共享。