Hugging Face 推出约束感知 GPU 分配器:同集群利用率最高提升 33 个百分点
Hugging Face 构建了一个约束感知的 GPU 分配器,在七个基准场景中与 FIFO 调度器对比,相同硬件和负载下 GPU 利用率最高提升 33 个百分点,优先级加权产出在所有场景中均上升,最高增幅 105%。
Hugging Face 构建了一个约束感知的 GPU 分配器,在七个基准场景中与 FIFO 调度器对比,相同硬件和负载下 GPU 利用率最高提升 33 个百分点,优先级加权产出在所有场景中均上升,最高增幅 105%。
Hugging Face 博客给出 Strands Robots 流式数据闭环的完整走查:同一个 Robot() 录制 LeRobotDataset、经 sync_dataset_to_bucket 同步进 Storage Bucket、再用 stream_dataset 从 Hub 流式读取训练,最后改一个 mode="real" 参数把 checkpoint 部署回硬件。
推荐理由:以可运行 notebook 串起录制、去重同步、流式训练到真机部署的完整数据闭环,适合评估机器人数据工程方案。
OpenAI 发布 GPT-5.6 构建者指南,介绍初创公司如何借助更智能的模型选择和 Responses API 新能力,构建更快、更具成本效益的 AI 智能体。
RingCentral 借助 ChatGPT Work 和 Codex 加速 AI 产品开发,并在工程与运营之间集中化运营智能,构建从工程到运维的 AI 原生工作方式。
启用两个 API 设置后,GPT-5.6 在 ARC-AGI-3 基准上的得分提升至原来的三倍。这两个设置通过保留推理过程和启用压缩(compaction)来提高性能与效率。
OpenAI 创意团队借助 Codex 构建定制创意工具、加速创意构思并更快完成原型开发。Codex 具备上下文感知能力,可融入创意工作流,成为团队协作伙伴。
IBM Research 在 Hugging Face 博客中复盘为智能体构建模型路由的经验,指出多数路由系统把模型选择当成分类问题,实际却是系统优化问题。
OpenAI 介绍 ChatGPT Work 在数据科学场景中的实用工作流,覆盖根因简报、KPI 备忘、范围界定分析和仪表盘规范四类任务。内容以实操流程为主,未披露具体模型版本、参数或性能数据。
OpenAI 介绍 ChatGPT Work 在销售场景中的实用工作流,涵盖管道简报、会议准备、客户计划、预测复盘和交易诊断。内容面向销售团队,说明如何用 ChatGPT Work 完成这些日常任务。
OpenAI 发布 ChatGPT 入门指南,介绍如何开始第一次对话,并演示用 AI 写作、头脑风暴和解决问题的简单方法。
PyTorch 性能分析系列第三篇用 NVIDIA A100-SXM4-80GB 剖析 attention 的 profiler 轨迹,从朴素实现到 in-place 掩码再到 SDPA 与手写 kernel 逐一对比。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队用 Lance 做数据构建与筛选、MDS 做流式训练,并将文本编码器从 T5Gemma 换成 Qwen3-VL,改为训练中实时计算文本 latent,实测吞吐损失约 3–4%(30 天训练多约 1 天)。图像统一以 JPEG quality 92 编码。
OpenAI 工程师利用大规模 core dump 分析排查基础设施的罕见崩溃,发现了一处硬件故障和一个存在 18 年之久的软件 bug。
Hugging Face 介绍用一条 hf jobs run 命令在 HF Jobs 上启动私有、兼容 OpenAI API 的 vLLM 端点,按秒计费,无需自备服务器或 Kubernetes。
推荐理由:原文给出了一条命令在 HF Jobs 上起 vLLM 端点的完整流程,可迁移到自建推理与编码智能体后端。
Google Chrome 团队开发者关系工程师 Thomas Steiner 在 Hugging Face 博客展示如何用 Cross-Origin Storage(COS)扩展在 Transformers.js 中试验跨源缓存。
Hugging Face 将 huggingface_hub 的发版周期从每 4 到 6 周一次改为每周一次,整个流程由单个 GitHub Actions 工作流驱动。
推荐理由:原文公开了每周发版工作流的完整结构,其中模型起草加确定性校验再人工确认的循环可迁移到其他生成任务。
Hugging Face 博客分享了用本地模型对 OpenClaw 仓库的 Issue 和 PR 做实时分类分诊的方案,作者在 NVIDIA GB10 上运行 gemma-4-26b-a4b 和 qwen3.6-35b-a3b,通过 Pi 智能体框架配合受限只读 shell(reposhell)和 final_json 工具输出结构化标签。
推荐理由:原文给出本地模型做 PR/Issue 分类的完整架构与 330 行评测数据,可迁移到其他高吞吐筛选场景。
Jason Liu 分享了他使用 OpenAI Codex 保存上下文、管理复杂项目,并让工作不再局限于单次提示词的经验。
Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,按 bare、clone、skill 三种层级在模型 × 版本 × 任务上并行运行,衡量智能体完成任务所需的轮次、token 与错误率,而非只看最终答案。
推荐理由:原文给出了一套可复用的智能体工具评测方法,并展示同一改动对不同规模模型效果相反的具体证据。
Hugging Face 在 PEFT 库中新增基准测试,用相同基座模型、数据集和硬件对比 LoRA 与其他 PEFT 技术。
推荐理由:Hugging Face 用统一条件的基准对比多种 PEFT 技术,读者可据此判断 LoRA 是否仍是默认选择。
AWS 开源 SDK Strands Robots 将 LeRobot 的硬件抽象、仿真与策略栈封装为 AgentTools,让一个 Strands 智能体完成从 Hub 数据集到实体机器人的全流程。
推荐理由:AWS 官方给出从 Hub 数据集到实体机器人的五步流程,可看到同一份智能体代码如何切换仿真与硬件。
天体物理学家 Chi-kwan Chan 使用 Codex 构建黑洞模拟,帮助科学家研究极端物理并检验爱因斯坦的广义相对论。
PyTorch 性能剖析系列第二部分将手写的 matmul-add 替换为 nn.Linear(bias=True),并堆叠三层加激活函数构成 MLP 模块,在 NVIDIA A100-SXM4-80GB 上分析其 profiler trace。
Nextdoor 工程师借助 Codex 与 GPT-5.5 排查难以复现的问题、跨平台构建功能,并将精力聚焦于产品成果。
作者让编码智能体通过调用两个 Hugging Face Space 搭建了展示巴黎地标的 3D Gaussian splat 网站,全程未手动使用图像生成或 3D 重建工具。
推荐理由:作者用一次真实搭建演示了 agents.md 如何让智能体串联两个 Space 完成图像到 3D 的流水线,可迁移到其他多媒体组合场景。
Notion 借助 Codex 一次性生成规格说明,并为网页端构建了 AI Voice Input 功能。Codex 还帮助 Notion 在小型团队中放大工程产能。
Hugging Face 官方博客给出把 GitHub Actions 的 CI 任务迁移到 Hugging Face Jobs 的分步教程,只需把 runs-on 从 ubuntu-latest 改成 hf-jobs-cpu-upgrade 或 hf-jobs-t4-small 等标签。
推荐理由:原文给出把 GitHub Actions 任务改到 Hugging Face Jobs 上运行的完整步骤与实测数据,可据此迁移自家 CI。
DharmaOCR 团队将 DPO 用于结构化 OCR 任务,用模型自身产生的重复循环失败样本构建偏好对,在全部测试的视觉语言模型家族中均降低文本退化,平均降幅 59.4%,最高 87.6%(Nanonets-OCR2-3B 从 1.61% 降至 0.20%)。
Wasmer 借助 Codex 与 GPT-5.5 构建了面向边缘计算的 Node.js 运行时,开发速度提升 10x 至 20x,交付周期从数月缩短到数周。
Braintrust 工程师借助 Codex 与 GPT-5.5 加快实验与编码速度,将客户需求直接转化为代码。
Hugging Face 发布 PyTorch 性能分析系列第一篇,介绍如何用 torch.profiler 分析矩阵乘法加偏置的算子。文章基于 PyTorch 2.13 与 NVIDIA A100-SXM4-80GB,讲解 profiler 表格与 trace 的读法,并演示 torch.compile 带来的变化。
Endava 借助 Codex 构建智能体组织,将需求分析周期从数周缩短至数小时,并加速软件交付。该案例展示了 Codex 在企业级软件工程流程中的落地方式。
Hugging Face 发布教程,介绍如何让 Reachy Mini 完全本地运行语音对话,无需云端、API key,音频不出本机。
推荐理由:Hugging Face 给出 Reachy Mini 全本地语音对话的完整级联方案与可替换组件清单,读者可据此复现并自行替换各环节模型。
Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件上传到 Hub Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的实现,读者可据此判断跨机房异步 RL 训练的部署成本。
Hugging Face 发布 AI 智能体术语表,重点厘清常被混用的 harness 与 scaffold:scaffold 是定义模型行为的系统提示词、工具描述与上下文管理层,harness 则是调用模型、处理工具调用并决定何时停止的执行层,社区常用 Agent = Model + Harness 概括。
Virgin Atlantic 借助 Codex 在固定的假日出行截止期限前完成移动应用改版,实现接近全覆盖的单元测试和零 P1 缺陷。
Ramp 工程师借助 Codex 与 GPT-5.5 进行代码审查并推进改进,将实质性反馈的获取时间从数小时缩短至数分钟。
OpenAI 介绍 ChatGPT Work 的运营工作流用法,覆盖 initiative briefs、strategy updates、decision packets 和 progress reporting 四类场景。内容为实操性工作流指南,未披露模型版本、参数或可用性信息。
Hugging Face 发文解析连续批处理中的异步批处理(asynchronous batching),通过 CUDA stream 将 CPU 批次准备与 GPU 计算解耦并行,消除同步模式下两者轮流等待的空闲间隙。
OpenAI 为在 Windows 上启用 Codex 构建了安全有效的沙箱,通过受控的文件访问和网络限制来约束其运行。该方案旨在让 Codex 在 Windows 环境下安全可用。