PyTorch 性能剖析(第二部分):从 nn.Linear 到融合 MLP
PyTorch 性能剖析系列第二部分将手写的 matmul-add 替换为 nn.Linear(bias=True),并堆叠三层加激活函数构成 MLP 模块,在 NVIDIA A100-SXM4-80GB 上分析其 profiler trace。
PyTorch 性能剖析系列第二部分将手写的 matmul-add 替换为 nn.Linear(bias=True),并堆叠三层加激活函数构成 MLP 模块,在 NVIDIA A100-SXM4-80GB 上分析其 profiler trace。
OpenAI 模型和 Codex 现可通过 Oracle Cloud 访问,企业可使用现有云承诺额度来构建和部署 AI。该接入方式支持企业级安全与治理。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍。
推荐理由:官方给出 26B MoE 文本扩散模型的速度、显存与质量取舍,便于判断本地低并发场景是否值得换用。
作者让编码智能体通过调用两个 Hugging Face Space 搭建了展示巴黎地标的 3D Gaussian splat 网站,全程未手动使用图像生成或 3D 重建工具。
推荐理由:作者用一次真实搭建演示了 agents.md 如何让智能体串联两个 Space 完成图像到 3D 的流水线,可迁移到其他多媒体组合场景。
Hugging Face 官方博客给出把 GitHub Actions 的 CI 任务迁移到 Hugging Face Jobs 的分步教程,只需把 runs-on 从 ubuntu-latest 改成 hf-jobs-cpu-upgrade 或 hf-jobs-t4-small 等标签。
推荐理由:原文给出把 GitHub Actions 任务改到 Hugging Face Jobs 上运行的完整步骤与实测数据,可据此迁移自家 CI。
Google 在 Gemini Enterprise Agent Platform 推出由 Agentic RAG 驱动的跨语料检索公开预览版,通过编排器、规划器、查询改写、搜索扇出和充分上下文智能体协同处理多源多跳查询。相比标准 RAG,该框架在事实性数据集上准确率最高提升 34%;在跨语料设置下从 4 个候选语料中路由查询,90.1% 的问题回答正确,单语料与跨语料版本延迟平均相差约 3%。
Hugging Face 重构官方命令行工具 hf CLI,使其同时适配人类用户和 Claude Code、Codex、Cursor 等编码智能体,新增 agent 模式输出、下一步命令提示和非阻塞重试机制。
推荐理由:官方给出 hf CLI 面向智能体重构的细节与基准数据,可据此判断命令行工具该如何适配编码智能体。
Google Research 在 GitHub 上以 Apache 2.0 协议开源其水文建模框架,供各国气象与水文机构将 AI 洪水预报接入自身工作流。该框架是基于 PyTorch 的 Python 包,采用 LSTM 网络架构,可用开源 Caravan 数据集训练,并支持加入本地数据微调。
推荐理由:Google 开源其洪水预报水文建模框架,读者可了解模型架构、训练数据与业务化接入方式。
Wasmer 借助 Codex 与 GPT-5.5 构建了面向边缘计算的 Node.js 运行时,开发速度提升 10x 至 20x,交付周期从数月缩短到数周。
Reachy Mini 对话应用现可通过 MCP 调用托管在公开 Hugging Face Spaces 上的工具,用一条命令 `reachy-mini-conversation-app tool-spaces add` 即可为机器人添加天气查询、网页搜索等能力,工具在 Space 中运行,无需下载代码到本地。
H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:Holo3.1 给出跨环境与跨框架的鲁棒性提升,并首次提供量化权重,读者可据此判断本地部署计算机使用智能体的可行路径。
JetBrains 发布 Mellum2,一个从零训练的 12B 参数混合专家(MoE)模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其面向路由、RAG、摘要、子智能体和高吞吐编码等低延迟场景,相比同规模模型推理速度提升超过 2 倍,模型已在 Hugging Face 开放下载,技术报告发布于 arXiv。
推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,可据此判断轻量模型在路由与 RAG 场景的部署取舍。
Hugging Face 博客指出,企业 AI 试点大规模失败,症结在于缺少"智能体逻辑"这一引导层。IBM 用知识图谱、程序分析库等软件原语约束 LLM,在 Cobol/PL-1 应用理解中实现约 30× token 消耗降低,Aster 测试生成在 75+ 个 Java 应用上覆盖率提升 20%-45%、token 消耗最多降低 15×。
OpenAI 前沿模型与 Codex 现已在 AWS 上正式可用,企业可通过已有的 AWS 环境、管控和采购流程接入 OpenAI。客户可在 AWS 上开始使用 OpenAI,从评估到生产部署的推进更快。
推荐理由:OpenAI 前沿模型与 Codex 上线 AWS,企业可在既有云环境与采购流程中直接接入。
Hugging Face 发布 PyTorch 性能分析系列第一篇,介绍如何用 torch.profiler 分析矩阵乘法加偏置的算子。文章基于 PyTorch 2.13 与 NVIDIA A100-SXM4-80GB,讲解 profiler 表格与 trace 的读法,并演示 torch.compile 带来的变化。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调对专有数据和 IP 的完全控制。
推荐理由:Mistral 一次性公布工业工程 AI 栈、Vibe 智能体升级与自建数据中心,可看到其企业级全栈布局。
Mistral 宣布将 Le Chat 升级为统一 AI 智能体 Vibe,同时覆盖工作与编码场景,原有对话、设置和订阅方案全部保留。
推荐理由:Mistral 把 Le Chat 升级为统一智能体 Vibe,读者可据此判断工作与编码两类长任务如何被同一入口承接。
Mistral AI 发布 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架,将数据摄取、检索和评测整合到共享接口下,开源并支持云端、本地和边缘部署。
推荐理由:原文给出检索管线的统一框架与内置评测指标,读者可据此判断自建 RAG 检索栈的整合成本。
Google 为隐私分析服务推出零信任聚合方案,结合新型密码学聚合协议与 TEE,使设备只需单条消息即可安全提交数据,无需多轮在线交互。该协议可证明 Google 只能获得群体的匿名聚合洞察,原始个体数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则向参与者验证协议按公开代码正确执行。
Mistral 宣布将 Emmi AI 并入公司,推出面向工业工程的物理 AI 能力,作为其企业解决方案中的新基础能力。该能力从几何与边界条件直接预测物理场,单次前向推理在单张 GPU 上以秒级完成,用于加速产品设计、工装工艺设计和实时数字孪生,合作方包括 ASML、Airbus、Safran 和 Siemens Energy。
推荐理由:Mistral 把物理仿真 AI 纳入企业平台,读者可据此判断工业设计流程的算力与迭代节奏会如何变化。
Cisco 与 OpenAI 正用 Codex 重塑企业工程,帮助 Cisco 规模化 AI 原生开发、加速 AI Defense 工作并自动化缺陷修复。
Hugging Face 发布教程,介绍如何让 Reachy Mini 完全本地运行语音对话,无需云端、API key,音频不出本机。
推荐理由:Hugging Face 给出 Reachy Mini 全本地语音对话的完整级联方案与可替换组件清单,读者可据此复现并自行替换各环节模型。
Hugging Face 在 TRL 中落地增量权重同步(Delta Weight Sync):只把 RL 优化器步之间真正变化的 bf16 权重编码成稀疏 safetensors 文件上传到 Hub Bucket,再由 vLLM 拉取应用。
推荐理由:TRL 把稀疏增量权重同步做成了可 pip 安装的实现,读者可据此判断跨机房异步 RL 训练的部署成本。
Mistral 在 Studio 发布 Connectors(公开预览),内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型与智能体调用。连接器以 MCP 协议打包为可复用实体,集中注册后可在 LeChat 和 AI Studio 中使用,并支持程序化创建、修改、列出和删除。
推荐理由:原文给出连接器注册、直接工具调用与人工审批三段能力,读者可据此判断企业级 Agent 集成层的落地方式。
PaddleOCR 3.5 发布,支持将 Hugging Face Transformers 作为推理后端,开发者可通过 engine="transformers" 运行 PP-OCRv5、PaddleOCR-VL 1.5 等模型。
OpenAI 与 Dell 达成合作,将 Codex 引入混合云和本地部署环境,帮助企业在数据与工作流中安全部署 AI 编程智能体。
Hugging Face 发文解析连续批处理中的异步批处理(asynchronous batching),通过 CUDA stream 将 CPU 批次准备与 GPU 计算解耦并行,消除同步模式下两者轮流等待的空闲间隙。
OpenAI 为在 Windows 上启用 Codex 构建了安全有效的沙箱,通过受控的文件访问和网络限制来约束其运行。该方案旨在让 Codex 在 Windows 环境下安全可用。
Hugging Face 博客发布技术文章,解析 AWS 基础设施如何与开源软件栈配合支撑基础模型全生命周期。文章梳理了 Amazon EC2 P5(H100/H200)与 P6(B200/B300)实例的算力规格,并指出预训练、后训练与推理正走向融合的基础设施需求:紧耦合加速计算、高带宽低延迟网络与分布式存储。
OpenAI 推出企业部署公司 DeployCo,目标是帮助各类组织把前沿 AI 引入生产环境,并转化为可衡量的业务成果。
OpenAI 通过沙箱、审批机制、网络策略和智能体原生遥测来安全运行 Codex,以支持编程智能体的安全合规采用。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS)的并行结构与分解策略由外部预设,而非模型自主决定。
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考对齐:rollout logprobs 语义、V1 运行时默认值、inflight 权重更新路径,以及最终投影使用的 fp32 lm_head。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的落地成果,覆盖数学、量子物理、基因组、电网与 AI 基础设施等领域。
推荐理由:官方汇总 AlphaEvolve 一年落地案例,涵盖基因组、电网、TPU 与量子模拟,可据此判断编码智能体的跨领域迁移边界。
OpenAI 推出 MRC(Multipath Reliable Connection)超级计算机网络协议,并通过 OCP 开放发布,用于提升大规模 AI 训练集群的韧性与性能。
OpenAI 重建了其 WebRTC 技术栈,以支撑实时语音 AI 的低延迟、全球规模与流畅的对话轮转。
IBM Granite 团队发布技术文章,详解 Granite 4.1 系列(3B、8B、30B 稠密 decoder-only 模型)的构建流程:约 15T token 五阶段预训练、上下文扩展至 512K、约 4.1M 高质量样本的 SFT,以及基于 on-policy GRPO 与 DAPO loss 的多阶段强化学习。
推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的取舍。
OpenAI 宣布扩展 Stargate,建设支撑 AGI 的算力基础设施,并新增数据中心容量以应对不断增长的 AI 需求。
DeepInfra 成为 Hugging Face Hub 支持的 Inference Provider,首批上线对话与文本生成任务,可访问 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开放权重 LLM。
OpenAI 的 GPT 模型、Codex 和 Managed Agents 现已在 AWS 上可用,企业可在自己的 AWS 环境中构建安全的 AI 应用。
推荐理由:OpenAI 把 GPT 模型、Codex 与 Managed Agents 接入 AWS,读者可据此判断企业现有云环境能否直接落地。