跳到正文
4月30日周四
4月29日周三
  1. Hugging Face Blog62

    Granite 4.1 LLM 是如何构建的:IBM 公开预训练、SFT 与强化学习全流程

    IBM Granite 团队发布技术文章,详解 Granite 4.1 系列(3B、8B、30B 稠密 decoder-only 模型)的构建流程:约 15T token 五阶段预训练、上下文扩展至 512K、约 4.1M 高质量样本的 SFT,以及基于 on-policy GRPO 与 DAPO loss 的多阶段强化学习。

    推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的取舍。

4月28日周二
  1. Hugging Face Blog74

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和 GUI 智能体操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。

4月27日周一
  1. Mistral AI71

    Mistral AI 发布企业 AI 编排层 Workflows 公开预览

    Mistral AI 发布 Workflows 公开预览,定位为企业 AI 的编排层,提供持久化执行、可观测性和容错能力,用于把 AI 流程从概念验证推进到生产。

    推荐理由:原文给出企业级 AI 编排层的持久化执行、可观测与人工审批能力,以及控制面与数据面分离的部署方式,可供评估生产落地路径。

  2. Hugging Face Blog62

    如何用 OpenAI Privacy Filter 构建可扩展 Web 应用

    Hugging Face 博客介绍了基于 OpenAI 本周在 Hub 上开源的 Privacy Filter 构建三个 Web 应用的实践。Privacy Filter 是 1.5B 参数、50M 激活参数的 PII 检测模型,Apache 2.0 许可,单次前向处理 128k 上下文,覆盖八类 PII,在 PII-Masking-300k 基准上达到 SOTA。

    推荐理由:原文给出三个基于 Privacy Filter 的完整应用示例,读者可参考其 gradio.Server 前后端分工方式来搭建自己的 PII 脱敏工具。

4月25日周六
4月24日周五
  1. Hugging Face Blog87

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。

    推荐理由:原文给出 V4 在长上下文推理成本与智能体后训练上的具体设计,可据此判断开源模型做长任务智能体的可行性。

4月23日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.5

    OpenAI 发布 GPT-5.5,官方称其为面向编码、研究和数据分析等复杂任务打造的模型,可跨工具使用。目前公开信息仅为摘要,未披露参数、上下文窗口或评测数据。

    推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析等复杂任务的定位。

  2. Hugging Face Blog60

    如何在 Chrome 扩展中使用 Transformers.js

    Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以自家 Gemma 4 浏览器助手扩展为参考实现。

    推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下本地模型托管、消息契约与工具调用循环的架构取舍。

  3. Google Research62

    Google Photos 上线 Auto frame 功能,可事后改变照片拍摄视角

    Google Photos 的 Auto frame 新增一项基于机器学习的重构图能力,把照片理解为 3D 场景并自动调整相机位置与焦距,生成原本未拍到的内容。该方法分两步:先用内部 3D 点图估计模型重建人体与面部并估算原焦距,再用生成式潜在扩散模型填补新视角下的空洞。该功能已上线,面向含人物的照片自动处理,重构图结果作为 Auto frame 候选中的第二个版本供用户选择。

    推荐理由:Google Photos 把 3D 场景估计与生成式补全结合,读者可了解拍照后改变机位这一编辑思路的实现路径。

4月22日周三
  1. OpenAI News62

    OpenAI 在 ChatGPT 中推出工作区智能体

    OpenAI 在 ChatGPT 中推出工作区智能体(workspace agents),由 Codex 驱动,可自动化复杂工作流并在云端运行。官方称其能帮助团队跨工具安全地扩展工作。

    推荐理由:OpenAI 官方公布 ChatGPT 工作区智能体的定位与运行方式,可据此了解其自动化工作流的切入点。

  2. OpenAI News62

    OpenAI 发布 Privacy Filter 开放权重模型

    OpenAI 发布 Privacy Filter,一款用于检测和脱敏文本中个人身份信息(PII)的开放权重模型,官方称其准确率达到 SOTA。目前公开信息仅为摘要,未披露模型规模、许可协议与开放入口。

    推荐理由:OpenAI 开源一款用于检测和脱敏文本 PII 的开放权重模型,可了解其在隐私合规场景的定位。

4月21日周二
  1. Google DeepMind22

    Google DeepMind 与埃森哲、贝恩、BCG、德勤、麦肯锡合作加速企业 AI 转型

    Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助企业规模化采用前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。

  2. OpenAI News67

    OpenAI 推出 ChatGPT Images 2.0

    OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。原文同时提到可查看 Images 2.5 的新变化。

    推荐理由:官方给出图像生成能力的三项具体改进方向,可据此判断多语言与文字渲染场景的可用性变化。

  3. Hugging Face Blog33

    QIMMA قِمّة:Hugging Face 推出质量优先的阿拉伯语 LLM 排行榜

    Hugging Face 发布 QIMMA قِمّة 阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证。该榜单整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌文学与代码 7 大领域,其中 99% 为原生阿拉伯语内容,并首次在阿拉伯语排行榜中引入代码评测。

  4. Hugging Face Blog40

    AI 与网络安全的未来:为什么开放性至关重要

    Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的关键不在模型本身,而在于其嵌入的系统——大算力、软件数据训练、漏洞探测与修补脚手架及一定自主性共同构成的能力配方。文章认为开放代码与工具可分散检测、验证、协调、补丁传播四个阶段,缩小攻防能力差距,并主张采用半自主 AI 智能体在组织内部署防御。

  5. OpenAI News62

    OpenAI 推出 Codex Labs,Codex 周活达 400 万

    OpenAI 推出 Codex Labs,并与埃森哲、普华永道、Infosys 等合作,帮助企业在软件开发全生命周期中部署和扩展 Codex。OpenAI 同时公布 Codex 周活跃用户达到 400 万。

    推荐理由:OpenAI 公布 Codex 周活 400 万并联合埃森哲、普华永道等推企业落地服务,可观察编码智能体的企业采用路径。

4月20日周一
  1. Berkeley AI Research34

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使基于学习动力学(世界模型)的长时程规划变得可行。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 和 Amir Bar 合作完成。

4月16日周四
  1. OpenAI News72

    OpenAI 发布生命科学研究推理模型 GPT-Rosalind

    OpenAI 发布 GPT-Rosalind,一款面向生命科学的前沿推理模型。该模型用于加速药物发现、基因组分析、蛋白质推理和科研工作流。

    推荐理由:OpenAI 发布面向生命科学的前沿推理模型,读者可了解其在药物发现与基因组分析等科研流程中的定位。