跳到正文
5月6日周三
  1. Hugging Face Blog34

    Hugging Face 为 Open ASR Leaderboard 引入私有数据集防刷榜

    Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、朗读与对话场景的高质量英文 ASR 私有数据集,以防止 benchmaxxing 和测试集污染。榜单默认平均 WER 仍只基于公开数据集计算,用户可通过开关选择是否纳入私有数据集查看影响。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。

5月5日周二
  1. OpenAI News74

    OpenAI 发布 GPT-5.5 Instant,更新 ChatGPT 默认模型

    OpenAI 发布 GPT-5.5 Instant,将其作为 ChatGPT 的默认模型,官方称其回答更智能、更准确,并减少了模型幻觉。该版本还改进了个性化控制。

    推荐理由:OpenAI 更新 ChatGPT 默认模型,读者可据此了解回答准确性与个性化控制的变化方向。

5月4日周一
5月2日周六
4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体仍更强。

    推荐理由:DeepMind 公开医疗 AI 智能体的多模态评测细节,读者可据此了解 AI 在临床问诊中已达标与仍欠缺的具体环节。

4月29日周三
  1. Hugging Face Blog62

    Granite 4.1 LLM 是如何构建的:IBM 公开预训练、SFT 与强化学习全流程

    IBM Granite 团队发布技术文章,详解 Granite 4.1 系列(3B、8B、30B 稠密 decoder-only 模型)的构建流程:约 15T token 五阶段预训练、上下文扩展至 512K、约 4.1M 高质量样本的 SFT,以及基于 on-policy GRPO 与 DAPO loss 的多阶段强化学习。

    推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的取舍。

4月28日周二
  1. Hugging Face Blog74

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和 GUI 智能体操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。

4月27日周一
  1. Mistral AI71

    Mistral AI 发布企业 AI 编排层 Workflows 公开预览

    Mistral AI 发布 Workflows 公开预览,定位为企业 AI 的编排层,提供持久化执行、可观测性和容错能力,用于把 AI 流程从概念验证推进到生产。

    推荐理由:原文给出企业级 AI 编排层的持久化执行、可观测与人工审批能力,以及控制面与数据面分离的部署方式,可供评估生产落地路径。

  2. Hugging Face Blog62

    如何用 OpenAI Privacy Filter 构建可扩展 Web 应用

    Hugging Face 博客介绍了基于 OpenAI 本周在 Hub 上开源的 Privacy Filter 构建三个 Web 应用的实践。Privacy Filter 是 1.5B 参数、50M 激活参数的 PII 检测模型,Apache 2.0 许可,单次前向处理 128k 上下文,覆盖八类 PII,在 PII-Masking-300k 基准上达到 SOTA。

    推荐理由:原文给出三个基于 Privacy Filter 的完整应用示例,读者可参考其 gradio.Server 前后端分工方式来搭建自己的 PII 脱敏工具。

4月25日周六
4月24日周五
  1. Hugging Face Blog87

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。

    推荐理由:原文给出 V4 在长上下文推理成本与智能体后训练上的具体设计,可据此判断开源模型做长任务智能体的可行性。

4月23日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.5

    OpenAI 发布 GPT-5.5,官方称其为面向编码、研究和数据分析等复杂任务打造的模型,可跨工具使用。目前公开信息仅为摘要,未披露参数、上下文窗口或评测数据。

    推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析等复杂任务的定位。

  2. Hugging Face Blog60

    如何在 Chrome 扩展中使用 Transformers.js

    Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以自家 Gemma 4 浏览器助手扩展为参考实现。

    推荐理由:以官方发布的 Gemma 4 浏览器扩展为参照,拆解 MV3 下本地模型托管、消息契约与工具调用循环的架构取舍。

  3. Google Research62

    Google Photos 上线 Auto frame 功能,可事后改变照片拍摄视角

    Google Photos 的 Auto frame 新增一项基于机器学习的重构图能力,把照片理解为 3D 场景并自动调整相机位置与焦距,生成原本未拍到的内容。该方法分两步:先用内部 3D 点图估计模型重建人体与面部并估算原焦距,再用生成式潜在扩散模型填补新视角下的空洞。该功能已上线,面向含人物的照片自动处理,重构图结果作为 Auto frame 候选中的第二个版本供用户选择。

    推荐理由:Google Photos 把 3D 场景估计与生成式补全结合,读者可了解拍照后改变机位这一编辑思路的实现路径。

4月22日周三