跳到正文
3月5日周四
  1. Google Research38

    Google 研究:用贝叶斯教学让 LLM 学会概率推理

    Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会按贝叶斯方式更新对用户偏好的概率估计。实验显示,该方法不仅提升训练任务表现,还能泛化到其他任务;而未经训练的 LLM 表现明显逊于最优贝叶斯助手,且往往在单轮交互后性能就停滞。

3月4日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 发布 Gemini 3.1 Flash-Lite,称其为 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元。

    推荐理由:官方给出定价、速度与基准数据,可据此判断高并发场景下是否值得替换 2.5 Flash。

3月3日周二
2月28日周六
  1. OpenAI News62

    OpenAI 公布与美国国防部合同的细节

    OpenAI 公布其与美国国防部(Department of War)合同的细节,说明其中的安全红线、法律保护以及 AI 系统在涉密环境中的部署方式。材料仅提供摘要,未披露合同金额、期限或具体部署系统。

    推荐理由:OpenAI 官方披露与国防部门合同的边界条款,可了解其安全红线与法律保护如何界定。

2月27日周五
  1. OpenAI News78

    OpenAI 宣布 1100 亿美元新融资,投前估值 7300 亿美元

    OpenAI 宣布获得 1100 亿美元新投资,投前估值 7300 亿美元。其中软银出资 300 亿美元,NVIDIA 出资 300 亿美元,Amazon 出资 500 亿美元。

    推荐理由:OpenAI 公布 1100 亿美元新融资与 7300 亿美元投前估值,并列出三家出资方,可据此观察其资本结构与算力合作走向。

2月26日周四
  1. Hugging Face Blog62

    Hugging Face 详解 transformers 中的 MoE 支持:权重加载重构、专家后端与专家并行

    Hugging Face 发布博客,介绍 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端与专家并行三部分。

    推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重构的加载、后端与专家并行设计,并给出 v4 与 v5 的加载耗时对比。

2月25日周三
2月24日周二
2月23日周一
  1. OpenAI News60

    OpenAI 解释为何不再评测 SWE-bench Verified

    OpenAI 宣布不再使用 SWE-bench Verified 评测,理由是这一基准正日益受到污染,无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷和训练数据泄漏问题,并建议改用 SWE-bench Pro。

    推荐理由:OpenAI 说明 SWE-bench Verified 存在污染与测试缺陷,并给出替代基准建议,可供关注编码评测的人参考。

2月20日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.1 Pro

    Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证分数,官方称推理表现超过 3 Pro 两倍以上。

    推荐理由:官方给出 ARC-AGI-2 上 77.1% 的验证分数,并列出消费端与开发者端的同步开放渠道,可据此判断升级幅度与可用范围。

2月19日周四
  1. Hugging Face Blog60

    IBM 与 UC Berkeley 用 IT-Bench 和 MAST 诊断企业级智能体为何失败

    IBM Research 与 UC Berkeley 合作,用 MAST(多智能体系统失败分类法)分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。

    推荐理由:IBM 与 UC Berkeley 用 MAST 分类法拆解 310 条 ITBench 执行轨迹,给出不同模型失败模式的差异与对应工程干预方向。

  2. Google DeepMind71

    Gemini 应用上线 Lyria 3 音乐生成,支持文本与图片生成 30 秒曲目

    Google DeepMind 的 Lyria 3 音乐生成模型以 beta 形式在 Gemini 应用上线,用户用文本或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并附由 Nano Banana 生成的封面图。

    推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式、时长与 SynthID 音频验证能力,可据此判断音乐生成的使用边界。

2月18日周三
  1. Hugging Face Blog62

    用 Gradio 的 gr.HTML 一次性生成任意 Web 应用

    Gradio 6 的 gr.HTML 现已支持自定义模板、作用域 CSS 和 JavaScript 交互,可让 Claude 等前沿 LLM 一次性生成前端、后端与状态管理,全部写在一个 Python 文件里,无需构建步骤即可部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.HTML 的三模板 API 与单文件示例,读者可据此让 LLM 一次性生成可部署的交互组件。

2月17日周二
2月13日周五
  1. OpenAI News62

    GPT-5.2 在理论物理中推导出新结果

    OpenAI 发布的一篇新预印本显示,GPT-5.2 为胶子振幅提出了一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。

    推荐理由:材料给出 GPT-5.2 在理论物理中提出新公式并被形式化证明的案例,可观察模型在科研推理上的边界。

  2. OpenAI News62

    OpenAI 在 ChatGPT 中推出 Lockdown Mode 与 Elevated Risk 标签

    OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。两项功能面向企业安全场景,具体能力与开放范围原文未进一步说明。

    推荐理由:OpenAI 为 ChatGPT 增加 Lockdown Mode 与 Elevated Risk 标签,读者可了解企业防御提示词注入的新手段。