跳到正文
6月3日周三
  1. OpenAI News62

    OpenAI 为 GPT-Rosalind 推出新能力

    OpenAI 为 GPT-Rosalind 推出新能力,面向生命科学研究,增强生物推理、药物化学、基因组分析和实验工作流能力。

    推荐理由:OpenAI 为 GPT-Rosalind 增加生命科学方向能力,读者可据此了解该模型在生物推理与基因组分析上的定位。

6月1日周一
  1. Hugging Face Blog60

    JetBrains 发布 Mellum2:12B 混合专家模型

    JetBrains 发布 Mellum2,一个从零训练的 12B 参数混合专家(MoE)模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其面向路由、RAG、摘要、子智能体和高吞吐编码等低延迟场景,相比同规模模型推理速度提升超过 2 倍,模型已在 Hugging Face 开放下载,技术报告发布于 arXiv。

    推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,可据此判断轻量模型在路由与 RAG 场景的部署取舍。

5月20日周三
  1. OpenAI News78

    OpenAI 模型推翻离散几何核心猜想

    OpenAI 称其模型解决了已有 80 年历史的单位距离问题,推翻离散几何中的一项重要猜想,被视为 AI 驱动数学的一个里程碑。

    推荐理由:OpenAI 模型推翻离散几何中悬置 80 年的核心猜想,可观察 AI 在数学证明上的能力边界。

5月14日周四
5月12日周二
  1. Hugging Face Blog22

    在 AWS 上构建基础模型训练与推理的积木:计算、网络与存储架构解析

    Hugging Face 博客发布技术文章,解析 AWS 基础设施如何与开源软件栈配合支撑基础模型全生命周期。文章梳理了 Amazon EC2 P5(H100/H200)与 P6(B200/B300)实例的算力规格,并指出预训练、后训练与推理正走向融合的基础设施需求:紧耦合加速计算、高带宽低延迟网络与分布式存储。

5月8日周五
5月7日周四
4月29日周三
  1. Hugging Face Blog62

    Granite 4.1 LLM 是如何构建的:IBM 公开预训练、SFT 与强化学习全流程

    IBM Granite 团队发布技术文章,详解 Granite 4.1 系列(3B、8B、30B 稠密 decoder-only 模型)的构建流程:约 15T token 五阶段预训练、上下文扩展至 512K、约 4.1M 高质量样本的 SFT,以及基于 on-policy GRPO 与 DAPO loss 的多阶段强化学习。

    推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的取舍。

4月28日周二
  1. Hugging Face Blog74

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和 GUI 智能体操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。

4月24日周五
  1. Hugging Face Blog87

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。

    推荐理由:原文给出 V4 在长上下文推理成本与智能体后训练上的具体设计,可据此判断开源模型做长任务智能体的可行性。

4月23日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.5

    OpenAI 发布 GPT-5.5,官方称其为面向编码、研究和数据分析等复杂任务打造的模型,可跨工具使用。目前公开信息仅为摘要,未披露参数、上下文窗口或评测数据。

    推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析等复杂任务的定位。

4月22日周三
4月20日周一
  1. Berkeley AI Research34

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使基于学习动力学(世界模型)的长时程规划变得可行。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 和 Amir Bar 合作完成。

4月16日周四
  1. OpenAI News72

    OpenAI 发布生命科学研究推理模型 GPT-Rosalind

    OpenAI 发布 GPT-Rosalind,一款面向生命科学的前沿推理模型。该模型用于加速药物发现、基因组分析、蛋白质推理和科研工作流。

    推荐理由:OpenAI 发布面向生命科学的前沿推理模型,读者可了解其在药物发现与基因组分析等科研流程中的定位。

4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在设施巡检场景的可用性。

4月3日周五
3月31日周二
3月25日周三
  1. Google Research62

    Google 发布 TurboQuant 等向量量化算法,将 KV cache 压缩至 3 bit

    Google Research 提出 TurboQuant 压缩算法,并配套 QJL 和 PolarQuant 两种方法,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 发表。

    推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度的前提下把 KV cache 压到 3 bit,并给出与基线的对比数据。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4 开源模型

    Mistral AI 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可。

    推荐理由:Mistral Small 4 把推理、多模态与编码智能体能力合并进单一开源模型,并给出可配置推理强度与部署门槛。

  2. Google Research40

    Google 用高温超导研究问题测试 LLM 世界模型

    Google 与康奈尔大学合作,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。基于 1,726 篇受控文献的 NotebookLM 在多数维度表现最佳,自建 RAG 系统紧随其后,所有系统均有待改进之处。

  3. Mistral AI62

    Mistral 发布开源 Lean 4 代码智能体 Leanstral

    Mistral 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。

    推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出了与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。

3月13日周五
3月5日周四
  1. Google Research38

    Google 研究:用贝叶斯教学让 LLM 学会概率推理

    Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会按贝叶斯方式更新对用户偏好的概率估计。实验显示,该方法不仅提升训练任务表现,还能泛化到其他任务;而未经训练的 LLM 表现明显逊于最优贝叶斯助手,且往往在单轮交互后性能就停滞。

3月4日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 发布 Gemini 3.1 Flash-Lite,称其为 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元。

    推荐理由:官方给出定价、速度与基准数据,可据此判断高并发场景下是否值得替换 2.5 Flash。

2月20日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.1 Pro

    Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证分数,官方称推理表现超过 3 Pro 两倍以上。

    推荐理由:官方给出 ARC-AGI-2 上 77.1% 的验证分数,并列出消费端与开发者端的同步开放渠道,可据此判断升级幅度与可用范围。

2月13日周五
  1. OpenAI News62

    GPT-5.2 在理论物理中推导出新结果

    OpenAI 发布的一篇新预印本显示,GPT-5.2 为胶子振幅提出了一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。

    推荐理由:材料给出 GPT-5.2 在理论物理中提出新公式并被形式化证明的案例,可观察模型在科研推理上的边界。

  2. Google DeepMind80

    Google DeepMind 发布 Gemini 3 Deep Think 升级版

    Google DeepMind 发布 Gemini 3 Deep Think 重大升级,面向科学、研究与工程难题,已在 Gemini 应用中向 Google AI Ultra 订阅用户开放,并首次通过 Gemini API 向部分研究者、工程师和企业提供早期访问。

    推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩,并首次开放 API 早期访问,可据此判断其科研与工程场景的可用性。

2月12日周四
  1. OpenAI News62

    OpenAI 发布 GPT-5.3-Codex-Spark 实时编码模型

    OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15 倍,支持 128k 上下文。该模型目前面向 ChatGPT Pro 用户开放研究预览。

    推荐理由:OpenAI 发布首个实时编码模型,给出 15 倍生成速度与 128k 上下文,可据此判断实时编码场景的可用性。

2月10日周二
2月4日周三
  1. Google Research30

    Google Research 提出 Sequential Attention:让 AI 模型更轻更快且不牺牲准确率

    Google Research 提出 Sequential Attention,用贪心选择机制逐步、自适应地挑选要加入模型的层、模块或特征,并将选择过程直接整合进单次模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,实现快速单遍贪心选择,同时提升效率与可解释性,可扩展至大规模特征选择。

1月27日周二
1月23日周五
  1. Google Research34

    Google 研究:用小模型分解式方法实现更优用户意图提取

    Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。该方法在移动端和网页轨迹上均优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 的效果可媲美 Gemini 1.5 Pro,成本与速度却大幅占优。

1月20日周二
  1. Hugging Face Blog62

    微软发布 Differential Transformer V2:差分注意力去掉自定义 kernel 与 RMSNorm

    微软 unilm 团队发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下把 query 头数翻倍,使解码速度与标准 Transformer 持平,且不再需要自定义注意力 kernel。

    推荐理由:微软团队给出 DIFF V2 的代码与消融对比,读者可据此理解差分注意力在解码速度与训练稳定性上的取舍。

1月16日周五
1月6日周二
  1. Hugging Face Blog66

    NVIDIA 发布 Cosmos Reason 2,面向物理 AI 的开源推理视觉语言模型

    NVIDIA 发布 Cosmos Reason 2,一款面向物理 AI 的开源推理视觉语言模型,在 Physical AI Bench 和 Physical Reasoning 榜单上位列开源模型第一。

    推荐理由:NVIDIA 开源视觉语言推理模型 Cosmos Reason 2 的发布细节,含 256K 上下文与 2B/8B 规格,可对照上一代判断物理 AI 推理能力进展。