跳到正文
7月1日周三
6月30日周二
  1. Google Research76

    Google 发布 TabFM 零样本表格数据基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:原文给出零样本表格预测的架构设计与 TabArena 基准对比,可据此判断它能否替代传统树模型流程。

6月26日周五
  1. OpenAI News62

    OpenAI 预告下一代模型 GPT-5.6 Sol

    OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全技术栈。

    推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可据此了解其在编码、科学与网络安全上的能力方向。

6月23日周二
  1. Mistral AI67

    Mistral 发布 OCR 4 文档解析模型

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器自托管部署。

    推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,便于评估文档解析管线。

6月22日周一
6月17日周三
6月11日周四
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于边缘端 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。

    推荐理由:Gemma 4 12B 用无编码器架构把视觉与音频直接接入 LLM 主干,读者可据此判断本地多模态智能体的硬件门槛。

6月5日周五
6月3日周三
  1. OpenAI News62

    OpenAI 为 GPT-Rosalind 推出新能力

    OpenAI 为 GPT-Rosalind 推出新能力,面向生命科学研究,增强生物推理、药物化学、基因组分析和实验工作流能力。

    推荐理由:OpenAI 为 GPT-Rosalind 增加生命科学方向能力,读者可据此了解该模型在生物推理与基因组分析上的定位。

6月2日周二
  1. Hugging Face Blog72

    H Company 发布 Holo3.1 计算机使用智能体模型家族

    H Company 发布 Holo3.1 计算机使用智能体模型家族,基于 Qwen 系列,覆盖 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次提供 FP8、Q4 GGUF 和 NVFP4 量化权重。

    推荐理由:Holo3.1 给出跨环境与跨框架的鲁棒性提升,并首次提供量化权重,读者可据此判断本地部署计算机使用智能体的可行路径。

6月1日周一
  1. Hugging Face Blog60

    JetBrains 发布 Mellum2:12B 混合专家模型

    JetBrains 发布 Mellum2,一个从零训练的 12B 参数混合专家(MoE)模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,采用 Apache 2.0 许可。官方称其面向路由、RAG、摘要、子智能体和高吞吐编码等低延迟场景,相比同规模模型推理速度提升超过 2 倍,模型已在 Hugging Face 开放下载,技术报告发布于 arXiv。

    推荐理由:JetBrains 开源 12B MoE 模型,每 token 仅激活 2.5B 参数,可据此判断轻量模型在路由与 RAG 场景的部署取舍。

5月22日周五
  1. Mistral AI80

    Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体

    Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,并支撑 Vibe 的云端远程编码智能体与 Le Chat 的 Work 模式预览。

    推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 权重,读者可据此判断自托管编码智能体的可行边界。

5月20日周三
  1. OpenAI News78

    OpenAI 模型推翻离散几何核心猜想

    OpenAI 称其模型解决了已有 80 年历史的单位距离问题,推翻离散几何中的一项重要猜想,被视为 AI 驱动数学的一个里程碑。

    推荐理由:OpenAI 模型推翻离散几何中悬置 80 年的核心猜想,可观察 AI 在数学证明上的能力边界。

5月19日周二
5月18日周一
5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量的取舍是否成立。

5月15日周五
5月7日周四
5月5日周二
  1. OpenAI News74

    OpenAI 发布 GPT-5.5 Instant,更新 ChatGPT 默认模型

    OpenAI 发布 GPT-5.5 Instant,将其作为 ChatGPT 的默认模型,官方称其回答更智能、更准确,并减少了模型幻觉。该版本还改进了个性化控制。

    推荐理由:OpenAI 更新 ChatGPT 默认模型,读者可据此了解回答准确性与个性化控制的变化方向。

4月28日周二
  1. Hugging Face Blog74

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和 GUI 智能体操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。

4月24日周五
  1. Hugging Face Blog87

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。

    推荐理由:原文给出 V4 在长上下文推理成本与智能体后训练上的具体设计,可据此判断开源模型做长任务智能体的可行性。

4月23日周四
  1. OpenAI News78

    OpenAI 发布 GPT-5.5

    OpenAI 发布 GPT-5.5,官方称其为面向编码、研究和数据分析等复杂任务打造的模型,可跨工具使用。目前公开信息仅为摘要,未披露参数、上下文窗口或评测数据。

    推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析等复杂任务的定位。

4月22日周三
  1. OpenAI News62

    OpenAI 发布 Privacy Filter 开放权重模型

    OpenAI 发布 Privacy Filter,一款用于检测和脱敏文本中个人身份信息(PII)的开放权重模型,官方称其准确率达到 SOTA。目前公开信息仅为摘要,未披露模型规模、许可协议与开放入口。

    推荐理由:OpenAI 开源一款用于检测和脱敏文本 PII 的开放权重模型,可了解其在隐私合规场景的定位。

4月16日周四
  1. OpenAI News72

    OpenAI 发布生命科学研究推理模型 GPT-Rosalind

    OpenAI 发布 GPT-Rosalind,一款面向生命科学的前沿推理模型。该模型用于加速药物发现、基因组分析、蛋白质推理和科研工作流。

    推荐理由:OpenAI 发布面向生命科学的前沿推理模型,读者可了解其在药物发现与基因组分析等科研流程中的定位。

  2. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表达力和语音质量上均有提升,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。

    推荐理由:官方给出新语音模型的音频标签控制方式、Elo 分数与多语言覆盖,可据此判断表达力控制的实际粒度。

4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在设施巡检场景的可用性。

4月9日周四
  1. Hugging Face Blog62

    Overworld 发布 Waypoint-1.5 实时视频世界模型

    Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。

    推荐理由:Waypoint-1.5 把实时生成世界模型下放到消费级显卡,读者可据此判断本地交互式世界生成的硬件门槛。

4月3日周五
4月2日周四
3月31日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.0 3B Vision 企业文档多模态模型

    IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式搭载在 Granite 4.0 Micro 之上,采用 Apache 2.0 许可在 Hugging Face 开放。

    推荐理由:IBM 发布面向企业文档的紧凑视觉语言模型,给出表格、图表与 KVP 抽取的基准对比,可据此判断小模型在文档流水线中的位置。

3月26日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上取得 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后取得 36.1%,并支持多语言。

    推荐理由:官方给出语音模型在函数调用与长程推理基准上的分数,并说明开发者、企业与普通用户三类入口的可用范围。

  2. Google DeepMind65

    Google DeepMind 发布 Lyria 3 Pro,支持最长 3 分钟曲目与段落级控制

    Google DeepMind 发布音乐生成模型 Lyria 3 Pro,可生成最长 3 分钟的曲目,并能按前奏、主歌、副歌、桥段等结构元素进行提示控制。该模型已在 Vertex AI 公开预览,并接入 Google AI Studio、Gemini API、Google Vids、Gemini 应用和 ProducerAI。

    推荐理由:Lyria 3 Pro 把单曲生成时长拉到 3 分钟并支持段落级提示,读者可据此判断音乐生成在创作流程中的可用边界。

3月24日周二
  1. Mistral AI71

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,可做情感表达与零样本跨语言音色适配。

    推荐理由:Mistral 首款 TTS 模型给出 4B 参数、9 语言与 70ms 延迟等具体指标,并附与 ElevenLabs 的人工对比结果。

3月17日周二
  1. OpenAI News62

    OpenAI 发布 GPT-5.4 mini 和 nano

    OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 的更小、更快版本。两款模型针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。

    推荐理由:OpenAI 在 GPT-5.4 之下补出 mini 与 nano 两档小模型,读者可据此判断高并发与子智能体场景的选型空间。

  2. Mistral AI78

    Mistral 发布 Mistral Small 4 开源模型

    Mistral AI 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可。

    推荐理由:Mistral Small 4 把推理、多模态与编码智能体能力合并进单一开源模型,并给出可配置推理强度与部署门槛。

  3. Mistral AI62

    Mistral 发布开源 Lean 4 代码智能体 Leanstral

    Mistral 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。

    推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出了与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。