跳到正文
12月19日周五
12月17日周三
  1. Mistral AI62

    Mistral 发布 OCR 3,表单与手写识别胜率较上代提升 74%

    Mistral 发布文档解析模型 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。

    推荐理由:官方给出 OCR 3 相对上一代在表单、手写和复杂表格上的胜率与定价,可据此判断文档解析成本与适用场景。

  2. Google DeepMind87

    Google DeepMind 发布 Gemini 3 Flash,主打速度与低成本

    Google DeepMind 发布 Gemini 3 Flash,定位为兼顾前沿智能与速度、成本更低的模型,已在 Gemini API、Google AI Studio、Gemini CLI、Google Antigravity、Vertex AI 和 Gemini Enterprise 上线,并开始向 Gemini 应用和搜索 AI Mode 全量推送。

    推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本权衡是否适合自身工作流。

12月13日周六
12月11日周四
  1. OpenAI News82

    OpenAI 发布 GPT-5.2 前沿模型

    OpenAI 发布 GPT-5.2,称其为面向日常专业工作最先进的前沿模型,具备领先的推理、长上下文理解、编码和视觉能力。该模型已在 ChatGPT 和 OpenAI API 中提供,用于支撑更快、更可靠的智能体工作流。

    推荐理由:OpenAI 官方发布 GPT-5.2,读者可据此了解新模型在推理、长上下文、编码与视觉上的定位及可用入口。

12月4日周四
12月3日周三
  1. Mistral AI80

    Mistral 发布 Mistral 3 系列,含 675B 参数 Mistral Large 3 与 3B/8B/14B Ministral 3

    Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个稠密小模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。

    推荐理由:Mistral 3 全系以 Apache 2.0 开源并给出 NVFP4 量化与多平台部署路径,可据此判断开源前沿模型的落地成本。

11月20日周四
  1. Google DeepMind62

    Google 在 Gemini 应用中上线 AI 图像验证功能

    Google 在 Gemini 应用中上线图像验证功能,用户上传图片并提问即可借助 SynthID 数字水印判断该图是否由 Google AI 生成或编辑。SynthID 自 2023 年推出以来已为超过 200 亿件 AI 生成内容添加水印。

    推荐理由:原文说明了 Gemini 应用内图像验证的入口与 SynthID 水印机制,读者可据此了解 AI 生成内容的溯源方式。

  2. Google DeepMind78

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打高保真图像生成与编辑,已在 Google AI Studio 和 Vertex AI 以付费预览形式逐步开放。

    推荐理由:官方给出新图像模型的分辨率、文本渲染与搜索接地能力,可据此判断多模态应用的选型与成本取舍。

  3. Google DeepMind82

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成与编辑模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 的新一代图像生成与编辑模型,可生成更准确、文本更清晰的多语言图像,并支持最多 14 张图像合成、保持最多 5 人一致性,提供 2K 和 4K 分辨率及局部编辑、光照调整等控制。

    推荐理由:Google DeepMind 发布基于 Gemini 3 Pro 的图像生成编辑模型,读者可了解其文本渲染、多图合成与产品接入范围。

11月19日周三
  1. Google DeepMind93

    Google DeepMind 发布 Gemini 3,Pro 版预览上线并推出 Deep Think 模式

    Google DeepMind 发布 Gemini 3,首发 Gemini 3 Pro 预览版,并同步接入 Gemini 应用、搜索 AI Mode、AI Studio、Vertex AI、Gemini CLI 及新智能体开发平台 Google Antigravity。

    推荐理由:Gemini 3 Pro 在多项基准上刷新成绩并同步接入搜索、Gemini 应用与开发者平台,可据此判断多模态与智能体能力的当前水位。

  2. Google Research80

    Google 发布生成式 UI:Gemini 应用与搜索 AI Mode 上线动态界面实验

    Google 发布生成式 UI 实现,由模型直接生成网页、游戏、工具等完整交互界面,而非只生成内容。该能力以 dynamic view 和 visual layout 两个实验在 Gemini 应用中推出,并集成到 Google Search 的 AI Mode,基于 Gemini 3 Pro 配合工具调用、系统指令与后处理实现。

    推荐理由:Google 把生成式 UI 从论文推进到 Gemini 与搜索的实测入口,读者可据此判断界面生成这一方向的产品化程度。

11月13日周四
  1. Google DeepMind71

    Google DeepMind 发布 SIMA 2:可推理、对话并在 3D 虚拟世界中自我改进的智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型作为智能体核心,使 SIMA 从指令执行者升级为能思考目标、与用户对话并自我改进的交互式游戏伙伴。SIMA 2 在未训练过的新游戏(如 ASKA、MineDojo)中泛化能力显著提升,并能通过 Gemini 反馈和试错进行自我改进,无需额外人类演示数据。该研究以有限研究预览形式向少量学者和游戏开发者开放早期访问。

    推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并展示了跨游戏泛化与自我改进的训练路径。

11月11日周二
  1. Google DeepMind57

    Google DeepMind 在 Nature 发表研究,让 AI 视觉表征更接近人类

    Google DeepMind 在 Nature 发表新论文,分析 AI 视觉模型与人类在视觉表征组织上的差异,并提出一种三步对齐方法。该方法先用 THINGS 数据集训练一个冻结主模型的小适配器作为教师模型,再生成包含百万张图像、数百万条类人判断的 AligNet 数据集,最后微调其他学生模型。

11月4日周二
10月30日周四
10月21日周二
  1. Hugging Face Blog58

    Hugging Face AI Sheets 新增图像支持

    Hugging Face 为开源工具 AI Sheets 发布重大更新,新增视觉能力,可在表格中查看、分析、提取图像信息,并生成和编辑图片,全程无需写代码。图像列支持描述分类、抽取结构化数据(如收据商户名、日期、金额)和添加元数据,文本列与图像列可在同一工作流中生成与转换内容,结果可导出为 CSV、Parquet 或上传至 Hub。

10月15日周三
10月2日周四
9月30日周二
  1. OpenAI News78

    OpenAI 发布视频生成模型 Sora 2

    OpenAI 发布视频生成模型 Sora 2,可在生成视频中同步对话与音效。原文同时说明 Sora 产品已不再提供。

    推荐理由:OpenAI 发布视频生成模型 Sora 2,首次在生成视频中同步对话与音效,可据此了解视频生成的能力边界变化。

  2. OpenAI News78

    OpenAI 发布 Sora 2 视频与音频生成模型系统卡

    OpenAI 发布新一代视频与音频生成模型 Sora 2,并同步公开系统卡。相比 Sora,新模型在物理准确性、画面真实感、音画同步、可控性和风格覆盖范围上有所提升。

    推荐理由:官方系统卡披露 Sora 2 在物理准确性、同步音频与可控性上的能力变化,可据此了解视频生成模型的新边界。

9月23日周二
  1. Hugging Face Blog49

    Hugging Face 发布 Smol2Operator:用两阶段后训练让 SmolVLM2-2.2B 学会 GUI 操作

    Hugging Face 发布 Smol2Operator,基于 SmolVLM2-2.2B-Instruct 通过两阶段训练将其从零 GUI 定位能力打造成可执行点击、输入等操作的智能体式 GUI coder。第一阶段先建立界面元素定位能力,第二阶段用 SFT 增强智能体推理,在 ScreenSpot-v2 基准上评估,并开源全部训练配方、数据处理工具、模型、demo 与数据集。

9月22日周一
9月9日周二
  1. Hugging Face Blog50

    Hugging Face 发布 mmBERT:基于 ModernBERT 的多语言编码器,覆盖 1800+ 语言

    Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在 3T+ tokens、1800 多种语言上训练,成为首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用 Gemma 2 tokenizer,训练分三阶段将语言数从 60 逐步扩展至 1833,并引入逆掩码率调度与退火语言学习等新技术。

8月7日周四
  1. OpenAI News86

    OpenAI 发布 GPT-5

    OpenAI 发布 GPT-5,称其为迄今最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。官方称 GPT-5 在编码、数学、写作、健康、视觉感知等方面达到 SOTA 表现。

    推荐理由:OpenAI 官方发布 GPT-5,给出其在编码、数学、写作、健康与视觉感知上的能力定位。

8月1日周五
  1. Mistral AI42

    Mistral 通过微调 Pixtral-12B 提升卫星图像视觉语言模型性能

    Mistral 用 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上显著优于基座模型。基座模型在 Playground、Stadium 等易混类别上会误判并偶发幻觉出不存在的类别名,微调后分类更准确。整个流程可通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。

7月23日周三
  1. Hugging Face Blog42

    TimeScope:你的视频大模型能看多长的视频?

    Hugging Face 开源长视频理解基准 TimeScope,通过在 1 分钟至 8 小时的视频中插入 5-10 秒的"needle"片段,评测模型的局部检索、信息综合与细粒度时序感知三项能力。结果显示,包括 Gemini 2.5-Pro 在内的领先视觉语言模型在真正的长视频时序理解上仍表现吃力,性能随视频变长明显下滑。

7月17日周四
  1. Mistral AI72

    Mistral 为 Le Chat 推出 Deep Research、语音模式等多项新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 官方一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线的功能覆盖方向。

7月15日周二
  1. Mistral AI78

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

    Mistral 发布 Voxtral 语音理解模型,提供 24B 生产版和 3B 本地与端侧版,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备音频问答、摘要、多语言自动检测和语音直接触发函数调用能力,并保留 Mistral Small 3.1 的文本能力。

    推荐理由:Mistral 开源两款语音理解模型,给出 32k 上下文、多语言与函数调用能力及低于同类 API 一半的价格,可据此判断开源语音方案的可用边界。

7月8日周二
  1. Hugging Face Blog36

    Hugging Face 详解高效多模态数据管道:从朴素填充到背包算法

    Hugging Face 以 nanoVLM 项目为例,展示如何用五阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充阶段约 60% 的 batch 被无用 padding token 占据,团队随后引入全局最大长度约束,并借助背包问题(knapsack)实现贪心打包,将序列按 token 数尽量塞满每个 batch。

6月28日周六
6月26日周四
6月6日周五
6月3日周二