跳到正文
6月5日周五
5月29日周五
5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实场景能力

    Google DeepMind 在 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国境内地点并叠加风格,生成以真实地点为起点的可交互世界。

    推荐理由:Google DeepMind 把 Genie 的世界模型与 Street View 真实影像打通,读者可据此判断世界模型从纯生成走向现实锚定的路径。

5月17日周日
  1. Google DeepMind71

    Google 将 SynthID 与 C2PA 内容验证扩展到 Search、Gemini、Chrome 和 Pixel

    Google 宣布扩展内容透明度与验证工具,把 SynthID 验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome,该验证功能此前已在全球被使用 5000 万次。

    推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可据此了解内容溯源工具的实际覆盖范围。

5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量的取舍是否成立。

5月12日周二
4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体仍更强。

    推荐理由:DeepMind 公开医疗 AI 智能体的多模态评测细节,读者可据此了解 AI 在临床问诊中已达标与仍欠缺的具体环节。

4月28日周二
  1. Hugging Face Blog74

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和 GUI 智能体操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。

4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表达力和语音质量上均有提升,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。

    推荐理由:官方给出新语音模型的音频标签控制方式、Elo 分数与多语言覆盖,可据此判断表达力控制的实际粒度。

4月9日周四
  1. Hugging Face Blog62

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers 发布 v5.4,可在同一套 API 中编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索后重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA Nemotron、BGE-VL 等已支持模型。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。

4月3日周五
4月2日周四
4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。

3月31日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.0 3B Vision 企业文档多模态模型

    IBM 发布 Granite 4.0 3B Vision,一个面向企业文档理解的紧凑视觉语言模型,以 LoRA 适配器形式搭载在 Granite 4.0 Micro 之上,采用 Apache 2.0 许可在 Hugging Face 开放。

    推荐理由:IBM 发布面向企业文档的紧凑视觉语言模型,给出表格、图表与 KVP 抽取的基准对比,可据此判断小模型在文档流水线中的位置。

3月29日周日
  1. Google DeepMind62

    Google DeepMind 为 AI 时代重新设计鼠标指针

    Google DeepMind 公布 AI 指针的实验性方案,由 Gemini 驱动,让指针理解用户指向的内容及其对用户的意义,并给出四条交互原则:保持工作流不中断、展示与说明、用「这个」和「那个」的简略表达、把像素变成可操作实体。

    推荐理由:Google DeepMind 公开 AI 指针的四条交互原则,并说明其已进入 Chrome 与 Googlebook,读者可据此判断 AI 交互从提示词转向指向与语音的路径。

3月26日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上取得 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后取得 36.1%,并支持多语言。

    推荐理由:官方给出语音模型在函数调用与长程推理基准上的分数,并说明开发者、企业与普通用户三类入口的可用范围。

  2. Google DeepMind65

    Google DeepMind 发布 Lyria 3 Pro,支持最长 3 分钟曲目与段落级控制

    Google DeepMind 发布音乐生成模型 Lyria 3 Pro,可生成最长 3 分钟的曲目,并能按前奏、主歌、副歌、桥段等结构元素进行提示控制。该模型已在 Vertex AI 公开预览,并接入 Google AI Studio、Gemini API、Google Vids、Gemini 应用和 ProducerAI。

    推荐理由:Lyria 3 Pro 把单曲生成时长拉到 3 分钟并支持段落级提示,读者可据此判断音乐生成在创作流程中的可用边界。

3月25日周三
  1. Google Research60

    Google 发布 Vibe Coding XR,用 Gemini 与 XR Blocks 生成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR 的 XR Blocks 框架结合,把自然语言提示直接转成可运行的 Android XR 应用,官方称耗时在 60 秒以内。

    推荐理由:Google 把 Gemini 与 XR Blocks 组合成自然语言生成 XR 应用的流程,并给出 VCXR60 初步评测数据,可据此判断 XR 原型开发门槛的变化。

3月24日周二
  1. Mistral AI71

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,可做情感表达与零样本跨语言音色适配。

    推荐理由:Mistral 首款 TTS 模型给出 4B 参数、9 语言与 70ms 延迟等具体指标,并附与 ElevenLabs 的人工对比结果。

3月18日周三
3月17日周二
  1. OpenAI News62

    OpenAI 发布 GPT-5.4 mini 和 nano

    OpenAI 发布 GPT-5.4 mini 和 nano,是 GPT-5.4 的更小、更快版本。两款模型针对编码、工具调用、多模态推理以及高并发 API 和子智能体负载做了优化。

    推荐理由:OpenAI 在 GPT-5.4 之下补出 mini 与 nano 两档小模型,读者可据此判断高并发与子智能体场景的选型空间。

  2. Mistral AI78

    Mistral 发布 Mistral Small 4 开源模型

    Mistral AI 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可。

    推荐理由:Mistral Small 4 把推理、多模态与编码智能体能力合并进单一开源模型,并给出可配置推理强度与部署门槛。

3月4日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 发布 Gemini 3.1 Flash-Lite,称其为 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元。

    推荐理由:官方给出定价、速度与基准数据,可据此判断高并发场景下是否值得替换 2.5 Flash。

2月27日周五
2月19日周四
  1. Google DeepMind71

    Gemini 应用上线 Lyria 3 音乐生成,支持文本与图片生成 30 秒曲目

    Google DeepMind 的 Lyria 3 音乐生成模型以 beta 形式在 Gemini 应用上线,用户用文本或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并附由 Nano Banana 生成的封面图。

    推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式、时长与 SynthID 音频验证能力,可据此判断音乐生成的使用边界。

2月18日周三
2月11日周三
2月5日周四
1月30日周五
  1. Google DeepMind71

    Google DeepMind 向美国 AI Ultra 订阅用户开放 Project Genie 世界模型原型

    Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。

    推荐理由:Google DeepMind 把 Genie 3 世界模型做成可交互原型,读者可据此了解世界模型从研究走向订阅制产品的路径。

1月16日周五
1月14日周三
  1. Google DeepMind71

    Google DeepMind 更新 Veo 3.1 Ingredients to Video,新增原生竖屏与 1080p/4K 放大

    Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频在短提示词下更富表现力,并提升角色身份、背景与物体的一致性。

    推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的具体变化,可据此判断移动端短视频工作流是否值得迁移。

1月6日周二
  1. Hugging Face Blog66

    NVIDIA 发布 Cosmos Reason 2,面向物理 AI 的开源推理视觉语言模型

    NVIDIA 发布 Cosmos Reason 2,一款面向物理 AI 的开源推理视觉语言模型,在 Physical AI Bench 和 Physical Reasoning 榜单上位列开源模型第一。

    推荐理由:NVIDIA 开源视觉语言推理模型 Cosmos Reason 2 的发布细节,含 256K 上下文与 2B/8B 规格,可对照上一代判断物理 AI 推理能力进展。

1月5日周一
12月24日周三