跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

130 条精选近 30 天 9 条共收录 231 条

更新

精选归档 · 第 2 页

7月21日周二第 21–40 条
7月15日周三
  1. Hugging Face Blog87

    Thinking Machines 发布 Inkling 与 Inkling-Small 开源多模态模型

    Thinking Machines 在 Hugging Face 发布 Inkling 系列开源多模态模型,Inkling 为 975B 总参数、41B 激活参数的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文,训练数据达 45 万亿 token。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准对比,读者可据此判断这一开源多模态模型的落地门槛。

7月1日周三
  1. Hugging Face Blog62

    Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI

    Hugging Face 与 Cerebras 联合演示了一套实时语音到语音的开源流水线,用 Cerebras 加速 Gemma 4 31B 的推理。该架构为模块化设计,依次经过 Nvidia Parakeet 语音识别、Cerebras 上的 Gemma 4 VLM 推理和阿里 Qwen3TTS 语音合成,各层均可替换。

    推荐理由:原文给出了一套可替换的实时语音到语音开源架构,读者可据此了解各层组件如何组合与复用。

6月23日周二
  1. Mistral AI67

    Mistral 发布 OCR 4 文档解析模型

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器自托管部署。

    推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,便于评估文档解析管线。

6月22日周一
6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于边缘端 E4B 与 26B MoE 之间,是首个支持原生音频输入的中等规模 Gemma 模型。

    推荐理由:Gemma 4 12B 用无编码器架构把视觉与音频直接接入 LLM 主干,读者可据此判断本地多模态智能体的硬件门槛。

6月5日周五
  1. Google Research71

    Google 研究用手机前摄实现被动心率监测

    Google Research 在 Nature 发表 PHRM 研究系统,利用手机前摄在面部解锁后拍摄视频,在后台被动估算心率和静息心率。该系统与 ECG 对比的 MAPE 低于 10%,每日 RHR 与 Fitbit Charge 6 对比的 MAE 为 4.39 bpm,并在浅、中、深三种肤色分组中均达到预设的非劣效标准。

    推荐理由:Google 用手机前摄在解锁后被动测心率,论文给出跨肤色误差与可申请的数据和模型资源。

5月18日周一
  1. Google DeepMind62

    Google DeepMind 为 Project Genie 加入 Street View 真实场景能力

    Google DeepMind 在 Project Genie 中上线 Street View 真实影像锚定能力,用户可选取美国境内地点并叠加风格,生成以真实地点为起点的可交互世界。

    推荐理由:Google DeepMind 把 Genie 的世界模型与 Street View 真实影像打通,读者可据此判断世界模型从纯生成走向现实锚定的路径。

5月17日周日
  1. Google DeepMind71

    Google 将 SynthID 与 C2PA 内容验证扩展到 Search、Gemini、Chrome 和 Pixel

    Google 宣布扩展内容透明度与验证工具,把 SynthID 验证从 Gemini 应用扩展到 Search,并将在未来几周进入 Chrome,该验证功能此前已在全球被使用 5000 万次。

    推荐理由:Google 把 SynthID 与 C2PA 验证铺到 Search、Gemini、Chrome 和 Pixel,读者可据此了解内容溯源工具的实际覆盖范围。

5月16日周六
  1. Google DeepMind87

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起在 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise 上线。

    推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的具体分数和 4 倍输出速度,可据此判断速度与质量的取舍是否成立。

5月12日周二
4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体仍更强。

    推荐理由:DeepMind 公开医疗 AI 智能体的多模态评测细节,读者可据此了解 AI 在临床问诊中已达标与仍欠缺的具体环节。

4月28日周二
  1. Hugging Face Blog74

    NVIDIA 发布 Nemotron 3 Nano Omni 全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解和 GUI 智能体操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。

    推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。

4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表达力和语音质量上均有提升,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。

    推荐理由:官方给出新语音模型的音频标签控制方式、Elo 分数与多语言覆盖,可据此判断表达力控制的实际粒度。

4月9日周四
  1. Hugging Face Blog62

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers 发布 v5.4,可在同一套 API 中编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索后重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA Nemotron、BGE-VL 等已支持模型。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。

4月3日周五
4月2日周四