跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

97 条精选近 30 天 8 条共收录 175 条

更新

多模态的精选

今天10月4日周日第 1–20 条
  1. 新智元80

    何恺明团队VISTA论文:让Claude在ARC-AGI-3拿满分

    何恺明团队在arXiv发布VISTA论文,把ARC-AGI-3官方给模型的64×64数字表换成图片,并加入可随时调用的无损视觉记忆相册,Claude Opus 5在25个公开游戏全部183关拿到满分,GPT-5.6 Sol拿到99分。

    推荐理由:何恺明团队用视觉输入加无损视觉记忆替代数字表,让同一模型在ARC-AGI-3上从40分升至满分,可看方法迁移思路。

9月30日周三
  1. 雷峰网78

    GPT-6 Astra 首批实测:一周搭出曼哈顿,长任务仍会跑偏

    雷峰网汇总了 GPT-6 Astra 发布后首批拿到模型的用户实测。Ben Davis 让 Astra 在 Blender 里生成 4K 飞船模型,并观察到它会主动打开页面、读取报错、修改后再测试;Theo 用 Blender 做可直接在浏览器运行的 3D 游戏,耗时约 30 分钟到 2 小时。

    推荐理由:汇总首批用户实测,呈现 Astra 在 3D 创作、软件操作与长任务上的能力边界和翻车点。

9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的世界模型,以及连接模型、科学工具、文献与研究者的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。

  2. 爱范儿80

    AMD 以约 82 亿美元全股票收购李飞飞创立的 World Labs

    AMD 正式宣布以全股票方式收购李飞飞创立两年的 AI 独角兽 World Labs,作价约 82 亿美元,双方已签署最终协议,预计 2026 年底前完成交易,仍须获得监管批准。

    推荐理由:AMD 以全股票方式收购 World Labs,读者可据此观察芯片厂商向空间智能与机器人仿真工作负载的布局。

9月25日周五
  1. Google Research66

    Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态追踪问题,缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与角色保持的评测结果,便于了解多智能体编排在视频生成中的具体分工。

  2. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上为原生实时对话模型加入近实时视觉形象,可同时处理视觉与音频输入并输出带表情和口型同步的音视频。

    推荐理由:官方给出 Live Avatar 的多模态对话、异步工具调用与 97 语言同步细节,可据此判断企业级实时数字人落地的能力边界。

9月23日周三
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。

    推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景中的分工。

9月18日周五
9月2日周三
  1. Google DeepMind74

    Google DeepMind 为 Gemini 推出智能体视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。

    推荐理由:官方给出 token 与成本降幅及准确率变化,并说明 API 开启方式,便于开发者评估长视频分析方案。

8月28日周五
  1. Google DeepMind72

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频能力。

    推荐理由:官方给出场景延展、首尾帧插值与 4K 放大等具体能力与 API 入口,可据此判断生成视频工作流的可控性变化。

8月27日周四
8月12日周三
  1. Google DeepMind78

    Google DeepMind 发布手语转文本模型 SL2T,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,并在 Pixel 11 的 Gboard 和 Live Transcribe 中上线手语听写功能,首批支持美国手语(ASL)转英文。

    推荐理由:官方披露了 SL2T 的训练规模、手语到文本的翻译路径与隐私处理方式,可据此判断手语 AI 从实验室走向消费级产品的技术取舍。

  2. Google Research72

    Google 推出 AMIE (Video),实现实时视频临床问诊

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可在实时视频问诊中感知非语言线索、引导虚拟体格检查并同步进行诊断推理。

    推荐理由:Google 把 AMIE 从文本诊断扩展到实时视频问诊,并给出随机对照的评测设计,可了解多模态临床 AI 的当前边界。

8月11日周二
  1. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS 多语言语音模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖与各 GPU 上的 TTFA 实测数据,可据此评估自建语音链路的延迟预算。

8月10日周一
  1. Hugging Face Blog78

    Meta 发布开源多模态模型 Muse Glimmer,30B 参数面向本地智能体

    Meta 发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数、采用 Apache 2.0 许可的多模态模型,面向本地智能体场景,可用于编码、文档分析和个人助手等隐私敏感应用。

    推荐理由:Meta 开源 30B 多模态模型,主打本地智能体场景,并给出与同级模型的基准对比和部署路径。

8月4日周二
  1. Mistral AI65

    Mistral AI 发布 Shieldstral 3B 开源多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可发布,可在单张 16GB NVIDIA GPU 上运行。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入策略并输出校准后的安全分数,无需重新训练即可统一文本与图像安全评估。官方称其在文本安全上可匹配最多 7 倍参数量的模型,并在多模态审核上取得新的 SOTA。

    推荐理由:3B 开源安全分类器把审核策略放进推理时的自然语言问题里,可据此判断小模型在内容审核上的替代空间。

7月30日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,这是其面向机器人的具身推理模型,可理解视频、编排多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:官方给出 ER 2 在进度分类、时刻定位与多机协作上的具体指标和开放入口,可据此判断机器人大脑的能力边界。

7月28日周二
7月23日周四
  1. Google Research62

    Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体

    Google Research 发布 SymptomAI,一个基于 Gemini Flash 2.0 的对话式症状评估智能体,在 n=13,917 的随机全国研究中让参与者与五种不同提问策略的智能体对话并给出鉴别诊断(DDx)。

    推荐理由:Google 用 13917 人随机对照研究比较五种提问策略,并首次把 AI 诊断与 Fitbit 生理信号做交叉验证。

7月21日周二