跳到正文
4月16日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表达力和语音质量上均有提升,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。

    推荐理由:官方给出新语音模型的音频标签控制方式、Elo 分数与多语言覆盖,可据此判断表达力控制的实际粒度。

4月15日周三
  1. Hugging Face Blog40

    VAKRA 基准解析:AI 智能体的推理、工具调用与失败模式

    Hugging Face 发布 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评估 AI 智能体的组合推理与多步工作流执行能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择与多跳推理四类任务,模型整体表现不佳。博客进一步分析了不同任务上观察到的失败模式。

  2. Hugging Face Blog66

    HCompany 发布浏览器扩展 HoloTab,基于 Holo3 模型自动操作网页

    HCompany 发布 Chrome 扩展 HoloTab,让 Holo3 计算机操作模型直接在浏览器中自动完成网页任务,用户只需描述需求,智能体便自行导航界面、填写字段并做决策,无需任何配置或技术背景。HoloTab 支持 Routines 功能,用户录制一次操作过程(可边操作边口述),扩展会据此生成可重复运行或定时执行的例程。该扩展免费开放使用,已在 Chrome 应用商店上线。

    推荐理由:HCompany 把此前发布的 Holo3 计算机操作模型封装成浏览器扩展,读者可了解其录制复用机制与零门槛定位。

4月14日周二
  1. Google Research46

    Google 推出 Vantage:用生成式 AI 评估未来技能

    Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生的问题解决、协作等未来技能,目前提供英文版并可注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,188 名 18-25 岁美国测试者的研究显示其评分与人类专家一致度接近专家间一致度。

4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,新增仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。

    推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在设施巡检场景的可用性。

4月10日周五
  1. OpenAI News12

    ChatGPT 如何服务营销团队

    OpenAI 介绍营销团队如何用 ChatGPT 规划营销活动、创作内容、分析效果,并把洞察转化为行动。文章围绕实际 AI 工作流展开,未披露新模型版本或具体功能参数。

  2. OpenAI News12

    OpenAI 科普:AI 基础入门

    OpenAI 发布面向初学者的 AI 基础科普内容,讲解 AI 是什么、如何运作,以及 ChatGPT 这类工具如何使用大语言模型。内容定位为清晰易懂的人工智能入门指南。

  3. OpenAI News22

    ChatGPT 文件处理实用指南

    OpenAI 介绍在 ChatGPT 中处理文件的实用方法,涵盖从查找信息到整理、转换文档并融入工作流。内容面向日常使用场景,帮助用户把文件用进 ChatGPT 的工作流程中。

4月9日周四
  1. Hugging Face Blog62

    Overworld 发布 Waypoint-1.5 实时视频世界模型

    Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。

    推荐理由:Waypoint-1.5 把实时生成世界模型下放到消费级显卡,读者可据此判断本地交互式世界生成的硬件门槛。

  2. Hugging Face Blog62

    Sentence Transformers v5.4 支持多模态嵌入与重排模型

    Sentence Transformers 发布 v5.4,可在同一套 API 中编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索后重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA Nemotron、BGE-VL 等已支持模型。

    推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。