跳到正文
  1. 新智元80

    何恺明团队VISTA论文:让Claude在ARC-AGI-3拿满分

    何恺明团队在arXiv发布VISTA论文,把ARC-AGI-3官方给模型的64×64数字表换成图片,并加入可随时调用的无损视觉记忆相册,Claude Opus 5在25个公开游戏全部183关拿到满分,GPT-5.6 Sol拿到99分。

    推荐理由:何恺明团队用视觉输入加无损视觉记忆替代数字表,让同一模型在ARC-AGI-3上从40分升至满分,可看方法迁移思路。

  1. Google Research66

    Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成

    Google Research 发布 AI video co-director 多智能体框架,作为 Gemini 和 Veo 之上的编排层,把长视频生成建模为全局优化与世界状态追踪问题,缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可组合框架,并给出多镜头一致性与角色保持的评测结果,便于了解多智能体编排在视频生成中的具体分工。

  1. Google Research60

    Google Research 用生成式 UI 让教师创建互动学习模拟

    Google Research 发布研究实验,让教师借助生成式 UI(GenUI)为课程目标动态生成可交互的学习模拟,并同步开放 30 多个面向中学 STEM 的英文示例库。

    推荐理由:Google Research 用生成式 UI 让教师按课程目标生成互动模拟,并给出教师评分与试点入口。

  1. Google Research72

    Google 推出 AMIE (Video),实现实时视频临床问诊

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可在实时视频问诊中感知非语言线索、引导虚拟体格检查并同步进行诊断推理。

    推荐理由:Google 把 AMIE 从文本诊断扩展到实时视频问诊,并给出随机对照的评测设计,可了解多模态临床 AI 的当前边界。

  1. Google Research62

    Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体

    Google Research 发布 SymptomAI,一个基于 Gemini Flash 2.0 的对话式症状评估智能体,在 n=13,917 的随机全国研究中让参与者与五种不同提问策略的智能体对话并给出鉴别诊断(DDx)。

    推荐理由:Google 用 13917 人随机对照研究比较五种提问策略,并首次把 AI 诊断与 Fitbit 生理信号做交叉验证。

  1. Google Research71

    Google 研究用手机前摄实现被动心率监测

    Google Research 在 Nature 发表 PHRM 研究系统,利用手机前摄在面部解锁后拍摄视频,在后台被动估算心率和静息心率。该系统与 ECG 对比的 MAPE 低于 10%,每日 RHR 与 Fitbit Charge 6 对比的 MAE 为 4.39 bpm,并在浅、中、深三种肤色分组中均达到预设的非劣效标准。

    推荐理由:Google 用手机前摄在解锁后被动测心率,论文给出跨肤色误差与可申请的数据和模型资源。

  1. Google DeepMind71

    Google DeepMind 发布 Co-Scientist 多智能体科研系统

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化科学假设。

    推荐理由:原文给出多智能体系统的三阶段架构与多个实验室应用案例,可了解 AI 参与科学假设生成的具体方式。

  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体仍更强。

    推荐理由:DeepMind 公开医疗 AI 智能体的多模态评测细节,读者可据此了解 AI 在临床问诊中已达标与仍欠缺的具体环节。

  1. Hugging Face Blog62

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。

  1. Hugging Face Blog62

    Hugging Face 发布 ScreenSuite,面向 GUI Agent 的评测套件

    Hugging Face 发布 ScreenSuite,一个面向 GUI Agent 的评测套件,整合 13 项基准,覆盖感知、定位、单步动作和多步智能体四类能力。

    推荐理由:Hugging Face 开源 GUI Agent 评测套件,读者可了解其 13 项基准覆盖的能力维度与纯视觉评测设定。

  1. OpenAI News85

    OpenAI 研究:视频生成模型可作为世界模拟器

    OpenAI 发布研究说明,介绍在视频数据上大规模训练生成模型的工作,将文本条件扩散模型联合训练于不同时长、分辨率和宽高比的视频与图像,并采用在视频和图像 latent code 的时空 patch 上运行的 Transformer 架构。其最大模型 Sora 能生成一分钟高保真视频,结果提示扩展视频生成模型是构建物理世界通用模拟器的一条可行路径。

    推荐理由:OpenAI 官方披露 Sora 的技术路线,说明视频生成模型被当作物理世界通用模拟器来训练。

  1. OpenAI News80

    OpenAI 发布 GPT-4V(ision) 系统卡

    OpenAI 发布 GPT-4V(ision) 系统卡,介绍该多模态模型的能力与安全评估情况。原文正文未能抓取,仅标题可用。

  1. OpenAI News60

    OpenAI 在 CLIP 中发现多模态神经元

    OpenAI 在 CLIP 中发现一类神经元,无论概念以字面、符号还是概念形式呈现都会产生响应。这可能解释 CLIP 在分类出人意料的视觉变体时仍保持准确的原因,也是理解 CLIP 及类似模型所学关联与偏见的重要一步。

    推荐理由:OpenAI 公开 CLIP 中跨字面、符号与概念形式响应同一概念的多模态神经元发现,有助于理解模型的关联与偏见来源。

已经到底了