跳到正文
5月16日周六
  1. Google DeepMind32

    剑桥大学团队用 Google Co-Scientist 寻找跨物种传播致病分子开关

    剑桥大学教授 Clare Bryant 利用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关,该工具生成并排序的假说中有一个她此前未关注的蛋白,与多个她感兴趣的信号通路相关。她随后加入未发表数据反复迭代,将假说从候选蛋白细化到具体氨基酸,团队正构建含氨基酸突变的细胞系验证。她表示,原本需两到三年实验才能锁定精确氨基酸,如今有望在六个月内完成。

  2. Google DeepMind38

    Google DeepMind Co-Scientist 加速肝病机制发现

    爱丁堡大学团队用 Google DeepMind 的 Co-Scientist 研究 MASH 肝病,系统提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假设经实验验证,或为靶向联合疗法铺路。Co-Scientist 还从肝生物学与药理学证据中筛出值得关注的机制和候选联合疗法,以应对潜在药物配对的组合爆炸。

  3. Google DeepMind60

    斯坦福团队用 Co-Scientist 筛选抗肝纤维化药物

    斯坦福大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,用 Google DeepMind 的 Co-Scientist 从已有药物文献中筛选可重定位治疗肝纤维化的候选药。

    推荐理由:斯坦福团队用 Co-Scientist 筛选抗纤维化药物,实验显示其候选药物表现优于研究者自选,可了解 AI 辅助药物重定位的实际验证方式。

5月12日周二
5月11日周一
  1. Import AI32

    Import AI 456:RSI 与经济增长、AI 监管的“激进可选性”与神经计算机

    Institute for Law & AI 提出“激进可选性”监管思路,主张政府短期避免过度监管,同时提前建设信息收集、举报人保护、评估与人才等能力,以便在强大 AI 冲击世界时能迅速应对。Meta 与 KAIST 的论文提出 Neural Computer,试图用神经网络在学习到的运行时状态中统一计算、内存与 I/O。

5月8日周五
5月4日周一
4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体仍更强。

    推荐理由:DeepMind 公开医疗 AI 智能体的多模态评测细节,读者可据此了解 AI 在临床问诊中已达标与仍欠缺的具体环节。

4月29日周三
  1. Hugging Face Blog62

    Granite 4.1 LLM 是如何构建的:IBM 公开预训练、SFT 与强化学习全流程

    IBM Granite 团队发布技术文章,详解 Granite 4.1 系列(3B、8B、30B 稠密 decoder-only 模型)的构建流程:约 15T token 五阶段预训练、上下文扩展至 512K、约 4.1M 高质量样本的 SFT,以及基于 on-policy GRPO 与 DAPO loss 的多阶段强化学习。

    推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的取舍。

4月25日周六
4月22日周三
4月21日周二
  1. Hugging Face Blog33

    QIMMA قِمّة:Hugging Face 推出质量优先的阿拉伯语 LLM 排行榜

    Hugging Face 发布 QIMMA قِمّة 阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证。该榜单整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌文学与代码 7 大领域,其中 99% 为原生阿拉伯语内容,并首次在阿拉伯语排行榜中引入代码评测。

4月20日周一
  1. Berkeley AI Research34

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使基于学习动力学(世界模型)的长时程规划变得可行。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun 和 Amir Bar 合作完成。

4月16日周四
4月15日周三
  1. Hugging Face Blog40

    VAKRA 基准解析:AI 智能体的推理、工具调用与失败模式

    Hugging Face 发布 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评估 AI 智能体的组合推理与多步工作流执行能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择与多跳推理四类任务,模型整体表现不佳。博客进一步分析了不同任务上观察到的失败模式。

4月9日周四
4月3日周五
4月1日周三
  1. Hugging Face Blog62

    TII 发布 Falcon Perception 与 Falcon OCR 模型

    阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。

    推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。

3月31日周二
  1. Hugging Face Blog32

    OpenMed 用 165 美元训练跨 25 物种的 mRNA 语言模型

    OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。

3月26日周四
  1. Google DeepMind60

    Google DeepMind 发布首个经实证验证的 AI 有害操纵评测工具

    Google DeepMind 发布关于 AI 有害操纵的研究,称其为首个经实证验证的评测工具,并公开运行同类人类被试研究所需的全部材料。研究覆盖英国、美国、印度共 9 项实验、逾 10000 名参与者,聚焦金融与健康等高风险场景,发现 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功不能预测另一个领域。

    推荐理由:原文公开了可复用的有害操纵评测工具与万人级实验数据,读者可据此了解AI操纵能力的测量方式与边界。

3月25日周三
  1. Google Research62

    Google 发布 TurboQuant 等向量量化算法,将 KV cache 压缩至 3 bit

    Google Research 提出 TurboQuant 压缩算法,并配套 QJL 和 PolarQuant 两种方法,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 发表。

    推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度的前提下把 KV cache 压到 3 bit,并给出与基线的对比数据。

3月24日周二
3月19日周四
3月18日周三
  1. Google DeepMind46

    Google DeepMind 发布 AGI 认知框架,并启动 Kaggle 黑客松

    Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出包含感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知 10 项能力的认知分类框架,并配套三阶段评估协议,用留出测试集防数据污染、采集具人口代表性的人类基线、将 AI 表现映射到人类表现分布。

3月17日周二
  1. Google Research40

    Google 用高温超导研究问题测试 LLM 世界模型

    Google 与康奈尔大学合作,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。基于 1,726 篇受控文献的 NotebookLM 在多数维度表现最佳,自建 RAG 系统紧随其后,所有系统均有待改进之处。

3月13日周五
3月12日周四
  1. Google Research62

    Google 推出 Groundsource:用 Gemini 将新闻报道转为灾害数据

    Google Research 推出 Groundsource,用 Gemini 从新闻报道中提取结构化灾害数据,首个开放数据集包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。

    推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,其准确率与覆盖范围可供评估 LLM 构建科学基准数据的可行性。

  2. Google Research62

    Google 与 BIDMC 开展 AMIE 对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。

    推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊流程中的安全与诊断数据,可对照其与 PCP 的差异。

3月10日周二
3月9日周一
3月7日周六
  1. Google Research62

    Google Research 发布 WAXAL:覆盖 27 种非洲语言的大规模开放语音数据集

    Google Research 发布 WAXAL 大规模开放语音数据集,覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音和超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,Google 提供方法指导。项目自 2021 年启动,Google 表示将持续扩充语言覆盖。

    推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。