跳到正文
7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。

    推荐理由:原文给出跨平台内核迁移的具体方法与实测数据,读者可据此判断 CUDA 经验能否复用到 Apple Silicon。

7月27日周一
  1. Import AI62

    Epoch 与 METR 发布 MirrorCode 长周期编程基准

    Epoch 与 METR 发布 MirrorCode 基准,考察 AI 仅凭 CLI 访问重新实现软件程序的能力,覆盖 25 个目标程序。Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2 至 17 周的任务,17/25 的目标程序至少有一次满分运行,但 8/25 从未达到 100% 阈值,ruff、giac_subset 和 mailauth 最难。

7月26日周日
  1. Berkeley AI Research33

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督,替代完整交互历史作为智能体工作上下文。在 CollabBench 协作编程任务中,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。

7月23日周四
  1. Google Research62

    Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体

    Google Research 发布 SymptomAI,一个基于 Gemini Flash 2.0 的对话式症状评估智能体,在 n=13,917 的随机全国研究中让参与者与五种不同提问策略的智能体对话并给出鉴别诊断(DDx)。

    推荐理由:Google 用 13917 人随机对照研究比较五种提问策略,并首次把 AI 诊断与 Fitbit 生理信号做交叉验证。

  2. Google Research62

    Google Research 用强化学习让量子计算机从错误中学习

    Google Research 在 Nature 发表论文,提出用强化学习智能体从量子纠错检测事件中学习,在计算过程中持续调节数千个控制参数以对抗漂移。在 Willow 超导处理器上人为注入漂移后,该方法将纠错码的逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步把逻辑错误率压低 20%,使表面码逻辑错误降至每千个纠错周期不到一次。

    推荐理由:Google 用强化学习让量子处理器在计算中持续校准控制参数,读者可了解纠错与校准解耦这一瓶颈的新解法。

7月16日周四
  1. Google Research27

    Google Research 揭示扩散模型创造力来源:score smoothing 机制

    Google Research 在 ICLR 2026 论文中揭示,扩散模型的创造力源于神经网络训练中的 score smoothing 效应:权重衰减等正则化使学到的 score function 变平滑,让去噪过程在训练数据点之间插值,从而生成新样本。研究用一维 +1/-1 示例和两层 ReLU 网络实验验证,即使没有显式正则化,梯度训练的隐式正则化也能产生该效应。

7月15日周三
7月9日周四
  1. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态传感器信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。

    推荐理由:Google 用五百万人的万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康信号上的规模化路径。

7月8日周三
7月1日周三
6月30日周二
6月29日周一
  1. Import AI38

    Import AI 463:NVIDIA 用 ENPIRE 让机器人自我改进;中国 1 万卡 GPU 集群;人类时代挽歌

    NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主试错与策略改进,在 PushT、整理插针、用切割器剪扎带等任务上达到 99% 成功率,测试硬件为双 YAM 机械臂加 RTX 5090 工作站。GPT-5.5(Codex)与 Opus 4.7(Claude Code)表现互有胜负,Kimi-2.6 落后,8 个智能体并行能更快得到更高分。

6月27日周六
  1. Google Research62

    Google 用冻结多 token 预测加速 Pixel 上的 Gemini Nano 模型

    Google Research 发布新架构,将多 token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在不改动主干权重的前提下加速端侧推理,已上线 Pixel 9 和 10 系列。

    推荐理由:Google 把多 token 预测接到冻结的 Gemini Nano v3 上,读者可了解端侧推理在内存与能耗约束下的具体优化路径。

6月25日周四
6月24日周三
6月22日周一
6月19日周五
  1. Hugging Face Blog49

    MosaicLeaks:你的深度研究智能体能守住秘密吗?

    Hugging Face 博客提出 MosaicLeaks,用 1001 条多跳研究链测试深度研究智能体的隐私泄漏,其外部查询日志可被拼凑出私有企业信息。测试中智能体频繁泄漏,仅优化任务表现会加剧泄漏;其 Privacy-Aware Deep Research(PA-DR)RL 训练方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄漏从 34.0% 降至 9.9%。

6月18日周四
6月17日周三
6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap 与智能体安全技术框架

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部部署和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,把内部智能体视为可能未对齐的潜在内部威胁。

    推荐理由:DeepMind 公开内部 AI 控制路线图,给出检测与响应分级和百万条编码智能体轨迹的实测数据,可供安全团队参考。

6月13日周六
  1. Google Research38

    Google Research 研究 AI 如何帮助用户理解皮肤问题

    Google Research 公布两项关于 AI 辅助皮肤问题理解的研究,其中发表于 JAMA Dermatology 的大规模调查显示,2345 名参与者使用 AI 工具后尝试命名皮肤状况的比例超 62%,准确率 23%,约为对照组 8% 的近三倍。但 AI 组在判断下一步就医建议上未取得统计显著改善,且比对照组更易给出不够紧急的建议。

6月11日周四
  1. Google Research29

    Google Research 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘

    Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。该框架基于 f-divergence,支持 Chi-squared、KL 和 Hockey-stick 等散度,可自动选择最优散度与超参数,无需样本划分,并在任意样本量下控制假阳性。

6月8日周一
  1. Google DeepMind62

    Google DeepMind 在塞拉利昂开展 AI 学习试验并发布教师培训指南

    Google DeepMind 公布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,八周内完成。

    推荐理由:原文给出塞拉利昂预注册试验的量化结果与教师主导设计,可了解 AI 辅助教学在真实课堂中的效果边界。

6月5日周五
  1. Google Research71

    Google 研究用手机前摄实现被动心率监测

    Google Research 在 Nature 发表 PHRM 研究系统,利用手机前摄在面部解锁后拍摄视频,在后台被动估算心率和静息心率。该系统与 ECG 对比的 MAPE 低于 10%,每日 RHR 与 Fitbit Charge 6 对比的 MAE 为 4.39 bpm,并在浅、中、深三种肤色分组中均达到预设的非劣效标准。

    推荐理由:Google 用手机前摄在解锁后被动测心率,论文给出跨肤色误差与可申请的数据和模型资源。

6月1日周一
  1. Import AI38

    Import AI 459:AI 监管为何困难、蛋白质折叠模型的缩放定律、以及为 AI 系统灭绝风险定价

    Import AI 459 聚焦三项研究:英国 AI 安全研究所的论文指出用 AI 监督 AI 训练的自动化对齐并非万能方案;另有工作提出蛋白质折叠模型的缩放定律,以及为 AI 系统灭绝风险定价的尝试。同期还介绍了美国 AI 经济年增速约 2,000%、2025 年名义 AI GDP 约 2500 亿美元的测算研究。

5月28日周四
  1. Google Research36

    Google 推出零信任聚合的隐私分析方案

    Google 为隐私分析服务推出零信任聚合方案,结合新型密码学聚合协议与 TEE,使设备只需单条消息即可安全提交数据,无需多轮在线交互。该协议可证明 Google 只能获得群体的匿名聚合洞察,原始个体数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则向参与者验证协议按公开代码正确执行。

5月20日周三
5月19日周二
  1. Google DeepMind62

    Google DeepMind 用 Co-Scientist 加速细胞衰老逆转的基因线索发现

    Google DeepMind 介绍其 Co-Scientist 正被用于细胞衰老逆转研究,帮助生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室筛选基因通路。Co-Scientist 扫描数万篇论文后提出 20 多个新的候选基因因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。它还能将原本需要长达六个月的筛选数据分析缩短到几天。

    推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与耗时对比,可了解 AI 智能体参与科研假设生成的实际方式。

5月18日周一