OpenAI 公布数学与理论计算机科学领域的十项进展
OpenAI 公布在数学与理论计算机科学若干长期未解问题上取得的新结果,涵盖几何、密码学与复杂性等方向。材料仅提供摘要,未列出具体问题、方法或数据。
推荐理由:OpenAI 公布数学与理论计算机科学中若干长期未解问题的进展,涉及几何、密码学与复杂性方向。
内容形态
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
117 条精选近 30 天 11 条共收录 410 条
OpenAI 公布在数学与理论计算机科学若干长期未解问题上取得的新结果,涵盖几何、密码学与复杂性等方向。材料仅提供摘要,未列出具体问题、方法或数据。
推荐理由:OpenAI 公布数学与理论计算机科学中若干长期未解问题的进展,涉及几何、密码学与复杂性方向。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并落地为自主科研原型 Science One Framework 与配套的 CoE Audit 审计指标。
推荐理由:原文给出可验证性框架与审计指标,读者可据此比较自主科研系统在引用与代码一致性上的差距。
Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。
推荐理由:原文给出跨平台内核迁移的具体方法与实测数据,读者可据此判断 CUDA 经验能否复用到 Apple Silicon。
Google Research 发布 SymptomAI,一个基于 Gemini Flash 2.0 的对话式症状评估智能体,在 n=13,917 的随机全国研究中让参与者与五种不同提问策略的智能体对话并给出鉴别诊断(DDx)。
推荐理由:Google 用 13917 人随机对照研究比较五种提问策略,并首次把 AI 诊断与 Fitbit 生理信号做交叉验证。
Google Research 在 Nature 发表论文,提出用强化学习智能体从量子纠错检测事件中学习,在计算过程中持续调节数千个控制参数以对抗漂移。在 Willow 超导处理器上人为注入漂移后,该方法将纠错码的逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步把逻辑错误率压低 20%,使表面码逻辑错误降至每千个纠错周期不到一次。
推荐理由:Google 用强化学习让量子处理器在计算中持续校准控制参数,读者可了解纠错与校准解耦这一瓶颈的新解法。
Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料来自五百万名同意参与者、超过一万亿分钟的多模态传感器信号,覆盖 100 多个国家、50 个美国州和 20 多种 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用五百万人的万亿分钟可穿戴数据预训练通用生理表征,读者可了解基础模型在健康信号上的规模化路径。
Google Research 发布新架构,将多 token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,在不改动主干权重的前提下加速端侧推理,已上线 Pixel 9 和 10 系列。
推荐理由:Google 把多 token 预测接到冻结的 Gemini Nano v3 上,读者可了解端侧推理在内存与能耗约束下的具体优化路径。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部部署和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,把内部智能体视为可能未对齐的潜在内部威胁。
推荐理由:DeepMind 公开内部 AI 控制路线图,给出检测与响应分级和百万条编码智能体轨迹的实测数据,可供安全团队参考。
Google DeepMind 公布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,八周内完成。
推荐理由:原文给出塞拉利昂预注册试验的量化结果与教师主导设计,可了解 AI 辅助教学在真实课堂中的效果边界。
Google Research 在 Nature 发表 PHRM 研究系统,利用手机前摄在面部解锁后拍摄视频,在后台被动估算心率和静息心率。该系统与 ECG 对比的 MAPE 低于 10%,每日 RHR 与 Fitbit Charge 6 对比的 MAE 为 4.39 bpm,并在浅、中、深三种肤色分组中均达到预设的非劣效标准。
推荐理由:Google 用手机前摄在解锁后被动测心率,论文给出跨肤色误差与可申请的数据和模型资源。
Google 宣布把基于 Gemini 的科研工具 Empirical Research Assistance(ERA)开放给科学家使用,相关论文同日发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,可据此判断科研编码自动化的落地边界。
Google DeepMind 介绍其 Co-Scientist 正被用于细胞衰老逆转研究,帮助生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室筛选基因通路。Co-Scientist 扫描数万篇论文后提出 20 多个新的候选基因因子,实验室测试验证了其中几个假设,成功让细胞进入更年轻状态并改善整体功能。它还能将原本需要长达六个月的筛选数据分析缩短到几天。
推荐理由:原文给出 Co-Scientist 在衰老研究中的具体产出与耗时对比,可了解 AI 智能体参与科研假设生成的实际方式。
斯坦福大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,用 Google DeepMind 的 Co-Scientist 从已有药物文献中筛选可重定位治疗肝纤维化的候选药。
推荐理由:斯坦福团队用 Co-Scientist 筛选抗纤维化药物,实验显示其候选药物表现优于研究者自选,可了解 AI 辅助药物重定位的实际验证方式。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化科学假设。
推荐理由:原文给出多智能体系统的三阶段架构与多个实验室应用案例,可了解 AI 参与科学假设生成的具体方式。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体仍更强。
推荐理由:DeepMind 公开医疗 AI 智能体的多模态评测细节,读者可据此了解 AI 在临床问诊中已达标与仍欠缺的具体环节。
Google Research 汇总了科学家使用 Empirical Research Assistance(ERA)的四类实践:公共卫生领域,团队每周向 CDC 的流感。
推荐理由:Google 官方汇总 ERA 在流行病预测、宇宙学、碳监测与神经科学四类真实科研任务中的使用结果,可了解 AI 辅助科研的落地边界。
IBM Granite 团队发布技术文章,详解 Granite 4.1 系列(3B、8B、30B 稠密 decoder-only 模型)的构建流程:约 15T token 五阶段预训练、上下文扩展至 512K、约 4.1M 高质量样本的 SFT,以及基于 on-policy GRPO 与 DAPO loss 的多阶段强化学习。
推荐理由:Granite 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的取舍。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛并以异步数据流连接,降低带宽需求并隔离硬件故障。
推荐理由:原文给出分布式训练在带宽、容错和跨代硬件上的实测结果,可据此判断大规模预训练基础设施的演进方向。
Google Research 在 ICLR 论文中提出智能体记忆框架 ReasoningBank,从成功和失败经验中提炼高层推理模式,用于测试时自我进化。
推荐理由:Google Research 的 ICLR 论文提出从成功与失败经验中提炼推理记忆的框架,并给出 WebArena 与 SWE-Bench-Verified 上的对比数据。
阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。