Google Quantum AI 发布白皮书:披露量子计算机破解加密货币加密的新资源估算
Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线加密所需的 qubit 和门数比此前认为的更少。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 所需量子资源的新估算,并说明如何在不泄露攻击细节的前提下公开漏洞。
内容形态
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
117 条精选近 30 天 11 条共收录 410 条
Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线加密所需的 qubit 和门数比此前认为的更少。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 所需量子资源的新估算,并说明如何在不泄露攻击细节的前提下公开漏洞。
Google DeepMind 发布关于 AI 有害操纵的研究,称其为首个经实证验证的评测工具,并公开运行同类人类被试研究所需的全部材料。研究覆盖英国、美国、印度共 9 项实验、逾 10000 名参与者,聚焦金融与健康等高风险场景,发现 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功不能预测另一个领域。
推荐理由:原文公开了可复用的有害操纵评测工具与万人级实验数据,读者可据此了解AI操纵能力的测量方式与边界。
Google Research 提出 TurboQuant 压缩算法,并配套 QJL 和 PolarQuant 两种方法,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 发表。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度的前提下把 KV cache 压到 3 bit,并给出与基线的对比数据。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统在乳腺筛查中的应用。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的前瞻部署数据,可了解人机双读流程的实际收益与仲裁环节风险。
Google Research 推出 Groundsource,用 Gemini 从新闻报道中提取结构化灾害数据,首个开放数据集包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,其准确率与覆盖范围可供评估 LLM 构建科学基准数据的可行性。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊流程中的安全与诊断数据,可对照其与 PCP 的差异。
OpenAI 发布 IH-Challenge,用于训练模型优先执行可信指令,从而改进指令层级、安全可控性以及抵御提示注入攻击的能力。
推荐理由:OpenAI 公开 IH-Challenge 训练方法,可用于理解前沿模型如何提升指令层级与抗提示注入能力。
Google Research 发布 WAXAL 大规模开放语音数据集,覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音和超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,Google 提供方法指导。项目自 2021 年启动,Google 表示将持续扩充语言覆盖。
推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。
OpenAI 宣布不再使用 SWE-bench Verified 评测,理由是这一基准正日益受到污染,无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷和训练数据泄漏问题,并建议改用 SWE-bench Pro。
推荐理由:OpenAI 说明 SWE-bench Verified 存在污染与测试缺陷,并给出替代基准建议,可供关注编码评测的人参考。
IBM Research 与 UC Berkeley 合作,用 MAST(多智能体系统失败分类法)分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
推荐理由:IBM 与 UC Berkeley 用 MAST 分类法拆解 310 条 ITBench 执行轨迹,给出不同模型失败模式的差异与对应工程干预方向。
OpenAI 发布的一篇新预印本显示,GPT-5.2 为胶子振幅提出了一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。
推荐理由:材料给出 GPT-5.2 在理论物理中提出新公式并被形式化证明的案例,可观察模型在科研推理上的边界。
Google DeepMind 发布两篇论文,介绍由 Gemini Deep Think 驱动的数学研究智能体 Aletheia 及跨学科研究案例。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级评估方式。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,在真实虚拟护理工作流中评估对话 AI 的表现。
推荐理由:Google 与 Included Health 合作开展全国性随机对照研究,读者可了解医疗对话 AI 从模拟走向真实临床的评估路径。
微软 unilm 团队发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下把 query 头数翻倍,使解码速度与标准 Transformer 持平,且不再需要自定义注意力 kernel。
推荐理由:微软团队给出 DIFF V2 的代码与消融对比,读者可据此理解差分注意力在解码速度与训练稳定性上的取舍。
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接以 2001 至 2018 年 NASA 卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:原文给出 NeuralGCM 在降水模拟上的误差下降与极端降水改进,可对照传统参数化方案的局限。
Google Research 为 STOC 2026 推出实验性 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 的推理扩展方法,在投稿后 24 小时内为作者提供自动化预审反馈。
推荐理由:Google 官方披露 PAT 在 STOC 2026 的实测反馈数据,可了解 AI 辅助数学证明审阅的实际表现与局限。
Google Research 发布 Titans 架构与 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,通过深度神经网络作为长期记忆模块实现测试时记忆。
推荐理由:Google 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,为超长上下文建模提供新思路。
Google DeepMind 发布研究,科学家借助 AlphaFold 与冷冻电镜结合,解析了“坏胆固醇”低密度脂蛋白(LDL)关键蛋白 apoB100 的结构。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,读者可了解 AI 在结构生物学中的具体协作方式。
Google Research 介绍了一种端到端语音到语音翻译(S2ST)模型,直接生成译文音频并保留原说话人音色,延迟仅 2 秒,而现有级联系统通常有 4-5 秒延迟且会累积误差。
推荐理由:Google 端到端语音翻译把延迟从 4-5 秒压到 2 秒并保留原说话人音色,可对照级联方案理解取舍。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明为该模型部署的安全措施。系统卡涵盖模型层缓解手段,包括针对有害任务和提示注入的专门安全训练,以及产品层缓解手段,如智能体沙箱和可配置网络访问。
推荐理由:系统卡披露了 GPT-5.1-Codex-Max 在模型层与产品层采取的安全措施,可了解其针对提示注入与智能体沙箱的防护思路。