Google Research 用 AI 合成神经元加速脑图谱绘制,重建误差降低 4.4%
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。
Google Research 提出 MoGen(Neuronal Morphology Generation),用 PointInfinity 点云流匹配模型生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含产品发现、替代品、购物车构建、退货、订单追踪、政策问答、组合规划和多意图旅程 8 个可验证环境,每个环境配有程序化问题生成、12 轴难度课程和算法可验证奖励。
Hugging Face 发布 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评估 AI 智能体的组合推理与多步工作流执行能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择与多跳推理四类任务,模型整体表现不佳。博客进一步分析了不同任务上观察到的失败模式。
Google Research 推出 ConvApparel,一个包含 4000 多组人机多轮对话(近 15000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类行为的真实感差距。
Google 发布两款学术智能体:PaperVizAgent 负责生成论文配图,ScholarPeer 负责自动同行评审。PaperVizAgent 由检索、规划、风格、可视化、评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any,是唯一超过 50.0 人类基线的框架。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。
阿布扎比 TII 的 Falcon Vision 团队发布 Falcon Perception,一个 0.6B 参数的早期融合 Transformer,用自然语言提示做开放词汇定位与分割,在 SA-Co 上达到 68.0 Macro-F1,高于 SAM 3 的 62.3,但在存在性校准上落后(MCC 0.64 对 0.82)。
推荐理由:原文给出 0.6B 早期融合模型在 SA-Co 与 PBench 上的分项对比,可据此判断单骨干架构在开放词汇感知上的取舍。
Google Research 在论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,并已将模拟器在 GitHub 开源。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。
Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线加密所需的 qubit 和门数比此前认为的更少。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 所需量子资源的新估算,并说明如何在不泄露攻击细节的前提下公开漏洞。
Google DeepMind 发布关于 AI 有害操纵的研究,称其为首个经实证验证的评测工具,并公开运行同类人类被试研究所需的全部材料。研究覆盖英国、美国、印度共 9 项实验、逾 10000 名参与者,聚焦金融与健康等高风险场景,发现 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功不能预测另一个领域。
推荐理由:原文公开了可复用的有害操纵评测工具与万人级实验数据,读者可据此了解AI操纵能力的测量方式与边界。
Google Research 提出 TurboQuant 压缩算法,并配套 QJL 和 PolarQuant 两种方法,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 发表。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度的前提下把 KV cache 压到 3 bit,并给出与基线的对比数据。
Google Research 发布自监督框架 S2Vec,将道路、建筑等建成环境特征栅格化为多层图像,通过掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可预测人口密度、收入等指标。
ServiceNow 在 Hugging Face 发布 EVA,一个面向对话式语音智能体的端到端评测框架,同时给出 EVA-A(准确性)和 EVA-X(体验)两个分数,并称是首个联合评估任务成功与会话体验的框架。
OpenAI 采用思维链监控(chain-of-thought monitoring)研究内部编程智能体的失准(misalignment)问题,通过分析真实部署场景来检测风险并强化 AI 安全保障措施。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统在乳腺筛查中的应用。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的前瞻部署数据,可了解人机双读流程的实际收益与仲裁环节风险。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出包含感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知 10 项能力的认知分类框架,并配套三阶段评估协议,用留出测试集防数据污染、采集具人口代表性的人类基线、将 AI 表现映射到人类表现分布。
Google 与康奈尔大学合作,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。基于 1,726 篇受控文献的 NotebookLM 在多数维度表现最佳,自建 RAG 系统紧随其后,所有系统均有待改进之处。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在特征、数据和模型组件归因中识别 LLM 的关键交互。SPEX 利用交互的稀疏性与低阶性,将搜索问题转化为稀疏恢复问题;ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
Google Research 推出 Groundsource,用 Gemini 从新闻报道中提取结构化灾害数据,首个开放数据集包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,其准确率与覆盖范围可供评估 LLM 构建科学基准数据的可行性。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊流程中的安全与诊断数据,可对照其与 PCP 的差异。
OpenAI 发布 IH-Challenge,用于训练模型优先执行可信指令,从而改进指令层级、安全可控性以及抵御提示注入攻击的能力。
推荐理由:OpenAI 公开 IH-Challenge 训练方法,可用于理解前沿模型如何提升指令层级与抗提示注入能力。
Google Research 发布 WAXAL 大规模开放语音数据集,覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音和超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,Google 提供方法指导。项目自 2021 年启动,Google 表示将持续扩充语言覆盖。
推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。
OpenAI 提出 CoT-Control,发现推理模型难以控制自身的思维链,这反而强化了可监控性作为 AI 安全保障的价值。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会按贝叶斯方式更新对用户偏好的概率估计。实验显示,该方法不仅提升训练任务表现,还能泛化到其他任务;而未经训练的 LLM 表现明显逊于最优贝叶斯助手,且往往在单轮交互后性能就停滞。
一篇新预印本将单负振幅扩展至引力子,GPT-5.2 Pro 参与推导并验证了量子引力中非零的引力子树振幅。
OpenAI 与 Pacific Northwest National Laboratory 联合推出 DraftNEPABench,用于评估 AI 编程智能体如何加速联邦许可审批。该基准显示,NEPA 文件起草时间有望最多缩短 15%,助力基础设施审查现代化。
OpenAI 宣布不再使用 SWE-bench Verified 评测,理由是这一基准正日益受到污染,无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷和训练数据泄漏问题,并建议改用 SWE-bench Pro。
推荐理由:OpenAI 说明 SWE-bench Verified 存在污染与测试缺陷,并给出替代基准建议,可供关注编码评测的人参考。
OpenAI 公开了其 AI 模型在 First Proof 数学挑战赛中的证明尝试,用于测试模型在专家级问题上的研究级推理能力。
IBM Research 与 UC Berkeley 合作,用 MAST(多智能体系统失败分类法)分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
推荐理由:IBM 与 UC Berkeley 用 MAST 分类法拆解 310 条 ITBench 执行轨迹,给出不同模型失败模式的差异与对应工程干预方向。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞场景,覆盖发现、修复与攻击三类任务。
Google Research 提出 MapTrace,一套用 Gemini 2.5 Pro 与 Imagen-4 自动生成地图寻路数据的流水线,并开源 200 万条问答对。
OpenAI 发布的一篇新预印本显示,GPT-5.2 为胶子振幅提出了一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。
推荐理由:材料给出 GPT-5.2 在理论物理中提出新公式并被形式化证明的案例,可观察模型在科研推理上的边界。
Google Research 发布开源原型框架 DialogLab,用于创作、模拟和测试动态的人机群组对话,已在 ACM UIST 2025 展示。该框架将对话的社会设定与时间流程解耦,支持拖拽式场景搭建、human control 实时干预和对话动态可视化验证。
Google DeepMind 于 2025 年 8 月发布的生物声学基础模型 Perch 2.0 主要用鸟类等陆生动物音频训练,却在未接触任何水下音频的情况下,作为嵌入模型在海洋任务迁移学习中表现优异。
Google DeepMind 发布两篇论文,介绍由 Gemini Deep Think 驱动的数学研究智能体 Aletheia 及跨学科研究案例。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级评估方式。
OpenAI 与 Ginkgo Bioworks 的云端自动化平台结合,构建了一个由 GPT-5 驱动的自主实验室,通过闭环实验将无细胞蛋白合成成本降低 40%。
Google Research 提出 Sequential Attention,用贪心选择机制逐步、自适应地挑选要加入模型的层、模块或特征,并将选择过程直接整合进单次模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,实现快速单遍贪心选择,同时提升效率与可解释性,可扩展至大规模特征选择。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,在真实虚拟护理工作流中评估对话 AI 的表现。
推荐理由:Google 与 Included Health 合作开展全国性随机对照研究,读者可了解医疗对话 AI 从模拟走向真实临床的评估路径。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 组智能体配置做大规模对照评测,得出首批智能体系统的量化缩放原则,指出“智能体越多越好”常会触顶甚至降低表现。