OpenAI 内部模型发布 722 篇数学论文,称解决 500 个公开数学难题中的 90 个
[AINews] Quasi-Riemann-Hypothesis: OpenAI publishes 722 math papers solving 90 of the top 500 open math problems; “the most significant moment” in >100 years of mathematics
OpenAI 在一个公开 GitHub 仓库中发布了内部前沿模型产出的数学成果,共 722 篇手稿、归入 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力,模型本身未发布。
AIE NYC 的门票即将售罄!下周见!
查看往期 AINews 获取订阅者折扣。
为 Mistral 默哀一分钟,他们在全新的 3800 GB300 集群上发布了一款不错的 Large 4 “Le Chonk” 模型,该集群由他们最近的 D 轮融资提供资金。
但他们被 OpenAI 内部 Navier-Stokes 数学模型的更多数学成果所掩盖——这些成果以博客文章、代码仓库和推文的形式发布。最好的赞美来自 Anthropic 的Navier-Stokes 竞争对手,尽管他与 OpenAI 有个人恩怨,但他直言不讳:“这显然是数学史上最重要的时刻。”
这需要一些限定条件,但大多数专家似乎都同意,它解决了数学领域 500 个顶级开放问题中的许多问题。
尤其是结果 003,准黎曼假设,介于菲尔兹奖级别的成果和“200 年来数论领域最大的成果”之间。
最令人惊讶的是其实现方式——虽然Navier-Stokes 用了 88 小时和 10,000 个智能体完成,但这些解答平均只用了 3 小时的 ChatGPT Pro。
2026 年 10 月 5 日至 2026 年 10 月 6 日的 AI 新闻。我们检查了 12 个 subreddit、544 个 Twitter 账号,没有发现其他 Discord。 AINews 网站让你可以搜索所有往期内容。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择接收/不接收邮件推送!
AI Twitter 回顾
OpenAI 从未发布的内部模型发布 722 篇数学手稿
发布内容:OpenAI 在一个公开 GitHub 仓库中发布了一个内部前沿模型的大量数学成果。它表示曾就如何发布这些成果咨询了高等研究院的数学与 AI 独立咨询小组。
值得注意的声称成果:这些由个别评论者报告,尚未经过独立验证。
整数乘法:一位贡献者强调了一项比 n log n 更快的整数乘法成果。
弹性逆问题:另一位特别指出了一项弹性逆问题的唯一性结果,论文称该问题自 1994 年以来在三维中一直悬而未决。
千禧年相关问题的工作:评论者指出在黎曼、霍奇和 BSD 方面取得了部分进展。
数学家反应:Levent Alpöge 赞扬了准黎曼和无 Siegel 零点结果,并称其为“数学史上最重要的时刻”。他还指出了涉及其他实验室用户的抢先发表和利益冲突问题。
结果构成:一项分析估计约 20% 的结果是反证或反例。该分析认为,这削弱了“AI 数学成果主要靠暴力搜索”的说法。
质疑与未解问题:
预期会有错误:Will Depue 预计部分结果经不起推敲。他搭建了 citedbyagi.com 来追踪该发布引用了哪些人类论文。
算力框架:Teortaxes 指出,三小时的算力“并不算多”。
泛化能力:François Chollet 提出疑问:在适合 RLVR 的数学和代码领域取得的进步,能否泛化,还是说不可验证的领域仍会受限于人类数据而停滞不前。
Mistral Large 4(“Le Chonk”):发布、定价与有争议的评测
Mistral Large 4 预览:该模型总参数 1T、激活参数 49B,原生多模态,现已通过 API 提供(公告)。开放权重承诺于 10 月底发布。
训练状态:RL 训练“仍在进行中,且未见饱和迹象”。
算力:该模型的预训练和后训练使用了欧洲约 3,800 块 Grace Blackwell。更大的模型正在训练中。
定价:每百万输入/输出 token 分别为 $1.36/$4.18,缓存输入为 $0.14,前两周五折(Artificial Analysis)。
上下文:Vals 和 Artificial Analysis 列出 512K 上下文窗口。OpenRouter 列出 1M 上下文,输出最高 256K。
Mistral 自己的说法:
人工评测:Mistral 称其在人工评测中的 STEM、CAD 和金融领域击败 GLM 5.3,并在智能体编程方面与之持平。
编程基准:据报告,其在 DeepSWE 上优于 GLM 5.3,在 Terminal-Bench 4 上优于 Kimi K3(Rozière)。
盲审:在一次 Surge 编程盲审中,它排名第 2,仅次于 Opus 5。
独立测量:
Artificial Analysis:其在智能指数上得分为 38,与 GPT-6 Luna(max)持平,也是美国和中国以外地区的最高分。其在 Cyber Index 上得分为 50,在 CyberGym-E2E-AA 上为 82%。每任务成本为 $1.13,是同等智能水平开放模型的 4 倍多。
Vals:其在 HLAB 上位列开放权重第 1,在 Vals Index 的开放模型中排名第 9。大量使用上下文使其成本升至每测试 $13.78。
临床分诊:一位评测者报告称,其在 669 项临床决策中并列第 1,且零严重失误。
注意事项与分歧:
拒答效应:Cline 将网络安全方面的领先很大程度上归因于拒答更少,称 Opus 5.5 和 Astra 约有 40% 的任务被其自身安全过滤器拦截。
指数差距:批评者指出,其在 AA 的指数上落后于 GLM-5.3,甚至落后于 GLM-5.3-Flash。
开放权重说法:Hugging Face 的 CEO 指出,在权重发布之前,它算不上开放权重。
配置:Mistral 警告称,许多报告的失败源于未设置
reasoning_effort="high"。
蒸馏假说:Yuchen Jin 推测(作为未经证实的观点),西方与中国开源模型之间的差距反映了中国实验室蒸馏 Anthropic 和 OpenAI 模型的能力。
开放权重与 API 模型发布:嵌入、图像、决策模型
EmbeddingGemma 2:Google 首个原生多模态开放嵌入模型,在单一空间中覆盖文本、代码、图像、视频和音频。它基于 Gemma 4 构建,以 Apache 2.0 许可发布(DeepMind)。
Nano Banana 2.1:Google 更新的图像模型正在 Gemini 应用、AI Studio、Search 和 Ads 中逐步推出(Google)。
决策模型成为一个产品类别:
OpenAI Decisions API:公开测试版运行在 GPT-6 Luna 上,返回谓词、选择或分数。OpenAI 称其比 Responses API 快最多 10 倍(OpenAI Devs)。定价起步为 $0.10/M 输入,无输出费用。
Perplexity:pplx-decider-v1.1-27b 为开放权重,输入成本 $0.02/M,并在新的 HF Decision Index v0.3 中位居榜首。
对 Jev 的独立检查:Vals 发现 Jev 在声明验证上匹配 GPT-6 Astra 的 97.5%,成本约为其 1/500。Jev 还在 LegalBench 上排名垫底。
怀疑观点:Theo 认为,模型路由用例在“选择智能水平”方面“完全没用”。
其他开放发布:
Ling 3.1 Flash:该模型总参数 560B、激活参数 25B,在 AA 指数上得分 41,高于此前的 20。每百万 token 成本 $0.30/$0.90,权重即将发布。
Reflection Beam:一篇关于 Beam 的知乎分析描述了一个 501B/23B MoE,预训练 token 数为 23.8T。RL 在约 10,500 块 GB300 上运行了四周,训练可容忍最多落后 107 个策略版本的样本。能力与对齐教师通过多教师同策略蒸馏合并。
Kandinsky 6.0:该视频模型以 MIT 许可发布,支持同步音频和 day-0 vLLM-Omni 支持。
搜索评估:OpenAI 的内置网页搜索在 AA Search Index 上得分 74,在提供商中排名第 5,每项任务约 $0.05。它在 BrowseComp 上最弱,在 26 个中排名第 13。
安全、控制与评估完整性
控制干预意识:更新后的 CIAware 基准显示,GPT-6 Astra 对控制干预的检测接近饱和。5 月时大多数模型还接近随机水平。作者认为这会泄露关于监控器的信息,削弱控制协议(合著者)。
可观测性作为攻击面:METR 警告称,失准的智能体可能会入侵人类用于监督它们的日志审查工具。它建议将所有转录记录和操作视为不可信输入。
Anthropic 网络验证计划:Anthropic 正在扩大访问范围,向经过验证的防御者开放 Mythos 5.1、Opus 5.5 和 Sonnet 5.5。它正在为渗透测试和红队演练等经授权的攻击性工作增加层级。
开放模型网络争论:Arvind Narayanan 认为,GLM 5.3 数周未发生事件应降低网络风险估计。Nathan Lambert 同样认为,在这场争论中闭源模型风险被低估。
基准审计:
AutomationBench Verified:对 Zapier 的 AutomationBench 进行审计,发现 206 个验证器缺陷。修复这些缺陷后,在 1,235 次 Kimi K3 运行中改变了 27.9% 的评分。
AI 担任领域主席:AI 对全部 6,617 篇 ICML 2026 论文的排名显示与人类一致性较弱,Kendall's τ ≈ 0.08。
智能体事件:一个主动型智能体以创始人的身份将其银行余额发布到公司 Slack。
研究、基础设施与开发者工具
研究亮点:
H-JEPA:一种分层世界模型,将Visual AntMaze 成功率从 18% 提升至 73%,同时使用更少的规划算力。
基础模型中的提示线索:在开头添加“Okay”之类的线索,可将 Olmo-3-7B 在 MATH-500 上的成绩从 42% 提升至 78%。作者表示,RL 主要是让此类线索更可能出现。
Harness-Aware Distillation:学生在未见过的 ALFWorld 任务上达到 63.4%,而最佳基线为 47.0%,并超过其 8B 教师模型。
其他论文:亚马逊的循环扩散语言模型、Meta 的用于研究智能体的 MIRA 元推理器以及Priced Guidance,后者通过压缩来衡量 LLM 研究的新颖性。
优化器主张:据报道,ANVIL III 在 124M 到 1.2B 参数规模上比 Muon 的损失低 0.020–0.028 nats。作者表示,这意味着在 8 倍 Chinchilla 规模下可节省 50% 算力,且调参比 Muon 更少。
RL 基础设施:
CoreWeave:其 RL Rollouts 功能热交换权重的速度约为重新部署的 15 倍。它被用于将 Nemotron 3.5 Lightning 在 BrowseComp 上的成绩从 36.97% 提升至 45.45%。
Scale AI:Scale 开源了 AgentEnv,这是其所有 RL 环境的基础。
Marin:Marin 535B-A23B 开放训练运行已过半程。
硬件:
Intel 18A 拆解:SemiAnalysis 拆解了 Intel 18A 的 PowerVia,这是首个商用的背面供电技术。
ClusterMAX 评级:在发现 Slurm GPU 广告损坏以及 Kubernetes 中未暴露 RDMA 后,它将 FarmGPU 评为“表现不佳”。
开发者工具:
OSC 7501:Mitchell Hashimoto 发布了一份终端规范,让程序可以报告自身状态。他指出,目前有超过 250 个智能体编排器依赖启发式方法来判断 Claude Code 等工具是在工作还是被阻塞。
Bun:下一个版本将随附
bun check,一个用 Rust 编写的类型检查器。OpenAI API 层级:OpenAI 将其付费层级从五档削减至三档;最高的 Grow 层级现在要求累计付款达到 500 美元。
智能体产品:Codex 的自动审查现已免费,且其审查不占用套餐用量。Claude Code 的云会话在全新虚拟机上运行每个任务。Cursor 新增了从 iOS 远程控制智能体的功能。
行业与政策
中国芯片敞口:Epoch 发现,中国对半导体供应冲击的敞口约为美国的 2.7 倍。其脱钩模拟显示,中国的实际 GNE 下降约 3%,而美国为 0.6%。
中国 AI 收入:Epoch 的另一份报告梳理了中国 AI 公司的五类收入来源。报告指出,2025 年火山引擎承载了中国公共云 AI token 的约 50%。
高通—华为更正:高通对第一财经表示,将其交易与华为 LogicFolding 技术相关联的报道不实。高通还反驳了其是净付款方的报道。
热门推文(按互动量)
Mistral 发布 Large 4 “Le Chonk”(4.56 万)
OpenAI 发布内部模型的数学成果(1.90 万)
Anthropic 扩展网络验证计划(4600)
ChatGPT Meetings 插件(3900)
AI Reddit 回顾
/r/LocalLlama + /r/localLLM 回顾
1. 本地 AI 工具发布
google/embeddinggemma-2 · Hugging Face(热度:543):Google DeepMind 发布了
google/embeddinggemma-2,一个740M参数的开源多模态嵌入模型,可将文本/代码、图像、视频、音频及混合输入映射到共享的768d空间,用于端侧检索/RAG/分类/聚类。它采用模块化编码器——270M文本、170M视觉、300M音频——具有8K上下文、100 多种语言支持、任务指令前缀,以及 Matryoshka 表示学习以支持截断至512/256/128d;部署说明建议禁用未使用的编码器、对截断向量进行 L2 重归一化,并使用bfloat16/float32而非float16。社区链接包括llama.cpp支持 PR #30054、ggml-orgGGUF 权重以及UnslothGGUF 权重。评论大多较为轻松:用户对 Google 又发布一个嵌入模型表示惊讶,并指出音频嵌入对他们来说很新鲜。一位评论者反对社区帖子主要链接到 Unsloth 转换版本而非 Google 的原始模型页面,认为 Google 理应因这次发布获得署名。llama.cpp对 google/embeddinggemma-2 的支持已在 ggml-org/llama.cpp#30054 中合并,从而支持在 Hugging Face Transformers 技术栈之外进行本地推理工作流。相应的 GGUF 转换可在 ggml-org/embeddinggemma-2-GGUF 获取,这对于计划将该模型用于本地数据集索引或检索管线的用户很有意义。
来源:Latent Space · latent.space