跳到正文
Latent Space·· 3 小时前AI 评分81

OpenAI 内部模型发布 722 篇数学论文,称解决 500 个公开数学难题中的 90 个

[AINews] Quasi-Riemann-Hypothesis: OpenAI publishes 722 math papers solving 90 of the top 500 open math problems; “the most significant moment” in >100 years of mathematics

AI 导读

OpenAI 在一个公开 GitHub 仓库中发布了内部前沿模型产出的数学成果,共 722 篇手稿、归入 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力,模型本身未发布。

正文 · AI 翻译

AIE NYC 的门票即将售罄!下周见!

查看往期 AINews 获取订阅者折扣。


为 Mistral 默哀一分钟,他们在全新的 3800 GB300 集群上发布了一款不错的 Large 4 “Le Chonk” 模型,该集群由他们最近的 D 轮融资提供资金。

但他们被 OpenAI 内部 Navier-Stokes 数学模型的更多数学成果所掩盖——这些成果以博客文章、代码仓库和推文的形式发布。最好的赞美来自 Anthropic 的Navier-Stokes 竞争对手,尽管他与 OpenAI 有个人恩怨,但他直言不讳:“这显然是数学史上最重要的时刻。”

这需要一些限定条件,但大多数专家似乎都同意,它解决了数学领域 500 个顶级开放问题中的许多问题。

尤其是结果 003,准黎曼假设,介于菲尔兹奖级别的成果和“200 年来数论领域最大的成果”之间。

最令人惊讶的是其实现方式——虽然Navier-Stokes 用了 88 小时和 10,000 个智能体完成,但这些解答平均只用了 3 小时的 ChatGPT Pro。

2026 年 10 月 5 日至 2026 年 10 月 6 日的 AI 新闻。我们检查了 12 个 subreddit、544 个 Twitter 账号,没有发现其他 Discord。 AINews 网站让你可以搜索所有往期内容。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择接收/不接收邮件推送!


AI Twitter 回顾

OpenAI 从未发布的内部模型发布 722 篇数学手稿

Mistral Large 4(“Le Chonk”):发布、定价与有争议的评测

开放权重与 API 模型发布:嵌入、图像、决策模型

  • EmbeddingGemma 2:Google 首个原生多模态开放嵌入模型,在单一空间中覆盖文本、代码、图像、视频和音频。它基于 Gemma 4 构建,以 Apache 2.0 许可发布(DeepMind)。

    • 规格:它采用模块化设计,提供 740M 全模态、440M 文本+视觉、570M 文本+音频和 270M 纯文本变体。它支持从 768 降至 128 的 Matryoshka 维度,8,192 上下文,据报告在 MTEB Code 上提升 +14%(Phil Schmid)。

    • 占用:它使用约 191–567MB 的活动 RAM,每次处理最多 5.5 分钟音频或 58 帧视频(Google)。

    • 生态:Day-0 支持覆盖 llama.cpp、vLLM、Ollama 和 Unsloth。它还能在浏览器中通过 WebGPU 运行,每次查询约 20–70ms。

  • Nano Banana 2.1:Google 更新的图像模型正在 Gemini 应用、AI Studio、Search 和 Ads 中逐步推出(Google)。

    • 定价:每张图像 $0.034,而此前的 Pro 模型为 $0.134,Google 称其表现优于前者(Schmid)。

    • Arena 结果:它在 Multi-Image Edit 中排名第 4,在 Text-to-Image 中排名第 5,在 Image Edit 中排名第 6,在 Text-to-Image 中比 Nano Banana 2 提升 +80 分(Arena)。

  • 决策模型成为一个产品类别:

    • OpenAI Decisions API:公开测试版运行在 GPT-6 Luna 上,返回谓词、选择或分数。OpenAI 称其比 Responses API 快最多 10 倍(OpenAI Devs)。定价起步为 $0.10/M 输入,无输出费用。

    • Perplexity:pplx-decider-v1.1-27b 为开放权重,输入成本 $0.02/M,并在新的 HF Decision Index v0.3 中位居榜首。

    • 对 Jev 的独立检查:Vals 发现 Jev 在声明验证上匹配 GPT-6 Astra 的 97.5%,成本约为其 1/500。Jev 还在 LegalBench 上排名垫底。

    • 怀疑观点:Theo 认为,模型路由用例在“选择智能水平”方面“完全没用”。

  • 其他开放发布:

    • Ling 3.1 Flash:该模型总参数 560B、激活参数 25B,在 AA 指数上得分 41,高于此前的 20。每百万 token 成本 $0.30/$0.90,权重即将发布。

    • Reflection Beam:一篇关于 Beam 的知乎分析描述了一个 501B/23B MoE,预训练 token 数为 23.8T。RL 在约 10,500 块 GB300 上运行了四周,训练可容忍最多落后 107 个策略版本的样本。能力与对齐教师通过多教师同策略蒸馏合并。

    • Kandinsky 6.0:该视频模型以 MIT 许可发布,支持同步音频和 day-0 vLLM-Omni 支持。

  • 搜索评估:OpenAI 的内置网页搜索在 AA Search Index 上得分 74,在提供商中排名第 5,每项任务约 $0.05。它在 BrowseComp 上最弱,在 26 个中排名第 13。

安全、控制与评估完整性

研究、基础设施与开发者工具

行业与政策

热门推文(按互动量)


AI Reddit 回顾

/r/LocalLlama + /r/localLLM 回顾

1. 本地 AI 工具发布

  • google/embeddinggemma-2 · Hugging Face(热度:543):Google DeepMind 发布了google/embeddinggemma-2,一个740M参数的开源多模态嵌入模型,可将文本/代码、图像、视频、音频及混合输入映射到共享的768d空间,用于端侧检索/RAG/分类/聚类。它采用模块化编码器——270M文本、170M视觉、300M音频——具有8K上下文、100 多种语言支持、任务指令前缀,以及 Matryoshka 表示学习以支持截断至512/256/128d;部署说明建议禁用未使用的编码器、对截断向量进行 L2 重归一化,并使用bfloat16/float32而非float16。社区链接包括llama.cpp支持 PR #30054、ggml-orgGGUF 权重以及UnslothGGUF 权重。评论大多较为轻松:用户对 Google 又发布一个嵌入模型表示惊讶,并指出音频嵌入对他们来说很新鲜。一位评论者反对社区帖子主要链接到 Unsloth 转换版本而非 Google 的原始模型页面,认为 Google 理应因这次发布获得署名。

    • llama.cpp 对 google/embeddinggemma-2 的支持已在 ggml-org/llama.cpp#30054 中合并,从而支持在 Hugging Face Transformers 技术栈之外进行本地推理工作流。相应的 GGUF 转换可在 ggml-org/embeddinggemma-2-GGUF 获取,这对于计划将该模型用于本地数据集索引或检索管线的用户很有意义。

阅读更多

来源:Latent Space · latent.space