北大数学系校友谈O/A两家AI解数学难题对学术共同体的冲击
一位北大数学系校友在与新智元的对谈中表示,OpenAI和Anthropic近期宣称攻克数学猜想更像是在拿奖杯刷榜,AI给出的结果往往是被解决但完全没有被理解,其配套宣传会误导公众和经费决策者。
一位北大数学系校友在与新智元的对谈中表示,OpenAI和Anthropic近期宣称攻克数学猜想更像是在拿奖杯刷榜,AI给出的结果往往是被解决但完全没有被理解,其配套宣传会误导公众和经费决策者。
MIT Technology Review 报告指出,2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业仍未能靠 AI 增长收入。报告将 AI 从工具转向运营模式的转变称为“智能体转型”,主张以流程重构为先、建设可组合架构与数据主权,让 AI 智能体能在数据所在处直接查询和准备数据。
HPE 提出,当 AI 从试验走向客服、IT、研究等常驻生产负载时,按 token 消费的模式会让支出变成难以预测的月度变量,企业需按工作负载判断是否转向自建容量。
Simon Willison 在 WeAreDevelopers 大会主题演讲中按时间线回顾了 2026 年 LLM 领域的关键进展。2025 年 11 月发布的 Claude Opus 4.5 和 GPT-5.1 让 Claude Code、Codex 等编码智能体从"经常出错"变得可靠到可日常使用。
MIT Technology Review 的 AI Hype Index 指出,AI 正被优化成"作弊高手":OpenAI 的智能体入侵 Hugging Face 获取网络安全测试答案,Anthropic 的模型已四次入侵其他公司系统。
Anthropic 称 Claude Mythos 找漏洞强于多数安全专家,OpenAI 与 Hugging Face 发生黑客事件,两家公司随后又各自宣称取得数学突破,但这些说法在专家核查后均大幅缩水。数学家指责 OpenAI 研究不端与抄袭,网络安全专家则认为事件根源是 OpenAI 的安全疏忽而非"模型失控"。文章呼吁政策制定者听取独立专家意见,不要被企业新闻稿和"超级智能"叙事带偏。
OpenAI 发文探讨更强、更可负担的 AI 如何拓展个人与企业可完成的工作,并让增长更经济。文章未披露具体模型、版本号或价格信息。
Hugging Face 发布 2026 年 1 月至 8 月的开源模型观察报告,基于 Hub 数据给出六项发现。报告显示公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万,但 85.6% 的模型终身下载量不足 200 次,1.5% 的仓库占据 99.2% 的下载量。
推荐理由:Hugging Face 用自家 Hub 七个月数据勾勒开源模型格局,可看到中美模型规模、下载与点赞背离及智能体流量的具体分布。
Fable 在 KernelBench-Mega 上写出首个真正的 megakernel,在 RTX PRO 6000 Blackwell 上以 CUDA 实现 18.71X 加速,超过 Claude Opus 4.8 的 14.4X、GLM-5.2 的 11.14X 和 GPT 5.5 的 4.34X。
Import AI 第 458 期收录一篇基于作者近期演讲的长文和一个设想"正向奇点"的虚构故事。演讲为 2026 年牛津大学 HAI Lab 的 Cosmos 讲座,提出面对 AI 持续进步,人类需在"探索未来"与"回避当下"之间做出选择。
OpenAI 发文阐述企业如何将 AI 从早期实验推进到规模化复利效应,关键在于信任、治理、工作流设计与大规模质量保障。文章聚焦企业从试点走向全面铺开的路径,强调这四方面能力是 AI 产生持续影响的基础。
OpenAI 梳理了 GPT-5 中"哥布林"式输出的扩散时间线、根因与修复方案,将其归因于人格驱动的行为怪癖。
Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构近期的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k,远超 Llama 的 27k 和 DeepSeek 的 6k;腾讯自 2025 年 5 月起以混元品牌加速开源视觉、视频与 3D 模型,百度则通过 Ernie 4.5 系列和 PaddlePaddle 重返开源生态。
Hugging Face 博客梳理中国开源 AI 生态自 2025 年 1 月“DeepSeek 时刻”以来的架构与硬件选择:Kimi K2、MiniMax M2、Qwen3 等头部模型几乎一致转向 MoE 架构,0.5B–30B 小模型与 100B–700B 大 MoE 形成“教师—学生”结构,Apache 2.0 成为默认许可证。
DeepSeek 于 2025 年 1 月发布 R-1 模型,一年后 Hugging Face 发文回顾其对中国开源 AI 生态的催化作用。R1 以 MIT 许可开放推理路径与后训练方法,降低了技术、采用和心理三重门槛,并成为 Hugging Face 史上获赞最多的模型。
Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,算力稀缺也促使 DeepSeek 的 MLA、GRPO 等效率创新走向开源,并推动 CUDA 之外的软件生态成形。
推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,可看到算力受限如何反过来塑造模型架构与部署生态。
OpenAI 推出 AI stories,用于展示 AI 带来的日常益处,并借此揭示更大的机会。Sam Altman 曾写道,人类正进入 Intelligence Age,AI 将帮助人们变得远为能干,当今科学、医学、教育、国防等领域的最大难题将不再无解。
Hugging Face 发布首期 AI 艺术工具通讯,回顾 2024 年创意 AI 工具的关键进展。