Aleph Alpha 研究:中国 AI 模型在敏感话题上复述官方立场或拒答
Aleph Alpha 用自建基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统认为只有 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
Aleph Alpha 用自建基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统认为只有 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
DeepSeek Harness 发布 v0.2.1-alpha.1,新增实验性 Claude Code Mods 兼容层,让按 Claude Code Mods 接口编写的扩展有机会接入 DSH 插件系统运行。
DeepSeek 弹性计算团队大量招聘,尤其需要资深工程师,并同步公开技术分享《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》。
DeepSeek 将 TileLang 算子开发工具及 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五大计算与通信库同步推出昇腾版本,TileLang 官宣原生支持华为昇腾 950 NPU。
推荐理由:原文拆解了 TileLang 前后端解耦架构与昇腾适配路径,可据此判断国产算子工具链的迁移成本。
OpenAI 于 8 月 19 日正式开源 Codex Harness,开放的是支撑 Codex App、CLI 和 IDE Extension 的 Agent Loop,开发者可通过 SDK 和 App Server 接入任务管理、工具调用、事件回传与人工审批,模型和云端服务仍由 OpenAI 提供。
DeepSeek Harness 发布 v0.2 预览版,同时放出 macOS 和 Windows 桌面端安装包,可在官网 deepseek.com/harness 下载,无需再折腾命令行。新版本预置常用能力,支持丢入文档、表格或 PDF 处理,插件安装以 npm 包名完成,并能让 AI 自己写插件。
推荐理由:桌面版把插件安装简化为 npm 包名,并支持 AI 自行编写插件,可据此判断上手门槛的变化。
DeepSeek 于 9 月 30 日开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库和分布式通信库,与此前面向英伟达平台的开源组件一一对应。其中 TileLang 昇腾版本是分量最重的一块,DeepSeek 称建立新一代自主可控的 GPU 软件生态需要先有通用且编程简单的语言工具。
OpenAI 在 DevDay 2026 公布 20 多项更新,推出由 GPT-6 Astra 驱动的常驻智能体 dots,以及强化智能体编程与计算机使用能力的 GPT-6.1 Sol。GPT-6.1 Sol 标准输入输出 Token 价格为每百万 2 美元和 10 美元,仅为 Astra 的五分之一,超高速档位可将 Codex 中 Token 生成速度最高提升 8 倍。
DeepSeek 推出 DeepSeek Harness 桌面端,官方提供 macOS 和 Windows 开箱即用安装包,登录即送 6 元赠金,有效期到 10 月 6 日。
Import AI 474 期聚焦 Michael Levin 提出的"柏拉图式心智空间"假说,认为心智是非物理模式,身体与机器只是其进入物理世界的接口,并用 xenobots、anthrobots 等实验佐证。同期内容还涉及太空 TPU 与智谱启动外层 RSI 循环。
英国 AI Security Institute 分析显示,开放权重模型与闭源前沿模型的网络能力差距正在收窄:GLM-5.2 最接近 4.3 个月前发布的 Claude Opus 4.6,DeepSeek-V4-Pro 介于 Claude Opus 4.5 与 GPT-5 之间,而 2025 年大部分时间测得的差距为 6 到 10 个月。
DeepSeek 发布 V4,两个 MoE 检查点上线 Hub:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,均支持 1M token 上下文窗口。
推荐理由:原文给出 V4 在长上下文推理成本与智能体后训练上的具体设计,可据此判断开源模型做长任务智能体的可行性。
Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构近期的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k,远超 Llama 的 27k 和 DeepSeek 的 6k;腾讯自 2025 年 5 月起以混元品牌加速开源视觉、视频与 3D 模型,百度则通过 Ernie 4.5 系列和 PaddlePaddle 重返开源生态。
Hugging Face 博客梳理中国开源 AI 生态自 2025 年 1 月“DeepSeek 时刻”以来的架构与硬件选择:Kimi K2、MiniMax M2、Qwen3 等头部模型几乎一致转向 MoE 架构,0.5B–30B 小模型与 100B–700B 大 MoE 形成“教师—学生”结构,Apache 2.0 成为默认许可证。
DeepSeek 于 2025 年 1 月发布 R-1 模型,一年后 Hugging Face 发文回顾其对中国开源 AI 生态的催化作用。R1 以 MIT 许可开放推理路径与后训练方法,降低了技术、采用和心理三重门槛,并成为 Hugging Face 史上获赞最多的模型。
Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,算力稀缺也促使 DeepSeek 的 MLA、GRPO 等效率创新走向开源,并推动 CUDA 之外的软件生态成形。
推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,可看到算力受限如何反过来塑造模型架构与部署生态。
Hugging Face 发布 FutureBench,用真实预测市场与新闻生成任务,评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周约产出 5 个新闻类问题,另从 Polymarket 每周引入约 8 个问题。其设计使数据污染不可能发生,结果可随时间客观验证。
DeepSeek-V3-0324 本周上线 Hugging Face Hub,架构与初代 DeepSeek-V3 相同,但许可从自定义协议改为 MIT,改进重点是指令遵循、代码与数学能力。
推荐理由:DeepSeek-V3-0324 的基准提升与 MIT 许可变化,能帮读者判断开源基座模型的迭代节奏。
Hugging Face 的 Open R1 项目发布第三期更新,公开了约 10 万条由 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集、基于 2024 国际信息学奥林匹克(IOI)的 IOI 基准,以及微调 Qwen2.5 Coder Instruct 7B 和 32B 得到的 OlympicCoder-7B 与 OlympicCoder-32B。
推荐理由:Open R1 复现计划公开了数据集、基准与 7B/32B 模型,并给出五条蒸馏训练经验,可迁移到自建推理模型。
Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个解答,经 Math Verify 与 Llama3.3-70B-Instruct 双重过滤后保留 22 万道有正确推理轨迹的题目。
推荐理由:Open R1 项目公开了 22 万条数学推理数据集的构建流程与蒸馏对比结果,可了解复现 R1 训练管线的具体做法。
Hugging Face 的 Open-R1 项目发布首周进展,在 MATH-500 上复现了 DeepSeek-R1 蒸馏系列模型的评测分数,例如 DeepSeek-R1-Distill-Qwen-32B 得 95.0、DeepSeek-R1-Distill-Llama-70B 得 93.4。
推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的 MATH-500 评测分数,并公开了合成数据生成与 GRPO 训练的工程细节。
这篇教程用 GRPO 和 Countdown Game 复现 DeepSeek R1 的 aha moment,基于 Qwen2.5-3B-Instruct 在 4x H100 上训练,450 步后解题成功率达 50%。
推荐理由:完整复现流程与训练观察记录,可看到小模型在 RL 下从文字推理转向程序化求解的过程。
Hugging Face 发布指南,介绍如何在 AWS 上部署和微调 DeepSeek-R1 系列模型。
Hugging Face 发布 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程,补齐官方未公开的数据集和训练代码。
推荐理由:Hugging Face 公开了复现 DeepSeek-R1 数据与训练流程的三步计划,读者可据此了解开源推理模型缺哪几块拼图。
BAAI 推出 FlagEval Debate 平台,让大模型以辩论形式正面对抗,目前支持中文、英文、阿拉伯文和韩文四种语言。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义参数功能,以解决静态评测和 Chatbot Arena 类平台缺乏区分度、模型孤立生成及投票偏差等问题。2024 年 Q3 的实验显示,当前多数模型已具备参与辩论的能力。
非凡研究 6 月报告显示,全球 1500 家活跃 AI 公司中 751 家位于中国,其中 103 家已出海扩张。腾讯云、华为、阿里等巨头聚焦东南亚与中东的云和 AI 基础设施,字节跳动七个月内推出 11 款海外应用,CapCut 月活超 3 亿、累计移动端收入达 1.25 亿美元。