Hugging Face 联合发布 RiskRubric.ai 模型风险评估平台
Hugging Face 博客宣布由 Cloud Security Alliance 和 Noma Security 主导、Haize Labs 与 Harmonic Security 参与贡献的 RiskRubric.ai,为模型提供标准化风险评估。
推荐理由:原文给出六个风险维度的评分框架与首批评测分布,读者可据此理解模型安全评估的标准化路径。
Hugging Face 博客宣布由 Cloud Security Alliance 和 Noma Security 主导、Haize Labs 与 Harmonic Security 参与贡献的 RiskRubric.ai,为模型提供标准化风险评估。
推荐理由:原文给出六个风险维度的评分框架与首批评测分布,读者可据此理解模型安全评估的标准化路径。
Apollo Research 与 OpenAI 开发了针对隐藏失配(scheming)的评测方法,在受控测试中发现前沿模型存在与 scheming 一致的行为。团队还公开了具体案例,并对一种早期缓解 scheming 的方法进行了压力测试。
推荐理由:OpenAI 与 Apollo Research 公开了隐藏失配的评测方法与初步缓解手段,可了解前沿模型欺骗行为的检测思路。
Hugging Face Hub 新增 Public AI 为 Inference Provider,用户可直接调用 Swiss AI Initiative、AI Singapore 等机构的公共与主权模型。
OpenAI 阐述了其在 AI 使用中平衡青少年安全、自由与隐私的做法。
OpenAI 正在 ChatGPT 中构建年龄预测与家长控制功能,为青少年提供更安全、适龄的使用体验。该功能同时为家庭提供新的管理工具,帮助家长更好地支持孩子的使用。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,并用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集下的文件系统瓶颈。
OpenAI 宣布升级 Codex,使其更快、更可靠,并增强实时协作和独立处理任务的能力。升级后的 Codex 可在终端、IDE、网页乃至手机等多种开发环境中使用。
推荐理由:Codex 在速度、可靠性和实时协作上的升级,覆盖终端、IDE、网页和手机多个开发入口。
OpenAI 基于迄今规模最大的 ChatGPT 使用研究,揭示了该工具如何在个人与职业场景中创造经济价值。研究显示,ChatGPT 的采用正从早期用户向更广泛人群扩展,逐步缩小使用差距,并成为日常生活的一部分。
OpenAI 在 GPT-5 系统卡增补中发布新模型 GPT-5-Codex,这是 GPT-5 针对 Codex 中智能体编码进一步优化的版本。该模型会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更长时间。
推荐理由:GPT-5 系统卡增补披露了面向 Codex 智能体编码优化的新模型,读者可了解其动态调整思考投入的机制。
Hugging Face 在 Gradio 中内置可见水印功能,创建 Space 时只需添加 watermark 参数即可为图像和视频加水印,如 gr.Image(my_generated_image, watermark=my_watermark_image)。该功能支持文件名、图像或 numpy 数组作为水印,还支持 QR 水印,并可为 AI 生成文本添加水印,用户复制文本时自动附带署名。
OpenAI 公布与美国 CAISI、英国 AISI 合作推进 AI 安全与安保的进展。该合作旨在强化 AI 系统的安全性,具体成果与细节尚未披露。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两款经 CoT 训练的推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
OpenAI 发布声明,重申非营利组织的领导地位,并公布新的组织结构,使其 PBC 获得股权,从而可调动超过 1000 亿美元资源,用于推进安全、有益的 AI。声明称该安排旨在服务全人类。
推荐理由:OpenAI 官方说明非营利与 PBC 的新治理结构,读者可了解其组织与资源安排的变化。
OpenAI 与 Microsoft 签署新的谅解备忘录(MOU),强化双方合作伙伴关系,并重申在 AI 安全与创新方面的共同承诺。
Hugging Face 发布博客,介绍为支持 OpenAI gpt-oss 系列而在 transformers 中做的多项升级,包括可从 Hub 下载的零构建 Kernel、MXFP4 量化、张量并行、专家并行、动态滑动窗口层与缓存、连续批处理与 Paged Attention,以及更快的模型加载。
推荐理由:Hugging Face 官方拆解了为 gpt-oss 引入 transformers 的七项工程改动,可据此了解量化、并行与缓存优化的落地方式。
Together AI 与 Hugging Face 联合推出新能力,Hugging Face Hub 上任意兼容的 LLM 均可通过 Together AI 基础设施微调,支持公开和私有仓库,训练完成后可自动回传至 Hub。
Hugging Face 发布 Jupyter Agent 项目,用约 2TB Kaggle notebook 经去重、教育性打分、QA 与轨迹生成,构建出 51k 合成 notebook、近 0.2B token 的数据集,微调 Qwen3-4B 做数据分析智能体。
SafetyKit 借助 OpenAI GPT-5 提升内容审核与合规执行能力,在准确性上超越传统安全系统。该方案用于扩展风险智能体,覆盖内容审核与合规场景。
Mistral AI 宣布完成 1.7B€ 的 C 轮融资,投后估值 11.7B€,由半导体设备厂商 ASML Holding NV 领投。现有投资方 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参投。
推荐理由:Mistral AI 完成 1.7B€ C 轮融资,由 ASML 领投,读者可据此了解欧洲大模型公司的资本与产业合作走向。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在 3T+ tokens、1800 多种语言上训练,成为首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用 Gemma 2 tokenizer,训练分三阶段将语言数从 60 逐步扩展至 1833,并引入逆掩码率调度与退火语言学习等新技术。
OpenAI 的 People-First AI Fund 现已开放申请,这项 5000 万美元计划面向推动教育、社区创新和经济机会的美国非营利组织,提供不受限制的资助。申请截止日期为 2025 年 10 月 8 日。
OpenAI 新研究解释了语言模型产生幻觉的原因,并指出改进评估方法可以提升 AI 的可靠性、诚实性与安全性。
OpenAI 与希腊政府启动“OpenAI for Greece”,将 ChatGPT Edu 引入中学,支持负责任的 AI 学习。该合作旨在提升 AI 素养、扶持本地初创企业并推动国家经济增长。
OpenAI 推出 Jobs Platform 和新的 Certifications,用于连接求职者与工作岗位、培训和认证。该平台旨在扩大经济机会,让 AI 技能更易获得。
Google 发布 EmbeddingGemma,一款面向端侧场景的多语言嵌入模型,308M 参数、2K 上下文窗口,支持 100 多种语言,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的可用边界。
SandboxAQ 在 Hugging Face 开源 SAIR 数据集,包含超 500 万个 AI 生成的蛋白质-配体 3D 结构,每个结构均配对 ChEMBL 或 BindingDB 的实验 IC₅₀ 数据,采用 CC BY 4.0 许可免费开放。
Mistral AI 为 Le Chat 推出 Memories(beta),采用自动保存、智能召回并始终显示来源链接的混合记忆方案。用户可随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,并支持导出与导入,实现记忆的可移植与互操作。同步上线的 Memory Insights 可基于用户自身数据提示记忆趋势与摘要,后续将支持记忆分类、即时遗忘和更清晰的调用记录。
OpenAI 收购 Statsig,Vijaye Raji 将出任应用业务 CTO,向应用业务 CEO Fidji Simo 汇报。
OpenAI 宣布与专家合作,为 ChatGPT 青少年用户加强保护并引入家长控制功能,同时将敏感对话路由至推理模型处理。
Mistral 在 Le Chat 中发布 20+ 个基于 MCP 的安全连接器目录(beta),覆盖数据、生产力、开发、自动化与商务等类别,支持接入 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并可添加自定义 MCP 连接器或连接任意远程 MCP 服务器。
推荐理由:官方给出连接器目录与记忆功能的开放范围,读者可据此判断企业工作流接入的可行路径。
Hugging Face 介绍在 ZeroGPU Spaces 中使用 PyTorch 提前编译(AoT)的方法,通过 spaces 包的 aoti_capture、aoti_compile 和 aoti_apply 等接口,把模型编译一次后即时重载,避免 torch.compile 在短生命周期进程中反复编译。
伯克利 AI 研究提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下其学习问题可化简为无权重最小二乘矩阵分解,最终学到的表示等价于对目标矩阵 M* 做 PCA。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并同步更新 Realtime API。新 API 能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:OpenAI 发布新一代语音到语音模型并扩展 Realtime API,读者可了解语音智能体在电话与工具调用上的新能力。
OpenAI 推出 5000 万美元的 People-First AI Fund,帮助美国非营利组织借助 AI 扩大影响力。资助覆盖教育、医疗、研究等领域,申请窗口为 2025 年 9 月 8 日至 10 月 8 日。
OpenAI 面向全球 1000 多人调查了 AI 应如何行事,并将其观点与自家 Model Spec 进行对比。这项"集体对齐"工作旨在让 AI 默认行为更好地反映多元的人类价值观与视角。
OpenAI 与 Anthropic 公布一次联合安全评估的结果,双方互相测试对方模型在失准、指令遵循、幻觉、越狱等方面的表现。OpenAI 称这是此类跨实验室合作评估,并提到其中的进展、挑战以及跨实验室协作的价值。
推荐理由:两家头部实验室首次互测对方模型的对齐与越狱表现,可了解跨实验室安全评估的做法与发现。
OpenAI 发文阐述其对经历心理或情绪困扰用户的安全考量,并说明当前系统的局限以及正在进行的改进工作。
OpenAI 与 Retro Bio 借助专用 AI 模型 GPT-4b micro,设计出用于干细胞疗法和长寿研究的更有效蛋白质。该模型专为生命科学场景打造,目标是加速相关研究进程。
Blue J 依靠专注、领域深度和合适的 OpenAI 模型,已扩张至三个国家、服务超过 3000 家机构。该案例展示了在复杂且受监管的行业中实现快速规模化的路径。
NVIDIA 发布 Nemotron Post-Training Dataset V2,将英文推理数据翻译为法语、西班牙语、德语、意大利语和日语五种语言,规模约 600 万条。
推荐理由:NVIDIA 公开了多语言推理数据集的构建流程与过滤细节,可据此判断合成后训练数据的翻译质量风险。