OpenAI 更新 Model Spec,为 ChatGPT 增加未成年人保护原则
OpenAI 更新 Model Spec,新增 Under-18 Principles,规定 ChatGPT 应基于发展科学为青少年提供安全、适龄的引导。此次更新强化了防护栏,明确了模型在更高风险情境下的预期行为,并延续其在 ChatGPT 青少年安全方面的整体工作。
OpenAI 更新 Model Spec,新增 Under-18 Principles,规定 ChatGPT 应基于发展科学为青少年提供安全、适龄的引导。此次更新强化了防护栏,明确了模型在更高风险情境下的预期行为,并延续其在 ChatGPT 青少年安全方面的整体工作。
Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具。该套件结合稀疏自编码器(SAEs)与 transcoders,覆盖模型每一层,并新增 skip-transcoders、跨层 transcoders 及针对聊天版本的越狱、拒答和思维链忠实度分析工具。
推荐理由:Gemma Scope 2 覆盖 Gemma 3 全系列并公开工具与演示,读者可了解可解释性工具在模型安全审计上的最新进展。
OpenAI 推出一个真实世界评估框架,用于衡量 AI 加速湿实验室生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨 AI 辅助实验的潜力与风险。
Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全研究。双方将共享专有模型、数据与思路,并围绕 AI 推理过程监控(CoT)、社会情感错位及 AI 对经济系统的影响展开联合研究。Google DeepMind 自 AISI 2023 年 11 月成立起便与其合作测试其最强模型。
OpenAI 发布 GPT-5 系列的最新模型家族 GPT-5.2,并更新了 GPT-5 系统卡。该系列模型的安全缓解方案与 GPT-5 系统卡和 GPT-5.1 系统卡中描述的基本一致。GPT-5.2 模型同样在多样化数据集上训练,包括互联网公开信息、与第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。
推荐理由:OpenAI 公布 GPT-5.2 系统卡更新,说明其安全缓解措施与 GPT-5、GPT-5.1 基本一致,可据此了解该系列的安全策略延续。
Google 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在一项评测中最高有 70% 的概率被 LLM 评估器偏好。隐私预算越紧,主题覆盖度越低,但摘要更简洁聚焦。
OpenAI 正随 AI 模型网络安全能力增强而投入更强的防护措施与防御能力,并说明其如何评估风险、限制滥用,以及与安全社区合作强化网络韧性。
OpenAI 研究人员正在测试一种名为"confessions"的方法,训练模型在犯错或行为不当时主动承认,以提升 AI 的诚实性、透明度以及模型输出的可信度。
OpenAI 将提供最高 200 万美元资助,用于 AI 与心理健康交叉领域的研究。该项目支持研究现实世界中的风险、收益与应用,以提升安全性和福祉。
OpenAI 披露一起 Mixpanel 安全事件,涉及有限的 API 分析数据,但 API 内容、凭证和支付信息均未泄露。OpenAI 同时说明了事件经过及正在采取的用户保护措施。
OpenAI 与独立专家合作评估前沿 AI 系统,通过第三方测试强化安全保障、验证防护措施,并提升模型能力与风险评估的透明度。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明为该模型部署的安全措施。系统卡涵盖模型层缓解手段,包括针对有害任务和提示注入的专门安全训练,以及产品层缓解手段,如智能体沙箱和可配置网络访问。
推荐理由:系统卡披露了 GPT-5.1-Codex-Max 在模型层与产品层采取的安全措施,可了解其针对提示注入与智能体沙箱的防护思路。
OpenAI 正在探索机制可解释性,以理解神经网络的推理过程。其提出的稀疏模型方法有望让 AI 系统更透明,并支持更安全、更可靠的行为。
OpenAI 正在反击《纽约时报》要求其交出 2000 万条私密 ChatGPT 对话的诉求,并加速推出新的安全与隐私保护措施以保护用户数据。
OpenAI 发布 GPT-5 系统卡增补,给出 GPT-5.1 Instant 和 GPT-5.1 Thinking 的更新安全指标。增补内容包含针对心理健康与情感依赖的新评估。
推荐理由:OpenAI 公布 GPT-5.1 两个版本的安全指标更新,新增心理健康与情感依赖评估,可了解其安全评测口径的变化。
OpenAI 发文解读提示词注入这一 AI 系统面临的前沿安全挑战,说明此类攻击的运作方式,并介绍 OpenAI 在推进相关研究、训练模型以及为用户构建防护措施方面的进展。
OpenAI 发布青少年安全蓝图,为负责任地构建 AI 提供路线图,涵盖安全防护、适龄设计与协作三方面。该蓝图旨在保护并赋能年轻人在线使用 AI。
OpenAI 推出 Aardvark,一款 AI 驱动的安全研究员,可自主发现、验证并协助修复软件漏洞,并支持规模化处理。该系统目前处于私有测试阶段,可通过报名参与早期测试。
推荐理由:OpenAI 官方披露智能体安全研究员 Aardvark 的定位与私有测试入口,可据此了解其自主发现并修复漏洞的能力方向。
Google Research 提出可证明隐私洞察(PPI),结合 LLM、差分隐私(DP)和可信执行环境(TEE),在保证个体数据不可被查看、聚合结果匿名的前提下分析 GenAI 使用数据。
OpenAI 发布 gpt-oss-safeguard 技术报告,介绍 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 两款开放权重推理模型。二者基于 gpt-oss 模型后训练,能依据给定策略进行推理并对内容打标,报告同时给出以原始 gpt-oss 模型为基线的安全评估结果。
OpenAI 发布 gpt-oss-safeguard,这是一组用于安全分类的开放权重推理模型,允许开发者应用并迭代自定义策略。
推荐理由:OpenAI 把安全分类做成可自行迭代策略的开放权重推理模型,开发者可据此评估自定义审核流程的落地方式。
Doppel 借助 GPT-5 和强化学习微调构建 AI 防御系统,用于拦截深度伪造与冒充攻击,将分析师工作量削减 80%,响应时间从数小时缩短至数分钟。
Hugging Face 发布博客提出“语音同意门”(voice consent gate),让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动声音克隆,并提供了示例 Space 和配套代码。该方案由语言模型为每次授权生成一对全新句子,一句表达明确同意、一句提供语音多样性,从而把同意变成可追溯、可审计的系统前置条件。
OpenAI 发布 GPT-5 系统卡增补,说明 GPT-5 在处理敏感对话方面的改进,并新增情绪依赖、心理健康和抗越狱三项基准测试。
OpenAI 与 170 多位心理健康专家合作,提升 ChatGPT 识别痛苦、共情回应并引导用户寻求现实支持的能力,将不安全回应减少最多 80%。
推荐理由:OpenAI 与 170 多位心理健康专家合作改进 ChatGPT 在敏感对话中的回应,并给出不安全回应下降幅度这一可核对的数字。
Hugging Face 宣布与威胁情报与恶意软件分析平台 VirusTotal 合作,即日起对 Hub 上 220 万以上公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动将文件哈希与 VirusTotal 威胁情报库比对,返回干净或恶意状态及检测数量等元数据,不向 VirusTotal 共享原始文件内容。
OpenAI 成立"福祉与 AI 专家委员会",汇集心理学家、临床医生和研究人员,指导 ChatGPT 如何支持用户情感健康,尤其是青少年群体。该委员会的意见将用于塑造更安全、更具关怀的 AI 体验。
OpenAI 公布了一套针对 ChatGPT 政治偏见的评估方法,通过新的真实世界测试提升客观性并减少偏见。该工作聚焦于如何定义和衡量 LLM 的政治偏见。
OpenAI 发布 2025 年 10 月报告,披露其识别和阻断 AI 恶意使用的进展。报告介绍了 OpenAI 如何打击滥用行为、执行政策,并保护用户免受现实世界危害。
OpenAI 封禁了一批韩语账号,这些账号利用 AI 进行恶意软件开发支持、调试、钓鱼和凭证窃取等操作。
OpenAI 封禁了一批与代号 Nine-emdash Line 行动相关的账号,该行动此前未被报道,来源指向中国。这些账号利用 AI 生成关于南海、香港和美国政治的 regional influence content。
推荐理由:OpenAI 首次披露并封禁一个中国来源的舆论影响行动账号,可了解平台方对 AI 滥用行为的处置口径。
OpenAI 封禁了一批账号,这些账号的活动与公开报道的威胁组织存在重叠,并显示出符合中国情报需求的典型特征,利用 AI 支持钓鱼与脚本工作流。
OpenAI 封禁了一批与俄罗斯来源的"Stop News"行动相关的账号,该行动利用 AI 生成针对非洲和英国的影响力内容。OpenAI 称其为屡次违规的影响力行动。
OpenAI 封禁了一批可能与俄语犯罪团伙有关的账号,这些账号利用 AI 构建恶意软件加载器、规避层、凭据窃取脚本和 C2 基础设施。
推荐理由:OpenAI 披露封禁与俄语犯罪团伙相关的账号,可了解 AI 被用于恶意软件工具链的具体环节。
OpenAI 封禁了一批与网络诈骗团伙关联的账号,这些账号利用 AI 生成诈骗话术、实施冒充、翻译以及维系与受害者的互动。
OpenAI 封禁了一批与中国关联的账号,这些账号利用 AI 支持监控相关规划、针对性画像以及对批评者等个人的研究。
OpenAI 发布 Sora 2 和 Sora 应用,称二者在构建时即以安全为基础,以应对先进视频模型与新型社交创作平台带来的新安全挑战。官方表示其做法建立在具体防护措施之上。
推荐理由:官方说明 Sora 2 与 Sora 应用在安全机制上的设计取向,可了解视频模型与社交创作平台的安全边界。
OpenAI 通过严格的使用政策、先进的检测工具和行业协作,打击网络儿童性剥削与虐待,以拦截、举报并防止 AI 被滥用。
OpenAI 与 AARP 达成合作,通过 OpenAI Academy 和 OATS 旗下 Senior Planet 项目,为老年人提供 AI 培训、诈骗识别工具及全国性项目,帮助他们安全上网。
Hugging Face 博客宣布由 Cloud Security Alliance 和 Noma Security 主导、Haize Labs 与 Harmonic Security 参与贡献的 RiskRubric.ai,为模型提供标准化风险评估。
推荐理由:原文给出六个风险维度的评分框架与首批评测分布,读者可据此理解模型安全评估的标准化路径。