Google DeepMind 与新加坡达成国家 AI 合作,落地医疗、教育与气候项目
Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、教育、科研和气候领域推出新项目。合作探索 AI 辅助临床的“三方护理”、用 AlphaFold 和 Google Earth 推进东南亚传染病研究,并开发基于 Gemma 的视障跑者助手。
Google DeepMind 与新加坡政府达成国家 AI 合作,在医疗、教育、科研和气候领域推出新项目。合作探索 AI 辅助临床的“三方护理”、用 AlphaFold 和 Google Earth 推进东南亚传染病研究,并开发基于 Gemma 的视障跑者助手。
ChatGPT 推出安全更新,提升敏感对话中的上下文感知能力,可随时间识别风险并更安全地回应。该更新帮助模型在敏感话题中更好地理解语境,从而做出更恰当的响应。
OpenAI 就 TanStack「Mini Shai-Hulud」供应链攻击发布回应,说明已采取的系统与签名证书保护措施,并解释 macOS 用户为何必须在 2026 年 6 月 12 日前更新 OpenAI 应用。文中还介绍了事件经过、受影响范围以及 OpenAI 如何加强对软件供应链威胁的防御。
OpenAI 通过沙箱、审批机制、网络策略和智能体原生遥测来安全运行 Codex,以支持编程智能体的安全合规采用。
OpenAI 扩展 Trusted Access for Cyber 计划,推出 GPT-5.5 和 GPT-5.5-Cyber,帮助经过验证的防御方加速漏洞研究并保护关键基础设施。
推荐理由:OpenAI 在网络安全场景下扩展可信访问计划,并给出 GPT-5.5 与 GPT-5.5-Cyber 两个版本,可据此了解其面向防御方的能力开放方式。
OpenAI 为 ChatGPT 推出可选安全功能 Trusted Contact,当系统检测到严重的自残风险时,会通知用户指定的可信任联系人。该功能为可选项,用户可自行设置信任对象。
ChatGPT 通过减少训练数据中的个人信息,并让用户自主控制对话是否用于改进 AI 模型,来在学习世界知识的同时保护隐私。
OpenAI 提出一项五部分行动计划,旨在加强智能时代的网络安全,重点是普及 AI 驱动的网络防御并保护关键系统。
OpenAI 发文说明其在 ChatGPT 中保障社区安全的方式,涵盖模型防护、滥用检测、政策执行以及与安全专家的合作。
OpenAI 发布 Privacy Filter,一款用于检测和脱敏文本中个人身份信息(PII)的开放权重模型,官方称其准确率达到 SOTA。目前公开信息仅为摘要,未披露模型规模、许可协议与开放入口。
推荐理由:OpenAI 开源一款用于检测和脱敏文本 PII 的开放权重模型,可了解其在隐私合规场景的定位。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后 AI 网络安全格局,指出 Mythos 的关键不在模型本身,而在于其嵌入的系统——大算力、软件数据训练、漏洞探测与修补脚手架及一定自主性共同构成的能力配方。文章认为开放代码与工具可分散检测、验证、协调、补丁传播四个阶段,缩小攻防能力差距,并主张采用半自主 AI 智能体在组织内部署防御。
OpenAI 面向网络安全领域推出 Trusted Access for Cyber,领先安全公司与大型企业已加入,使用 GPT-5.4-Cyber 强化全球网络防御。OpenAI 同时提供 1000 万美元 API 资助,支持该生态建设。
OpenAI 扩展 Trusted Access for Cyber 计划,向经过审核的防御者推出 GPT-5.4-Cyber,并随 AI 网络安全能力提升强化防护措施。
OpenAI 就 Axios 供应链攻击作出回应,已轮换 macOS 代码签名证书并更新应用,同时确认没有用户数据遭到泄露。
OpenAI 发布儿童安全蓝图,一份为负责任构建 AI 提供路线图的文件,涵盖安全防护、适龄设计和协作三方面,目标是保护并赋能年轻人在线体验。
OpenAI 宣布推出试点项目 OpenAI Safety Fellowship,用于支持独立的安全与对齐研究,并培养下一代人才。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。
Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线加密所需的 qubit 和门数比此前认为的更少。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 所需量子资源的新估算,并说明如何在不泄露攻击细节的前提下公开漏洞。
Google DeepMind 发布关于 AI 有害操纵的研究,称其为首个经实证验证的评测工具,并公开运行同类人类被试研究所需的全部材料。研究覆盖英国、美国、印度共 9 项实验、逾 10000 名参与者,聚焦金融与健康等高风险场景,发现 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功不能预测另一个领域。
推荐理由:原文公开了可复用的有害操纵评测工具与万人级实验数据,读者可据此了解AI操纵能力的测量方式与边界。
OpenAI 的 Model Spec 是一套公开的模型行为框架,用于在 AI 系统演进过程中平衡安全、用户自由与问责。该框架面向模型行为设定公开标准,并随 AI 能力提升持续调整。
OpenAI 推出 Safety Bug Bounty 计划,用于识别 AI 滥用与安全风险,覆盖范围包括智能体漏洞、提示注入和数据外泄。
推荐理由:OpenAI 把智能体漏洞、提示注入和数据外泄纳入漏洞赏金范围,可观察安全边界如何随智能体落地扩展。
OpenAI 面向使用 gpt-oss-safeguard 的开发者发布基于提示词的青少年安全策略,用于在 AI 系统中审核针对不同年龄段的特定风险。
OpenAI 针对 Sora 2 视频模型和 Sora 社交创作平台带来的新型安全挑战,将安全作为设计基础,并以具体防护措施为核心构建方案。
OpenAI 采用思维链监控(chain-of-thought monitoring)研究内部编程智能体的失准(misalignment)问题,通过分析真实部署场景来检测风险并强化 AI 安全保障措施。
OpenAI Japan 发布日本青少年安全蓝图,为使用生成式 AI 的青少年引入更强的年龄保护、家长控制和身心健康保障措施。
OpenAI 详解 Codex Security 为何不依赖传统 SAST,而是用 AI 驱动的约束推理与验证来发现真实漏洞,减少误报。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊流程中的安全与诊断数据,可对照其与 PCP 的差异。
OpenAI 介绍了 ChatGPT 在智能体工作流中抵御提示词注入与社会工程攻击的设计思路:通过限制高风险操作、保护敏感数据来降低风险。
OpenAI 发布 IH-Challenge,用于训练模型优先执行可信指令,从而改进指令层级、安全可控性以及抵御提示注入攻击的能力。
推荐理由:OpenAI 公开 IH-Challenge 训练方法,可用于理解前沿模型如何提升指令层级与抗提示注入能力。
OpenAI 宣布收购 AI 安全平台 Promptfoo,该平台帮助企业在开发阶段识别并修复 AI 系统中的漏洞。
推荐理由:OpenAI 收购 AI 安全平台 Promptfoo,读者可据此了解其在企业 AI 安全测试环节的布局。
OpenAI 发布 Codex Security 研究预览版,这是一个 AI 应用安全智能体,可分析项目上下文来检测、验证并修复复杂漏洞,官方称其置信度更高、噪声更少。
OpenAI 提出 CoT-Control,发现推理模型难以控制自身的思维链,这反而强化了可监控性作为 AI 安全保障的价值。
OpenAI 发布 GPT-5.3 Instant 系统卡,但当前抓取仅保留标题,正文内容缺失。
OpenAI 公布其与美国国防部(Department of War)合同的细节,说明其中的安全红线、法律保护以及 AI 系统在涉密环境中的部署方式。材料仅提供摘要,未披露合同金额、期限或具体部署系统。
推荐理由:OpenAI 官方披露与国防部门合同的边界条款,可了解其安全红线与法律保护如何界定。
OpenAI 公布其心理健康安全工作的最新进展,包括家长控制、可信联系人、改进的痛苦识别能力,以及近期诉讼方面的动态。
OpenAI 最新威胁报告剖析了恶意行为者如何将 AI 模型与网站、社交平台结合使用,并探讨这对检测与防御意味着什么。报告聚焦此类组合手法带来的识别与防护挑战。
OpenAI 承诺向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究。该资金旨在加强全球应对 AGI 安全与安保风险的努力。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞场景,覆盖发现、修复与攻击三类任务。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。两项功能面向企业安全场景,具体能力与开放范围原文未进一步说明。
推荐理由:OpenAI 为 ChatGPT 增加 Lockdown Mode 与 Elevated Risk 标签,读者可了解企业防御提示词注入的新手段。
OpenAI 分享了其 AI 本地化思路:全球共享的前沿模型可在不牺牲安全性的前提下适配各地语言、法律与文化。该方案强调在保持模型统一的同时满足本地化需求。