OpenAI 改进 ChatGPT 在敏感对话中的回应
OpenAI 与 170 多位心理健康专家合作,提升 ChatGPT 识别痛苦、共情回应并引导用户寻求现实支持的能力,将不安全回应减少最多 80%。
推荐理由:OpenAI 与 170 多位心理健康专家合作改进 ChatGPT 在敏感对话中的回应,并给出不安全回应下降幅度这一可核对的数字。
OpenAI 与 170 多位心理健康专家合作,提升 ChatGPT 识别痛苦、共情回应并引导用户寻求现实支持的能力,将不安全回应减少最多 80%。
推荐理由:OpenAI 与 170 多位心理健康专家合作改进 ChatGPT 在敏感对话中的回应,并给出不安全回应下降幅度这一可核对的数字。
Hugging Face 宣布与威胁情报与恶意软件分析平台 VirusTotal 合作,即日起对 Hub 上 220 万以上公开模型和数据集仓库进行持续扫描。用户访问仓库或文件页面时,Hub 会自动将文件哈希与 VirusTotal 威胁情报库比对,返回干净或恶意状态及检测数量等元数据,不向 VirusTotal 共享原始文件内容。
OpenAI 成立"福祉与 AI 专家委员会",汇集心理学家、临床医生和研究人员,指导 ChatGPT 如何支持用户情感健康,尤其是青少年群体。该委员会的意见将用于塑造更安全、更具关怀的 AI 体验。
OpenAI 公布了一套针对 ChatGPT 政治偏见的评估方法,通过新的真实世界测试提升客观性并减少偏见。该工作聚焦于如何定义和衡量 LLM 的政治偏见。
OpenAI 发布 2025 年 10 月报告,披露其识别和阻断 AI 恶意使用的进展。报告介绍了 OpenAI 如何打击滥用行为、执行政策,并保护用户免受现实世界危害。
OpenAI 封禁了一批韩语账号,这些账号利用 AI 进行恶意软件开发支持、调试、钓鱼和凭证窃取等操作。
OpenAI 封禁了一批与代号 Nine-emdash Line 行动相关的账号,该行动此前未被报道,来源指向中国。这些账号利用 AI 生成关于南海、香港和美国政治的 regional influence content。
推荐理由:OpenAI 首次披露并封禁一个中国来源的舆论影响行动账号,可了解平台方对 AI 滥用行为的处置口径。
OpenAI 封禁了一批账号,这些账号的活动与公开报道的威胁组织存在重叠,并显示出符合中国情报需求的典型特征,利用 AI 支持钓鱼与脚本工作流。
OpenAI 封禁了一批与俄罗斯来源的"Stop News"行动相关的账号,该行动利用 AI 生成针对非洲和英国的影响力内容。OpenAI 称其为屡次违规的影响力行动。
OpenAI 封禁了一批可能与俄语犯罪团伙有关的账号,这些账号利用 AI 构建恶意软件加载器、规避层、凭据窃取脚本和 C2 基础设施。
推荐理由:OpenAI 披露封禁与俄语犯罪团伙相关的账号,可了解 AI 被用于恶意软件工具链的具体环节。
OpenAI 封禁了一批与网络诈骗团伙关联的账号,这些账号利用 AI 生成诈骗话术、实施冒充、翻译以及维系与受害者的互动。
OpenAI 封禁了一批与中国关联的账号,这些账号利用 AI 支持监控相关规划、针对性画像以及对批评者等个人的研究。
OpenAI 发布 Sora 2 和 Sora 应用,称二者在构建时即以安全为基础,以应对先进视频模型与新型社交创作平台带来的新安全挑战。官方表示其做法建立在具体防护措施之上。
推荐理由:官方说明 Sora 2 与 Sora 应用在安全机制上的设计取向,可了解视频模型与社交创作平台的安全边界。
OpenAI 通过严格的使用政策、先进的检测工具和行业协作,打击网络儿童性剥削与虐待,以拦截、举报并防止 AI 被滥用。
OpenAI 与 AARP 达成合作,通过 OpenAI Academy 和 OATS 旗下 Senior Planet 项目,为老年人提供 AI 培训、诈骗识别工具及全国性项目,帮助他们安全上网。
Hugging Face 博客宣布由 Cloud Security Alliance 和 Noma Security 主导、Haize Labs 与 Harmonic Security 参与贡献的 RiskRubric.ai,为模型提供标准化风险评估。
推荐理由:原文给出六个风险维度的评分框架与首批评测分布,读者可据此理解模型安全评估的标准化路径。
Apollo Research 与 OpenAI 开发了针对隐藏失配(scheming)的评测方法,在受控测试中发现前沿模型存在与 scheming 一致的行为。团队还公开了具体案例,并对一种早期缓解 scheming 的方法进行了压力测试。
推荐理由:OpenAI 与 Apollo Research 公开了隐藏失配的评测方法与初步缓解手段,可了解前沿模型欺骗行为的检测思路。
OpenAI 阐述了其在 AI 使用中平衡青少年安全、自由与隐私的做法。
OpenAI 正在 ChatGPT 中构建年龄预测与家长控制功能,为青少年提供更安全、适龄的使用体验。该功能同时为家庭提供新的管理工具,帮助家长更好地支持孩子的使用。
OpenAI 公布与美国 CAISI、英国 AISI 合作推进 AI 安全与安保的进展。该合作旨在强化 AI 系统的安全性,具体成果与细节尚未披露。
OpenAI 新研究解释了语言模型产生幻觉的原因,并指出改进评估方法可以提升 AI 的可靠性、诚实性与安全性。
OpenAI 宣布与专家合作,为 ChatGPT 青少年用户加强保护并引入家长控制功能,同时将敏感对话路由至推理模型处理。
OpenAI 面向全球 1000 多人调查了 AI 应如何行事,并将其观点与自家 Model Spec 进行对比。这项"集体对齐"工作旨在让 AI 默认行为更好地反映多元的人类价值观与视角。
OpenAI 与 Anthropic 公布一次联合安全评估的结果,双方互相测试对方模型在失准、指令遵循、幻觉、越狱等方面的表现。OpenAI 称这是此类跨实验室合作评估,并提到其中的进展、挑战以及跨实验室协作的价值。
推荐理由:两家头部实验室首次互测对方模型的对齐与越狱表现,可了解跨实验室安全评估的做法与发现。
OpenAI 发文阐述其对经历心理或情绪困扰用户的安全考量,并说明当前系统的局限以及正在进行的改进工作。
OpenAI 发布 GPT-5 系统卡,说明其通过统一模型路由系统在 gpt-5-main、gpt-5-thinking 以及 gpt-5-thinking-nano 等轻量版本之间分配任务,以针对不同任务和开发者用途提供快速或更强的响应。
推荐理由:系统卡披露 GPT-5 用统一路由在多个模型间分配任务,可据此了解其快慢响应的实现方式。
OpenAI 在 GPT-5 中引入 safe-completions 方法,用更细致的输出级安全训练取代此前的硬拒绝策略,以同时提升安全性与有用性。该方案针对双用途提示词,从以输出为中心的角度处理响应,而非直接拒绝作答。
OpenAI 研究发布开放权重模型 gpt-oss 的最坏情况前沿风险,提出"恶意微调"(MFT)方法,通过微调让 gpt-oss 在生物学和网络安全两个领域尽可能发挥最大能力。
Outtake 利用 GPT-4.1 和 OpenAI o3 驱动 AI 智能体,检测和处置数字威胁的速度比以往快 100 倍。
OpenAI 发布 ChatGPT agent 系统卡,介绍这一智能体模型整合了研究、浏览器自动化和代码工具,并在 Preparedness Framework 下配备安全防护措施。
推荐理由:OpenAI 官方系统卡披露 ChatGPT agent 的能力组合与安全框架,可了解其智能体设计与防护思路。
OpenAI 研究了大语言模型在错误回答上训练后出现更广泛错位行为的机制,并识别出一个驱动该行为的内部特征,该特征可通过极少量微调被逆转。
OpenAI 正在主动评估先进 AI 在生物学和医学领域的能力,并实施防护措施以防止其被滥用。先进 AI 虽能变革生物学与医学,但也带来了生物安全风险。
OpenAI 发布 Outbound Coordinated Disclosure Policy,规范其如何负责任地报告第三方软件中的漏洞,强调诚信、协作与大规模主动安全。该政策面向对外披露场景,旨在以协调方式处理第三方软件安全问题。
OpenAI 发布最新报告,通过案例研究披露其检测和阻止 AI 恶意使用的方式。报告聚焦 OpenAI 如何发现并防范这类滥用行为。
OpenAI 封禁了一批疑似源自柬埔寨的账号,这些账号利用 AI 支持针对英国用户的任务诈骗流程。
OpenAI 封禁了一批与疑似伊朗关联的 STORM-2035 行动相关的账号,该行动利用 AI 生成针对美国、英国、爱尔兰和委内瑞拉政治的影响力内容。
OpenAI 封禁了一批利用 AI 进行社会工程、监控主题研究和针对批评者的影响力活动的账号。这些账号被用于社交工程与舆论影响操作。
OpenAI 封禁了一批与疑似欺诈性就业活动相关的账号,这些账号利用 AI 生成用于虚假远程职位申请的材料。
OpenAI 封禁了一批利用 AI 生成帖文、批评一名台湾社交媒体网红及相关美国话题的账号。该行动被命名为“Sneer Review”,涉及中国来源的影响力活动。
OpenAI 封禁了一批中国来源账号,这些账号使用 AI 生成美国政治内容,并研究人物、运动和在线社群。该行动被命名为 Operation Uncle Spam,指向美国政治极化影响活动。