OpenAI 提出 IH-Challenge 改进前沿 LLM 的指令层级
OpenAI 发布 IH-Challenge,用于训练模型优先执行可信指令,从而改进指令层级、安全可控性以及抵御提示注入攻击的能力。
推荐理由:OpenAI 公开 IH-Challenge 训练方法,可用于理解前沿模型如何提升指令层级与抗提示注入能力。
OpenAI 发布 IH-Challenge,用于训练模型优先执行可信指令,从而改进指令层级、安全可控性以及抵御提示注入攻击的能力。
推荐理由:OpenAI 公开 IH-Challenge 训练方法,可用于理解前沿模型如何提升指令层级与抗提示注入能力。
ChatGPT 推出面向数学和科学的交互式可视化讲解功能,帮助学生实时探索公式、变量和概念。
OpenAI 宣布收购 AI 安全平台 Promptfoo,该平台帮助企业在开发阶段识别并修复 AI 系统中的漏洞。
推荐理由:OpenAI 收购 AI 安全平台 Promptfoo,读者可据此了解其在企业 AI 安全测试环节的布局。
OpenAI 发布 Codex Security 研究预览版,这是一个 AI 应用安全智能体,可分析项目上下文来检测、验证并修复复杂漏洞,官方称其置信度更高、噪声更少。
Descript 借助 OpenAI 推理模型实现大规模内容库的自动本地化,在不丢失时间轴与语义的前提下完成多语言视频配音。该方案面向大体量内容库的自动本地化需求,解决了配音中时序与含义难以兼顾的问题。
Balyasny Asset Management 通过严格的模型评估、全平台使用 OpenAI 以及智能体工作流,重构了投资研究流程。该机构将这三者结合,打造出一套 AI 研究引擎。
OpenAI 发布 GPT-5.4,称其为面向专业工作能力最强且高效的前沿模型,具备 SOTA 编码、计算机使用、工具搜索能力和 1M token 上下文窗口。
推荐理由:OpenAI 官方公布 GPT-5.4 的定位与能力方向,可据此了解其面向专业工作的能力边界。
OpenAI 提出 CoT-Control,发现推理模型难以控制自身的思维链,这反而强化了可监控性作为 AI 安全保障的价值。
OpenAI 发布面向学校的 AI 工具、认证和评估资源,帮助中小学与高校缩小 AI 能力差距、扩大机会。该举措旨在确保教育领域的 AI 使用能够真正转化为发展机遇。
OpenAI 提出五种 AI 价值模型,帮助企业领导者按从员工熟练度到流程重塑的顺序推进 AI 落地,以构建持久的业务优势。
德甲俱乐部 VfL Wolfsburg 将 ChatGPT 推广为全俱乐部范围的能力,重点在于人而非试点项目,以此提升效率、创造力与知识共享,同时不丢失其足球身份。
OpenAI 上线 Adoption 新闻频道,提供将 AI 进展转化为业务优势的实用洞察与框架。该频道面向企业落地场景,内容聚焦实践方法与可复用框架。
OpenAI 推出 ChatGPT for Excel 以及新的金融应用集成,由 GPT-5.4 驱动,用于在受监管环境中加速建模、研究与分析。
推荐理由:OpenAI 把 ChatGPT 接入 Excel 并新增金融数据集成,读者可据此判断其在受监管场景中的可用边界。
一篇新预印本将单负振幅扩展至引力子,GPT-5.2 Pro 参与推导并验证了量子引力中非零的引力子树振幅。
OpenAI 推出 Learning Outcomes Measurement Suite,用于长期评估 AI 在不同教育环境中对学生学习的影响。该套件面向多样化的教育场景,追踪 AI 对学习成果的作用。
Axios COO Allison Murphy 介绍了该公司如何用 AI 支持本地记者、简化新闻编辑室工作流程,并大规模交付高影响力的本地新闻报道。
OpenAI 发布 GPT-5.3 Instant,官方称其在日常对话中更顺畅、更实用。原文正文未能抓取,除标题外暂无更多细节。
OpenAI 发布 GPT-5.3 Instant 系统卡,但当前抓取仅保留标题,正文内容缺失。
OpenAI 公布其与美国国防部(Department of War)合同的细节,说明其中的安全红线、法律保护以及 AI 系统在涉密环境中的部署方式。材料仅提供摘要,未披露合同金额、期限或具体部署系统。
推荐理由:OpenAI 官方披露与国防部门合同的边界条款,可了解其安全红线与法律保护如何界定。
OpenAI 与 Microsoft 发布联合声明,称双方将继续在研究、工程和产品开发方面紧密合作,延续多年的深度协作与共同成果。
OpenAI 宣布获得 1100 亿美元新投资,投前估值 7300 亿美元。其中软银出资 300 亿美元,NVIDIA 出资 300 亿美元,Amazon 出资 500 亿美元。
推荐理由:OpenAI 公布 1100 亿美元新融资与 7300 亿美元投前估值,并列出三家出资方,可据此观察其资本结构与算力合作走向。
OpenAI 与 Amazon 宣布战略合作,将 OpenAI 的 Frontier 平台引入 AWS。合作范围包括扩展 AI 基础设施、定制模型以及企业级 AI 智能体。
推荐理由:OpenAI 与 AWS 的合作把 Frontier 平台接入云基础设施,读者可据此观察企业级 AI 智能体的落地路径。
Amazon Bedrock 推出面向智能体的 Stateful Runtime Environment,为 OpenAI 驱动的多步 AI 工作流提供持久化编排、记忆与安全执行能力。
OpenAI 公布其心理健康安全工作的最新进展,包括家长控制、可信联系人、改进的痛苦识别能力,以及近期诉讼方面的动态。
OpenAI 与 Pacific Northwest National Laboratory 联合推出 DraftNEPABench,用于评估 AI 编程智能体如何加速联邦许可审批。该基准显示,NEPA 文件起草时间有望最多缩短 15%,助力基础设施审查现代化。
OpenAI 与 Figma 推出 Codex 集成,打通代码与设计,让团队在实现与 Figma canvas 之间自由切换、快速迭代与交付。
OpenAI 最新威胁报告剖析了恶意行为者如何将 AI 模型与网站、社交平台结合使用,并探讨这对检测与防御意味着什么。报告聚焦此类组合手法带来的识别与防护挑战。
OpenAI 任命 Arvind KC 为首席人力官,负责帮助公司规模化扩张、强化企业文化,并主导 AI 时代工作方式的演进。
OpenAI 宣布不再使用 SWE-bench Verified 评测,理由是这一基准正日益受到污染,无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷和训练数据泄漏问题,并建议改用 SWE-bench Pro。
推荐理由:OpenAI 说明 SWE-bench Verified 存在污染与测试缺陷,并给出替代基准建议,可供关注编码评测的人参考。
OpenAI 宣布推出 Frontier Alliance Partners,帮助企业从 AI 试点走向生产环境,实现安全、可扩展的智能体部署。
OpenAI 公开了其 AI 模型在 First Proof 数学挑战赛中的证明尝试,用于测试模型在专家级问题上的研究级推理能力。
OpenAI 承诺向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究。该资金旨在加强全球应对 AGI 安全与安保风险的努力。
OpenAI 推出 OpenAI for India,旨在扩大印度全国 AI 可及性,建设本地基础设施、赋能企业并提升劳动力技能。该计划聚焦本地基础设施、企业应用与人才培养三个方向。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞场景,覆盖发现、修复与攻击三类任务。
OpenAI 发布的一篇新预印本显示,GPT-5.2 为胶子振幅提出了一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。
推荐理由:材料给出 GPT-5.2 在理论物理中提出新公式并被形式化证明的案例,可观察模型在科研推理上的边界。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。两项功能面向企业安全场景,具体能力与开放范围原文未进一步说明。
推荐理由:OpenAI 为 ChatGPT 增加 Lockdown Mode 与 Elevated Risk 标签,读者可了解企业防御提示词注入的新手段。
OpenAI 推出开源工具包 GABRIEL,借助 GPT 把定性文本和图像转化为定量数据,帮助社会科学家大规模分析研究。该工具包已开源,面向社会科学研究场景。
OpenAI 构建了一套实时访问系统,将速率限制、用量追踪与 credits 结合,为 Codex 和 Sora 提供持续访问能力。该系统旨在突破单纯速率限制的局限,支撑这两个产品的规模化访问。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15 倍,支持 128k 上下文。该模型目前面向 ChatGPT Pro 用户开放研究预览。
推荐理由:OpenAI 发布首个实时编码模型,给出 15 倍生成速度与 128k 上下文,可据此判断实时编码场景的可用性。
OpenAI 技术人员 Ryan Lopopolo 提出 harness engineering,探讨在智能体优先的世界中如何利用 Codex。文章聚焦于围绕 AI 智能体构建工程实践,而非单纯依赖模型本身的能力。