GPT-6 Astra 首批实测:一周搭出曼哈顿,长任务仍会跑偏
雷峰网汇总了 GPT-6 Astra 发布后首批拿到模型的用户实测。Ben Davis 让 Astra 在 Blender 里生成 4K 飞船模型,并观察到它会主动打开页面、读取报错、修改后再测试;Theo 用 Blender 做可直接在浏览器运行的 3D 游戏,耗时约 30 分钟到 2 小时。
推荐理由:汇总首批用户实测,呈现 Astra 在 3D 创作、软件操作与长任务上的能力边界和翻车点。
雷峰网汇总了 GPT-6 Astra 发布后首批拿到模型的用户实测。Ben Davis 让 Astra 在 Blender 里生成 4K 飞船模型,并观察到它会主动打开页面、读取报错、修改后再测试;Theo 用 Blender 做可直接在浏览器运行的 3D 游戏,耗时约 30 分钟到 2 小时。
推荐理由:汇总首批用户实测,呈现 Astra 在 3D 创作、软件操作与长任务上的能力边界和翻车点。
OpenAI 发布 GPT-6.1 Sol,官方称其在编码、电脑操作和专业工作方面接近 Astra 的智能水平,标准 API 输入与输出 token 价格仅为 Astra 的五分之一。
推荐理由:OpenAI 发布 GPT-6.1 Sol,价格降至 Astra 标准 API 的五分之一,可据此判断编码与电脑操作场景的成本变化。
Anthropic 发布 Claude Opus 5.5,称其为 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:同一天两家实验室分别发布新模型并大幅降价,读者可对比能力定位与每任务成本的实际差异。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作,并在能力与成本上提供不同取舍。原文未披露参数、定价或开放时间等更多细节。
推荐理由:OpenAI 一次推出两款 GPT-6 模型,读者可据此了解其在能力与成本上的不同取舍。
OpenAI 发布 GPT-6 Astra,称其为面向企业的最强模型,具备更强的推理能力、电脑操作能力以及写作与设计判断力。
推荐理由:OpenAI 公布 GPT-6 Astra 面向企业场景的能力方向,可据此了解其推理与电脑操作定位。
OpenAI 发布新一代模型 GPT-6 Astra,官方称其为目前最智能且对齐程度最高的模型。该模型在计算机操作、编码、网络安全和科学等方向具备 SOTA 能力。
推荐理由:OpenAI 官方发布新一代模型,读者可据此了解其在计算机操作、编码与安全等方向的能力定位。
OpenAI 发布 GPT-6 Astra 安全概览,称其是已广泛部署的最强模型,也是首个在 Preparedness Framework 下达到网络安全能力 Critical 级别的模型。
推荐理由:OpenAI 官方给出 GPT-6 Astra 的安全能力定级,读者可据此了解该模型在网络安全维度上的定位。
OpenAI 表示 Astra 是其首个在 Preparedness Framework 下达到关键网络安全能力阈值的模型,发布时将配备更强的安全防护措施。该内容来自 OpenAI 官方博客 Path to Astra 一文,目前仅有摘要信息。
推荐理由:OpenAI 首次披露 Astra 触及 Preparedness Framework 的关键网络安全能力阈值,读者可据此了解前沿模型发布前的安全门槛。
OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 提供,用于经授权的漏洞研究、漏洞利用验证和安全测试。该模型是 Daybreak 扩展的一部分。
推荐理由:OpenAI 推出面向网络安全的专用模型,读者可了解其授权漏洞研究与安全测试的定位。
OpenAI 在 ChatGPT 中上线改进版 GPT-5.6 Sol,官方称其准确性和一致性更好。同时免费用户获得 GPT-5.6 Luna 的更大使用权限,可进行不限量的日常对话。
推荐理由:OpenAI 官方说明 GPT-5.6 Sol 的准确性与一致性改进,并扩大免费用户对 GPT-5.6 Luna 的使用范围。
OpenAI 宣布下调 GPT-5.6 在 Luna 和 Terra 上的定价,并介绍更高效的模型如何帮助企业在规模化场景中部署 AI 工作流。原文未披露具体价格数字与模型能力细节。
推荐理由:OpenAI 公布 GPT-5.6 在 Luna 与 Terra 上的更低定价,读者可据此评估企业级 AI 工作流的部署成本。
OpenAI 发布文章说明 GPT-5.6 如何在模型、推理和智能体工作流三个层面提升 AI 效率,以在同等成本下提供更多可用智能。原文未给出具体性能数字或版本细节。
OpenAI 发布新一代语音模型 GPT-Live,用于实现更自然的人机交互,目前已接入 ChatGPT Voice。
推荐理由:OpenAI 发布新一代语音模型并接入 ChatGPT Voice,读者可据此了解语音交互能力的代际更新。
OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全技术栈。
推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可据此了解其在编码、科学与网络安全上的能力方向。
OpenAI 为 GPT-Rosalind 推出新能力,面向生命科学研究,增强生物推理、药物化学、基因组分析和实验工作流能力。
推荐理由:OpenAI 为 GPT-Rosalind 增加生命科学方向能力,读者可据此了解该模型在生物推理与基因组分析上的定位。
OpenAI 称其模型解决了已有 80 年历史的单位距离问题,推翻离散几何中的一项重要猜想,被视为 AI 驱动数学的一个里程碑。
推荐理由:OpenAI 模型推翻离散几何中悬置 80 年的核心猜想,可观察 AI 在数学证明上的能力边界。
OpenAI 扩展 Trusted Access for Cyber 计划,推出 GPT-5.5 和 GPT-5.5-Cyber,帮助经过验证的防御方加速漏洞研究并保护关键基础设施。
推荐理由:OpenAI 在网络安全场景下扩展可信访问计划,并给出 GPT-5.5 与 GPT-5.5-Cyber 两个版本,可据此了解其面向防御方的能力开放方式。
OpenAI 发布 GPT-5.5 Instant,将其作为 ChatGPT 的默认模型,官方称其回答更智能、更准确,并减少了模型幻觉。该版本还改进了个性化控制。
推荐理由:OpenAI 更新 ChatGPT 默认模型,读者可据此了解回答准确性与个性化控制的变化方向。
OpenAI 发布 GPT-5.5,官方称其为面向编码、研究和数据分析等复杂任务打造的模型,可跨工具使用。目前公开信息仅为摘要,未披露参数、上下文窗口或评测数据。
推荐理由:OpenAI 官方发布 GPT-5.5,读者可据此了解新模型面向编码、研究与数据分析等复杂任务的定位。
OpenAI 发布 Privacy Filter,一款用于检测和脱敏文本中个人身份信息(PII)的开放权重模型,官方称其准确率达到 SOTA。目前公开信息仅为摘要,未披露模型规模、许可协议与开放入口。
推荐理由:OpenAI 开源一款用于检测和脱敏文本 PII 的开放权重模型,可了解其在隐私合规场景的定位。