跳到正文
  1. 开源中国78

    Anthropic 红队评估 GLM-5.3:自主漏洞利用能力追平 Claude Mythos Preview

    Anthropic 前沿红色团队评估智谱 GLM-5.3,认为它是首个能像五个月前 Claude Mythos Preview 那样自主构建端到端漏洞利用、却几乎未设拒绝护栏就放出的模型。五个月前 Anthropic 发布 Claude Mythos Preview 时,曾称其为第一个能自主构建复杂端到端漏洞利用的 AI 模型。

    推荐理由:Anthropic 红队对 GLM-5.3 的评估给出了自主漏洞利用能力与拒绝护栏缺失的对比,可了解前沿模型安全评估的一种视角。

  1. 开源中国82

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30%、Agent 编程评测从 10% 升至 70%

    Anthropic 发布 Claude 5.5 家族第二个成员 Claude Sonnet 5.5,定位为 Opus 5.5 的快而省互补款,主打高频日常任务、修 bug、文档和表格。官方称其比 Sonnet 5 速度快 30% 以上,多数任务成本低 30%,Agent 编程评测成绩从 10% 提升到 70%。

    推荐理由:Anthropic 新模型在 Agent 编程评测上的大幅跃升,可作为观察 Sonnet 系列定位与能力边界的参照。

  2. Latent Space78

    AINews:Opus 5.5 擅长生成讲解视频

    AINews 汇总 9/24-9/25 动态,指出 Opus 5.5 本周发布后社区反响积极,尤其在用代码生成讲解视频上表现突出。榜单方面 Opus 5.5 以 88.4% 领跑 SimpleBench,在 Terminal-Bench-Science 上从低推理档 24% 升至 xhigh 档 62%,max 档回落至 59%。

    推荐理由:汇总 Opus 5.5 发布一周内的社区实测与榜单表现,可快速了解前沿模型在视频生成与智能体任务上的当前水位。

  3. Simon Willison80

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均胜出。

    推荐理由:作者实测了 Sonnet 5.5 的编码与免费层表现,并把它与 Opus 5.5、ChatGPT 免费层做了横向比较。

  1. Latent Space88

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna

    Anthropic 发布 Claude Opus 5.5,称其为 Claude 5.5 家族首个模型,多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,并成为 Claude Code 与 Claude 应用的默认模型。

    推荐理由:同一天两家实验室分别发布新模型并大幅降价,读者可对比能力定位与每任务成本的实际差异。

  2. Simon Willison88

    Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna 发布并引发新一轮价格战

    Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者称 GPT-6 Sol 与 Luna 的价格是各自 GPT-5.6 对应型号的一半。

    推荐理由:作者实测并整理当日多家新模型的价格表,可据此比较同一档位模型的成本变化。

  1. Hugging Face Blog60

    Hugging Face 教你用开源模型替代 Claude 运行 OpenClaw 智能体

    Anthropic 正在限制 Pro/Max 订阅者在开放智能体平台中使用 Claude 模型,Hugging Face 提出两条迁移路径:通过 Hugging Face Inference Providers 调用开源模型,或在本地硬件上运行开源模型。

    推荐理由:Anthropic 收紧 Claude 在开放智能体平台的访问后,文章给出托管与本地两条迁移路径和具体配置命令。

  1. Google DeepMind82

    Google 发布智能体开发平台 Antigravity

    Google 发布智能体开发平台 Antigravity,即日起免费公开预览,提供 Gemini 3 Pro 的宽松速率限制。该平台在传统 AI IDE 之外新增以智能体为中心的 Manager 界面,可并行编排多个工作区中的智能体,并支持浏览器控制与异步交互。

    推荐理由:Google 把 IDE 改造成以智能体为中心的开发平台,读者可据此判断异步编排与 Artifacts 验证会怎样改变编码工作流。

  1. OpenAI News62

    OpenAI 与 Anthropic 公布联合安全评估结果

    OpenAI 与 Anthropic 公布一次联合安全评估的结果,双方互相测试对方模型在失准、指令遵循、幻觉、越狱等方面的表现。OpenAI 称这是此类跨实验室合作评估,并提到其中的进展、挑战以及跨实验室协作的价值。

    推荐理由:两家头部实验室首次互测对方模型的对齐与越狱表现,可了解跨实验室安全评估的做法与发现。

已经到底了