跳到正文
6月26日周五
  1. OpenAI News62

    OpenAI 预告下一代模型 GPT-5.6 Sol

    OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全技术栈。

    推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可据此了解其在编码、科学与网络安全上的能力方向。

6月25日周四
  1. Hugging Face Blog60

    NVIDIA NeMo AutoModel 发布,MoE 微调吞吐提升 3.4-3.7 倍

    NVIDIA 发布开源库 NeMo AutoModel,在 HuggingFace Transformers v5 之上加入 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核,微调 MoE 模型时训练吞吐提升 3.4-3.7 倍、GPU 显存减少 29-32%。

    推荐理由:原文给出同一 from_pretrained() API 下的吞吐与显存对比数据,读者可据此判断 MoE 微调的迁移成本。

6月24日周三
6月23日周二
  1. Mistral AI67

    Mistral 发布 OCR 4 文档解析模型

    Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器自托管部署。

    推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,便于评估文档解析管线。

6月22日周一
  1. Hugging Face Blog62

    如何用本地模型免费分诊 OpenClaw 仓库的 Issue 和 PR

    Hugging Face 博客分享了用本地模型对 OpenClaw 仓库的 Issue 和 PR 做实时分类分诊的方案,作者在 NVIDIA GB10 上运行 gemma-4-26b-a4b 和 qwen3.6-35b-a3b,通过 Pi 智能体框架配合受限只读 shell(reposhell)和 final_json 工具输出结构化标签。

    推荐理由:原文给出本地模型做 PR/Issue 分类的完整架构与 330 行评测数据,可迁移到其他高吞吐筛选场景。

6月19日周五
  1. Hugging Face Blog49

    MosaicLeaks:你的深度研究智能体能守住秘密吗?

    Hugging Face 博客提出 MosaicLeaks,用 1001 条多跳研究链测试深度研究智能体的隐私泄漏,其外部查询日志可被拼凑出私有企业信息。测试中智能体频繁泄漏,仅优化任务表现会加剧泄漏;其 Privacy-Aware Deep Research(PA-DR)RL 训练方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄漏从 34.0% 降至 9.9%。

6月18日周四
  1. OpenAI News60

    OpenAI 用 GPT-5.5 Instant 提升 ChatGPT 健康问答能力

    OpenAI 发布 GPT-5.5 Instant,用于改进 ChatGPT 在健康与养生问题上的回答,官方称其具备更强的推理、更好的上下文理解、更清晰的表达,并引入医生参与设计的评估。该更新聚焦健康问答场景,具体能力变化以官方说明为准。

    推荐理由:官方说明 GPT-5.5 Instant 在健康与养生问答上的推理、上下文和表达改进,可了解 ChatGPT 医疗场景的能力变化。

  2. Hugging Face Blog60

    Hugging Face 发布 agent-eval:在自有工具上评测开放模型的智能体能力

    Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,按 bare、clone、skill 三种层级在模型 × 版本 × 任务上并行运行,衡量智能体完成任务所需的轮次、token 与错误率,而非只看最终答案。

    推荐理由:原文给出了一套可复用的智能体工具评测方法,并展示同一改动对不同规模模型效果相反的具体证据。

6月17日周三
  1. Google DeepMind60

    Google DeepMind 与英国政府合作开发 AI 规划审批原型

    Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,开发一款基于 Gemini 的 AI 规划审批原型,目标是帮助审批人员将申请决策时间缩短 50%。

    推荐理由:英国政府与 Google DeepMind 合作开发规划审批原型,目标将审批时间减半,可观察 AI 进入公共服务的落地方式。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap 与智能体安全技术框架

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部部署和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,把内部智能体视为可能未对齐的潜在内部威胁。

    推荐理由:DeepMind 公开内部 AI 控制路线图,给出检测与响应分级和百万条编码智能体轨迹的实测数据,可供安全团队参考。

6月15日周一