OpenAI 预告下一代模型 GPT-5.6 Sol
OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全技术栈。
推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可据此了解其在编码、科学与网络安全上的能力方向。
OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全技术栈。
推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可据此了解其在编码、科学与网络安全上的能力方向。
Hugging Face 介绍用一条 hf jobs run 命令在 HF Jobs 上启动私有、兼容 OpenAI API 的 vLLM 端点,按秒计费,无需自备服务器或 Kubernetes。
推荐理由:原文给出了一条命令在 HF Jobs 上起 vLLM 端点的完整流程,可迁移到自建推理与编码智能体后端。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试数月后,内存占用降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。
OpenAI 发布新研究论文,展示 AI 智能体正在改变工作方式,能够承担更长、更复杂的任务,并在多种岗位上提升生产力。
Google Research 在 COLM 2026 发表的论文揭示,推理能让 LLM 召回原本几乎无法获取的参数化知识,且这一效果并非来自复杂问题的分解。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前它仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:原文说明 computer use 从独立模型并入主 Flash 模型,并给出企业级安全护栏,读者可据此判断智能体自动化任务的落地路径。
NVIDIA 发布开源库 NeMo AutoModel,在 HuggingFace Transformers v5 之上加入 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核,微调 MoE 模型时训练吞吐提升 3.4-3.7 倍、GPU 显存减少 29-32%。
推荐理由:原文给出同一 from_pretrained() API 下的吞吐与显存对比数据,读者可据此判断 MoE 微调的迁移成本。
Mistral AI 为 Connectors 推出多项新能力:按工作区或组织设置连接器访问权限、按工具粒度开关,以及带连接器作用域的 API key,均已 GA。
OpenAI 与 Broadcom 联合推出名为 Jalapeño 的定制 AI 芯片,专为 LLM 推理设计。该芯片旨在提升 AI 系统在性能、能效和规模化方面的表现。
推荐理由:OpenAI 与 Broadcom 联合推出面向 LLM 推理的自研芯片,读者可了解其在推理性能与规模化上的定位。
Hugging Face 与 Treble Technologies 上线首个开放、社区驱动的远场 ASR 基准 FFASR Leaderboard,覆盖 14 个模拟房间,并设 Lab Measured 与 Lab Simulated 两列做 sim-to-real 验证。
GPT-5 Pro 帮助免疫学家 Derya Unutmaz 解开了一个困扰三年的免疫学谜题,为 T 细胞行为提供了新见解。这一突破有望支持癌症与自身免疫疾病研究。
OpenAI 正通过 Appia Foundation 参与构建先进 AI 的共享标准,支持评估框架、安全实践与全球合作。
Mistral 发布 OCR 4,在提取文本之外返回边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器自托管部署。
推荐理由:官方给出 OCR 4 的边界框、块分类与置信度输出,以及自托管和按页计价方案,便于评估文档解析管线。
Google Chrome 团队开发者关系工程师 Thomas Steiner 在 Hugging Face 博客展示如何用 Cross-Origin Storage(COS)扩展在 Transformers.js 中试验跨源缓存。
Omio 正借助 OpenAI 构建对话式旅行体验,并加速产品开发、转型为 AI 原生公司。
Hugging Face 将 huggingface_hub 的发版周期从每 4 到 6 周一次改为每周一次,整个流程由单个 GitHub Actions 工作流驱动。
推荐理由:原文公开了每周发版工作流的完整结构,其中模型起草加确定性校验再人工确认的循环可迁移到其他生成任务。
PaddleOCR 发布 PP-OCRv6 通用 OCR 模型家族并上线 Hugging Face,提供 tiny、small、medium 三档,参数从 1.5M 到 34.5M,其中 small 和 medium 支持 50 种语言。
推荐理由:原文给出三档模型参数、检测与识别精度及多后端接入方式,便于按部署场景选型。
牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即便专家可自选议题、提前研究并接受 1,000 英镑奖金激励。
OpenAI 推出 Daybreak 计划下的 Patch the Planet,帮助开源维护者借助 AI 与专家审核发现、验证并修复漏洞。该计划面向开源维护者,聚焦漏洞的查找、验证与修复环节。
OpenAI 推出新的 Daybreak 工具集,包括 Codex Security 和 GPT-5.5-Cyber,帮助各类组织大规模发现、验证并修补漏洞。
推荐理由:OpenAI 官方发布 Daybreak 安全工具集,读者可了解其面向漏洞发现与修复的产品定位。
Hugging Face 博客分享了用本地模型对 OpenClaw 仓库的 Issue 和 PR 做实时分类分诊的方案,作者在 NVIDIA GB10 上运行 gemma-4-26b-a4b 和 qwen3.6-35b-a3b,通过 Pi 智能体框架配合受限只读 shell(reposhell)和 final_json 工具输出结构化标签。
推荐理由:原文给出本地模型做 PR/Issue 分类的完整架构与 330 行评测数据,可迁移到其他高吞吐筛选场景。
Jason Liu 分享了他使用 OpenAI Codex 保存上下文、管理复杂项目,并让工作不再局限于单次提示词的经验。
三星电子在全球范围内部署 ChatGPT Enterprise 和 Codex,供员工使用,这是 OpenAI 规模最大的企业 AI 落地项目之一。
Hugging Face 博客提出 MosaicLeaks,用 1001 条多跳研究链测试深度研究智能体的隐私泄漏,其外部查询日志可被拼凑出私有企业信息。测试中智能体频繁泄漏,仅优化任务表现会加剧泄漏;其 Privacy-Aware Deep Research(PA-DR)RL 训练方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄漏从 34.0% 降至 9.9%。
OpenAI 为 ChatGPT Enterprise 新增用量分析与支出控制功能,帮助企业掌握成本并放心扩展 AI 应用。新功能面向企业管理员,用于管理组织内的 ChatGPT 使用开销。
OpenAI 发布 GPT-5.5 Instant,用于改进 ChatGPT 在健康与养生问题上的回答,官方称其具备更强的推理、更好的上下文理解、更清晰的表达,并引入医生参与设计的评估。该更新聚焦健康问答场景,具体能力变化以官方说明为准。
推荐理由:官方说明 GPT-5.5 Instant 在健康与养生问答上的推理、上下文和表达改进,可了解 ChatGPT 医疗场景的能力变化。
研究者使用 OpenAI 的推理模型辅助诊断罕见疾病,在先前未解决的病例中新增 18 例确诊。该结果来自对儿童罕见遗传病诊断场景的应用。
Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,按 bare、clone、skill 三种层级在模型 × 版本 × 任务上并行运行,衡量智能体完成任务所需的轮次、token 与错误率,而非只看最终答案。
推荐理由:原文给出了一套可复用的智能体工具评测方法,并展示同一改动对不同规模模型效果相反的具体证据。
Hugging Face 在 PEFT 库中新增基准测试,用相同基座模型、数据集和硬件对比 LoRA 与其他 PEFT 技术。
推荐理由:Hugging Face 用统一条件的基准对比多种 PEFT 技术,读者可据此判断 LoRA 是否仍是默认选择。
AWS 开源 SDK Strands Robots 将 LeRobot 的硬件抽象、仿真与策略栈封装为 AgentTools,让一个 Strands 智能体完成从 Hub 数据集到实体机器人的全流程。
推荐理由:AWS 官方给出从 Hub 数据集到实体机器人的五步流程,可看到同一份智能体代码如何切换仿真与硬件。
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家,它改进了一个关键的药物制造反应,推进了药物化学研究。
智谱发布旗舰模型 GLM-5.2,主打长程任务能力,首次在 1M token 上下文下稳定支撑长程工作,并采用 MIT 开源许可。
推荐理由:GLM-5.2 把 1M 上下文与编码智能体能力结合,并给出与闭源前沿模型的基准对比,可据此判断开源模型在长程任务上的位置。
Hugging Face 发布 Agentic Resource Discovery(ARD)规范草案及参考实现 Discover Tool,让智能体在运行时按自然语言搜索能力,而非预先安装。
推荐理由:原文给出 ARD 规范草案与 Hugging Face 参考实现,读者可据此了解智能体能力发现从预装转向运行时搜索的路径。
OpenAI 发布 LifeSciBench,一个由专家编写并评审的基准,用于评估 AI 系统处理真实生命科学研究任务与决策的能力。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,开发一款基于 Gemini 的 AI 规划审批原型,目标是帮助审批人员将申请决策时间缩短 50%。
推荐理由:英国政府与 Google DeepMind 合作开发规划审批原型,目标将审批时间减半,可观察 AI 进入公共服务的落地方式。
Google Research 基于 Google Earth AI 的 RSF Vision-Transformer 骨干模型,发布了一套覆盖英格兰逾 13 万平方公里区域的矢量化数据集,可将树篱、石墙和小树林等细尺度生态特征转化为可操作的清单。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部部署和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,把内部智能体视为可能未对齐的潜在内部威胁。
推荐理由:DeepMind 公开内部 AI 控制路线图,给出检测与响应分级和百万条编码智能体轨迹的实测数据,可供安全团队参考。
OpenAI 推出 Deployment Simulation,一种在部署前预测 AI 模型行为的方法,使用真实对话数据来提升安全性和评估准确性。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利机构 Sequent,认为对齐研究"尚未走上正轨",计划两年内扩至 40-80 名全职员工,初期募资 1 亿至 1.5 亿美元,研究方向涵盖可扩展监督、学习理论、博弈论与 personas。
OpenAI 推出 Partner Network,投入 1.5 亿美元帮助全球合作伙伴加速企业级 AI 的采用、部署与转型。