Ecom-RLVE:面向电商对话智能体的自适应可验证环境
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含产品发现、替代品、购物车构建、退货、订单追踪、政策问答、组合规划和多意图旅程 8 个可验证环境,每个环境配有程序化问题生成、12 轴难度课程和算法可验证奖励。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含产品发现、替代品、购物车构建、退货、订单追踪、政策问答、组合规划和多意图旅程 8 个可验证环境,每个环境配有程序化问题生成、12 轴难度课程和算法可验证奖励。
Hugging Face 发布一个 Skill 和配套测试框架,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:原文给出可复用的 Skill 与独立测试框架,读者可了解如何让智能体产出可被维护者接受的模型移植 PR。
OpenAI 面向网络安全领域推出 Trusted Access for Cyber,领先安全公司与大型企业已加入,使用 GPT-5.4-Cyber 强化全球网络防御。OpenAI 同时提供 1000 万美元 API 资助,支持该生态建设。
Sentence Transformers 现已支持训练和微调多模态嵌入与 Reranker 模型,作者以 Qwen/Qwen3-VL-Embedding-2B 微调视觉文档检索(VDR)为例,微调后 NDCG@10 从基线的 0.888 提升至 0.947,超过所有对比的现有 VDR 模型,包括参数量达其 4 倍的模型。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表达力和语音质量上均有提升,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。
推荐理由:官方给出新语音模型的音频标签控制方式、Elo 分数与多语言覆盖,可据此判断表达力控制的实际粒度。
Hugging Face 发布 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评估 AI 智能体的组合推理与多步工作流执行能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择与多跳推理四类任务,模型整体表现不佳。博客进一步分析了不同任务上观察到的失败模式。
OpenAI 更新 Agents SDK,新增原生沙箱执行和模型原生 harness,帮助开发者在文件与工具之间构建安全、长时间运行的智能体。
推荐理由:官方给出 Agents SDK 的两项能力变化,读者可据此判断长时运行智能体的构建方式有何调整。
HCompany 发布 Chrome 扩展 HoloTab,让 Holo3 计算机操作模型直接在浏览器中自动完成网页任务,用户只需描述需求,智能体便自行导航界面、填写字段并做决策,无需任何配置或技术背景。HoloTab 支持 Routines 功能,用户录制一次操作过程(可边操作边口述),扩展会据此生成可重复运行或定时执行的例程。该扩展免费开放使用,已在 Chrome 应用商店上线。
推荐理由:HCompany 把此前发布的 Holo3 计算机操作模型封装成浏览器扩展,读者可了解其录制复用机制与零门槛定位。
OpenAI 扩展 Trusted Access for Cyber 计划,向经过审核的防御者推出 GPT-5.4-Cyber,并随 AI 网络安全能力提升强化防护措施。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生的问题解决、协作等未来技能,目前提供英文版并可注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分量表打分,188 名 18-25 岁美国测试者的研究显示其评分与人类专家一致度接近专家间一致度。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在设施巡检场景的可用性。
Cloudflare 将 OpenAI 的 GPT-5.4 和 Codex 引入 Agent Cloud,让企业能够构建、部署并规模化运行面向真实任务的 AI 智能体。该集成强调速度与安全性,用于支撑企业级智能体工作流。
OpenAI 介绍如何用 ChatGPT 辅助写作,完成内容的起草、修改与润色,并保持清晰的结构、语气和意图。
OpenAI 发布提示词基础指南,讲解如何写出清晰有效的提示词,从而让 ChatGPT 给出更好、更有用的回答。
OpenAI 发布指南,介绍如何用 ChatGPT 做研究:收集来源、分析信息,并生成结构化、带引用的洞察。内容围绕研究工作流展开,未披露新模型版本或具体性能数据。
OpenAI 介绍如何用 ChatGPT 探索数据集、生成洞察并创建可视化,进而把分析结果转化为可执行的决策。
OpenAI 发布指南,介绍在使用 ChatGPT 等工具时兼顾安全、准确与透明的负责任 AI 使用最佳实践。内容面向用户,强调安全、准确性和透明度三方面的规范做法。
OpenAI 发布面向财务团队的 ChatGPT 实用工作流,覆盖财务分析、报告、规划与决策沟通四类场景。内容聚焦可直接落地的操作方式,帮助财务人员用 ChatGPT 完成从数据处理到汇报输出的日常工作。
ChatGPT 的 projects 功能可用于组织对话、文件与指令,管理持续推进的工作并提升协作效率。该功能帮助用户把相关聊天与资料归入同一项目,从而更有效地管理进行中的任务。
OpenAI 发文介绍临床医生如何使用 ChatGPT 支持诊断、文书撰写与患者护理。文中称相关 AI 工具具备安全性并符合 HIPAA 合规要求。
OpenAI 发布面向金融服务的 AI 资源集合,包含提示词包、GPTs、指南和工具,帮助机构安全部署并规模化应用 AI。
OpenAI 发布指南,介绍如何用 ChatGPT 的搜索和深度研究(deep research)功能做研究,以获取最新信息、分析来源并生成结构化洞察。
OpenAI 介绍营销团队如何用 ChatGPT 规划营销活动、创作内容、分析效果,并把洞察转化为行动。文章围绕实际 AI 工作流展开,未披露新模型版本或具体功能参数。
OpenAI 介绍管理者如何用 ChatGPT 准备沟通、撰写清晰反馈、保持条理并提升团队效能。内容涵盖对话准备、反馈撰写与日常组织等场景。
OpenAI 展示了旗下 ChatGPT、Codex 和 API 等产品在真实场景中的应用方式,覆盖工作、开发与日常任务。内容围绕这些产品如何将 AI 带入实际使用展开。
OpenAI 介绍 ChatGPT 的个性化方式:通过自定义指令和记忆功能,让回复更相关、更一致、更贴合个人需求。文章属于使用指南,未披露新模型版本或参数细节。
OpenAI 介绍运营团队如何使用 ChatGPT 简化工作流、改善协作、标准化流程并加快执行速度。
ChatGPT 支持通过清晰的提示词生成并迭代图像,用户可在几分钟内产出高质量视觉内容。教程涵盖提示词撰写、设计反复修改等环节。
OpenAI 发布 ChatGPT 技能使用指南,介绍如何创建和使用技能来构建可复用工作流、自动化重复性任务,并确保输出一致且高质量。
OpenAI 发布面向初学者的 AI 基础科普内容,讲解 AI 是什么、如何运作,以及 ChatGPT 这类工具如何使用大语言模型。内容定位为清晰易懂的人工智能入门指南。
OpenAI 就 Axios 供应链攻击作出回应,已轮换 macOS 代码签名证书并更新应用,同时确认没有用户数据遭到泄露。
OpenAI 介绍客户成功团队如何使用 ChatGPT 管理客户账户、改善沟通、降低流失率并推动产品采用与续约。
OpenAI 发布面向销售团队的 ChatGPT 工作流指南,覆盖客户调研、会议准备、外联触达、销售管道复盘与销售执行等实用场景。
OpenAI 介绍在 ChatGPT 中处理文件的实用方法,涵盖从查找信息到整理、转换文档并融入工作流。内容面向日常使用场景,帮助用户把文件用进 ChatGPT 的工作流程中。
OpenAI 介绍如何用 ChatGPT 做头脑风暴:发散想法、梳理思路,并把粗略概念转化为结构化、可执行的计划。
Google Research 推出 ConvApparel,一个包含 4000 多组人机多轮对话(近 15000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类行为的真实感差距。
CyberAgent 借助 ChatGPT Enterprise 和 Codex 在广告、媒体与游戏业务中安全扩大 AI 应用,提升质量并加快决策。该案例展示了 OpenAI 企业级产品在跨业务场景下的落地方式。
Overworld 发布实时视频世界模型 Waypoint-1.5,在 RTX 3090 至 5090 等桌面硬件上可生成最高 720p、60 FPS 的实时环境,并新增面向更广消费级硬件的 360p 版本。
推荐理由:Waypoint-1.5 把实时生成世界模型下放到消费级显卡,读者可据此判断本地交互式世界生成的硬件门槛。
Sentence Transformers 发布 v5.4,可在同一套 API 中编码和比较文本、图像、音频与视频,并支持多模态重排模型。新增能力覆盖跨模态相似度、encode_query/encode_document 检索流程以及先检索后重排的 RAG 模式,官方同时列出了 Qwen3-VL、NVIDIA Nemotron、BGE-VL 等已支持模型。
推荐理由:官方给出 v5.4 多模态嵌入与重排的完整用法和模型清单,可据此判断跨模态检索的落地路径。
Google 发布两款学术智能体:PaperVizAgent 负责生成论文配图,ScholarPeer 负责自动同行评审。PaperVizAgent 由检索、规划、风格、可视化、评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any,是唯一超过 50.0 人类基线的框架。