Sierra 发布 𝜏-bench:评测真实场景下的 AI 智能体
Sierra 研究团队发布 𝜏-bench 基准,用于评测 AI 智能体在动态用户与工具交互中的表现和可靠性,包含 𝜏-retail 和 𝜏-airline 两个领域。
推荐理由:Sierra 提出面向真实场景的智能体评测基准,并给出 12 个模型在规则遵循与可靠性上的实测表现。
技术方向
模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。
105 条精选近 30 天 23 条共收录 353 条
Sierra 研究团队发布 𝜏-bench 基准,用于评测 AI 智能体在动态用户与工具交互中的表现和可靠性,包含 𝜏-retail 和 𝜏-airline 两个领域。
推荐理由:Sierra 提出面向真实场景的智能体评测基准,并给出 12 个模型在规则遵循与可靠性上的实测表现。
Mistral AI 开放其首个平台服务 la plateforme 的 beta 访问,提供三个对话端点和一个嵌入端点。
推荐理由:Mistral AI 开放首个平台服务测试,给出三个对话端点和嵌入端点的模型、价格与基准表现,可据此判断其早期 API 能力边界。
Anthropic 发布 Claude 2.1,已在 API、Console 和 claude.ai 上线,上下文窗口翻倍至 200,000 token,约合 15 万词或 500 页以上材料。
推荐理由:官方给出 200K 上下文、幻觉率减半与工具调用三项能力变化,可据此判断长文档与企业集成场景的可用性。
Hugging Face 在 huggingface.js 下发布 Agents.js,一个可在浏览器或服务端为 LLM 提供工具访问的 JavaScript 库,通过 npm install @huggingface/agents 安装。
推荐理由:原文给出库的安装方式、代码示例与自定义工具接口,读者可据此判断如何在浏览器或服务端为 LLM 接入工具。
OpenAI 宣布为 ChatGPT 实现插件的初步支持。插件是专为语言模型设计的工具,以安全为核心原则,可帮助 ChatGPT 获取最新信息、执行计算或调用第三方服务。
推荐理由:OpenAI 官方给出 ChatGPT 插件机制的初步支持,读者可据此了解模型接入外部信息与服务的早期形态。