Anthropic 发布 Claude 2.1,上下文扩至 200K token 并新增工具调用
Introducing Claude 2.1
Anthropic 发布 Claude 2.1,已在 API、Console 和 claude.ai 上线,上下文窗口翻倍至 200,000 token,约合 15 万词或 500 页以上材料。
官方给出 200K 上下文、幻觉率减半与工具调用三项能力变化,可据此判断长文档与企业集成场景的可用性。

我们最新的模型 Claude 2.1 现已在我们的 Console 中通过 API 提供,并为我们的 claude.ai 聊天体验提供支持。Claude 2.1 在企业关键能力方面实现了进步——包括业界领先的 200K token 上下文窗口、模型幻觉率的显著降低、系统提示以及我们的新测试版功能:工具使用。我们还在更新我们的 定价,以提高各模型对客户的成本效率。
200K 上下文窗口
自今年早些时候推出以来,Claude 已被数百万人用于各种应用——从翻译学术论文到起草商业计划和分析复杂合同。在与用户的讨论中,他们要求在处理长文档时提供更大的上下文窗口和更准确的输出。
作为回应,我们将你可以传递给 Claude 的信息量翻倍,上限为 200,000 个 token,相当于约 150,000 个单词,或超过 500 页的材料。我们的用户现在可以上传技术文档,如整个代码库、财务报表如 S-1,甚至像《伊利亚特》或《奥德赛》这样的长篇文学作品。通过能够与大量内容或数据对话,Claude 可以总结、进行问答、预测趋势、比较和对比多个文档等等。
处理 200K 长度的消息是一项复杂的壮举,也是行业首创。虽然我们很高兴能将这一强大的新能力交到用户手中,但通常需要人类数小时努力才能完成的任务,Claude 可能只需几分钟。我们预计随着技术的进步,延迟将大幅降低。
幻觉率降低 2 倍
Claude 2.1 在诚实性方面也取得了显著进步,与之前的 Claude 2.0 模型相比,虚假陈述减少了 2 倍。这使企业能够构建高性能的 AI 应用,解决具体的业务问题,并以更高的信任度和可靠性在其运营中部署 AI。
我们通过整理大量复杂的、事实性的问题来测试 Claude 2.1 的诚实性,这些问题探究了当前模型的已知弱点。使用一个区分错误断言(“玻利维亚第五大人口城市是蒙特罗”)与承认不确定性(“我不确定玻利维亚第五大人口城市是什么”)的评分标准,Claude 2.1 显著更有可能拒绝回答,而不是提供错误信息。

Claude 2.1 在理解和总结方面也取得了有意义的改进,特别是对于需要高度准确性的长篇复杂文档,如法律文件、财务报告和技术规范。在我们的评估中,Claude 2.1 表现出错误答案减少 30%,以及错误地得出文档支持某一特定主张的比率降低 3-4 倍。

虽然我们对这些准确性改进感到鼓舞,但提高用户输出的精确性和可靠性仍然是我们产品和研究团队的首要任务。
API 工具使用
应大众需求,我们还添加了工具使用,这是一项新的测试版功能,允许 Claude 与用户现有的流程、产品和 API 集成。这种扩展的互操作性旨在使 Claude 在用户的日常运营中更加有用。
Claude 现在可以跨开发者定义的函数或 API 进行编排,搜索网络来源,并从私有知识库中检索信息。用户可以定义一组供 Claude 使用的工具并指定一个请求。模型随后会决定完成任务需要哪个工具,并代表用户执行操作,例如:
- 使用计算器进行复杂的数值推理
- 将自然语言请求转换为结构化 API 调用
- 通过搜索数据库或使用网络搜索 API 来回答问题
- 通过私有 API 在软件中执行简单操作
- 连接产品数据集以提供推荐并帮助用户完成购买
工具使用目前处于早期开发阶段——我们正在构建开发者功能并编写提示指南,以便更轻松地集成到您的应用程序中。我们鼓励用户分享关于工具使用的反馈,以帮助塑造和改进产品。
开发者体验
我们一直在努力简化 Claude API 用户的开发者 Console 体验,同时让测试新提示变得更加容易,以便更快地学习。我们全新的 Workbench 产品让开发者能够在游乐场式的体验中迭代提示,并访问新的模型设置以优化 Claude 的行为。他们可以创建多个提示并在不同项目之间切换,修订内容会随着操作被保存,以保留历史上下文。开发者还可以生成代码片段,以便直接在我们的某个 SDK 中使用他们的提示。
我们还推出了 系统提示,允许用户向 Claude 提供自定义指令以提升性能。系统提示设定了有用的上下文,增强 Claude 采用指定个性和角色的能力,或以更可定制、更一致的方式按照用户需求组织回复。
Claude 2.1 现已在我们的 API 中可用,并且也为我们在 claude.ai 的聊天界面提供支持,涵盖免费和 Pro 层级。200K token 上下文窗口的使用保留给 Claude Pro 用户,他们现在可以上传比以往更大的文件。在我们努力构建业内最安全、技术最先进的 AI 系统之际,我们迫不及待地想看到这些新功能所激发的用例。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口
Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的批次已经启动。
Barclays 扩展 Claude 以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球运营中集成安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:Claude 仅在我们的科学家提供高层指导的情况下,发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com