跳到正文
Hugging Face Blog·· 2025-04-16AI 评分42

HELMET:全面评估长上下文语言模型的基准

Introducing HELMET: Holistically Evaluating Long-context Language Models

AI 导读

Hugging Face 发布 HELMET(How to Evaluate Long-Context Models Effectively and Thoroughly),一个从多样性、可控性和可靠性三方面改进的长上下文语言模型评测基准,已评估 59 个近期 LCLM。

来源:Hugging Face Blog · huggingface.co