Hugging Face Blog·· 2025-04-16AI 评分42
HELMET:全面评估长上下文语言模型的基准
Introducing HELMET: Holistically Evaluating Long-context Language Models
AI 导读
Hugging Face 发布 HELMET(How to Evaluate Long-Context Models Effectively and Thoroughly),一个从多样性、可控性和可靠性三方面改进的长上下文语言模型评测基准,已评估 59 个近期 LCLM。
来源:Hugging Face Blog · huggingface.co