Hugging Face Blog·· 2023-12-01AI 评分36
Open LLM Leaderboard 深度解析 DROP 基准评分异常
Open LLM Leaderboard: DROP deep dive
AI 导读
Hugging Face 对 Open LLM Leaderboard 新增的 DROP 基准进行深度排查,发现多数模型 f1-score 低于 10 分源于评测实现问题:数字后跟非空格空白字符时归一化失效,且以 . 作为停止符会截断浮点答案、让高质量模型因生成过长反而得分更低。改用 \n 作为停止符重新计算后,分数与模型整体表现的相关性明显改善。
来源:Hugging Face Blog · huggingface.co