Hugging Face 发布目标检测排行榜:详解 IoU、AP、AR 等评估指标
Hugging Face 推出目标检测排行榜(Object Detection Leaderboard),对 Hub 上的目标检测模型按指标进行排名。该榜单基于 IoU、Average Precision(AP)和 Average Recall(AR)等指标评估模型,并详解了这些指标的计算方法及评估中可能出现的分歧与陷阱,帮助开发者挑选适合自身应用的开源模型。
Hugging Face 推出目标检测排行榜(Object Detection Leaderboard),对 Hub 上的目标检测模型按指标进行排名。该榜单基于 IoU、Average Precision(AP)和 Average Recall(AR)等指标评估模型,并详解了这些指标的计算方法及评估中可能出现的分歧与陷阱,帮助开发者挑选适合自身应用的开源模型。
Hugging Face 发文解释 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数为何明显低于 LLaMA 论文中的数字。
推荐理由:同一份 MMLU 数据集在三种实现下分数与排名都不同,读者可据此理解评测数字为何不可直接横向比较。
Hugging Face 通过扩展 Open LLM Leaderboard 评估套件,对比了 GPT-4 自动评估与 Scale AI 人类标注在开源指令模型上的偏好排序。
Hugging Face 发布开源工具 AI vs. AI,用于在多智能体环境中对强化学习模型进行排名。该工具托管于 Spaces,通过匹配算法让模型持续对战,并基于 ELO 评分系统(初始 1200 分)在 Leaderboard 上展示排名,用户将训练好的模型推送到 Hub 即可参与评估。
Habana Gaudi2 在 BERT 预训练和 Stable Diffusion 推理上约为 Nvidia A100 80GB 的两倍速度。BERT 预训练中 Gaudi2 吞吐达 1580.2 samples/s(BS=32),A100 为 981.6;Stable Diffusion 推理延迟 0.925s/img,A100 为 2.63s。
Hugging Face 为 🤗 Evaluate 库新增偏见评估指标,可对 GPT-2、BLOOM 等因果语言模型进行基于提示词的偏见检测。工作流分两步:用 🤗 Datasets 上的预设提示词生成文本,再用 🤗 Evaluate 的指标打分,覆盖 Toxicity、Polarity、Hurtfulness 三类任务。
Hugging Face 发布 MTEB,一个衡量文本嵌入模型在多种嵌入任务上表现的基准,包含 8 类任务、56 个数据集,覆盖最多 112 种语言,榜单已汇总超过 2000 条结果。
推荐理由:MTEB 把 56 个数据集、8 类任务和 112 种语言汇总到同一榜单,读者可据此理解文本嵌入模型的评测维度与取舍。
Hugging Face 发布 Evaluation on the Hub,由 AutoTrain 驱动,无需写代码即可对 Hub 上任意因果语言模型做零样本评估,目前支持最高 660 亿参数模型,更大模型的支持即将推出。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集和指标评测模型。评测结果会以 PR 形式写入模型卡的元数据,并可在数据集页查看排行榜;官方已用该工具评测数百个模型并提交了对应 PR。工具支持为任务寻找最佳模型、在新数据集上跑基线、以及用多个相关数据集评测自己的模型三种场景。
推荐理由:Hugging Face 把模型评测做成 Hub 上的一键流程,读者可了解免代码评测与结果写入模型卡的做法。
OpenAI Five 在一场三局两胜的比赛中击败了由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的 99.95 百分位 Dota 玩家队伍,其中四人曾打过职业 Dota。比赛在 10 万名同时在线观众面前现场进行。