UCLA 发布 ConTextual:多模态模型在文本密集场景中的图文联合推理评测基准
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多数领域表现明显落后。用 OCR 或图像描述增强 LLM 的方案人类通过率仅 17.2%。
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多数领域表现明显落后。用 OCR 或图像描述增强 LLM 的方案人类通过率仅 17.2%。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后听两个模型朗读并投票选出更自然的一个,投票前不显示模型名称。
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,系统测试前沿模型在高质量人类越狱攻击下的鲁棒性。该基准整合 AdvBench、AART、Beavertails、Do Not Answer 等红队数据集,用 LlamaGuard 与 GPT-4 判定回答是否安全,并按伤害与暴力、犯罪、隐私等违规类别细分评分。
Upstage 在 Hugging Face 上发起 Open Ko-LLM Leaderboard,为韩语大模型提供公开评测平台,采用 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA、Ko-CommonGEN V2 五项任务,并使用不公开的私有测试集防止数据污染。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,用计算复杂度类别评估 LLM 推理能力。
Patronus 团队联合 Hugging Face 发布 Enterprise Scenarios Leaderboard,用于评估语言模型在真实企业场景中的表现。
Hugging Face 推出 Hallucinations Leaderboard,通过 in-context learning 在 NQ Open、TriviaQA、TruthfulQA、XSum、CNN/DM、RACE、SQuADv2、FEVER、HaluEval 等基准上评测大语言模型的幻觉表现。
Hugging Face 推出 LLM Safety Leaderboard,基于 DecodingTrust 的 red-teaming 方法对 LLM 安全性进行评估,该平台曾获 NeurIPS 2023 杰出论文奖。
Hugging Face 发布博客,介绍如何用 LangChain 新集成的 ChatHuggingFace 封装把开源模型搭建成 ReAct 智能体,并给出完整代码示例。
推荐理由:原文给出 ReAct 智能体的完整搭建代码与开源模型对比基准,可据此判断哪些模型适合驱动智能体工作流。
Vectara 基于 Hugging Face 开源排行榜模板发布了新的 HHEM 排行榜,用于评估 GPT-4、Google Gemini、Meta Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜通过 requests 和 results 两个数据集管理模型评测请求与结果,并支持社区提交新模型进行评估。
Hugging Face 对 Open LLM Leaderboard 新增的 DROP 基准进行深度排查,发现多数模型 f1-score 低于 10 分源于评测实现问题:数字后跟非空格空白字符时归一化失效,且以 . 作为停止符会截断浮点答案、让高质量模型因生成过长反而得分更低。改用 \n 作为停止符重新计算后,分数与模型整体表现的相关性明显改善。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模、四种 EC2 实例(含 NVIDIA A10G 与 A100 40GB)及 1/5/10/20 并发请求,并对比了 GPTQ 4-bit 量化效果。
Hugging Face 推出目标检测排行榜(Object Detection Leaderboard),对 Hub 上的目标检测模型按指标进行排名。该榜单基于 IoU、Average Precision(AP)和 Average Recall(AR)等指标评估模型,并详解了这些指标的计算方法及评估中可能出现的分歧与陷阱,帮助开发者挑选适合自身应用的开源模型。
Hugging Face 发文解释 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数为何明显低于 LLaMA 论文中的数字。
推荐理由:同一份 MMLU 数据集在三种实现下分数与排名都不同,读者可据此理解评测数字为何不可直接横向比较。
Hugging Face 通过扩展 Open LLM Leaderboard 评估套件,对比了 GPT-4 自动评估与 Scale AI 人类标注在开源指令模型上的偏好排序。
Hugging Face 发布开源工具 AI vs. AI,用于在多智能体环境中对强化学习模型进行排名。该工具托管于 Spaces,通过匹配算法让模型持续对战,并基于 ELO 评分系统(初始 1200 分)在 Leaderboard 上展示排名,用户将训练好的模型推送到 Hub 即可参与评估。
Habana Gaudi2 在 BERT 预训练和 Stable Diffusion 推理上约为 Nvidia A100 80GB 的两倍速度。BERT 预训练中 Gaudi2 吞吐达 1580.2 samples/s(BS=32),A100 为 981.6;Stable Diffusion 推理延迟 0.925s/img,A100 为 2.63s。
Hugging Face 为 🤗 Evaluate 库新增偏见评估指标,可对 GPT-2、BLOOM 等因果语言模型进行基于提示词的偏见检测。工作流分两步:用 🤗 Datasets 上的预设提示词生成文本,再用 🤗 Evaluate 的指标打分,覆盖 Toxicity、Polarity、Hurtfulness 三类任务。
Hugging Face 发布 MTEB,一个衡量文本嵌入模型在多种嵌入任务上表现的基准,包含 8 类任务、56 个数据集,覆盖最多 112 种语言,榜单已汇总超过 2000 条结果。
推荐理由:MTEB 把 56 个数据集、8 类任务和 112 种语言汇总到同一榜单,读者可据此理解文本嵌入模型的评测维度与取舍。
Hugging Face 发布 Evaluation on the Hub,由 AutoTrain 驱动,无需写代码即可对 Hub 上任意因果语言模型做零样本评估,目前支持最高 660 亿参数模型,更大模型的支持即将推出。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集和指标评测模型。评测结果会以 PR 形式写入模型卡的元数据,并可在数据集页查看排行榜;官方已用该工具评测数百个模型并提交了对应 PR。工具支持为任务寻找最佳模型、在新数据集上跑基线、以及用多个相关数据集评测自己的模型三种场景。
推荐理由:Hugging Face 把模型评测做成 Hub 上的一键流程,读者可了解免代码评测与结果写入模型卡的做法。
OpenAI Five 在一场三局两胜的比赛中击败了由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的 99.95 百分位 Dota 玩家队伍,其中四人曾打过职业 Dota。比赛在 10 万名同时在线观众面前现场进行。