Artificial Analysis 发布 Big Bench Audio:评估音频语言模型的推理能力
Artificial Analysis 发布 Big Bench Audio,一个从 Big Bench Hard 改编的音频推理评测数据集,含 1000 道音频题,覆盖 Formal Fallacies、Navigate、Object Counting、Web of Lies 四类各 250 题。
Artificial Analysis 发布 Big Bench Audio,一个从 Big Bench Hard 改编的音频推理评测数据集,含 1000 道音频题,覆盖 Formal Fallacies、Navigate、Object Counting、Web of Lies 四类各 250 题。
Hugging Face 用 Keras、JAX 和 TPU 搭建了一个 chatbot arena,测试 LLM 在被指出错误后能否修正代码。实验在 TPU v5e 2x4 上以 bfloat16 同时加载了 7 个模型(5 个约 8B 参数、3 个约 2B 参数),场景是把自然语言日历请求翻译成 Python API 调用。
Morgan Stanley 正借助 AI 评估(AI evals)推动金融服务领域的变革。该机构将 AI 评估用于塑造金融服务的未来方向。
Hugging Face 发布 AraGen,一个面向阿拉伯语 LLM 的生成式任务基准与排行榜,采用新的 3C3H 评估指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度打分。该排行榜采用动态评估策略,数据集与评估代码先进行三个月盲测再公开,随后更换新数据集,以缓解数据污染问题。
BAAI 推出 FlagEval Debate 平台,让大模型以辩论形式正面对抗,目前支持中文、英文、阿拉伯文和韩文四种语言。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义参数功能,以解决静态评测和 Chatbot Arena 类平台缺乏区分度、模型孤立生成及投票偏差等问题。2024 年 Q3 的实验显示,当前多数模型已具备参与辩论的能力。
Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件在 16 项任务上评估日语大语言模型,涵盖自然语言推理、机器翻译、摘要、问答、代码生成、数学推理和考试题等,任务以 4-shot 方式运行。数据集由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译调整,部分任务需要长上下文推理。
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 裁判的评分和理由进行投票对比的平台,投票结果汇总为 Elo 排行榜并每小时更新。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开放权重多模态模型,含 1B 参数视觉编码器和 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:官方给出 Pixtral Large 的基准成绩与开放权重,读者可据此判断开源多模态模型与闭源前沿的差距。
OpenAI 发布名为 SimpleQA 的事实性基准,用于衡量语言模型回答简短事实型问题的能力。该基准聚焦短小、寻求事实的提问场景,评估模型的事实准确性。
CGIAR 与 Digital Green 在 Hugging Face 专家支持下为农业问答机器人 Farmer.chat 搭建了 LLM-as-a-Judge 评估体系,用于衡量 RAG 回答的质量、简洁度与准确性。
OpenAI 推出 MLE-bench,用于衡量 AI 智能体在机器学习工程任务上的表现。该基准测试评估智能体完成机器学习工程工作的能力。
Hugging Face 发布 Open FinLLM Leaderboard,为金融场景提供专门的 LLM 评测框架,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类任务。榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集来自金融行业真实挑战,如信用评分、欺诈检测和股价走势预测。
Hugging Face 推出 BenCzechMark,这是首个面向捷克语的大语言模型综合评测套件,包含 9 大类共 50 项任务,其中 90% 为原生非翻译内容。配套排行榜已收录 25 个以上不同规模的开源模型,任务覆盖阅读理解、事实知识、捷克语理解、数学推理、自然语言推理、命名实体识别、情感分析与文档检索等,并采用 Acc、EM、AUROC、Ppl 等指标评估。
OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,用于更可靠地评估 AI 模型解决真实软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,可用于更可靠地比较模型解决真实软件问题的能力。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现。
Hugging Face 用基于 transformers.agents 的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:Hugging Face 用 Code Agent 在 GAIA 上取得领先,并公开了工具、执行沙箱与规划策略的实现细节。
Hugging Face 发布 BigCodeBench,包含 1140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每项任务平均 5.6 个测试用例、分支覆盖率 99%。
Artificial Analysis 发布文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等主流开源与闭源模型。
Meta 发布 CyberSecEval 2,用于评估 LLM 生成不安全代码、协助网络攻击、被提示词注入操纵以及滥用代码解释器的风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。测试还显示提示词注入仍是未解决问题,LLM 目前难以可靠完成端到端漏洞利用。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),用于评估和比较阿拉伯语大语言模型性能,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体类型之外新增可基于历史观察迭代的 ReactAgent 等两类智能体,并加入共享功能。
推荐理由:官方给出新智能体框架的模块划分与 GAIA 榜单成绩,可据此判断开源智能体方案的可用性。
Hugging Face 发布希伯来语 LLM 开放排行榜,用于评估和提升希伯来语语言模型。该排行榜包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式,模型通过 HuggingFace Inference Endpoints 部署并由 lighteval 库评估。
Artificial Analysis 开发的 LLM 性能排行榜现已上线 Hugging Face,覆盖超过 100 个 serverless LLM API 端点,综合评估质量、价格与速度。
Hugging Face 排行榜与评测团队发现,同一 MMLU 任务仅改变提示词格式,5 个模型的得分波动约 10 分,Qwen1.5-7B 甚至从 51.2% 跌至 22.9%,模型排名也随之改变。为此他们与 .txt 合作,尝试用 Outlines 库的结构化生成约束模型输出,以减少提示词格式带来的评测方差。
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无链式推理提示时的准确率差值 Δ。该榜单覆盖 LogiQA、LSAT 等多项选择题任务,已实现 Classic 与 Reflect 两种提示策略,并称对训练数据污染更具鲁棒性。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 的医学与生物学子集。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,从 LeetCode、AtCoder、CodeForces 持续收集带发布日期的编程题,通过“随时间滚动”评估检测并防止数据污染。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试套取虚构银行 XYZ001 客户的敏感信息,再投票选出隐私保护更强的模型。
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感文本密集视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。首轮评测 13 个模型,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上不及人类;开源模型在多数领域表现明显落后。用 OCR 或图像描述增强 LLM 的方案人类通过率仅 17.2%。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后听两个模型朗读并投票选出更自然的一个,投票前不显示模型名称。
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,系统测试前沿模型在高质量人类越狱攻击下的鲁棒性。该基准整合 AdvBench、AART、Beavertails、Do Not Answer 等红队数据集,用 LlamaGuard 与 GPT-4 判定回答是否安全,并按伤害与暴力、犯罪、隐私等违规类别细分评分。
Upstage 在 Hugging Face 上发起 Open Ko-LLM Leaderboard,为韩语大模型提供公开评测平台,采用 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA、Ko-CommonGEN V2 五项任务,并使用不公开的私有测试集防止数据污染。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,用计算复杂度类别评估 LLM 推理能力。
Patronus 团队联合 Hugging Face 发布 Enterprise Scenarios Leaderboard,用于评估语言模型在真实企业场景中的表现。
Hugging Face 推出 Hallucinations Leaderboard,通过 in-context learning 在 NQ Open、TriviaQA、TruthfulQA、XSum、CNN/DM、RACE、SQuADv2、FEVER、HaluEval 等基准上评测大语言模型的幻觉表现。
Hugging Face 推出 LLM Safety Leaderboard,基于 DecodingTrust 的 red-teaming 方法对 LLM 安全性进行评估,该平台曾获 NeurIPS 2023 杰出论文奖。
Hugging Face 发布博客,介绍如何用 LangChain 新集成的 ChatHuggingFace 封装把开源模型搭建成 ReAct 智能体,并给出完整代码示例。
推荐理由:原文给出 ReAct 智能体的完整搭建代码与开源模型对比基准,可据此判断哪些模型适合驱动智能体工作流。
Vectara 基于 Hugging Face 开源排行榜模板发布了新的 HHEM 排行榜,用于评估 GPT-4、Google Gemini、Meta Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜通过 requests 和 results 两个数据集管理模型评测请求与结果,并支持社区提交新模型进行评估。
Hugging Face 对 Open LLM Leaderboard 新增的 DROP 基准进行深度排查,发现多数模型 f1-score 低于 10 分源于评测实现问题:数字后跟非空格空白字符时归一化失效,且以 . 作为停止符会截断浮点答案、让高质量模型因生成过长反而得分更低。改用 \n 作为停止符重新计算后,分数与模型整体表现的相关性明显改善。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模、四种 EC2 实例(含 NVIDIA A10G 与 A100 40GB)及 1/5/10/20 并发请求,并对比了 GPTQ 4-bit 量化效果。