用 100 个 LLaMA 3.1 8B 在 HumanEval 上追平 GPT-4o
Modal 团队用 LLaMA 3.1 8B Instruct 在 HumanEval 上做多次采样搜索,pass@100 达到 90.5%,略高于 GPT-4o 报告的 pass@1 90.2%,pass@1000 则升至 95.1%。
推荐理由:作者用不到 50 美元复现了搜索扩展的核心结论,读者可据此理解小模型靠多次采样逼近前沿模型的条件。
内容形态
模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。
130 条精选近 30 天 48 条共收录 567 条
Modal 团队用 LLaMA 3.1 8B Instruct 在 HumanEval 上做多次采样搜索,pass@100 达到 90.5%,略高于 GPT-4o 报告的 pass@1 90.2%,pass@1000 则升至 95.1%。
推荐理由:作者用不到 50 美元复现了搜索扩展的核心结论,读者可据此理解小模型靠多次采样逼近前沿模型的条件。
Hugging Face 用基于 transformers.agents 的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:Hugging Face 用 Code Agent 在 GAIA 上取得领先,并公开了工具、执行沙箱与规划策略的实现细节。
Anthropic 宣布一项新计划,资助第三方机构开发能有效衡量 AI 模型高级能力的评测,以缓解当前安全相关评测供不应求的局面。
推荐理由:Anthropic 公开了第三方模型评测的资助方向与优先级,可据此了解前沿实验室如何定义安全评测需求。
Sierra 研究团队发布 𝜏-bench 基准,用于评测 AI 智能体在动态用户与工具交互中的表现和可靠性,包含 𝜏-retail 和 𝜏-airline 两个领域。
推荐理由:Sierra 提出面向真实场景的智能体评测基准,并给出 12 个模型在规则遵循与可靠性上的实测表现。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体类型之外新增可基于历史观察迭代的 ReactAgent 等两类智能体,并加入共享功能。
推荐理由:官方给出新智能体框架的模块划分与 GAIA 榜单成绩,可据此判断开源智能体方案的可用性。
Hugging Face 发布博客,介绍如何用 LangChain 新集成的 ChatHuggingFace 封装把开源模型搭建成 ReAct 智能体,并给出完整代码示例。
推荐理由:原文给出 ReAct 智能体的完整搭建代码与开源模型对比基准,可据此判断哪些模型适合驱动智能体工作流。
Hugging Face 发文解释 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数为何明显低于 LLaMA 论文中的数字。
推荐理由:同一份 MMLU 数据集在三种实现下分数与排名都不同,读者可据此理解评测数字为何不可直接横向比较。
Hugging Face 发布 MTEB,一个衡量文本嵌入模型在多种嵌入任务上表现的基准,包含 8 类任务、56 个数据集,覆盖最多 112 种语言,榜单已汇总超过 2000 条结果。
推荐理由:MTEB 把 56 个数据集、8 类任务和 112 种语言汇总到同一榜单,读者可据此理解文本嵌入模型的评测维度与取舍。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集和指标评测模型。评测结果会以 PR 形式写入模型卡的元数据,并可在数据集页查看排行榜;官方已用该工具评测数百个模型并提交了对应 PR。工具支持为任务寻找最佳模型、在新数据集上跑基线、以及用多个相关数据集评测自己的模型三种场景。
推荐理由:Hugging Face 把模型评测做成 Hub 上的一键流程,读者可了解免代码评测与结果写入模型卡的做法。
OpenAI Five 在一场三局两胜的比赛中击败了由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的 99.95 百分位 Dota 玩家队伍,其中四人曾打过职业 Dota。比赛在 10 万名同时在线观众面前现场进行。