跳到正文
12月10日周二
12月9日周一
12月5日周四
  1. OpenAI News62

    OpenAI 发布 o1 系统卡

    OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评估。

    推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评估流程,可了解其安全评估框架。

12月4日周三
  1. Hugging Face Blog22

    Hugging Face 推出 AraGen:基于 3C3H 的阿拉伯语 LLM 生成式基准与排行榜

    Hugging Face 发布 AraGen,一个面向阿拉伯语 LLM 的生成式任务基准与排行榜,采用新的 3C3H 评估指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度打分。该排行榜采用动态评估策略,数据集与评估代码先进行三个月盲测再公开,随后更换新数据集,以缓解数据污染问题。

11月21日周四
11月20日周三
  1. Hugging Face Blog40

    BAAI 推出 FlagEval Debate:首个多语言 LLM 辩论竞赛平台

    BAAI 推出 FlagEval Debate 平台,让大模型以辩论形式正面对抗,目前支持中文、英文、阿拉伯文和韩文四种语言。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义参数功能,以解决静态评测和 Chatbot Arena 类平台缺乏区分度、模型孤立生成及投票偏差等问题。2024 年 Q3 的实验显示,当前多数模型已具备参与辩论的能力。

10月30日周三
10月23日周三
  1. Hugging Face Blog33

    CinePile 2.0:用对抗式精炼打造更强的长视频问答数据集

    Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式精炼方法改进数据质量。初版 CinePile 于 2024 年 5 月推出,含约 30 万训练样本和 5000 测试样本,人类表现曾超最佳商业视觉模型 25%、开源模型 65%。2.0 版与 Hugging Face 合作,针对退化问题、视觉依赖和难度评估等局限进行优化。

10月15日周二
10月10日周四
10月4日周五
  1. Hugging Face Blog38

    Hugging Face 推出 Open FinLLM Leaderboard:金融大模型专用评测榜单

    Hugging Face 发布 Open FinLLM Leaderboard,为金融场景提供专门的 LLM 评测框架,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类任务。榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集来自金融行业真实挑战,如信用评分、欺诈检测和股价走势预测。

10月1日周二
  1. Hugging Face Blog22

    Hugging Face 发布 BenCzechMark:首个捷克语 LLM 综合评测基准

    Hugging Face 推出 BenCzechMark,这是首个面向捷克语的大语言模型综合评测套件,包含 9 大类共 50 项任务,其中 90% 为原生非翻译内容。配套排行榜已收录 25 个以上不同规模的开源模型,任务覆盖阅读理解、事实知识、捷克语理解、数学推理、自然语言推理、命名实体识别、情感分析与文档检索等,并采用 Acc、EM、AUROC、Ppl 等指标评估。

9月23日周一
  1. Hugging Face Blog48

    Hugging Face 发布 FineVideo:4.3 万视频、3.4 千小时的开源视频数据集

    Hugging Face 构建了 FineVideo 数据集,包含 4.3 万个视频、总计 3.4 千小时,并配有丰富描述、叙事细节、场景切分和 QA 对。该数据集从 YouTube-Commons 的 190 万个英文视频出发,经词密度与视觉动态性过滤后,用 Gemini 1.5 Pro 和 GPT-4o 完成内容标注与结构化输出。

8月14日周三
8月13日周二
  1. OpenAI News60

    OpenAI 发布 SWE-bench Verified

    OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,用于更可靠地评估 AI 模型解决真实软件问题的能力。

    推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,可用于更可靠地比较模型解决真实软件问题的能力。

8月8日周四
7月25日周四
7月24日周三
7月18日周四
  1. Hugging Face Blog42

    Hugging Face 发布 Docmatix:面向文档视觉问答的超大规模数据集

    Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的数据集,包含 240 万张图像和 950 万对 Q/A,规模是此前数据集的 240 倍。该数据集由 PDFA 的 210 万份 PDF 转录文本经 Phi-3-small 生成 Q/A,并过滤掉 15% 的幻觉样本。用其微调 Florence-2 后,DocVQA 性能相对提升近 20%。

7月17日周三
7月11日周四
  1. Hugging Face Blog60

    NuminaMath 如何赢得首届 AIMO 进步奖

    Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 两阶段微调,先做 CoT 数据训练,再用 GPT-4 生成的约 6 万个工具集成推理样本训练模型调用 Python REPL。

    推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛或微调任务。

7月1日周一
  1. Hugging Face Blog62

    Hugging Face 的 Transformers Code Agent 登顶 GAIA 基准

    Hugging Face 用基于 transformers.agents 的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。

    推荐理由:Hugging Face 用 Code Agent 在 GAIA 上取得领先,并公开了工具、执行沙箱与规划策略的实现细节。

6月20日周四
6月18日周二
6月6日周四
5月24日周五
  1. Hugging Face Blog47

    Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架

    Meta 发布 CyberSecEval 2,用于评估 LLM 生成不安全代码、协助网络攻击、被提示词注入操纵以及滥用代码解释器的风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。测试还显示提示词注入仍是未解决问题,LLM 目前难以可靠完成端到端漏洞利用。

5月14日周二
5月5日周日
4月30日周二
4月23日周二
4月22日周一
4月20日周六
4月19日周五
4月16日周二
3月20日周三
3月15日周五
  1. Hugging Face Blog40

    Hugging Face 发布 WebSight 数据集,用视觉语言模型将网页截图转为 HTML 代码

    Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码,v0.1 版包含 823,000 对 HTML 代码与对应截图,v0.2 版改用真实图像和 Tailwind CSS 并扩展至 200 万样本。基于该数据集微调的视觉语言模型 Sightseer 能将网页截图转为可用的 HTML 代码,并支持在生成代码中嵌入与原截图相近的图像。