跳到正文
1月9日周四
  1. Hugging Face Blog36

    Hugging Face Open LLM Leaderboard 揭示模型推理的 CO₂ 排放与性能关系

    Hugging Face 在 Open LLM Leaderboard 中引入 CO₂ 排放估算,基于 2742 个模型的推理数据发现,社区微调模型普遍比其官方基础模型更低碳。70B 参数级别中,Qwen2.5 和 Llama3.1 的官方微调耗能约为基础模型的两倍,而 MoE 架构模型的排行榜得分与排放比整体偏低。

12月24日周二
  1. Hugging Face Blog62

    如何在 PyTorch 中可视化并理解 GPU 显存占用

    Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录显存快照、导出 profile.pkl 并在 pytorch.org/memory_viz 可视化,逐步拆解模型创建、前向、反向和优化器各阶段的显存变化。

    推荐理由:原文给出 PyTorch 显存快照的可视化步骤与显存估算公式,读者可据此定位训练中的显存峰值来源。

12月19日周四
  1. Hugging Face Blog73

    Answer.AI 与 LightOn 发布 ModernBERT,替代 BERT 的编码器模型

    Answer.AI 与 LightOn 发布 ModernBERT,一个仅编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个版本,支持 8192 token 上下文,可作 BERT 类模型的直接替换。

    推荐理由:ModernBERT 以 8k 上下文和更快推理替换 BERT 类编码器,读者可据此判断 RAG 与代码检索的升级空间。

12月17日周二
12月16日周一
12月10日周二
12月9日周一
12月4日周三
  1. Hugging Face Blog22

    Hugging Face 推出 AraGen:基于 3C3H 的阿拉伯语 LLM 生成式基准与排行榜

    Hugging Face 发布 AraGen,一个面向阿拉伯语 LLM 的生成式任务基准与排行榜,采用新的 3C3H 评估指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度打分。该排行榜采用动态评估策略,数据集与评估代码先进行三个月盲测再公开,随后更换新数据集,以缓解数据污染问题。

12月3日周二
11月20日周三
  1. Hugging Face Blog40

    BAAI 推出 FlagEval Debate:首个多语言 LLM 辩论竞赛平台

    BAAI 推出 FlagEval Debate 平台,让大模型以辩论形式正面对抗,目前支持中文、英文、阿拉伯文和韩文四种语言。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义参数功能,以解决静态评测和 Chatbot Arena 类平台缺乏区分度、模型孤立生成及投票偏差等问题。2024 年 Q3 的实验显示,当前多数模型已具备参与辩论的能力。

  2. Hugging Face Blog36

    Hugging Face 与 LLM-jp 联合推出日语 LLM 开放排行榜

    Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件在 16 项任务上评估日语大语言模型,涵盖自然语言推理、机器翻译、摘要、问答、代码生成、数学推理和考试题等,任务以 4-shot 方式运行。数据集由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译调整,部分任务需要长上下文推理。

11月12日周二
  1. Hugging Face Blog22

    Hugging Face Hub 开放数据集托管与分享功能

    Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用。

11月4日周一
  1. Hugging Face Blog38

    Argilla 2.4 发布:无需代码即可在 Hugging Face Hub 上构建微调与评测数据集

    Argilla 2.4 推出无需代码的数据集构建功能,用户可直接从 Hugging Face Hub 导入数据集、定义问题并收集人工反馈。该功能支持公开数据集导入,默认启用 Hugging Face OAuth,社区用户可直接参与标注,整个流程不到 5 分钟。Argilla 是 Hugging Face 旗下免费开源的数据中心工具,目前仅支持公开数据集,私有数据集支持仍在征询反馈中。

10月24日周四
10月23日周三
  1. Hugging Face Blog33

    CinePile 2.0:用对抗式精炼打造更强的长视频问答数据集

    Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式精炼方法改进数据质量。初版 CinePile 于 2024 年 5 月推出,含约 30 万训练样本和 5000 测试样本,人类表现曾超最佳商业视觉模型 25%、开源模型 65%。2.0 版与 Hugging Face 合作,针对退化问题、视觉依赖和难度评估等局限进行优化。

10月16日周三
10月9日周三
10月5日周六
  1. Hugging Face Blog22

    Hugging Face 如何改进 Hub 上 Parquet 文件的去重效率

    Hugging Face 的 Xet 团队针对 Hub 上超 2.2PB 的 Parquet 存储测试了去重表现:追加 1 万行可去重 99.1%,仅需额外 20MB;但修改一行因列头含绝对偏移量只去重 89%,需额外 230MB,删除一行则导致后半文件全部重写。团队提出改用相对偏移量、对行组做内容定义分块(CDC)等改进思路,并希望与 Apache Arrow 社区合作落地。

10月4日周五
  1. Hugging Face Blog38

    Hugging Face 推出 Open FinLLM Leaderboard:金融大模型专用评测榜单

    Hugging Face 发布 Open FinLLM Leaderboard,为金融场景提供专门的 LLM 评测框架,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类任务。榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集来自金融行业真实挑战,如信用评分、欺诈检测和股价走势预测。

10月1日周二
9月23日周一
  1. Hugging Face Blog22

    Hugging Face Daily Papers 页面功能全解析

    Hugging Face 的 Daily Papers 页面已收录超过 3,700 篇论文、订阅数突破 12k,作者可一键认领论文并关联到自己的账号。该页面还支持所有用户提交论文、在评论区与作者直接讨论、通过 @librarian-bot 推荐相似论文,以及多语言评论与内置翻译。论文页右侧集中展示关联的模型、数据集和 demo,用户可通过点赞支持论文,并订阅每日(周末除外)论文更新邮件。

  2. Hugging Face Blog48

    Hugging Face 发布 FineVideo:4.3 万视频、3.4 千小时的开源视频数据集

    Hugging Face 构建了 FineVideo 数据集,包含 4.3 万个视频、总计 3.4 千小时,并配有丰富描述、叙事细节、场景切分和 QA 对。该数据集从 YouTube-Commons 的 190 万个英文视频出发,经词密度与视觉动态性过滤后,用 Gemini 1.5 Pro 和 GPT-4o 完成内容标注与结构化输出。

9月17日周二
8月27日周二
8月21日周三
8月14日周三
8月8日周四
  1. Hugging Face Blog62

    Hugging Face 收购 XetHub,将用其技术替换 Hub 的 Git LFS 存储后端

    Hugging Face 宣布收购西雅图公司 XetHub,其 12 人团队将加入,创始人此前在 Apple 构建并扩展内部 ML 基础设施。XetHub 的技术让 Git 可扩展到 TB 级仓库,HF CTO Julien Chaumond 表示团队将帮助 Hub 把存储后端换成自研的 LFS 替代方案。

    推荐理由:Hugging Face 收购 XetHub 并计划替换 Hub 的 Git LFS 存储后端,读者可了解大文件版本管理将如何变化。

8月6日周二
  1. Hugging Face Blog28

    Hugging Face 联合 Albumentations AI 推出文档图像 TextImage 数据增强

    Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像与文本标注,用于视觉语言模型微调。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合图像修复,避免缩放、模糊等常规变换损害文字提取精度。初版已移除同义词替换以降低时间开销,可通过 pip 安装 albumentations 使用。

7月18日周四
  1. Hugging Face Blog42

    Hugging Face 发布 Docmatix:面向文档视觉问答的超大规模数据集

    Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的数据集,包含 240 万张图像和 950 万对 Q/A,规模是此前数据集的 240 倍。该数据集由 PDFA 的 210 万份 PDF 转录文本经 Phi-3-small 生成 Q/A,并过滤掉 15% 的幻觉样本。用其微调 Florence-2 后,DocVQA 性能相对提升近 20%。

7月16日周二
7月11日周四
  1. Hugging Face Blog60

    NuminaMath 如何赢得首届 AIMO 进步奖

    Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 两阶段微调,先做 CoT 数据训练,再用 GPT-4 生成的约 6 万个工具集成推理样本训练模型调用 Python REPL。

    推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛或微调任务。

7月10日周三
  1. Hugging Face Blog36

    Hugging Face 在 Dataset Hub 上用 Presidio 试验 PII 自动检测

    Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,用户可查看数据集 PII 含量报告,以便在训练前决定是否进一步过滤。该功能面向含 PII 的标注数据集和大规模预训练数据集,后者虽经过滤仍可能残留少量敏感信息。数据集所有者也可用报告验证发布前的 PII 过滤流程。

7月8日周一
  1. Hugging Face Blog25

    Hugging Face 为 Dataset Hub 推出四项数据集搜索新功能

    Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按文本、图像、音频等模态及行数区间检索,并支持 Parquet、WebDataset 等格式和 Pandas、Dask、Datasets 库兼容性过滤。这些筛选可相互组合,并与语言、任务、许可证等已有过滤器及文本搜索栏搭配使用。

7月3日周三
6月25日周二
  1. Hugging Face Blog22

    XLSCOUT 推出 ParaEmbed 2.0:面向专利与 IP 的嵌入模型,获 Hugging Face 专家支持

    XLSCOUT 发布专有嵌入模型 ParaEmbed 2.0,基于 Hugging Face 专家支持计划合作,在多领域专利数据上微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。该模型用于专利撰写、无效检索和新颖性比对,借助 Hugging Face Inference Endpoints 与 TEI,嵌入吞吐从约 300 个/秒提升至约 2700 个/秒。

6月24日周一
  1. Hugging Face Blog22

    Hugging Face 伦理与社会通讯 #6:构建更好的 AI,数据质量为何至关重要

    Hugging Face 发布《伦理与社会通讯 #6》,聚焦 AI 数据质量,提出高质量数据应满足相关性、全面性、时效性和偏见缓解等要求。文章以 Reddit 与 Google 的 RAG 搜索合作为例,说明低质数据会导致"披萨加胶水"这类错误推荐。文中强调数据质量需贯穿 AI 开发全生命周期,并给出数据去重、内容过滤、人工反馈和治理框架等实践策略。

6月20日周四