Hugging Face 推出 Open TTS Leaderboard:面向多语言 TTS 与声音克隆的可扩展评测
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的全球研究联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等开放 2800 多种病毒的蛋白复合物预测结构,读者可了解开放科学在疫情准备中的具体做法。
Hugging Face 博客介绍 DiScoFormer(Density and Score Transformer),一个无需重训练、单次前向传播即可从数据点集合同时估计分布密度与 score 的模型。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。
Google Research 发布 WAXAL 大规模开放语音数据集,覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音和超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,Google 提供方法指导。项目自 2021 年启动,Google 表示将持续扩充语言覆盖。
推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。
Hugging Face 的 Open ASR Leaderboard 新增多语言和长音频转录赛道,截至 2025 年 11 月 21 日已对比来自 18 个机构的 60+ 个开源与闭源模型、覆盖 11 个数据集。
Intel 与 Hugging Face 联合测试显示,在搭载 Intel Xeon 6 处理器(Granite Rapids)的 Google Cloud C4 虚拟机上运行 OpenAI GPT OSS 大模型,总拥有成本(TCO)较上一代 C3 实例提升 1.7 倍,即 70%。
NVIDIA 发布 Nemotron-Personas-Japan,一个面向日语 AI 的开放合成人格数据集,采用 CC BY 4.0 许可,可商用与非商用。数据集含 100 万条记录、每条 6 个人格,共 600 万个人格,约 14 亿 token,覆盖约 95 万个独特姓名和 1500 多个职业类别。
NVIDIA 发布 Nemotron Post-Training Dataset V2,将英文推理数据翻译为法语、西班牙语、德语、意大利语和日语五种语言,规模约 600 万条。
推荐理由:NVIDIA 公开了多语言推理数据集的构建流程与过滤细节,可据此判断合成后训练数据的翻译质量风险。
OpenAI 研究发布开放权重模型 gpt-oss 的最坏情况前沿风险,提出"恶意微调"(MFT)方法,通过微调让 gpt-oss 在生物学和网络安全两个领域尽可能发挥最大能力。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,称其为全球最大的开源自动驾驶数据集,R4 版本包含 100 万条 episode、5000+ 小时驾驶数据、90+ TB 规模,来自德国 30 座城市 60 辆驾校车辆的 6 路环视摄像头与车辆状态数据。
推荐理由:L2D 以 90TB 多模态驾驶数据接入 LeRobot 训练管线,可对比现有开源自驾数据集在规模与动作标注上的差异。
Hugging Face 联合 2A2I、TII 推出 Open Arabic LLM Leaderboard 2,升级阿拉伯语大模型评测榜。首版 OALL 上线不到 7 个月吸引超 46,000 名访客,收到 700 多个模型提交,参数规模从 1B 到 70B 以上,来自 180 多个机构。新版回应社区对阿拉伯语专项任务、评测透明度与数据集多样性的批评。
Artificial Analysis 发布文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等主流开源与闭源模型。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),用于评估和比较阿拉伯语大语言模型性能,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布希伯来语 LLM 开放排行榜,用于评估和提升希伯来语语言模型。该排行榜包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式,模型通过 HuggingFace Inference Endpoints 部署并由 lighteval 库评估。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后听两个模型朗读并投票选出更自然的一个,投票前不显示模型名称。
Upstage 在 Hugging Face 上发起 Open Ko-LLM Leaderboard,为韩语大模型提供公开评测平台,采用 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA、Ko-CommonGEN V2 五项任务,并使用不公开的私有测试集防止数据污染。
Hugging Face 对 Open LLM Leaderboard 新增的 DROP 基准进行深度排查,发现多数模型 f1-score 低于 10 分源于评测实现问题:数字后跟非空格空白字符时归一化失效,且以 . 作为停止符会截断浮点答案、让高质量模型因生成过长反而得分更低。改用 \n 作为停止符重新计算后,分数与模型整体表现的相关性明显改善。
Hugging Face 发文解释 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数为何明显低于 LLaMA 论文中的数字。
推荐理由:同一份 MMLU 数据集在三种实现下分数与排名都不同,读者可据此理解评测数字为何不可直接横向比较。
Hugging Face 月度阅读小组 2021 年 2 月聚焦长程注意力,围绕 Longformer、Compressive Transformer、Linformer、Performer 四篇论文梳理降低 Transformer 序列长度二次开销的四条路线:自定义注意力模式、循环、低秩近似与核近似。