跳到正文
9月30日周三
9月24日周四
  1. NVIDIA Blog62

    NVIDIA 联合 Google DeepMind 等开放 2800 多种病毒的蛋白复合物预测结构

    NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的全球研究联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。

    推荐理由:NVIDIA 联合 Google DeepMind 等开放 2800 多种病毒的蛋白复合物预测结构,读者可了解开放科学在疫情准备中的具体做法。

6月30日周二
3月31日周二
  1. Hugging Face Blog32

    OpenMed 用 165 美元训练跨 25 物种的 mRNA 语言模型

    OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。

3月7日周六
  1. Google Research62

    Google Research 发布 WAXAL:覆盖 27 种非洲语言的大规模开放语音数据集

    Google Research 发布 WAXAL 大规模开放语音数据集,覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音和超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,Google 提供方法指导。项目自 2021 年启动,Google 表示将持续扩充语言覆盖。

    推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。

11月21日周五
10月16日周四
9月26日周五
8月21日周四
8月5日周二
3月11日周二
  1. Hugging Face Blog76

    Hugging Face 与 Yaak 发布 L2D 开源自动驾驶数据集

    Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,称其为全球最大的开源自动驾驶数据集,R4 版本包含 100 万条 episode、5000+ 小时驾驶数据、90+ TB 规模,来自德国 30 座城市 60 辆驾校车辆的 6 路环视摄像头与车辆状态数据。

    推荐理由:L2D 以 90TB 多模态驾驶数据接入 LeRobot 训练管线,可对比现有开源自驾数据集在规模与动作标注上的差异。

2月10日周一
  1. Hugging Face Blog31

    Hugging Face 发布 Open Arabic LLM Leaderboard 2

    Hugging Face 联合 2A2I、TII 推出 Open Arabic LLM Leaderboard 2,升级阿拉伯语大模型评测榜。首版 OALL 上线不到 7 个月吸引超 46,000 名访客,收到 700 多个模型提交,参数规模从 1B 到 70B 以上,来自 180 多个机构。新版回应社区对阿拉伯语专项任务、评测透明度与数据集多样性的批评。

6月6日周四
5月14日周二
5月5日周日
2月27日周二
2月20日周二
12月1日周五
  1. Hugging Face Blog36

    Open LLM Leaderboard 深度解析 DROP 基准评分异常

    Hugging Face 对 Open LLM Leaderboard 新增的 DROP 基准进行深度排查,发现多数模型 f1-score 低于 10 分源于评测实现问题:数字后跟非空格空白字符时归一化失效,且以 . 作为停止符会截断浮点答案、让高质量模型因生成过长反而得分更低。改用 \n 作为停止符重新计算后,分数与模型整体表现的相关性明显改善。

6月23日周五
3月9日周二