OpenAI 与 Retro Bio 用 GPT-4b micro 加速生命科学研究
OpenAI 与 Retro Bio 借助专用 AI 模型 GPT-4b micro,设计出用于干细胞疗法和长寿研究的更有效蛋白质。该模型专为生命科学场景打造,目标是加速相关研究进程。
OpenAI 与 Retro Bio 借助专用 AI 模型 GPT-4b micro,设计出用于干细胞疗法和长寿研究的更有效蛋白质。该模型专为生命科学场景打造,目标是加速相关研究进程。
NVIDIA 发布 Nemotron Post-Training Dataset V2,将英文推理数据翻译为法语、西班牙语、德语、意大利语和日语五种语言,规模约 600 万条。
推荐理由:NVIDIA 公开了多语言推理数据集的构建流程与过滤细节,可据此判断合成后训练数据的翻译质量风险。
Hugging Face 发布开源训练管线 kimina-prover-rl,用于 Lean 4 形式化定理证明,基于 DeepSeek-R1 启发的"先推理后生成"范式,并完全兼容 verl 框架。
Hugging Face 发布 TextQuests 基准,基于 25 款经典 Infocom 互动小说游戏,测试 LLM 作为智能体的长上下文推理与探索学习能力。
Hugging Face 推出 FilBench 评测套件,覆盖 Tagalog、Filipino 和 Cebuano 三种菲律宾语言,包含文化知识、经典 NLP、阅读理解与生成四大类共 12 项任务,并已评测 20+ 个 SOTA LLM。
Hugging Face 发布开源无代码工具 AI Sheets,可在类电子表格界面中通过提示词新建列,用开放模型构建、转换和增强数据集。工具支持从 Hub 调用数千个开放模型或本地模型,也可从自然语言描述直接生成数据集,导入支持 XLS、TSV、CSV、Parquet,单次最多 1000 行。
推荐理由:Hugging Face 官方开源的无代码表格工具,读者可了解如何用开放模型批量构建与增强数据集。
Hugging Face 推出 3LM(علم),一个评估阿拉伯语 LLM 在 STEM 与代码生成任务上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成高难度选择题,以及翻译自 HumanEval+ 和 MBPP+ 的阿拉伯语代码基准。
Mistral 用 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上显著优于基座模型。基座模型在 Playground、Stadium 等易混类别上会误判并偶发幻觉出不存在的类别名,微调后分类更准确。整个流程可通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。
Hugging Face 发布开源免费的实验追踪 Python 库 Trackio,提供本地 Gradio 仪表盘并支持同步到 Hugging Face Spaces 分享。
推荐理由:Hugging Face 官方开源实验追踪库,兼容 wandb API 且可同步到 Spaces 分享,读者可据此判断迁移成本。
PyArrow 和 Pandas 现已支持 Parquet 内容定义分块(CDC),可在 Hugging Face 的 Xet 存储层上对 Parquet 文件高效去重,只上传或下载发生变化的 chunk。
Mistral AI 联合 Carbone 4 和法国生态转型署(ADEME)完成首个 AI 模型全生命周期分析,并公开 Mistral Large 2 的环境足迹:截至 2025 年 1 月,训练加 18 个月使用共产生 20.4 ktCO₂e、消耗 281 000 m³ 水和 660 kg Sb eq。
Arc Institute 发起 Virtual Cell Challenge,要求参赛者训练模型预测 CRISPR 沉默某个基因后对细胞的影响,并称之为上下文泛化。
Hugging Face 发布 Ettin 套件,这是首个用完全相同的数据(2T tokens)、架构和训练配方训练的 SoTA 配对编码器与解码器模型系列,参数规模覆盖 17M 到 1B。
Numina 与 Kimi 团队发布基于 Qwen2.5-72B、采用 Kimi k1.5 RL 流程训练的定理证明模型 Kimina-Prover-72B,同时开源基于 Qwen3-8B 和 Qwen3-1.7B 的两个蒸馏版本。
推荐理由:原文给出 Kimina-Prover 系列在 miniF2F 上的成绩与 TTRL 搜索、错误修复两项方法细节,可据此了解形式化定理证明的当前进展。
Hugging Face 发布 SmolLM3,一个完全开源的 3B 模型,在 11T token 上训练,支持 6 种语言和最长 128k 上下文,并提供 think / no_think 双模式推理。
推荐理由:Hugging Face 公开了 3B 模型的完整训练配方与数据配比,读者可据此复现或改进同规模模型。
Hugging Face 以 nanoVLM 项目为例,展示如何用五阶段构建高效多模态数据管道,解决 GPU 空转与填充浪费问题。朴素填充阶段约 60% 的 batch 被无用 padding token 占据,团队随后引入全局最大长度约束,并借助背包问题(knapsack)实现贪心打包,将序列按 token 数尽量塞满每个 batch。
Hugging Face 上线 NeurIPS 2025 E2LM 竞赛,面向 LLM 早期训练阶段(约 200B tokens 以内)构建科学知识领域的评测基准,参赛者需基于 lm-evaluation-harness 通过 HuggingFace Space 提交方案。
Hugging Face 发布教程,介绍用 diffusers 库和 QLoRA 在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以下。在 RTX 4090 上,QLoRA 峰值显存约 9GB,标准 BF16 LoRA 需 26GB,700 步训练约 41 分钟。
推荐理由:原文给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,可据此复现低显存训练流程。
Falcon-H1 系列发布六个开源模型,参数规模从 0.5B 到 34B,每个尺寸均提供 base 与 instruct 版本,采用 Apache 2.0 许可。
推荐理由:Falcon-H1 用注意力与 SSM 并行混合架构覆盖 0.5B 到 34B 六个尺寸,可对照其长上下文吞吐与同尺寸 Transformer 模型的取舍。
阿联酋 TII 发布 7B 参数的 Falcon-Arabic,基于 Falcon 3 架构,支持阿拉伯语、英语等多种语言,上下文长度 32,000 tokens。该模型在 OALL v2 基准上超越同尺寸及至多 4 倍大的阿拉伯语 LLM,训练采用扩展 32,000 个阿拉伯语 token 的词表与 100% 原生阿拉伯语数据。
Falcon-Edge 系列发布,基于 BitNet 架构的三值(1.58bit)语言模型,提供 1B 和 3B 两种规模,每种规模各有 base 与指令微调版本。
John Deere 的 Justin Rose 分享了公司如何借助 AI 改造农业,并规模化推进创新,帮助农民更智能、更高效、更可持续地作业。
Intel 发布权重仅训练后量化方法 AutoRound,通过符号梯度下降联合优化权重舍入与裁剪范围,支持 INT2-INT8 低比特量化。在 INT2 下其相对精度最高达主流基线 2.1 倍,量化 72B 模型在 A100 上仅需 37 分钟。
ServiceNow 开源实验性 RL 实现 PipelineRL,核心是在 RL 训练中做 inflight 权重更新,推理不中断即可接收新权重,从而维持高推理吞吐并减少 rollout 权重与最新模型权重之间的滞后。
推荐理由:原文给出开源仓库与训练契约设计,读者可据此判断大规模 RL 训练中吞吐与 on-policy 数据如何兼顾。
TNG 基于 olmOCR-7B-0225-preview 微调出忠实版 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,微调后模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。该模型已在 Hugging Face 开源。
语言技术实验室发布 Visual Salamandra,将 Salamandra Instructed 7B 大语言模型扩展至图像和视频多模态任务。
Hugging Face 与 MBZUAI 合作上线 Arabic-Leaderboards Space,统一收录阿拉伯语 AI 评测,目前包含 AraGen-03-25 和 Arabic Instruction Following 两个榜单。
Hugging Face 发布教程,介绍如何用 Sentence Transformers 库微调 reranker(Cross Encoder)模型,涵盖数据集、损失函数、训练参数、评估器与 Trainer 等组件。
Hugging Face 的 Open R1 项目发布第三期更新,公开了约 10 万条由 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集、基于 2024 国际信息学奥林匹克(IOI)的 IOI 基准,以及微调 Qwen2.5 Coder Instruct 7B 和 32B 得到的 OlympicCoder-7B 与 OlympicCoder-32B。
推荐理由:Open R1 复现计划公开了数据集、基准与 7B/32B 模型,并给出五条蒸馏训练经验,可迁移到自建推理模型。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,称其为全球最大的开源自动驾驶数据集,R4 版本包含 100 万条 episode、5000+ 小时驾驶数据、90+ TB 规模,来自德国 30 座城市 60 辆驾校车辆的 6 路环视摄像头与车辆状态数据。
推荐理由:L2D 以 90TB 多模态驾驶数据接入 LeRobot 训练管线,可对比现有开源自驾数据集在规模与动作标注上的差异。
Hugging Face 与印度科学理工学院 IISc/ARTPARK 达成合作,提升开源多模态多语言数据集 Vaani 的可访问性与可用性。Vaani 目标采集超 150,000 小时语音和 15,000 小时转写文本,覆盖印度全部 773 个地区、54 种语言;目前已开源 790 小时转写音频,来自约 7 万名说话者。
Hugging Face 发布了一套用于构建视频生成数据集的开源工具链,采用三阶段流水线:用 yt-dlp 下载视频并切分为短片段,再通过 LAION-5B-WatermarkDetection。
Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个解答,经 Math Verify 与 Llama3.3-70B-Instruct 双重过滤后保留 22 万道有正确推理轨迹的题目。
推荐理由:Open R1 项目公开了 22 万条数学推理数据集的构建流程与蒸馏对比结果,可了解复现 R1 训练管线的具体做法。
Adyen 与 Hugging Face 联合发布 DABstep,一个面向多步推理的数据分析智能体基准,包含 450+ 个源自 Adyen 真实业务的数据分析任务。最强推理型智能体在该基准上仅取得 16% 准确率,凸显当前模型在真实数据分析场景中的明显差距。DABstep 同时提供数据集、任务、评测、实时排行榜与基线,仅需代码执行环境即可运行并自动评测。
Hugging Face 的 Open-R1 项目发布首周进展,在 MATH-500 上复现了 DeepSeek-R1 蒸馏系列模型的评测分数,例如 DeepSeek-R1-Distill-Qwen-32B 得 95.0、DeepSeek-R1-Distill-Llama-70B 得 93.4。
推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的 MATH-500 评测分数,并公开了合成数据生成与 GRPO 训练的工程细节。
这篇教程用 GRPO 和 Countdown Game 复现 DeepSeek R1 的 aha moment,基于 Qwen2.5-3B-Instruct 在 4x H100 上训练,450 步后解题成功率达 50%。
推荐理由:完整复现流程与训练观察记录,可看到小模型在 RL 下从文字推理转向程序化求解的过程。
Hugging Face 发布 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程,补齐官方未公开的数据集和训练代码。
推荐理由:Hugging Face 公开了复现 DeepSeek-R1 数据与训练流程的三步计划,读者可据此了解开源推理模型缺哪几块拼图。
Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1 和 static-similarity-mrl-multilingual-v1,在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。
推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此判断低算力场景下嵌入推理的可行边界。
Hugging Face 在 Open LLM Leaderboard 中引入 CO₂ 排放估算,基于 2742 个模型的推理数据发现,社区微调模型普遍比其官方基础模型更低碳。70B 参数级别中,Qwen2.5 和 Llama3.1 的官方微调耗能约为基础模型的两倍,而 MoE 架构模型的排行榜得分与排放比整体偏低。
Hugging Face 博客发布教程,介绍用 torch.cuda.memory._record_memory_history 记录显存快照、导出 profile.pkl 并在 pytorch.org/memory_viz 可视化,逐步拆解模型创建、前向、反向和优化器各阶段的显存变化。
推荐理由:原文给出 PyTorch 显存快照的可视化步骤与显存估算公式,读者可据此定位训练中的显存峰值来源。