跳到正文
Google Developers Blog·· 27 天前精选AI 评分68

Google 发布 autofinetune:在 TPU 上用 Tunix 实现自主 LLM 后训练

Autonomous LLM post-training with Tunix on TPUs

AI 导读

Google 发布 autofinetune,把自主研究循环用于 LLM 后训练,基于 Tunix、Gemma 和 Cloud TPU,由 Antigravity CLI 与 Gemini Flash 3.7 编排。

推荐理由

Google 官方给出自主后训练闭环的完整配置与两个案例,可据此判断自动化微调流程的可行边界。

正文 · AI 翻译

2026年9月11日

想象一下,你写完一份 Markdown 规范后去睡觉,醒来发现一个 AI 智能体已经替你通宵运行了数十次 LLM 微调实验——发现了最优的 LoRA 秩、优化了学习率调度、调整了批次大小,并将每一项验证过的改进提交到 Git。

这不再是幻想。今年早些时候,autoresearch 项目展示了自主 LLM 智能体如何在自包含循环中迭代探索预训练。受这一范式启发,我们创建了 autofinetune:将自主研究循环应用于 LLM 后训练(通过 GRPO 进行监督微调和强化学习),使用 Google 的全套 AI 技术栈——Tunix、Gemma 和 Cloud TPU,并由 Antigravity CLI 和 Gemini Flash 3.7 编排。

fullstack

在本文中,我们将探讨自主研究循环如何用于后训练,并介绍几个真实的 LLM 微调案例研究。

范式转变:从手动调参到自主循环

传统的后训练涉及一个重复的手动循环:

  1. 提出假设(例如,“将 attn_vec_einsum 添加到 LoRA 目标模块会提高准确率吗?” 或 “如果在 GRPO 期间更改 rollout 温度会发生什么?”)。
  2. 编辑训练脚本和超参数。
  3. 在加速器上启动作业。
  4. 监控损失曲线和基准评估。
  5. 手动回滚失败或在电子表格中记录成功。

如 autoresearch 所示,我们现在可以借助 AI 智能体的力量自动化整个过程:

  • 设计竞技场(program.md):人类定义循环、边界条件、评估标准和约束。
  • 提供执行代码(run.py):一个单一、干净、自包含的微调脚本。
  • 让智能体迭代:智能体遵循 program.md 中的指令:修改 run.py、运行训练作业、测量目标指标、保留获胜提交或回滚回归,并将结果记录在 results.tsv 中。

agentloop

案例研究 1:在 FunctionGemma 上进行监督微调(SFT)

在 autofinetune 的第一个实验中,我们采用了之前 博客 中相同的 SFT 设置,并通过创建自主研究循环来扩展它,以在 google/mobile-actions 数据集上优化 google/functiongemma-270m-it。

设置

  • 硬件:Cloud TPU v5e-1
  • 迭代速度:每次运行几分钟
  • 总运行次数:数小时内进行 20 次自动化实验,用于快速实验
  • 目标指标:函数调用生成的后训练评估准确率(accuracy)

智能体在 program.md 中被赋予了边界:

  • 允许:LoRA 秩/alpha、目标投影层、学习率、预热/衰减调度、优化器(例如 AdamW/Muon、梯度裁剪)、批次大小和随机种子。
  • 不允许:更改数据集、训练轮数或模型架构。

示例轨迹

以下是来自 sample_runs/SFT_results.tsv 的示例轨迹,展示了智能体如何进行爬山优化。

SFT_results

如您所见,智能体能够自动调整 LoRA 秩/alpha、优化器、学习率等,以在生成正确函数调用方面持续提高模型的准确率。

案例研究 2:在 Gemma 上进行强化学习(GRPO)以进行数学推理

监督微调只是一个简单的测试。在我们的第二个案例研究中,我们采用了 Tunix 仓库中的官方 GRPO 示例(该示例使用 GSM8K 训练 Gemma 3 1B 进行数学推理;训练后的模型在答案中具有更好的数值准确性和格式准确性),并将其设置为自主强化学习微调。强化学习受超参数敏感性、不稳定性和更长执行时间的影响——这使得该任务更具挑战性且更耗时。

Arena 设置

  • 硬件:Cloud TPU v6e-1
  • 模型:Gemma 3 1B
  • 数据集:GSM8K
  • 迭代速度:每次运行几个小时
  • 运行时长:2–3 天内进行 40 次实验
  • 目标指标:为了简化智能体的外循环优化,我们选择了一个单一的人工评估指标 Post_RL_metric,它简单地就是 numerical_accuracy + format_accuracy(当然你也可以使用其他指标,即使用不同的权重)。

示例轨迹

以下是记录在 sample_runs/RL_results.tsv 中的示例轨迹,展示了智能体的进展。智能体能够识别出更好的 LoRA 配置、rollout 温度、KL 惩罚、系统提示等,从而将总奖励提高约 10%。

SFT_results

下一步是什么?

我们希望这个项目能向你展示 AI 智能体在 LLM 后训练领域的力量,并启发你思考如何利用它们,在 TPU 上使用 Tunix 自动化你的 LLM 微调工作流。请查看 autofinetune GitHub 仓库 中的代码、示例运行和 program.md 模板,探索 Tunix 库,并立即开始构建你自己的自主后训练实验室!

上一页

下一页

来源:Google Developers Blog · developers.googleblog.com