Google 发布 autofinetune:在 TPU 上用 Tunix 实现自主 LLM 后训练
Autonomous LLM post-training with Tunix on TPUs
Google 发布 autofinetune,把自主研究循环用于 LLM 后训练,基于 Tunix、Gemma 和 Cloud TPU,由 Antigravity CLI 与 Gemini Flash 3.7 编排。
Google 官方给出自主后训练闭环的完整配置与两个案例,可据此判断自动化微调流程的可行边界。
2026年9月11日
想象一下,你写完一份 Markdown 规范后去睡觉,醒来发现一个 AI 智能体已经替你通宵运行了数十次 LLM 微调实验——发现了最优的 LoRA 秩、优化了学习率调度、调整了批次大小,并将每一项验证过的改进提交到 Git。
这不再是幻想。今年早些时候,autoresearch 项目展示了自主 LLM 智能体如何在自包含循环中迭代探索预训练。受这一范式启发,我们创建了 autofinetune:将自主研究循环应用于 LLM 后训练(通过 GRPO 进行监督微调和强化学习),使用 Google 的全套 AI 技术栈——Tunix、Gemma 和 Cloud TPU,并由 Antigravity CLI 和 Gemini Flash 3.7 编排。
在本文中,我们将探讨自主研究循环如何用于后训练,并介绍几个真实的 LLM 微调案例研究。
范式转变:从手动调参到自主循环
传统的后训练涉及一个重复的手动循环:
- 提出假设(例如,“将
attn_vec_einsum添加到 LoRA 目标模块会提高准确率吗?” 或 “如果在 GRPO 期间更改 rollout 温度会发生什么?”)。 - 编辑训练脚本和超参数。
- 在加速器上启动作业。
- 监控损失曲线和基准评估。
- 手动回滚失败或在电子表格中记录成功。
如 autoresearch 所示,我们现在可以借助 AI 智能体的力量自动化整个过程:
- 设计竞技场(
program.md):人类定义循环、边界条件、评估标准和约束。 - 提供执行代码(
run.py):一个单一、干净、自包含的微调脚本。 - 让智能体迭代:智能体遵循
program.md中的指令:修改run.py、运行训练作业、测量目标指标、保留获胜提交或回滚回归,并将结果记录在results.tsv中。
案例研究 1:在 FunctionGemma 上进行监督微调(SFT)
在 autofinetune 的第一个实验中,我们采用了之前 博客 中相同的 SFT 设置,并通过创建自主研究循环来扩展它,以在 google/mobile-actions 数据集上优化 google/functiongemma-270m-it。
设置
- 硬件:Cloud TPU v5e-1
- 迭代速度:每次运行几分钟
- 总运行次数:数小时内进行 20 次自动化实验,用于快速实验
- 目标指标:函数调用生成的后训练评估准确率(accuracy)
智能体在 program.md 中被赋予了边界:
- 允许:LoRA 秩/alpha、目标投影层、学习率、预热/衰减调度、优化器(例如 AdamW/Muon、梯度裁剪)、批次大小和随机种子。
- 不允许:更改数据集、训练轮数或模型架构。
示例轨迹
以下是来自 sample_runs/SFT_results.tsv 的示例轨迹,展示了智能体如何进行爬山优化。
如您所见,智能体能够自动调整 LoRA 秩/alpha、优化器、学习率等,以在生成正确函数调用方面持续提高模型的准确率。
案例研究 2:在 Gemma 上进行强化学习(GRPO)以进行数学推理
监督微调只是一个简单的测试。在我们的第二个案例研究中,我们采用了 Tunix 仓库中的官方 GRPO 示例(该示例使用 GSM8K 训练 Gemma 3 1B 进行数学推理;训练后的模型在答案中具有更好的数值准确性和格式准确性),并将其设置为自主强化学习微调。强化学习受超参数敏感性、不稳定性和更长执行时间的影响——这使得该任务更具挑战性且更耗时。
Arena 设置
- 硬件:Cloud TPU v6e-1
- 模型:Gemma 3 1B
- 数据集:GSM8K
- 迭代速度:每次运行几个小时
- 运行时长:2–3 天内进行 40 次实验
- 目标指标:为了简化智能体的外循环优化,我们选择了一个单一的人工评估指标
Post_RL_metric,它简单地就是numerical_accuracy + format_accuracy(当然你也可以使用其他指标,即使用不同的权重)。
示例轨迹
以下是记录在 sample_runs/RL_results.tsv 中的示例轨迹,展示了智能体的进展。智能体能够识别出更好的 LoRA 配置、rollout 温度、KL 惩罚、系统提示等,从而将总奖励提高约 10%。
下一步是什么?
我们希望这个项目能向你展示 AI 智能体在 LLM 后训练领域的力量,并启发你思考如何利用它们,在 TPU 上使用 Tunix 自动化你的 LLM 微调工作流。请查看 autofinetune GitHub 仓库 中的代码、示例运行和 program.md 模板,探索 Tunix 库,并立即开始构建你自己的自主后训练实验室!
上一页
下一页
来源:Google Developers Blog · developers.googleblog.com