Hugging Face 的 Transformers Code Agent 登顶 GAIA 基准
Hugging Face 用基于 transformers.agents 的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:Hugging Face 用 Code Agent 在 GAIA 上取得领先,并公开了工具、执行沙箱与规划策略的实现细节。
技术方向
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
317 条精选近 30 天 15 条共收录 784 条
Hugging Face 用基于 transformers.agents 的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:Hugging Face 用 Code Agent 在 GAIA 上取得领先,并公开了工具、执行沙箱与规划策略的实现细节。
Google 发布开源大模型 Gemma 2,提供 9B 和 27B 两个参数规模,各有预训练基础版与指令微调版,上下文长度 8K tokens,采用与初代相同的宽松许可,允许再分发、微调和商用。
推荐理由:原文给出 Gemma 2 的两种参数规模、训练数据量与评测对比,可据此判断开源小模型的能力位置。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)上线 Hugging Face Hub 并接入 Diffusers,同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)训练器,作为 PPO 之外的在线 RLHF 训练算法。官方称 RLOO 只需加载策略模型、参考策略模型和奖励模型三份模型,显存占用比 PPO 少约 50-70%,1B 模型上速度是 PPO 的 2 倍、6.9B 模型上最高 3 倍。
推荐理由:原文给出 RLOO 与 PPO 在显存、速度和胜率上的对比数据,可据此判断在线 RLHF 训练的成本取舍。
Mistral AI 在 la Plateforme 上线模型定制功能,提供三条路径:开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。
推荐理由:Mistral 同时给出开源微调代码库与托管微调服务,读者可据此判断自建与托管两条路径的成本差异。
Mistral 发布首款代码模型 Codestral,22B 开放权重,支持 80+ 编程语言,上下文窗口 32k,采用 fill-in-the-middle 机制补全代码和写测试。
推荐理由:Mistral 首款代码模型给出 22B 参数、32k 上下文与 80+ 语言支持,并附免费 API 与主流 IDE 集成入口。
Mistral AI 推出非生产许可证 MNPL,允许开发者将自家技术用于非商业用途并支持研究工作,商业使用则需另循公平可持续的方式。Codestral 于同日在该许可证下发布,Mistral 表示仍会继续以 Apache 2.0 发布模型和代码,并逐步整合 Apache 2.0 与 MNPL 两条产品线。
推荐理由:Mistral 推出非生产许可证,读者可据此理解开源模型厂商在开放与商业化之间的授权取舍。
TII 发布第二代 Falcon 2 模型,包括 11B 基座语言模型和具备图像理解能力的 11B VLM,训练数据超过 5000B tokens,覆盖英语及另外十种语言。
推荐理由:原文给出 Falcon 2 11B 的架构、训练数据与评测对比,可据此判断小尺寸开源模型与多模态路线的取舍。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。
推荐理由:Google 开源视觉语言模型 PaliGemma 的完整发布说明,含架构、三种 checkpoint 与微调路径,便于判断适用场景。
Hugging Face 发布 Transformers Agents 2.0,在原有智能体类型之外新增可基于历史观察迭代的 ReactAgent 等两类智能体,并加入共享功能。
推荐理由:官方给出新智能体框架的模块划分与 GAIA 榜单成绩,可据此判断开源智能体方案的可用性。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、全透明且许可宽松的代码大语言模型,无需人工标注或从 GPT-4 等专有模型蒸馏数据。
推荐理由:StarCoder2-15B-Instruct 用自生成数据完成指令微调,其开源流程与评测对比可供代码模型训练参考。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有基础版和指令微调版,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2。
推荐理由:Meta 发布 Llama 3 并同步落地 Hugging Face 生态,读者可据此了解新分词器、GQA 与 8K 上下文带来的变化。
Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 MoE 架构,141B 总参数中仅 39B 激活参数,以 Apache 2.0 许可开放。该模型支持英语、法语、意大利语、德语和西班牙语,具备数学与编码能力,原生支持函数调用,上下文窗口为 64K tokens。
推荐理由:Mixtral 8x22B 以 39B 激活参数和 Apache 2.0 许可发布,读者可据此判断开源模型的性能与成本取舍。
Hugging Face 发布 Idefics2,一个 8B 参数、Apache 2.0 许可的多模态模型,可接受任意文本与图像序列输入并生成文本回复,支持图像问答、文档信息抽取和基础算术。
推荐理由:8B 参数、Apache 2.0 许可并同步放出多模态指令微调数据集,读者可据此判断开源多模态的可用起点。
Hugging Face 发布视觉语言模型入门文章,介绍其图像编码器、嵌入投影层与文本解码器的典型结构,并汇总 LLaVA 1.6、DeepSeek-VL、CogVLM、Qwen-VL 等开源模型的分辨率与能力差异。
推荐理由:系统梳理视觉语言模型的组成、选型榜单与微调流程,并给出可直接运行的 transformers 与 TRL 代码示例。
Google 发布 CodeGemma 代码专用模型系列,基于预训练的 2B 和 7B Gemma checkpoint 继续训练 5000 亿 token,包含 2B 基座、7B 基座和 7B instruct 三个开源版本,上下文均为 8K token。
推荐理由:CodeGemma 三个规格的定位、基准对比和 FIM 提示格式都写清了,可据此判断它适合哪类代码补全场景。
Hugging Face 博客介绍嵌入向量的二值量化与标量(int8)量化,用于降低检索的内存、磁盘占用和成本。二值量化把 float32 值转为 1 bit,内存与存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化减少 4 倍,性能保留约 99.3%。
推荐理由:原文给出二值与标量量化的实测数据与代码示例,读者可据此评估检索成本与性能的取舍。
Hugging Face 博客介绍 GaLore 方法,通过将梯度投影到低秩子空间,可在 NVIDIA RTX 4090 等消费级 GPU 上训练 Llama 架构的 7B 参数模型,优化器状态内存减少超过 82.5%。
推荐理由:原文给出 GaLore 在消费级显卡上训练 7B 模型的内存节省数据与 transformers 接入方式,便于判断显存受限场景的可行性。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,包含超 3000 万个文件、250 亿 token,用于复现 Phi-1.5 的预训练数据。
推荐理由:Hugging Face 公开了构建 250 亿 token 合成预训练数据集的完整流程与代码,可供复现和迁移。
BigCode 发布 StarCoder2,这是新一代透明训练的开放代码大语言模型,包含 3B、7B、15B 三个参数规模,全部基于新的高质量代码数据集 The Stack v2 训练。
推荐理由:BigCode 同时放出三个尺寸的代码模型与配套数据集,读者可据此了解开源代码模型在参数规模与训练数据上的最新配置。