跳到正文
Allen AI (Ai2)·· 8 小时前精选AI 评分61

Ai2 的 Bolmo 字节级语言模型研究登上 Nature,并开源新 checkpoint

Now in Nature: Retrofitting language models to operate over bytes

AI 导读

Ai2 宣布其字节级语言模型 Bolmo 的研究成果发表在 Nature,并在 Hugging Face 发布新 checkpoint,把 byteifying 方法从 Olmo 扩展到其他模型家族。

推荐理由

Bolmo 的 byteifying 方法从 Olmo 扩展到 Qwen 3 8B 与 Llama 3 8B,并公开 Stage 1 checkpoint,读者可据此判断字节级建模的迁移成本。

正文 · AI 翻译

去年12月,我们推出了 Bolmo,这是我们完全开放的字节级语言模型系列。如今,Bolmo背后的研究已发表在Nature上,我们正在Hugging Face上发布新的检查点,将这一基础方法从作为Bolmo起点的Olmo模型扩展到其他模型系列。

我们还在发布我们的第一阶段检查点,这些检查点在训练Bolmo新的字节级组件时保持原始全局模型冻结,为研究人员提供了一个更快的起点,以便对架构进行实验和扩展。

大多数语言模型并不直接处理文本。相反,它们首先将文本分解为子词:从固定词汇表中提取的词块。这种方法效果非常好,但在处理拼写、不寻常的字符串、罕见词或无法干净地映射到这些预定义词块的文本时,也可能使模型变得不够灵活。

字节级模型采用不同的方法,将文本作为计算机用来表示字符的底层字节来处理。因此,像Bolmo这样的模型从文本的更低层表示——对应于字母、标点、符号和其他字符的字节序列——开始工作。

在这个层面上工作可以提高模型对细粒度文本结构的理解,从空白字符到不同的书写系统,而不受固定词汇表的束缚。而且由于字节是数字数据的基本表示形式,字节级建模最终可能为处理包括图像和音频在内的其他类型信息提供共同的基础。

然而,从历史上看,要让字节级模型达到子词模型的性能,需要从头开始训练——这是一项昂贵的工作,使得字节级方法难以在子词模型快速改进的同时保持同步。

借助Bolmo,我们展示了另一种方法。我们创建了一个称为byteifying的过程,它可以将一个已经具备能力的子词模型转换为字节级模型,只需相对较短的额外训练。我们使用这种方法从我们的开放Olmo模型开发出了Bolmo 1B和Bolmo 7B,我们认为这是首批完全开放、在广泛任务上与强大的子词模型具有竞争力的字节级语言模型。

在Nature论文中,我们展示了byteifying可以推广到Olmo之外。我们将同样的过程应用于Qwen 3 8B和Llama 3 8B,创建了两个新的字节级模型:Bwen 8B和BlamaLlama-B 8B。两者都接近匹配它们所衍生的模型,而Bwen 8B是我们迄今为止最强的byteified模型——在我们的综合评估套件中优于Bolmo 7B。

开发者和研究人员已经开始将Bolmo适配于特定应用,包括一个用于俄语到英语诗歌和歌词翻译的Bolmo 7B微调版本。

Bolmo的发表紧随Ai2近期在Nature上的其他研究。今年2月,我们的论文“利用检索增强语言模型综合科学文献”展示了专门的检索、排序和引用处理如何帮助语言模型以更可靠的依据综合科学文献。

Bolmo、这项工作以及我们更广泛的研究反映了一个共同信念:当研究社区能够审视、复现并轻松在此基础上继续构建时,AI 的根本性进展才更具影响力。

对于 Bolmo 而言,这意味着开辟一条通往不再被锁定于单一信息表示方式的模型的道路。未来的系统可以跨语言、领域和任务调整其表示方式,而研究人员则可以在无需重复承担全部训练成本的情况下测试新架构。由于字节也超越了文本的范畴,同样的思路最终可能适用于其他类型的数据。 

研究人员也开始将 Bolmo 作为新工作的基础,包括在字节级模型之间迁移能力的实验以及探究像 Bolmo 这样的分层字节架构的效率与细粒度字符理解之间权衡的研究。

通过将 Bolmo 及其训练配方完全开放,我们希望帮助研究人员挑战当今语言模型中固有的假设——并发现当这些假设改变时,什么将成为可能。

订阅以接收有关最新 Ai2 新闻的每月更新。

来源:Allen AI (Ai2) · allenai.org