跳到正文
LinuxDo· looooong·· 3 小时前AI 评分24

能否通过扩大词表提升模型生成速度?社区讨论 token 合并思路

提问:能否通过增加词表的方法提升速度呢

AI 导读

有用户在 LinuxDo 提问,能否在现有模型底座上扩大词表、把"地球是圆的"这类多 token 短语内置成单个 token,以空间换时间提升生成速度。回帖指出这并未提升速度,只是减少 token 数量,类似目标检测论文中把 100 这类数字写入词表的做法。也有观点认为 tokenizer 由数据训练得出,强行加入超长 token 而数据不匹配会导致语义问题、训练失败。

正文

2026 年10 月 7 日 06:55 1

声明一下,我对于模型训练几乎完全不了解,只是突然冒出来的想法
如果模型追求生成速度,那为啥我们不能在现有模型底座的基础上通过扩大词表的方式去提升速度呢,也就是空间换时间呢?虽然看上去 token 输出速度还是一样,但是 token 的长度增加了,变向的加速了速度

2 个赞

looooong (looooong) 2026 年10 月 7 日 06:59 2

就比如说把某些通用语本来是很多个 token, 直接变成一个,就像是“地球是圆的”,然后本来假设是“地球/是/圆的”,然后直接内置成一个 token

237581600 (Herta42) 2026 年10 月 7 日 07:02 4

不觉得在提升速度,只是减少了token数量,我在阅读MLLM用于目标检测的论文中看到过类似讨论,比如[100,200,300,400],模型预测的token就是"[1] [0] [0] [,] … [2]“,有人就把100这种数字写入词表,这样预测结果变成了”[100], [,], [200]…"。

neteroster (neteroster) 2026 年10 月 7 日 07:06 5

现在的tokenizer很多都是用数据训练出来的,他这么分说明按训练数据的规模/分布就该这么分

你这么整一个超长token但是数据不匹配的话会导致语义出问题,然后训练就炸了

来源:LinuxDo · linux.do