Together AI 研究:语音模型在街道名识别上平均错误率达 39%
How speech models fail where it matters the most and what to do about it
Together AI 发布研究,用 2,262 条来自 78 位、13 种语言说话人的语音测试 15 个 ASR 模型,街道名平均转写错误率为 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% 对 64%)。
Together AI 用 15 个 ASR 模型实测街道名识别,给出 39% 错误率与跨语言差距的具体数据,并公开两个基准。
概述
我们证明,当说话者具有多样化的语言背景时,语音识别系统难以理解街道名称的发音——在 15 个最先进的模型中,平均转录错误率为 39%,而非英语母语者与英语母语者之间存在 18% 的准确率差距。我们表明,一种名为“跨语言风格迁移”的合成数据生成技术,相对于基础模型可将这些错误减少多达 60%,且仅需不到 1,000 个训练样本。

Whisper、Deepgram、Phi-4 等自动语音识别系统是我们当前数字基础设施不可或缺的一部分。这些模型已在 Librispeech 和 Switchboard 等语音基准上进行了标准测试,并在词错误率等指标上达到接近人类的水平。然而,这些仅关注词准确率的聚合指标,往往会掩盖关键错误。最显著的差距之一是无法可靠地转录现实世界中简短、高风险的话语。当用户向导航系统或紧急调度员口述命令时,命名实体中的一个错误就可能给个人和调度机构带来关键时间的损失。
我们的最新研究调查了基准性能与现实世界可靠性之间的差距。我们推出了 SF Streets 和 US Streets,这两个新基准旨在对已部署系统中的命名实体识别进行压力测试。我们的评估显示,即使是来自 OpenAI、Deepgram、Google 和 Microsoft 的最强模型也难以应对这一任务。为解决这一问题,我们开发了一种合成数据生成方案,利用跨语言风格迁移,在不到 1,000 个训练样本的情况下将性能提升多达 60%(相对于基础模型)。
STT 基准测试中的地址识别
标准语音基准通常以长篇朗读语音为主,其中语义上下文有助于消除歧义。而街道名称,当由多语言城市的居民发音时,则代表着不同的挑战。它们上下文匮乏、声学多样,且对语音错误零容忍:发音上的微小差异可能在地图上造成巨大差别。
为量化这一难度,我们收集了 SF Streets 数据集。该数据集包含来自美国 78 位语言背景多样的参与者的 2,262 条话语,发音为旧金山的街道名称。我们重点关注该城市的林荫大道,如“Cesar Chavez”或“Alemany”,因为它们作为主要干道,在导航查询中经常被提及。

我们在此数据集上评估了 15 个最先进的模型,尽管这些模型在一般语音上实现了较低的 WER,但它们在街道名称上的平均转录错误率为 39%。这种脱节挑战了模型规模能自动解决鲁棒性问题的假设。例如,Whisper-Large 实现了 14% 的尚可的一般词错误率,但其在街道名称上的特定错误率上升至 27%。
在旧金山这样的城市,出租车服务为老年人和残障人士提供着必不可少且有补贴的交通出行。这些偏差带来了实实在在的经济损失。利用标准出租车费率表和交通数据,我们估算,纠正这些错误所需的额外行驶时间,每次事件约耗费 \$4.00。若按该市年度出租车总量累计,仅转录错误一项,每年就可能造成约 43,500 小时的可避免延误。这相当于每年约 \$2.1 百万的时间与车费浪费。
人口特征与差异化影响
这些系统的可靠性在不同群体之间差异显著。随着现代语音模型被部署到多样化的城市环境中,它们会遇到口音和语言背景各异的说话者。我们对 SF Streets 数据的分析揭示出显著的性能差异。在我们的 15 个模型及模型变体中,非英语母语者的准确率比英语母语者低 18%(46% 对 64%)。

这一技术故障直接转化为更实际的运营摩擦:为衡量现实世界中的后果,我们使用 Google Maps API 将转录的街道名称映射到地理坐标;我们发现,非英语母语者的错误转录导致路线目的地平均偏离预期位置 2.40 英里。仅英语母语者的错误导致的偏差较小,为 1.26 英里。
用数据克隆提升代表性
为每一个可能的命名实体收集具有代表性的人类语音数据,成本高得令人望而却步,且无法扩展。因此,我们研究了合成数据能否帮助我们弥合这一差距。

我们利用了多语言文本转语音模型固有的偏差。我们采用了一种我们称之为跨语言风格迁移的技术。我们提示开源的 XTTS 模型生成西班牙语等外语语音,但在提示中注入特定的英语街道名称。这迫使模型将非英语语音规则应用于英语单词。用“Estoy en Washington”提示模型,会生成带有明显西班牙语语音特征的“Washington”一词。
这种方法使我们无需真人说话者即可生成高度多样化的发音集合。我们创建了一个微调数据集,其中包含不到 1,000 条此类合成话语。在这个小型合成集上微调 Whisper-Base,使准确率相对基础模型提升了 60%,其中提升最大的是非英语母语者。这表明,小规模的合成与开源语音克隆可以在命名实体转录方面带来显著改进。
展望未来
我们的工作凸显了现代语音识别中一个持续存在的弱点。尽管通用模型在不断改进,但它们在那些驱动应急调度和导航等关键系统的简短、信息密集的话语上仍然不成比例地失败。然而,我们也证明这是一个可以解决的问题。创造性地使用合成数据和风格迁移,使从业者能够提高模型的鲁棒性,而无需进行大规模且昂贵的数据收集工作。
为促进进一步研究,我们将发布 SF Streets 数据集以及规模更大的 US Streets 基准。US Streets 集包含来自美国 12 个主要城市的 3,600 条录音。我们希望这些资源能帮助社区超越聚合指标,关注在部署中最关键的可靠性。
来源:Together AI Blog · together.ai