跳到正文
Sarvam AI·· 2025-06-07精选AI 评分60

Sarvam AI 发布 Sarvam-Translate 开源翻译模型,支持 22 种印度语言

Sarvam Translate

AI 导读

Sarvam AI 与 AI4Bharat 联合发布 Sarvam-Translate,基于 Gemma3-4B-IT 微调,支持 22 种印度语言的段落级翻译,并为 15 种语言提供结构化文档翻译。

推荐理由

Sarvam 与 AI4Bharat 联合发布覆盖 22 种印度语言的开源翻译模型,读者可了解其结构化文本保留能力与语言覆盖差异。

正文 · AI 翻译
  1. 首页
  2. /
  3. 博客

Sarvam-Translate 是一个开放权重模型,支持 22 种印度语言之间的翻译,并能处理结构化长文本。

开源产品


2025 年 6 月 7 日 · 13 分钟阅读

Sarvam Translate

现已支持 22 种印度语言和结构化长文本

从 Hugging Face 下载模型,在我们的 playground 上试用,并使用我们的 API 进行构建。

让内容跨语言可用一直是数字无障碍的关键考量。虽然翻译系统持续演进,但仍有三个大方向的工作要做——其一,支持更多语言;其二,支持对风格化(如习语)长文本进行更自然的翻译;其三,支持不同格式的结构化文本。这些格式可能因来源而异,例如带有方程的数学教科书、内容周围带有 HTML 代码的网页,或对图像进行数字化后可能带有 OCR 相关错误的输出。

尽管多语言大模型已展现出进行长文本翻译的能力,但它们在印度语言上的表现仍然落后。在 Sarvam,我们正致力于通过聚焦 22 种印度表列语言来解决这一问题,重点是在支持长文本结构化内容的同时实现更自然的翻译。

我们很高兴地分享,与 AI4Bharat 合作,我们通过最新模型 Sarvam-Translate 在这方面迈出了重要一步。Sarvam-Translate 通过微调 Gemma3-4B-IT 训练而成,支持 22 种印度语言——印地语、孟加拉语、马拉地语、泰卢固语、泰米尔语、古吉拉特语、乌尔都语、卡纳达语、奥里亚语、马拉雅拉姆语、旁遮普语、阿萨姆语、迈蒂利语、桑塔利语、克什米尔语、尼泊尔语、信德语、多格拉语、孔卡尼语、曼尼普尔语(梅泰语)、博多语、梵语。它支持 22 种语言的段落级翻译,并支持 15 种语言翻译多样化的结构化内容。

在语言专家进行的人工评估中,Sarvam-Translate 被认为显著优于 Gemma3-27B-IT、Llama4 Scout 和 Llama-3.1-405B-FP8 等规模大得多的模型。此外,在遵循结构化长文本内容能力的自动化评估中,Sarvam-Translate 在 15 种语言上显示出高准确率(> 4.9 / 5)。

Sarvam-Translate 可在我们的 API store 上试用并用于你的应用。此外,为了让其他人能够使用并基于该模型进行构建,我们将在 Hugging Face 上发布一个开放权重模型。这延续了我们公开构建、助力印度主权 AI 生态系统的承诺。Sarvam-Translate 的示例用例

以下是 Sarvam-Translate 支持的每种语言的功能矩阵。

语言句子段落结构化文档
印地语✅✅✅
孟加拉语✅✅✅
马拉地语✅✅✅
泰卢固语✅✅✅
泰米尔语✅✅✅
古吉拉特语✅✅✅
乌尔都语✅✅✅
卡纳达语✅✅✅
奥里亚语✅✅✅
马拉雅拉姆语✅✅✅
旁遮普语✅✅✅
迈蒂利语✅✅✅
阿萨姆语✅✅✅
梵语✅✅✅
桑塔利语✅🟨❌
克什米尔语✅🟨❌
尼泊尔语✅✅✅
孔卡尼语✅✅🟨
信德语✅🟨🟨
多格拉语✅🟨❌
博多语✅🟨🟨
曼尼普尔语✅🟨❌

Scroll

Scroll

语言支持功能矩阵

Sarvam-Translate 的示例用例

下面,我们分享一些示例,以突出展示 Sarvam-Translate 的不同使用方式。

在不破坏 HTML 结构的情况下翻译网页

Sarvam-Translate 不会在标签周围提取/重新插入文本,而是保留 HTML 结构,仅翻译可见的文本内容。

翻译网页内容是翻译模型的核心用例之一。然而,提取、翻译并重新插入文本往往容易出错且繁琐。Sarvam-Translate 通过仅翻译可见文本内容、保留所有 HTML 标签和结构,简化了这一流程。如下图所示,包括强调等在内的各种元素都在文本中得以保留。

源 PDF

译文

在保留语法的同时翻译 LaTeX 文档

LaTeX 中的学术和技术文档将人类可读文本与格式和命令语法结合在一起。在翻译过程中保持 LaTeX 代码的完整性颇具挑战。Sarvam-Translate 能够识别并仅翻译人类可读内容,同时保留 LaTeX 语法和结构。在下面的示例中,表格和格式都得以保留。另请注意,模型选择将引用论文中的作者姓名保留为英文。

英文

译文

翻译化学文档

化学文档通常混合了专业化学符号和方程式。确保这些内容在翻译过程中保持不变需要精细控制。Sarvam-Translate 能够准确翻译周围文本,同时保留化学方程式和格式。此外,诸如 x 和 y 之类的符号也保留为罗马字符。

原图

译文

翻译习语、俚语和文化指涉

习语表达、修辞手法以及具有文化特定性的短语在直译时往往会失去含义。我们发现,Sarvam-Translate 通常能够生成保留原始语气、意图和细微差别的译文。请注意下面几个习语短语是如何被正确翻译的。例如,'being behind the eight ball' 这一源自台球运动的比喻,意为陷入困境,在泰卢固语中被恰当地翻译为 'జయేష్ అప్పటికే చాలా కష్టాల్లో ఉన్నాడు'。

输入

在保留文化细微差别的同时翻译民间故事

民间故事和小说等叙事文本承载着文化深度和文体细微差别。在保持跨语言可读性的同时捕捉这些内容十分复杂。我们的模型能够处理叙事流、文化表达和文体元素,从而生成忠实的译文。例如,在迈蒂利语中,短语 "One who interferes in other's work" 被翻译为 "जे दोसरक काजमे टाँग अड़ाबैत अछि",这是对常见习语的恰当使用。

输入

翻译带有俚语和表情符号的社交媒体帖子

社交媒体帖子经常包含非正式语言、俚语、表情符号和非传统结构,这带来了独特的翻译挑战。我们发现,Sarvam-Translate 通常能够处理此类内容,准确传达含义和语气。请注意下面示例中各种表情符号的使用和风格化内容。例如,"Wut u doing rn?" 在卡纳达语中被恰当地翻译为 "ಏನ್ ಮಾಡ್ತಾ ಇದೀಯಾ?"。

输入

在保持时间轴和格式的同时翻译字幕文件

字幕(SRT)文件要求译文与时间轴和格式提示精确对齐。我们的模型仅翻译口语对话,同时保持字幕结构和同步。这可以通过一次 API 调用实现可访问的 SRT 文件。

输入

翻译包含嵌入外语文本的文档

多语言文档通常包含嵌入的外语文本,在大多数情况下这些文本应保持不翻译。Sarvam-Translate 展示了识别此类片段并在翻译周围内容时保留它们的能力。在下面的示例中,我们保留了繁体中文。

输入

精准翻译法律文件

法律文本要求术语和结构高度精准。翻译此类文件需要保留法律引用、条款和格式。我们发现 Sarvam-Translate 能够确保适合专业法律用途的准确性和一致性。例如,考虑这个复杂句子“Upon a meticulous perusal of the statutory scheme, the legislative history of the Parent Act, and the precedents cited at the Bar, this Court is disinclined to accede to the appellant's submissions”。该模型能够将其翻译为阿萨姆语“বিধিবদ্ধ আঁচনি, মূল আইনৰ বিধিবদ্ধ ইতিহাস, আৰু বাৰত উল্লেখ কৰা পূৰ্ব উদাহৰণসমূহৰ এক নিখুঁত পৰ্যালোচনাৰ পিছত, এই আদালতে আপীলকাৰীৰ যুক্তিসমূহ মানি ল'বলৈ অনিচ্ছুক”,这是一种更自然的句子结构,并正确传达了技术内容。

输入:判决文件

在保护语法的同时翻译代码文件

翻译代码文件需要区分可执行代码和人类可读文本,例如注释或文档。我们发现 Sarvam-Translate 能够选择性地翻译自然语言内容,同时保持代码不变。例如,注释“Function to perform Bubble Sort”被翻译为孟加拉语“বাবল সর্ট করার ফাংশন”,保留了 bubble sort 等技术术语,而没有进行过度复杂的翻译。

输入

鉴于该模型的通用能力,我们相信可以解锁新的用例。我们鼓励您尝试 Sarvam-Translate,并在 社交媒体 或我们的 discord 上与我们分享您的发现。

在本博客的剩余部分,我们将介绍该模型在评估和训练方面的一些技术细节。

对结构化内容的自动评估

为了测试 Sarvam-Translate 的能力,我们进行了一项大规模评估,涵盖多种语言、文档风格和内容格式。在此评估中,我们使用了一个精选的文章数据集,涵盖一系列真实世界的格式和内容类型。该数据集包括 GitHub Markdown 文件、使用视觉语言模型(VLM)数字化为 Markdown 的扫描 PDF、包含用 LaTeX 编写的数学公式的文档,以及具有复杂化学记号的化学文档。它还包含带有嵌入注释和文档的代码文件,以及从 HTML 中提取的网页内容。我们在这些类别中每类创建了 1,000 份文档。

鉴于评估规模,对每种文档类型和语言对进行人工审核是不切实际的。为解决这个问题,我们使用 Gemini Flash 2.5 进行自动评估。对于每种文档类型,我们设计了提示,引导 Gemini 关注对该格式最重要的翻译质量特定方面。例如,数学公式的评估标准不同于代码或 HTML 的评估标准。我们在下面描述这些标准。

Markdown 内容(GitHub)

目标:确保翻译后的文档保留Markdown 结构,包括标题、项目符号、链接、代码块,并且翻译内容能自然地融入该结构。格式应与源文档完全一致。

数字化 Markdown(VLM / OCR 输出)

目标:评估当源文档来自数字化、OCR 提取的来源时,翻译的稳健性如何,该来源可能包含轻微错误或不一致。结构(表格、标题)应被保留,翻译应能优雅地处理噪声,而不引入额外错误。

数学内容(LaTeX 公式)

目标:确保LaTeX 公式在翻译后的文档中被精确保留,同时周围文本被自然翻译。公式语法的任何部分都不应被更改或破坏。翻译必须保持数学符号的完整性。

化学内容(方程式、符号)

目标:验证化学方程式,包括下标、上标、箭头和特殊符号,是否被正确保留。方程式周围的文本应被自然翻译,而化学符号应保持不变并精确格式化。

代码内容(带注释的代码)

目标:确保代码在翻译后的文档中完全保持不变,并且仅翻译注释和文档。编程语法不得被更改。评估还应检查是否引入了非预期的更改(缩进、特殊字符)。

HTML 内容(网页)

目标:验证HTML 标签和结构是否被精确保留。标签内的可见文本内容应被流畅翻译,但 HTML 本身应保持不变。如果原始内容中存在某些元素(例如斜体、粗体),则相应译文应保持相同的样式。

评估结果

各语言的翻译质量得分(5 分制),在多种内容类型上取平均值。

人工评估

虽然自动评估在大规模场景下很有用,但鉴于翻译质量的主观性以及前沿模型在特定语言上的能力有限,人工评估是必要的。为此,我们精心挑选了 100 份英文文档,涵盖多样化的内容类型,包括科学、数学和化学等技术材料;取自语音转录和对话博客的非正式和口语文本;Markdown 文档、HTML 页面和代码片段等结构化内容;以及新闻文章和教科书节选等正式内容。

这些文档使用 Sarvam-Translate 以及领先的开源 LLM(如 Gemma3-27B-IT、Llama-3.1-405B-FP8 和 Llama4 Scout)进行翻译。随后,翻译输出由专业人工标注员进行评估。评估人员是专业语言专家,每位都在翻译创作和验证方面拥有多年专业经验,并且精通英语及其目标印度语言。

人工评估人员从多个关键维度评估翻译,包括流畅度、充分性、对源结构的忠实度以及包容性。他们被随机展示两个翻译,并被要求选择其中一个更受偏好,或两者同样受偏好。人工评估的结果总结在以下表格中。

Gemma3 27B IT 对比 Sarvam Translate

Llama 4 Scout 对比 Sarvam Translate

Llama 3.1 405B FP8 对比 Sarvam Translate

在所有印度语言中,Sarvam-Translate 始终优于其他模型,尤其是在处理结构化内容、在较长上下文中保持连贯性,以及提供包容且文化敏感的翻译方面表现突出。

Sarvam-Translate 是如何训练的

这段历程历经数年,建立在持续的努力以及对开源印度语言技术开发的深厚专业积累之上。我们投入了大量资源来构建稳健的数据清洗流水线和精细的标注工作流,以确保获得最高质量的数据集。我们还利用了 Gemma 3 开源模型,与其他任何模型相比,它为建设 Sarvam-Translate 提供了最佳的起点。

数据

Sarvam-Translate 是在一个丰富多样的数据集上训练的,该数据集包含英语与 22 种印度语言之间的翻译对。这个数据集融合了多个来源。首先,我们纳入了来自以往开放数据工作的清洗后数据,包括 BPCC,其本身既包含挖掘数据,也包含人工验证数据。我们使用稳健的内部流水线仔细清洗了这些数据。其次,我们从精心筛选的英语源内容中生成了新的翻译对。这涵盖了广泛的领域:科学与历史内容、对话式与现代文本,以及代码、LaTeX、HTML 和化学方程式等结构复杂的格式。在这一过程中,我们认识到需要对数据进行非常高质量的过滤。即使是 Llama-3.1-405B-FP8 这样的大型模型,在生成印度语言输出时也会犯很多错误。

训练过程

我们在 Gemma3-4B-IT 的基础上训练了 Sarvam-Translate。我们通过两阶段流程对其进行了微调。在第一阶段,我们在一个覆盖范围更广、规模更大的数据集上对完整模型进行微调,其中包括一些噪声较多但领域多样的数据,以建立广泛的翻译能力。这也是为了让模型具备其原本并不流利的语言能力所必需的。在第二阶段,我们使用 LoRA 在一个更小、经过高度筛选、格式多样的数据集上进一步微调模型,并特别关注格式保留和风格一致性。通过多项消融实验,我们发现这种两阶段流程是有效的。

推理效率

我们能够使用训练后量化(PTQ)对 Sarvam-Translate 进行量化,利用一个庞大且多样的校准数据集来确保稳健的 8 位推理性能。推理系统经过精细调优,可在 NVIDIA NIM 上使用 TensorRT 引擎运行,利用完整的 FP8 内核来提升吞吐量和效率。这一优化配置已可在我们的 API 商店中使用,并可在仪表板中试用。

已知局限

虽然该模型支持跨多种任务的 22 种语言,但性能会因语言而异。这些差异源于预训练数据、后训练资源以及每种语言在分词器中的代表性之间的平衡。文档翻译是一项关键能力,但对于某些语言,如博多语、多格拉语、克什米尔语、曼尼普尔语、桑塔利语、梵语和信德语,性能较为有限,我们观察到这些语言的翻译质量较低,并且偶尔会出现输出不完整的情况。

对于支持较好的语言,该模型在大多数文档格式上表现良好。然而,它并未在长篇 LaTeX 或 HTML 文档上进行过广泛训练。因此,在非常大的 .tex 文件或 .html 文件中,它有时可能会遗漏标签或其他结构元素。为保持准确性,我们建议在可能的情况下,将大型代码或 LaTeX 文件拆分为较小的部分,然后分别翻译各个部分。

此外,我们偶尔观察到某些输出可能包含音译或语码混合片段,尤其是在低资源或高度屈折的语言中。

结论

过去几年,翻译技术取得了长足进步。借助 Sarvam-Translate,我们将这些进步扩展到 22 种印度语言,确保它们在广泛的内容类型中都能得到体现。

这项成就之所以特别有意义,在于该模型能够处理真实世界中混合格式的文档,例如 Markdown、HTML、科学符号、代码等。该模型不仅保留结构,还尊重上下文、风格和性别细微差别,确保每一处翻译都真实自然。

我们相信,这是以下方面的关键推动因素:

  • 让网络内容以印度语言更易获取
  • 以母语支持教育和研究
  • 赋能政府和公共服务,以公民偏好的语言触达他们
  • 大规模促进印度语言数字内容的创作

这仅仅是开始。随着内容格式不断演变,我们的使命始终如一:确保印度语言在数字领域得到充分体现。

我们始终致力于通过与开源社区、研究人员、行业和政府合作伙伴协作来推进这项工作,让所有 22 种印度语言都能获得高质量翻译。

我们邀请您探索 Sarvam-Translate,试用它,向我们提供反馈,并与我们一同塑造印度语言技术的下一个前沿。

来源:Sarvam AI · sarvam.ai