支持构建大型语言模型,以开发和调优人工智能翻译引擎和生成式人工智能。

人工智能翻译引擎和生成式人工智能的发展,
调音必不可少
构建大型语言模型
我们会支持你。

  • 超过一百万对
  • 支持10多种语言
  • 丰富的交付记录
请在此索取样本

关于AI翻译与问答
解决你的机器学习问题!

  • 想开发专注于特定领域的高精度AI翻译

    专注于某一特定领域
    高精度AI翻译
    想要发展

  • 想提高多语言聊天机器人的准确性

    多语言聊天机器人
    准确性
    想加注

  • 想预测在对话或问答环节中该说什么

    在对话和问答环节中,
    我想预测这个说法。

  • 正在寻找一个与东南亚语言兼容的平行语料库

    东南亚国家的语言
    通信
    翻译语料库
    看着

  • 想为你的行业或专业领域专门制作一个词汇表

    按行业或专业领域划分
    专属
    请参阅术语表
    我想做

Koden公司的六大优势

  • 超过40年的经验

    超过40年的经验

    自20世纪80年代以来,我们一直在开发机器翻译,
    我们拥有丰富的经验,能够为大型企业提供双语语料库。
    凭借多年的经验和专业知识,为解决问题做出贡献
    我们提供多语言语料库。

  • 擅长专业领域

    擅长专业领域

    旅游、医疗、法律、金融、知识产权等。
    持有跨多个领域的平行语料库。
    新闻发布会、问答环节及其他对话形式
    我们还提供翻译语料库。

  • 超过一百万对

    超过一百万对

    我们能提供超过100万对翻译语料库!
    你正在使用的翻译支持工具
    它也可以作为翻译记忆。

  • 稀有语言

    稀有语言

    除了日文翻译成英文的数据外,
    从英语到东南亚语言和稀有语言
    我们持有一份翻译的平行语料库。

  • 自然表达

    自然表达

    平行语料库由每种语言的母语者决定。
    因为它是翻译的,所以每种语言都独一无二。
    细节和陈词滥调都被反映出来。

  • 半自定义

    半自定义

    除了字段和数据类型外,
    既然我们也管理翻译方向,
    我们可以提取您所需的翻译语料库。
    我们还提供多语言技术术语的创建。

支持这类专业领域

实施成就

一家大型电信公司的研究部门
/广播站研究所
/基于人工智能的机器翻译引擎开发公司
以及更多

常见问题解答

什么是“平行语料库”?
平行语料库是一组以两种或多种语言、一种语言和另一种语言组合翻译的句子集合。在基于人工智能的机器翻译引擎的发展中,能够保持上下文的高度重视。对于少于两种语言的单一语言,称为单语语料库。
平行语料库中共有多少词汇和组合?
我们提供最丰富的日语和英语选择。此外,我们支持英语与中文、西班牙语与法语,以及印尼语与葡萄牙语的组合。
如果我购买平行公司,使用有限制吗?
是的,有些并行语料库只能用于机器学习,也有些并行语料库可以发布在网站或教育材料上。对于后者,我们会在购买前讨论相关术语。
翻译语料库的最低购买单位或价格是多少?
据说机器学习需要大约10万对,我们的客户经常在该设备中购买。价格将根据用途和购买数量单独协商。
翻译语料库是如何交付的?
我们可根据要求提供文本文件(CSV、TSV等)或Excel文件。

选择平行语料库的关键点

选择平行语料库的关键点

在机器翻译和多语言生成式人工智能的开发和调优中,对双语语料库的需求正在稳步增长。此外,当译者开始涉足新领域的翻译时,拥有内部积累的翻译记忆极大提升了翻译工作的效率。另一方面,内部收集系统化的双语语料库并不容易;外部获取数据,专注于开发预期交付物和翻译工作,效率更高。

以下六点是选择平行语料库的关键点。
1)语言组合
2)场
3)质量
4)数量
5)数据类型
6)上下文的有无

第一种“语言组合”指译者翻译的语言对或机器翻译训练的语言对是日语与英语,还是日语与中文。同样,在注册翻译支持工具的翻译记忆时,“语言组合”被视为最重要的因素。此外,在寻求更自然表达时,确定哪种语言是原文也是一个重要因素。例如,即使称之为“日英平行语料库”,自然会注意到将日语来源翻译成英语和英语来源翻译成日语之间在英语表达流利度和翻译背景上存在差异。

2)中的“领域”指的是旅游、医疗保健、法律、经济、科学与技术等领域。通过获取来自需要准确领域的机器学习数据,可以加快开发速度。在构建提升特定领域机器翻译准确度的语言模型时,估计的有效性约为10万对。不用说,领域在从双语翻译语料库中创建技术术语词典时也非常重要。就我们而言,日本所需的领域曾以旅游为导向国家的名义专注于入境旅游,而医疗领域则需要双语语料库来加强对入境游客和外国人的医疗服务。此外,需求在几年内转向商业领域,这些领域记录用于商务演示和解释、会议和活动讲座以及后续问答环节的演示材料。

第三部分中,“质量”指的是准确性,这取决于平行语料库的创建方式。最好由人工翻译数据,如果使用机器翻译且未经过人工检查或校正,质量自然会下降。此外,即使在手动翻译数据中,如果一句话的翻译被翻译成两个或更多句子,且原文与译文必须对应一个句子,这会影响质量。此外,如果翻译过于简略,则不能被视为高质量的平行语料库。

第4点的“数量”足以让译者在特定领域注册数万对平行语料库,以便注册到内部使用的翻译支持工具的翻译存储器或词汇词典中。对于特定领域的机器学习,如开发机器翻译引擎,据说10万对语料库已足够有效。另一方面,开发通用机器翻译引擎则需要数千万对语料库。因此,所需并行语料库数量因应用而异。

在第5节中,“数据类型”意味着用于创建平行语料库的文件是以下之一:报告/白皮书,或演示/新闻发布会/问答。如果你想机器学习书面语言,可以使用报告或白皮书;如果你想机器学习口语,可以使用由演示、新闻发布会和问答创建的转录语料库。我们的并行语料库详细管理属性,因此可以按数据类型提取平行语料库。

6)中的“有无上下文”指的是多个句子之间是否存在语义联系。具体来说,词典中列出的例句只包含特定的词头词,且与其他例子没有上下文关系。因此,它被判断为“上下文性”的。相比之下,报告由多句描述特定事件组成,因此被视为“上下文性”。同样,在新闻发布会和问答环节中,多位发言者轮流交谈,因此可以说“有上下文”。不仅限于机器翻译,为了用聊天机器人生成更准确的答案,现在比以往任何时候都更需要在机器学习训练的转录语料库中包含“上下文”。

结论
选择并行企业时,你需要根据预期用途考虑上述第1点到第6点。尤其是在针对特定领域进行机器学习时,必须考虑质量、数据类型和上下文的需求。要使用适合您目标的并行语料库,请先查看我们的免费样本数据。

结束
阅读更多