专注于某一特定领域
高精度AI翻译
想要发展
多语言聊天机器人
准确性
想加注
在对话和问答环节中,
我想预测这个说法。
东南亚国家的语言
通信
翻译语料库
看着
按行业或专业领域划分
专属
请参阅术语表
我想做
自20世纪80年代以来,我们一直在开发机器翻译,
我们拥有丰富的经验,能够为大型企业提供双语语料库。
凭借多年的经验和专业知识,为解决问题做出贡献
我们提供多语言语料库。
旅游、医疗、法律、金融、知识产权等。
持有跨多个领域的平行语料库。
新闻发布会、问答环节及其他对话形式
我们还提供翻译语料库。
我们能提供超过100万对翻译语料库!
你正在使用的翻译支持工具
它也可以作为翻译记忆。
除了日文翻译成英文的数据外,
从英语到东南亚语言和稀有语言
我们持有一份翻译的平行语料库。
平行语料库由每种语言的母语者决定。
因为它是翻译的,所以每种语言都独一无二。
细节和陈词滥调都被反映出来。
除了字段和数据类型外,
既然我们也管理翻译方向,
我们可以提取您所需的翻译语料库。
我们还提供多语言技术术语的创建。
我们为工厂和工地的安全工作提供了重要的防护措施,采用行业特定的对话形式呈现。
我们涵盖了广泛的领域,从农业、林业和渔业等初级产业,到经济、金融、信息技术和核能等领域。
我们提供外国人入境和居住日本所需的多语言数据,包括与入境和居留身份相关的法律,以及医疗机构的医疗面试。
一家大型电信公司的研究部门
/广播站研究所
/基于人工智能的机器翻译引擎开发公司
以及更多
在机器翻译和多语言生成式人工智能的开发和调优中,对双语语料库的需求正在稳步增长。此外,当译者开始涉足新领域的翻译时,拥有内部积累的翻译记忆极大提升了翻译工作的效率。另一方面,内部收集系统化的双语语料库并不容易;外部获取数据,专注于开发预期交付物和翻译工作,效率更高。
以下六点是选择平行语料库的关键点。
1)语言组合
2)场
3)质量
4)数量
5)数据类型
6)上下文的有无
第一种“语言组合”指译者翻译的语言对或机器翻译训练的语言对是日语与英语,还是日语与中文。同样,在注册翻译支持工具的翻译记忆时,“语言组合”被视为最重要的因素。此外,在寻求更自然表达时,确定哪种语言是原文也是一个重要因素。例如,即使称之为“日英平行语料库”,自然会注意到将日语来源翻译成英语和英语来源翻译成日语之间在英语表达流利度和翻译背景上存在差异。
2)中的“领域”指的是旅游、医疗保健、法律、经济、科学与技术等领域。通过获取来自需要准确领域的机器学习数据,可以加快开发速度。在构建提升特定领域机器翻译准确度的语言模型时,估计的有效性约为10万对。不用说,领域在从双语翻译语料库中创建技术术语词典时也非常重要。就我们而言,日本所需的领域曾以旅游为导向国家的名义专注于入境旅游,而医疗领域则需要双语语料库来加强对入境游客和外国人的医疗服务。此外,需求在几年内转向商业领域,这些领域记录用于商务演示和解释、会议和活动讲座以及后续问答环节的演示材料。
第三部分中,“质量”指的是准确性,这取决于平行语料库的创建方式。最好由人工翻译数据,如果使用机器翻译且未经过人工检查或校正,质量自然会下降。此外,即使在手动翻译数据中,如果一句话的翻译被翻译成两个或更多句子,且原文与译文必须对应一个句子,这会影响质量。此外,如果翻译过于简略,则不能被视为高质量的平行语料库。
第4点的“数量”足以让译者在特定领域注册数万对平行语料库,以便注册到内部使用的翻译支持工具的翻译存储器或词汇词典中。对于特定领域的机器学习,如开发机器翻译引擎,据说10万对语料库已足够有效。另一方面,开发通用机器翻译引擎则需要数千万对语料库。因此,所需并行语料库数量因应用而异。
在第5节中,“数据类型”意味着用于创建平行语料库的文件是以下之一:报告/白皮书,或演示/新闻发布会/问答。如果你想机器学习书面语言,可以使用报告或白皮书;如果你想机器学习口语,可以使用由演示、新闻发布会和问答创建的转录语料库。我们的并行语料库详细管理属性,因此可以按数据类型提取平行语料库。
6)中的“有无上下文”指的是多个句子之间是否存在语义联系。具体来说,词典中列出的例句只包含特定的词头词,且与其他例子没有上下文关系。因此,它被判断为“上下文性”的。相比之下,报告由多句描述特定事件组成,因此被视为“上下文性”。同样,在新闻发布会和问答环节中,多位发言者轮流交谈,因此可以说“有上下文”。不仅限于机器翻译,为了用聊天机器人生成更准确的答案,现在比以往任何时候都更需要在机器学习训练的转录语料库中包含“上下文”。
结论
选择并行企业时,你需要根据预期用途考虑上述第1点到第6点。尤其是在针对特定领域进行机器学习时,必须考虑质量、数据类型和上下文的需求。要使用适合您目标的并行语料库,请先查看我们的免费样本数据。