机器翻译使用计算机系统把源语言内容转换成目标语言。输出可以作为理解或后续语言工作的输入,但是否适合直接使用,需要结合文本与用途判断。
理解其工作方式,有助于区分“系统生成了句子”和“译文已经经过核实”。两者是不同状态。
不同方法怎样利用语言信息
早期的一类方法依靠词典和明确的语言规则,按规则处理词形与句法。统计方法则从已有双语数据中估计对应关系,选择可能的目标表达。
神经机器翻译通过训练模型学习语言之间的关系,再生成目标文本。它并不是逐词查字典,也不意味着每次都在检索一条已批准译文。不同系统可能组合多种方法,具体行为取决于模型、数据和使用方式。
AWS的机器翻译概述可作为这些基本术语的参考;本文不比较当前供应商的排名或各语种效果。
输入和使用条件会影响输出
同一系统面对不同主题、语言对和源稿质量,结果可能不同。专业术语、上下文不足、含混指代或源文错误,都需要在评估中关注。
如果系统支持术语或参考内容,应确认这些输入怎样被使用。提供了词表不等于每处都会正确应用,更不能把模型名称当作质量证明。
流畅的句子仍可能有错误
检查时需要回到源文,关注意思、遗漏、数字、否定、条件和术语,而不只看目标语言是否通顺。一句读起来自然的话,仍可能表达了不同事实。
需要人工译后编辑时,应事先说明目标质量、处理范围和验收方式。修改工作量也应基于实际样本评估,不默认机器输出总能缩短整个项目。
将技术选择放在交付要求里
能否使用某个系统,还涉及资料许可、访问方式、文件格式和项目边界。先确认允许处理的内容,再判断生成与检查如何连接。
何时使用机器翻译侧重项目适用性判断;技术与质量支持说明工具与语言检查的关系。技术提供一种处理方式,最终仍需明确谁确认内容可以使用。