语言思辨前沿

机器翻译简史

7 分钟

让机器翻译人类语言,是计算机科学最古老的梦想之一。70 年来,机器翻译经历了三个时代。

第一个时代:规则翻译(1950s-1980s)

思路:给机器一本词典加一套语法规则,让它逐词翻译再调整语序。

1954 年,乔治城大学做了第一次机器翻译实验:把俄语翻译成英语。6 条规则、250 个词,翻译了 49 个句子。结果令人兴奋,很多人以为再过 5 年机器翻译就完美了。

但现实很残酷:

  • 语言的规则太多了,例外比规则还多
  • 一个词有多个意思,机器不知道选哪个。「bank」是银行还是河岸?要看上下文
  • 不同语言语序差异大,逐词翻译行不通

到 1966 年,一份报告(ALPAC 报告)断言机器翻译短期内不可能成功,资金枯竭,进入寒冬。

第二个时代:统计翻译(1990s-2010s)

思路:不教机器规则,给它大量双语对照文本,让它自己学统计规律。

IBM 在 1993 年提出了统计机器翻译的数学模型。不再需要人工写规则,只要有足够的双语数据。Google 翻译在 2006 年用这种方法实现了大跨越,支持几十种语言。

统计翻译的核心:找最可能的翻译。P(翻译|原文) = 最大化。用大量平行文本计算这个概率。

优点:不需要语言学知识,效果随数据增加而提升。
缺点:需要大量双语数据,小语种做不到;逐句翻译不考虑全文语境;译文不够流畅。

第三个时代:神经翻译(2014-至今)

思路:用神经网络(深度学习)模拟人脑,让机器自己学会「理解」语言再翻译。

2014 年,Google 和蒙特利尔大学几乎同时发表了神经机器翻译的论文。2016 年 Google 翻译切换到神经网络系统,质量飞跃,被《纽约时报》称为「AI 的重大突破」。

神经翻译的特点:译文更流畅,能考虑更长距离的上下文,甚至能做零样本翻译(没见过 A-B 平行文本,但见过 A-C 和 C-B,就能翻译 A-B)。

练习:用翻译软件翻译同一段话,对比三年前和现在的结果,感受进步有多大。

小纸条

机器翻译经历了哪三个时代?各有什么特点?

登录 后可看答案