语言思辨前沿

神经机器翻译

7 分钟

神经机器翻译是当前最先进的翻译技术。它用深度学习模拟人脑,让机器自己学会「理解」语言。

核心架构:编码器-解码器

想象翻译的过程:你读到一句英文,先在脑子里「理解」它的意思,然后用中文「表达」出来。神经翻译模仿这个过程:

  1. 编码器(Encoder):读入源语言,把它编码成一个数学向量。这个向量包含了整句话的意思
  2. 解码器(Decoder):从向量出发,逐词生成目标语言

注意力机制(Attention):

早期的神经翻译有个问题:编码器把整句话压缩成一个固定长度的向量,长句子装不下。2015 年,注意力机制解决了这个问题。

注意力机制让解码器在翻译每个词时,「回看」源句的不同部分。翻译「The cat sat on the mat」中的「猫」时,注意力集中在「cat」上;翻译「坐」时,集中在「sat」上。就像人翻译时会回头看原文。

Transformer(2017):

Google 在 2017 年发表了 Transformer 架构,彻底改变了机器翻译。Transformer 不用循环神经网络(RNN),而是完全用注意力机制。

  • 训练更快(可以并行处理)
  • 能处理更长的句子
  • 翻译质量大幅提升

Transformer 后来成了所有大语言模型(GPT、BERT、GLM)的基础架构。

神经翻译的优势

  • 译文更流畅自然
  • 能考虑长距离上下文
  • 不需要太多特征工程
  • 可以做零样本翻译

仍有挑战

  • 需要大量计算资源(GPU)
  • 训练数据仍然依赖平行文本
  • 文化相关的翻译仍然困难
  • 「幻觉」:偶尔生成原文没有的内容

练习:用 Google 翻译或 DeepL 翻译一段中文到英文,再翻译回来,看看意思偏了多少。这就是「回译」测试。

小纸条

神经机器翻译的核心架构是什么?注意力机制解决了什么问题?

登录 后可看答案