神经机器翻译
约 7 分钟
神经机器翻译是当前最先进的翻译技术。它用深度学习模拟人脑,让机器自己学会「理解」语言。
核心架构:编码器-解码器
想象翻译的过程:你读到一句英文,先在脑子里「理解」它的意思,然后用中文「表达」出来。神经翻译模仿这个过程:
- 编码器(Encoder):读入源语言,把它编码成一个数学向量。这个向量包含了整句话的意思
- 解码器(Decoder):从向量出发,逐词生成目标语言
注意力机制(Attention):
早期的神经翻译有个问题:编码器把整句话压缩成一个固定长度的向量,长句子装不下。2015 年,注意力机制解决了这个问题。
注意力机制让解码器在翻译每个词时,「回看」源句的不同部分。翻译「The cat sat on the mat」中的「猫」时,注意力集中在「cat」上;翻译「坐」时,集中在「sat」上。就像人翻译时会回头看原文。
Transformer(2017):
Google 在 2017 年发表了 Transformer 架构,彻底改变了机器翻译。Transformer 不用循环神经网络(RNN),而是完全用注意力机制。
- 训练更快(可以并行处理)
- 能处理更长的句子
- 翻译质量大幅提升
Transformer 后来成了所有大语言模型(GPT、BERT、GLM)的基础架构。
神经翻译的优势:
- 译文更流畅自然
- 能考虑长距离上下文
- 不需要太多特征工程
- 可以做零样本翻译
仍有挑战:
- 需要大量计算资源(GPU)
- 训练数据仍然依赖平行文本
- 文化相关的翻译仍然困难
- 「幻觉」:偶尔生成原文没有的内容
练习:用 Google 翻译或 DeepL 翻译一段中文到英文,再翻译回来,看看意思偏了多少。这就是「回译」测试。
小纸条
神经机器翻译的核心架构是什么?注意力机制解决了什么问题?
登录 后可看答案