案例库 · 研发与科研 · 技术决策 · 2017
谷歌大脑弃用循环,让每个词都能关注每个词
Transformer 用自注意力取代循环,训练速度大幅提升,在极少的计算开销下就超越了以往的翻译模型。
Google Brain
那一手
2017年的序列模型大多基于循环或卷积架构,它们一次只能处理序列中的一个片段。循环迫使模型必须先完成第一步,才能进行第二步,因此学习长距离上下文既慢又难以在硬件上并行化。
Transformer 借鉴了注意力机制,并将其发挥到极致:完全抛弃循环,让每个位置在一个操作中与其他所有位置进行对比。每个词在进入下一阶段前,可以权衡其他每个词的重要性。
由于整个序列可以并行处理,训练能够更轻松地扩展到多块 GPU。在 WMT 2014 英德翻译任务上,模型比此前最佳成绩提升了超过 2 个 BLEU 点;在英法任务上,仅用 8 块 GPU 训练 3.5 天就创下单模型记录——训练成本仅为当时领先模型的一小部分。
这一洞察是简化而非堆砌:通过移除顺序瓶颈,网络能够以较低成本、大规模地学习长距离依赖关系。
为什么管用
- 注意力机制允许每个词在一步并行操作中与所有其他词建立上下文关联,无论它们相距多远。
- 并行处理意味着模型训练更快,并更高效地利用现有硬件。
- 架构具备泛化能力,无需针对任务调整就能在翻译和句法分析上取得优异结果。
- 移除循环是消除结构性瓶颈,而非仅仅调参,这种架构改动带来了全面收益。
值了多少让每个词都能关注每个词神来之笔
可以搬走什么
用并行取代串行是结构性的胜利——架构,而非仅仅数据,决定了你能学到的上限。
后来呢
Transformer 成为几乎所有现代语言模型(包括 2020 年代的大型对话模型)的基础架构,因为它能随数据和计算规模扩展,而循环网络则难以做到。用并行注意力取代循环,是现代软件中影响最深远的一次架构决策之一。
资料来源
发现哪里写错了?告诉我们。