Transformer
Attention だけで系列を処理するアーキテクチャ。 Vaswani らが 2017 年に提案し、現在の LLM の基盤になっている。
何を捨てたか#
論文の題名どおり、再帰も畳み込みも使わない。
| 捨てたもの | 得たもの |
|---|---|
| 再帰(RNN) | 並列計算。系列全体を同時に処理できる |
| 畳み込み | 任意の位置間の直接的な結合 |
RNN が の逐次ステップを要したのに対し、 Transformer は ステップで全位置を関係づける。 GPU で完全に並列化できることが、 大規模化を可能にした決定的な要因。
構成#
入力 → [埋め込み + 位置情報]
→ [Self-Attention → 残差 + 層正規化]
→ [フィードフォワード → 残差 + 層正規化] × N層
→ 出力- Self-Attention … トークン間の関係を計算
- フィードフォワード … 各位置で独立に非線形変換
- 残差接続 … 勾配を通す(ResNet と同じ発想)
- 位置エンコーディング … 順序の情報を注入
計算量の代償#
Self-Attention は全トークン対を計算するので
系列長の 2 乗。これが長文脈の壁になっており、 FlashAttention(メモリ効率化)、疎な Attention、 状態空間モデル(Mamba など)といった改良が続いている。
応用の広がり#
言語だけでなく、画像(ViT)、音声、タンパク質構造(AlphaFold)など 系列・集合として表せるものに広く適用されている。 帰納バイアスが弱い代わりに汎用性が高いという性格。
参考文献#
- Ashish Vaswani et al. Attention Is All You Need. NeurIPS, 2017. https://arxiv.org/abs/1706.03762
- Dan Jurafsky, James H. Martin. Speech and Language Processing, 3rd ed. draft.(全文公開) https://web.stanford.edu/~jurafsky/slp3/
- Alexey Dosovitskiy et al. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ICLR, 2021. https://arxiv.org/abs/2010.11929