拡散モデル
画像に少しずつノイズを加える過程を逆にたどって生成するモデル。
前向き過程#
元画像 に ステップかけてノイズを加える。
ではほぼ純粋な正規分布になる。 この過程は学習不要で、閉じた形で任意の に飛べる。
逆向き過程#
ノイズから画像に戻す方を学習する。 実際に学習するのは「加えられたノイズ を当てる」こと。
驚くほど単純な二乗誤差。 これが変分下界の(重み付けを変えた)形になっていることが DDPM の理論的な貢献。
なぜうまくいくのか#
「ノイズから画像を作る」という難問を、 「少しだけノイズを取る」という易しい問題を 回に分解している。
各ステップの変化が小さいので、 ガウス分布での近似が正当化され、学習も安定する。 GAN のような敵対的な不安定さがない。
代償と高速化#
生成に 回(元は 1000 回)のネットワーク評価が要る。
| 手法 | 内容 |
|---|---|
| DDIM | 決定的なサンプラー。50 ステップ程度に短縮 |
| 潜在拡散 | 低次元空間で拡散する |
| 蒸留 | 多ステップの結果を数ステップで再現するよう学習 |
スコアベースとの関係#
はスコア関数 と比例関係にある。
拡散モデルとスコアベース生成モデルは 同じものの別の定式化で、 連続時間の確率微分方程式として統一的に記述できる。
参考文献#
- Jonathan Ho, Ajay Jain, Pieter Abbeel. Denoising Diffusion Probabilistic Models. NeurIPS, 2020. https://arxiv.org/abs/2006.11239
- Jascha Sohl-Dickstein et al. Deep Unsupervised Learning using Nonequilibrium Thermodynamics. ICML, 2015. https://arxiv.org/abs/1503.03585
- Yang Song et al. Score-Based Generative Modeling through Stochastic Differential Equations. ICLR, 2021. https://arxiv.org/abs/2011.13456
- Jiaming Song, Chenlin Meng, Stefano Ermon. Denoising Diffusion Implicit Models. ICLR, 2021. https://arxiv.org/abs/2010.02502