過学習と汎化

過学習と汎化

執筆済 AI機械学習

訓練データに合わせすぎて、未知のデータで性能が落ちること。

Rˆ(θ)R(θ)

経験誤差は小さいのに汎化誤差が大きい状態。

バイアス・バリアンス分解#

𝔼[(yfˆ)2]=バイアス2表現力不足+バリアンスデータへの過敏さ+σ2避けられない誤差

古典的には、モデルを複雑にするとバイアスが減りバリアンスが増える。 両者の和が最小になる複雑さが最適、という U 字型の描像。

対策#

手法 内容
データを増やす 最も確実
正則化 L1/L2、Dropout、データ拡張
早期終了 検証誤差が悪化したら止める
モデルを小さくする 表現力を制限する
交差検証 汎化性能を正しく見積もる

二重降下#

深層学習では古典的な U 字型が成り立たないことがある。

パラメータ数を増やしていくと、 訓練誤差が 0 になる点(補間閾値)でテスト誤差が一度悪化し、 さらに増やすと再び改善する

テスト誤差:

Belkin らが整理したこの現象は、 「パラメータが多すぎると過学習する」という 古典的な理解が単純すぎることを示した。

過剰にパラメータを持つモデルが汎化する理由は 完全には解明されておらず、 最適化の暗黙の正則化などが候補として議論されている。

参考文献#

ノート一覧を閉じる