人工知能
データから規則を学び取る手法。学習とは最適化であり、勾配法が中核にある。
データから規則を学び取る手法を中心にまとめる。
構成#
| 分野 | 内容 |
|---|---|
| 機械学習 | 学習の枠組みと基本概念 |
| ニューラルネットワーク | 層を重ねた関数近似 |
| 深層学習 | CNN、RNN、Transformer |
| 大規模言語モデル | LLM の仕組み |
| 強化学習 | 試行錯誤から方策を学ぶ |
| 画像生成モデル・音声モデル | 生成の技術 |
| AIシステム | RAG、エージェント、MCP |
最適化との関係#
学習とは最適化である。 損失関数を最小化するパラメータを探す。
そのため勾配に基づく最適化、 特にSGD と Adam が学習の中核にある。
違いは規模で、パラメータが に及ぶため、 二階の手法が使えない。
参考文献#
- Ian Goodfellow, Yoshua Bengio, Aaron Courville. Deep Learning. MIT Press, 2016.(全文公開) https://www.deeplearningbook.org/
- Kevin P. Murphy. Probabilistic Machine Learning: An Introduction. MIT Press, 2022. https://probml.github.io/pml-book/book1.html
- Trevor Hastie, Robert Tibshirani, Jerome Friedman. The Elements of Statistical Learning, 2nd ed. Springer, 2009.(全文公開) https://hastie.su.domains/ElemStatLearn/
この階層のノート
機械学習 8 / 8 データから規則を推定し未知のデータに一般化する枠組み。経験誤差と汎化誤差の差が過学習の正体。 ニューラルネットワーク 7 / 7 線形変換と非線形関数を交互に重ねた関数近似器。表現力があることと学習できることは別問題。 深層学習 7 / 7 多層のニューラルネットワークによる学習。アーキテクチャの設計とは帰納バイアスの設計である。 大規模言語モデル 13 / 13 大量のテキストで学習した次トークン予測モデル。条件付き確率の連鎖を Transformer でモデル化したもの。 強化学習 6 / 6 試行錯誤で報酬最大化を学ぶ枠組み。正解ではなく報酬しか与えられない点が教師あり学習と異なる。 画像生成モデル 4 / 4 画像の分布を学習して標本を生成するモデル。高次元分布をどう扱いやすい形に分解するかで手法が分かれる。 音声モデル 4 / 4 音声を扱うモデル。テキストより2〜3桁長い系列をどう圧縮して扱うかが中心的な課題。 AIシステム 7 / 7 モデル単体ではなくモデルを組み込んだシステムの設計。確率的な出力をシステム側で吸収する。