1.基本を理解
読み方・用語解説- 読み方
- じげんさくげん
- 英語名
- Dimensionality Reduction
- 提唱者・年代
- 統計・パターン認識の古典的手法(PCAは1900年代初期に開発され、現在も使用)
💡 豆知識——特徴量(変数)の“次元”を“削る”。情報量をなるべく落とさないのがコツ。
【セットで覚えたい関連用語】
2.意味(定義)と例え話
データの情報をなるべく損なわずに特徴を抽出し、特徴量の次元を減らして計算負荷を軽くする教師なし学習の手法。
「特徴量が多いほど計算とメモリが増え、過学習も起きやすい」(次元の呪い)という問題への対策として発展した。
100ページのレポートを“大事な3つだけ”の要点に要約するのと同じ。全部は持たずに本質だけ残して、持ち運べるようにしてるんだ。
計算量・メモリ負荷の削減、高次元データの2D/3D可視化、ノイズ除去に使われる。学習の前処理としても活用。
「情報損失を最小限に/計算量削減・可視化に使う/教師なし」が得点セット。正規化との違いに注意!
3.直前に理解(Q&A)
8問Q1. 次元削減とは?最頻出
情報の損失を最小限に抑えながら特徴量(変数)の数を減らす手法。計算量削減や可視化に用いる。
Q2. 何への対策?最頻出
次元の呪い。特徴量が増えると計算・メモリが膨大になり、過学習リスクも高まるため。
Q3. 代表的な手法は?頻出
PCA(主成分分析)。データの“変動の大きさ”が大きい順に新しい特徴量(主成分)へ変換する。
Q4. 利用の目的は?頻出
計算量・メモリ負荷の削減と、高次元データの2D/3D可視化。
Q5. 情報は完全に消える?頻出
いいえ。「利用する情報の損失を最小限に抑えながら」減らす。完全に捨てるわけではない。
Q6. 「次元削減は教師あり学習」は正しい?ひっかけ
誤り。ラベルを使わない教師なし学習の代表的な手法。
Q7. 次元削減と正規化の違いは?混同注意
次元削減=特徴量の“数を減らす”。正規化=値の範囲(分布)を整える前処理。目的が違う。
Q8. 位置づけは?親と子
機械学習(教師なし)⊃次元削減。他の学習の前処理として使われることが多い。
4. まとめ
次元削減は、情報の損失を最小限に抑えて特徴量の数を減らし、計算を軽くする教師なし学習の手法。