1.基本を理解
読み方・用語解説- 読み方
- ひょうじゅんか
- 英語名
- Standardization
- 提唱者・年代
- 統計・機械学習の標準前処理
💡 豆知識——“standardize=標準にする”。zスコア標準化とも。各特徴量が“平均0・標準偏差1”の共通言語になる。
【セットで覚えたい関連用語】
平
平均中心を揃える値。標
標準偏差スケールを揃える値(No.224)。正
正規化0〜1のような範囲に押し込む手法(姉妹技)。2.意味(定義)と例え話
一言で言うと?
特徴量の平均を0、標準偏差を1になるように変換する手法。単位・尺度の異なる特徴量で距離や勾配を用いるモデルに用いる。
背景・歴史的流れ
標準前処理。“cm・円・歳”と単位がバラバラの特徴量はスケールが違う——揃えることで、勾配ベースの学習が安定し、距離ベースのモデルが公平になる。
身近な例え話
生徒の成績を“偏差値”に換算——テストごとに基準が違っても、“平均から何ポイントずれているか”で比較できる。
AIとの関係
k-NN・SVM・ニューラルネットなど、学習前の標準ステップ。
おすすめの活用法・注目ポイント
「平均0・標準偏差1/訓練データで推定し、テストにも適用」が鉄板。
3.直前に理解(Q&A)
7問Q1. 標準化とは?最頻出
特徴量の平均を0、標準偏差を1になるように変換する手法。
Q2. 目的は?最頻出
学習の収束を安定させ、距離・勾配ベースのモデルを公平にする。
Q3. 式は?頻出
(x − 平均) ÷ 標準偏差。
Q4. 「テストデータを先に標準化して、学習する」は正しい?ひっかけ
誤り。平均・標準偏差は“訓練データ”で推定し、テストデータには適用する(情報漏れ防止)。
Q5. 正規化との違いは?混同
正規化は0〜1のような範囲に押し込む。標準化は平均0・標準偏差1。
Q6. 使う場面は?頻出
k-NN、SVM、ニューラルネットワーク、ロジスティック回帰など。
Q7. 位置づけは?親と子
データ前処理 ⊃ 標準化。
4. まとめ
標準化=特徴量の平均を0、標準偏差を1に変換する手法。スケールを揃えて、学習を安定させる。