1.基本を理解
読み方・用語解説- 読み方
- クラスターリング
- 英語名
- Clustering
- 提唱者・年代
- 教師なし学習の古典的手法(1960年代以降にk-meansなどが確立され、現在も使用)
💡 豆知識——cluster=「塊・集まり」。似たものを“塊”にする、という直感で覚えよう。
【セットで覚えたい関連用語】
2.意味(定義)と例え話
教師なし学習の代表的な手法。データを似た特徴ごとに自動的にグループ分類する(例:顧客セグメント化)。
大量のラベルなしデータから、データマイニングの心臓部として「グループ」を見つけると期待されて発展した。
洗濯物を“色や素材”で勝手に分けるのと同じ。誰かに答えを教わるのではなく、距離(似ている度合い)を見て似たもの同士をまとめちゃうんだ。
顧客セグメント化、異常検知(外れ値の発見)、文書・ログの分類など、ビジネス分析に広く使われる。
「ラベル不要・距離や類似性が基準・教師なしの代表」の3点セットが鉄板。分類との違いも一緒に押さえておこう!
3.直前に理解(Q&A)
8問Q1. クラスタリングとは?最頻出
正解ラベルを用いず、データ間の距離や類似性に基づいて似たもの同士をグループ化する教師なし学習手法。
Q2. 分類(classification)との違いは?最頻出
分類=既知のカテゴリにラベル付きで学習して当てる(教師あり)。クラスタリング=ラベルなしでグループを“発見”する(教師なし)。
Q3. グループ分けの基準は?頻出
データ間の距離や類似性。近い(似ている)もの同士を同じグループにする。
Q4. 利用例は?頻出
顧客セグメント化、異常検知、文書のグループ分け、レコメンドの補強など。データマイニングでも利用される。
Q5. k-meansとは?頻出
グループ数kを人間が指定し、データをk個の塊に自動で分ける典型的なアルゴリズム。
Q6. 「クラスタリングには正解ラベルが必要」は正しい?ひっかけ
誤り。教師なし学習なのでラベルは不要。ラベルを使うのは分類(教師あり)。
Q7. クラスタリングと次元削減の違いは?混同注意
クラスタリング=似たものをグループ化する。次元削減=特徴量の数を減らす。どちらも教師なしだが目的が異なる。
Q8. 位置づけは?親と子
機械学習 ⊃ 教師なし学習 ⊃ クラスタリング。データマイニングの中心手法でもある。
4. まとめ
クラスタリングはラベルなしで似たものをグループ化する教師なし学習の代表。顧客セグメント化が定番。