1.基本を理解
読み方・用語解説- 読み方
- かいそうてきくらすたりんぐ
- 英語名
- Hierarchical Clustering
- 提唱者・年代
- Sneath & Sokal(1973)に由来する古典的手法
💡 豆知識——“階層=家系図”——“近い順にグループをくっつけていき、全員が1群になるまで”の履歴をツリーで残す。
【セットで覚えたい関連用語】
2.意味(定義)と例え話
データの階層構造(併合や分割の階層)を樹形で表現するクラスタリング。デンドログラムを見てクラスタ数をあとから決められる。
Sneath & Sokal(1973)に由来。“併合(agglomerative:下からくっつける)”や“分割(divisive:上から分ける)”の過程を残し、“クラスタ数はあとから決められる”点がk-meansと対照。
家系図——“親戚→一族→本家”と、近い順にくっつけていった履歴が一本のツリーに残る、あの感じ。
顧客セグメント・文書クラスタリング・系統解析など、“階層構造を知りたい”場面で使われる。
「クラスタ数をあとから決められる/併合か分割/デンドログラムで可視化」が鉄板。
3.直前に理解(Q&A)
7問Q1. 階層的クラスタリングとは?最頻出
データの階層構造(併合や分割の階層)を樹形で表現するクラスタリング。
Q2. 最大の特徴は?最頻出
クラスタ数を“あとから”決められる(デンドログラムを見て決める)。
Q3. 方式は?頻出
併合型(agglomerative:下からくっつける)/分割型(divisive:上から分ける)。
Q4. 「k-meansはkをあとから決める手法」は正しい?ひっかけ
誤り。k-meansはkを“事前に”決める。あとから決めるのが階層的クラスタリング。
Q5. 何を可視化する?頻出
デンドログラム(併合の順序と結合高さのツリー図)。
Q6. いつ・誰?頻出
Sneath & Sokal(1973)。
Q7. 位置づけは?親と子
クラスタリング ⊃ 階層的クラスタリング(↔k-means:非階層的)。
4. まとめ
階層的クラスタリング=併合・分割の階層を樹形で表現するクラスタリング。クラスタ数はあとから決められる。