G検定 × 解説記事

階層的クラスタリングって結局なんなの?🌳

“グループ分けの‘階層’をツリーで表現するクラスタリング”——クラスタ数はあとから決められる。

1.基本を理解

読み方・用語解説
読み方
かいそうてきくらすたりんぐ
英語名
Hierarchical Clustering
提唱者・年代
Sneath & Sokal(1973)に由来する古典的手法

💡 豆知識——“階層=家系図”——“近い順にグループをくっつけていき、全員が1群になるまで”の履歴をツリーで残す。

【セットで覚えたい関連用語】

デ
デンドログラム併合の履歴をツリー図で可視化するもの。
k
k-means法対極の“kを先に決める”非階層クラスタリング。
併
併合(agglomerative)下から順に群をくっつける方式。

2.意味(定義)と例え話

一言で言うと?

データの階層構造(併合や分割の階層)を樹形で表現するクラスタリング。デンドログラムを見てクラスタ数をあとから決められる。

背景・歴史的流れ

Sneath & Sokal(1973)に由来。“併合(agglomerative:下からくっつける)”や“分割(divisive:上から分ける)”の過程を残し、“クラスタ数はあとから決められる”点がk-meansと対照。

身近な例え話

家系図——“親戚→一族→本家”と、近い順にくっつけていった履歴が一本のツリーに残る、あの感じ。

AIとの関係

顧客セグメント・文書クラスタリング・系統解析など、“階層構造を知りたい”場面で使われる。

おすすめの活用法・注目ポイント

「クラスタ数をあとから決められる/併合か分割/デンドログラムで可視化」が鉄板。

3.直前に理解(Q&A)

7問

Q1. 階層的クラスタリングとは?最頻出

データの階層構造(併合や分割の階層)を樹形で表現するクラスタリング。

Q2. 最大の特徴は?最頻出

クラスタ数を“あとから”決められる(デンドログラムを見て決める)。

Q3. 方式は?頻出

併合型(agglomerative:下からくっつける)/分割型(divisive:上から分ける)。

Q4. 「k-meansはkをあとから決める手法」は正しい?ひっかけ

誤り。k-meansはkを“事前に”決める。あとから決めるのが階層的クラスタリング。

Q5. 何を可視化する?頻出

デンドログラム(併合の順序と結合高さのツリー図)。

Q6. いつ・誰?頻出

Sneath & Sokal(1973)。

Q7. 位置づけは?親と子

クラスタリング ⊃ 階層的クラスタリング(↔k-means:非階層的)。

4. まとめ

階層的クラスタリング=併合・分割の階層を樹形で表現するクラスタリング。クラスタ数はあとから決められる。

ハッシュタグ #G検定 #生成AIパスポート #階層的クラスタリング #デンドログラム #併合 #クラスタリング #教師なし学習 #DX勉強 #資格勉強 #機械学習