前の演習のデンドログラムを見て、データにはいくつのクラスタがあるように見えますか?
デンドログラムは変数 dn に保存されています。plt.show() を使ってデンドログラムを表示してください。
dn
plt.show()
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
ニュース記事を分類できるようになる前に、まずクラスタリングの基本を学びます。本章では、教師なし学習と呼ばれる Machine Learning アルゴリズムの一群を紹介し、その中でも代表的な手法であるクラスタリングを取り上げます。広く使われている2つのクラスタリング手法――階層的クラスタリングと k-means クラスタリング――について学びます。最後に、クラスタリングを始める前に必要な基本的な前処理手順を確認します。
この章では、人気の高いクラスタリング手法である階層的クラスタリングと、その SciPy による実装に焦点を当てます。階層的クラスタリングの実行手順に加えて、データにいくつのクラスタが存在するのかという重要な問いに答えるための考え方を学びます。章の終わりには、階層的クラスタリングの限界と、利用時に考慮すべきポイントについて議論します。
現在の演習
この章では、別のクラスタリング手法である k-means クラスタリングと、その SciPy による実装を紹介します。k-means クラスタリングは、前章で取り上げた階層的クラスタリングの最大の欠点を克服します。デンドログラムは階層的クラスタリングに特有であるため、本章では k-means を実行する前にクラスタ数を見つける方法の一つを扱います。最後に、k-means クラスタリングの限界と、このアルゴリズムを使う際の注意点について議論します。
2つの代表的なクラスタリング手法に慣れてきたところで、この章ではそれらを実世界の課題に適用していきます。まずは画像の支配的な色を見つけるプロセスを説明し、続いて導入で触れたニュース記事のクラスタリング問題に進みます。章の最後では、可視化が難しくなる多変量でのクラスタリングについて取り上げます。