Wikipedia のクラスタリング パート I
動画で見たように、TruncatedSVD は csr_matrix 形式の疎行列(単語頻度行列など)に対して PCA を実行できます。TruncatedSVD と k-means の知識を組み合わせて、Wikipedia の人気ページをクラスタリングしてみましょう。この演習では、パイプラインを構築します。次の演習で、いくつかの Wikipedia 記事の単語頻度行列に適用します。
TruncatedSVD の後に KMeans を続けた Pipeline オブジェクトを作成してください。(今回は単語頻度行列をあらかじめ用意してあるため、TfidfVectorizer は不要です。)
使用する Wikipedia データセットはこちらから取得しました。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
- 次をインポートします:
sklearn.decompositionからTruncatedSVD。sklearn.clusterからKMeans。sklearn.pipelineからmake_pipeline。
n_components=50を指定して、svdという名前のTruncatedSVDインスタンスを作成します。n_clusters=6を指定して、kmeansという名前のKMeansインスタンスを作成します。svdとkmeansから成るpipelineという名前のパイプラインを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____