始める無料で始める

Wikipedia記事のクラスタリング その1

動画で見たとおり、TruncatedSVDは単語出現頻度の配列のようなcsr_matrix形式の疎行列に対してもPCAを実行できます。TruncatedSVDとk-meansの知識を組み合わせて、Wikipediaの人気ページをいくつかクラスタリングしてみましょう。この演習ではパイプラインを構築します。次の演習では、それを実際のWikipedia記事の単語出現頻度配列に適用します。

TruncatedSVDの後にKMeansを実行するPipelineオブジェクトを作成しましょう(今回は単語出現頻度の行列をあらかじめ計算済みなので、TfidfVectorizerは不要です)。

今回使用するWikipedia データセットはこちらから取得したものです。

この演習はコースの一部です

Pythonで学ぶ教師なし学習

コースを見る

演習の手順

  • 以下をインポートしてください。
    • sklearn.decompositionからTruncatedSVD
    • sklearn.clusterからKMeans
    • sklearn.pipelineからmake_pipeline
  • n_components=50を指定してsvdという名前のTruncatedSVDインスタンスを作成してください。
  • n_clusters=6を指定してkmeansという名前のKMeansインスタンスを作成してください。
  • svdkmeansの構成でpipelineという名前のパイプラインを作成してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____

# Create a TruncatedSVD instance: svd
svd = ____

# Create a KMeans instance: kmeans
kmeans = ____

# Create a pipeline: pipeline
pipeline = ____
コードを編集して実行