Wikipedia記事のクラスタリング その1
動画で見たとおり、TruncatedSVDは単語出現頻度の配列のようなcsr_matrix形式の疎行列に対してもPCAを実行できます。TruncatedSVDとk-meansの知識を組み合わせて、Wikipediaの人気ページをいくつかクラスタリングしてみましょう。この演習ではパイプラインを構築します。次の演習では、それを実際のWikipedia記事の単語出現頻度配列に適用します。
TruncatedSVDの後にKMeansを実行するPipelineオブジェクトを作成しましょう(今回は単語出現頻度の行列をあらかじめ計算済みなので、TfidfVectorizerは不要です)。
今回使用するWikipedia データセットはこちらから取得したものです。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
- 以下をインポートしてください。
sklearn.decompositionからTruncatedSVDsklearn.clusterからKMeanssklearn.pipelineからmake_pipeline
n_components=50を指定してsvdという名前のTruncatedSVDインスタンスを作成してください。n_clusters=6を指定してkmeansという名前のKMeansインスタンスを作成してください。svdとkmeansの構成でpipelineという名前のパイプラインを作成してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____