Wikipedia のクラスタリング パート II
前の演習で作成したパイプラインを実際に使ってみましょう。人気のある Wikipedia 記事の tf-idf 単語頻度を格納した配列 articles と、その記事タイトルのリスト titles が与えられています。パイプラインを使って Wikipedia 記事をクラスタリングしてください。
前の演習の解答が読み込まれているため、TruncatedSVD と KMeans を連結した Pipeline pipeline がすでに用意されています。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
pandasをpdとしてインポートします。- 単語頻度配列
articlesにパイプラインを適合させます。 - クラスタラベルを予測します。
- 記事タイトルのリスト
titlesとクラスタラベルを対応づけるため、列にlabelsとtitlesを持つ DataFramedfを作成します。これはすでに用意されています。 dfの.sort_values()メソッドを使って、'label'列で並べ替え、結果を表示します。- 提出して、Wikipedia ページの見事なクラスタリング結果を少し観察してみましょう!
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)