Wikipedia記事のクラスタリング その2
それでは、前の演習で作成したパイプラインを実際に使ってみましょう。いくつかの有名なWikipedia記事のtf-idfによる単語出現頻度を格納した配列articlesと、それらのタイトルを格納したリストtitlesがあります。先ほどのパイプラインを使って、Wikipediaの記事をクラスタリングしましょう。
前の演習の解答はあらかじめ読み込まれているため、TruncatedSVDとKMeansを連結したパイプラインpipelineをそのまま使用できます。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
pandasをpdとしてインポートしてください。- パイプラインを単語の出現頻度配列
articlesにフィットさせてください。 - クラスタラベルを予測してください。
labelsとtitlesを列とするデータフレームdfを作成し、クラスタラベルと記事タイトルのリストtitlesを対応付けます。この部分はすでに実装済みです。dfの.sort_values()メソッドを使って'label'列でデータフレームを並べ替え、結果を表示してください。- コードを実行し、Wikipedia記事のクラスタリング結果を確認してみましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)