始める無料で始める

Wikipedia記事のクラスタリング その2

それでは、前の演習で作成したパイプラインを実際に使ってみましょう。いくつかの有名なWikipedia記事のtf-idfによる単語出現頻度を格納した配列articlesと、それらのタイトルを格納したリストtitlesがあります。先ほどのパイプラインを使って、Wikipediaの記事をクラスタリングしましょう。

前の演習の解答はあらかじめ読み込まれているため、TruncatedSVDとKMeansを連結したパイプラインpipelineをそのまま使用できます。

この演習はコースの一部です

Pythonで学ぶ教師なし学習

コースを見る

演習の手順

  • pandaspdとしてインポートしてください。
  • パイプラインを単語の出現頻度配列articlesにフィットさせてください。
  • クラスタラベルを予測してください。
  • labelstitlesを列とするデータフレームdfを作成し、クラスタラベルと記事タイトルのリストtitlesを対応付けます。この部分はすでに実装済みです。
  • df.sort_values()メソッドを使って'label'列でデータフレームを並べ替え、結果を表示してください。
  • コードを実行し、Wikipedia記事のクラスタリング結果を確認してみましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import pandas
____

# Fit the pipeline to articles
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})

# Display df sorted by cluster label
print(____)
コードを編集して実行