始める無料で始める

Wikipedia のクラスタリング パート II

前の演習で作成したパイプラインを実際に使ってみましょう。人気のある Wikipedia 記事の tf-idf 単語頻度を格納した配列 articles と、その記事タイトルのリスト titles が与えられています。パイプラインを使って Wikipedia 記事をクラスタリングしてください。

前の演習の解答が読み込まれているため、TruncatedSVD と KMeans を連結した Pipeline pipeline がすでに用意されています。

この演習はコースの一部です

Pythonで学ぶ教師なし学習

コースを見る

演習の手順

  • pandaspd としてインポートします。
  • 単語頻度配列 articles にパイプラインを適合させます。
  • クラスタラベルを予測します。
  • 記事タイトルのリスト titles とクラスタラベルを対応づけるため、列に labelstitles を持つ DataFrame df を作成します。これはすでに用意されています。
  • df.sort_values() メソッドを使って、'label' 列で並べ替え、結果を表示します。
  • 提出して、Wikipedia ページの見事なクラスタリング結果を少し観察してみましょう!

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import pandas
____

# Fit the pipeline to articles
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})

# Display df sorted by cluster label
print(____)
コードを編集して実行