Wikipedia 記事の NMF 特徴量
前の演習で作成した NMF 特徴量を調べてみましょう。前の演習の解答は読み込まれており、配列 nmf_features が利用可能です。また、各 Wikipedia 記事のタイトルを表すリスト titles も利用できます。
特徴量を確認すると、両方の俳優について NMF 特徴量 3 の値が他と比べて突出して高いことに気づきます。これは、どちらの記事も主に 3 番目の NMF コンポーネントで再構成されていることを意味します。次の動画で理由を見ていきますが、NMF のコンポーネントはトピック(たとえば演技など)を表すのです。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
pandasをpdとしてインポートします。pd.DataFrame()を使ってnmf_featuresから DataFramedfを作成します。index=titlesでインデックスをtitlesに設定します。dfの.loc[]アクセサを使って、タイトルが'Anne Hathaway'の行を選択し、結果を出力します。これは女優 Anne Hathaway に関する記事の NMF 特徴量です。- 同様に
'Denzel Washington'(別の俳優)についても実行します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import pandas
____
# Create a pandas DataFrame: df
df = ____
# Print the row for 'Anne Hathaway'
print(____)
# Print the row for 'Denzel Washington'
print(____)