Wikipedia記事のNMF特徴量
ここでは、前の演習で作成したNMF特徴量を詳しく見ていきます。前の演習の解答はあらかじめ読み込まれているため、配列nmf_featuresを利用できます。また、各 Wikipedia記事のタイトルを格納したリストtitlesもあります。
特徴量を調べると、2人の俳優のどちらもNMF特徴量3の値が突出して高いことに気づきます。つまり、両方の記事は主に3番目のNMF成分を使って再現されているということです。その理由については、次の動画で解説します。NMFの成分はトピック(例えば「演技」など)を表しているのです。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
pandasをpdとしてインポートしてください。pd.DataFrame()を使ってnmf_featuresからDataFramedfを作成します。index=titlesを指定してインデックスをtitlesに設定してください。dfの.loc[]アクセサを使って、タイトルが'Anne Hathaway'の行を選択し、結果を表示してください。これは女優アン・ハサウェイに関する記事のNMF特徴量です。- 同じ操作を(別の俳優である)
'Denzel Washington'に対しても行ってください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import pandas
____
# Create a pandas DataFrame: df
df = ____
# Print the row for 'Anne Hathaway'
print(____)
# Print the row for 'Denzel Washington'
print(____)