Wikipedia記事へのNMFの適用
動画では、おもちゃの単語頻度配列にNMFを適用して変換する様子を見ました。次はみなさんの番です。ここでは、Wikipedia記事のtf-idf単語頻度配列(csr行列の articles)に対してNMFを適用します。モデルを学習し、記事を変換してください。次の演習で結果を確認していきます。
この演習はコースの一部です
Pythonで学ぶ教師なし学習
演習の手順
sklearn.decompositionからNMFをインポートします。- 成分数を
6とするNMFインスタンスmodelを作成します。 - 単語カウントデータ
articlesにモデルを適合させます。 modelの.transform()メソッドでarticlesを変換し、結果をnmf_featuresに代入します。nmf_featuresを表示して、どのような配列か最初の感触をつかみましょう(.round(2)は各要素を小数点以下2桁に丸めます)。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import NMF
____
# Create an NMF instance: model
model = ____
# Fit the model to articles
____
# Transform the articles: nmf_features
nmf_features = ____
# Print the NMF features
print(nmf_features.round(2))