始める無料で始める

最もポジティブな単語とネガティブな単語の特定

この演習では、映画レビューの感情データセットに対して学習したロジスティック回帰の係数を解釈してみます。モデルオブジェクトはすでに lr という変数にインスタンス化・学習済みです。

さらに、各特徴量に対応する単語は vocab という変数に読み込まれています。たとえば、vocab[100] が "think" であれば、特徴量 100 はその映画レビュー内で単語 "think" が出現した回数に対応します。

この演習はコースの一部です

Python で学ぶ線形分類器

コースを見る

演習の手順

  • 係数が大きい順に上位5つに対応する単語を見つけてください。
  • 係数が小さい順に上位5つに対応する単語を見つけてください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Get the indices of the sorted cofficients
inds_ascending = np.argsort(lr.coef_.flatten()) 
inds_descending = inds_ascending[::-1]

# Print the most positive words
print("Most positive words: ", end="")
for i in range(5):
    print(____, end=", ")
print("\n")

# Print most negative words
print("Most negative words: ", end="")
for i in range(5):
    print(____, end=", ")
print("\n")
コードを編集して実行