始める無料で始める

フェイクニュースにおける名詞の使い方

この演習では、フェイクまたは本物のニュース見出しを含むデータフレーム headlines が与えられています。あなたのタスクは、headlinestitle に含まれる固有名詞とその他の名詞の数を表す、新しい特徴量 num_propnnum_noun を作成することです。

次に、フェイクニュースと本物のニュースの見出しで使われている固有名詞とその他の名詞の平均数を計算し、それらを比較します。もし大きな差があれば、フェイクニュース検出器に num_propnnum_noun を特徴量として使うことで、性能向上が見込めます。

このタスクを進めるために、前の演習で作成した関数 proper_nounsnouns はすでに利用可能になっています。

この演習はコースの一部です

Pythonで学ぶNLPの特徴量エンジニアリング

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

headlines[____] = headlines['title'].apply(____)

# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____

# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))
コードを編集して実行