フェイクニュースにおける名詞の使い方
この演習では、フェイクまたは本物のニュース見出しを含むデータフレーム headlines が与えられています。あなたのタスクは、headlines の title に含まれる固有名詞とその他の名詞の数を表す、新しい特徴量 num_propn と num_noun を作成することです。
次に、フェイクニュースと本物のニュースの見出しで使われている固有名詞とその他の名詞の平均数を計算し、それらを比較します。もし大きな差があれば、フェイクニュース検出器に num_propn と num_noun を特徴量として使うことで、性能向上が見込めます。
このタスクを進めるために、前の演習で作成した関数 proper_nouns と nouns はすでに利用可能になっています。
この演習はコースの一部です
Pythonで学ぶNLPの特徴量エンジニアリング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
headlines[____] = headlines['title'].apply(____)
# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____
# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))