Використання іменників у фейкових новинах
У цій вправі вам надано датафрейм headlines, що містить заголовки новин, які можуть бути фейковими або справжніми. Ваше завдання — згенерувати дві нові ознаки num_propn та num_noun, які відображають кількість власних назв та інших іменників у ознаці title датафрейму headlines.
Далі ми обчислимо середню кількість власних назв та інших іменників, ужитих у заголовках фейкових і справжніх новин, і порівняємо значення. Якщо різниця суттєва, є висока ймовірність, що використання ознак num_propn і num_noun у детекторах фейкових новин поліпшить їхню ефективність.
Щоб виконати це завдання, функції proper_nouns і nouns, які ви створили в попередній вправі, уже доступні для використання.
Ця вправа є частиною курсу
Інженерія ознак для NLP у Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
headlines[____] = headlines['title'].apply(____)
# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____
# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))