НачатьНачать бесплатно

Использование существительных в фейковых новостях

В этом упражнении вам предоставлен датафрейм headlines, содержащий заголовки новостей — как фейковых, так и настоящих. Ваша задача — создать два новых признака: num_propn и num_noun, которые отражают количество имён собственных и других существительных в столбце title датафрейма headlines.

Далее мы вычислим среднее количество имён собственных и других существительных в заголовках фейковых и настоящих новостей и сравним результаты. Если разница окажется значительной, есть все основания полагать, что включение признаков num_propn и num_noun в детекторы фейковых новостей улучшит их качество.

Для выполнения задания функции proper_nouns и nouns, созданные в предыдущем упражнении, уже доступны вам.

Это упражнение является частью курса

Конструирование признаков для NLP на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

headlines[____] = headlines['title'].apply(____)

# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____

# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))
Редактировать и запускать код