1. Learn
  2. /
  3. Курси
  4. /
  5. Інженерія ознак для NLP у Python

Connected

Вправа

Використання іменників у фейкових новинах

У цій вправі вам надано датафрейм headlines, що містить заголовки новин, які можуть бути фейковими або справжніми. Ваше завдання — згенерувати дві нові ознаки num_propn та num_noun, які відображають кількість власних назв та інших іменників у ознаці title датафрейму headlines.

Далі ми обчислимо середню кількість власних назв та інших іменників, ужитих у заголовках фейкових і справжніх новин, і порівняємо значення. Якщо різниця суттєва, є висока ймовірність, що використання ознак num_propn і num_noun у детекторах фейкових новин поліпшить їхню ефективність.

Щоб виконати це завдання, функції proper_nouns і nouns, які ви створили в попередній вправі, уже доступні для використання.

Інструкції 1/2

undefined XP
  • 1
    • Створіть нову ознаку num_propn, застосувавши proper_nouns до headlines['title'].
    • Відфільтруйте headlines, щоб обчислити середню кількість власних назв у фейкових новинах за допомогою методу mean.
  • 2
    • Повторіть процес для інших іменників: створіть ознаку 'num_noun', використовуючи nouns, і обчисліть середнє значення для інших іменників