Zacznij terazZacznij za darmo

Użycie rzeczowników w fałszywych wiadomościach

W tym ćwiczeniu masz do dyspozycji ramkę danych headlines zawierającą nagłówki wiadomości – zarówno fałszywych, jak i prawdziwych. Twoim zadaniem jest wygenerowanie dwóch nowych cech: num_propn i num_noun, które reprezentują liczbę nazw własnych oraz pozostałych rzeczowników zawartych w kolumnie title ramki headlines.

Następnie obliczymy średnią liczbę nazw własnych i pozostałych rzeczowników używanych w fałszywych i prawdziwych nagłówkach, a potem porównamy te wartości. Jeśli różnica będzie znacząca, istnieje duże prawdopodobieństwo, że użycie cech num_propn i num_noun w detektorach fałszywych wiadomości poprawi ich skuteczność.

Aby wykonać to zadanie, funkcje proper_nouns i nouns zbudowane w poprzednim ćwiczeniu są już dla ciebie dostępne.

To ćwiczenie jest częścią kursu

Inżynieria cech dla NLP w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

headlines[____] = headlines['title'].apply(____)

# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____

# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))
Edytuj i uruchom kod