Użycie rzeczowników w fałszywych wiadomościach
W tym ćwiczeniu masz do dyspozycji ramkę danych headlines zawierającą nagłówki wiadomości – zarówno fałszywych, jak i prawdziwych. Twoim zadaniem jest wygenerowanie dwóch nowych cech: num_propn i num_noun, które reprezentują liczbę nazw własnych oraz pozostałych rzeczowników zawartych w kolumnie title ramki headlines.
Następnie obliczymy średnią liczbę nazw własnych i pozostałych rzeczowników używanych w fałszywych i prawdziwych nagłówkach, a potem porównamy te wartości. Jeśli różnica będzie znacząca, istnieje duże prawdopodobieństwo, że użycie cech num_propn i num_noun w detektorach fałszywych wiadomości poprawi ich skuteczność.
Aby wykonać to zadanie, funkcje proper_nouns i nouns zbudowane w poprzednim ćwiczeniu są już dla ciebie dostępne.
To ćwiczenie jest częścią kursu
Inżynieria cech dla NLP w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
headlines[____] = headlines['title'].apply(____)
# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____
# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))