LoslegenKostenlos starten

Substantivgebrauch in Fake News

In dieser Übung bekommst du ein DataFrame headlines, das Schlagzeilen enthält, die entweder gefälscht oder echt sind. Deine Aufgabe ist es, zwei neue Features num_propn und num_noun zu erzeugen, die die Anzahl der Eigennamen bzw. der übrigen Substantive enthalten, die im Feature title von headlines vorkommen.

Als Nächstes berechnen wir die durchschnittliche Anzahl von Eigennamen und anderen Substantiven in gefälschten und echten Schlagzeilen und vergleichen die Werte. Gibt es einen deutlichen Unterschied, ist es gut möglich, dass die Features num_propn und num_noun die Leistung von Fake-News-Detektoren verbessern.

Damit du loslegen kannst, stehen dir die Funktionen proper_nouns und nouns, die du in der vorherigen Übung gebaut hast, bereits zur Verfügung.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering für NLP in Python</Kurs>
Kurs ansehen

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

headlines[____] = headlines['title'].apply(____)

# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____

# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))
Code bearbeiten und ausführen