Podstatná jména ve fake news
V tomto cvičení máš k dispozici dataframe headlines s novinovými titulky, které jsou označeny jako falešné nebo pravé. Tvým úkolem je vytvořit dva nové příznaky: num_propn a num_noun, které reprezentují počet vlastních jmen a ostatních podstatných jmen obsažených v příznaku title dataframu headlines.
Dále vypočítáme průměrný počet vlastních jmen a ostatních podstatných jmen použitých ve falešných a pravých titulcích a porovnáme výsledky. Pokud bude rozdíl výrazný, je dobrá šance, že přidání příznaků num_propn a num_noun do detektoru fake news zlepší jeho výkon.
Funkce proper_nouns a nouns, které jsi sestavil/a v předchozím cvičení, jsou ti k dispozici.
Toto cvičení je součástí kurzu
Feature Engineering for NLP in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
headlines[____] = headlines['title'].apply(____)
# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____
# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))