Substantivanvändning i falska nyheter
I den här övningen har du fått en dataframe headlines som innehåller nyhetsrubriker som antingen är falska eller äkta. Din uppgift är att skapa två nya särdrag, num_propn och num_noun, som representerar antalet egennamn och övriga substantiv i särdragskolumnen title i headlines.
Därefter beräknar vi det genomsnittliga antalet egennamn och övriga substantiv i falska respektive äkta nyhetsrubriker och jämför värdena. Om det finns en tydlig skillnad är det troligt att num_propn och num_noun som särdrag i en detektor för falska nyheter kan förbättra modellens prestanda.
Funktionerna proper_nouns och nouns som du byggde i föregående övning är redan tillgängliga för dig.
Den här övningen är en del av kursen
Funktionsutveckling för NLP i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
headlines[____] = headlines['title'].apply(____)
# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____
# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))