CommencezCommencez gratuitement

Utilisation des noms dans les fausses nouvelles

Dans cet exercice, on vous fournit un dataframe headlines qui contient des manchettes de nouvelles, soit fausses soit réelles. Votre tâche est de générer deux nouvelles caractéristiques, num_propn et num_noun, qui représentent respectivement le nombre de noms propres et le nombre d'autres noms présents dans la caractéristique title de headlines.

Ensuite, nous calculerons le nombre moyen de noms propres et d'autres noms utilisés dans les manchettes de fausses nouvelles et de vraies nouvelles, puis nous comparerons les valeurs. S'il y a une différence marquée, il y a de bonnes chances que l'utilisation des caractéristiques num_propn et num_noun dans des détecteurs de fausses nouvelles améliore leur performance.

Pour réaliser cette tâche, les fonctions proper_nouns et nouns que vous avez créées dans l'exercice précédent sont déjà mises à votre disposition.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le NLP en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

headlines[____] = headlines['title'].apply(____)

# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____

# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))
Modifier et exécuter le code