CommencezCommencez gratuitement

Créer un indicateur

Cette fois, vous allez créer une véritable variable indicatrice qui vaut 1 lorsque les courriels correspondent aux termes de recherche d'intérêt, et 0 sinon. C'est la dernière étape à effectuer pour pouvoir utiliser le contenu textuel comme caractéristique dans un modèle de Machine Learning, ou comme indicateur appliqué aux résultats d'un modèle. Vous pouvez continuer à travailler avec le dataframe df qui contient les courriels, et la liste searchfor est celle définie dans l'exercice précédent.

Cette activité fait partie du cours

Détection de fraude en Python

Voir le cours

Instructions de l’exercice

  • Utilisez une condition numpy where pour mettre l'indicateur à « 1 » lorsque le courriel nettoyé contient des mots de la liste searchfor, et à 0 sinon.
  • Joignez les mots de la liste searchfor avec un indicateur « ou ».
  • Comptez les valeurs de la nouvelle variable indicatrice.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create flag variable where the emails match the searchfor terms
df['flag'] = ____.____((df['clean_content'].___.____('____'.____(____)) == True), 1, 0)

# Count the values of the flag variable
count = df['flag'].____()
print(count)
Modifier et exécuter le code