Créer un indicateur
Cette fois, vous allez créer une véritable variable indicatrice qui vaut 1 lorsque les courriels correspondent aux termes de recherche d'intérêt, et 0 sinon. C'est la dernière étape à effectuer pour pouvoir utiliser le contenu textuel comme caractéristique dans un modèle de Machine Learning, ou comme indicateur appliqué aux résultats d'un modèle. Vous pouvez continuer à travailler avec le dataframe df qui contient les courriels, et la liste searchfor est celle définie dans l'exercice précédent.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Utilisez une condition numpy where pour mettre l'indicateur à « 1 » lorsque le courriel nettoyé contient des mots de la liste
searchfor, et à 0 sinon. - Joignez les mots de la liste
searchforavec un indicateur « ou ». - Comptez les valeurs de la nouvelle variable indicatrice.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create flag variable where the emails match the searchfor terms
df['flag'] = ____.____((df['clean_content'].___.____('____'.____(____)) == True), 1, 0)
# Count the values of the flag variable
count = df['flag'].____()
print(count)