Utiliser une liste de termes
Souvent, vous ne voulez pas chercher un seul terme. Vous pouvez probablement créer un véritable « dictionnaire de fraude » de termes qui pourraient signaler des clients et/ou des transactions potentiellement frauduleux. Les analystes en fraude ont souvent une bonne idée de ce que devrait contenir un tel dictionnaire. Dans cet exercice, vous allez repérer une multitude de termes, puis, dans le prochain exercice, vous créerez une nouvelle variable d'indicateur à partir de ceux-ci. Cet « indicateur » peut être utilisé directement comme caractéristique dans un modèle de Machine Learning, ou comme filtre additionnel par-dessus les résultats de votre modèle de Machine Learning. Commençons par utiliser une liste de termes pour filtrer nos données. Le dataframe contenant les courriels nettoyés est de nouveau disponible sous df.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Créez une liste à rechercher comprenant « enron stock », « sell stock », « stock bonus » et « sell enron stock ».
- Joignez les chaînes de caractères dans les conditions de recherche.
- Filtrez les données en utilisant les courriels qui correspondent à la liste définie dans
searchfor.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a list of terms to search for
searchfor = ['____', '____', '____', '____']
# Filter cleaned emails on searchfor list and select from df
filtered_emails = df.____[____['_____'].____._____('|'.join(____), na=False)]
print(filtered_emails)