Recherche de mots avec des dataframes
Dans cet exercice, vous allez travailler avec des données textuelles contenant des courriels d'employés d'Enron. Le scandale Enron est une affaire de fraude bien connue. Des employés d'Enron ont camouflé la mauvaise situation financière de l'entreprise, maintenant ainsi le cours de l'action artificiellement élevé. Ils ont vendu leurs propres options sur actions et, lorsque la vérité a éclaté, les investisseurs d'Enron se sont retrouvés les mains vides. L'objectif est de trouver tous les courriels qui mentionnent certains mots, comme « sell enron stock ».
En utilisant des opérations sur les chaînes de caractères dans des dataframes, vous pouvez facilement filtrer des données de courriels désordonnées et créer des indicateurs selon les mots repérés. Les données de courriels d'Enron ont été placées dans un dataframe nommé df; cherchons donc des termes suspects. N'hésitez pas à explorer df dans la Console avant de commencer.
Cette activité fait partie du cours
Détection de fraude en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Find all cleaned emails that contain 'sell enron stock'
mask = df['clean_content'].____.____('____', na=False)