Använda en lista med termer
Ofta vill du inte söka på bara en term. Du kan förmodligen skapa en fullständig "bedrägeridictionary" med termer som potentiellt kan flagga bedrägliga klienter och/eller transaktioner. Bedrägerianalytiker har ofta en god uppfattning om vad en sådan dictionary bör innehålla. I den här övningen ska du flagga ett flertal termer, och i nästa övning skapar du en ny flaggvariabel utifrån dem. En flagga kan användas antingen direkt i en maskininlärningsmodell som ett särdrag, eller som ett extra filter ovanpå din modells resultat. Låt oss börja med att använda en lista med termer för att filtrera våra data. Dataframe:en med de rensade e-postmeddelandena är tillgänglig som df.
Den här övningen är en del av kursen
Bedrägeridetektering i Python
Övningsinstruktioner
- Skapa en lista att söka i som innehåller 'enron stock', 'sell stock', 'stock bonus' och 'sell enron stock'.
- Sammanfoga strängtermed i sökvillkoren.
- Filtrera data med hjälp av de e-postmeddelanden som matchar listan som definierats under
searchfor.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a list of terms to search for
searchfor = ['____', '____', '____', '____']
# Filter cleaned emails on searchfor list and select from df
filtered_emails = df.____[____['_____'].____._____('|'.join(____), na=False)]
print(filtered_emails)