Použití seznamu výrazů
Často nestačí hledat jen jeden výraz. Můžeš sestavit celý "podvodný slovník" výrazů, které by mohly označit podezřelé klienty nebo transakce. Fraud analytici většinou dobře vědí, co do takového slovníku patří. V tomto cvičení budeš označovat více výrazů najednou a v dalším cvičení z nich vytvoříš novou příznaková proměnnou. Takový příznak lze použít buď přímo jako feature v modelu strojového učení, nebo jako dodatečný filtr na výsledky tohoto modelu. Nejprve využijeme seznam výrazů k filtrování dat. Datový rámec s vyčištěnými e-maily je opět k dispozici jako df.
Toto cvičení je součástí kurzu
Detekce podvodů v Pythonu
Pokyny k cvičení
- Vytvoř seznam pro vyhledávání obsahující výrazy 'enron stock', 'sell stock', 'stock bonus' a 'sell enron stock'.
- Spoj řetězcové výrazy v podmínkách vyhledávání.
- Filtruj data pomocí e-mailů, které odpovídají seznamu definovanému v proměnné
searchfor.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a list of terms to search for
searchfor = ['____', '____', '____', '____']
# Filter cleaned emails on searchfor list and select from df
filtered_emails = df.____[____['_____'].____._____('|'.join(____), na=False)]
print(filtered_emails)