Używanie listy wyrażeń
Często nie chcesz przeszukiwać danych pod kątem tylko jednego wyrażenia. Możesz stworzyć pełny „słownik nadużyć" – listę terminów, które potencjalnie sygnalizują podejrzanych klientów i/lub transakcje. Analitycy ds. nadużyć zazwyczaj wiedzą, jakie wyrażenia powinny się w takim słowniku znaleźć. W tym ćwiczeniu oflagujemy wiele wyrażeń jednocześnie, a w kolejnym ćwiczeniu utworzymy na tej podstawie nową zmienną flagową. Taka flaga może być używana bezpośrednio w modelu uczenia maszynowego jako cecha lub jako dodatkowy filtr nałożony na wyniki modelu. Na początek użyjmy listy wyrażeń, aby przefiltrować dane. Ramka danych z oczyszczonymi e-mailami jest ponownie dostępna jako df.
To ćwiczenie jest częścią kursu
Wykrywanie oszustw w Pythonie
Instrukcje do ćwiczenia
- Utwórz listę wyrażeń do wyszukania, zawierającą: 'enron stock', 'sell stock', 'stock bonus' oraz 'sell enron stock'.
- Połącz wyrażenia tekstowe w warunkach wyszukiwania.
- Przefiltruj dane, wybierając e-maile pasujące do listy zdefiniowanej w
searchfor.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a list of terms to search for
searchfor = ['____', '____', '____', '____']
# Filter cleaned emails on searchfor list and select from df
filtered_emails = df.____[____['_____'].____._____('|'.join(____), na=False)]
print(filtered_emails)