Zacznij terazZacznij za darmo

Używanie listy wyrażeń

Często nie chcesz przeszukiwać danych pod kątem tylko jednego wyrażenia. Możesz stworzyć pełny „słownik nadużyć" – listę terminów, które potencjalnie sygnalizują podejrzanych klientów i/lub transakcje. Analitycy ds. nadużyć zazwyczaj wiedzą, jakie wyrażenia powinny się w takim słowniku znaleźć. W tym ćwiczeniu oflagujemy wiele wyrażeń jednocześnie, a w kolejnym ćwiczeniu utworzymy na tej podstawie nową zmienną flagową. Taka flaga może być używana bezpośrednio w modelu uczenia maszynowego jako cecha lub jako dodatkowy filtr nałożony na wyniki modelu. Na początek użyjmy listy wyrażeń, aby przefiltrować dane. Ramka danych z oczyszczonymi e-mailami jest ponownie dostępna jako df.

To ćwiczenie jest częścią kursu

Wykrywanie oszustw w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz listę wyrażeń do wyszukania, zawierającą: 'enron stock', 'sell stock', 'stock bonus' oraz 'sell enron stock'.
  • Połącz wyrażenia tekstowe w warunkach wyszukiwania.
  • Przefiltruj dane, wybierając e-maile pasujące do listy zdefiniowanej w searchfor.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a list of terms to search for
searchfor = ['____', '____', '____', '____']

# Filter cleaned emails on searchfor list and select from df 
filtered_emails = df.____[____['_____'].____._____('|'.join(____), na=False)]
print(filtered_emails)
Edytuj i uruchom kod