НачатьНачать бесплатно

Использование списка терминов

Как правило, поиск по одному термину не даёт достаточно результатов. Вы можете составить полноценный «словарь мошенничества» — набор терминов, которые потенциально указывают на недобросовестных клиентов и/или подозрительные транзакции. У опытных аналитиков по выявлению мошенничества обычно есть представление о том, что должно входить в такой словарь. В этом упражнении вы будете искать сразу несколько терминов, а в следующем — создадите на их основе новую переменную-флаг. Этот флаг можно использовать как признак непосредственно в модели машинного обучения или как дополнительный фильтр поверх результатов модели. Начнём с фильтрации данных по списку терминов. Датафрейм с очищенными письмами по-прежнему доступен как df.

Это упражнение является частью курса

Обнаружение мошенничества на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте список для поиска, включив в него термины 'enron stock', 'sell stock', 'stock bonus' и 'sell enron stock'.
  • Объедините строковые термины в условиях поиска.
  • Отфильтруйте данные, оставив только письма, соответствующие списку, заданному в переменной searchfor.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a list of terms to search for
searchfor = ['____', '____', '____', '____']

# Filter cleaned emails on searchfor list and select from df 
filtered_emails = df.____[____['_____'].____._____('|'.join(____), na=False)]
print(filtered_emails)
Редактировать и запускать код