Визуализация данных
Из предыдущего упражнения мы знаем, что доля мошеннических транзакций по сравнению с обычными очень мала. С этим можно работать — например, применить повторную выборку данных, о которой рассказывается в следующем видео.
В этом упражнении вы изучите данные и визуализируете соотношение мошеннических и обычных транзакций. Прежде чем вносить какие-либо изменения, всегда полезно сначала взглянуть на данные — это хорошая отправная точка в анализе мошенничества.
Кроме того, при обсуждении с коллегами наглядный график наглядно покажет, что мы имеем дело с сильно несбалансированными данными.
Давайте построим график, отображающий соотношение мошеннических и обычных точек данных в наборе df.
Функция prep_data() уже загружена в вашем рабочем пространстве, как и matplotlib.pyplot под псевдонимом plt.
Это упражнение является частью курса
Обнаружение мошенничества на Python
Инструкции к упражнению
Определите функцию
plot_data(X, y), которая строит аккуратный точечный график набора признаковXс меткамиy. Эта часть уже выполнена за вас.Примените функцию
prep_data()к набору данныхdf, чтобы получить набор признаковXи меткиy.Вызовите функцию
plot_data()с полученнымиXиy, чтобы визуализировать результаты.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
plt.legend()
return plt.show()
# Create X and y from the prep_data function
X, y = prep_data(____)
# Plot our data by running our plot data function on X and y
____(X, y)