Візуалізація ваших даних
З попередньої вправи ми знаємо, що частка спостережень із шахрайством проти не-шахрайства дуже низька. Це можна змінити, наприклад, шляхом ресемплінгу даних — про це йтиметься в наступному відео.
У цій вправі ви розглянете дані та візуалізуєте співвідношення шахрайство/не‑шахрайство. Перед тим як щось змінювати, завжди варто спочатку подивитися на свої дані — це гарна відправна точка у вашому аналізі шахрайства.
Крім того, коли ви обговорюєте результати з колегами, графік часто наочно показує, що ми маємо справу з сильно незбалансованими даними.
Створімо графік, щоб візуалізувати співвідношення кількості точок даних з шахрайством і без нього в наборі df.
Функція prep_data() уже завантажена у ваш робочий простір, так само як і matplotlib.pyplot під іменем plt.
Ця вправа є частиною курсу
Виявлення шахрайства в Python
Інструкції до вправи
Визначте функцію
plot_data(X, y), яка красиво побудує розсіювальний графік для набору ознакXз міткамиy. Це вже зроблено за вас.Застосуйте функцію
prep_data()до вашого наборуdf, щоб створити набір ознакXі міткиy.Запустіть функцію
plot_data()для щойно отриманихXтаy, щоб візуалізувати результати.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
plt.legend()
return plt.show()
# Create X and y from the prep_data function
X, y = prep_data(____)
# Plot our data by running our plot data function on X and y
____(X, y)