ПочатиПочніть безкоштовно

Візуалізація ваших даних

З попередньої вправи ми знаємо, що частка спостережень із шахрайством проти не-шахрайства дуже низька. Це можна змінити, наприклад, шляхом ресемплінгу даних — про це йтиметься в наступному відео.

У цій вправі ви розглянете дані та візуалізуєте співвідношення шахрайство/не‑шахрайство. Перед тим як щось змінювати, завжди варто спочатку подивитися на свої дані — це гарна відправна точка у вашому аналізі шахрайства.

Крім того, коли ви обговорюєте результати з колегами, графік часто наочно показує, що ми маємо справу з сильно незбалансованими даними. Створімо графік, щоб візуалізувати співвідношення кількості точок даних з шахрайством і без нього в наборі df.

Функція prep_data() уже завантажена у ваш робочий простір, так само як і matplotlib.pyplot під іменем plt.

Ця вправа є частиною курсу

Виявлення шахрайства в Python

Переглянути курс

Інструкції до вправи

  • Визначте функцію plot_data(X, y), яка красиво побудує розсіювальний графік для набору ознак X з мітками y. Це вже зроблено за вас.

  • Застосуйте функцію prep_data() до вашого набору df, щоб створити набір ознак X і мітки y.

  • Запустіть функцію plot_data() для щойно отриманих X та y, щоб візуалізувати результати.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
	plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
	plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
	plt.legend()
	return plt.show()

# Create X and y from the prep_data function 
X, y = prep_data(____)

# Plot our data by running our plot data function on X and y
____(X, y)
Редагувати та запускати код