EmpezarEmpieza gratis

Representar tus datos

En el ejercicio anterior vimos que la proporción de observaciones de fraude frente a no fraude es muy baja. Puedes hacer algo al respecto, por ejemplo re-muestreando los datos, como se explica en el siguiente vídeo.

En este ejercicio, vas a explorar los datos y visualizar la proporción de fraude frente a no fraude. En análisis de fraude, siempre es un buen primer paso mirar los datos antes de hacerles cualquier cambio.

Además, cuando lo expliques a tus compañeros, una imagen suele dejar claro que tratamos con un conjunto de datos muy desbalanceado. Vamos a crear una gráfica para visualizar la proporción de puntos de datos de fraude frente a no fraude en el conjunto df.

La función prep_data() ya está cargada en tu entorno de trabajo, al igual que matplotlib.pyplot como plt.

Este ejercicio forma parte del curso

Fraud Detection in Python

Ver curso

Instrucciones del ejercicio

  • Define la función plot_data(X, y), que represente de forma clara el conjunto de características X con las etiquetas y en un diagrama de dispersión. Esto ya está hecho por ti.

  • Usa la función prep_data() sobre tu conjunto df para crear el conjunto de características X y las etiquetas y.

  • Ejecuta la función plot_data() con tus nuevos X y y para visualizar los resultados.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
	plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
	plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
	plt.legend()
	return plt.show()

# Create X and y from the prep_data function 
X, y = prep_data(____)

# Plot our data by running our plot data function on X and y
____(X, y)
Editar y ejecutar código