Representar tus datos
En el ejercicio anterior vimos que la proporción de observaciones de fraude frente a no fraude es muy baja. Puedes hacer algo al respecto, por ejemplo re-muestreando los datos, como se explica en el siguiente vídeo.
En este ejercicio, vas a explorar los datos y visualizar la proporción de fraude frente a no fraude. En análisis de fraude, siempre es un buen primer paso mirar los datos antes de hacerles cualquier cambio.
Además, cuando lo expliques a tus compañeros, una imagen suele dejar claro que tratamos con un conjunto de datos muy desbalanceado.
Vamos a crear una gráfica para visualizar la proporción de puntos de datos de fraude frente a no fraude en el conjunto df.
La función prep_data() ya está cargada en tu entorno de trabajo, al igual que matplotlib.pyplot como plt.
Este ejercicio forma parte del curso
Fraud Detection in Python
Instrucciones del ejercicio
Define la función
plot_data(X, y), que represente de forma clara el conjunto de característicasXcon las etiquetasyen un diagrama de dispersión. Esto ya está hecho por ti.Usa la función
prep_data()sobre tu conjuntodfpara crear el conjunto de característicasXy las etiquetasy.Ejecuta la función
plot_data()con tus nuevosXyypara visualizar los resultados.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
plt.legend()
return plt.show()
# Create X and y from the prep_data function
X, y = prep_data(____)
# Plot our data by running our plot data function on X and y
____(X, y)