EmpezarEmpieza gratis

Usar visualizaciones: distplot

Entender la distribución de nuestra variable dependiente es muy importante y puede influir en el tipo de modelo o en el preprocesado que hagamos. Una forma estupenda de hacerlo es representarla, pero el trazado no es una función incorporada en PySpark; necesitaremos algunos pasos intermedios para que funcione correctamente. En este ejercicio vas a visualizar la variable 'LISTPRICE' y obtendrás más información sobre su distribución calculando la asimetría (skewness).

Los paquetes matplotlib.pyplot y seaborn ya se han importado con los alias plt y sns.

Este ejercicio forma parte del curso

Ingeniería de características con PySpark

Ver curso

Instrucciones del ejercicio

  • Muestra el 50% del dataframe df con sample(), asegurándote de no usar reposición y fijando la semilla aleatoria en 42.
  • Convierte el DataFrame de Spark a un pandas.DataFrame() con toPandas().
  • Traza un gráfico de distribución usando el método distplot() de seaborn.
  • Importa la función skewness() de pyspark.sql.functions y calcúlala sobre el agregado de la columna 'LISTPRICE' con el método agg(). Recuerda hacer collect() de tu resultado para evaluar el cálculo.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()

# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()

# Import skewness function
from pyspark.sql.functions import skewness

# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())
Editar y ejecutar código