¿Qué estamos prediciendo?
¿Cuál de estos campos (o columnas) es el valor que intentamos predecir?
TAXESSALESCLOSEPRICEDAYSONMARKETLISTPRICE
Este ejercicio forma parte del curso
Ingeniería de características con PySpark
Instrucciones del ejercicio
- De las columnas listadas arriba, identifica cuál usaremos como variable dependiente
$Y$. - Con el conjunto de datos cargado
df, filtra para quedarte solo con la variable dependiente usandoselect(). Guarda este dataframe en la variableY_df. - Muestra estadísticas descriptivas de la variable dependiente con
describe()sobreY_dfy llama ashow()para visualizarlas.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Select our dependent variable
Y_df = df.____([____])
# Display summary statistics
Y_df.____().____()