Utilizarea vizualizărilor: lmplot
Graficele de model liniar ne ajută să vizualizăm dacă variabilele au relații cu variabila dependentă. Dacă există o relație, acestea sunt candidate bune pentru analiză. Dacă nu există, nu înseamnă că trebuie eliminate – s-ar putea să fie nevoie să le procesăm sau să le transformăm înainte de a le putea folosi.
seaborn este disponibil în spațiul tău de lucru cu aliasul obișnuit sns.
Acest exercițiu face parte din cursul
Feature Engineering cu PySpark
Instrucțiuni pentru exercițiu
- Folosind setul de date încărcat
df, filtrează-l la coloanele 'SALESCLOSEPRICE' și 'LIVINGAREA' cuselect(). - Eșantionează 50% din DataFrame cu
sample(), fără înlocuire și cu seed-ul aleator setat la 42. - Convertește Spark DataFrame-ul într-un
pandas.DataFrame()folosindtoPandas(). - Folosind 'SALESCLOSEPRICE' ca variabilă dependentă și 'LIVINGAREA' ca variabilă independentă, trasează un grafic de model liniar cu
lmplot()din seaborn.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)
# Convert to pandas dataframe
pandas_df = sample_df.____()
# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()