LoslegenKostenlos starten

Visualisierungen nutzen: lmplot

Lineare Modell-Plots helfen dir zu erkennen, ob Variablen mit der abhängigen Variable zusammenhängen. Falls ja, sind sie gute Kandidaten für deine Analyse. Falls nicht, heißt das nicht, dass du sie verwerfen solltest – möglicherweise musst du sie erst aufbereiten oder umformen, bevor du sie nutzen kannst.

seaborn ist in deinem Workspace mit dem üblichen Alias sns verfügbar.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Filtere den geladenen Datensatz df mit select() auf die Spalten 'SALESCLOSEPRICE' und 'LIVINGAREA'.
  • Ziehe mit sample() eine Stichprobe von 50 % des DataFrames, ohne Zurücklegen, und setze den Zufalls-Seed auf 42.
  • Wandle das Spark DataFrame mit toPandas() in ein pandas.DataFrame() um.
  • Verwende 'SALESCLOSEPRICE' als abhängige Variable und 'LIVINGAREA' als unabhängige Variable und zeichne mit seaborn lmplot() einen linearen Modell-Plot.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)

# Convert to pandas dataframe
pandas_df = sample_df.____()

# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()
Code bearbeiten und ausführen