Was sagen wir voraus?
Welche dieser Felder (oder Spalten) ist der Wert, den wir vorhersagen wollen?
TAXESSALESCLOSEPRICEDAYSONMARKETLISTPRICE
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Bestimme aus den oben aufgeführten Spalten, welche wir als abhängige Variable
$Y$verwenden. - Filtere den geladenen Datensatz
dfmitselect()auf unsere abhängige Variable. Speichere dieses DataFrame in der VariablenY_df. - Zeige mit
describe()aufY_dfund anschließendemshow()die zusammenfassenden Statistiken für die abhängige Variable an.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Select our dependent variable
Y_df = df.____([____])
# Display summary statistics
Y_df.____().____()