Spalten zusammenführen
Der letzte Schritt der Datenaufbereitung besteht darin, alle Prädiktorspalten in einer einzigen Spalte zu bündeln.
Eine aktualisierte Version der flights-Daten, die alle Änderungen aus den letzten Übungen berücksichtigt, hat die folgenden Prädiktorspalten:
mon,domunddowcarrier_idx(indizierter Wert auscarrier)org_idx(indizierter Wert ausorg)kmdepartduration
Hinweis: Das Argument truncate=False für die Methode show() verhindert, dass die Daten in der Ausgabe abgeschnitten werden.
Diese Übung ist Teil des Kurses
<Kurs>Maschinelles Lernen mit PySpark</Kurs>Übungsanweisungen
- Importiere die Klasse, die die Prädiktoren zusammenführt.
- Erstelle ein Assembler-Objekt, mit dem du die Prädiktorspalten zu einer einzelnen Spalte zusammenführen kannst.
- Verwende den Assembler, um eine neue, zusammengefasste Spalte zu erzeugen.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)