LoslegenKostenlos starten

Spalten zusammenführen

Der letzte Schritt der Datenaufbereitung besteht darin, alle Prädiktorspalten in einer einzigen Spalte zu bündeln.

Eine aktualisierte Version der flights-Daten, die alle Änderungen aus den letzten Übungen berücksichtigt, hat die folgenden Prädiktorspalten:

  • mon, dom und dow
  • carrier_idx (indizierter Wert aus carrier)
  • org_idx (indizierter Wert aus org)
  • km
  • depart
  • duration

Hinweis: Das Argument truncate=False für die Methode show() verhindert, dass die Daten in der Ausgabe abgeschnitten werden.

Diese Übung ist Teil des Kurses

<Kurs>Maschinelles Lernen mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Importiere die Klasse, die die Prädiktoren zusammenführt.
  • Erstelle ein Assembler-Objekt, mit dem du die Prädiktorspalten zu einer einzelnen Spalte zusammenführen kannst.
  • Verwende den Assembler, um eine neue, zusammengefasste Spalte zu erzeugen.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Import the necessary class
from pyspark.ml.feature import ____

# Create an assembler object
assembler = ____(inputCols=[
    ____
], outputCol='features')

# Consolidate predictor columns
flights_assembled = assembler.____(____)

# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)
Code bearbeiten und ausführen