Kom igångKom igång gratis

Utan mellanhänder

Nu vet du hur man läser in data i Spark via pandas, men du undrar säkert varför man ska behöva gå omvägen via pandas alls? Vore det inte enklare att läsa in en textfil direkt i Spark? Det vore det!

Tur då att SparkSession har ett .read-attribut med flera metoder för att läsa in data från olika källor till Spark DataFrames. Med dessa kan du skapa en DataFrame från en .csv-fil – precis som med vanliga pandas DataFrames!

Variabeln file_path är en sträng med sökvägen till filen airports.csv. Den filen innehåller information om olika flygplatser runt om i världen.

En SparkSession med namnet spark finns tillgänglig i din miljö.

Den här övningen är en del av kursen

Grunderna i PySpark

Visa kurs

Övningsinstruktioner

  • Använd metoden .read.csv() för att skapa en Spark DataFrame som heter airports
    • Det första argumentet är file_path
    • Skicka in argumentet header=True så att Spark vet att kolumnnamnen finns på filens första rad.
  • Skriv ut denna DataFrame genom att anropa .show().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"

# Read in the airports data
airports = ____.____.____(____, ____=____)

# Show the data
____.____()
Redigera och kör kod