Utan mellanhänder
Nu vet du hur man läser in data i Spark via pandas, men du undrar säkert varför man ska behöva gå omvägen via pandas alls? Vore det inte enklare att läsa in en textfil direkt i Spark? Det vore det!
Tur då att SparkSession har ett .read-attribut med flera metoder för att läsa in data från olika källor till Spark DataFrames. Med dessa kan du skapa en DataFrame från en .csv-fil – precis som med vanliga pandas DataFrames!
Variabeln file_path är en sträng med sökvägen till filen airports.csv. Den filen innehåller information om olika flygplatser runt om i världen.
En SparkSession med namnet spark finns tillgänglig i din miljö.
Den här övningen är en del av kursen
Grunderna i PySpark
Övningsinstruktioner
- Använd metoden
.read.csv()för att skapa en Spark DataFrame som heterairports- Det första argumentet är
file_path - Skicka in argumentet
header=Trueså att Spark vet att kolumnnamnen finns på filens första rad.
- Det första argumentet är
- Skriv ut denna DataFrame genom att anropa
.show().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()