Kom igångKom igång gratis

Läsa in CSV till DataFrame

I föregående övning såg du en metod för att skapa en DataFrame från en RDD. Det vanligaste sättet att skapa DataFrames är att läsa in data från en CSV-fil. I den här övningen skapar du en PySpark DataFrame från filen people.csv, som redan finns tillgänglig som variabeln file_path, och bekräftar att det skapade objektet verkligen är en PySpark DataFrame.

Kom ihåg att du redan har en SparkSession spark och variabeln file_path (sökvägen till filen people.csv) tillgängliga i din arbetsyta.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Skapa en DataFrame från variabeln file_path, som innehåller sökvägen till filen people.csv.
  • Bekräfta att resultatet är en PySpark DataFrame.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)

# Check the type of people_df
print("The type of people_df is", ____(people_df))
Redigera och kör kod