Läsa in CSV till DataFrame
I föregående övning såg du en metod för att skapa en DataFrame från en RDD. Det vanligaste sättet att skapa DataFrames är att läsa in data från en CSV-fil. I den här övningen skapar du en PySpark DataFrame från filen people.csv, som redan finns tillgänglig som variabeln file_path, och bekräftar att det skapade objektet verkligen är en PySpark DataFrame.
Kom ihåg att du redan har en SparkSession spark och variabeln file_path (sökvägen till filen people.csv) tillgängliga i din arbetsyta.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Skapa en DataFrame från variabeln
file_path, som innehåller sökvägen till filenpeople.csv. - Bekräfta att resultatet är en PySpark DataFrame.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)
# Check the type of people_df
print("The type of people_df is", ____(people_df))