Del 1: Skapa en DataFrame från en CSV-fil
Vart fjärde år firar fotbollsfans runt om i världen ett evenemang som kallas FIFA World Cup – och med det verkar mycket förändras i många länder. I den här övningen i tre delar utför du en explorativ dataanalys (EDA) av datasetet "FIFA 2018 World Cup Player" med hjälp av PySpark SQL, vilket innefattar DataFrame-operationer, SQL-frågor och visualisering.
I den första delen laddar du in datasetet FIFA 2018 World Cup Players (Fifa2018_dataset.csv), som är i CSV-format, i en PySpark-DataFrame och granskar datan med hjälp av grundläggande DataFrame-operationer.
Kom ihåg att du redan har en SparkSession spark och en variabel file_path tillgängliga i din arbetsyta.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Skapa en PySpark-DataFrame från
file_path(som är sökvägen till filenFifa2018_dataset.csv). - Skriv ut DataFramens schema.
- Skriv ut de första 10 observationerna.
- Hur många rader finns det i DataFrame?
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)
# Check the schema of columns
fifa_df.____()
# Show the first 10 observations
fifa_df.____(____)
# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))