Kom igångKom igång gratis

Del 1: Skapa en DataFrame från en CSV-fil

Vart fjärde år firar fotbollsfans runt om i världen ett evenemang som kallas FIFA World Cup – och med det verkar mycket förändras i många länder. I den här övningen i tre delar utför du en explorativ dataanalys (EDA) av datasetet "FIFA 2018 World Cup Player" med hjälp av PySpark SQL, vilket innefattar DataFrame-operationer, SQL-frågor och visualisering.

I den första delen laddar du in datasetet FIFA 2018 World Cup Players (Fifa2018_dataset.csv), som är i CSV-format, i en PySpark-DataFrame och granskar datan med hjälp av grundläggande DataFrame-operationer.

Kom ihåg att du redan har en SparkSession spark och en variabel file_path tillgängliga i din arbetsyta.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Skapa en PySpark-DataFrame från file_path (som är sökvägen till filen Fifa2018_dataset.csv).
  • Skriv ut DataFramens schema.
  • Skriv ut de första 10 observationerna.
  • Hur många rader finns det i DataFrame?

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)

# Check the schema of columns
fifa_df.____()

# Show the first 10 observations
fifa_df.____(____)

# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))
Redigera och kör kod