Část 1: Vytvoření DataFrame z CSV souboru
Každé 4 roky slaví fotbaloví fanoušci po celém světě svátek zvaný „Mistrovství světa ve fotbalu FIFA" a s ním přichází spousta změn v mnoha zemích. V tomto třídílném cvičení provedeš průzkumnou analýzu dat (EDA) na datasetu „FIFA 2018 World Cup Player" pomocí PySpark SQL – čeká tě práce s operacemi nad DataFrame, SQL dotazy i vizualizace.
V první části načteš dataset hráčů Mistrovství světa FIFA 2018 (Fifa2018_dataset.csv) ve formátu CSV do PySparku DataFrame a prozkoumáš data pomocí základních operací nad DataFrame.
Máš k dispozici SparkSession spark a proměnnou file_path ve svém pracovním prostředí.
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Vytvoř PySpark DataFrame z
file_path(což je cesta k souboruFifa2018_dataset.csv). - Vypiš schéma DataFrame.
- Vypiš prvních 10 pozorování.
- Kolik řádků DataFrame obsahuje?
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)
# Check the schema of columns
fifa_df.____()
# Show the first 10 observations
fifa_df.____(____)
# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))