Začněte nyníZačněte zdarma

Část 1: Vytvoření DataFrame z CSV souboru

Každé 4 roky slaví fotbaloví fanoušci po celém světě svátek zvaný „Mistrovství světa ve fotbalu FIFA" a s ním přichází spousta změn v mnoha zemích. V tomto třídílném cvičení provedeš průzkumnou analýzu dat (EDA) na datasetu „FIFA 2018 World Cup Player" pomocí PySpark SQL – čeká tě práce s operacemi nad DataFrame, SQL dotazy i vizualizace.

V první části načteš dataset hráčů Mistrovství světa FIFA 2018 (Fifa2018_dataset.csv) ve formátu CSV do PySparku DataFrame a prozkoumáš data pomocí základních operací nad DataFrame.

Máš k dispozici SparkSession spark a proměnnou file_path ve svém pracovním prostředí.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř PySpark DataFrame z file_path (což je cesta k souboru Fifa2018_dataset.csv).
  • Vypiš schéma DataFrame.
  • Vypiš prvních 10 pozorování.
  • Kolik řádků DataFrame obsahuje?

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)

# Check the schema of columns
fifa_df.____()

# Show the first 10 observations
fifa_df.____(____)

# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))
Upravit a spustit kód