ÎncepețiÎncepe gratuit

Partea 1: Creează un DataFrame dintr-un fișier CSV

La fiecare 4 ani, fanii fotbalului din întreaga lume sărbătoresc „Cupa Mondială FIFA" – un eveniment care schimbă ceva în multe țări. În acest exercițiu în 3 părți, vei realiza o analiză exploratorie a datelor (EDA) pe setul de date „FIFA 2018 World Cup Player", folosind PySpark SQL, care implică operații pe DataFrame, interogări SQL și vizualizare.

În prima parte, vei încărca setul de date FIFA 2018 World Cup Players (Fifa2018_dataset.csv), aflat în format CSV, într-un DataFrame PySpark și vei inspecta datele folosind operații de bază pe DataFrame.

Reține că ai deja la dispoziție o sesiune SparkSession numită spark și o variabilă file_path în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un DataFrame PySpark din file_path (calea către fișierul Fifa2018_dataset.csv).
  • Afișează schema DataFrame-ului.
  • Afișează primele 10 observații.
  • Câte rânduri conține DataFrame-ul?

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)

# Check the schema of columns
fifa_df.____()

# Show the first 10 observations
fifa_df.____(____)

# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))
Editează și rulează codul