Zacznij terazZacznij za darmo

Część 1: Tworzenie DataFrame z pliku CSV

Co cztery lata kibice piłki nożnej na całym świecie świętują Mistrzostwa Świata FIFA – wydarzenie, które w wielu krajach odmienia rzeczywistość dosłownie w każdym wymiarze. W tym ćwiczeniu składającym się z 3 części przeprowadzisz podstawową eksplorację danych (EDA) na zbiorze „FIFA 2018 World Cup Player" przy użyciu PySpark SQL – z wykorzystaniem operacji na DataFrame, zapytań SQL i wizualizacji.

W pierwszej części wczytasz zbiór danych zawodników Mistrzostw Świata FIFA 2018 (Fifa2018_dataset.csv) w formacie CSV do DataFrame PySpark, a następnie zapoznasz się z danymi za pomocą podstawowych operacji na DataFrame.

Pamiętaj, że w swoim środowisku masz już dostępną sesję SparkSession spark oraz zmienną file_path.

To ćwiczenie jest częścią kursu

Podstawy Big Data z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz DataFrame PySpark na podstawie file_path (ścieżki do pliku Fifa2018_dataset.csv).
  • Wyświetl schemat DataFrame.
  • Wyświetl pierwsze 10 obserwacji.
  • Ile wierszy zawiera DataFrame?

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)

# Check the schema of columns
fifa_df.____()

# Show the first 10 observations
fifa_df.____(____)

# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))
Edytuj i uruchom kod