Частина 1: Створіть датафрейм із CSV‑файлу
Кожні 4 роки футбольні вболівальники по всьому світу святкують подію під назвою «Fifa World Cup», і з нею в багатьох країнах ніби все змінюється. У цій вправі з трьох частин ви виконаєте розвідувальний аналіз даних (EDA) на наборі даних «FIFA 2018 World Cup Player» за допомогою PySpark SQL, застосовуючи операції з датафреймами, SQL‑запити та візуалізацію.
У першій частині ви завантажите набір даних гравців чемпіонату світу FIFA 2018 (Fifa2018_dataset.csv) у форматі CSV до датафрейму PySpark і оглянете дані за допомогою базових операцій із датафреймами.
Пам'ятайте, у вашому робочому середовищі вже доступні SparkSession spark і змінна file_path.
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Створіть датафрейм PySpark з
file_path(це шлях до файлуFifa2018_dataset.csv). - Виведіть схему датафрейму.
- Виведіть перші 10 спостережень.
- Скільки рядків у датафреймі?
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)
# Check the schema of columns
fifa_df.____()
# Show the first 10 observations
fifa_df.____(____)
# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))