ПочатиПочніть безкоштовно

Частина 1: Створіть датафрейм із CSV‑файлу

Кожні 4 роки футбольні вболівальники по всьому світу святкують подію під назвою «Fifa World Cup», і з нею в багатьох країнах ніби все змінюється. У цій вправі з трьох частин ви виконаєте розвідувальний аналіз даних (EDA) на наборі даних «FIFA 2018 World Cup Player» за допомогою PySpark SQL, застосовуючи операції з датафреймами, SQL‑запити та візуалізацію.

У першій частині ви завантажите набір даних гравців чемпіонату світу FIFA 2018 (Fifa2018_dataset.csv) у форматі CSV до датафрейму PySpark і оглянете дані за допомогою базових операцій із датафреймами.

Пам'ятайте, у вашому робочому середовищі вже доступні SparkSession spark і змінна file_path.

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Створіть датафрейм PySpark з file_path (це шлях до файлу Fifa2018_dataset.csv).
  • Виведіть схему датафрейму.
  • Виведіть перші 10 спостережень.
  • Скільки рядків у датафреймі?

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)

# Check the schema of columns
fifa_df.____()

# Show the first 10 observations
fifa_df.____(____)

# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))
Редагувати та запускати код