НачатьНачать бесплатно

Часть 1: создание DataFrame из CSV-файла

Каждые 4 года болельщики по всему миру отмечают Чемпионат мира по футболу FIFA, и в это время жизнь во многих странах преображается. В этом упражнении, состоящем из 3 частей, вы проведёте разведочный анализ данных (EDA) на основе набора данных «FIFA 2018 World Cup Player» с помощью PySpark SQL. Вы будете работать с операциями над DataFrame, SQL-запросами и визуализацией.

В первой части вы загрузите набор данных FIFA 2018 World Cup Players (Fifa2018_dataset.csv) в формате CSV в DataFrame PySpark и изучите данные с помощью базовых операций над DataFrame.

Напоминаем: в вашем рабочем пространстве уже доступны SparkSession spark и переменная file_path.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Создайте DataFrame PySpark из file_path (путь к файлу Fifa2018_dataset.csv).
  • Выведите схему DataFrame.
  • Выведите первые 10 наблюдений.
  • Сколько строк содержится в DataFrame?

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)

# Check the schema of columns
fifa_df.____()

# Show the first 10 observations
fifa_df.____(____)

# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))
Редактировать и запускать код