Часть 1: создание DataFrame из CSV-файла
Каждые 4 года болельщики по всему миру отмечают Чемпионат мира по футболу FIFA, и в это время жизнь во многих странах преображается. В этом упражнении, состоящем из 3 частей, вы проведёте разведочный анализ данных (EDA) на основе набора данных «FIFA 2018 World Cup Player» с помощью PySpark SQL. Вы будете работать с операциями над DataFrame, SQL-запросами и визуализацией.
В первой части вы загрузите набор данных FIFA 2018 World Cup Players (Fifa2018_dataset.csv) в формате CSV в DataFrame PySpark и изучите данные с помощью базовых операций над DataFrame.
Напоминаем: в вашем рабочем пространстве уже доступны SparkSession spark и переменная file_path.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Создайте DataFrame PySpark из
file_path(путь к файлуFifa2018_dataset.csv). - Выведите схему DataFrame.
- Выведите первые 10 наблюдений.
- Сколько строк содержится в DataFrame?
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)
# Check the schema of columns
fifa_df.____()
# Show the first 10 observations
fifa_df.____(____)
# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))