НачатьНачать бесплатно

Загрузка данных о рейсах

В этом упражнении вы загрузите данные об авиарейсах из CSV-файла. Для быстрой работы набор данных сокращён до 50 000 записей. Полный набор данных в том же формате можно скачать здесь.

Особенности формата CSV:

  • поля разделены запятой (разделитель по умолчанию);
  • пропущенные данные обозначены строкой 'NA'.

Словарь данных:

  • mon — месяц (целое число от 1 до 12)
  • dom — день месяца (целое число от 1 до 31)
  • dow — день недели (целое число; 1 = понедельник, 7 = воскресенье)
  • carrier — авиакомпания (код IATA)
  • flight — номер рейса
  • org — аэропорт вылета (код IATA)
  • mile — расстояние (в милях)
  • depart — время вылета (в часах, десятичная дробь)
  • duration — ожидаемая продолжительность полёта (в минутах)
  • delay — задержка (в минутах)

Библиотека pyspark уже импортирована, а сессия инициализирована.

Примечание: Данные были существенно сокращены.

Это упражнение является частью курса

Машинное обучение с PySpark

Посмотреть курс

Инструкции к упражнению

  • Прочитайте данные из CSV-файла flights.csv. Задайте типы данных для столбцов автоматически. Обработайте пропущенные значения.
  • Сколько записей содержится в наборе данных?
  • Просмотрите первые пять записей.
  • Какие типы данных были присвоены столбцам? Выглядят ли они корректными?

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Read data from CSV file
flights = spark.____.____(____,
                         sep=____,
                         header=____,
                         inferSchema=____,
                         nullValue=____)

# Get number of records
print("The data contain %d records." % flights.____())

# View the first five records
flights.____(5)

# Check column data types
print(flights.____)
Редактировать и запускать код