Загрузка данных о рейсах
В этом упражнении вы загрузите данные об авиарейсах из CSV-файла. Для быстрой работы набор данных сокращён до 50 000 записей. Полный набор данных в том же формате можно скачать здесь.
Особенности формата CSV:
- поля разделены запятой (разделитель по умолчанию);
- пропущенные данные обозначены строкой 'NA'.
Словарь данных:
mon— месяц (целое число от 1 до 12)dom— день месяца (целое число от 1 до 31)dow— день недели (целое число; 1 = понедельник, 7 = воскресенье)carrier— авиакомпания (код IATA)flight— номер рейсаorg— аэропорт вылета (код IATA)mile— расстояние (в милях)depart— время вылета (в часах, десятичная дробь)duration— ожидаемая продолжительность полёта (в минутах)delay— задержка (в минутах)
Библиотека pyspark уже импортирована, а сессия инициализирована.
Примечание: Данные были существенно сокращены.
Это упражнение является частью курса
Машинное обучение с PySpark
Инструкции к упражнению
- Прочитайте данные из CSV-файла
flights.csv. Задайте типы данных для столбцов автоматически. Обработайте пропущенные значения. - Сколько записей содержится в наборе данных?
- Просмотрите первые пять записей.
- Какие типы данных были присвоены столбцам? Выглядят ли они корректными?
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Read data from CSV file
flights = spark.____.____(____,
sep=____,
header=____,
inferSchema=____,
nullValue=____)
# Get number of records
print("The data contain %d records." % flights.____())
# View the first five records
flights.____(5)
# Check column data types
print(flights.____)