Завантаження CSV у датафрейм
У попередній вправі ви бачили спосіб створення датафрейму з RDD. Зазвичай найпоширеніший спосіб створення датафреймів — завантаження даних із файлу CSV. У цій вправі ви створите датафрейм PySpark з файлу people.csv, який уже надано як file_path, і перевірите, що створений об'єкт — це датафрейм PySpark.
Пам'ятайте: у вашому середовищі вже доступні SparkSession spark і змінна file_path (шлях до файлу people.csv).
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Створіть датафрейм зі змінної
file_path, яка містить шлях до файлуpeople.csv. - Підтвердьте, що результат — це датафрейм PySpark.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)
# Check the type of people_df
print("The type of people_df is", ____(people_df))