ПочатиПочніть безкоштовно

Завантаження CSV у датафрейм

У попередній вправі ви бачили спосіб створення датафрейму з RDD. Зазвичай найпоширеніший спосіб створення датафреймів — завантаження даних із файлу CSV. У цій вправі ви створите датафрейм PySpark з файлу people.csv, який уже надано як file_path, і перевірите, що створений об'єкт — це датафрейм PySpark.

Пам'ятайте: у вашому середовищі вже доступні SparkSession spark і змінна file_path (шлях до файлу people.csv).

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Створіть датафрейм зі змінної file_path, яка містить шлях до файлу people.csv.
  • Підтвердьте, що результат — це датафрейм PySpark.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)

# Check the type of people_df
print("The type of people_df is", ____(people_df))
Редагувати та запускати код