НачатьНачать бесплатно

Загрузка CSV в DataFrame

В предыдущем упражнении вы познакомились со способом создания DataFrame из RDD. Однако на практике наиболее распространённый способ создания DataFrame — загрузка данных из CSV-файла. В этом упражнении вы создадите PySpark DataFrame из файла people.csv, путь к которому уже задан в переменной file_path, а затем убедитесь, что полученный объект является PySpark DataFrame.

Напомним: в вашем рабочем пространстве уже доступны объект SparkSession spark и переменная file_path (путь к файлу people.csv).

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Создайте DataFrame из переменной file_path, которая содержит путь к файлу people.csv.
  • Убедитесь, что полученный объект является PySpark DataFrame.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)

# Check the type of people_df
print("The type of people_df is", ____(people_df))
Редактировать и запускать код