Загрузка CSV в DataFrame
В предыдущем упражнении вы познакомились со способом создания DataFrame из RDD. Однако на практике наиболее распространённый способ создания DataFrame — загрузка данных из CSV-файла. В этом упражнении вы создадите PySpark DataFrame из файла people.csv, путь к которому уже задан в переменной file_path, а затем убедитесь, что полученный объект является PySpark DataFrame.
Напомним: в вашем рабочем пространстве уже доступны объект SparkSession spark и переменная file_path (путь к файлу people.csv).
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Создайте DataFrame из переменной
file_path, которая содержит путь к файлуpeople.csv. - Убедитесь, что полученный объект является PySpark DataFrame.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)
# Check the type of people_df
print("The type of people_df is", ____(people_df))