Без посередників
Тепер ви вмієте завантажувати дані у Spark через pandas, але, мабуть, замислюєтеся: навіщо взагалі залучати pandas? Хіба не простіше одразу прочитати текстовий файл у Spark? Звісно, простіше!
На щастя, ваш SparkSession має атрибут .read із кількома методами для зчитування різних джерел даних у датафрейми Spark. Завдяки їм ви можете створити датафрейм з файлу .csv так само, як і звичайний датафрейм у pandas!
Змінна file_path — це рядок із шляхом до файлу airports.csv. У цьому файлі міститься інформація про різні аеропорти з усього світу.
У вашому робочому середовищі доступний SparkSession з назвою spark.
Ця вправа є частиною курсу
Основи PySpark
Інструкції до вправи
- Використайте метод
.read.csv()для створення датафрейму Spark під назвоюairports.- Першим аргументом передайте
file_path. - Передайте аргумент
header=True, щоб Spark узяв назви стовпців з першого рядка файлу.
- Першим аргументом передайте
- Виведіть цей датафрейм, викликавши
.show().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()