Аналітика з SQL на датафреймах
SQL-запити зазвичай лаконічні та простіші у виконанні, ніж операції з датафреймами. Але щоб застосувати SQL до датафрейму, спершу потрібно створити його тимчасове подання як таблиці, а вже потім виконувати SQL-запити до створеної таблиці.
У вашому середовищі вже доступні SparkContext spark і датафрейм salaries_df.
Ця вправа є частиною курсу
Вступ до PySpark
Інструкції до вправи
- Створіть тимчасову таблицю
"salaries_table"з датафреймуsalaries_df. - Складіть запит, щоб вибрати стовпець "job_title" для
company_locationу Канаді ("CA"). - Застосуйте SQL-запит і створіть новий датафрейм
canada_titles. - Отримайте зведену статистику таблиці.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a temporary view of salaries_table
salaries_df.____('salaries_table')
# Construct the "query"
query = '''SELECT job_title, salary_in_usd FROM ____ WHERE company_location == "CA"'''
# Apply the SQL "query"
canada_titles = spark.____(____)
# Generate basic statistics
canada_titles.____().show()