Аналитика с помощью SQL на DataFrame
SQL-запросы лаконичны и удобны в работе по сравнению с операциями над DataFrame. Однако чтобы применить SQL-запрос к DataFrame, сначала нужно создать временное представление этого DataFrame в виде таблицы, а затем уже выполнять запросы к ней.
В вашем рабочем пространстве уже доступны SparkContext spark и salaries_df.
Это упражнение является частью курса
Введение в PySpark
Инструкции к упражнению
- Создайте временную таблицу
"salaries_table"из DataFramesalaries_df. - Составьте запрос для извлечения столбца
"job_title"по значениюcompany_location, равному Канаде ("CA"). - Выполните SQL-запрос и создайте новый DataFrame
canada_titles. - Получите сводку по таблице.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a temporary view of salaries_table
salaries_df.____('salaries_table')
# Construct the "query"
query = '''SELECT job_title, salary_in_usd FROM ____ WHERE company_location == "CA"'''
# Apply the SQL "query"
canada_titles = spark.____(____)
# Generate basic statistics
canada_titles.____().show()