Частина 2: SQL-запити до DataFrame
Датафрейм fifa_df, який ми створили, містить додаткові відомості про типи даних і назви стовпців. Завдяки цій інформації PySpark SQL може виконувати SQL-запити до датафрейма. SQL-запити лаконічні та простіші у виконанні, ніж операції з DataFrame. Але щоб застосувати SQL-запити до датафрейма, спочатку потрібно створити його тимчасове подання як таблиці, а потім виконувати SQL-запити до створеної таблиці (програмне виконання SQL-запитів).
У другій частині ви створите тимчасову таблицю з датафрейма fifa_df і виконаєте SQL-запити, щоб отримати стовпець 'Age' для гравців з Німеччини.
У вашому середовищі вже доступні SparkContext spark і fifa_df.
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Створіть тимчасову таблицю
fifa_df_tableз датафреймаfifa_df. - Складіть «запит», щоб отримати стовпець "Age" для гравців з Німеччини у
fifa_df_table. - Застосуйте SQL-«запит» і створіть новий датафрейм
fifa_df_germany_age. - Обчисліть базову статистику створеного датафрейма.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a temporary view of fifa_df
fifa_df.____('fifa_df_table')
# Construct the "query"
query = '''SELECT ____ FROM ____ WHERE Nationality == "Germany"'''
# Apply the SQL "query"
fifa_df_germany_age = spark.____(____)
# Generate basic statistics
fifa_df_germany_age.____().show()