Rularea SQL pe DataFrame-uri
DataFrame-urile pot fi manipulate cu ușurință folosind interogări SQL în PySpark. Metoda .sql() dintr-un SparkSession permite aplicațiilor să ruleze interogări SQL în mod programatic și returnează rezultatul ca un nou DataFrame. În acest exercițiu, vei crea un tabel temporar dintr-un DataFrame creat anterior, vei construi o interogare pentru a selecta numele persoanelor din acel tabel temporar și vei atribui rezultatul unui nou DataFrame.
Reține că ai deja un SparkSession spark și un DataFrame df disponibile în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Introducere în PySpark
Instrucțiuni pentru exercițiu
- Creează un tabel temporar numit
"people"din DataFrame-uldf. - Construiește o interogare pentru a selecta numele persoanelor din tabelul temporar
people. - Atribuie rezultatul interogării Spark unui nou DataFrame numit
people_df_names. - Afișează primele 10 nume din DataFrame-ul
people_df_names.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a temporary table "people"
df.____("people")
# Select the names from the temporary table people
query = """SELECT name FROM ____"""
# Assign the result of Spark's query to people_df_names
people_df_names = spark.sql(____)
# Print the top 10 names of the people
people_df_names.____(____)