ÎncepețiÎncepe gratuit

Rularea interogărilor SQL în mod programatic

DataFrame-urile pot fi manipulate cu ușurință folosind interogări SQL în PySpark. Funcția sql() dintr-un SparkSession permite aplicațiilor să ruleze interogări SQL în mod programatic și returnează rezultatul ca un nou DataFrame. În acest exercițiu, vei crea un tabel temporar din DataFrame-ul creat anterior, vei construi o interogare pentru a selecta numele persoanelor din acel tabel temporar și vei atribui rezultatul unui nou DataFrame.

Reține că ai deja un SparkSession spark și un DataFrame disponibil în spațiul de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un tabel temporar people.
  • Construiește o query pentru a selecta numele persoanelor din tabelul temporar people.
  • Atribuie rezultatul interogării query din Spark unui nou DataFrame – people_df_names.
  • Afișează primele 10 nume de persoane din DataFrame-ul people_df_names.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a temporary table "people"
people_df.____("people")

# Construct a query to select the names of the people from the temporary table "people"
query = '''SELECT name FROM ____'''

# Assign the result of Spark's query to people_df_names
people_df_names = spark.sql(____)

# Print the top 10 names of the people
people_df_names.____(____)
Editează și rulează codul