ÎncepețiÎncepe gratuit

Partea 2: Interogări SQL pe DataFrame

DataFrame-ul fifa_df pe care l-am creat conține informații suplimentare despre tipurile de date și numele coloanelor asociate. Aceste informații îi permit PySpark SQL să execute interogări SQL pe DataFrame. Interogările SQL sunt concise și mai ușor de rulat decât operațiile pe DataFrame. Totuși, pentru a aplica interogări SQL pe un DataFrame, trebuie mai întâi să creezi o vizualizare temporară a acestuia sub formă de tabel, după care poți aplica interogările SQL pe tabelul creat (Running SQL Queries Programmatically).

În această a doua parte, vei crea un tabel temporar din DataFrame-ul fifa_df și vei rula interogări SQL pentru a extrage coloana 'Age' a jucătorilor din Germania.

Ai deja un SparkContext spark și fifa_df disponibile în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează tabelul temporar fifa_df_table din DataFrame-ul fifa_df.
  • Construiește o „interogare" (query) pentru a extrage coloana "Age" a jucătorilor din Germania din fifa_df_table.
  • Aplică „interogarea" SQL și creează un nou DataFrame numit fifa_df_germany_age.
  • Calculează statisticile de bază ale DataFrame-ului creat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a temporary view of fifa_df
fifa_df.____('fifa_df_table')

# Construct the "query"
query = '''SELECT ____ FROM ____ WHERE Nationality == "Germany"'''

# Apply the SQL "query"
fifa_df_germany_age = spark.____(____)

# Generate basic statistics
fifa_df_germany_age.____().show()
Editează și rulează codul