ÎncepețiÎncepe gratuit

Ești curios să interoghezi?

Unul dintre avantajele interfeței DataFrame este că poți rula interogări SQL pe tabelele din clusterul tău Spark. Dacă nu ai experiență cu SQL, nu-ți face griji – îți vom pune la dispoziție interogările necesare! (Dacă vrei să înveți mai mult despre SQL, începe cu cursul nostru Introducere în SQL.)

Așa cum ai văzut în exercițiul anterior, unul dintre tabelele din clusterul tău este tabela flights. Aceasta conține câte un rând pentru fiecare zbor care a plecat de pe Aeroportul Internațional Portland (PDX) sau de pe Aeroportul Internațional Seattle-Tacoma (SEA) în 2014 și 2015.

Rularea unei interogări pe această tabelă este la fel de simplă ca apelarea metodei .sql() pe SparkSession. Această metodă primește un șir de caractere cu interogarea și returnează un DataFrame cu rezultatele!

Dacă privești mai atent, vei observa că tabela flights apare doar în interogare, nu ca argument al niciunei metode. Motivul este că nu există un obiect local în mediul tău care să conțină acele date, deci nu ar avea sens să transmiți tabela ca argument.

Reține că am creat deja un SparkSession numit spark în spațiul tău de lucru. (Nu mai este numit my_spark, deoarece l-am creat noi pentru tine!)

Acest exercițiu face parte din cursul

Fundamente PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește metoda .sql() pentru a obține primele 10 rânduri din tabela flights și salvează rezultatul în flights10. Variabila query conține interogarea SQL corespunzătoare.
  • Folosește metoda DataFrame .show() pentru a afișa flights10.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Don't change this query
query = "FROM flights SELECT * LIMIT 10"

# Get the first 10 rows of flights
flights10 = ____

# Show the results
flights10.____
Editează și rulează codul