Încărcarea unui dataframe dintr-un fișier parquet
În spațiul tău de lucru se află un fișier dataframe numit sherlock_sentences.parquet. Fiecare rând al acestui dataframe conține o singură propoziție. O propoziție este o secvență de cuvinte separată de alte propoziții prin semne de punctuație – puncte, ghilimele și alți delimitatori specifici limbajului natural care marchează o frază sau o parte de frază. Misiunea ta, dacă alegi să o accepți, este să încarci acest fișier.
Acest exercițiu face parte din cursul
Introducere în Spark SQL în Python
Instrucțiuni pentru exercițiu
- Încarcă
sherlock_sentences.parquet. - Filtrează după „id > 70" și afișează primele 5 rânduri.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the dataframe
df = ____('sherlock_sentences.parquet')
# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)