Wczytywanie ramki danych z pliku parquet
W twoim środowisku roboczym dostępny jest plik sherlock_sentences.parquet zawierający ramkę danych. Każdy wiersz tej ramki to pojedyncze zdanie składowe – sekwencja słów oddzielona od pozostałych zdań znakami interpunkcyjnymi, takimi jak kropki, cudzysłowy i inne naturalne separatory języka. Twoim zadaniem jest wczytanie tego pliku.
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark SQL w Pythonie
Instrukcje do ćwiczenia
- Wczytaj plik
sherlock_sentences.parquet. - Odfiltruj wiersze spełniające warunek "id > 70" i wyświetl pierwsze 5 wierszy.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the dataframe
df = ____('sherlock_sentences.parquet')
# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)