Zacznij terazZacznij za darmo

Wczytywanie ramki danych z pliku parquet

W twoim środowisku roboczym dostępny jest plik sherlock_sentences.parquet zawierający ramkę danych. Każdy wiersz tej ramki to pojedyncze zdanie składowe – sekwencja słów oddzielona od pozostałych zdań znakami interpunkcyjnymi, takimi jak kropki, cudzysłowy i inne naturalne separatory języka. Twoim zadaniem jest wczytanie tego pliku.

To ćwiczenie jest częścią kursu

Wprowadzenie do Spark SQL w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj plik sherlock_sentences.parquet.
  • Odfiltruj wiersze spełniające warunek "id > 70" i wyświetl pierwsze 5 wierszy.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the dataframe
df = ____('sherlock_sentences.parquet')

# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)
Edytuj i uruchom kod