Začněte nyníZačněte zdarma

Načtení dataframu z parquet souboru

V tvém pracovním prostoru je k dispozici soubor s dataframem sherlock_sentences.parquet. Každý řádek tohoto dataframu obsahuje jednu klauzuli – tedy posloupnost slov oddělenou od ostatních klauzulí interpunkcí, jako jsou tečky, uvozovky a další přirozené oddělovače vět a větných fragmentů. Tvůj úkol, pokud se ho rozhodneš přijmout, je tento soubor načíst.

Toto cvičení je součástí kurzu

Úvod do Spark SQL v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Načti soubor sherlock_sentences.parquet.
  • Filtruj záznamy s podmínkou "id > 70" a zobraz prvních 5 řádků.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the dataframe
df = ____('sherlock_sentences.parquet')

# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)
Upravit a spustit kód