Načtení dataframu z parquet souboru
V tvém pracovním prostoru je k dispozici soubor s dataframem sherlock_sentences.parquet. Každý řádek tohoto dataframu obsahuje jednu klauzuli – tedy posloupnost slov oddělenou od ostatních klauzulí interpunkcí, jako jsou tečky, uvozovky a další přirozené oddělovače vět a větných fragmentů. Tvůj úkol, pokud se ho rozhodneš přijmout, je tento soubor načíst.
Toto cvičení je součástí kurzu
Úvod do Spark SQL v Pythonu
Pokyny k cvičení
- Načti soubor
sherlock_sentences.parquet. - Filtruj záznamy s podmínkou "id > 70" a zobraz prvních 5 řádků.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the dataframe
df = ____('sherlock_sentences.parquet')
# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)