Läsa in en dataram från en parquet-fil
En dataramfil med namnet sherlock_sentences.parquet finns tillgänglig i din arbetsyta. Varje rad i dataramen innehåller en enskild sats. En sats är en sekvens av ord som avgränsas från andra satser med skiljetecken, till exempel punkter, citattecken och andra naturliga avgränsare som markerar en mening eller ett meningsfragment. Din uppgift är att läsa in den här filen.
Den här övningen är en del av kursen
Introduktion till Spark SQL i Python
Övningsinstruktioner
- Läs in
sherlock_sentences.parquet. - Filtrera på "id > 70" och visa de första 5 raderna.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load the dataframe
df = ____('sherlock_sentences.parquet')
# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)