Charger un dataframe à partir d'un fichier Parquet
Un fichier de dataframe nommé sherlock_sentences.parquet est disponible dans votre espace de travail. Chaque ligne de ce dataframe contient une seule proposition. Chaque proposition est une suite de mots séparée des autres par de la ponctuation, comme des points, des guillemets et d'autres délimiteurs de langue naturelle qui marquent une phrase ou un fragment de phrase. Votre mission, si vous l'acceptez, est de charger ce fichier.
Cette activité fait partie du cours
Introduction à Spark SQL en Python
Instructions de l’exercice
- Chargez
sherlock_sentences.parquet. - Filtrez avec « id > 70 », puis affichez les 5 premières lignes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the dataframe
df = ____('sherlock_sentences.parquet')
# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)