CommencezCommencez gratuitement

Charger un dataframe à partir d'un fichier Parquet

Un fichier de dataframe nommé sherlock_sentences.parquet est disponible dans votre espace de travail. Chaque ligne de ce dataframe contient une seule proposition. Chaque proposition est une suite de mots séparée des autres par de la ponctuation, comme des points, des guillemets et d'autres délimiteurs de langue naturelle qui marquent une phrase ou un fragment de phrase. Votre mission, si vous l'acceptez, est de charger ce fichier.

Cette activité fait partie du cours

Introduction à Spark SQL en Python

Voir le cours

Instructions de l’exercice

  • Chargez sherlock_sentences.parquet.
  • Filtrez avec « id > 70 », puis affichez les 5 premières lignes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the dataframe
df = ____('sherlock_sentences.parquet')

# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)
Modifier et exécuter le code