CommencezCommencez gratuitement

Charger des données dans l'interpréteur PySpark

En PySpark, on exprime le calcul au moyen d'opérations sur des collections distribuées, automatiquement parallélisées sur le cluster. Dans l'exercice précédent, vous avez vu comment charger une liste comme collection parallélisée. Dans cet exercice, vous allez charger des données à partir d'un fichier local dans l'interpréteur PySpark.

Rappel : vous disposez déjà d'un SparkContext sc et d'une variable file_path (le chemin vers le fichier README.md) dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Chargez le fichier texte local README.md dans l'interpréteur PySpark.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load a local file into PySpark shell
lines = sc.____(file_path)
Modifier et exécuter le code