Répartir les données

Un dataframe text_df existe, avec les colonnes id, word et chapter. Les 5 premières lignes de text_df sont affichées dans la console.

Vous pouvez vérifier qu’il y a 12 chapitres avec la commande suivante :

text_df.select('chapter')\
       .distinct()\
       .sort('chapter')\
       .show(truncate=False)

Le résultat de cette commande est affiché dans la console sous « Table 1 ».

Le dataframe text_df ne possède actuellement qu’une seule partition. Supposons que vous sachiez que les prochaines étapes de traitement vont regrouper les données par chapitre. Le traitement sera plus efficace si chaque chapitre reste sur une seule machine. Pour éviter des déplacements inutiles de données d’une machine à l’autre, répartissons le dataframe en une partition par chapitre, en utilisant les commandes repartition et getNumPartitions vues dans la première vidéo de ce chapitre.

N’hésitez pas à consulter les diaporamas disponibles à droite de la console si vous ne vous souvenez plus comment cela a été fait dans la vidéo.

Cet exercice fait partie du cours

Introduction à Spark SQL en Python

Afficher le cours

Instructions

Répartissez text_df en 12 partitions, avec chaque chapitre dans sa propre partition.
Affichez le nombre de partitions du nouveau dataframe.

Exercice interactif pratique

Essayez cet exercice en complétant cet exemple de code.

# Repartition text_df into 12 partitions on 'chapter' column
repart_df = text_df.____(____, ____)

# Prove that repart_df has 12 partitions
repart_df.____.____

Modifier et exécuter le code

Cet exercice fait partie du cours

Introduction à Spark SQL en Python

AvancéNiveau de compétence

4.8+

Commencer le cours gratuitement

Dans ce chapitre, vous apprendrez à créer et interroger une table SQL dans Spark. Spark SQL apporte l’expressivité de SQL à Spark. Vous verrez aussi comment utiliser les fonctions de fenêtre SQL dans Spark. Les fonctions de fenêtre effectuent des calculs sur des lignes liées à la ligne courante. Elles simplifient grandement des résultats difficiles à obtenir avec de simples jointures et agrégations classiques. Nous utiliserons des fonctions de fenêtre pour calculer des cumuls progressifs, des différences successives et d’autres opérations qui sont délicates en SQL de base.

Exercise 1: Créer et interroger une table SQL dans Spark Exercise 2: Créer une table SQL à partir d’un dataframe Exercise 3: Déterminer les noms des colonnes d’une table Exercise 4: Fonctions fenêtre en SQL Exercise 5: Sommes cumulatives avec les fonctions de fenêtre en SQL Exercise 6: Corriger la requête défectueuse Exercise 7: Notation par points et SQL Exercise 8: Agrégation, étape par étape Exercise 9: Agrégations multiples sur la même colonne Exercise 10: Agrégat SQL en notation par points Exercise 11: Convertir une fonction window de la notation par points vers SQL

Dans ce chapitre, vous chargerez du texte en langage naturel. Vous appliquerez ensuite une analyse avec fenêtre glissante pour trouver des séquences de mots fréquentes.

Exercise 1: Charger du texte en langage naturel Exercise 2: Charger un dataframe à partir d’un fichier Parquet Exercise 3: Scinder et éclater une colonne de texte Exercise 4: Utiliser monotonically_increasing_id()Exercise 5: Analyse par fenêtre glissante Exercise 6: Créer des données de caractéristiques à partir d’une fenêtre de contexte Exercise 7: Répartir les données

Exercice en cours

Exercise 8: Séquences de mots fréquentes Exercise 9: De quel type de données s’agit-il ?Exercise 10: Trouver des séquences de mots fréquentes Exercise 11: 5-uplets uniques en ordre trié Exercise 12: 3-uplets les plus fréquents par chapitre

Dans les chapitres précédents, vous avez appris à exploiter l’expressivité des fonctions de fenêtre en SQL. Cette expressivité rend désormais essentiel de savoir mettre correctement en cache les DataFrames et les tables SQL. Il est aussi important de savoir évaluer votre application. Vous apprendrez à le faire avec l’interface Spark. Vous verrez également une bonne pratique de journalisation dans Spark. Spark SQL apporte un autre outil utile pour optimiser les performances des requêtes : le plan d’exécution. Vous apprendrez à utiliser ce plan pour évaluer la provenance d’un DataFrame.

Exercise 1: Mise en cache Exercise 2: S’exercer au cache : partie 1 Exercise 3: S’exercer au cache : le SQL Exercise 4: S’entraîner au caching : tout rassembler Exercise 5: Mettre en cache et retirer du cache des tables Exercise 6: L’interface Spark Exercise 7: Onglet Storage de la Spark UI Exercise 8: Inspecter le cache dans l’interface Spark UI Exercise 9: Journalisation Exercise 10: S’entraîner au logging Exercise 11: S'entraîner au logging 2 Exercise 12: Plans de requête Exercise 13: S’entraîner avec les plans de requête Exercise 14: S’entraîner à lire des plans de requête 2

Les chapitres précédents vous ont donné les outils pour charger du texte brut, le tokeniser et extraire des séquences de mots. C’est déjà très utile pour l’analyse, mais cela l’est aussi pour le Machine Learning. Ce que vous avez appris se concrétise ici avec l’utilisation d’une régression logistique pour classer du texte. À la fin de ce chapitre, vous aurez chargé des données textuelles brutes en langage naturel et les aurez utilisées pour entraîner un classifieur de texte.

Exercise 1: Extraire, transformer, sélectionner Exercise 2: S’entraîner à créer une UDF Exercise 3: S’exercer avec une colonne de type array Exercise 4: Créer des données de caractéristiques pour la classification Exercise 5: Créer un UDF pour des données vectorielles Exercise 6: Appliquer une UDF à des données vectorielles Exercise 7: Transformer du texte en format vectoriel Exercise 8: Classification de texte Exercise 9: Attribuer un label aux données Exercise 10: Diviser les données Exercise 11: Entraîner le classifieur Exercise 12: Prédire et évaluer Exercise 13: Évaluer le classifieur Exercise 14: Prédire sur les données de test Exercise 15: Récapitulatif