S’entraîner à créer une UDF

Il arrive que vos données nécessitent une transformation non prise en charge par les fonctions intégrées. C’est là qu’une fonction définie par l’utilisateur ("UDF") est adaptée.

La fonction SQL udf est disponible.

Un dataframe df2 est disponible, de type DataFrame[doc: array<string>, in: array<string>, out: array<string>]. Sa colonne doc contient des jetons simples.

Ce qui suit affiche les 20 premières lignes de df2 où doc contient « 1 » :

df2.where(array_contains('doc','1')).show()

Vous avez deux objectifs à atteindre :

Veiller à ce que les données transformées soient des vecteurs non vides.
Un dataframe possède une colonne qui contient des tableaux de chaînes de caractères, où chaque tableau comporte un seul élément. Vous souhaitez transformer cette colonne en une chaîne de caractères.

Cet exercice fait partie du cours

<cours>Introduction à Spark SQL en Python</cours>

Instructions de l’exercice

Créez une udf qui renvoie true si et seulement si la valeur est un vecteur non vide, en utilisant numNonzeros().
Créez une udf qui renvoie le premier élément du tableau et sa représentation sous forme de chaîne.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Returns true if the value is a nonempty vector
nonempty_udf = udf(lambda x:  
    True if (x and hasattr(x, "toArray") and x.____())
    else False, ____())

# Returns first element of the array as string
s_udf = udf(lambda x: ____(x[0]) if (x and type(x) is list and len(x) > 0)
    else '', ____())

Modifier et exécuter le code

Cet exercice fait partie du cours

<cours>Introduction à Spark SQL en Python</cours>

AvancéNiveau de compétence

4.8+

Commencer le cours gratuitement

Dans ce chapitre, vous apprendrez à créer et interroger une table SQL dans Spark. Spark SQL apporte l’expressivité de SQL à Spark. Vous verrez aussi comment utiliser les fonctions de fenêtre SQL dans Spark. Les fonctions de fenêtre effectuent des calculs sur des lignes liées à la ligne courante. Elles simplifient grandement des résultats difficiles à obtenir avec de simples jointures et agrégations classiques. Nous utiliserons des fonctions de fenêtre pour calculer des cumuls progressifs, des différences successives et d’autres opérations qui sont délicates en SQL de base.

Exercise 1: Créer et interroger une table SQL dans Spark Exercise 2: Créer une table SQL à partir d’un dataframe Exercise 3: Déterminer les noms des colonnes d’une table Exercise 4: Fonctions fenêtre en SQL Exercise 5: Sommes cumulatives avec les fonctions de fenêtre en SQL Exercise 6: Corriger la requête défectueuse Exercise 7: Notation par points et SQL Exercise 8: Agrégation, étape par étape Exercise 9: Agrégations multiples sur la même colonne Exercise 10: Agrégat SQL en notation par points Exercise 11: Convertir une fonction window de la notation par points vers SQL

Dans ce chapitre, vous chargerez du texte en langage naturel. Vous appliquerez ensuite une analyse avec fenêtre glissante pour trouver des séquences de mots fréquentes.

Exercise 1: Charger du texte en langage naturel Exercise 2: Charger un dataframe à partir d’un fichier Parquet Exercise 3: Scinder et éclater une colonne de texte Exercise 4: Utiliser monotonically_increasing_id()Exercise 5: Analyse par fenêtre glissante Exercise 6: Créer des données de caractéristiques à partir d’une fenêtre de contexte Exercise 7: Répartir les données Exercise 8: Séquences de mots fréquentes Exercise 9: De quel type de données s’agit-il ?Exercise 10: Trouver des séquences de mots fréquentes Exercise 11: 5-uplets uniques en ordre trié Exercise 12: 3-uplets les plus fréquents par chapitre

Dans les chapitres précédents, vous avez appris à exploiter l’expressivité des fonctions de fenêtre en SQL. Cette expressivité rend désormais essentiel de savoir mettre correctement en cache les DataFrames et les tables SQL. Il est aussi important de savoir évaluer votre application. Vous apprendrez à le faire avec l’interface Spark. Vous verrez également une bonne pratique de journalisation dans Spark. Spark SQL apporte un autre outil utile pour optimiser les performances des requêtes : le plan d’exécution. Vous apprendrez à utiliser ce plan pour évaluer la provenance d’un DataFrame.

Exercise 1: Mise en cache Exercise 2: S’exercer au cache : partie 1 Exercise 3: S’exercer au cache : le SQL Exercise 4: S’entraîner au caching : tout rassembler Exercise 5: Mettre en cache et retirer du cache des tables Exercise 6: L’interface Spark Exercise 7: Onglet Storage de la Spark UI Exercise 8: Inspecter le cache dans l’interface Spark UI Exercise 9: Journalisation Exercise 10: S’entraîner au logging Exercise 11: S'entraîner au logging 2 Exercise 12: Plans de requête Exercise 13: S’entraîner avec les plans de requête Exercise 14: S’entraîner à lire des plans de requête 2

Les chapitres précédents vous ont donné les outils pour charger du texte brut, le tokeniser et extraire des séquences de mots. C’est déjà très utile pour l’analyse, mais cela l’est aussi pour le Machine Learning. Ce que vous avez appris se concrétise ici avec l’utilisation d’une régression logistique pour classer du texte. À la fin de ce chapitre, vous aurez chargé des données textuelles brutes en langage naturel et les aurez utilisées pour entraîner un classifieur de texte.

Exercise 1: Extraire, transformer, sélectionner Exercise 2: S’entraîner à créer une UDF

Exercice actuel

Exercise 3: S’exercer avec une colonne de type array Exercise 4: Créer des données de caractéristiques pour la classification Exercise 5: Créer un UDF pour des données vectorielles Exercise 6: Appliquer une UDF à des données vectorielles Exercise 7: Transformer du texte en format vectoriel Exercise 8: Classification de texte Exercise 9: Attribuer un label aux données Exercise 10: Diviser les données Exercise 11: Entraîner le classifieur Exercise 12: Prédire et évaluer Exercise 13: Évaluer le classifieur Exercise 14: Prédire sur les données de test Exercise 15: Récapitulatif