ÎncepețiÎncepe gratuit

Elimină cuvintele de oprire și reduce setul de date

În acest exercițiu vei elimina cuvintele de oprire din datele tale. Cuvintele de oprire sunt cuvinte comune care, de regulă, nu prezintă interes – de exemplu, „I", „the", „a" etc. Poți elimina multe astfel de cuvinte folosind o listă proprie. În acest exercițiu însă, vei folosi o listă predefinită, stop_words, pusă deja la dispoziție în mediul tău de lucru.

După eliminarea cuvintelor de oprire, vei crea un RDD de perechi în care fiecare element este un tuplu de tip (k, v), unde k este cheia și v este valoarea. În acest exemplu, RDD-ul de perechi este compus din (w, 1), unde w reprezintă fiecare cuvânt din RDD, iar 1 este un număr. În final, vei combina valorile cu aceeași cheie din RDD-ul de perechi pentru a număra aparițiile fiecărui cuvânt.

Reține că ai deja un SparkContext sc și splitRDD disponibile în spațiul tău de lucru, împreună cu variabila listă stop_words.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Filtrează splitRDD, eliminând cuvintele de oprire din variabila stop_words.
  • Creează un tuplu RDD de perechi care conține cuvântul (folosind iteratorul w) și numărul 1 pentru fiecare element-cuvânt din splitRDD.
  • Calculează numărul de apariții ale fiecărui cuvânt (frecvența cuvintelor) în RDD-ul de perechi. Folosește o transformare care operează pe perechi cheie-valoare (k, v). Gândește-te cu atenție ce funcție este potrivită aici.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Filter splitRDD to remove stop words from the stop_words curated list
splitRDD_no_stop = splitRDD.____(lambda x: x.lower() not in ____)

# Create a tuple of the word (w) and 1 
splitRDD_no_stop_words = splitRDD_no_stop.map(lambda w: (____, ____))

# Count of the number of occurences of each word
resultRDD = splitRDD_no_stop_words.____(lambda x, y: x + y)
Editează și rulează codul