Tipuri de date
Bine făcut! Înainte să treci la modelare, este important să știi că Spark lucrează exclusiv cu date numerice. Asta înseamnă că toate coloanele din DataFrame-ul tău trebuie să fie fie numere întregi, fie numere zecimale (numite "double" în Spark).
Atunci când am importat datele, am lăsat Spark să ghicească tipul de date din fiecare coloană. Din păcate, Spark nu ghicește întotdeauna corect – vei observa că unele coloane sunt șiruri de caractere care conțin numere, în loc de valori numerice propriu-zise.
Pentru a remedia acest lucru, poți folosi metoda .cast() împreună cu metoda .withColumn().
Este important de reținut că .cast() se aplică pe coloane, iar .withColumn() se aplică pe DataFrame-uri.
Singurul argument pe care trebuie să îl transmiți metodei .cast() este tipul de valoare dorit, sub formă de șir de caractere. De exemplu, pentru numere întregi vei transmite argumentul "integer", iar pentru numere zecimale vei folosi "double".
Poți include apelul la .cast() în interiorul unui apel la .withColumn() pentru a suprascrie coloana existentă, exact cum ai făcut în capitolul anterior!
Ce tip de date are nevoie Spark pentru modelare?
Acest exercițiu face parte din cursul
Fundamente PySpark
Exercițiu interactiv practic
Transformă teoria în practică cu unul dintre exercițiile noastre interactive
Începe exercițiul