Zacznij terazZacznij za darmo

Typy danych

Dobra robota! Zanim zaczniesz budować modele, warto wiedzieć, że Spark operuje wyłącznie na danych liczbowych. Oznacza to, że wszystkie kolumny w twoim DataFrame muszą być albo liczbami całkowitymi, albo liczbami dziesiętnymi (w Sparku nazywanymi double).

Podczas importowania danych Spark samodzielnie próbował rozpoznać typ każdej kolumny. Niestety, nie zawsze robi to poprawnie – niektóre kolumny w twoim DataFrame mogą zawierać liczby zapisane jako tekst, zamiast rzeczywistych wartości liczbowych.

Aby to poprawić, możesz użyć metody .cast() w połączeniu z metodą .withColumn(). Ważne: .cast() działa na kolumnach, natomiast .withColumn() – na DataFrame'ach.

Jedynym argumentem, który musisz przekazać do .cast(), jest nazwa docelowego typu danych w postaci tekstowej. Na przykład, żeby uzyskać liczby całkowite, użyj argumentu "integer", a dla liczb dziesiętnych – "double".

Wywołanie .cast() możesz umieścić wewnątrz .withColumn(), żeby nadpisać istniejącą kolumnę – dokładnie tak, jak robiłeś to w poprzednim rozdziale!

Jakiego rodzaju danych Spark potrzebuje do modelowania?

To ćwiczenie jest częścią kursu

Podstawy PySpark

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń

Rozpocznij ćwiczenie