Typy danych
Dobra robota! Zanim zaczniesz budować modele, warto wiedzieć, że Spark operuje wyłącznie na danych liczbowych. Oznacza to, że wszystkie kolumny w twoim DataFrame muszą być albo liczbami całkowitymi, albo liczbami dziesiętnymi (w Sparku nazywanymi double).
Podczas importowania danych Spark samodzielnie próbował rozpoznać typ każdej kolumny. Niestety, nie zawsze robi to poprawnie – niektóre kolumny w twoim DataFrame mogą zawierać liczby zapisane jako tekst, zamiast rzeczywistych wartości liczbowych.
Aby to poprawić, możesz użyć metody .cast() w połączeniu z metodą .withColumn().
Ważne: .cast() działa na kolumnach, natomiast .withColumn() – na DataFrame'ach.
Jedynym argumentem, który musisz przekazać do .cast(), jest nazwa docelowego typu danych w postaci tekstowej. Na przykład, żeby uzyskać liczby całkowite, użyj argumentu "integer", a dla liczb dziesiętnych – "double".
Wywołanie .cast() możesz umieścić wewnątrz .withColumn(), żeby nadpisać istniejącą kolumnę – dokładnie tak, jak robiłeś to w poprzednim rozdziale!
Jakiego rodzaju danych Spark potrzebuje do modelowania?
To ćwiczenie jest częścią kursu
Podstawy PySpark
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie