Datatyper
Bra jobbat! Innan du börjar bygga modeller är det viktigt att känna till att Spark enbart hanterar numeriska data. Det innebär att alla kolumner i din DataFrame måste vara antingen heltal eller decimaltal (som kallas 'doubles' i Spark).
När vi importerade våra data lät vi Spark gissa vilken typ av information varje kolumn innehöll. Tyvärr gissar Spark inte alltid rätt, och du kan se att vissa kolumner i vår DataFrame är strängar som innehåller tal – i stället för faktiska numeriska värden.
För att åtgärda detta kan du använda metoden .cast() tillsammans med metoden .withColumn().
Observera att .cast() används på kolumner, medan .withColumn() används på DataFrames.
Det enda argumentet du behöver skicka till .cast() är den värdetyp du vill skapa, angiven som en sträng. För att skapa heltal skickar du till exempel argumentet "integer", och för decimaltal använder du "double".
Du kan lägga detta anrop till .cast() inuti ett anrop till .withColumn() för att skriva över den redan befintliga kolumnen – precis som du gjorde i föregående kapitel!
Vilken typ av data behöver Spark för modellering?
Den här övningen är en del av kursen
Grunderna i PySpark
Interaktiv övning med praktiskt arbete
Gör teori till handling med en av våra interaktiva övningar
Starta övningen