Začněte nyníZačněte zdarma

Datové typy

Dobrá práce! Než se pustíš do modelování, je důležité vědět, že Spark pracuje výhradně s numerickými daty. To znamená, že všechny sloupce v tvém DataFrame musí být buď celá čísla (integers), nebo desetinná čísla (v Sparku označovaná jako "double").

Při importu dat jsme nechali Spark, aby sám odhadl, jaký typ informací každý sloupec obsahuje. Spark ale neuhádne vždy správně – uvidíš, že některé sloupce v tvém DataFrame jsou řetězce (strings) obsahující čísla, místo aby to byly skutečné numerické hodnoty.

Napravit to můžeš pomocí metody .cast() v kombinaci s metodou .withColumn(). Důležité je vědět, že .cast() pracuje se sloupci, zatímco .withColumn() pracuje s DataFrames.

Metodě .cast() stačí předat jediný argument – typ hodnoty, kterou chceš vytvořit, jako řetězec. Například pro celá čísla předáš "integer" a pro desetinná čísla "double".

Volání .cast() můžeš vnořit do volání .withColumn(), čímž přepíšeš stávající sloupec – stejně jako jsi to dělal/a v předchozí kapitole!

Jaký typ dat Spark potřebuje pro modelování?

Toto cvičení je součástí kurzu

Foundations of PySpark

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení