始める無料で始める

データ型

よくできました!モデリングに入る前に、Spark は数値データしか扱えないことを押さえておきましょう。つまり、DataFrame のすべての列は整数か小数(Spark では「double」と呼びます)のいずれかである必要があります。

このデータを読み込むとき、各列の型は Spark に推測させました。しかし、Spark の推測は常に正しいとは限らず、実際には数値なのに文字列として読み込まれている列がいくつかあります。

これを解決するには、.withColumn() メソッドと組み合わせて .cast() メソッドを使います。 重要なポイントとして、.cast() は列に対して機能し、.withColumn() は DataFrame に対して機能します。

.cast() に渡す引数は、作成したい型を表す文字列だけです。たとえば整数を作るには引数として "integer"、小数には "double" を指定します。

前の章で行ったように、この .cast() の呼び出しを .withColumn() の中に入れて、既存の列を上書きできます!

Spark がモデリングに必要とするデータの種類は何ですか?

この演習はコースの一部です

PySpark入門

コースを見る

実践的なインタラクティブ演習

理論を実践に変える、インタラクティブな演習のひとつをお試しください

演習を開始する