始める無料で始める

データを分割する

データフレーム df_examples が用意されています。列は endword: string、features: vector、outvec: vector、label: int です。これを学習用とテスト用に分割し、分類器の学習と評価に使います。

この演習はコースの一部です

Pythonで学ぶ Spark SQL 入門

コースを見る

演習の手順

  • 例を 80/20 の割合で学習用とテスト用に分割します。
  • 学習用データの件数を出力します。
  • テスト用データの件数を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)

# Print the number of training examples
print("Number training: ", ____.____)

# Print the number of test examples
print("Number test: ", ____.____)
コードを編集して実行