Chia dữ liệu
Một dataframe df_examples có sẵn với các cột endword: string, features: vector, outvec: vector, và label: int. Bạn sẽ tách nó để lấy tập huấn luyện và tập kiểm tra, dùng để huấn luyện và kiểm tra một bộ phân loại.
Bài tập này là một phần của khóa học
Nhập môn Spark SQL bằng Python
Hướng dẫn bài tập
- Chia các ví dụ thành train và test theo tỷ lệ 80/20.
- In số lượng ví dụ huấn luyện.
- In số lượng ví dụ kiểm tra.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)
# Print the number of training examples
print("Number training: ", ____.____)
# Print the number of test examples
print("Number test: ", ____.____)