Bắt đầu ngayBắt đầu miễn phí

Chia dữ liệu

Một dataframe df_examples có sẵn với các cột endword: string, features: vector, outvec: vector, và label: int. Bạn sẽ tách nó để lấy tập huấn luyện và tập kiểm tra, dùng để huấn luyện và kiểm tra một bộ phân loại.

Bài tập này là một phần của khóa học

Nhập môn Spark SQL bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Chia các ví dụ thành train và test theo tỷ lệ 80/20.
  • In số lượng ví dụ huấn luyện.
  • In số lượng ví dụ kiểm tra.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)

# Print the number of training examples
print("Number training: ", ____.____)

# Print the number of test examples
print("Number test: ", ____.____)
Chỉnh sửa và Chạy Mã