Chọn hàng ngẫu nhiên
Trong bài tập này, bạn sẽ so sánh hai phương pháp đã nêu để chọn các hàng (bản ghi) ngẫu nhiên có hoàn lại trong một DataFrame pandas:
- Hàm tích hợp của
pandaslà.random() - Bộ sinh số nguyên ngẫu nhiên của
NumPynp.random.randint()
Nói chung, trong thống kê và Machine Learning, khi cần huấn luyện một thuật toán, chúng ta huấn luyện trên 75% dữ liệu hiện có và kiểm tra hiệu năng trên 25% còn lại.
Trong bài này, bạn sẽ lấy mẫu ngẫu nhiên 75% tổng số ván bài poker đã chơi bằng mỗi phương pháp ở trên và kiểm tra phương pháp nào hiệu quả hơn về tốc độ.
Bài tập này là một phần của khóa học
Viết mã hiệu quả với pandas
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Extract number of rows in dataset
N=poker_hands.shape[0]
# Select and time the selection of the 75% of the dataset's rows
rand_start_time = time.time()
poker_hands.iloc[np.random.randint(____=0, high=____, ____=int(0.75 * N))]
print("Time using Numpy: {} sec".format(time.time() - rand_start_time))