CommencezCommencez gratuitement

Sélection aléatoire de lignes

Dans cet exercice, vous allez comparer deux méthodes pour sélectionner des lignes (entrées) aléatoires avec remise dans un DataFrame pandas :

  • La fonction intégrée de pandas .random()
  • Le générateur de nombres entiers aléatoires de NumPy np.random.randint()

De façon générale, en statistiques et en Machine Learning, lorsqu'on doit entraîner un algorithme, on l'entraîne sur 75 % des données disponibles, puis on évalue sa performance sur les 25 % restants.

Pour cet exercice, nous allons échantillonner aléatoirement 75 % de toutes les mains de poker jouées disponibles, en utilisant chacune des méthodes ci-dessus, puis vérifier laquelle est la plus efficace en termes de vitesse.

Cette activité fait partie du cours

Rédiger du code efficace avec pandas

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Extract number of rows in dataset
N=poker_hands.shape[0]

# Select and time the selection of the 75% of the dataset's rows
rand_start_time = time.time()
poker_hands.iloc[np.random.randint(____=0, high=____, ____=int(0.75 * N))]
print("Time using Numpy: {} sec".format(time.time() - rand_start_time))
Modifier et exécuter le code