Utiliser pandas pour importer des fichiers plats comme DataFrames (2)
Dans le dernier exercice, vous avez pu importer des fichiers plats dans un DataFrame pandas. En prime, il est ensuite facile de récupérer le tableau numpy correspondant au moyen de la méthode .to_numpy(). Vous aurez maintenant l'occasion de le faire avec l'ensemble de données MNIST, disponible sous le nom digits.csv.
Plusieurs arguments de pd.read_csv() vous seront utiles pour cet exercice :
nrowsvous permet d'indiquer combien de lignes lire dans le fichier. Par exemple,nrows=10n'importera que les 10 premières lignes.headeraccepte les numéros de ligne à utiliser comme étiquettes de colonnes et marque le début des données. Si le fichier ne contient pas de ligne d'en-tête, vous pouvez définirheader=None, etpandasattribuera automatiquement des étiquettes de colonnes entières à partir de 0 (p. ex., 0, 1, 2, …).
Cette activité fait partie du cours
Introduction à l'importation de données en Python
Instructions de l’exercice
- Importez les 5 premières lignes du fichier dans un DataFrame à l'aide de la fonction
pd.read_csv()et assignez le résultat àdata. Vous devrez utiliser les argumentsnrowsetheader. Notez qu'il n'y a pas de ligne d'en-tête dans ce fichier. - Construisez un tableau
numpyà partir du DataFrame obtenu dansdataet assignez-le àdata_array. - Exécutez
print(type(data_array))pour afficher le type de données dedata_array.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Assign the filename: file
file = 'digits.csv'
# Read the first 5 rows of the file into a DataFrame: data
data = ____(____, ____, ____)
# Build a numpy array from the DataFrame: data_array
data_array = ____
# Print the datatype of data_array to the shell
print(type(data_array))