Importul fișierelor plate ca DataFrame-uri cu pandas (2)
În exercițiul anterior, ai reușit să imporți fișiere plate
într-un DataFrame pandas. Ca bonus, este foarte simplu
să obții array-ul numpy corespunzător
folosind metoda .to_numpy(). Acum vei avea ocazia
să faci asta cu setul de date MNIST, disponibil ca digits.csv.
Există câțiva argumenți ai funcției pd.read_csv() care îți vor fi utili în acest exercițiu:
nrowsîți permite să specifici câte rânduri să citești din fișier. De exemplu,nrows=10va importa doar primele 10 rânduri.headeracceptă numere de rând care să fie folosite ca etichete de coloane și marchează începutul datelor. Dacă fișierul nu conține un rând de antet, poți setaheader=None, iarpandasva atribui automat etichete întregi coloanelor, începând de la 0 (de exemplu, 0, 1, 2, …).
Acest exercițiu face parte din cursul
Introducere în importul datelor în Python
Instrucțiuni pentru exercițiu
- Importă primele 5 rânduri din fișier într-un DataFrame folosind funcția
pd.read_csv()și atribuie rezultatul variabileidata. Va trebui să folosești argumentelenrowsșiheader. Reține că acest fișier nu conține un rând de antet. - Construiește un array
numpydin DataFrame-ul rezultat îndatași atribuie-l variabileidata_array. - Execută
print(type(data_array))pentru a afișa tipul de date al variabileidata_array.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Assign the filename: file
file = 'digits.csv'
# Read the first 5 rows of the file into a DataFrame: data
data = ____(____, ____, ____)
# Build a numpy array from the DataFrame: data_array
data_array = ____
# Print the datatype of data_array to the shell
print(type(data_array))