Імпорт плоских файлів у DataFrame за допомогою pandas (2)
У попередній вправі ви імпортували плоскі файли
у DataFrame бібліотеки pandas. Як бонус, після цього легко
отримати відповідний масив
numpy за допомогою методу .to_numpy(). Тепер ви зможете зробити це на наборі даних MNIST, що доступний як digits.csv.
Функція pd.read_csv() має низку аргументів, корисних для цієї вправи:
nrowsдає змогу вказати, скільки рядків читати з файлу. Наприклад,nrows=10імпортує лише перші 10 рядків.headerприймає номери рядків, які слід використати як підписи стовпців і які позначають початок даних. Якщо файл не містить рядка заголовків, ви можете встановитиheader=None, іpandasавтоматично призначить цілочислові підписи стовпців, починаючи з 0 (наприклад, 0, 1, 2, …).
Ця вправа є частиною курсу
Вступ до імпорту даних у Python
Інструкції до вправи
- Імпортуйте перші 5 рядків файлу у DataFrame за допомогою функції
pd.read_csv()і присвойте результат зміннійdata. Використайте аргументиnrowsіheader. Зверніть увагу, що у файлі немає рядка заголовків. - Створіть масив
numpyз отриманого DataFrame уdataі присвойте його доdata_array. - Виконайте
print(type(data_array)), щоб вивести тип даних змінноїdata_array.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Assign the filename: file
file = 'digits.csv'
# Read the first 5 rows of the file into a DataFrame: data
data = ____(____, ____, ____)
# Build a numpy array from the DataFrame: data_array
data_array = ____
# Print the datatype of data_array to the shell
print(type(data_array))