Импорт плоских файлов в DataFrame с помощью pandas (2)
В предыдущем упражнении вы научились импортировать плоские файлы в DataFrame библиотеки pandas. Кроме того, на основе DataFrame легко получить соответствующий массив numpy — для этого достаточно вызвать метод .to_numpy(). Теперь попробуем сделать это на примере набора данных MNIST, который доступен в файле digits.csv.
Для этого упражнения вам пригодятся следующие аргументы функции pd.read_csv():
nrows— позволяет указать количество строк для чтения. Например,nrows=10импортирует только первые 10 строк.header— принимает номер строки, которая используется как заголовок столбцов и обозначает начало данных. Если файл не содержит строки заголовка, задайтеheader=None: в этом случаеpandasавтоматически присвоит столбцам целочисленные метки, начиная с 0 (например, 0, 1, 2, …).
Это упражнение является частью курса
Введение в импорт данных в Python
Инструкции к упражнению
- Импортируйте первые 5 строк файла в DataFrame с помощью функции
pd.read_csv()и сохраните результат в переменнуюdata. Используйте аргументыnrowsиheader. Обратите внимание: в этом файле нет строки заголовка. - Постройте массив
numpyна основе полученного DataFramedataи сохраните его в переменнуюdata_array. - Выполните
print(type(data_array)), чтобы вывести тип данных переменнойdata_array.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Assign the filename: file
file = 'digits.csv'
# Read the first 5 rows of the file into a DataFrame: data
data = ____(____, ____, ____)
# Build a numpy array from the DataFrame: data_array
data_array = ____
# Print the datatype of data_array to the shell
print(type(data_array))