НачатьНачать бесплатно

Импорт плоских файлов в DataFrame с помощью pandas (2)

В предыдущем упражнении вы научились импортировать плоские файлы в DataFrame библиотеки pandas. Кроме того, на основе DataFrame легко получить соответствующий массив numpy — для этого достаточно вызвать метод .to_numpy(). Теперь попробуем сделать это на примере набора данных MNIST, который доступен в файле digits.csv.

Для этого упражнения вам пригодятся следующие аргументы функции pd.read_csv():

  • nrows — позволяет указать количество строк для чтения. Например, nrows=10 импортирует только первые 10 строк.
  • header — принимает номер строки, которая используется как заголовок столбцов и обозначает начало данных. Если файл не содержит строки заголовка, задайте header=None: в этом случае pandas автоматически присвоит столбцам целочисленные метки, начиная с 0 (например, 0, 1, 2, …).

Это упражнение является частью курса

Введение в импорт данных в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте первые 5 строк файла в DataFrame с помощью функции pd.read_csv() и сохраните результат в переменную data. Используйте аргументы nrows и header. Обратите внимание: в этом файле нет строки заголовка.
  • Постройте массив numpy на основе полученного DataFrame data и сохраните его в переменную data_array.
  • Выполните print(type(data_array)), чтобы вывести тип данных переменной data_array.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Assign the filename: file
file = 'digits.csv'

# Read the first 5 rows of the file into a DataFrame: data
data = ____(____, ____, ____)

# Build a numpy array from the DataFrame: data_array
data_array = ____

# Print the datatype of data_array to the shell
print(type(data_array))
Редактировать и запускать код