НачатьНачать бесплатно

Обработка данных по частям (1)

Иногда источники данных настолько велики, что хранить весь набор данных в памяти слишком ресурсозатратно. В этом упражнении вы будете обрабатывать первые 1000 строк файла построчно, чтобы создать словарь с количеством упоминаний каждой страны в одном из столбцов набора данных.

CSV-файл 'world_dev_ind.csv' находится в вашем текущем рабочем каталоге. Для начала нужно открыть соединение с этим файлом с помощью так называемого менеджера контекста. Например, команда with open('datacamp.csv') as datacamp связывает CSV-файл 'datacamp.csv' с именем datacamp внутри менеджера контекста. Здесь оператор with и является менеджером контекста — он обеспечивает эффективное использование ресурсов при открытии файла.

Если вы хотите узнать больше о менеджерах контекста, обратитесь к курсу DataCamp «Импорт данных в Python».

Это упражнение является частью курса

Инструментарий Python

Посмотреть курс

Инструкции к упражнению

  • С помощью open() свяжите CSV-файл 'world_dev_ind.csv' с именем file в менеджере контекста.
  • Дополните цикл for так, чтобы он выполнился ровно 1000 раз и обработал только первые 1000 строк файла.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Open a connection to the file
with ____ as ____:

    # Skip the column names
    file.readline()

    # Initialize an empty dictionary: counts_dict
    counts_dict = {}

    # Process only the first 1000 rows
    for j in ____:

        # Split the current line into a list: line
        line = file.readline().split(',')

        # Get the value for the first column: first_col
        first_col = line[0]

        # If the column value is in the dict, increment its value
        if first_col in counts_dict.keys():
            counts_dict[first_col] += 1

        # Else, add to the dict and set value to 1
        else:
            counts_dict[first_col] = 1

# Print the resulting dictionary
print(counts_dict)
Редактировать и запускать код