Обработка больших объёмов данных из Twitter
Иногда объём данных, которые нужно обработать, превышает возможности оперативной памяти компьютера. Это распространённая проблема в работе специалистов по данным. Один из способов её решить — обрабатывать источник данных не целиком, а по частям (чанками).
В этом упражнении вы сделаете именно это. Вы обработаете большой CSV-файл с данными из Twitter так же, как обрабатывали 'tweets.csv' в упражнениях Bringing it all together из предыдущего курса, но на этот раз — порциями по 10 записей за раз.
Если вас интересует, как получить доступ к данным Twitter для работы на собственном компьютере, обратитесь к части 2 курса DataCamp по импорту данных в Python.
Библиотека pandas импортирована как pd, а файл 'tweets.csv' находится в вашем текущем рабочем каталоге.
Имейте в виду, что это реальные данные из Twitter, поэтому существует вероятность, что они содержат нецензурную лексику или другой нежелательный контент (в этом упражнении и в последующих, которые также используют реальные данные Twitter).
Это упражнение является частью курса
Инструментарий Python
Инструкции к упражнению
- Инициализируйте пустой словарь
counts_dictдля хранения результатов обработки данных Twitter. - Переберите файл
'tweets.csv'с помощью циклаfor. Используйте переменную циклаchunkи итерируйтесь по результату вызоваpd.read_csv()с параметромchunksize, равным 10. - Во внутреннем цикле переберите значения столбца
'lang'вchunkс помощью циклаfor. Используйте переменную циклаentry.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Initialize an empty dictionary: counts_dict
# Iterate over the file chunk by chunk
for ____ in ____:
# Iterate over the column in DataFrame
for ____ in ____:
if entry in counts_dict.keys():
counts_dict[entry] += 1
else:
counts_dict[entry] = 1
# Print the populated dictionary
print(counts_dict)