Обробка великих обсягів даних Twitter
Іноді дані, які потрібно опрацювати, настільки великі, що пам'яті комп'ютера не вистачає. Це поширена проблема для фахівців із даних. Рішення — опрацьовувати джерело даних частинами (фрагментами), а не намагатися завантажити все одразу.
У цій вправі ви саме так і зробите. Ви опрацюєте великий CSV‑файл із даними Twitter так само, як обробляли 'tweets.csv' у вправах Підсумуємо все разом у попередньому курсі, але цього разу працюватимете з ним порціями по 10 записів за раз.
Якщо вам цікаво, як отримувати дані з Twitter, щоб працювати з ними на власній системі, перегляньте Частину 2 курсу DataCamp з імпорту даних у Python.
Пакет pandas вже імпортовано як pd, а файл 'tweets.csv' розміщений у вашому поточному каталозі.
Зверніть увагу: це реальні дані з Twitter, тож завжди існує ризик, що вони можуть містити ненормативну лексику або інший образливий контент (у цій вправі та будь‑яких наступних вправах, де також використовуються реальні дані Twitter).
Ця вправа є частиною курсу
Набір інструментів Python
Інструкції до вправи
- Ініціалізуйте порожній словник
counts_dictдля збереження результатів обробки даних Twitter. - Проітеруйтеся файлом
'tweets.csv', використовуючи циклfor. Використайте змінну циклуchunkі ітеруйтеся викликомpd.read_csv()із параметромchunksizeрівним 10. - У внутрішньому циклі проітеруйтеся стовпцем
'lang'уchunk, використовуючи циклfor. Використайте змінну циклуentry.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Initialize an empty dictionary: counts_dict
# Iterate over the file chunk by chunk
for ____ in ____:
# Iterate over the column in DataFrame
for ____ in ____:
if entry in counts_dict.keys():
counts_dict[entry] += 1
else:
counts_dict[entry] = 1
# Print the populated dictionary
print(counts_dict)