Zpracování velkého množství twitterových dat
Někdy jsou data, která potřebujeme zpracovat, tak velká, že přesáhnou kapacitu operační paměti počítače. To je problém, se kterým se datová vědci setkávají poměrně běžně. Řešením je zpracovávat celý datový zdroj postupně po částech místo toho, aby se načetl celý najednou.
V tomto cvičení uděláš přesně to. Budeš zpracovávat velký csv soubor s twitterovými daty stejným způsobem, jakým jsi zpracoval/a soubor 'tweets.csv' v cvičeních Bringing it all together v předchozím kurzu – tentokrát ale vždy po 10 záznamech najednou.
Pokud tě zajímá, jak získat přístup k twitterovým datům a pracovat s nimi na vlastním počítači, podívej se na Part 2 kurzu DataCamp věnovaného importu dat v Pythonu.
Balíček pandas je naimportován jako pd a soubor 'tweets.csv' je k dispozici v tvém aktuálním pracovním adresáři.
Měj na paměti, že jde o skutečná data z Twitteru, a proto vždy existuje riziko, že mohou obsahovat vulgární nebo jinak nevhodný obsah (v tomto i v dalších cvičeních pracujících se skutečnými twitterovými daty).
Toto cvičení je součástí kurzu
Python Toolbox
Pokyny k cvičení
- Inicializuj prázdný slovník
counts_dict, do kterého budeš ukládat výsledky zpracování twitterových dat. - Iteruj přes soubor
'tweets.csv'pomocí cyklufor. Jako proměnnou cyklu použijchunka iteruj přes volánípd.read_csv()s hodnotouchunksizenastavenou na 10. - Ve vnitřním cyklu iteruj přes sloupec
'lang'v proměnnéchunkpomocí cyklufor. Jako proměnnou cyklu použijentry.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Initialize an empty dictionary: counts_dict
# Iterate over the file chunk by chunk
for ____ in ____:
# Iterate over the column in DataFrame
for ____ in ____:
if entry in counts_dict.keys():
counts_dict[entry] += 1
else:
counts_dict[entry] = 1
# Print the populated dictionary
print(counts_dict)