Píšeme generátor pro načítání dat po částech (3)
Skvělá práce! Právě jsi vytvořil/a generátorovou funkci, kterou můžeš využít při zpracování velkých souborů.
Teď tuto funkci použijeme k práci s datasetem Světové banky – stejně jako předtím. Soubor budeš procházet řádek po řádku a sestavovat slovník s počty výskytů jednotlivých zemí v příslušném sloupci datasetu. Tentokrát ale nezpracuješ jen 1000 řádků – projdeš celý dataset!
Generátorová funkce read_large_file() i soubor 'world_dev_ind.csv' jsou předpřipraveny a připraveny k použití. Směle do toho!
Toto cvičení je součástí kurzu
Python Toolbox
Pokyny k cvičení
- Připoj soubor
'world_dev_ind.csv'k proměnnéfilev kontextovém správci pomocíopen(). - Dokonči cyklus
fortak, aby iteroval přes generátor vrácený volánímread_large_file()a zpracoval všechny řádky souboru.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Initialize an empty dictionary: counts_dict
counts_dict = {}
# Open a connection to the file
with ____ as ____:
# Iterate over the generator from read_large_file()
for line in ____:
row = line.split(',')
first_col = row[0]
if first_col in counts_dict.keys():
counts_dict[first_col] += 1
else:
counts_dict[first_col] = 1
# Print
print(counts_dict)