Zpracování dat po částech (1)
Někdy mohou být zdroje dat tak velké, že uložení celé datové sady do paměti je příliš náročné na zdroje. V tomto cvičení zpracuješ prvních 1000 řádků souboru po jednotlivých řádcích a vytvoříš slovník s počty výskytů každé země v daném sloupci datové sady.
Csv soubor 'world_dev_ind.csv' je dostupný v tvém aktuálním adresáři. Nejprve je potřeba otevřít spojení s tímto souborem pomocí tzv. context manageru. Příkaz with open('datacamp.csv') as datacamp například připojí csv soubor 'datacamp.csv' jako datacamp v rámci context manageru. Příkaz with zde představuje context manager a jeho účelem je zajistit efektivní správu zdrojů při otevírání spojení se souborem.
Pokud se chceš o context managerech dozvědět víc, podívej se na kurz DataCamp Importing Data in Python.
Toto cvičení je součástí kurzu
Python Toolbox
Pokyny k cvičení
- Pomocí
open()připoj csv soubor'world_dev_ind.csv'jakofilev rámci context manageru. - Doplň smyčku
fortak, aby se zopakovala 1000krát a zpracovala pouze prvních 1000 řádků dat ze souboru.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Open a connection to the file
with ____ as ____:
# Skip the column names
file.readline()
# Initialize an empty dictionary: counts_dict
counts_dict = {}
# Process only the first 1000 rows
for j in ____:
# Split the current line into a list: line
line = file.readline().split(',')
# Get the value for the first column: first_col
first_col = line[0]
# If the column value is in the dict, increment its value
if first_col in counts_dict.keys():
counts_dict[first_col] += 1
# Else, add to the dict and set value to 1
else:
counts_dict[first_col] = 1
# Print the resulting dictionary
print(counts_dict)