Začněte nyníZačněte zdarma

Zpracování dat po částech (1)

Někdy mohou být zdroje dat tak velké, že uložení celé datové sady do paměti je příliš náročné na zdroje. V tomto cvičení zpracuješ prvních 1000 řádků souboru po jednotlivých řádcích a vytvoříš slovník s počty výskytů každé země v daném sloupci datové sady.

Csv soubor 'world_dev_ind.csv' je dostupný v tvém aktuálním adresáři. Nejprve je potřeba otevřít spojení s tímto souborem pomocí tzv. context manageru. Příkaz with open('datacamp.csv') as datacamp například připojí csv soubor 'datacamp.csv' jako datacamp v rámci context manageru. Příkaz with zde představuje context manager a jeho účelem je zajistit efektivní správu zdrojů při otevírání spojení se souborem.

Pokud se chceš o context managerech dozvědět víc, podívej se na kurz DataCamp Importing Data in Python.

Toto cvičení je součástí kurzu

Python Toolbox

Zobrazit kurz

Pokyny k cvičení

  • Pomocí open() připoj csv soubor 'world_dev_ind.csv' jako file v rámci context manageru.
  • Doplň smyčku for tak, aby se zopakovala 1000krát a zpracovala pouze prvních 1000 řádků dat ze souboru.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Open a connection to the file
with ____ as ____:

    # Skip the column names
    file.readline()

    # Initialize an empty dictionary: counts_dict
    counts_dict = {}

    # Process only the first 1000 rows
    for j in ____:

        # Split the current line into a list: line
        line = file.readline().split(',')

        # Get the value for the first column: first_col
        first_col = line[0]

        # If the column value is in the dict, increment its value
        if first_col in counts_dict.keys():
            counts_dict[first_col] += 1

        # Else, add to the dict and set value to 1
        else:
            counts_dict[first_col] = 1

# Print the resulting dictionary
print(counts_dict)
Upravit a spustit kód