Comece agoraComece grátis

Fazendo scan de vários arquivos

Os dados de empréstimos da equipe agora estão divididos em um CSV por ano ("seattle2021.csv", "seattle2022.csv", "seattle_2023.csv"). Esses arquivos anuais usam os nomes de colunas legados usageclass e materialtype. Use um padrão glob para fazer o scan de todos os arquivos juntos como um único conjunto de dados lógico e, em seguida, crie um resumo de empréstimos físicos.

polars já está carregado como pl, e o diretório está em MULTIFILE_DIR.

Este exercicio faz parte do curso

Dimensionamento e Otimização de Pipelines de Dados com Polars

Ver curso

Instruções do exercicio

  • Faça o scan de todos os arquivos "seattle*.csv" em MULTIFILEDIR usando um padrão glob.
  • Filtre o conjunto de dados combinado para empréstimos "Physical" e depois faça o group by de materialtype.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Scan every yearly file using a glob pattern
yearly_checkouts = pl.____(
    str(MULTIFILE_DIR / "____")
)

# Build a physical-checkout summary across the combined dataset
result = (
    yearly_checkouts
    # Filter to physical
    .filter(pl.col("usageclass") == "____")
    .group_by("____")
    .agg(pl.col("checkouts").sum().alias("total"))
    .sort("total", descending=True)
    .collect()
)
print(result)
Editar e Executar Código