Qual estado é mais favorável aos mercados?
Ao explorar os dados de feiras de produtores, você se pergunta que padrões poderiam aparecer ao agregar no nível de estado. Alguns estados são mais favoráveis a mercados do que outros? Para investigar, você agrupa os dados por estado e obtém o número de mercados com transformação logarítmica (log_markets) e as populações dos estados (log_pop).
markets_and_pop = (markets
.groupby('state', as_index = False)
.agg({
'name': lambda d: log(len(d)),
'state_pop': lambda d: log(d.iloc[0]) })
.rename(columns = {
'name': 'log_markets',
'state_pop': 'log_pop' }))
Para visualizar, você decide usar um gráfico de regressão para ter uma ideia da relação "normal" entre número de mercados e população, e um gráfico de dispersão com rótulos de texto para identificar rapidamente outliers interessantes.
Este exercicio faz parte do curso
Aprimorando suas visualizações de dados em Python
Instruções do exercicio
- Itere sobre as linhas do DataFrame
markets_and_pop. - Posicione as anotações ao lado de seus pontos no gráfico de dispersão.
- Reduza o tamanho do texto das anotações para
10pontos.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
g = sns.regplot(
"log_markets", "log_pop",
ci = False,
# Shrink scatter plot points
scatter_kws = {'s':2},
data = markets_and_pop)
# Iterate over the rows of the data
for _, row in markets_and_pop.____():
state, _, _, log_markets, log_pop = row
# Place annotation and reduce size for clarity
g.annotate(state, (____,____), ____ = ____)
plt.show()