ADMGUIA
MÉTODOS
ESTATÍSTICOS I
Guia completo para estudantes de Administração
━━━━━━━━━━━━━━━━━━━━━━━━━━━━
Dados •
Estatística Descritiva • Probabilidade • Amostragem • Inferência
Portal Admguia | Atualização: julho de 2026
Sumário
Uma disciplina quantitativa, mas também interpretativa
2. Por que ela faz parte do curso
Administração é uma atividade baseada em evidências
Leitura crítica de relatórios e pesquisas
Ética, privacidade e responsabilidade
Preparação para disciplinas posteriores
3.1 População, amostra e unidade de análise
3.2 Parâmetro, estatística e estimador
3.3 Variáveis e escalas de mensuração
3.4 Qualidade, origem e preparação dos dados
3.5 Distribuições de frequência
3.7 Média aritmética e média ponderada
3.8 Mediana, moda e escolha da medida de centro
3.9 Quartis, percentis e amplitude interquartil
3.10 Amplitude, variância e desvio-padrão
3.11 Coeficiente de variação e padronização
3.12 Assimetria, curtose e formato da distribuição
3.13 Valores atípicos e observações influentes
3.15 Relação entre duas variáveis: tabelas cruzadas
3.17 Fundamentos de probabilidade
3.18 Probabilidade condicional e independência
3.19 Teorema de Bayes e atualização de evidências
3.20 Variável aleatória, esperança e variância
3.21 Distribuição de Bernoulli e binomial
3.23 Distribuições geométrica e hipergeométrica
3.24 Distribuições uniforme e exponencial
3.26 Amostragem probabilística e não probabilística
3.27 Viés, erro amostral e erros não amostrais
3.28 Distribuição amostral e erro-padrão
3.29 Teorema Central do Limite
3.30 Estimação pontual e intervalar
3.31 Distribuição t de Student
3.32 Determinação do tamanho da amostra
3.33 Introdução aos testes de hipótese
3.34 Teste de uma média: exemplo introdutório
3.35 Teste de uma proporção: exemplo introdutório
3.36 Ética, transparência e reprodutibilidade
3.37 Razões, proporções, taxas e índices
3.38 Variações percentuais e pontos percentuais
3.39 Dados agrupados e estimativas por classes
3.40 Média geométrica e taxas acumuladas
3.41 Índices ponderados e efeito de composição
3.42 Paradoxo de Simpson: exemplo gerencial
3.43 Transformações e escala logarítmica
3.44 Dados temporais, tendência e sazonalidade
3.45 Dados pareados e independentes
3.46 Amostragem estratificada: alocação
3.47 Amostragem por conglomerados e efeito do desenho
3.49 Correção de população finita
3.50 Aproximação normal da binomial
3.51 Quantis da normal e níveis de serviço
3.52 Valor esperado, árvore e decisão
3.53 Comunicação de intervalos e incerteza
3.54 Múltiplas comparações e achados casuais
3.56 Poder e planejamento de estudos
3.57 Bootstrap: visão introdutória
3.58 Simulação de Monte Carlo: visão introdutória
3.60 Causalidade, experimentos e observação
3.61 Caderno de exercícios resolvidos
Exercício resolvido 1 — Média ponderada de preços
Exercício resolvido 2 — Mediana com número par
Exercício resolvido 3 — Variância amostral
Exercício resolvido 4 — Coeficiente de variação
Exercício resolvido 5 — Percentil de serviço
Exercício resolvido 6 — União de eventos
Exercício resolvido 7 — Independência
Exercício resolvido 8 — Bayes em inspeção
Exercício resolvido 9 — Esperança de perda
Exercício resolvido 10 — Binomial ao menos um
Exercício resolvido 11 — Poisson
Exercício resolvido 12 — Exponencial
Exercício resolvido 13 — Normal
Exercício resolvido 14 — Erro-padrão
Exercício resolvido 15 — Intervalo de média
Exercício resolvido 16 — Tamanho de amostra
Exercício resolvido 17 — Teste de proporção
Exercício resolvido 18 — Diferença entre significância e
efeito
Exercício resolvido 19 — Correlação com extremo
Exercício resolvido 20 — Amostra por conveniência
Exercício resolvido 21 — Correção finita
Exercício resolvido 22 — Pontuação z comparativa
Exercício resolvido 23 — Taxa versus contagem
Exercício resolvido 24 — Variação acumulada
Exercício resolvido 25 — Poder insuficiente
3.62 Casos de interpretação e diagnóstico
Caso interpretativo 1 — Média crescente e mediana
estável
Caso interpretativo 2 — Desvio-padrão menor após filtro
Caso interpretativo 3 — Taxa estável com volume
crescente
Caso interpretativo 4 — Percentual alto em amostra
pequena
Caso interpretativo 5 — Correlação negativa inesperada
Caso interpretativo 6 — Queda do valor-p sem mudança de
efeito
Caso interpretativo 7 — Intervalo estreito em base
enviesada
Caso interpretativo 8 — Sazonalidade confundida com
tendência
Caso interpretativo 9 — Meta alterada durante o período
Caso interpretativo 10 — Outlier que revela novo mercado
Caso interpretativo 11 — Amostra maior com pior desenho
Caso interpretativo 12 — Resultado agregado e
desigualdade
Caso interpretativo 13 — Probabilidade pequena e impacto
alto
Caso interpretativo 14 — Previsão correta pelo motivo
errado
Caso interpretativo 15 — Não significância com intervalo
útil
Caso interpretativo 16 — Significância e dano
concentrado
4. Principais Temas e Organização
Organização sugerida para um semestre de 16 semanas
Módulo 1 — definição do problema e governança dos dados
Módulo 2 — leitura visual e síntese
Módulo 3 — medidas descritivas e variabilidade
Módulo 4 — relações e cuidado causal
Módulo 5 — raciocínio probabilístico
Módulo 6 — distribuições como modelos
Módulo 7 — da população à amostra
5. Relação com outras matérias
Matemática e Matemática Financeira
Contabilidade e Análise das Demonstrações
Marketing e Pesquisa de Mercado
Logística e Cadeia de Suprimentos
Análise das Decisões Gerenciais
6. Aplicações Práticas e Profissionais
6.15 Desempenho de fornecedores
6.31 Avaliação de uma promoção de preços
6.32 Definição de meta de prazo
6.33 Dimensionamento de equipe em central de atendimento
6.34 Detecção de mudança em reclamações
6.35 Comparação de filiais com volumes diferentes
6.36 Análise de notas de avaliação
6.37 Priorização de causas de defeitos
6.38 Teste de mensagem em comunicação interna
6.39 Indicador de produtividade
6.41 Monitoramento de orçamento
6.42 Pesquisa de acessibilidade
6.43 Tutorial prático: organização de uma base em
planilha
6.44 Tutorial prático: estatística descritiva em
planilha
6.45 Tutorial prático: probabilidade e distribuições
6.46 Tutorial prático: intervalos e tamanho amostral
6.47 Tutorial prático: gráficos gerenciais
6.48 Tutorial prático: nota técnica e resumo executivo
6.49 Roteiro de auditoria de uma análise
6.50 Erros profissionais frequentes e correções
7. Exemplo Prático ou Estudo de Caso
Caso integrado: Rede Varejo Horizonte
7.3 Estatística descritiva dos prazos
7.4 Taxa de atraso e tabela cruzada
7.5 Intervalo para a taxa de atraso
7.6 Probabilidade condicional e avaria
7.7 Modelo binomial para auditoria
7.8 Correlação entre prazo e avaliação
7.9 Planejamento da pesquisa de satisfação
7.10 Teste da meta de satisfação
7.11 Relação entre atraso e recompra
7.13 Aprofundamentos do estudo de caso
Média de avaliação e composição de respostas
Análise de sensibilidade para dados ausentes
Plano de implementação em 90 dias
7.14 Modelo de relatório executivo do caso
Questão 1 — medidas descritivas
Questão 2 — probabilidade condicional
Questão 4 — intervalo para proporção
Questão 5 — decisão e significância
10. Referências e Aprofundamento
Plano de aprofundamento em oito semanas
Orientação final para uso acadêmico e profissional
1. Apresentação da Disciplina
Métodos Estatísticos I apresenta a
linguagem, os conceitos e as técnicas que permitem transformar dados em
informações úteis para a Administração. A disciplina começa pela organização de
bases, classificação de variáveis e construção de tabelas e gráficos. Em
seguida, desenvolve medidas descritivas, probabilidade, variáveis aleatórias,
distribuições e fundamentos da inferência. O objetivo não é apenas calcular
médias ou probabilidades, mas aprender a formular perguntas, reconhecer limites
dos dados e sustentar conclusões proporcionais às evidências disponíveis.
A estatística pode ser definida como o
campo que reúne métodos para coletar, organizar, resumir, analisar e
interpretar dados. Ela trabalha com variabilidade: vendas mudam entre períodos,
pessoas avaliam serviços de maneiras diferentes, prazos de entrega oscilam,
custos não se repetem exatamente e amostras distintas produzem resultados
diferentes. Em vez de tratar essa variação como ruído sem importância, a
estatística ajuda a descrevê-la e a compreender quanto de uma conclusão é
estável ou incerto.
Para estudantes de Administração, a
disciplina funciona como ponte entre situações organizacionais e decisões
fundamentadas. Um painel de indicadores, uma pesquisa de satisfação, um teste
de campanha, uma previsão de demanda ou uma auditoria de processos dependem de
definições estatísticas. Sem elas, números podem parecer objetivos e ainda
assim induzir ao erro por amostra enviesada, média inadequada, gráfico
distorcido, comparação sem base ou associação confundida com causalidade.
O curso introdutório deve combinar quatro
movimentos. O primeiro é compreender o problema gerencial e definir a unidade
de análise. O segundo é produzir ou obter dados com qualidade. O terceiro é
aplicar técnicas adequadas ao tipo de variável e à pergunta. O quarto é
comunicar resultados, incertezas e limitações. A sequência evita que a pessoa
estudante comece pelo software e termine com uma tabela que não responde a
nenhuma questão relevante.
A definição central da disciplina pode ser
sintetizada assim: Métodos Estatísticos
I ensina a descrever padrões, quantificar variabilidade e usar amostras para
aprender sobre populações, mantendo transparência sobre premissas e incertezas.
Competências esperadas
·
distinguir população, amostra,
unidade de análise, parâmetro e estatística;
·
classificar variáveis e
selecionar formas adequadas de resumo e visualização;
·
calcular e interpretar média,
mediana, moda, quartis, variância, desvio-padrão e coeficiente de variação;
·
reconhecer assimetria, valores
atípicos, concentração e diferenças entre grupos;
·
aplicar regras de
probabilidade, probabilidade condicional e teorema de Bayes;
·
trabalhar com distribuições
discretas e contínuas frequentes em problemas administrativos;
·
compreender amostragem,
distribuição amostral, erro-padrão, intervalo de confiança e teste de hipótese
introdutório;
·
usar planilhas ou softwares
estatísticos sem transformar a ferramenta em uma caixa-preta;
·
comunicar resultados em
linguagem clara, sem exagerar o alcance das conclusões.
Uma disciplina quantitativa, mas
também interpretativa
O domínio operacional das fórmulas é
necessário, porém insuficiente. A mesma média pode representar bases muito
diferentes; o mesmo percentual pode ter denominadores incompatíveis; a mesma
correlação pode refletir coincidência, variável omitida ou causalidade reversa.
Por isso, cada cálculo do guia será acompanhado de interpretação gerencial,
pergunta de validação e alerta de uso. O resultado final esperado é uma pessoa
administradora capaz de ler dados com curiosidade e prudência.
2.
Por que ela faz parte do curso
Administração é uma atividade
baseada em evidências
Organizações produzem dados continuamente:
vendas, custos, tempos, reclamações, acessos, faltas, acidentes, avaliações,
estoques e resultados de campanhas. A formação administrativa precisa ensinar
como transformar esses registros em evidências. Métodos Estatísticos I fornece
a base para distinguir variações comuns de sinais relevantes, comparar
períodos, identificar segmentos e decidir quando uma diferença observada merece
investigação.
A disciplina também protege contra decisões
apoiadas em casos isolados. Um relato pode revelar um problema importante, mas
não mede sua frequência. Uma semana de vendas não define uma tendência. Uma
pesquisa respondida apenas por pessoas muito satisfeitas ou muito insatisfeitas
não representa necessariamente toda a clientela. O pensamento estatístico
pergunta quem foi observado, como os dados foram produzidos e quão
representativa é a informação.
Planejamento e controle
Planejar exige estimar demanda, capacidade,
custos e riscos. Controlar exige comparar previsto e realizado, identificar
desvios e acompanhar indicadores. Mesmo quando modelos avançados são tratados
em outras disciplinas, a compreensão de média, dispersão, probabilidade e
amostragem permanece indispensável. Uma previsão sem intervalo de incerteza
pode transmitir precisão falsa; uma meta baseada em média histórica pode ser
inviável quando a variabilidade é elevada.
Integração de áreas
|
Área |
Uso de métodos estatísticos |
|
Marketing |
segmentação,
pesquisa, experimentos, conversão e retenção |
|
Operações |
tempos,
defeitos, capacidade, produtividade e qualidade |
|
Finanças |
retornos,
risco, inadimplência, cenários e indicadores |
|
Gestão de
pessoas |
absenteísmo,
rotatividade, clima e remuneração |
|
Logística |
demanda,
atrasos, perdas, estoques e desempenho de transportadoras |
|
Setor
público |
indicadores
sociais, avaliação de serviços e alocação de recursos |
|
Empreendedorismo |
validação
de hipóteses, métricas de produto e aprendizagem |
|
Auditoria
e controles |
amostragem,
exceções, conformidade e monitoramento |
Essa integração explica por que estatística
não deve ser tratada como matéria isolada. Ela fornece um vocabulário comum
para equipes discutirem evidências. Quando marketing apresenta uma taxa,
operações questiona a base e finanças pede impacto, todos precisam compreender
numerador, denominador, período, amostra e margem de erro.
Leitura crítica de relatórios e
pesquisas
Pessoas administradoras recebem estudos
prontos, dashboards, pesquisas de mercado e relatórios de consultoria. A
disciplina permite avaliar se a amostra é adequada, se o gráfico preserva
escala, se a média é representativa, se a relação entre variáveis é forte e se
a conclusão ultrapassa o desenho do estudo. Essa competência reduz o risco de
adotar recomendações apenas porque foram apresentadas com números e visual
sofisticado.
Decisão sob incerteza
A gestão raramente dispõe de certeza
completa. Probabilidade organiza incertezas e permite comparar riscos.
Distribuições representam contagens, tempos, proporções e resultados contínuos.
Intervalos de confiança mostram uma faixa plausível para parâmetros. Testes de
hipótese ajudam a avaliar se evidências observadas são compatíveis com uma
referência. A disciplina ensina que incerteza não significa ausência de
decisão; significa decisão acompanhada de riscos e premissas.
Ética, privacidade e
responsabilidade
Dados descrevem pessoas e podem influenciar
oportunidades, crédito, atendimento e políticas. Uma análise estatística
responsável exige finalidade legítima, minimização de dados, proteção,
transparência e atenção a grupos sub-representados. Uma média global pode
ocultar desigualdades; um modelo pode reproduzir padrões discriminatórios; uma
amostra por conveniência pode excluir quem encontra maiores barreiras. A
formação estatística deve combinar competência técnica e responsabilidade
social.
Preparação para disciplinas
posteriores
Métodos Estatísticos I prepara para Métodos
Estatísticos II, econometria, pesquisa de mercado, controle da qualidade,
ciência de dados, previsão, análise multivariada e avaliação de políticas. Sem
a base descritiva e probabilística, técnicas posteriores podem ser aplicadas de
forma mecânica. Com a base, a pessoa estudante consegue compreender o que cada
modelo estima, quais condições são necessárias e como interpretar resultados.
3.
Conceitos Fundamentais
3.1 População, amostra e unidade
de análise
População é o conjunto completo sobre o qual se deseja aprender. Amostra é a parte observada. Unidade de análise é o elemento ao qual
cada registro se refere, como cliente, pedido, loja, pessoa empregada ou dia.
A definição deve ser específica. “Clientes
da empresa” pode significar pessoas cadastradas, compradores do último ano ou
usuários ativos. Mudanças nessa definição alteram taxas e conclusões. Também é
necessário distinguir população-alvo, população acessível e quadro amostral. O
quadro amostral é a lista ou mecanismo usado para selecionar unidades; se ele
exclui parte da população-alvo, surge erro de cobertura.
Uma rede deseja estimar a satisfação de
quem realizou compras nos últimos 30 dias. A população-alvo são todas essas
pessoas compradoras. A empresa possui 48.000 pedidos, mas somente 39.000 têm
contato válido. Esses 39.000 formam a população acessível. Se forem sorteadas
600 pessoas e 210 responderem, as 210 compõem a amostra efetivamente analisada.
A diferença entre selecionadas e
respondentes deve ser registrada. Mesmo com sorteio inicial, a não resposta
pode produzir viés se quem responde tiver experiência sistematicamente
diferente. Comparar características disponíveis entre respondentes e não respondentes
ajuda a avaliar o problema.
Erro comum: chamar de “população” qualquer
arquivo disponível. Um banco de dados é uma fonte, não necessariamente a
população correta. A pergunta gerencial deve vir antes da extração.
3.2 Parâmetro, estatística e
estimador
Parâmetro é uma característica numérica da população, como média verdadeira
de tempo. Estatística é uma medida
calculada na amostra. Estimador é a
regra usada para calcular uma estimativa do parâmetro.
A média populacional costuma ser
representada por μ, enquanto a média amostral é representada por x̄. A
proporção populacional pode ser p, e a proporção amostral, p̂. O parâmetro é
fixo, embora geralmente desconhecido; a estatística varia entre amostras. Essa
variabilidade amostral é a origem do erro-padrão e dos intervalos de confiança.
Se a taxa real de entregas no prazo entre
todos os pedidos do trimestre é 91%, esse 91% é um parâmetro. Se uma auditoria
seleciona 400 pedidos e encontra 88% no prazo, 88% é uma estatística amostral.
Outra amostra poderia produzir 90% ou 92%.
Uma estimativa não deve ser julgada apenas
pela proximidade aparente. Importam viés, variabilidade, método de seleção e
tamanho da amostra. Estimadores não viesados acertam o parâmetro em média ao
longo de repetições, mas cada amostra continua sujeita a erro.
Erro comum: tratar a estatística amostral
como verdade exata. Um relatório adequado informa estimativa, incerteza e
método de obtenção.
3.3 Variáveis e escalas de
mensuração
Variável é uma característica que pode
assumir valores diferentes entre unidades. Variáveis qualitativas descrevem categorias; variáveis quantitativas representam contagens ou medidas. Escalas nominais,
ordinais, intervalares e de razão determinam quais operações fazem sentido.
Em escala nominal, categorias não possuem
ordem natural, como canal de venda. Em escala ordinal, existe ordem, mas as
distâncias não são necessariamente iguais, como avaliações “ruim”, “regular”,
“bom” e “ótimo”. Escalas intervalares têm diferenças comparáveis, mas zero
convencional. Escalas de razão possuem zero significativo, permitindo comparar
proporções, como receita e tempo.
Número de reclamações é quantitativo
discreto porque resulta de contagem. Tempo de atendimento é quantitativo
contínuo, ainda que o sistema registre minutos inteiros. Grau de concordância
em escala de 1 a 5 é ordinal; calcular média pode ser útil como resumo
operacional, mas exige reconhecer que a distância entre categorias é uma
convenção.
A classificação orienta gráficos e medidas.
Moda serve para categorias nominais; mediana faz sentido para dados ordinais;
média e desvio-padrão são mais naturais em medidas quantitativas. Códigos
numéricos de categorias não transformam uma variável qualitativa em
quantitativa.
Erro comum: calcular média do código de uma
filial ou somar categorias porque estão representadas por números. O
significado vem da variável, não do formato do arquivo.
3.4 Qualidade, origem e preparação
dos dados
Dados administrativos podem ser primários,
quando coletados para a análise, ou secundários, quando já existiam em
sistemas, pesquisas ou bases públicas. Fontes secundárias reduzem custo, mas
exigem verificar finalidade original, cobertura, definições, periodicidade e
alterações metodológicas. Um indicador com o mesmo nome pode mudar de cálculo
ao longo do tempo.
Dimensões de qualidade incluem completude,
validade, consistência, unicidade, atualidade e exatidão. Completude verifica
campos ausentes. Validade compara valores com regras. Consistência examina
relações entre campos. Unicidade identifica registros duplicados. Atualidade
avalia atraso. Exatidão depende de confronto com referência ou processo de
auditoria.
A preparação deve ser documentada. Remover
registros, substituir valores ausentes, agrupar categorias ou corrigir datas
altera a base. Uma trilha mínima registra arquivo original, regras, quantidade
de linhas afetadas e justificativas. O objetivo não é conservar todo erro, mas
impedir que decisões invisíveis se tornem parte do resultado.
Valores ausentes não são todos iguais.
Podem ocorrer ao acaso, depender de variáveis observadas ou relacionar-se ao
próprio valor ausente. Uma pesquisa de renda tende a ter não resposta maior em
alguns grupos. Preencher todos os vazios com a média reduz artificialmente a
dispersão e pode distorcer relações. Em análises introdutórias, é preferível
apresentar a quantidade de ausências, investigar padrões e fazer análise de
sensibilidade.
Duplicidades também requerem contexto. Dois
pedidos idênticos podem ser duplicação de carga ou compras reais repetidas.
Remover apenas pela igualdade das colunas pode apagar eventos legítimos. A
unidade de análise e a chave esperada orientam a decisão.
3.5 Distribuições de frequência
Uma distribuição de frequência mostra como
observações se distribuem entre categorias ou intervalos. A frequência absoluta
é a contagem; a relativa é a proporção; a acumulada soma frequências até
determinado ponto. Para dados contínuos, classes simplificam a leitura, mas
escolhas de largura e limites influenciam a aparência.
Considere 200 tempos de entrega. Classes de
0 a 2, 2 a 4, 4 a 6 e mais de 6 dias podem responder a níveis de serviço. Se o
objetivo é estudar pequenas diferenças operacionais, classes de um dia podem
ser melhores. A regra de Sturges, a raiz quadrada de n e critérios baseados na
amplitude interquartil oferecem pontos de partida, não decisões automáticas.
Frequência
relativa da classe = frequência absoluta da classe / número total de
observações
Frequência
percentual = frequência relativa × 100%
A tabela deve informar limites e tratamento
de extremos. Intervalos como 0–10 e 10–20 são ambíguos se o valor 10 puder
entrar em ambos. Uma convenção é [0,10) e [10,20), incluindo o limite inferior
e excluindo o superior, exceto talvez na última classe.
Erro comum: comparar frequências absolutas
entre grupos de tamanhos diferentes. Percentuais ou taxas padronizadas são
necessários quando os denominadores variam.
3.6 Tabelas e gráficos
A visualização deve ser escolhida pela
pergunta. Gráfico de barras compara categorias; histograma descreve
distribuição contínua; linhas acompanham séries temporais; boxplot compara
posição e dispersão entre grupos; dispersão examina duas variáveis quantitativas.
Gráficos de setores podem funcionar com poucas categorias, mas dificultam
comparações precisas e perdem legibilidade com muitas partes.
Escalas devem ser honestas. Em barras,
iniciar o eixo longe de zero pode exagerar diferenças. Em linhas, um eixo
truncado pode ser aceitável quando o objetivo é mostrar pequenas variações,
desde que esteja evidente. Perspectiva tridimensional, áreas proporcionais mal
calculadas e cores sem contraste reduzem compreensão.
Um gráfico gerencial precisa de título
informativo, unidade, período, fonte e, quando necessário, nota metodológica.
“Vendas” é menos útil que “Receita líquida mensal, em R$ mil, janeiro a
dezembro de 2025”. Rótulos devem permitir leitura sem exigir adivinhação.
Visualização não substitui análise. Um pico
pode resultar de promoção, erro de carga, sazonalidade ou mudança de definição.
O gráfico revela onde perguntar, mas a resposta depende de contexto e
investigação.
Erro comum: usar gráfico para decorar
relatório. Cada elemento deve ajudar a perceber comparação, tendência,
composição, distribuição ou relação.
3.7 Média aritmética e média
ponderada
A média aritmética soma os valores e divide
pelo número de observações. Ela utiliza toda a informação numérica, mas é
sensível a valores extremos. A média ponderada atribui pesos diferentes, como
volumes, créditos ou probabilidades.
x̄ =
(Σxᵢ) / n
x̄
ponderada = (Σwᵢxᵢ) / (Σwᵢ)
Uma loja registra tempos de 4, 5, 5, 6 e 20
minutos. A média é 8 minutos, puxada pelo atendimento de 20. Se as médias
mensais de duas unidades são 10 e 14 minutos, com 900 e 100 atendimentos, a
média conjunta não é 12; é (900×10 + 100×14)/1.000 = 10,4 minutos.
A média responde à pergunta de equilíbrio:
se o total fosse repartido igualmente, quanto caberia a cada unidade? Para
distribuições simétricas, representa bem o centro. Em dados assimétricos, deve
ser acompanhada de mediana, quartis e explicação dos extremos.
Erro comum: calcular média das médias sem
ponderar pelos tamanhos dos grupos. Outro erro é interpretar média como
experiência típica quando poucos valores altos dominam o resultado.
3.8 Mediana, moda e escolha da
medida de centro
A mediana é o valor que divide os dados
ordenados em duas metades. A moda é o valor ou categoria mais frequente. Elas
respondem a perguntas diferentes e podem complementar a média.
Para n ímpar, a mediana é o valor central.
Para n par, costuma ser a média dos dois valores centrais. A moda pode ser
única, múltipla ou inexistente em dados sem repetição. Em categorias nominais,
é a principal medida de tendência central.
Nas rendas 2.000, 2.200, 2.400, 2.600 e
20.000, a média é 5.840 e a mediana é 2.400. A mediana representa melhor uma
posição típica. Em uma loja, o tamanho de calçado mais vendido é a moda e
orienta o estoque, mesmo que a média numérica exista.
A escolha depende da distribuição e da
decisão. Para tempos de espera com cauda longa, mediana informa a experiência
central, enquanto percentis altos mostram risco de demora. Para custo total, a
média continua relevante porque preserva a soma.
Erro comum: escolher a medida que favorece
uma narrativa. O relatório deve justificar a medida e, quando possível, mostrar
resumos complementares.
3.9 Quartis, percentis e amplitude
interquartil
Quartis dividem dados ordenados em quatro
partes; percentis dividem em cem posições conceituais. A amplitude
interquartil, IQR = Q3 − Q1, mede a dispersão dos 50% centrais e é resistente a
extremos.
IQR
= Q3 − Q1
Limite
inferior para investigação = Q1 − 1,5×IQR
Limite
superior para investigação = Q3 + 1,5×IQR
Se Q1 = 12 minutos e Q3 = 20, o IQR é 8. Os
limites usuais são 0 e 32 minutos. Observações acima de 32 aparecem como
potenciais valores atípicos em um boxplot. Isso não autoriza exclusão; sinaliza
investigação.
Percentis são úteis para níveis de serviço.
Dizer que o percentil 90 do prazo é 5 dias significa que aproximadamente 90%
das entregas ocorreram em até 5 dias. A meta pode ser definida sobre p90 quando
a organização deseja controlar a cauda, e não apenas a média.
Erro comum: supor que todos os softwares
calculam quartis do mesmo modo. Métodos de interpolação podem produzir pequenas
diferenças; o procedimento deve ser consistente quando comparações dependem
dele.
3.10 Amplitude, variância e
desvio-padrão
A amplitude é máximo menos mínimo. A
variância mede a média dos desvios quadráticos em relação à média. O
desvio-padrão é a raiz da variância e retorna à unidade original.
Amplitude
= máximo − mínimo
s² =
Σ(xᵢ − x̄)² / (n − 1)
s =
√s²
Para os valores 8, 10, 10, 12, a média é
10. Os desvios são −2, 0, 0 e 2; os quadrados somam 8. A variância amostral é
8/3 = 2,67 e o desvio-padrão é aproximadamente 1,63.
O denominador n−1 é usado na variância
amostral para corrigir a tendência de subestimar a variabilidade populacional
quando a média é estimada com a própria amostra. O desvio-padrão não representa
uma distância máxima; em distribuições aproximadamente normais, ajuda a
interpretar concentração ao redor da média.
Erro comum: comparar variâncias sem
considerar unidades ou escalas. Como a variância está em unidade ao quadrado, o
desvio-padrão é mais intuitivo para comunicação.
3.11 Coeficiente de variação e
padronização
O coeficiente de variação mede o
desvio-padrão em relação à média, permitindo comparar variabilidade relativa
entre grandezas positivas com escalas diferentes.
CV =
(s / x̄) × 100%
Um processo A tem média 100 e desvio-padrão
10, CV de 10%. Um processo B tem média 20 e desvio-padrão 4, CV de 20%. B
possui menor dispersão absoluta, mas maior variabilidade relativa.
O CV é útil em custos, demandas e tempos
quando zero é significativo. Torna-se instável com média próxima de zero e
inadequado em escalas intervalares ou dados que podem assumir valores positivos
e negativos de forma natural.
Erro comum: concluir que menor CV é sempre
melhor. Em retornos ou inovação, variabilidade pode estar associada a
oportunidades; a interpretação depende do objetivo.
3.12 Assimetria, curtose e formato
da distribuição
Uma distribuição simétrica possui lados
aproximadamente espelhados. Na assimetria positiva, a cauda se estende para
valores altos; média tende a superar mediana. Na assimetria negativa, a cauda
se estende para valores baixos; média tende a ser menor. Tempos de espera,
renda e valores de compra frequentemente têm assimetria positiva.
Curtose está relacionada ao peso das caudas
e à ocorrência de extremos em comparação com uma referência normal. Em
aplicações introdutórias, é mais útil examinar histograma, boxplot e percentis
do que depender de um único coeficiente. Amostras pequenas produzem medidas
instáveis.
O formato afeta escolhas. A média e o
desvio-padrão resumem bem distribuições aproximadamente simétricas sem extremos
importantes. Para distribuições assimétricas, mediana e IQR oferecem
complemento resistente. Transformações logarítmicas podem facilitar análise de
valores positivos com grande cauda, mas mudam a escala e exigem interpretação
cuidadosa.
Erro comum: chamar qualquer distribuição
não normal de “errada”. A normalidade é um modelo útil, não uma obrigação dos
dados. Muitos fenômenos reais são naturalmente assimétricos ou discretos.
3.13 Valores atípicos e
observações influentes
Valor atípico é uma observação distante do
padrão principal. Pode representar erro, evento raro legítimo, mudança de
regime ou subgrupo não identificado. A decisão correta não é remover
automaticamente, mas verificar origem, regras de negócio e impacto sobre
resultados.
Métodos de detecção incluem boxplot,
escores padronizados, regras de domínio e comparação temporal. Um faturamento
negativo pode ser válido se representar estorno. Uma idade de 250 anos é
provavelmente erro. Uma compra cem vezes maior pode ser contrato corporativo
legítimo.
Observações influentes são aquelas cuja
presença altera substancialmente estimativas, como média ou correlação. Nem
todo outlier é influente, e nem toda observação influente parece extrema em uma
dimensão. Comparar análises com e sem o ponto, mantendo transparência, ajuda a
avaliar robustez.
Erro comum: excluir valores porque
atrapalham uma conclusão. Critérios de tratamento devem ser definidos antes de
observar o efeito desejado e documentados no relatório.
3.14 Padronização e escore z
O escore z expressa quantos desvios-padrão
um valor está acima ou abaixo da média. Ele permite comparar posições relativas
em escalas diferentes.
z =
(x − μ) / σ
Se a média de vendas é R$ 50 mil e o
desvio-padrão é R$ 8 mil, uma venda de R$ 66 mil possui z = 2. Em outro
indicador com média 10 e desvio 1, um valor 12 também possui z = 2. Ambos estão
duas unidades de desvio acima de suas médias.
Padronizar não torna distribuições normais;
apenas muda centro e escala. O z pode ser usado para identificar posições
incomuns em distribuições aproximadamente simétricas, mas limites fixos não
substituem contexto.
Erro comum: interpretar z = 2 como
“probabilidade de 2%”. A conversão para probabilidades depende de uma
distribuição assumida, normalmente a normal.
3.15 Relação entre duas variáveis:
tabelas cruzadas
Quando duas variáveis são qualitativas, uma
tabela de contingência organiza contagens conjuntas. Percentuais por linha
respondem como a distribuição de uma variável muda dentro de cada categoria da
outra; percentuais por coluna respondem outra pergunta. Percentuais totais
podem ocultar a comparação relevante.
Suponha 300 clientes divididos por canal e
satisfação. Se 70% do canal digital e 55% do presencial estão satisfeitos, a
comparação exige percentuais dentro de cada canal. Contagens brutas podem ser
maiores no presencial apenas porque há mais clientes.
Uma associação aparente pode mudar quando
se estratifica por uma terceira variável. Esse fenômeno, relacionado ao
paradoxo de Simpson, mostra que agregações podem ocultar composição.
Comparações de desempenho entre unidades devem considerar mix de clientes,
complexidade ou período.
Erro comum: interpretar diferença de
percentuais como causalidade. A tabela mostra associação descritiva; desenho do
estudo e controle de fatores são necessários para inferência causal.
3.16 Covariância e correlação
Covariância mede se duas variáveis tendem a
variar na mesma direção. Correlação de Pearson padroniza a covariância entre −1
e 1, indicando intensidade e direção de relação linear.
Cov(X,Y)
= Σ[(xᵢ − x̄)(yᵢ − ȳ)] / (n − 1)
r =
Cov(X,Y) / (sₓsᵧ)
Uma correlação r = 0,80 entre investimento
em mídia e vendas indica forte associação linear positiva na amostra. Não
significa que 80% das vendas foram causadas pela mídia, nem que aumentar mídia
produzirá proporcionalmente o mesmo efeito.
Correlação próxima de zero pode coexistir
com relação curva. Valores extremos podem inflar ou inverter r. Gráfico de
dispersão deve acompanhar o coeficiente. Em dados ordinais ou relações
monotônicas não lineares, correlação de Spearman pode ser mais adequada.
Erro comum: confundir correlação com
causalidade. Variáveis omitidas, tendência temporal, causalidade reversa e
seleção podem explicar a associação.
3.17 Fundamentos de probabilidade
Probabilidade quantifica incerteza em uma
escala de 0 a 1. O espaço amostral reúne resultados possíveis; evento é um
subconjunto. Os axiomas estabelecem que probabilidades são não negativas, o
espaço completo tem probabilidade 1 e eventos mutuamente exclusivos somam suas
probabilidades.
P(Aᶜ)
= 1 − P(A)
P(A
∪ B) = P(A) + P(B) − P(A ∩ B)
Se 30% dos pedidos atrasam e 12% atrasam e
apresentam avaria, a probabilidade de atraso sem avaria é 18%, desde que
“atraso e avaria” esteja contido no grupo de atrasos. Diagramas e tabelas
ajudam a evitar dupla contagem.
Probabilidades podem ser clássicas,
empíricas ou subjetivas estruturadas. Em negócios, muitas estimativas vêm de
frequências históricas, mas o ambiente pode mudar. A base deve ser relevante ao
período e processo futuro.
Erro comum: somar probabilidades de eventos
que podem ocorrer juntos sem subtrair a interseção.
3.18 Probabilidade condicional e
independência
Probabilidade condicional mede a chance de
A quando se sabe que B ocorreu. O denominador passa a ser o conjunto B.
P(A|B)
= P(A ∩ B) / P(B)
Se 40 de 200 clientes são inadimplentes e
30 dos inadimplentes possuem atraso prévio, P(atraso prévio | inadimplência) =
30/40 = 75%. Isso difere de P(inadimplência | atraso prévio), cujo denominador
é o total com atraso prévio.
Eventos A e B são independentes quando
P(A|B) = P(A), equivalendo a P(A∩B) = P(A)P(B). Independência não é o mesmo que
exclusão mútua. Eventos mutuamente exclusivos com probabilidades positivas não
são independentes: a ocorrência de um impede o outro.
Erro comum: inverter condicionais. “A
maioria das fraudes possui característica X” não implica que a maioria dos
casos com X seja fraude; a taxa-base importa.
3.19 Teorema de Bayes e
atualização de evidências
O teorema de Bayes atualiza uma
probabilidade inicial quando surge uma evidência. Ele combina taxa-base,
sensibilidade da evidência e ocorrência de falsos positivos.
P(A|B)
= [P(B|A)P(A)] / P(B)
Considere fraude em 1% das transações. Um
alerta identifica 90% das fraudes, mas sinaliza 5% das transações legítimas. Em
10.000 transações, espera-se 100 fraudes, 90 alertadas; entre 9.900 legítimas,
495 alertadas. Assim, apenas 90 de 585 alertas, cerca de 15,4%, correspondem a
fraude.
A conclusão não é que o alerta seja inútil.
Ele eleva o risco de 1% para 15,4%, permitindo priorizar investigação.
Entretanto, bloquear automaticamente todos os alertas produziria muitos falsos
positivos. Decisões devem considerar custo de investigação, dano da fraude e
impacto sobre clientes.
Erro comum: olhar apenas para a
sensibilidade de 90% e concluir que um alerta tem 90% de chance de ser fraude.
3.20 Variável aleatória, esperança
e variância
Variável aleatória associa um número a cada
resultado de um experimento. Pode ser discreta, com valores contáveis, ou
contínua, com valores em intervalos. A distribuição atribui probabilidades aos
valores ou densidade às faixas.
E(X)
= ΣxP(X=x) para variável discreta
Var(X)
= E[(X−μ)²] = E(X²) − [E(X)]²
Um contrato pode gerar lucro de R$ 20 mil
com probabilidade 0,6 e prejuízo de R$ 10 mil com probabilidade 0,4. O valor
esperado é 0,6×20.000 + 0,4×(−10.000) = R$ 8.000. O valor esperado é média de
longo prazo, não promessa de resultado individual.
A variância mede risco em torno da
esperança. Duas alternativas com mesmo valor esperado podem ter dispersões
diferentes. A decisão gerencial também considera aversão ao risco, liquidez,
limites e consequências assimétricas.
Erro comum: escolher a maior esperança
ignorando a possibilidade de perda incompatível com a capacidade da
organização.
3.21 Distribuição de Bernoulli e
binomial
Uma variável Bernoulli representa um ensaio
com dois resultados, como sucesso e fracasso, com probabilidade p de sucesso. A
binomial conta sucessos em n ensaios independentes com p constante.
P(X=x)
= C(n,x)pˣ(1−p)ⁿ⁻ˣ
E(X)=np;
Var(X)=np(1−p)
Se cada contato tem probabilidade 0,20 de
conversão e 10 contatos são tratados como independentes, a probabilidade de
exatamente 3 conversões é C(10,3)0,2³0,8⁷ ≈ 0,201. O número esperado é 2.
As condições importam. Em campanhas, p pode
variar por segmento e os resultados podem depender do mesmo evento externo.
Nesses casos, a binomial simples é aproximação. A modelagem deve reconhecer
heterogeneidade e dependência.
Erro comum: usar binomial em amostragem sem
reposição de população pequena, quando a hipergeométrica é mais adequada.
3.22 Distribuição de Poisson
A Poisson modela contagens de eventos em um
intervalo quando ocorrem com taxa média λ, de forma aproximadamente
independente e sem concentração simultânea relevante.
P(X=x)
= e^(−λ) λˣ / x!
E(X)=λ;
Var(X)=λ
Se um suporte recebe em média 4 chamados
por hora, a probabilidade de exatamente 2 em uma hora é e^(−4)4²/2! ≈ 0,1465. A
probabilidade de nenhum chamado é e^(−4) ≈ 0,0183.
A igualdade entre média e variância é
característica do modelo. Dados com variância muito maior podem apresentar
sobredispersão por heterogeneidade, picos ou dependência. A taxa também deve
ser proporcional ao intervalo: média de 4 por hora corresponde a 2 por meia
hora apenas se o processo for estável.
Erro comum: usar uma taxa média diária para
todos os horários quando há forte sazonalidade intradiária.
3.23 Distribuições geométrica e
hipergeométrica
A distribuição geométrica descreve o número
de tentativas até o primeiro sucesso em ensaios Bernoulli independentes. A
hipergeométrica conta sucessos em amostra sem reposição de uma população
finita.
Geométrica:
P(X=x) = (1−p)ˣ⁻¹p
Hipergeométrica:
P(X=x) = [C(K,x)C(N−K,n−x)] / C(N,n)
Se a chance de fechar uma venda é 0,25 por
contato independente, a probabilidade de a primeira venda ocorrer no terceiro
contato é 0,75²×0,25 = 0,1406. Se um lote de 50 itens contém 5 defeituosos e
são selecionados 4 sem reposição, a hipergeométrica representa o número de
defeitos observados.
A geométrica possui propriedade de falta de
memória, adequada apenas quando a chance permanece constante. Em vendas,
aprendizagem, fadiga ou qualidade dos leads podem quebrar essa condição. Na
hipergeométrica, a dependência surge porque cada retirada altera a composição
restante.
Erro comum: aproximar automaticamente por
binomial quando a fração amostral é elevada. Uma regra prática é considerar a
correção de população finita quando n/N não é pequena.
3.24 Distribuições uniforme e
exponencial
A uniforme contínua atribui densidade
constante a um intervalo [a,b]. A exponencial modela tempo entre eventos de um
processo de Poisson com taxa λ.
Uniforme:
f(x)=1/(b−a), para a≤x≤b
Exponencial:
f(x)=λe^(−λ)ˣ, x≥0; E(X)=1/λ
Se um horário de chegada é tratado como
uniforme entre 10 e 20 minutos, a probabilidade de ocorrer entre 12 e 15 é
(15−12)/(20−10)=0,30. Se chamadas chegam à taxa de 6 por hora, o tempo médio
entre chamadas é 1/6 de hora, ou 10 minutos; a probabilidade de esperar mais de
15 minutos é e^(−6×0,25) ≈ 0,223.
A exponencial também possui falta de
memória e supõe taxa constante. Tempos reais de serviço frequentemente não são
exponenciais. A distribuição é útil como modelo inicial e em teoria de filas,
mas deve ser confrontada com dados.
Erro comum: confundir tempo entre chegadas
com duração do atendimento. São variáveis diferentes e podem seguir
distribuições diferentes.
3.25 Distribuição normal
A normal é contínua, simétrica e definida
por média μ e desvio-padrão σ. Sua forma de sino surge em muitos agregados e
aproximações, mas não deve ser presumida sem contexto.
Z =
(X−μ)/σ
A regra empírica indica que, em uma normal,
aproximadamente 68% dos valores ficam entre μ±1σ, 95% entre μ±2σ e 99,7% entre
μ±3σ. Se tempos são normais com média 50 e desvio 5, aproximadamente 95% ficam
entre 40 e 60.
Para calcular probabilidades, padroniza-se
X e utiliza-se a normal padrão. P(X≤60) corresponde a P(Z≤2), cerca de 0,9772.
A área é probabilidade; a altura da curva em um ponto não é probabilidade
isolada.
A normal pode aproximar binomial quando np
e n(1−p) são suficientemente grandes, com correção de continuidade. Também
aparece nas distribuições amostrais pelo Teorema Central do Limite.
Erro comum: remover dados reais para
“forçar normalidade”. A técnica deve se adaptar ao fenômeno, e não o contrário.
3.26 Amostragem probabilística e
não probabilística
Amostragem probabilística atribui
probabilidade conhecida e positiva de seleção às unidades. Exemplos: aleatória
simples, sistemática, estratificada e por conglomerados. Ela permite
quantificar erro amostral sob o desenho. Amostragens por conveniência, julgamento,
quotas e bola de neve podem ser úteis, mas não sustentam automaticamente
generalização estatística.
Na aleatória simples, todas as amostras de
tamanho n têm chance igual. Na sistemática, escolhe-se início aleatório e
intervalo k. Na estratificada, divide-se a população em grupos e sorteia-se
dentro de cada um, melhorando precisão ou garantindo representação. Por
conglomerados, sorteiam-se grupos naturais, reduzindo custo, porém aumentando
dependência interna.
Um levantamento nacional pode estratificar
por região e porte e selecionar empresas dentro de cada estrato. Uma pesquisa
em um evento, respondida por quem aceita participar, é amostra de conveniência.
O tamanho grande não elimina viés de seleção.
Erro comum: afirmar que uma amostra é
“aleatória” apenas porque as pessoas responderam espontaneamente ou porque o
analista não escolheu individualmente os casos.
3.27 Viés, erro amostral e erros
não amostrais
Erro amostral é a diferença decorrente de
observar uma amostra em vez da população. Ele tende a diminuir com amostras
maiores e pode ser quantificado em desenhos probabilísticos. Viés é erro
sistemático que não desaparece simplesmente aumentando n.
Erros não amostrais incluem cobertura
inadequada, não resposta, perguntas tendenciosas, memória, registro,
processamento e fraude. Uma pesquisa com um milhão de respostas enviesadas pode
ser menos útil que uma amostra probabilística de mil respostas.
A redação de perguntas influencia
respostas. Questões duplas, termos vagos, escalas desequilibradas e ordem das
opções geram distorções. Pré-teste e piloto ajudam a detectar problemas. O
canal também importa: pessoas sem acesso digital podem ser excluídas de
formulários online.
Erro comum: divulgar apenas “margem de
erro” e ignorar erros de cobertura e não resposta, que podem dominar a
incerteza total.
3.28 Distribuição amostral e
erro-padrão
Distribuição amostral é a distribuição de
uma estatística em todas as amostras possíveis de mesmo tamanho sob um desenho.
Ela descreve como a estatística varia e sustenta inferência.
Para a média, sob condições usuais, E(x̄)=μ
e o desvio-padrão da distribuição amostral é σ/√n. Quando σ é desconhecido,
utiliza-se s como estimativa.
EP(x̄)
= σ/√n ≈ s/√n
Se o desvio-padrão populacional é 20 e
n=100, o erro-padrão da média é 2. A dispersão dos indivíduos continua 20; o
que diminui é a incerteza da média estimada. Quadruplicar n reduz o erro-padrão
pela metade.
Para proporção, o erro-padrão aproximado é
√[p(1−p)/n], usando p̂ na prática. Em amostras sem reposição de população
finita, pode-se aplicar fator de correção.
Erro comum: confundir desvio-padrão dos
dados com erro-padrão da estimativa. Um descreve variabilidade individual; o
outro, precisão da estatística.
3.29 Teorema Central do Limite
O Teorema Central do Limite afirma que, sob
condições amplas, a distribuição da média amostral se aproxima da normal à
medida que n cresce, mesmo quando a população não é normal. O tamanho
necessário depende da assimetria, extremos e dependência.
Esse resultado explica a ampla utilização
de intervalos e testes baseados em normalidade aproximada. Ele não afirma que
os dados individuais se tornam normais nem que qualquer amostra pequena é
suficiente.
Se vendas individuais são assimétricas,
médias de grupos de 50 vendas podem apresentar distribuição muito mais próxima
da normal. Entretanto, dados dependentes no tempo ou agrupados exigem cuidados;
aumentar registros sem aumentar unidades independentes pode não produzir a
precisão esperada.
Erro comum: usar “n≥30” como regra
universal. Trinta pode ser suficiente em distribuições moderadas, mas
inadequado com caudas muito pesadas, raridade ou forte dependência.
3.30 Estimação pontual e
intervalar
Estimativa pontual oferece um único valor.
Intervalo de confiança combina estimativa e margem de erro. Em repetidas
amostras e sob o procedimento correto, uma proporção definida dos intervalos
conterá o parâmetro.
Para média com σ conhecida ou amostra
grande:
IC
para μ: x̄ ± z* × σ/√n
Para proporção, em aproximação normal:
IC
para p: p̂ ± z* × √[p̂(1−p̂)/n]
Se 400 clientes produzem p̂=0,60, o
erro-padrão é √(0,6×0,4/400)=0,0245. Para 95%, margem ≈1,96×0,0245=0,048. O
intervalo aproximado é 55,2% a 64,8%.
Interpretação frequencista correta: o
método gera 95% de intervalos que contêm o parâmetro em repetição. Na
comunicação gerencial, pode-se dizer que a estimativa é compatível com valores
na faixa, dadas as premissas.
Erro comum: concluir que 95% dos indivíduos
estão dentro do intervalo da média. O intervalo é sobre o parâmetro, não sobre
observações individuais.
3.31 Distribuição t de Student
Quando a média é estimada com σ
desconhecido, especialmente em amostras pequenas e dados aproximadamente
normais, utiliza-se a distribuição t com n−1 graus de liberdade. Ela tem caudas
mais pesadas que a normal, refletindo incerteza adicional.
IC
para μ: x̄ ± t* × s/√n
À medida que os graus de liberdade
aumentam, t se aproxima da normal padrão. Para n=10 e 95% bilateral, o valor
crítico é maior que 1,96. O intervalo fica mais largo.
A utilização da t não corrige
automaticamente assimetria extrema ou outliers. Em amostras pequenas, gráfico e
conhecimento do processo são indispensáveis. Métodos robustos ou reamostragem
podem ser estudados posteriormente.
Erro comum: usar z apenas porque a planilha
oferece a função, ignorando que σ é desconhecido e n é pequeno.
3.32 Determinação do tamanho da
amostra
O tamanho depende da precisão desejada,
nível de confiança, variabilidade, desenho e recursos. Para estimar proporção
com margem E e aproximação normal:
n₀ =
z*² p(1−p) / E²
Quando p é desconhecido, p=0,5 produz
variância máxima e tamanho conservador. Para 95% e margem de 5 pontos
percentuais, n≈1,96²×0,25/0,05²≈385. Em população finita N, pode-se corrigir:
n =
n₀ / [1 + (n₀−1)/N]
O cálculo deve prever não resposta. Se são
necessárias 385 respostas e a taxa esperada é 55%, deve-se convidar cerca de
700 pessoas. Em desenho complexo, aplica-se efeito do plano. O tamanho também
precisa garantir análises por subgrupos; 385 no total podem ser insuficientes
para comparar dez regiões.
Erro comum: definir tamanho apenas como
porcentagem da população. Em populações grandes, precisão depende mais do
tamanho absoluto e variabilidade do que da fração, salvo correção finita.
3.33 Introdução aos testes de
hipótese
Teste de hipótese avalia se os dados são
compatíveis com uma afirmação de referência. A hipótese nula H0 representa o
cenário testado; a alternativa H1 expressa diferença, aumento, redução ou outro
padrão.
O procedimento define estatística de teste
e distribuição sob H0. O valor-p é a probabilidade, assumindo H0 e o modelo, de
obter resultado tão ou mais extremo que o observado. Valor-p pequeno indica
incompatibilidade entre dados e H0; não mede a probabilidade de H0 ser
verdadeira.
Erro tipo I ocorre ao rejeitar H0 quando é
verdadeira, com probabilidade controlada por α. Erro tipo II ocorre ao não
rejeitar H0 quando a alternativa é verdadeira. Poder é 1−β e depende do efeito,
variabilidade, n e α.
Significância estatística não equivale a
relevância prática. Com amostras enormes, diferenças mínimas podem produzir
valores-p pequenos. O relatório deve apresentar tamanho do efeito, intervalo e
contexto.
Erro comum: “aceitar H0” porque p>0,05.
O correto é não rejeitar com os dados e poder disponíveis; ausência de
evidência não prova igualdade.
3.34 Teste de uma média: exemplo
introdutório
Uma empresa afirma que o tempo médio de
atendimento é 12 minutos. Uma amostra de 36 atendimentos tem média 13,2 e
desvio-padrão 3,6. Teste bilateral: H0: μ=12; H1: μ≠12.
t =
(x̄−μ₀)/(s/√n) = (13,2−12)/(3,6/6) = 2,0
Com 35 graus de liberdade, o valor-p
bilateral é aproximadamente 0,053. Ao nível de 5%, não se rejeita H0 por
pequena margem. O intervalo de 95% é aproximadamente 13,2 ± 2,03×0,6, isto é,
11,98 a 14,42, incluindo 12.
A interpretação não deve ser “o tempo é
12”. A amostra sugere aumento de 1,2 minuto, mas a incerteza ainda inclui 12.
Um estudo com maior precisão, análise por turno e verificação de independência
podem ser necessários.
Erro comum: arredondar p=0,053 para 0,05 e
alterar a decisão sem informar. Limiares são convenções; a evidência deve ser
tratada de forma contínua.
3.35 Teste de uma proporção:
exemplo introdutório
Uma meta estabelece 90% de entregas no
prazo. Em 250 pedidos, 215 foram pontuais, p̂=0,86. Teste unilateral:
H0:p=0,90; H1:p<0,90.
z =
(p̂−p₀)/√[p₀(1−p₀)/n] = (0,86−0,90)/√(0,09/250) ≈ −2,11
O valor-p unilateral é cerca de 0,017. Ao
nível de 5%, há evidência de desempenho abaixo de 90%, sob seleção e
independência adequadas. A diferença prática é 4 pontos percentuais,
equivalente a dez pedidos adicionais fora do prazo em 250.
Uma análise gerencial deve estratificar
causas, rotas e transportadoras. O teste indica que o resultado agregado é
difícil de explicar apenas por variação amostral se a taxa real fosse 90%; não
identifica a causa.
Erro comum: aplicar teste quando os 250
pedidos representam toda a população do período. Nesse caso, a taxa de 86% é
descritiva do período; inferência pode ser relevante para um processo futuro,
mas precisa definir a superpopulação ou repetição conceitual.
3.36 Ética, transparência e
reprodutibilidade
Análises estatísticas influenciam decisões
e devem permitir revisão. Reprodutibilidade exige conservar dados de origem,
dicionário, etapas de limpeza, fórmulas, versão do código e critérios de
exclusão. Em planilhas, células de entrada, cálculo e resultado devem ser
separadas; referências e filtros ocultos precisam ser documentados.
Privacidade exige coletar somente o
necessário, controlar acesso e reduzir risco de reidentificação. Pequenos
grupos podem ser identificáveis mesmo sem nome. Resultados devem ser agregados
quando a exposição não é justificável. A finalidade original dos dados limita
usos posteriores.
Transparência também envolve resultados
desfavoráveis. Selecionar apenas períodos, segmentos ou testes que confirmam a
expectativa produz viés. Hipóteses e métricas principais devem ser definidas
antes quando possível. Análises exploratórias são válidas, mas precisam ser
apresentadas como exploração.
Erro comum: acreditar que anonimização
simples resolve todos os riscos. Combinações de atributos e cruzamentos
externos podem reidentificar pessoas; governança é processo contínuo.
3.37 Razões, proporções, taxas e
índices
Razão compara duas quantidades; proporção é
uma razão em que o numerador está contido no denominador; taxa incorpora
exposição ou tempo; índice combina medidas para acompanhar mudança. Em
Administração, esses termos são frequentemente usados como sinônimos, mas a
distinção evita indicadores enganosos. A taxa de rotatividade, por exemplo,
deve relacionar saídas a uma medida do quadro exposto ao risco, e não apenas ao
número no final do mês.
Uma organização iniciou o mês com 100
pessoas e terminou com 120, após 30 admissões e 10 desligamentos. Dividir 10
desligamentos por 120 produz 8,3%; dividir por 100 produz 10%. Uma convenção
mais representativa usa quadro médio: (100+120)/2=110, resultando 9,1%. A
fórmula escolhida precisa permanecer estável e ser informada.
Índices com base 100 facilitam comparação
temporal. Se a receita foi 2 milhões no ano-base e 2,4 milhões no ano seguinte,
o índice é 120. Isso representa crescimento nominal de 20%. Para avaliar
crescimento real, deve-se ajustar inflação ou mudança de volume, conforme a
pergunta.
Taxas de eventos raros precisam de
denominadores de exposição. Comparar dez acidentes em unidades com 100 mil e 1
milhão de horas trabalhadas seria inadequado por contagem. As taxas são 10 e 1
por 100 mil horas. A unidade deve ser escolhida para comunicação, sem alterar a
relação.
Erro comum: trocar o denominador ao longo
do tempo ou comparar indicadores com definições distintas. Um painel deve
conter ficha técnica com fórmula, fonte, periodicidade, população e regras de
exceção.
3.38 Variações percentuais e
pontos percentuais
Variação percentual mede mudança relativa
ao valor inicial. Pontos percentuais medem diferença entre duas porcentagens.
Se uma taxa passa de 20% para 25%, o aumento é de 5 pontos percentuais e 25% em
termos relativos, pois (25−20)/20=0,25.
A distinção é importante em conversão,
juros, participação e inadimplência. Dizer que uma taxa subiu 5% quando passou
de 20% para 25% subestima a mudança. Dizer que subiu 25 pontos percentuais
exagera. A linguagem deve corresponder ao cálculo.
Variação
percentual = (valor novo − valor antigo) / valor antigo × 100%
Bases pequenas geram variações percentuais
grandes. Um aumento de um para dois casos é 100%, mas representa apenas um caso
adicional. Relatórios devem apresentar valor absoluto e relativo. Quando o
valor inicial é zero, a variação percentual não é definida; é melhor descrever
a mudança absoluta ou utilizar outra referência.
Em séries com quedas e recuperações,
percentuais não são simétricos. Cair 50% e depois subir 50% não retorna ao
início: 100 cai para 50 e sobe para 75. Essa propriedade é relevante em preços,
carteira e indicadores acumulados.
3.39 Dados agrupados e estimativas
por classes
Quando apenas uma tabela de classes está
disponível, média e dispersão podem ser aproximadas pelos pontos médios. A
aproximação perde informação dentro das classes e depende da largura. Classes
abertas, como “50 ou mais”, exigem hipótese e podem gerar erro relevante.
|
Classe de tempo |
Frequência |
Ponto médio |
Produto f×m |
|
0 a <5 |
12 |
2,5 |
30 |
|
5 a <10 |
20 |
7,5 |
150 |
|
10 a
<15 |
10 |
12,5 |
125 |
|
15 a
<20 |
8 |
17,5 |
140 |
|
Total |
50 |
|
445 |
A média aproximada é 445/50=8,9 minutos.
Não se sabe se os valores de cada classe estão próximos ao ponto médio. Se os
dados originais existirem, devem ser usados. A tabela agrupada é adequada para
comunicação e análise histórica quando a granularidade original foi perdida.
Para localizar mediana em classes,
identifica-se a classe que contém a posição n/2 e pode-se interpolar supondo
distribuição uniforme dentro dela. Essa suposição deve ser apresentada. Em
decisões sensíveis, a interpolação não substitui microdados.
Erro comum: tratar o ponto médio como
observação real e apresentar muitas casas decimais. O resultado é aproximado e
deve ter precisão compatível.
3.40 Média geométrica e taxas
acumuladas
A média geométrica é adequada para fatores
multiplicativos, como crescimentos sucessivos e retornos. Para fatores
positivos g₁,...,gₙ, a média geométrica é (Πgᵢ)^(1/n). Em taxas, converte-se
cada taxa em fator 1+r.
Uma receita cresce 10% no primeiro ano e
cai 10% no segundo. A média aritmética das taxas é zero, mas o fator acumulado
é 1,10×0,90=0,99, queda total de 1%. A taxa média geométrica anual é
√0,99−1≈−0,50%.
Taxa
geométrica média = [(1+r₁)(1+r₂)...(1+rₙ)]^(1/n) − 1
A média geométrica não é apropriada quando
fatores são negativos ou quando o objetivo é calcular total aditivo. Em
retornos com perda de 100%, o capital zera e a taxa composta posterior não
recupera sem novo aporte. A interpretação deve ser sobre crescimento composto
do mesmo estoque.
Erro comum: usar média aritmética para
comunicar crescimento anual composto ou comparar trajetórias multiplicativas.
3.41 Índices ponderados e efeito
de composição
Indicadores agregados frequentemente são
médias ponderadas. O resultado pode mudar porque o desempenho dentro dos grupos
mudou ou porque o peso dos grupos se alterou. Separar efeito de taxa e efeito
de composição evita conclusões equivocadas.
Duas lojas possuem taxas de satisfação de
90% e 70%. No período 1, cada uma tem 100 respostas, taxa global 80%. No
período 2, as taxas permanecem, mas a loja de 70% recebe 300 respostas e a
outra 100; a taxa global cai para 75% sem piora interna. A composição mudou.
Padronização direta aplica pesos comuns
para comparar grupos. Em operações, pode-se fixar a distribuição de rotas ou
complexidade. O resultado padronizado responde como seria o desempenho se as
unidades tivessem o mesmo mix. O indicador bruto continua relevante para o
resultado total; os dois têm finalidades distintas.
Erro comum: atribuir toda mudança agregada
à qualidade do processo. O analista deve decompor volume, mix e taxa.
3.42 Paradoxo de Simpson: exemplo
gerencial
O paradoxo de Simpson ocorre quando uma
associação observada em grupos se inverte ou desaparece no agregado por
diferenças de composição. Considere aprovação de crédito em dois segmentos.
|
Segmento |
Canal A aprovados/total |
Taxa A |
Canal B aprovados/total |
Taxa B |
|
Baixo
risco |
81/90 |
90% |
19/20 |
95% |
|
Alto risco |
2/10 |
20% |
24/80 |
30% |
|
Total |
83/100 |
83% |
43/100 |
43% |
Dentro de cada segmento, B tem taxa maior.
No agregado, A parece muito superior porque atende principalmente baixo risco.
A comparação bruta responde sobre o portfólio recebido; a comparação
estratificada responde sobre desempenho condicionado ao risco. Nenhuma deve ser
usada sem explicitar a pergunta.
Em gestão, o fenômeno aparece em hospitais,
escolas, lojas e transportadoras. Ajustar por uma variável inadequada também
pode distorcer. O critério de estratificação deve ser anterior ao resultado ou
apoiado em conhecimento causal.
Erro comum: procurar subgrupos até
encontrar narrativa conveniente. Exploração é útil, mas aumenta risco de
achados casuais e deve ser validada.
3.43 Transformações e escala
logarítmica
Transformações alteram a escala para
facilitar visualização ou modelagem. O logaritmo reduz caudas de valores
positivos e converte relações multiplicativas em aditivas. Diferenças de log
podem aproximar variações percentuais pequenas.
Valores de pedidos de R$ 20, R$ 50, R$ 100,
R$ 1.000 e R$ 10.000 ficam comprimidos no log, permitindo observar padrões sem
que o maior domine o gráfico. A mediana na escala original permanece
interpretável; a média do log, quando retransformada, relaciona-se à média
geométrica, não à média aritmética.
Transformações não devem esconder extremos
relevantes. Um evento de R$ 10.000 pode ser estratégico. O relatório pode
mostrar escalas original e logarítmica. Valores zero exigem tratamento;
adicionar constante arbitrária muda interpretação.
Erro comum: apresentar coeficientes ou
médias transformadas como se estivessem na unidade original.
3.44 Dados temporais, tendência e
sazonalidade
Séries temporais possuem ordem. Observações
próximas podem ser dependentes, violando pressupostos de amostras
independentes. Tendência, sazonalidade, calendário, promoções e mudanças
estruturais precisam ser reconhecidos antes de calcular uma média única.
Uma média anual de vendas pode ocultar
picos de dezembro e quedas de janeiro. Comparar julho com junho confunde
sazonalidade; comparar com julho anterior reduz esse problema, mas ainda pode
haver mudança de preço e composição. Gráficos de linha e índices por período
são primeiros passos.
Média móvel suaviza ruído, mas introduz
atraso e depende da janela. Uma janela de 12 meses pode remover sazonalidade
anual, enquanto três meses reage mais rápido. O objetivo é descrição; previsão
formal será aprofundada em disciplinas posteriores.
Erro comum: aplicar correlação comum a duas
séries com tendência e concluir relação forte. Tendências simultâneas podem
gerar correlação espúria.
3.45 Dados pareados e
independentes
Dados são pareados quando duas medidas
pertencem à mesma unidade ou par correspondente, como antes e depois na mesma
loja. São independentes quando grupos não compartilham unidades. A distinção
afeta cálculo da variabilidade e testes.
Em avaliação de treinamento, comparar a
média pré e pós como se fossem grupos independentes ignora que cada pessoa
funciona como controle. A análise das diferenças individuais remove parte da
heterogeneidade e pode aumentar precisão. Entretanto, mudanças externas e
regressão à média ainda ameaçam interpretação causal.
Pareamento também aparece em gêmeos,
filiais semelhantes e casos-controles. O vínculo deve ser preservado na base
com identificador. Se registros são reordenados e o pareamento se perde,
resultados tornam-se inválidos.
Erro comum: considerar centenas de medições
da mesma pessoa como centenas de unidades independentes. O tamanho efetivo está
relacionado ao número de unidades e à dependência.
3.46 Amostragem estratificada:
alocação
Na amostragem estratificada, a população é
dividida em estratos internamente mais homogêneos ou importantes. A alocação
proporcional usa n_h=n×N_h/N. A alocação desproporcional pode aumentar casos em
estratos pequenos para permitir comparação, exigindo pesos na estimativa
global.
Uma população tem 8.000 clientes digitais e
2.000 presenciais. Para n=500 proporcional, selecionam-se 400 e 100. Se a
gestão deseja precisão semelhante nos dois canais, pode selecionar 250 de cada.
Para estimar o total, pesos de 8.000/250 e 2.000/250 corrigem as probabilidades
diferentes.
A alocação ótima de Neyman considera
tamanho e desvio-padrão: mais amostra em estratos grandes e variáveis. Custos
diferentes também podem entrar. Em curso introdutório, a ideia central é que o
desenho depende do objetivo: estimar total ou comparar grupos.
Erro comum: combinar percentuais de amostra
desproporcional sem ponderação e chamá-los de resultado populacional.
3.47 Amostragem por conglomerados
e efeito do desenho
Conglomerados são grupos naturais, como
escolas, lojas ou municípios. Selecionar alguns conglomerados e observar
unidades dentro reduz custo, mas unidades do mesmo grupo tendem a ser
semelhantes. Essa correlação aumenta variância em comparação com amostra
aleatória simples de mesmo n.
O efeito do desenho deff é a razão entre a
variância sob o desenho complexo e a variância sob amostragem simples. Se
deff=1,8, o erro-padrão é √1,8≈1,34 vezes maior. O tamanho nominal de mil pode
ter precisão semelhante à de 556 observações independentes.
Aumentar número de conglomerados costuma
melhorar mais a precisão do que coletar muitas unidades em poucos grupos,
quando a correlação intraclasse é positiva. No entanto, custos de deslocamento
e estrutura precisam ser equilibrados.
Erro comum: usar fórmula de amostra simples
em dados agrupados e divulgar margem de erro subestimada.
3.48 Ponderação e calibração
Pesos amostrais podem representar inverso
da probabilidade de seleção, ajuste de não resposta e calibração a totais
conhecidos. Uma unidade com peso 20 representa aproximadamente vinte unidades
da população sob o desenho.
Pesos extremos aumentam variância. Podem
surgir quando probabilidades são muito pequenas ou grupos respondem pouco.
Técnicas de aparagem reduzem extremos, mas introduzem viés e devem ser
justificadas. O relatório deve informar se estimativas são ponderadas e qual
população representam.
Em pesquisas online abertas, atribuir pesos
demográficos não transforma automaticamente a amostra em probabilística.
Calibração corrige diferenças nas variáveis usadas, não vieses em
características não observadas. É uma ferramenta, não garantia.
Erro comum: calcular tamanho amostral
apenas pelo número de respostas e ignorar o tamanho efetivo reduzido pelos
pesos.
3.49 Correção de população finita
Quando se amostra sem reposição uma fração
relevante da população, a incerteza diminui porque observar uma unidade fornece
informação sobre o conjunto restante. O fator de correção é √[(N−n)/(N−1)].
EP
corrigido = EP da amostra simples × √[(N−n)/(N−1)]
Para N=1.000 e n=400, o fator é
√(600/999)≈0,775. A margem é cerca de 22,5% menor do que a fórmula para
população infinita. Para n/N abaixo de 5%, o efeito é pequeno e frequentemente
ignorado.
A correção vale para amostragem sem
reposição e população finita definida. Não deve ser usada apenas porque o banco
de dados tem tamanho conhecido quando o objetivo é inferir para períodos
futuros ou uma superpopulação conceitual.
Erro comum: aplicar correção finita em
pesquisas de opinião sobre comportamento futuro usando apenas o cadastro atual
como N, sem definir o alvo inferencial.
3.50 Aproximação normal da
binomial
Quando n é grande e p não está muito perto
de 0 ou 1, a binomial pode ser aproximada por normal com média np e desvio
√[np(1−p)]. Como a binomial é discreta e a normal contínua, usa-se correção de
continuidade.
Se X~Binomial(100,0,40), deseja-se P(X≤45).
A média é 40 e o desvio √24≈4,899. Com correção, calcula-se P(Y≤45,5). O z é
(45,5−40)/4,899≈1,123, probabilidade aproximada 0,869.
Sem correção, usar 45 produz z≈1,021 e
probabilidade menor. Softwares calculam binomial exata facilmente, mas a
aproximação ajuda a compreender distribuição amostral de proporções.
Erro comum: aproximar quando np ou n(1−p) é
muito pequeno. A assimetria torna a normal inadequada.
3.51 Quantis da normal e níveis de
serviço
Quantis da normal transformam
probabilidades em limites. O percentil 95 da normal padrão é aproximadamente
1,645; o 97,5 é 1,96. Em gestão, essa lógica aparece em capacidade, estoque e
níveis de serviço, sempre condicionada à adequação da distribuição.
Se demanda semanal é aproximadamente normal
com média 500 e desvio 80, o percentil 95 é 500+1,645×80≈632. Planejar 632
unidades cobre cerca de 95% das semanas segundo o modelo. Isso não significa
95% de atendimento de cada item se houver múltiplos produtos ou dependências.
A decisão deve comparar custo de excesso e
falta. Escolher 95% não é conclusão estatística, mas escolha gerencial. A
estatística traduz o nível desejado em quantidade.
Erro comum: utilizar média mais dois
desvios como regra universal sem verificar assimetria, estabilidade e
consequências.
3.52 Valor esperado, árvore e
decisão
O valor esperado combina resultados e
probabilidades. Em uma árvore, decisões são quadrados, incertezas são círculos
e resultados aparecem nas folhas. Calcula-se de trás para frente.
Uma campanha custa R$ 20 mil. Há 40% de
chance de gerar benefício de R$ 80 mil e 60% de gerar R$ 10 mil. Benefícios
líquidos são 60 mil e −10 mil. Valor esperado=0,4×60+0,6×(−10)=R$ 18 mil.
Uma alternativa segura de R$ 15 mil tem
valor menor, mas menor risco. A escolha depende de capacidade financeira,
repetição e utilidade. Se a campanha é única e a perda ameaça caixa, o valor
esperado não resume adequadamente.
Probabilidades devem ser auditadas.
Intervalos e cenários podem mostrar sensibilidade. A árvore estrutura a
decisão, mas não cria informação inexistente.
3.53 Comunicação de intervalos e
incerteza
Um intervalo deve ser comunicado com
estimativa, faixa, nível e contexto. “Satisfação 64%, margem 4 pontos, pesquisa
probabilística com 500 respostas, realizada em junho” é mais informativo que
“64% dos clientes estão satisfeitos”.
Evite transformar limite em certeza. Se o
intervalo é 60% a 68%, valores próximos aos extremos são menos compatíveis que
o centro, mas todos estão na faixa pelo procedimento. O intervalo não incorpora
automaticamente viés de não resposta, erro de medição ou mudanças futuras.
Gráficos com barras de erro devem
identificar se mostram desvio-padrão, erro-padrão ou intervalo. Essas
quantidades têm significados diferentes. Eixos e escalas precisam permitir
leitura.
Erro comum: sobrepor intervalos e concluir
ausência de diferença sem teste adequado; ou ver pequena sobreposição e
concluir significância. A relação depende do desenho e da covariância.
3.54 Múltiplas comparações e
achados casuais
Quando muitos testes são realizados,
aumenta a chance de encontrar pelo menos um resultado pequeno por acaso. Com 20
testes independentes a α=5%, a chance de pelo menos um falso positivo é
1−0,95²⁰≈64%.
Correções como Bonferroni dividem α pelo
número de testes, controlando erro familiar, mas podem reduzir poder.
Estratégias melhores incluem definir hipóteses principais, separar exploração e
confirmação, relatar todos os testes e validar em nova amostra.
Dashboards com centenas de segmentos
convidam à caça de diferenças. O analista deve priorizar efeitos consistentes,
plausíveis e relevantes, não apenas células coloridas. Em exploração,
resultados geram hipóteses, não conclusões finais.
Erro comum: publicar somente o segmento com
p<0,05 sem informar quantos foram examinados.
3.55 Tamanho do efeito
Tamanho do efeito quantifica magnitude.
Diferença de médias pode ser expressa na unidade original ou padronizada.
Diferença de proporções, razão de riscos e odds ratio respondem a perguntas
distintas.
Uma redução de 0,5 minuto pode ser
estatisticamente significativa com grande n, mas irrelevante. Uma redução de 5
minutos com intervalo amplo pode ser importante e ainda incerta. Relatório deve
combinar magnitude e precisão.
A diferença padronizada d=(x̄₁−x̄₂)/s
combinado facilita comparação entre escalas, mas referências como 0,2, 0,5 e
0,8 não são universais. A unidade original permanece essencial para decisão.
Erro comum: substituir relevância de
negócio por rótulo de tamanho “pequeno” ou “grande” sem contexto.
3.56 Poder e planejamento de
estudos
Poder é a chance de rejeitar H0 quando
existe um efeito especificado. Aumenta com n, efeito maior, menor variabilidade
e α maior. Planejar poder antes evita estudos incapazes de responder à
pergunta.
Se a organização precisa detectar diferença
mínima de 3 pontos percentuais, deve usar essa diferença no cálculo, juntamente
com taxa-base e poder desejado, frequentemente 80% ou 90%. Calcular apenas
margem para uma proporção não é igual a planejar comparação entre grupos.
Após um estudo não significativo, “poder
observado” calculado com o efeito amostral oferece pouca informação. É melhor
examinar intervalo: se exclui efeitos relevantes, há evidência de equivalência
prática; se é largo, o estudo é inconclusivo.
Erro comum: interpretar p>0,05 como
prova de que não há efeito, sem avaliar se o estudo poderia detectar o efeito
importante.
3.57 Bootstrap: visão introdutória
Bootstrap é reamostragem com reposição da
amostra observada para aproximar a distribuição de uma estatística. É útil
quando fórmulas são difíceis ou quando se deseja estudar mediana, razão ou
outras medidas.
Com n observações, sorteiam-se n valores
com reposição, calcula-se a estatística e repete-se milhares de vezes. A
distribuição dos resultados fornece erro-padrão e intervalos. O método assume
que a amostra representa adequadamente a população e precisa respeitar
estrutura de dependência.
Em dados temporais ou agrupados, reamostrar
linhas individualmente destrói dependência; usam-se blocos ou clusters. Em
amostras pequenas com extremos raros, o bootstrap não inventa padrões ausentes.
Erro comum: tratar bootstrap como correção
automática de amostragem enviesada.
3.58 Simulação de Monte Carlo:
visão introdutória
Simulação de Monte Carlo gera valores de
entradas segundo distribuições e calcula resultados repetidamente. Ela traduz
incerteza de demanda, preço e prazo em distribuição de lucro ou caixa.
Um projeto depende de volume normal, preço
triangular e custo variável. A cada iteração, sorteiam-se valores e calcula-se
resultado. Após dez mil repetições, estimam-se média, percentis e probabilidade
de prejuízo. A qualidade depende das distribuições e correlações assumidas.
Simulação não torna a previsão verdadeira.
Ela mostra consequências das premissas. Cenários extremos e validação histórica
são necessários. Correlações entre preço e volume ou custos não podem ser
ignoradas quando materiais.
Erro comum: apresentar milhares de
iterações como garantia de precisão, embora as premissas sejam frágeis.
3.59 Regressão à média
Resultados extremos tendem a ser seguidos
por valores menos extremos quando parte da variação é aleatória. Esse fenômeno
é regressão à média. Ele pode fazer uma intervenção parecer eficaz se unidades
foram escolhidas justamente por desempenho ruim excepcional.
Uma empresa oferece treinamento às cinco
lojas com pior resultado do mês. No mês seguinte, elas melhoram mesmo sem
efeito, porque parte da queda anterior era transitória. Um grupo de comparação
ou série mais longa ajuda a separar efeito e regressão.
O fenômeno também ocorre em saúde,
qualidade e desempenho de pessoas. Metas e bônus baseados em extremos podem
gerar interpretações equivocadas.
Erro comum: atribuir toda melhora após
seleção de casos extremos à ação realizada.
3.60 Causalidade, experimentos e
observação
Estudos observacionais descrevem
associações sem controlar a atribuição. Experimentos randomizados distribuem
tratamento ao acaso, equilibrando fatores em média e fortalecendo inferência
causal. Quase-experimentos usam regras, tempo ou comparação para aproximar
contrafactual.
Em teste A/B, usuários elegíveis são
alocados aleatoriamente, a métrica é definida antes e a análise segue intenção
de tratar. Interromper quando o resultado parece favorável aumenta falso
positivo. Contaminação entre grupos e múltiplas métricas precisam ser
controladas.
Nem toda decisão pode ser randomizada por
ética, custo ou operação. Diagramas causais, estratificação e regressão ajudam,
mas dependem de premissas. Métodos Estatísticos I prepara a leitura crítica; o
aprofundamento vem depois.
Erro comum: usar linguagem causal — “a
campanha aumentou” — em comparação antes/depois sem grupo e sem controlar
tendência.
3.61 Caderno de exercícios
resolvidos
Os exercícios seguintes reforçam cálculo e
interpretação. Cada solução inclui a pergunta gerencial e o principal cuidado
metodológico.
Exercício resolvido 1 — Média
ponderada de preços
Uma empresa vende 100 unidades a R$ 20, 300
a R$ 15 e 600 a R$ 10. O preço médio ponderado é
(100×20+300×15+600×10)/1.000=R$ 12,50. A média simples dos três preços seria R$
15 e não representaria a receita por unidade. O peso correto é quantidade.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 2 — Mediana
com número par
Os valores 2, 3, 3, 5, 8 e 20 têm mediana
(3+5)/2=4. A média é 41/6=6,83. Para pedido típico, mediana é mais resistente;
para receita total por pedido, média mantém relevância.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 3 — Variância
amostral
Para 4, 6 e 8, x̄=6. Desvios
quadráticos:4,0,4, soma 8. s²=8/(3−1)=4; s=2. Dividir por 3 produziria
variância populacional, adequada apenas se esses três valores fossem toda a
população-alvo.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 4 —
Coeficiente de variação
Processo A: média 50, s=5, CV=10%. Processo
B: média 200, s=30, CV=15%. B tem maior variabilidade absoluta e relativa. Se a
média pudesse ser zero, CV perderia sentido.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 5 — Percentil
de serviço
Em 100 entregas ordenadas, o p90 próximo da
posição 90 indica limite abaixo do qual ficam cerca de 90 casos. Se p90=7 dias,
a meta de 90% em até 7 é descritiva. O método exato de interpolação deve ser
consistente.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 6 — União de
eventos
P(A)=0,40, P(B)=0,30 e P(A∩B)=0,12.
P(A∪B)=0,40+0,30−0,12=0,58. Somar 0,70 contaria a interseção duas vezes.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 7 —
Independência
Se P(A)=0,20 e P(B)=0,50, independência
implica P(A∩B)=0,10. Observar interseção 0,16 sugere dependência. A conclusão
amostral exige considerar incerteza.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 8 — Bayes em
inspeção
Defeito 2%, teste detecta 95% e falso
positivo 3%. Em 10.000 itens:190 defeituosos positivos e 294 legítimos
positivos. P(defeito|positivo)=190/484≈39,3%. A taxa-base reduz o valor
preditivo.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 9 — Esperança
de perda
Perda de R$ 100 mil com chance 1% e de R$
10 mil com chance 9%; caso contrário zero. Perda esperada=1.000+900=R$ 1.900.
Seguro deve ser comparado à perda esperada, risco de cauda e aversão.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 10 — Binomial
ao menos um
Com p=0,10 e n=5, P(ao menos
um)=1−0,9⁵≈0,4095. O complemento evita somar casos 1 a 5.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 11 — Poisson
Com λ=3 por período, P(X=0)=e^(−3)≈0,0498 e
P(X≤1)=e^(−3)(1+3)≈0,1991. A taxa deve ser estável no período.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 12 —
Exponencial
Chegadas a 4 por hora dão tempo médio 15
minutos. P(espera>30 min)=e^(−4)×⁰·⁵=e^(−2)≈0,1353. Isso é tempo entre
chegadas, não tempo de serviço.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 13 — Normal
X~N(100,15²). Para x=130, z=2 e
P(X>130)≈2,28%. A interpretação depende de normalidade aproximada.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 14 —
Erro-padrão
s=12, n=64: EP≈12/8=1,5. Aumentar n para
256 reduz EP para 0,75. O desvio dos indivíduos permanece 12.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 15 — Intervalo
de média
x̄=50, s=10, n=100. IC95%
aproximado=50±1,96=48,04 a 51,96. Se dados forem agrupados ou dependentes, a
faixa simples pode ser estreita demais.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 16 — Tamanho
de amostra
Para proporção, 95%, E=0,03 e p=0,5:
n≈1,96²×0,25/0,0009≈1.068. Deve-se ajustar não resposta e desenho.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 17 — Teste de
proporção
Meta p0=0,80, amostra n=400, p̂=0,75.
z=(−0,05)/√(0,16/400)=−2,5; p unilateral≈0,0062. Há evidência abaixo da meta,
além de diferença prática de 5 pontos.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 18 — Diferença
entre significância e efeito
Um ganho de R$ 0,02 por transação pode ter
p<0,001 em milhões de transações. O impacto total pode ser grande ou pequeno
conforme volume e custo. A decisão precisa converter efeito unitário em valor.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 19 —
Correlação com extremo
Quatro pontos seguem padrão fraco, mas um
caso muito alto em x e y pode elevar r. O gráfico e análise com/sem o ponto
revelam influência. Remoção exige justificativa.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 20 — Amostra
por conveniência
Uma enquete em rede social recebe 20 mil
respostas. O número reduz variação entre respondentes, mas não corrige exclusão
de quem não segue a página ou não deseja responder. Não se deve divulgar margem
de erro probabilística padrão.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 21 — Correção
finita
N=2.000, n=500. Fator=√(1.500/1.999)≈0,866.
Um EP de 2 pontos cairia para 1,73. A correção só vale para inferência à
população finita amostrada sem reposição.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 22 — Pontuação
z comparativa
Pessoa A obteve 80 em prova com média 70,
s=5: z=2. Pessoa B obteve 90 em prova com média 75, s=10: z=1,5. A tem posição
relativa maior, embora nota bruta menor.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 23 — Taxa
versus contagem
Unidade A tem 20 falhas em 10.000
operações, taxa 0,2%; B tem 10 em 2.000, taxa 0,5%. A tem mais falhas
absolutas, B pior taxa.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 24 — Variação
acumulada
Crescimentos de 20% e −20% geram fator
1,2×0,8=0,96, queda de 4%. Média geométrica anual=√0,96−1≈−2,02%.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
Exercício resolvido 25 — Poder
insuficiente
Um estudo de 20 unidades encontra diferença
favorável, p=0,18 e intervalo de −2 a +10. Não há evidência conclusiva; o
intervalo inclui prejuízo pequeno e benefício importante. A resposta é aumentar
precisão, não declarar ausência.
Verificação gerencial: identifique a
unidade do resultado, compare com a ordem de grandeza e declare a condição que,
se violada, mais comprometeria a conclusão. Essa etapa deve acompanhar a conta
em provas e relatórios.
3.62 Casos de interpretação e
diagnóstico
Caso interpretativo 1 — Média
crescente e mediana estável
O valor médio de compra subiu 18%, enquanto
a mediana permaneceu praticamente igual. A leitura mais provável é que compras
altas ganharam peso ou ficaram maiores. Antes de afirmar melhoria geral,
examine percentis, número de pedidos, segmento corporativo e clientes
recorrentes. A receita pode ter crescido de forma concentrada. Para decisão
comercial, separe expansão da base e aumento no topo.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 2 —
Desvio-padrão menor após filtro
A dispersão do prazo caiu depois de excluir
pedidos cancelados e reentregues. Isso pode representar limpeza correta ou
remoção de casos que fazem parte da experiência. A população precisa ser
definida. Cancelamentos antes do envio podem ser outra jornada; reentregas por
falha logística devem permanecer ou ser analisadas separadamente. Uma melhora
estatística causada por mudança de regra não é melhora operacional.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 3 — Taxa
estável com volume crescente
A taxa de defeitos permanece em 2%, mas o
volume dobra. O número de defeitos dobra e o custo total pode crescer. Taxa
mede qualidade relativa; contagem mede carga. A gestão precisa de ambos. Se a
capacidade de retrabalho não aumenta, uma taxa estável pode produzir
congestionamento. Metas devem considerar risco unitário e impacto total.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 4 — Percentual
alto em amostra pequena
Uma filial alcançou 100% de satisfação com
cinco respostas. Outra teve 82% com quinhentas. O primeiro resultado é muito
incerto e sujeito a seleção. Um intervalo exato seria amplo. O painel deve
mostrar n, limitar ranking e acumular períodos. Não se deve descartar a filial
pequena, mas tratar sua estimativa com prudência.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 5 — Correlação
negativa inesperada
Dados mostram correlação negativa entre
treinamento e desempenho. Pode ocorrer porque pessoas com pior desempenho
recebem mais treinamento. A direção causal está invertida. Também pode haver
medida inadequada de desempenho ou período curto. Antes de concluir que
treinamento prejudica, analise regra de seleção, linha de base e mudança
individual.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 6 — Queda do
valor-p sem mudança de efeito
Em atualizações sucessivas, a diferença
permanece em 2 pontos, mas o valor-p cai à medida que n cresce. A evidência de
que a diferença não é zero aumenta; a magnitude não. A decisão deve ter limiar
prático definido. Se 2 pontos não pagam o custo, a significância crescente não
muda a recomendação.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 7 — Intervalo
estreito em base enviesada
Uma pesquisa online com cem mil respostas
produz margem amostral muito pequena, mas exclui pessoas sem acesso e atrai
participantes engajados. Precisão entre respondentes não significa
representatividade. O relatório não deve usar intervalo probabilístico como se
a seleção fosse aleatória. Alternativas incluem desenho misto e calibração,
mantendo limitações.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 8 —
Sazonalidade confundida com tendência
Vendas sobem todo dezembro e caem em
janeiro. Comparar apenas meses consecutivos gera interpretações de sucesso e
fracasso anuais. A análise deve comparar anos, ajustar dias úteis e observar
índice sazonal. Promoções e inflação também influenciam. A tendência é o
movimento além do padrão recorrente.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 9 — Meta
alterada durante o período
O prazo prometido mudou de sete para cinco
dias no meio do trimestre. A taxa de atraso aumenta mesmo se o prazo realizado
permanecer igual. O indicador deve ser segmentado por regra e acompanhado do
tempo real. Misturar períodos cria quebra de série. A mudança metodológica
precisa de nota e, quando possível, recálculo histórico.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 10 — Outlier
que revela novo mercado
Um pedido cem vezes maior parece extremo,
mas vem de cliente empresarial recém-conquistado. Excluí-lo da análise de
varejo pode ser correto; apagá-lo da receita total é errado. A observação
revela que a população contém dois segmentos. O modelo deve separar B2C e B2B,
e não tratar o novo negócio como erro.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 11 — Amostra
maior com pior desenho
A primeira pesquisa sorteou mil clientes e
obteve 600 respostas. A segunda coletou dez mil respostas por link aberto. A
segunda tem mais casos, mas seleção menos controlada. O tamanho não compensa
viés. Comparar resultados requer cautela, pois a mudança de método pode
explicar diferenças.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 12 — Resultado
agregado e desigualdade
A satisfação global sobe, mas cai em um
grupo que enfrenta barreiras de acesso. A média ponderada pode melhorar porque
o grupo tem peso pequeno ou porque outros crescem. A gestão responsável
desagrega indicadores e estabelece padrões mínimos. Otimizar o total não
justifica deterioração concentrada sem análise e resposta.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 13 —
Probabilidade pequena e impacto alto
Um evento tem chance anual de 0,5%,
aparentemente baixa, mas prejuízo potencial de R$ 20 milhões. A perda esperada
é R$ 100 mil, porém a capacidade de sobreviver ao evento importa. Seguro,
contingência e limites não podem ser definidos apenas pela média. Risco de
cauda exige cenário e governança.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 14 — Previsão
correta pelo motivo errado
Um modelo acerta vendas totais, mas erra
regiões em direções opostas que se cancelam. O erro agregado parece bom,
enquanto estoque local fica inadequado. Avalie nível em que a decisão é tomada.
Métricas devem ser calculadas por produto, local e horizonte, além do total.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 15 — Não
significância com intervalo útil
Um teste não rejeita diferença zero, mas o
intervalo vai de −0,2 a +0,3 ponto, faixa totalmente irrelevante para a gestão.
Nesse caso, o estudo pode sustentar equivalência prática, embora o teste
tradicional não “prove igualdade”. Defina margem de equivalência e use
interpretação do intervalo.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
Caso interpretativo 16 —
Significância e dano concentrado
Uma política melhora a média em pequena
magnitude e prejudica fortemente poucos casos. A média pode ser positiva, mas a
distribuição de efeitos importa. Examine quantis, subgrupos e riscos. Uma
decisão ética não se limita ao efeito médio; precisa considerar quem recebe
benefícios e danos.
Resposta recomendada: declarar o que os
números mostram, apresentar pelo menos uma explicação alternativa, indicar a
informação adicional necessária e evitar transformar associação ou indicador
isolado em juízo definitivo.
4.
Principais Temas e Organização
Organização sugerida para um
semestre de 16 semanas
|
Módulo |
Semanas |
Conteúdos centrais |
Produto de aprendizagem |
|
1.
Perguntas e dados |
1–2 |
população,
amostra, variáveis, qualidade e ética |
dicionário
e plano de análise |
|
2.
Organização e visualização |
3–4 |
frequências,
tabelas, gráficos e comunicação |
painel
descritivo |
|
3. Medidas
descritivas |
5–6 |
centro,
posição, dispersão, forma e outliers |
relatório
comparativo |
|
4.
Relações bivariadas |
7 |
tabelas
cruzadas, dispersão, covariância e correlação |
análise de
associação |
|
5.
Probabilidade |
8–9 |
eventos,
condicionais, independência e Bayes |
árvore e
tabela de probabilidades |
|
6.
Distribuições |
10–11 |
binomial,
Poisson, normal e outras distribuições |
modelagem
de situações |
|
7.
Amostragem |
12–13 |
desenhos,
vieses, distribuição amostral e TCL |
plano
amostral |
|
8.
Inferência introdutória |
14–15 |
intervalos,
tamanho amostral e testes |
estimativa
e decisão |
|
9.
Integração |
16 |
estudo de
caso, comunicação e revisão |
relatório
executivo |
Módulo 1 — definição do problema e
governança dos dados
O semestre deve começar pela pergunta. A
equipe descreve decisão, público, período, unidade de análise e variáveis
necessárias. Essa etapa evita bases enormes com pouca utilidade. Também
introduz consentimento, finalidade, acesso e responsabilidade. Um exercício
recomendado é construir dicionário de dados e identificar riscos de qualidade
antes de qualquer cálculo.
Módulo 2 — leitura visual e
síntese
Nesta etapa, estudantes constroem
frequências e gráficos. O foco é escolher representação e explicar o que ela
mostra. Atividades podem incluir corrigir gráficos enganosos, comparar escalas
e reescrever títulos. A avaliação deve considerar clareza, não apenas estética.
Módulo 3 — medidas descritivas e
variabilidade
Média, mediana, quartis, variância e
desvio-padrão são trabalhados em conjunto. Cada exemplo deve perguntar qual
medida responde melhor à decisão. Comparar dois grupos com mesma média e
dispersões diferentes ajuda a mostrar por que centro isolado é insuficiente.
Módulo 4 — relações e cuidado
causal
Tabelas cruzadas e gráficos de dispersão
introduzem associação. O estudante calcula correlação e aprende a procurar
subgrupos, não linearidade e outliers. Casos de correlação espúria e paradoxo
de Simpson mostram por que relação não prova causa.
Módulo 5 — raciocínio
probabilístico
Probabilidade é apresentada com tabelas,
árvores e frequências naturais antes de fórmulas compactas. Bayes pode ser
trabalhado com fraudes, testes de qualidade ou triagem. A compreensão da
taxa-base é mais importante que decorar uma expressão.
Módulo 6 — distribuições como
modelos
Distribuições são escolhidas pelo
mecanismo: binomial para sucessos em ensaios, Poisson para contagens,
exponencial para intervalos, normal para medidas e aproximações. A atividade
deve incluir verificação das condições e discussão do que acontece quando elas
falham.
Módulo 7 — da população à amostra
O estudante compara amostras
probabilísticas e por conveniência, simula distribuição de médias e observa o
efeito de n sobre erro-padrão. A simulação em planilha torna o Teorema Central
do Limite concreto. O módulo também aborda não resposta e correção de população
finita.
Módulo 8 — inferência
Intervalos e testes são introduzidos como
procedimentos de decisão sob incerteza. O ensino deve evitar receituário de
p-valor. Estimativa, margem de erro, tamanho do efeito e premissas aparecem no
relatório. O estudante aprende a distinguir significância estatística e
importância gerencial.
Módulo 9 — projeto integrador
O projeto final reúne pergunta, dados,
preparação, descrição, probabilidade ou inferência e recomendação. A entrega
ideal contém nota técnica e resumo executivo. A nota registra métodos; o resumo
comunica conclusão, risco e ação. Essa combinação aproxima a disciplina da
prática profissional.
Estratégia de estudo
·
reescrever cada fórmula em
palavras e identificar a unidade do resultado;
·
resolver exemplos manualmente
antes de usar funções da planilha;
·
comparar resultado com gráfico
e ordem de grandeza;
·
manter um caderno de erros com
causa e correção;
·
explicar o resultado para
alguém sem formação estatística;
·
praticar interpretação de
saídas de software, não apenas digitação de comandos.
5.
Relação com outras matérias
Matemática e Matemática Financeira
Álgebra, funções, somatórios e potências
sustentam fórmulas. A diferença é que estatística lida explicitamente com
variabilidade e amostras. Em finanças, médias de retorno, dispersão e
probabilidades ajudam a representar risco.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
Contabilidade e Análise das
Demonstrações
Indicadores contábeis são dados.
Estatística auxilia comparar empresas, períodos e segmentos, reconhecer valores
extremos e avaliar estabilidade. Médias setoriais exigem pesos e definições
consistentes.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
Marketing e Pesquisa de Mercado
Questionários, escalas, amostragem, margem
de erro e testes são centrais. A disciplina ajuda a evitar conclusões baseadas
apenas em respondentes espontâneos e a interpretar diferenças de conversão.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
Gestão de Pessoas
Absenteísmo, rotatividade, remuneração e
clima exigem taxas, distribuição e comparação justa. Pequenos grupos demandam
cautela de privacidade e precisão.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
Administração da Produção
Tempos, defeitos e produtividade são
variáveis. Estatística distingue variabilidade natural, mudanças e gargalos,
preparando para controle estatístico da qualidade.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
Logística e Cadeia de Suprimentos
Demanda, prazos e perdas possuem
distribuições. Percentis e probabilidades apoiam estoques, níveis de serviço e
avaliação de transportadoras.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
Economia e Econometria
Estatística fornece probabilidade,
amostragem e inferência. Econometria aprofunda relações entre variáveis
econômicas, regressão e identificação.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
Métodos Determinísticos
Otimização trata parâmetros como
conhecidos; estatística ajuda a estimá-los e avaliar sua incerteza. As duas
áreas se complementam em modelos mais realistas.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
Análise das Decisões Gerenciais
Probabilidades, valores esperados e
evidências alimentam árvores, cenários e decisões. A qualidade da decisão
depende da qualidade das estimativas.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
Tecnologia e Ciência de Dados
Bancos, planilhas e linguagens automatizam
análises. A estatística fornece critérios para validar modelos e evitar que
correlações sejam tratadas como explicações.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
Metodologia Científica e TCC
Pergunta, amostra, variáveis, desenho e
análise sustentam pesquisas. A disciplina ajuda a alinhar objetivo, método e
conclusão.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
Políticas Públicas
Indicadores, pesquisas e avaliações apoiam
diagnóstico e monitoramento. Representatividade e desagregação são essenciais
para não ocultar desigualdades.
A conexão prática ocorre quando a pessoa
estudante traduz conceitos estatísticos para a linguagem da área. Antes de
calcular, deve identificar unidade, horizonte, denominador e mecanismo que
produziu os dados. Depois, deve explicar o que o resultado permite e o que
permanece incerto.
6.
Aplicações Práticas e Profissionais
As aplicações a seguir mostram como o
conhecimento introdutório aparece no cotidiano. Cada situação inclui pergunta,
método, interpretação e cuidado. O objetivo é demonstrar que a estatística não
é uma etapa isolada, mas parte de um processo de decisão.
6.1 Vendas e sazonalidade
Uma rede deseja entender por que a receita
do mês cresceu. O analista separa quantidade, preço médio, mix e dias úteis.
Constrói série temporal e compara o mês com o mesmo período do ano anterior,
evitando atribuir sazonalidade a desempenho. Médias móveis podem resumir
tendência, mas não substituem análise causal.
A decisão é ajustar metas e estoque. O
cuidado é não comparar meses de durações e campanhas diferentes.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.2 Conversão de campanha
Marketing compara duas campanhas. Calcula
conversões sobre pessoas elegíveis e verifica se a alocação foi comparável. Um
intervalo para a diferença ajuda a medir incerteza.
A decisão é ampliar, manter teste ou
interromper. O cuidado é observar custo por aquisição e qualidade posterior,
não apenas taxa inicial.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.3 Ticket médio
Uma loja apresenta ticket médio maior, mas
possui poucos pedidos corporativos muito altos. Mediana, quartis e distribuição
por segmento mostram que a experiência típica não mudou.
A decisão é separar estratégia B2B e
varejo. O cuidado é não usar média agregada como medida única.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.4 Pesquisa de satisfação
A organização sorteia clientes recentes,
acompanha não resposta e calcula proporções com intervalo. Resultados são
desagregados por canal sem divulgar grupos pequenos.
A decisão é priorizar causas de
insatisfação. O cuidado é evitar tratar nota média como precisão absoluta.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.5 Tempo de atendimento
A equipe acompanha média, mediana e
percentil 90. Um turno tem média semelhante, mas cauda maior, indicando
episódios longos.
A decisão é revisar escala e casos
complexos. O cuidado é não penalizar equipe que atende demanda mais difícil sem
ajuste de mix.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.6 Qualidade de lote
A inspeção seleciona itens sem reposição. A
hipergeométrica estima probabilidade de detectar defeitos e ajuda a desenhar
amostra.
A decisão é aceitar, ampliar inspeção ou
bloquear lote. O cuidado é considerar custo de falso aceite e falso bloqueio.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.7 Chamados de suporte
Contagens por hora são comparadas com
Poisson como referência. Sobredispersão sugere picos, dependência ou
heterogeneidade.
A decisão é dimensionar cobertura por faixa
horária. O cuidado é não usar taxa diária constante.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.8 Atrasos logísticos
A taxa de atraso é calculada por
transportadora, rota e faixa de distância. Intervalos evitam ranking rígido com
poucos pedidos.
A decisão é renegociar ou redistribuir
rotas. O cuidado é controlar complexidade e volume.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.9 Estoque e demanda
Média e desvio da demanda semanal orientam
estoque de segurança em modelos posteriores. Percentis são úteis para nível de
serviço.
A decisão é ajustar reposição. O cuidado é
verificar tendência e sazonalidade antes de assumir estabilidade.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.10 Rotatividade de pessoas
A taxa usa média de quadro no denominador e
é analisada por área e tempo de casa. Pequenos grupos são agregados para
privacidade.
A decisão é investigar liderança, carreira
ou seleção. O cuidado é não atribuir causa com base em correlação simples.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.11 Absenteísmo
Dias ausentes por pessoa apresentam muitos
zeros e cauda longa. Mediana, proporção com ausência e frequência por motivo
complementam a média.
A decisão é prevenção e apoio. O cuidado é
evitar estigmatização e respeitar sigilo.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.12 Remuneração
Distribuições por cargo e nível são
comparadas com mediana, quartis e diferenças ajustadas.
A decisão é revisar faixas. O cuidado é não
interpretar diferença bruta como discriminação comprovada nem ignorá-la.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.13 Risco de crédito
Taxas de inadimplência são avaliadas por
coorte. Bayes ajuda a interpretar alertas e taxa-base.
A decisão é priorizar análise e limites. O
cuidado é medir falsos positivos e impactos sobre grupos.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.14 Auditoria de despesas
Amostra probabilística estima taxa de não
conformidade. Itens de alto valor podem formar estrato próprio.
A decisão é ampliar testes e corrigir
controles. O cuidado é não extrapolar amostra de conveniência.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.15 Desempenho de fornecedores
Prazo, defeito e custo são analisados em
conjunto. Médias ponderadas por volume evitam que pequenos contratos dominem o
ranking.
A decisão é desenvolver, diversificar ou
substituir. O cuidado é registrar intervalos e criticidade.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.16 Restaurante e filas
Chegadas por período e tempos de serviço
são descritos. Distribuições orientam dimensionamento e simulações futuras.
A decisão é alterar escala e processo. O
cuidado é separar chegada de duração.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.17 Hospital e ocupação
Taxas de ocupação e permanência são
analisadas por especialidade. Percentis altos ajudam a planejar picos.
A decisão é ajustar leitos e fluxos. O
cuidado é não reduzir qualidade a produtividade.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.18 Universidade e evasão
Coortes são acompanhadas, evitando misturar
ingressantes de anos diferentes. Tabelas cruzadas identificam grupos com maior
evasão.
A decisão é oferecer apoio. O cuidado é
preservar privacidade e não rotular estudantes.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.19 Evento e público
Amostragem em horários e acessos distintos
reduz viés. Estimativas de satisfação são ponderadas quando probabilidades de
seleção diferem.
A decisão é redesenhar programação e
acessibilidade. O cuidado é não ouvir apenas quem permaneceu até o fim.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.20 Serviço público digital
Taxa de conclusão é comparada por
dispositivo, região e acessibilidade. Logs incompletos são tratados como
limitação.
A decisão é melhorar jornada. O cuidado é
não excluir quem não consegue iniciar o serviço.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.21 Manutenção
Tempos entre falhas são descritos e
comparados com modelos como exponencial. Mudanças após manutenção preventiva
são acompanhadas.
A decisão é definir frequência. O cuidado é
considerar censura e idade dos equipamentos.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.22 Segurança do trabalho
Taxas usam horas trabalhadas, não apenas
número de pessoas. Eventos raros exigem séries longas e contexto.
A decisão é prevenção. O cuidado é não
interpretar redução casual como sucesso permanente.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.23 Produtos digitais
Retenção por coorte, funil e tempo até ação
são analisados. Médias agregadas podem esconder mudança de composição.
A decisão é testar melhorias. O cuidado é
definir usuário ativo e janela antes.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.24 Terceiro setor
Cobertura e resultados são avaliados com
indicadores quantitativos e evidências qualitativas. Amostras devem incluir
territórios de difícil acesso.
A decisão é alocar recursos. O cuidado é
não reduzir impacto social ao indicador mais fácil.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.25 Sustentabilidade
Consumo e emissões são normalizados por
produção. Séries distinguem crescimento da atividade e eficiência.
A decisão é priorizar projetos. O cuidado é
documentar fronteiras e fatores de conversão.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.26 Compras públicas
Preços de propostas são descritos por
mediana e dispersão; valores atípicos são investigados.
A decisão é estimar referência e risco. O
cuidado é garantir comparabilidade de especificações.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.27 Pesquisa salarial
Amostra de empresas é estratificada por
porte e setor. Medianas são preferidas em distribuições assimétricas.
A decisão é revisar política. O cuidado é
evitar comparar cargos não equivalentes.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.28 Previsão orçamentária
Erros históricos são resumidos por sinal,
magnitude e dispersão. Viés persistente indica premissas sistemáticas.
A decisão é calibrar forecast. O cuidado é
não recompensar previsões conservadoras sem avaliar impacto.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.29 Controle de fraude
Alertas são avaliados por precisão,
sensibilidade e taxa-base. A matriz de confusão é acompanhada por custo.
A decisão é definir limiar e revisão
humana. O cuidado é monitorar grupos afetados e mudanças de comportamento.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.30 Comunicação executiva
Um resumo apresenta três números:
estimativa, faixa e impacto. Apêndice guarda método e base.
A decisão é agir com compreensão da
incerteza. O cuidado é não ocultar limitações para simplificar demais.
Roteiro recomendado: definir a unidade de
análise; verificar denominadores e ausências; produzir gráfico antes do teste;
calcular medida de efeito e incerteza; discutir explicações alternativas;
registrar a ação, a pessoa responsável e o indicador de acompanhamento. Essa
sequência reduz a distância entre análise e gestão.
6.31 Avaliação de uma promoção de
preços
Uma rede reduz o preço de um item durante
duas semanas e observa aumento de unidades vendidas. A análise descritiva deve
separar efeito de preço, exposição, disponibilidade e calendário. Lojas
participantes podem ter sido escolhidas por maior potencial, criando viés de
seleção. Uma comparação antes/depois simples mistura tendência e sazonalidade.
O desenho preferível é selecionar lojas
comparáveis e, quando possível, randomizar a promoção. A métrica principal pode
ser margem total, não apenas volume. A distribuição por loja revela
heterogeneidade: algumas ganham volume suficiente, outras apenas reduzem
receita unitária. Intervalos para a diferença ajudam a evitar expansão com base
em oscilação casual.
A decisão final registra custo da promoção,
canibalização, efeito posterior e perfil de clientes. Se a campanha atrai
compras antecipadas, parte do ganho da semana pode ser perda nas semanas
seguintes. Estatística organiza a evidência, mas a janela de avaliação precisa
refletir o mecanismo comercial.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.32 Definição de meta de prazo
Uma operação deseja prometer entrega em até
cinco dias. A média histórica é 4,2, mas o percentil 90 é 8. A média não
sustenta a promessa para a maioria dos casos na cauda. A equipe constrói
distribuição por região e produto e identifica que a promessa única penaliza
rotas longas.
Uma política pode usar prazos segmentados e
medir cumprimento da promessa. O indicador central passa a ser proporção
entregue até a data comunicada, acompanhada de p90 do atraso. A estimativa
precisa excluir cancelamentos de forma consistente e tratar reentregas.
A decisão deve equilibrar competitividade e
confiabilidade. Reduzir o prazo anunciado pode aumentar conversão e também
descumprimento. Um experimento controlado em rotas selecionadas permite medir
efeito sobre venda e satisfação sem alterar toda a rede.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.33 Dimensionamento de equipe em
central de atendimento
Contagens de chamadas por intervalo são
resumidas por dia da semana e hora. A média de 30 chamadas por hora é
insuficiente quando o pico chega a 55. A variância maior que a média indica que
uma Poisson homogênea não representa bem o processo.
A equipe estima percentis da demanda e
descreve tempos de serviço. Chamadas repetidas do mesmo problema geram
dependência. Para a etapa inicial, dimensiona cobertura com cenários de
percentis e valida a taxa de abandono. Modelos de filas serão aprofundados
depois.
A decisão gerencial deve considerar pausas,
treinamento, qualidade e eventos especiais. Dimensionar apenas para o máximo é
caro; dimensionar para a média produz filas. O nível de serviço escolhido é uma
decisão, não uma constante estatística.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.34 Detecção de mudança em
reclamações
O número de reclamações subiu de 80 para
100, crescimento de 25%. No mesmo período, a base de pedidos cresceu de 8.000
para 12.000. A taxa caiu de 1,0% para 0,83%. Contagem e taxa contam histórias
diferentes.
O analista examina categorias e gravidade.
Reclamações graves podem crescer mesmo com taxa total menor. Atraso entre
ocorrência e registro também distorce séries recentes. Um gráfico por data do
evento e coorte de pedidos ajuda a alinhar denominador.
A decisão não deve comemorar apenas a
redução da taxa. É necessário verificar composição, canais de registro e
barreiras para reclamar. Menor número pode refletir dificuldade de acesso ao
atendimento.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.35 Comparação de filiais com
volumes diferentes
Filiais pequenas apresentam indicadores
mais extremos por variabilidade amostral. Um ranking de taxa de defeito pode
colocar uma loja com um defeito em dez vendas acima de outra com cinquenta em
mil, embora a evidência seja muito mais incerta na primeira.
Intervalos e gráficos de funil mostram
limites que se alargam em volumes menores. A gestão pode usar regra de volume
mínimo e combinar taxa, quantidade e tendência. Agrupar períodos aumenta
precisão, mas pode esconder mudança recente.
A decisão deve evitar exposição punitiva
baseada em ruído. Filiais fora dos limites merecem investigação, não condenação
automática. Casos dentro dos limites ainda podem ter oportunidades
operacionais.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.36 Análise de notas de avaliação
Notas de 1 a 5 são ordinais. A média é um
resumo prático, mas diferenças de 3 para 4 não precisam ter o mesmo significado
de 4 para 5. Distribuição completa, mediana e proporções em categorias
complementam o indicador.
Uma unidade pode ter média 4 com todas as
notas 4; outra, média 4 com metade 3 e metade 5. As experiências são
diferentes. O Net Promoter Score e outros índices transformam escalas, mas
também perdem informação e dependem de convenção.
A decisão deve relacionar notas a
comentários, jornada e taxa de resposta. Mudanças pequenas podem decorrer de
composição. Não é adequado calcular média de rótulos codificados sem explicar a
escala.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.37 Priorização de causas de
defeitos
Um diagrama de Pareto organiza categorias
por frequência e percentual acumulado. Ele ajuda a identificar poucas causas
responsáveis por grande parte dos registros. Entretanto, frequência não
equivale a impacto; uma causa rara pode ser grave.
A equipe cria duas análises: quantidade e
custo/risco. Categorias precisam ser mutuamente compreensíveis; “outros” muito
grande sinaliza classificação insuficiente. Mudanças no processo de registro
podem alterar a série.
A decisão combina Pareto com investigação
de processo. Resolver a categoria mais frequente não garante maior benefício se
o tratamento for caro ou o impacto unitário baixo. Estatística descritiva
organiza prioridades, enquanto análise gerencial escolhe ação.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.38 Teste de mensagem em
comunicação interna
Duas versões de uma mensagem são enviadas
aleatoriamente. A métrica é conclusão de uma tarefa, não apenas abertura. O
tamanho amostral é definido para detectar diferença mínima relevante antes do
envio.
A análise principal segue a alocação
original, mesmo se algumas pessoas não abrirem. Isso preserva comparabilidade.
Métricas secundárias, como cliques e tempo, são exploratórias. Interromper o
teste no primeiro resultado favorável aumenta falso positivo.
A decisão considera clareza e
acessibilidade. Uma versão pode elevar conclusão e aumentar dúvidas em
determinado grupo. Resultados desagregados precisam de tamanho e proteção de
identidade.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.39 Indicador de produtividade
Produção por pessoa pode subir porque a
demanda ficou mais simples ou porque atividades de qualidade foram reduzidas. O
numerador e o denominador não capturam automaticamente valor. Comparar equipes
exige ajustar horas, complexidade e retrabalho.
A distribuição individual pode revelar que
a média cresceu por poucos casos. Mediana e quartis ajudam. No entanto, usar
métricas individuais para pressão pode alterar comportamento e qualidade,
fenômeno conhecido como lei de Goodhart.
A decisão deve construir painel equilibrado
com volume, qualidade, prazo e bem-estar. Estatística ajuda a acompanhar, mas o
desenho do incentivo determina consequências.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.40 Avaliação de treinamento
Participantes podem melhorar notas após
treinamento por aprendizagem, familiaridade com a prova ou regressão à média.
Comparação pareada mede diferenças individuais, mas não elimina tendências
externas.
Quando viável, um grupo de espera oferece
comparação. O relatório apresenta média da diferença, distribuição e intervalo.
Resultados de satisfação não substituem aplicação no trabalho. Indicadores
posteriores precisam ser definidos.
A decisão deve considerar custo, impacto e
transferência. Um ganho estatístico pequeno pode ser relevante em atividade
crítica; um ganho grande em teste sem validade pode não justificar expansão.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.41 Monitoramento de orçamento
Erros de previsão são calculados como
realizado menos previsto. A média do erro mostra viés; o erro absoluto médio
mostra magnitude; percentuais tornam-se problemáticos quando valores previstos
são próximos de zero.
A equipe analisa distribuição por centro e
horizonte. Previsões mais distantes tendem a ser menos precisas. Revisões
sucessivas não devem apagar o orçamento original; versões são mantidas para
aprendizagem.
A decisão é ajustar premissas e cadência.
Penalizar todo erro pode incentivar folgas. O objetivo é melhorar informação,
não produzir números artificialmente fáceis de atingir.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.42 Pesquisa de acessibilidade
Uma avaliação de serviço precisa incluir
pessoas com deficiência e diferentes formas de acesso. Uma amostra digital sem
recursos acessíveis pode excluir justamente quem enfrenta barreiras. Quantidade
pequena em subgrupos aumenta incerteza, mas não torna suas experiências
dispensáveis.
O desenho pode sobreamostrar grupos e
aplicar pesos no total. Métodos qualitativos complementam medidas quando a
população é heterogênea. Resultados são divulgados com proteção e linguagem
respeitosa.
A decisão deve priorizar barreiras pela
gravidade e frequência, sem usar média global para ocultar exclusões. A
qualidade do serviço inclui possibilidade de participação.
Perguntas de validação: o indicador tem
denominador correto? A comparação usa grupos equivalentes? A diferença é
relevante além de estatisticamente detectável? Há pessoas ou situações
sistematicamente ausentes? A resposta deve acompanhar a recomendação.
6.43 Tutorial prático: organização
de uma base em planilha
Uma base bem organizada utiliza uma linha
por unidade de análise e uma coluna por variável. Cabeçalhos são únicos, sem
células mescladas. Datas são armazenadas como datas, valores como números e
categorias com grafia padronizada. Totais e subtotais não ficam no meio dos
microdados, pois podem ser contados como observações.
Crie uma aba “dicionário” com nome,
definição, tipo, unidade, valores permitidos, fonte e regra de ausência.
Mantenha a aba original protegida e faça transformações em cópia ou por
consultas reproduzíveis. Adicione identificador único e teste duplicidades.
Para pedidos, a chave pode ser pedido; para itens, pedido mais item. A
granularidade precisa corresponder à pergunta.
Use validação de dados para categorias e
destaque valores impossíveis. Funções como CONT.VALORES, CONTAR.VAZIO, MÍNIMO,
MÁXIMO e CONT.SES ajudam na auditoria. Tabelas dinâmicas resumem frequências e
médias, mas devem ser atualizadas e ter fonte verificada. Filtros ativos
precisam ser visíveis antes de copiar resultados.
Evite substituir valores originais
silenciosamente. Crie colunas derivadas, como atraso_calculado, e compare com o
campo do sistema. Registre divergências. Ao exportar, confira separador
decimal, codificação e zeros à esquerda em códigos.
6.44 Tutorial prático: estatística
descritiva em planilha
Para uma coluna numérica, calcule CONT.NÚM,
MÉDIA, MEDIANA, MODO, MÍNIMO, MÁXIMO, QUARTIL, VAR.S e DESVPAD.S. A função
escolhida deve corresponder a amostra ou população. Em bases administrativas
completas de um período, DESVPAD.P descreve aquele conjunto; para inferir um
processo, DESVPAD.S é usual.
Construa histograma com classes coerentes e
boxplot quando disponível. Compare o número de observações em cada cálculo,
pois funções podem ignorar vazios e textos de formas diferentes. Uma média
sobre 10.000 registros e uma mediana sobre 9.800 por falhas de conversão não
são diretamente consistentes.
Para médias por grupo, use tabela dinâmica
ou MÉDIASES, mas acompanhe contagem. Uma média baseada em três casos não deve
receber a mesma ênfase que outra baseada em mil. Adicione percentuais dentro do
grupo e não apenas sobre total geral.
Reproduza manualmente um pequeno
subconjunto. Essa verificação detecta problemas de intervalo, filtro e função.
Depois, transforme cálculos em tabela de resultados com unidade, período e
nota.
6.45 Tutorial prático:
probabilidade e distribuições
Planilhas possuem funções para binomial,
Poisson e normal. Antes de utilizá-las, escreva os parâmetros e a pergunta:
exatamente, até, pelo menos ou entre. Muitas funções possuem argumento
cumulativo. “Pelo menos um” é frequentemente calculado por 1 menos a
probabilidade de zero.
Para binomial, registre n e p e verifique
independência e constância. Para Poisson, alinhe λ ao intervalo. Para normal,
padronize mentalmente a ordem de grandeza e confirme se deseja cauda à esquerda
ou direita. Se a função retorna acumulada à esquerda e a pergunta é “maior
que”, use 1−resultado.
Uma tabela de cenários pode variar p ou λ e
mostrar sensibilidade. Em vez de confiar no primeiro número, simule alguns
ensaios com ALEATÓRIO e compare frequências. A simulação converge com
repetições, mas flutua; fixe semente apenas em ferramentas que permitem e
registre a versão.
6.46 Tutorial prático: intervalos
e tamanho amostral
Monte células separadas para estimativa, n,
nível, valor crítico, erro-padrão e margem. Essa decomposição facilita
auditoria. Para proporção, use p̂(1−p̂); para planejamento conservador, p=0,5.
Não arredonde n para baixo.
Para média com amostra pequena, utilize
valor t e graus de liberdade. Verifique se dados são aproximadamente adequados
e se não há agrupamento. Em pesquisa estratificada, uma fórmula simples de
amostra aleatória não representa toda a variância.
Crie cenário de margem por n. Como a margem
cai com 1/√n, dobrar amostra não reduz pela metade. Para reduzir a margem pela
metade, aproximadamente quadruplica-se n. Esse gráfico ajuda a negociar custo e
precisão.
6.47 Tutorial prático: gráficos
gerenciais
Comece pela mensagem, não pelo tipo de
gráfico. Para ranking de categorias, barras horizontais facilitam rótulos. Para
tempo, linhas preservam ordem. Para distribuição, histograma e boxplot. Para
relação, dispersão. Use uma cor principal e destaque apenas o ponto relevante;
excesso de cores cria competição.
Evite eixo secundário quando puder
normalizar ou separar gráficos. Duas escalas podem criar relação visual
arbitrária. Se for necessário, explique. Não use 3D. Em barras, mantenha zero;
em linhas, informe truncamento. Mostre denominadores em taxas e quantidade de
casos em grupos.
Acessibilidade exige contraste, tamanho
legível e não depender apenas de cor. Rótulos, padrões e texto alternativo
ajudam. Tabelas são preferíveis quando a pessoa precisa recuperar valores
exatos; gráficos são melhores para padrões.
6.48 Tutorial prático: nota
técnica e resumo executivo
A nota técnica contém objetivo, população,
período, fonte, amostragem, limpeza, definições, métodos, resultados detalhados
e limitações. O resumo executivo cabe em uma página: pergunta, três achados,
implicação, recomendação e risco. Os números precisam ser consistentes entre os
dois.
Uma frase robusta combina estimativa e
contexto: “A taxa estimada de satisfação foi 64% (IC95%: 60%–68%; n=500),
abaixo da meta de 70%; a não resposta de 42% pode limitar representatividade.”
Em seguida, informa ação. Evite “comprovado”, “sem dúvida” e causalidade não
sustentada.
Guarde anexos com dicionário, fórmulas e
código. Nomeie versões e data de extração. Uma decisão futura pode precisar
reproduzir o resultado ou entender por que mudou.
6.49 Roteiro de auditoria de uma
análise
·
recalcular totais e verificar
se frequências somam ao denominador;
·
comparar resultados com e sem
filtros e valores extremos;
·
confirmar unidades, datas e
granularidade;
·
testar amostra de registros
contra a fonte;
·
reproduzir cálculo principal
por método alternativo;
·
verificar se a conclusão
corresponde ao desenho;
·
procurar subgrupos omitidos e
riscos de privacidade;
·
registrar limitações e decisão
tomada.
Auditoria não é desconfiança pessoal; é
proteção institucional. Análises importantes podem ser revisadas por outra
pessoa antes da divulgação. A revisão deve se concentrar em lógica, dados e
reprodutibilidade, não apenas em formatação.
6.50 Erros profissionais
frequentes e correções
|
Erro |
Consequência |
Correção |
|
média sem
distribuição |
extremos e
heterogeneidade ocultos |
mostrar
mediana, quartis e gráfico |
|
percentual
sem denominador |
comparação
ambígua |
informar
contagem e base |
|
amostra
voluntária generalizada |
viés de
seleção |
limitar
conclusão ou redesenhar |
|
correlação
tratada como causa |
ação
equivocada |
explicações
alternativas e desenho |
|
p-valor
como probabilidade de H0 |
interpretação
falsa |
definir
valor-p corretamente |
|
muitos
testes sem transparência |
falsos
positivos |
pré-definir,
corrigir e validar |
|
arredondamento
precoce |
erro
acumulado |
arredondar
na apresentação |
|
software
como caixa-preta |
resultado
não auditável |
verificar
fórmulas e premissas |
|
remoção
automática de outliers |
apagamento
de eventos |
investigar
e documentar |
|
gráfico
truncado sem aviso |
exagero
visual |
escala
honesta e nota |
Ferramentas de trabalho
|
Ferramenta |
Uso introdutório |
Cuidados |
|
Planilha
eletrônica |
limpeza,
tabelas dinâmicas, gráficos, funções e simulação |
referências,
filtros ocultos, arredondamento e versão |
|
Software
estatístico |
distribuições,
intervalos, testes e relatórios |
entender
opções e premissas |
|
Python ou
R |
automação,
reprodutibilidade e bases maiores |
controle
de ambiente e revisão do código |
|
BI |
painéis e
acompanhamento |
definições,
atualização e governança |
|
Formulários |
coleta
estruturada |
validação,
acessibilidade e privacidade |
|
SQL |
extração e
agregação |
chaves,
duplicidades e granularidade |
Ferramentas não corrigem perguntas mal
formuladas. Uma função pode calcular desvio-padrão corretamente sobre a coluna
errada. Por isso, revisão de amostra, unidade, período e regras de negócio deve
preceder a automação. Resultados críticos merecem reprodução independente ou
teste com dados conhecidos.
7.
Exemplo Prático ou Estudo de Caso
Caso integrado: Rede Varejo
Horizonte
A Rede Varejo Horizonte opera lojas físicas
e canal digital. A direção percebeu aumento de reclamações sobre entrega e
queda na recompra, mas os relatórios agregados mostravam crescimento de
receita. Foi criado um projeto para responder três perguntas: qual é o
desempenho real dos prazos, quais fatores estão associados ao atraso e qual
tamanho de amostra é necessário para acompanhar satisfação com precisão.
7.1 Definição do problema
A unidade de análise principal é o pedido
entregue. A população do trimestre contém 24.000 pedidos. As variáveis são
canal, região, transportadora, valor, prazo prometido, prazo realizado, atraso,
avaria, avaliação e recompra em 60 dias. A equipe separa resultados descritivos
do trimestre e inferências sobre o processo futuro.
A base possui 24.000 linhas, mas 320
pedidos foram cancelados antes do envio e não pertencem à população de
entregas. Outros 180 têm data de entrega ausente por falha de integração. Os
cancelados são removidos com justificativa; os 180 permanecem sinalizados e são
descritos como ausência. A análise de prazo usa 23.500 entregas com data
válida.
7.2 Dicionário resumido
|
Variável |
Tipo |
Unidade ou categorias |
Regra |
|
dias_entrega |
quantitativa
discreta operacional |
dias
corridos |
data
entregue − data enviada |
|
atraso |
qualitativa
binária |
sim/não |
dias_entrega
> prazo prometido |
|
região |
qualitativa
nominal |
N, NE, CO,
SE, S |
endereço
de destino |
|
transportadora |
qualitativa
nominal |
A, B, C |
parceira
responsável |
|
avaliação |
ordinal |
1 a 5 |
resposta
após entrega |
|
valor_pedido |
quantitativa
contínua |
R$ |
valor
líquido |
|
recompra_60d |
qualitativa
binária |
sim/não |
nova
compra em até 60 dias |
7.3 Estatística descritiva dos
prazos
Para uma amostra ilustrativa de 12 pedidos,
os dias de entrega são: 2, 3, 3, 4, 4, 4, 5, 5, 6, 7, 9 e 18. A soma é 70 e a
média é 70/12 = 5,83 dias. A mediana é a média entre o sexto e o sétimo
valores: (4+5)/2 = 4,5 dias. A diferença mostra assimetria positiva provocada
pelo pedido de 18 dias.
O primeiro quartil é aproximadamente 3,25 e
o terceiro, 6,75, conforme o método de interpolação adotado. O IQR é 3,5. O
limite superior usual é 6,75 + 1,5×3,5 = 12. O prazo de 18 dias é um potencial
outlier e deve ser investigado. Ele correspondeu a endereço incorreto e
reexpedição; é legítimo e não deve ser apagado, mas pode ser analisado em
categoria de exceção.
Na base completa, a média foi 5,2 dias, a
mediana 4, p75 igual a 6 e p90 igual a 9. O relatório executivo comunica que
metade das entregas ocorre em até 4 dias, mas 10% ultrapassam 9 dias. Essa
informação é mais útil que apresentar apenas média.
7.4 Taxa de atraso e tabela
cruzada
Entre 23.500 entregas válidas, 3.525
atrasaram. A taxa é 3.525/23.500 = 15%. Por transportadora: A realizou 10.000
pedidos, com 1.200 atrasos (12%); B realizou 8.000, com 1.440 (18%); C realizou
5.500, com 885 (16,1%).
|
Transportadora |
Pedidos |
Atrasos |
Taxa |
|
A |
10.000 |
1.200 |
12,0% |
|
B |
8.000 |
1.440 |
18,0% |
|
C |
5.500 |
885 |
16,1% |
|
Total |
23.500 |
3.525 |
15,0% |
A transportadora B apresenta taxa maior,
mas atende proporcionalmente mais rotas longas. Ao estratificar por região,
parte da diferença diminui. A conclusão gerencial é que o ranking bruto não
basta; deve-se comparar dentro de faixas de distância e complexidade. A equipe
cria taxa padronizada e mantém análise operacional por rota.
7.5 Intervalo para a taxa de
atraso
Embora o trimestre completo seja população
descritiva do período, a direção deseja estimar a taxa do processo futuro.
Tratando os pedidos como realização de um processo estável, utiliza-se
aproximação para proporção: p̂=0,15 e n=23.500.
EP =
√[0,15×0,85/23.500] ≈ 0,00233
IC95%
≈ 0,15 ± 1,96×0,00233 = 0,15 ± 0,00457
A faixa aproximada é 14,54% a 15,46%, sob
independência e estabilidade. Como pedidos podem estar agrupados por rota, dia
e transportadora, essa conta pode subestimar incerteza. A equipe usa a faixa
como referência e acrescenta análise por clusters em etapa posterior.
7.6 Probabilidade condicional e
avaria
Dos 23.500 pedidos, 470 tiveram avaria.
Entre os 3.525 atrasados, 176 tiveram avaria. Assim,
P(avaria|atraso)=176/3.525≈5,0%. Entre os 19.975 não atrasados, 294 tiveram
avaria, taxa de 1,47%. A avaria é mais frequente entre atrasos, mas a
associação não prova que atraso cause avaria; rotas longas e múltiplos
manuseios podem afetar ambos.
A probabilidade de atraso dado avaria é
176/470≈37,4%. Observe a diferença de condicionais: 5% dos atrasados têm
avaria, enquanto 37,4% dos avariados atrasam. Denominadores diferentes
respondem a perguntas distintas.
7.7 Modelo binomial para auditoria
A operação quer estimar a chance de
encontrar pelo menos um atraso ao auditar 10 pedidos de uma rota cuja taxa
histórica é 15%, assumindo independência e p constante. É mais simples usar o
complemento:
P(X≥1)=1−P(X=0)=1−0,85¹⁰≈1−0,1969=0,8031
Há cerca de 80,3% de chance de observar
pelo menos um atraso. Se a rota possui dependência por lote ou dia, a binomial
pode ser otimista ou pessimista; a amostra deve distribuir pedidos no tempo.
7.8 Correlação entre prazo e
avaliação
Em uma amostra de respondentes, a
correlação de Pearson entre dias de entrega e avaliação é r=−0,42. O gráfico
mostra tendência negativa: prazos maiores associam-se a notas menores, com
grande dispersão. A correlação é moderada e não explica toda a satisfação.
Qualidade do produto, comunicação e expectativa também importam.
Amostra de avaliação possui viés de
resposta: apenas 28% responderam, e extremos podem estar super-representados. A
empresa não deve interpretar r como efeito causal exato. O resultado orienta
hipótese e melhoria, enquanto um experimento de comunicação e análises
ajustadas podem aprofundar.
7.9 Planejamento da pesquisa de
satisfação
A empresa deseja estimar a proporção de
clientes satisfeitos com margem de 4 pontos percentuais e 95% de confiança. Sem
estimativa prévia, usa p=0,5:
n₀ =
1,96²×0,25 / 0,04² ≈ 600,25 → 601 respostas
Com população de 24.000 pedidos, a correção
finita produz:
n =
601 / [1 + 600/24.000] ≈ 586,3 → 587 respostas
Se a taxa de resposta esperada é 30%,
precisam ser convidados cerca de 587/0,30≈1.957 clientes. A seleção será
estratificada por canal e região, com pesos se as frações diferirem. O
questionário terá versão acessível e contato alternativo para reduzir exclusão
digital.
7.10 Teste da meta de satisfação
Na pesquisa, 587 respostas válidas são
obtidas e 334 pessoas são classificadas como satisfeitas: p̂=334/587≈0,569. A
meta é 60%. Teste H0:p=0,60 contra H1:p<0,60.
z =
(0,569−0,60)/√[0,60×0,40/587] ≈ −1,53
O valor-p unilateral é aproximadamente
0,063. Ao nível de 5%, não há evidência suficiente para afirmar que a taxa é
menor que 60%, embora a estimativa esteja abaixo. O intervalo de confiança
aproximado para p está em torno de 52,9% a 60,9%, mostrando incerteza
relevante.
A decisão não deve depender do limiar
isolado. A direção reconhece que o resultado é compatível com desempenho abaixo
da meta e mantém plano de melhoria. O teste evita afirmar certeza excessiva,
mas não exige inação.
7.11 Relação entre atraso e
recompra
Entre pedidos sem atraso, 24% dos clientes
recompraram em 60 dias; entre atrasados, 17%. A diferença bruta é −7 pontos
percentuais. Entretanto, clientes de regiões com prazo maior também têm
frequência histórica diferente. A análise introdutória apresenta associação e
recomenda ajuste posterior por perfil, valor e região.
Em termos gerenciais, se a diferença fosse
causal e aplicável, reduzir atrasos poderia contribuir para retenção. Porém,
não se converte imediatamente 7 pontos em ganho financeiro. A equipe realiza
teste controlado de comunicação e melhora operacional por rotas, acompanhando
coortes.
7.12 Recomendação executiva
|
Achado |
Evidência |
Ação |
|
Cauda
longa de prazo |
mediana 4
dias e p90 9 dias |
monitorar
percentis e exceções |
|
Atraso
agregado de 15% |
3.525 em
23.500 |
meta por
rota e faixa de distância |
|
Transportadora
B com taxa bruta maior |
18% contra
12% e 16,1% |
comparação
padronizada e plano por rota |
|
Avaria
associada a atraso |
5,0%
versus 1,47% |
investigar
manuseio e múltiplas transferências |
|
Satisfação
estimada em 56,9% |
IC inclui
valores abaixo e perto de 60% |
melhorar
experiência e repetir pesquisa |
|
Recompra
menor entre atrasados |
17% versus
24% |
análise
ajustada e experimento |
O caso ilustra o fluxo completo: pergunta,
população, qualidade, descrição, probabilidade, amostragem, inferência e
decisão. Nenhum cálculo isolado resolve o problema. O valor surge da combinação
entre técnicas, conhecimento operacional e comunicação das limitações.
7.13 Aprofundamentos do estudo de
caso
Análise por coortes
A equipe percebe que pedidos de clientes
novos e recorrentes têm comportamentos diferentes. Em vez de misturar todos,
cria coortes pela primeira compra e acompanha recompra a partir de uma mesma
referência. Essa organização evita comparar clientes com tempos de exposição
diferentes. Uma pessoa que comprou há dez dias não teve a mesma oportunidade de
recompra que outra observada por sessenta dias.
Para cada coorte mensal, calcula-se
proporção de recompra em 30 e 60 dias, sempre fechando a janela. Coortes
recentes ficam marcadas como incompletas. O painel deixa de mostrar queda
artificial provocada por observação parcial. A recomendação é manter definição
estável e não substituir coortes por totais acumulados.
Intervalos por transportadora
As taxas brutas de atraso foram 12%, 18% e
16,1%, mas os volumes diferem. Para a transportadora A,
EP≈√(0,12×0,88/10.000)=0,00325; IC95% aproximado 11,36% a 12,64%. Para B,
EP≈0,00429; intervalo 17,16% a 18,84%. Para C, EP≈0,00496; intervalo 15,13% a
17,07%.
Os intervalos de A e B estão claramente
separados no agregado. B e C têm pequena sobreposição. Contudo, essa análise
ainda não ajusta rotas. A direção pode afirmar que B teve pior taxa bruta no
período, mas não que sua operação é intrinsecamente pior sem controlar o mix.
Comparação de médias e caudas
A média de prazo da transportadora A é 4,8
dias e a de C, 4,9. Parece empate. O p90 de A é 7 e o de C é 10. C possui cauda
mais longa, importante para promessa. A mesma média pode coexistir com
experiências extremas diferentes. O contrato passa a incluir percentil e
proporção no prazo, além da média.
A escolha da métrica altera incentivos. Se
apenas média for cobrada, atrasos extremos podem ser compensados por entregas
muito rápidas. Percentil 90 controla a cauda, mas pode ignorar os 10% piores.
Por isso, complementa-se com máximo operacional investigado e taxa de atrasos
graves.
Média de avaliação e composição de
respostas
A nota média foi 4,1 no canal digital e 3,9
no físico. Entretanto, taxa de resposta foi 20% e 45%. Se respondentes digitais
são mais extremos, a comparação pode refletir seleção. A equipe compara
distribuição de valor, região e atraso entre respondentes e população
disponível. Encontra maior participação de pedidos atrasados entre respondentes
digitais.
Pesos de ajuste por classes observadas
reduzem parte da diferença, mas não eliminam viés em fatores não observados. O
relatório apresenta resultado bruto e ajustado, evitando falsa precisão. Para o
próximo ciclo, a equipe testa lembretes e canais acessíveis para aumentar
resposta.
Simulação da média amostral
Para ensinar variabilidade, a equipe
sorteia mil amostras de 100 pedidos da base e calcula a média de prazo. As
médias formam distribuição mais concentrada que os prazos individuais. O desvio
das médias aproxima s/√100. Quando n sobe para 400, a dispersão cai
aproximadamente pela metade.
A simulação mostra que amostras diferentes
produzem respostas diferentes mesmo sem erro de cálculo. Também permite
verificar cobertura de intervalos: em repetição, aproximadamente 95% dos
intervalos construídos pelo procedimento contêm a média da base, quando as
condições são atendidas.
Efeito de agrupamento por dia
Pedidos do mesmo dia compartilham clima,
sistema e capacidade. Tratar todos como independentes pode subestimar erro. A
equipe calcula médias diárias e percebe dias de pico. Uma abordagem simples é
usar dia como unidade em parte das análises, reduzindo n de pedidos para n de
dias, mas preservando independência mais plausível.
Métodos de cluster serão aprofundados em
cursos posteriores. No relatório introdutório, a limitação é explicitada e as
tendências são verificadas em agregações diária e semanal. Conclusões que
aparecem apenas no nível individual são tratadas com cautela.
Análise de sensibilidade para
dados ausentes
Há 180 entregas sem data. No cenário
otimista, nenhuma atrasou; a taxa total seria 3.525/23.680≈14,89%. No
pessimista, todas atrasaram; seria 3.705/23.680≈15,65%. A conclusão de taxa
próxima de 15% permanece, mas a faixa de sensibilidade é maior que o erro-padrão
simples.
Esse exercício demonstra que incerteza de
qualidade pode superar incerteza amostral. Em vez de imputar um valor único, a
equipe mostra limites plausíveis e prioriza correção da integração. A próxima
análise registra percentual de completude como indicador de qualidade.
Custos de atraso
Atrasos não têm impacto uniforme. Pedidos
de alto valor ou clientes estratégicos podem gerar maior custo. A equipe
calcula custo médio por atraso incluindo compensação, reenvio, contato e margem
esperada de recompra. A distribuição é assimétrica, então apresenta média e
mediana.
Multiplicar taxa de atraso por custo médio
fornece estimativa inicial, mas correlação entre atraso e custo precisa ser
considerada. Pedidos mais complexos podem atrasar e custar mais. Uma análise
por segmento produz estimativa mais coerente. O objetivo é priorizar redução
onde o benefício esperado é maior sem abandonar equidade de serviço.
Definição de atraso grave
A equipe propõe “atraso grave” como mais de
três dias além do prometido. Antes de adotar, examina distribuição e impacto. A
definição não deve ser escolhida apenas para reduzir o indicador. Ela precisa
refletir experiência, contrato e risco.
São divulgadas taxa de qualquer atraso e de
atraso grave. Mudanças na promessa podem alterar os dois sem melhorar prazo
real; por isso, o painel também mostra dias realizados. Indicadores em conjunto
reduzem manipulação.
Teste A/B de comunicação
Clientes com risco de atraso são
randomizados para mensagem padrão ou mensagem proativa com nova previsão. A
métrica principal é avaliação após entrega; secundárias incluem contatos ao
suporte e cancelamento. O experimento não resolve o atraso, mas avalia
mitigação de experiência.
A análise compara grupos pela alocação. Se
2.000 clientes são divididos igualmente e satisfação é 55% contra 60%, a
diferença é 5 pontos. O intervalo para a diferença deve ser calculado. O custo
da mensagem é baixo, mas a empresa verifica se transparência não aumenta
cancelamentos. A decisão considera conjunto de efeitos.
Plano de amostragem contínua
Em vez de pesquisa anual, a empresa
seleciona amostra semanal estratificada. O tamanho semanal é menor, e
resultados são combinados em janelas móveis. Isso permite detectar mudanças,
mas cria dependência de respostas repetidas e múltiplas comparações.
A equipe define indicador mensal principal,
regras para alertas e volume mínimo por estrato. Sem essas regras, flutuações
semanais gerariam reação excessiva. O plano inclui auditoria trimestral de não
resposta e pesos.
Dashboard com incerteza
O painel mostra estimativa por ponto, faixa
e volume. Filiais pequenas não são ordenadas rigidamente; aparecem em gráfico
de funil. Cores são usadas apenas quando resultado excede limites e relevância.
O usuário pode abrir ficha técnica do indicador.
A data de atualização e quantidade de
ausências ficam visíveis. Resultados preliminares são identificados. Isso reduz
a tendência de copiar um número sem contexto. A governança define quem pode
alterar fórmula e quem aprova mudanças.
Matriz de riscos da análise
|
Risco |
Probabilidade |
Impacto |
Resposta |
|
não
resposta seletiva |
alta |
alta |
estratificar,
lembrar e comparar perfis |
|
datas
ausentes |
média |
média |
corrigir
integração e sensibilidade |
|
mudança de
promessa |
média |
alta |
versionar
definição e mostrar prazo real |
|
dependência
por rota |
alta |
média |
agregar e
usar métodos de cluster depois |
|
uso
punitivo do ranking |
média |
alta |
intervalos,
ajuste de mix e revisão humana |
|
exposição
de grupos pequenos |
baixa |
alta |
supressão
e controle de acesso |
Plano de implementação em 90 dias
Nos primeiros 30 dias, a empresa corrige
dicionário, chaves e ausências; define indicadores e responsáveis. Entre 31 e
60, implementa amostra estratificada, painel piloto e análise por rota. Entre
61 e 90, executa experimento de comunicação, revisa contratos e apresenta
resultados ao comitê.
Cada ação possui critério de conclusão.
“Melhorar dados” torna-se reduzir ausência de data para menos de 0,2%.
“Acompanhar atrasos” torna-se publicar taxa, p90 e atraso grave semanalmente.
“Rever transportadora” exige comparação padronizada e plano de causa.
Lições metodológicas do caso
O caso evidencia que população descritiva e
inferência futura são conceitos diferentes. Também mostra que grande volume não
elimina viés, que condicionais dependem do denominador, que média pode ocultar
cauda e que significância não substitui decisão. Qualidade de dados, desenho e
comunicação influenciam tanto quanto fórmulas.
Uma análise madura não termina com o
relatório. Ela cria processo de medição, ação e revisão. Se a definição muda, a
série precisa ser reconciliada. Se o contexto muda, o modelo é reavaliado. A
estatística torna a aprendizagem explícita.
7.14 Modelo de relatório executivo
do caso
Situação: a rede apresentou taxa de atraso de 15% no trimestre, com mediana
de entrega de 4 dias e p90 de 9 dias. A transportadora B teve taxa bruta de
18%, mas atende maior proporção de rotas longas. A pesquisa estimou satisfação
de 56,9%, com incerteza que inclui valores próximos e abaixo da meta de 60%.
Interpretação: a experiência central é razoável, porém a cauda de atrasos é
relevante e se associa a avarias e menor recompra. Rankings sem ajuste de mix
podem levar a decisões inadequadas. Ausência de datas e não resposta são
limitações materiais.
Recomendação: implantar metas segmentadas com taxa no prazo, p90 e atraso grave;
corrigir dados; comparar transportadoras por rota; testar comunicação proativa;
realizar pesquisa estratificada contínua. Revisar resultados em 90 dias.
Risco: conclusões causais ainda não estão estabelecidas. Ações devem ser
monitoradas por desenho comparável e indicadores de qualidade, custo e
experiência.
8. Questões para Estudo
Questão 1 — medidas descritivas
Os tempos de atendimento, em minutos, foram
6, 7, 7, 8, 8, 9, 10 e 25. Calcule média e mediana. Qual medida descreve melhor
o atendimento típico?
Gabarito comentado
A soma é 80 e n=8, então a média é 10. A
mediana é a média do quarto e quinto valores, ambos 8; portanto, mediana 8. O
valor 25 cria assimetria positiva e eleva a média. Para experiência típica,
mediana é mais representativa, mas a média é relevante para carga total. O
relatório deveria mostrar ambas e investigar o caso de 25 minutos.
Questão 2 — probabilidade
condicional
Em 1.000 transações, 20 são fraudes. Um
sistema alerta 18 fraudes e também 49 transações legítimas. Qual é a
probabilidade de fraude dado um alerta?
Gabarito comentado
Há 18 fraudes alertadas e 49 falsos
positivos, total de 67 alertas. Logo, P(fraude|alerta)=18/67≈26,9%. Apesar de
sensibilidade de 90% (18/20), a baixa taxa-base limita a precisão. O alerta
aumenta o risco de 2% para 26,9%, sendo útil para priorizar revisão, mas
inadequado para condenação automática.
Questão 3 — binomial
Uma campanha tem taxa de conversão de 30%.
Supondo dez contatos independentes com a mesma probabilidade, calcule a
probabilidade de exatamente quatro conversões.
Gabarito comentado
X~Binomial(n=10,p=0,30).
P(X=4)=C(10,4)0,3⁴0,7⁶. C(10,4)=210; 0,3⁴=0,0081; 0,7⁶≈0,117649. O produto é
aproximadamente 0,2001, ou 20,0%. As condições de independência e p constante
precisam ser plausíveis.
Questão 4 — intervalo para
proporção
Em uma amostra aleatória de 500 clientes,
320 recomendariam a empresa. Construa intervalo aproximado de 95% para a
proporção.
Gabarito comentado
p̂=320/500=0,64.
EP=√(0,64×0,36/500)=√0,0004608≈0,02147. Margem=1,96×0,02147≈0,0421. Intervalo
aproximado: 0,5979 a 0,6821, ou 59,8% a 68,2%. A interpretação depende de
seleção probabilística e ausência de viés relevante de não resposta.
Questão 5 — decisão e
significância
Uma unidade reduziu o tempo médio de 15
para 14,6 minutos. Com grande amostra, o valor-p foi 0,001, mas o custo da
intervenção foi alto e a meta operacional exige redução de pelo menos 2
minutos. Como interpretar?
Gabarito comentado
Há evidência estatística de diferença em
relação à referência, mas o efeito observado é 0,4 minuto, abaixo da relevância
operacional de 2 minutos. A decisão deve considerar intervalo do efeito, custo
e benefícios. Significância estatística não garante impacto gerencial
suficiente. A intervenção pode ser tecnicamente detectável e economicamente
inadequada.
9. Resumo e Glossário
Resumo da aprendizagem
Métodos Estatísticos I ensina a produzir e
interpretar evidências em ambientes com variabilidade. O processo começa pela
pergunta, população, unidade e qualidade dos dados. Variáveis são classificadas
para orientar tabelas, gráficos e medidas. Média, mediana, quartis e dispersão
descrevem distribuições; tabelas cruzadas e correlação descrevem associações.
Probabilidade organiza incerteza e distribuições modelam contagens, tempos e
medidas. Amostragem conecta população e observação; distribuição amostral, erro-padrão
e Teorema Central do Limite sustentam intervalos e testes introdutórios.
O aprendizado mais importante é
proporcionalidade da conclusão. Uma amostra não é população; associação não é
causalidade; p-valor não é probabilidade da hipótese; média não substitui
distribuição; tamanho grande não corrige viés. O trabalho profissional exige
método, contexto, transparência e acompanhamento.
Checklist para análise
·
qual decisão ou pergunta
precisa ser respondida?
·
qual é a população, unidade e
período?
·
como a amostra foi selecionada
e quem ficou de fora?
·
quais variáveis, unidades e
regras de cálculo?
·
há ausências, duplicidades,
mudanças de definição ou valores impossíveis?
·
qual gráfico permite ver
distribuição ou relação?
·
quais medidas de centro e
dispersão são adequadas?
·
as condições do modelo
probabilístico são plausíveis?
·
qual é a estimativa, o
intervalo e o tamanho do efeito?
·
quais explicações alternativas
e limitações?
·
qual ação será tomada e como
será acompanhada?
Glossário
|
Termo |
Definição |
|
População |
conjunto
completo sobre o qual se deseja aprender |
|
Amostra |
subconjunto
observado da população |
|
Parâmetro |
característica
numérica da população |
|
Estatística |
medida
calculada com dados amostrais |
|
Variável |
característica
que assume valores entre unidades |
|
Desvio-padrão |
medida de
dispersão na unidade original |
|
Percentil |
posição
abaixo da qual se encontra determinada proporção |
|
Correlação |
medida
padronizada de associação linear |
|
Probabilidade
condicional |
probabilidade
de um evento dado outro |
|
Distribuição |
regra que
descreve valores e probabilidades |
|
Erro-padrão |
desvio da
distribuição amostral de uma estatística |
|
Intervalo
de confiança |
procedimento
que produz faixa de valores compatíveis com o parâmetro |
|
Valor-p |
probabilidade
de resultado tão extremo sob a hipótese nula |
|
Viés |
erro
sistemático que desloca resultados |
|
Poder |
probabilidade
de detectar um efeito quando ele existe |
Mapa de fórmulas
Média:
x̄ = Σxᵢ/n
Variância
amostral: s² = Σ(xᵢ−x̄)²/(n−1)
Coeficiente
de variação: CV = 100s/x̄
Escore
z: z=(x−μ)/σ
Probabilidade
condicional: P(A|B)=P(A∩B)/P(B)
Bayes:
P(A|B)=P(B|A)P(A)/P(B)
Binomial:
P(X=x)=C(n,x)pˣ(1−p)ⁿ⁻ˣ
Poisson:
P(X=x)=e^(−λ)λˣ/x!
Erro-padrão
da média: EP=σ/√n
Erro-padrão
da proporção: EP=√[p(1−p)/n]
IC
da média: x̄±valor crítico×EP
IC
da proporção: p̂±valor crítico×EP
Tamanho
para proporção: n=z²p(1−p)/E²
10. Referências e Aprofundamento
Bibliografia básica
·
ANDERSON, David R.; SWEENEY,
Dennis J.; WILLIAMS, Thomas A. Estatística aplicada à Administração e Economia.
·
BUSSAB, Wilton de O.; MORETTIN,
Pedro A. Estatística Básica.
·
LEVINE, David M. et al.
Estatística: teoria e aplicações usando Microsoft Excel.
·
STEVENSON, William J.
Estatística aplicada à Administração.
·
TRIOLA, Mario F. Introdução à
Estatística.
·
LARSON, Ron; FARBER, Betsy.
Estatística Aplicada.
·
MONTGOMERY, Douglas C.; RUNGER,
George C. Estatística Aplicada e Probabilidade para Engenheiros.
·
SPIEGEL, Murray R.; STEPHENS,
Larry J. Estatística.
Leituras complementares
·
WHEELAN, Charles. Estatística:
o que é, para que serve, como funciona.
·
HUFF, Darrell. Como mentir com
estatística.
·
KAHNEMAN, Daniel. Rápido e
devagar: duas formas de pensar.
·
SILVER, Nate. O sinal e o
ruído.
·
NAKAGAWA, Shinichi; CUTHILL,
Innes C. textos sobre tamanho de efeito e interpretação.
Tópicos para estudos futuros
·
testes para duas médias e duas
proporções;
·
qui-quadrado para associação e
aderência;
·
análise de variância;
·
regressão linear e múltipla;
·
métodos não paramétricos;
·
controle estatístico de
processos;
·
séries temporais e previsão;
·
reamostragem e bootstrap;
·
desenho de experimentos e
testes A/B;
·
amostragem complexa e
ponderação;
·
estatística bayesiana;
·
visualização e comunicação de
incerteza.
Plano de aprofundamento em oito
semanas
|
Semana |
Foco |
Atividade |
|
1 |
dados e
variáveis |
construir
dicionário e auditar uma base |
|
2 |
descrição |
criar
tabela, histograma e boxplot |
|
3 |
medidas |
comparar
média, mediana, quartis e dispersão |
|
4 |
probabilidade |
resolver
árvores, condicionais e Bayes |
|
5 |
distribuições |
modelar
binomial, Poisson e normal |
|
6 |
amostragem |
desenhar
pesquisa e calcular tamanho |
|
7 |
inferência |
construir
intervalos e testes introdutórios |
|
8 |
integração |
entregar
relatório executivo com limitações |
Como continuar aprendendo
A melhor sequência combina teoria, cálculo,
software e comunicação. Para cada tema, resolva um exemplo pequeno à mão,
reproduza em planilha, altere parâmetros e explique em palavras. A simulação é
especialmente útil para probabilidade, distribuição amostral e intervalos.
Gerar muitas amostras permite observar fenômenos que uma fórmula pode parecer
esconder.
Bases reais devem ser usadas com
responsabilidade. Comece com dados públicos ou sintéticos quando houver risco
de exposição. Documente limpeza e mantenha versões. Ao publicar, preserve
definições e não apresente números sem denominador, período e fonte.
O aprofundamento deve manter a pergunta
gerencial. Técnicas mais complexas não são automaticamente melhores. Um
intervalo simples e bem explicado pode apoiar decisão melhor que um modelo
avançado sem validação. A maturidade estatística aparece na escolha adequada,
na humildade diante da incerteza e na capacidade de revisar conclusões quando
novos dados surgem.
Orientação final para uso
acadêmico e profissional
Ao estudar este guia, a pessoa estudante
deve repetir os cálculos com bases pequenas, comparar funções de planilha e
escrever a interpretação antes de consultar o resultado pronto. Em trabalhos
acadêmicos, cada tabela precisa indicar fonte, período, unidade e procedimento.
Em situações profissionais, a recomendação deve separar fato observado,
inferência, hipótese explicativa e decisão. Essa disciplina de comunicação
reduz equívocos e facilita a revisão por colegas, professoras(es), gestoras(es)
e demais pessoas interessadas. Sempre que uma conclusão mudar após novo dado, a
atualização deve ser registrada como aprendizagem, e não tratada como falha do
método.
Encerramento
Métodos Estatísticos I oferece uma base
para estudar organizações sem confundir dados com realidade completa. Dados são
registros produzidos por processos, escolhas e limitações. A estatística ajuda
a resumir e aprender, mas exige julgamento. Ao dominar os fundamentos, a pessoa
estudante passa a fazer perguntas melhores, detectar exageros, comunicar
incerteza e construir decisões mais transparentes.
Nenhum comentário:
Postar um comentário