ADMGUIA
MÉTODOS
ESTATÍSTICOS II
Guia completo para estudantes de Administração
━━━━━━━━━━━━━━━━━━━━━━━━━━━━
Testes •
ANOVA • Regressão • Séries Temporais • Controle Estatístico
Portal Admguia | Atualização: julho de 2026
Sumário
2. Por que ela faz parte do curso
Experimentação e aprendizagem organizacional
Controle e melhoria de processos
Leitura crítica de pesquisas e modelos
Articulação entre evidência e julgamento
Empregabilidade e atuação profissional
Formação para a responsabilidade
3.1 Fluxo completo da inferência estatística
3.2 Distribuições amostrais e erro-padrão
3.3 Estimadores, viés, precisão e consistência
3.4 Intervalos de confiança para uma média
3.5 Intervalos para proporções e diferenças
3.6 Lógica dos testes de hipótese
3.8 Comparação de duas médias independentes
3.9 Amostras pareadas e medidas repetidas
3.10 Comparação de duas proporções
3.11 Testes para variâncias e dispersão
3.12 Qui-quadrado de independência e aderência
3.14 Comparações múltiplas e tamanhos de efeito
3.15 ANOVA de dois fatores e interação
3.17 Correlação de Pearson, Spearman e correlação
parcial
3.19 Regressão linear múltipla
3.22 Variáveis indicadoras e interações em regressão
3.23 Introdução à regressão logística
3.24 Componentes de séries temporais
3.25 Médias móveis e suavização exponencial
3.27 Números-índice e deflacionamento
3.28 Controle estatístico de processos
3.29 Desenho de experimentos e testes A/B
3.30 Poder, tamanho amostral e diferença mínima
relevante
3.31 Dados ausentes, valores extremos e transformações
3.32 Multiplicidade, seleção de modelos e
reprodutibilidade
4. Principais Temas e Organização
Módulo 1 — Retomada dos fundamentos
Módulo 2 — Comparações entre duas populações
Módulo 3 — Tabelas de contingência
Módulo 4 — ANOVA e comparações múltiplas
Módulo 5 — Métodos não paramétricos
Módulo 6 — Regressão e diagnóstico
Módulo 7 — Séries temporais e previsão
Módulo 8 — Controle, experimentação e governança
5. Relação com outras matérias
Pesquisa Operacional e Métodos Determinísticos
Matemática Financeira e Finanças
Marketing e Pesquisa de Mercado
Operações, Logística e Qualidade
Sistemas de Informação e Ciência de Dados
6. Aplicações Práticas e Profissionais
6.1 Comparação de fornecedores
6.13 Avaliação de política pública
Roteiro de análise profissional
Modelo de comunicação executiva
Caderno de aprofundamento e atividades resolvidas
6.21 Estudo resolvido — Meta de tempo médio
6.22 Estudo resolvido — Processos com variâncias
diferentes
6.23 Estudo resolvido — Produtividade antes e depois
6.24 Estudo resolvido — Taxa de renovação
6.25 Estudo resolvido — Associação entre região e
reclamação
6.26 Estudo resolvido — ANOVA e pós-teste
6.27 Estudo resolvido — Interação entre canal e faixa
etária
6.28 Estudo resolvido — Mann-Whitney em escala ordinal
6.29 Estudo resolvido — Wilcoxon com poucos pares
6.30 Estudo resolvido — Kruskal-Wallis entre canais
6.31 Estudo resolvido — Correlação enganosa pelo tempo
6.32 Estudo resolvido — Regressão simples e intervalo de
previsão
6.33 Estudo resolvido — Regressão múltipla de custos
6.34 Estudo resolvido — Indicadores e interação em
regressão
6.35 Estudo resolvido — Odds ratio e probabilidade
6.36 Estudo resolvido — Média móvel e tendência
6.37 Estudo resolvido — Suavização exponencial e escolha
de alfa
6.38 Estudo resolvido — Métricas de erro
6.39 Estudo resolvido — Gráfico p com tamanho variável
6.40 Estudo resolvido — Gráficos X̄ e R
6.41 Estudo resolvido — Planejamento de teste A/B
6.42 Estudo resolvido — Dados ausentes em pesquisa
6.43 Estudo resolvido — Multiplicidade em painel de
indicadores
6.44 Estudo resolvido — Auditoria de modelo de
rotatividade
Laboratório de ferramentas: planilha, R, Python e
interfaces gráficas
Fluxo mínimo em qualquer ferramenta
Exemplo de organização em planilha
Oficina de leitura crítica de resultados
Miniestudos setoriais adicionais
Hospital e tempo de permanência
Município e atendimento digital
Aprofundamentos para interpretação e governança
Equivalência e não inferioridade
Bootstrap como ferramenta de incerteza
Intervalo da média prevista e intervalo de previsão
Tamanhos de efeito padronizados e não padronizados
ANCOVA e ajuste por medida inicial
Medidas repetidas e estrutura de dependência
Erros-padrão robustos e agrupados
Validação cruzada e separação treino-teste
Calibração, discriminação e limiares
Decomposição sazonal e intervenção
Análise de capacidade do processo
Pesos amostrais e efeito de desenho
Princípios de análise reproduzível
Ética da inferência e distribuição dos efeitos
Quadro de premissas e respostas possíveis
Atividade integradora de revisão por pares
Oficina adicional de interpretação de saídas
6.45 Saída de teste t com amostra enorme
6.46 Saída de ANOVA não significativa
6.47 Saída de regressão com R² baixo
6.48 Saída de regressão com R² muito alto
6.49 Coeficiente com sinal inesperado
6.50 Valor-p diferente entre softwares
6.51 Intervalo amplo em regressão logística
6.52 Previsão com bom erro médio e viés
6.53 Gráfico de controle com muitos ajustes
6.54 Teste A/B com métrica secundária favorável
Exercício de construção de um parecer estatístico
Projeto aplicado: do problema ao monitoramento
Etapa 1 — Enquadrar a pergunta
Etapa 2 — Mapear o processo de geração dos dados
Etapa 3 — Criar plano de análise
Etapa 4 — Explorar sem antecipar conclusões
Etapa 5 — Executar, diagnosticar e validar
Etapa 6 — Converter evidência em decisão
Etapa 7 — Comunicar para dois públicos
Etapa 8 — Monitorar e aprender
Critérios de avaliação do projeto
Matemática de apoio para acompanhar os métodos
7. Exemplo Prático ou Estudo de Caso
Caso integrado: Rede Conecta Serviços
Etapa 1 — Comparação pareada nas unidades do protocolo
Etapa 2 — Comparação das mudanças
Etapa 4 — Satisfação entre regiões
Etapa 6 — Previsão de contatos
Etapa 7 — Controle da taxa de recontato
Questão 1 — Duas médias independentes
Questão 5 — Previsão e controle
10. Referências e Aprofundamento
Bibliografia para regressão, experimentação e previsão
Fontes e documentação de ferramentas
Plano de aprofundamento em oito semanas
Checklist final para trabalhos
1. Apresentação da Disciplina
Métodos Estatísticos II aprofunda a análise
de dados iniciada em Métodos Estatísticos I e desloca o foco da descrição para
a comparação, explicação, previsão e avaliação de decisões. A disciplina
trabalha com situações em que a Administração precisa verificar se grupos
diferem, estimar o efeito de uma intervenção, compreender a relação entre
várias variáveis, projetar resultados futuros e acompanhar processos ao longo
do tempo. Em todos esses casos, o desafio não é apenas executar uma fórmula: é
escolher um método compatível com a pergunta, as variáveis, o desenho da coleta
e as limitações da base.
A definição central da disciplina pode ser
apresentada da seguinte forma: Métodos
Estatísticos II reúne técnicas inferenciais e modelagens que permitem comparar
grupos, estimar relações, testar hipóteses, construir previsões e monitorar
processos, sempre quantificando a incerteza das conclusões. O termo
inferência indica que os dados observados são usados para aprender sobre uma
população, um processo ou um mecanismo que não foi integralmente observado. O
resultado nunca deve ser tratado como certeza absoluta; ele é uma conclusão
condicionada ao modelo, à amostra e às premissas adotadas.
O volume II pressupõe familiaridade com
variáveis, tabelas, gráficos, medidas de posição e dispersão, probabilidade,
distribuições amostrais, intervalos de confiança e lógica básica dos testes de
hipótese. Esses fundamentos serão retomados apenas quando necessários para
compreender uma técnica mais avançada. O novo percurso inclui comparações entre
duas ou mais populações, análise de variância, testes de independência, métodos
não paramétricos, correlação avançada, regressão linear simples e múltipla, introdução
à regressão logística, séries temporais, experimentação, controle estatístico e
boas práticas de análise reproduzível.
Para estudantes de Administração, a
disciplina funciona como uma oficina de investigação gerencial. Um resultado
estatístico precisa ser convertido em decisão: a diferença entre duas campanhas
é suficientemente grande para mudar o orçamento? A queda do tempo de
atendimento ocorreu por efeito de um novo processo ou por variação aleatória?
Quais fatores explicam a rotatividade? Uma previsão de vendas é confiável para
dimensionar estoque? Um indicador está fora de controle? O curso ensina a
responder essas perguntas com cálculos, diagnósticos e comunicação responsável.
O guia adota uma abordagem aplicada. Cada
técnica será apresentada com a pergunta que resolve, as condições de uso, a
fórmula central, um exemplo numérico, a interpretação e os erros mais comuns.
Esse formato evita dois extremos: tratar estatística como conjunto abstrato de
símbolos ou como sequência de comandos de software sem compreensão. A pessoa
estudante deve ser capaz de explicar o raciocínio mesmo quando a conta é
executada por planilha, calculadora ou programa estatístico.
Competências esperadas
·
formular hipóteses estatísticas
a partir de problemas gerenciais claramente definidos;
·
selecionar testes para médias,
proporções, variâncias, frequências e dados pareados;
·
interpretar valor-p, intervalo
de confiança, tamanho do efeito e poder estatístico de forma integrada;
·
aplicar ANOVA e procedimentos
de comparação múltipla sem confundir significância com relevância;
·
construir e interpretar modelos
de regressão simples e múltipla;
·
avaliar resíduos,
multicolinearidade, observações influentes e limites de extrapolação;
·
usar métodos não paramétricos
quando as escalas ou premissas dos testes paramétricos não forem adequadas;
·
decompor séries temporais,
produzir previsões e avaliar erros;
·
planejar experimentos e testes
A/B com métricas, amostra e critérios de decisão definidos previamente;
·
monitorar processos com
gráficos de controle e distinguir sinal especial de oscilação comum;
·
documentar análises de modo
auditável, reproduzível, ético e compreensível para diferentes públicos.
Como estudar a disciplina
O estudo é mais produtivo quando segue
quatro camadas. Primeiro, identifique a pergunta e o tipo de variável. Segundo,
desenhe a estrutura dos dados e verifique como as observações foram produzidas.
Terceiro, execute o método e confira suas premissas. Quarto, traduza o
resultado para a decisão, incluindo magnitude, incerteza, riscos e próximos
passos. Memorizar nomes de testes sem dominar essas camadas produz análises
frágeis. O melhor sinal de aprendizagem é conseguir justificar por que um
método foi escolhido e o que ele não permite afirmar.
Ao longo do guia, valores numéricos são
arredondados para facilitar a leitura. Em aplicações profissionais, os cálculos
devem ser feitos com maior precisão e o arredondamento deve ocorrer apenas na
apresentação. Também se recomenda conservar a base original, registrar
transformações, nomear versões dos arquivos e separar exploração de
confirmação. A disciplina ensina técnicas, mas também forma hábitos de trabalho
que reduzem erros e tornam as conclusões verificáveis.
2.
Por que ela faz parte do curso
Da observação à explicação
Métodos Estatísticos I permite descrever o
que ocorreu; o volume II ajuda a investigar por que ocorreu, se a diferença é
consistente e quanto pode ser esperado no futuro. A Administração depende dessa
passagem. Uma média de satisfação menor em determinada unidade é apenas um
ponto de partida. É necessário avaliar tamanho da amostra, variabilidade,
perfil das pessoas respondentes, diferença entre grupos e fatores associados. A
inferência organiza esse caminho e reduz a chance de transformar uma oscilação
casual em diagnóstico definitivo.
Decisões comparativas
Grande parte das escolhas gerenciais
envolve alternativas: fornecedor A ou B, processo antigo ou novo, campanha de
controle ou experimental, unidade presencial ou remota, turno diurno ou
noturno. Testes para duas amostras, dados pareados e proporções oferecem
estruturas para comparar alternativas. A análise correta evita decidir pela
maior média observada sem considerar dispersão e incerteza. Também obriga a
definir previamente qual diferença seria material para o negócio, pois uma
diferença estatisticamente detectável pode ser pequena demais para justificar
custo, risco ou mudança operacional.
Gestão de múltiplos grupos
Organizações raramente possuem apenas duas
unidades ou dois segmentos. Redes com várias lojas, equipes, regiões, produtos
ou níveis de serviço precisam comparar mais de dois grupos. A análise de
variância permite testar uma hipótese global sem executar uma quantidade
desordenada de testes isolados. Quando há diferença, procedimentos pós-teste
ajudam a identificar onde ela se concentra. Essa lógica é relevante para
remuneração, qualidade, produtividade, satisfação, desempenho de fornecedores e
avaliação de programas.
Explicação multivariada
Resultados organizacionais costumam
depender de vários fatores simultaneamente. Vendas podem variar com preço,
investimento em comunicação, sazonalidade, localização e disponibilidade.
Rotatividade pode estar associada a remuneração, tempo de casa, liderança,
distância e jornada. A regressão múltipla permite estimar a associação de uma
variável mantendo outras constantes no modelo. Embora não crie causalidade por
si só, ela oferece uma estrutura mais realista que comparações bivariadas e
ajuda a identificar confundimento, interações e heterogeneidade.
Previsão e planejamento
Orçamento, compras, estoque, capacidade e
escala de pessoal dependem de previsões. Séries temporais ajudam a separar
tendência, sazonalidade, ciclos e ruído. Métodos como médias móveis, suavização
exponencial e regressão temporal produzem projeções e podem ser comparados por
medidas de erro. A disciplina ensina que previsão não é adivinhação: é um
procedimento documentado, avaliado fora da amostra e acompanhado por intervalos
e cenários. Um modelo simples bem monitorado pode ser mais útil que uma solução
complexa sem governança.
Experimentação e aprendizagem
organizacional
Testes A/B, pilotos e experimentos
controlados permitem aprender antes de ampliar uma intervenção. Em marketing,
pode-se comparar mensagens; em operações, novos roteiros; em gestão de pessoas,
formatos de treinamento; em serviços públicos, lembretes e simplificações.
Métodos Estatísticos II mostra como definir unidade de randomização, métrica
principal, tamanho de amostra, duração, hipótese e regra de decisão. Também
alerta para contaminação, abandono, análise precoce e seleção oportunista de
resultados.
Controle e melhoria de processos
Indicadores variam mesmo quando o processo
não sofreu mudança relevante. Gráficos de controle ajudam a distinguir causas
comuns, inerentes ao sistema, de causas especiais, associadas a eventos
específicos. Essa distinção modifica a resposta gerencial. Reagir a toda
oscilação pode aumentar a variabilidade; ignorar sinais especiais pode
prolongar falhas. O pensamento estatístico de processos é útil em indústria,
serviços, saúde, logística, atendimento, tecnologia e administração pública.
Leitura crítica de pesquisas e
modelos
Gestoras(es) recebem relatórios com
regressões, valores-p, rankings, previsões e segmentações. A formação precisa
permitir perguntas como: a amostra representa a população? O modelo inclui
variáveis relevantes? Os resíduos indicam problemas? Houve validação? O
resultado foi ajustado para múltiplas comparações? A diferença é material? O
algoritmo afeta grupos de maneira desigual? Sem essas perguntas, a organização
pode aceitar uma conclusão apenas porque ela parece tecnicamente sofisticada.
Articulação entre evidência e
julgamento
Nenhum método elimina o julgamento. É
necessário escolher variáveis, horizonte, nível de confiança, custo de erros e
critérios de decisão. A estatística torna o julgamento mais explícito e
disciplinado. Em vez de esconder preferências, a análise registra premissas,
mostra sensibilidades e permite revisão. A boa decisão integra evidência
quantitativa, conhecimento operacional, aspectos jurídicos, impacto social e
viabilidade de implementação.
Empregabilidade e atuação
profissional
|
Campo de atuação |
Contribuição de Métodos Estatísticos II |
|
Controladoria
e finanças |
modelos de
desempenho, previsão, cenários e testes de desvios |
|
Marketing
e produto |
experimentos,
conversão, retenção, regressão e segmentação |
|
Operações
e logística |
controle
de processos, previsão, comparação de fornecedores e capacidade |
|
Gestão de
pessoas |
pesquisas,
rotatividade, absenteísmo, equidade e avaliação de programas |
|
Saúde e
serviços |
qualidade,
tempos, eventos, filas, risco e resultados de intervenções |
|
Setor
público |
avaliação
de políticas, indicadores, desigualdades e monitoramento |
|
Consultoria
e auditoria |
diagnóstico,
amostragem, validação de evidências e comunicação executiva |
|
Ciência de
dados |
fundamentos
de modelagem, validação, interpretação e governança |
Formação para a responsabilidade
Modelos estatísticos podem influenciar
crédito, contratação, atendimento, benefícios e prioridades. Por isso, o curso
não deve limitar-se à precisão média. É necessário observar privacidade,
consentimento, representatividade, vieses, explicabilidade e impactos
distribuídos. Uma regressão pode funcionar no conjunto total e falhar para um
grupo pequeno. Um experimento pode elevar conversão e piorar a experiência de
pessoas vulneráveis. A formação administrativa precisa combinar capacidade
analítica e compromisso com decisões justificáveis.
3.
Conceitos Fundamentais
3.1 Fluxo completo da inferência
estatística
Uma análise inferencial começa antes do
teste. O ponto inicial é uma pergunta substantiva, como verificar se um
treinamento reduziu o tempo médio de atendimento ou se duas campanhas
apresentam taxas de conversão diferentes. Em seguida, definem-se população,
unidade de análise, variável de resposta, grupos, período e diferença mínima
relevante.
O fluxo recomendado possui oito etapas:
formular a questão; declarar hipóteses; verificar desenho e independência;
explorar dados; escolher método; calcular estimativa, incerteza e teste;
avaliar premissas; comunicar decisão e limitações. Essa ordem impede que o
método seja escolhido apenas porque está disponível no software. Em pesquisas
confirmatórias, plano e métrica principal devem ser registrados antes de
observar o resultado.
Considere uma empresa que compara o prazo
de entrega de dois centros. A pergunta não é apenas qual média foi menor. É
necessário saber se pedidos são comparáveis, se clientes aparecem
repetidamente, se houve sazonalidade, se a medida possui valores extremos e
qual redução justificaria mudar a operação.
A conclusão deve apresentar estimativa da
diferença, intervalo de confiança, valor-p quando pertinente e efeito sobre a
decisão. “Houve diferença significativa” é incompleto. Uma redação melhor
informa que o centro B apresentou redução média estimada de determinado número
de horas, com faixa de incerteza e ressalvas sobre o período analisado.
Um erro frequente é formular hipóteses
depois de observar gráficos e escolher apenas a comparação que produz resultado
favorável. Exploração é legítima, mas deve ser identificada como exploratória e
confirmada em nova base quando a decisão for importante.
3.2 Distribuições amostrais e
erro-padrão
A distribuição amostral descreve como uma
estatística varia entre amostras hipotéticas retiradas da mesma população. Ela
fundamenta intervalos e testes. A média observada é um valor; a distribuição
amostral mostra quanto esse valor poderia mudar apenas porque outras unidades
foram selecionadas.
O erro-padrão mede a variabilidade da
estatística. Para uma média com desvio-padrão populacional conhecido, EP =
σ/√n; na prática, usa-se s/√n. Para uma proporção, EP = √[p(1-p)/n]. O aumento
da amostra reduz o erro-padrão pela raiz quadrada: quadruplicar n reduz
aproximadamente o erro pela metade.
Uma amostra de 100 pedidos tem tempo médio
de 42 minutos e desvio-padrão de 15. O erro-padrão é 15/√100 = 1,5 minuto. Isso
não significa que os pedidos variam apenas 1,5 minuto; esse é o grau de
oscilação esperado da média entre amostras equivalentes.
A distinção entre desvio-padrão e
erro-padrão é decisiva. O primeiro descreve heterogeneidade entre observações;
o segundo, incerteza de uma estimativa. Relatórios devem nomear claramente cada
medida e evitar barras de erro sem legenda.
A fórmula clássica pressupõe observações
independentes. Amostras por conglomerados, medições repetidas ou séries
temporais exigem ajustes. Tratar registros correlacionados como independentes
costuma produzir erros-padrão artificialmente pequenos.
EP
da média = s / √n
EP
da proporção = √[p(1 − p) / n]
3.3 Estimadores, viés, precisão e
consistência
Um estimador é uma regra usada para
calcular uma aproximação de um parâmetro. A média amostral estima a média
populacional; a proporção amostral estima a proporção populacional. Estimadores
são avaliados por propriedades como ausência de viés, variância, erro
quadrático médio e consistência.
Um estimador não viesado acerta o parâmetro
em média ao longo de repetições. Precisão refere-se à pequena variabilidade.
Pode existir estimador pouco viesado e muito impreciso, ou ligeiramente viesado
e mais estável. O erro quadrático médio combina viés e variância e ajuda a
comparar alternativas.
Suponha que uma pesquisa de satisfação seja
enviada apenas por aplicativo. Mesmo com 20 mil respostas, pessoas que usam
outros canais ficam excluídas. A estimativa pode ser muito precisa em termos
matemáticos e ainda viesada em relação à população-alvo. Aumentar n não corrige
falha de cobertura.
Em Administração, a qualidade da estimativa
depende tanto do desenho quanto da fórmula. Uma amostra menor e probabilística
pode oferecer inferência mais defensável que milhões de registros de
conveniência. A precisão numérica nunca deve ser confundida com validade.
Também é necessário distinguir erro
amostral de erros não amostrais, como não resposta, medição, duplicação,
classificação incorreta e processamento. Intervalos de confiança tradicionais
refletem principalmente o primeiro.
3.4 Intervalos de confiança para
uma média
O intervalo de confiança combina estimativa
pontual e margem de erro. Quando a variância populacional é desconhecida,
usa-se a distribuição t de Student, especialmente em amostras pequenas. A forma
geral é média ± valor crítico × erro-padrão.
Para n observações independentes, IC = x̄ ±
tα/2,n−1 × s/√n. O nível de 95% descreve o desempenho do procedimento em
repetições: se muitas amostras fossem coletadas e intervalos construídos da
mesma forma, aproximadamente 95% conteriam o parâmetro.
Uma amostra de 25 atendimentos apresenta
média de 48 minutos e desvio-padrão de 10. Com 24 graus de liberdade, t crítico
de 95% é aproximadamente 2,064. O erro-padrão é 2 e o intervalo é 48 ± 4,128,
ou de 43,87 a 52,13 minutos.
O intervalo mostra uma faixa de médias
populacionais compatíveis com os dados e o modelo. Sua amplitude informa
precisão e pode ser comparada à tolerância gerencial. Se a meta é 45 minutos, o
intervalo atravessa a meta e a evidência não sustenta uma conclusão simples de
cumprimento.
Não se deve afirmar que há 95% de
probabilidade de o parâmetro fixo estar dentro do intervalo já calculado na
interpretação frequentista. Em comunicação não técnica, pode-se dizer que o
método produz uma faixa de valores plausíveis, evitando excesso de formalismo
sem transformar a frase em certeza probabilística incorreta.
IC
da média = x̄ ± t crítico × (s / √n)
3.5 Intervalos para proporções e
diferenças
Proporções aparecem em conversão,
inadimplência, aprovação, defeitos e retenção. O intervalo aproximado normal
usa p̂ ± z√[p̂(1-p̂)/n], mas pode funcionar mal quando n é pequeno ou a
proporção é muito próxima de zero ou um. Métodos como Wilson são preferíveis
nesses casos.
Para comparar duas proporções
independentes, calcula-se a diferença p̂1 − p̂2 e seu erro-padrão não combinado
para o intervalo. A faixa indica tanto direção quanto magnitude plausível.
Razão de riscos e odds ratio são alternativas úteis, desde que explicadas
corretamente.
Em uma campanha, 121 de 1.100 pessoas
converteram; no controle, 96 de 1.200. As taxas são 11% e 8%. A diferença
estimada é 3 pontos percentuais. O intervalo aproximado de 95% para campanha
menos controle vai de 0,6 a 5,4 pontos percentuais.
A interpretação executiva pode informar que
a campanha provavelmente elevou a conversão, mas o ganho plausível varia. Para
orçamento, é necessário transformar pontos percentuais em clientes, margem e
custo incremental.
Percentual relativo e ponto percentual não
são sinônimos. A passagem de 8% para 11% representa aumento de 3 pontos
percentuais e de 37,5% em termos relativos. Relatórios devem escolher a métrica
que melhor responde à decisão e, quando possível, apresentar ambas.
IC
para diferença de proporções = (p̂1 − p̂2) ± z × √[p̂1(1−p̂1)/n1 +
p̂2(1−p̂2)/n2]
3.6 Lógica dos testes de hipótese
Um teste de hipótese avalia quão
compatíveis os dados são com uma hipótese nula. A hipótese nula costuma
representar ausência de diferença ou um valor de referência; a alternativa
representa o efeito de interesse. O procedimento calcula uma estatística e um
valor-p sob condições definidas.
O valor-p é a probabilidade, assumindo a
hipótese nula e o modelo, de obter resultado tão extremo quanto o observado ou
mais. Ele não é a probabilidade de a hipótese nula ser verdadeira, não mede
tamanho do efeito e não informa sozinho a importância prática.
Se um teste produz p = 0,03 com α = 0,05,
rejeita-se H0 segundo a regra predefinida. Ainda assim, a conclusão precisa
incluir estimativa e intervalo. A decisão estatística pode mudar com α, tamanho
da amostra e desenho.
Erros tipo I e II correspondem,
respectivamente, a rejeitar H0 quando ela é verdadeira e deixar de rejeitá-la
quando a alternativa relevante é verdadeira. O poder é a probabilidade de
detectar um efeito específico. Planejamento amostral deve considerar esses
erros e a diferença mínima relevante.
Expressões como “aceitar a hipótese nula”
devem ser evitadas. Ausência de evidência não é evidência de ausência. Para
demonstrar equivalência ou não inferioridade são necessários desenhos e margens
próprios.
Estatística
de teste = (estimativa − valor de H0) / erro-padrão
3.7 Teste para uma média
O teste t de uma amostra compara a média
populacional a um valor de referência quando o desvio-padrão populacional é
desconhecido. A estatística é t = (x̄ − μ0)/(s/√n), com n−1 graus de liberdade.
As observações devem ser independentes e a
distribuição da média deve ser aproximadamente normal. Em amostras pequenas,
valores extremos e forte assimetria exigem atenção. Em amostras maiores, o
Teorema Central do Limite oferece maior robustez, mas não corrige dependência
nem medição inadequada.
Uma central declara meta de 50 segundos. Em
36 chamadas, a média foi 54 e o desvio-padrão 12. O erro-padrão é 2 e t =
(54−50)/2 = 2. Com 35 graus de liberdade, o valor-p bilateral é próximo de
0,053; o intervalo de 95% é aproximadamente 49,94 a 58,06.
O resultado está no limite de 5% e não deve
ser resumido como prova de cumprimento ou descumprimento. A estimativa sugere
piora de 4 segundos, mas a faixa inclui diferença quase nula e aumento
relevante. A decisão pode exigir mais dados ou uma margem operacional
explícita.
Testar apenas porque a média parece
diferente gera interpretações artificiais. O valor de referência e a direção do
teste devem ser definidos antes, e testes unilaterais só são adequados quando
efeitos na direção oposta não levariam à mesma alegação.
3.8 Comparação de duas médias
independentes
O teste t para duas amostras independentes
compara médias de grupos sem pareamento. A versão de Welch é recomendada como
padrão porque não exige variâncias iguais. Ela usa erro-padrão √(s1²/n1 +
s2²/n2) e graus de liberdade aproximados.
A independência entre grupos deve refletir
o desenho. Se a mesma pessoa aparece nos dois grupos, se lojas pertencem a
redes correlacionadas ou se pedidos são agrupados por cliente, o teste simples
pode subestimar incerteza. A variável também deve ser quantitativa e o efeito
deve ser analisado com intervalo.
Um processo A possui n=40, média 82 e
desvio 12; o processo B possui n=35, média 75 e desvio 10. A diferença A−B é 7.
O erro-padrão é aproximadamente 2,54; t≈2,75 e o intervalo de 95% para a
diferença é cerca de 1,9 a 12,1 unidades.
A evidência indica média maior em A. A
escolha do melhor processo depende do significado da variável: se for tempo, B
é melhor; se for produção, A pode ser melhor. Estatística não substitui a
definição do indicador.
Usar o teste clássico com variâncias
agrupadas sem avaliar a suposição pode alterar o resultado, sobretudo com
tamanhos desiguais. A versão de Welch reduz esse risco e deve ser preferida
salvo justificativa específica.
t de
Welch = (x̄1 − x̄2 − Δ0) / √(s1²/n1 + s2²/n2)
3.9 Amostras pareadas e medidas
repetidas
Dados pareados surgem quando a mesma
unidade é medida antes e depois ou quando unidades são combinadas por
características. O teste trabalha com as diferenças dentro dos pares, reduzindo
variabilidade entre unidades. A unidade de análise passa a ser a diferença.
O procedimento calcula d̄, sd e t =
d̄/(sd/√n). É necessário verificar independência entre pares e distribuição das
diferenças. Analisar os dois momentos como amostras independentes desperdiça a
informação do pareamento e pode reduzir poder.
Em 25 pessoas, o tempo antes menos depois
de um treinamento teve média de 5 minutos e desvio-padrão de 7. O erro-padrão é
1,4 e t≈3,57. O intervalo de 95% para a redução média vai de aproximadamente
2,1 a 7,9 minutos.
A conclusão deve relacionar a redução ao
custo do treinamento, à manutenção do efeito e à qualidade do atendimento. Uma
melhora média pode coexistir com piora em parte das pessoas, por isso a
distribuição das diferenças também deve ser examinada.
Em estudos antes e depois sem grupo de
comparação, mudanças podem decorrer de sazonalidade, maturação ou eventos
externos. O teste pareado confirma alteração temporal, não necessariamente
causalidade do programa.
t
pareado = d̄ / (sd / √n)
3.10 Comparação de duas proporções
O teste para duas proporções verifica se
taxas populacionais diferem. Sob H0 de igualdade, usa-se proporção combinada no
erro-padrão do teste. Para o intervalo da diferença, usa-se erro-padrão não
combinado.
As contagens esperadas precisam ser
suficientemente grandes para a aproximação normal. Com eventos raros ou
amostras pequenas, testes exatos podem ser mais apropriados. A unidade deve ser
independente; múltiplas transações da mesma pessoa exigem outra estrutura.
No exemplo de conversão, controle 96/1.200
e campanha 121/1.100. A proporção combinada é 217/2.300≈9,43%. O erro-padrão
sob H0 é cerca de 0,0122 e z≈2,46, produzindo valor-p bilateral próximo de
0,014.
A evidência estatística favorece diferença,
mas a decisão exige custo por exposição, margem por conversão e possíveis
efeitos de longo prazo. O intervalo de 0,6 a 5,4 pontos percentuais é mais
informativo que o valor-p isolado.
Testes repetidos em muitos segmentos
aumentam falsos positivos. Se a empresa examina dezenas de recortes, deve usar
correções, hierarquia de métricas ou validação posterior.
z =
(p̂1 − p̂2) / √[p̂c(1−p̂c)(1/n1 + 1/n2)]
3.11 Testes para variâncias e
dispersão
A variabilidade pode ser tão importante
quanto a média. Processos com a mesma média podem diferir em previsibilidade. O
teste F clássico compara duas variâncias sob normalidade; o teste de Levene é
mais robusto a desvios da normalidade e costuma ser preferido.
O teste F usa F = s1²/s2² e depende
fortemente da forma da distribuição. Para vários grupos, Levene ou
Brown-Forsythe avaliam homogeneidade. Contudo, o objetivo gerencial pode ser
estimar a diferença de dispersão, não apenas testar igualdade.
Dois fornecedores entregam com médias
semelhantes, mas desvios de 1,8 e 4,5 dias. A variância do segundo é 6,25 vezes
a do primeiro. Mesmo que a média seja aceitável, a maior instabilidade pode
exigir estoque de segurança e gerar custo.
A interpretação deve conectar dispersão à
experiência e ao risco. Coeficiente de variação pode apoiar comparações quando
escalas diferem e a média é positiva e significativa.
Não se deve usar a aceitação de
homogeneidade como prova de igualdade. Testes de premissas com baixa potência
podem não detectar problemas; gráficos e robustez devem complementar a análise.
3.12 Qui-quadrado de independência
e aderência
O teste qui-quadrado trabalha com
frequências categóricas. O teste de independência avalia associação entre duas
variáveis; o de aderência compara uma distribuição observada a proporções
esperadas. A estatística soma (O−E)²/E nas células.
As observações devem ser independentes e as
frequências esperadas não podem ser excessivamente pequenas. O resultado indica
associação, mas não sua intensidade nem causalidade. Medidas como V de Cramér
ajudam a quantificar o efeito.
Uma empresa cruza canal de atendimento e
resolução no primeiro contato. Se as frequências observadas diferem muito das
esperadas sob independência, o teste pode rejeitar H0. Em seguida, resíduos
padronizados mostram quais células contribuíram mais.
A análise gerencial deve evitar concluir
que o canal causa resolução. Perfis de demanda podem variar entre canais. O
achado orienta investigação e, quando possível, modelagem com variáveis de
controle.
Agrupar categorias apenas para obter
significância pode ocultar padrões. Categorias devem ser definidas por lógica
substantiva, e células raras podem exigir combinação justificada ou teste
exato.
χ² =
Σ (O − E)² / E
V de
Cramér = √[χ² / (n × min(r−1, c−1))]
3.13 ANOVA de um fator
A análise de variância de um fator compara
médias de três ou mais grupos. Em vez de realizar muitos testes t, ela decompõe
a variabilidade total em variação entre grupos e dentro dos grupos. A
estatística F é a razão entre quadrados médios.
As condições incluem independência,
resíduos aproximadamente normais e variâncias razoavelmente homogêneas. ANOVA é
relativamente robusta em grupos balanceados. A versão de Welch pode ser usada
quando variâncias diferem.
Considere três métodos com dez observações
cada, médias 72, 78 e 84. Se a soma de quadrados entre grupos é 720 e dentro é
540, os quadrados médios são 360 e 20. Logo, F=18 com graus de liberdade 2 e
27, evidenciando diferença global.
A ANOVA informa que nem todas as médias são
iguais, mas não identifica automaticamente os pares diferentes. O tamanho do
efeito η²=720/(720+540)=0,571 indica que cerca de 57,1% da variação observada é
associada ao fator no conjunto analisado.
ANOVA significativa não autoriza escolher o
grupo de maior média sem considerar pós-testes, custos, dispersão e desenho.
Também não transforma estudo observacional em experimento causal.
F =
QM entre grupos / QM dentro dos grupos
η² =
SQ entre / SQ total
3.14 Comparações múltiplas e
tamanhos de efeito
Após ANOVA significativa, procedimentos
pós-teste controlam o erro familiar. Tukey é apropriado para todas as
comparações pareadas com variâncias homogêneas; Games-Howell é útil quando
variâncias e tamanhos diferem. Contrastes planejados podem ser mais eficientes
quando hipóteses foram definidas antes.
Além de valores-p ajustados, devem ser
apresentadas diferenças, intervalos e medidas de efeito. Cohen d padroniza
diferença entre duas médias; η² e ω² resumem o fator. Medidas não substituem
unidades originais, que continuam necessárias para a decisão.
Se métodos A, B e C têm médias 72, 78 e 84,
comparações podem mostrar C>A e C>B, enquanto B>A pode ou não ser
detectável. A recomendação precisa considerar ganho incremental e custo de
implementação.
Correções tornam critérios mais rigorosos
porque muitos testes aumentam a chance de ao menos um falso positivo. A seleção
de apenas comparações favoráveis sem ajuste é uma forma de multiplicidade
oculta.
Tamanho de efeito deve ser contextualizado.
Um d de 0,3 pode ser importante em grande escala ou irrelevante em processo
caro. Limiares genéricos não substituem conhecimento do campo.
3.15 ANOVA de dois fatores e
interação
A ANOVA de dois fatores avalia
simultaneamente dois fatores categóricos e sua interação. A interação ocorre
quando o efeito de um fator depende do nível do outro. Em Administração, isso
permite investigar, por exemplo, método de treinamento e turno, campanha e
segmento ou embalagem e região.
O modelo contém efeitos principais A e B e
termo A×B. Quando a interação é relevante, efeitos principais médios podem ser
enganosos. Gráficos de médias por grupo ajudam a visualizar linhas paralelas ou
cruzamentos.
Suponha que um treinamento melhore
produtividade no turno diurno, mas não no noturno. A média geral pode sugerir
efeito moderado, enquanto a interação revela necessidade de adaptação por
turno.
A interpretação deve começar pela
interação. Se ela for pequena, efeitos principais podem ser discutidos. Se for
grande, apresentam-se efeitos simples e comparações dentro de níveis.
Desenhos desbalanceados e dados ausentes
exigem cuidado com tipos de soma de quadrados. A análise deve registrar
codificação, referência e método empregado.
3.16 Métodos não paramétricos
Métodos não paramétricos são úteis para
dados ordinais, distribuições muito assimétricas, amostras pequenas ou presença
de valores extremos incompatíveis com testes paramétricos. Eles frequentemente
trabalham com postos em vez de valores originais.
Mann-Whitney compara duas amostras
independentes; Wilcoxon signed-rank, pares; Kruskal-Wallis, três ou mais
grupos; Friedman, medidas repetidas. Esses testes não são simplesmente “testes
de medianas” em todas as condições: a interpretação depende da forma das
distribuições.
Uma pesquisa com escala de 1 a 5 pode
comparar satisfação entre dois canais pelo Mann-Whitney. O resultado indica
tendência de postos diferentes. Devem ser apresentados distribuição, medianas,
intervalos ou medida de efeito compatível.
Escolher método não paramétrico não elimina
necessidade de independência e desenho adequado. Também pode haver perda de
poder quando o teste paramétrico é apropriado.
Não se deve decidir apenas por um teste de
normalidade. Em amostras grandes, pequenas imperfeições geram rejeição; em
pequenas, problemas sérios podem passar despercebidos. Gráficos, escala,
outliers e robustez devem orientar a escolha.
3.17 Correlação de Pearson,
Spearman e correlação parcial
Correlação mede associação, não
causalidade. Pearson quantifica relação linear entre variáveis quantitativas;
Spearman usa postos e capta associação monotônica, sendo mais robusto a
extremos e adequado a dados ordinais. A correlação parcial examina a relação
entre duas variáveis controlando linearmente outras.
O coeficiente varia de −1 a 1. Valor
próximo de zero indica pouca associação do tipo medido, não ausência de
qualquer relação. Um padrão curvo pode ter correlação linear baixa. O diagrama
de dispersão deve preceder o coeficiente.
Vendas e publicidade podem apresentar
r=0,85, mas ambas crescerem com o tempo. Ao controlar tendência ou
sazonalidade, a correlação parcial pode cair. Essa mudança sugere confundimento
temporal.
Intervalos de confiança e tamanho da
amostra importam. Correlações elevadas em poucos casos podem ser instáveis. A
interpretação deve considerar unidade, amplitude das variáveis e seleção da
amostra.
Correlação entre indicadores construídos
com denominadores comuns pode ser artificial. Também é perigoso calcular
dezenas de correlações e destacar apenas as maiores sem ajuste ou validação.
r =
Σ[(xi−x̄)(yi−ȳ)] / √[Σ(xi−x̄)² Σ(yi−ȳ)²]
3.18 Regressão linear simples
A regressão linear simples modela a média
de Y como função linear de X: Ŷ = b0 + b1X. O intercepto representa o valor
previsto quando X=0, se essa condição tiver sentido; a inclinação b1 representa
a variação média prevista em Y para aumento de uma unidade em X.
Os coeficientes de mínimos quadrados
minimizam a soma dos resíduos ao quadrado. R² representa a proporção da
variação de Y explicada pelo modelo na amostra, mas não mede causalidade nem
garante qualidade preditiva fora dela.
Com investimentos em publicidade de 10, 20,
30, 40 e 50 e vendas de 100, 120, 138, 165 e 185, a reta estimada é
Ŷ=77,1+2,15X. Para X=35, a previsão pontual é 152,35. O R² da pequena amostra é
aproximadamente 0,996.
A inclinação sugere aumento médio de 2,15
unidades de venda por unidade de publicidade no intervalo observado. O R² muito
alto deve ser interpretado com cautela por haver apenas cinco pontos e possível
tendência comum.
Extrapolar para X=100 seria arriscado. O
relacionamento pode saturar, custos marginais podem aumentar e outras condições
podem mudar. A faixa observada define o domínio mais defensável.
Ŷ =
b0 + b1X
b1 =
Σ[(xi−x̄)(yi−ȳ)] / Σ(xi−x̄)²
3.19 Regressão linear múltipla
A regressão múltipla relaciona Y a vários
preditores: Ŷ = b0 + b1X1 + ... + bkXk. Cada coeficiente representa associação
média com Y mantendo os demais preditores constantes, dentro do modelo e da
faixa dos dados.
O método ajuda a controlar confundidores
observados, estimar efeitos parciais e melhorar previsões. Ainda assim, omissão
de variáveis, erros de medição, seleção e simultaneidade podem produzir
coeficientes enviesados. A escolha de variáveis deve combinar teoria e
diagnóstico, não apenas algoritmo automático.
Um modelo de vendas pode incluir preço,
publicidade, número de pontos e sazonalidade. Se bpreço=−12, a interpretação é
queda média prevista de 12 unidades para aumento de uma unidade monetária no
preço, mantendo os demais fatores constantes.
O R² ajustado penaliza inclusão de
variáveis sem contribuição suficiente. Erro de previsão em validação é mais
relevante que R² de treinamento quando o objetivo é prever. Para explicação,
coeficientes, intervalos e plausibilidade substantiva são centrais.
Coeficientes não devem ser comparados
diretamente quando escalas diferem. Padronização pode apoiar comparação, mas a
comunicação em unidades originais costuma ser mais útil para decisões.
Ŷ =
b0 + b1X1 + b2X2 + ... + bkXk
3.20 Diagnóstico de regressão
Um modelo linear pressupõe relação
adequada, independência dos erros, variância aproximadamente constante e
resíduos com comportamento compatível para inferência. Diagnóstico inclui
gráficos de resíduos versus ajustados, Q-Q plot, alavancagem, distância de Cook
e análise temporal.
Heterocedasticidade ocorre quando a
variância dos erros muda com o nível previsto. Pode afetar erros-padrão;
soluções incluem transformação, modelagem da variância ou erros robustos.
Autocorrelação é comum em séries e painéis e exige métodos próprios.
Um ponto com X muito distante pode ter alta
alavancagem e alterar fortemente a reta. Ele não deve ser removido
automaticamente. Primeiro verifica-se erro, depois contexto e sensibilidade do
modelo com e sem o caso.
Influência é uma propriedade da combinação
de posição e resíduo. Observações influentes podem revelar novos segmentos,
falhas de processo ou limites do modelo. Documentar decisões sobre esses casos
é parte da governança.
Um modelo pode apresentar resíduos
visualmente adequados e ainda sofrer causalidade reversa ou viés de seleção.
Diagnóstico estatístico não substitui análise do desenho.
3.21 Multicolinearidade
Multicolinearidade ocorre quando preditores
são fortemente relacionados. Ela não necessariamente prejudica previsão
conjunta, mas aumenta erros-padrão e torna coeficientes individuais instáveis.
Pequenas mudanças na amostra podem alterar sinais e magnitudes.
O fator de inflação da variância, VIF,
ajuda a detectar o problema. Valores elevados devem ser examinados no contexto.
Possíveis respostas incluem combinar variáveis, escolher uma representação,
coletar mais dados, usar conhecimento teórico ou técnicas de regularização em
cursos avançados.
Preço de tabela, desconto e preço final
podem ser quase determinísticos entre si. Incluir todos no mesmo modelo gera
dificuldade interpretativa. A solução depende da pergunta: efeito do preço
final, da política de desconto ou da posição de mercado.
Remover automaticamente a variável com
maior VIF pode criar omissão relevante. A decisão precisa preservar a
especificação substantiva.
Multicolinearidade perfeita impede
estimação; alta colinearidade permite cálculo, mas reduz capacidade de separar
efeitos. O relatório deve reconhecer essa limitação.
VIFj
= 1 / (1 − Rj²)
3.22 Variáveis indicadoras e
interações em regressão
Variáveis categóricas entram na regressão
por indicadores binários, com uma categoria de referência. Para uma variável
com g categorias, usam-se normalmente g−1 indicadores. O coeficiente representa
diferença em relação à referência, controlando outros termos.
Interações permitem que o efeito de X varie
por grupo ou por nível de Z. O modelo Y=b0+b1X+b2Z+b3XZ exige interpretar
efeitos condicionais: efeito de X é b1+b3Z.
Um modelo de salário pode incluir
experiência, indicador de modalidade e interação. Se a interação for negativa,
o retorno da experiência difere entre modalidades. A interpretação deve
apresentar previsões ou efeitos em valores concretos.
A categoria de referência muda a redação
dos coeficientes, mas não as previsões gerais. Escolher referência
substantivamente útil melhora comunicação.
Inserir muitas interações sem hipótese
aumenta complexidade e multiplicidade. Interações devem ser motivadas e
acompanhadas por gráficos.
3.23 Introdução à regressão
logística
Quando a resposta é binária, como comprar
ou não, inadimplir ou não, a regressão linear pode produzir probabilidades fora
de 0 e 1 e variância inadequada. A regressão logística modela o logaritmo das
chances como função linear dos preditores.
O modelo é log[p/(1−p)] = b0 + b1X1 + ... .
A exponencial de um coeficiente produz odds ratio. Um OR de 1,20 indica
multiplicação das chances por 1,20 para aumento de uma unidade, mantendo outras
variáveis constantes.
Se a probabilidade inicial é 20%, as
chances são 0,25. Multiplicar por 1,20 gera 0,30, correspondente a
probabilidade de 23,1%, não 24%. Odds e probabilidade são diferentes,
especialmente quando o evento é comum.
A avaliação deve incluir discriminação,
calibração, limiar e custos de erros. Acurácia isolada pode ser enganosa em
eventos raros.
Coeficientes logísticos não comprovam
causalidade. Modelos de risco que afetam pessoas exigem validação por grupo,
explicação, proteção de dados e revisão humana.
log[p/(1−p)]
= b0 + b1X1 + ... + bkXk
Odds
ratio de Xj = e^(bj)
3.24 Componentes de séries
temporais
Uma série temporal é uma sequência ordenada
no tempo. Seus componentes podem incluir nível, tendência, sazonalidade,
ciclos, intervenções e ruído. A ordem importa: observações próximas costumam
ser correlacionadas, o que impede usar métodos independentes sem ajuste.
A exploração inclui gráfico temporal,
decomposição, taxas de crescimento, autocorrelação e identificação de mudanças
estruturais. A frequência deve corresponder à decisão: diária para escala,
semanal para reposição, mensal para orçamento.
Vendas mensais podem crescer 2% ao mês e
aumentar em dezembro. Comparar dezembro a novembro confunde sazonalidade;
comparar ao dezembro anterior ajuda a separar padrões.
Uma previsão deve informar horizonte, data
de corte e intervalo. Quanto maior o horizonte, maior tende a ser a incerteza.
Eventos externos podem invalidar padrões históricos.
Preencher datas ausentes com zero pode
criar quedas artificiais. É necessário distinguir ausência de observação de
valor realmente zero.
3.25 Médias móveis e suavização
exponencial
A média móvel de k períodos suaviza
variações e responde com atraso. A suavização exponencial simples atualiza a
previsão por Ft+1=αYt+(1−α)Ft, dando maior peso ao recente conforme α aumenta.
Médias móveis são transparentes e úteis
quando não há tendência forte. Suavização simples é apropriada para série com
nível relativamente estável. Tendência e sazonalidade exigem extensões, como
Holt e Holt-Winters.
Com previsão anterior 200, valor observado
230 e α=0,30, a nova previsão é 0,30×230+0,70×200=209. O ajuste é parcial,
evitando seguir integralmente uma oscilação.
Parâmetros devem ser escolhidos por
validação, não apenas por aparência. Comparar erro em dados usados para ajustar
favorece modelos mais flexíveis.
Uma previsão operacional precisa ser
atualizada e acompanhada. O melhor modelo no passado pode perder desempenho
após mudança de preço, canal ou comportamento.
Ft+1
= αYt + (1 − α)Ft
3.26 Avaliação de previsões
Métricas de erro permitem comparar modelos.
MAE é a média dos erros absolutos; RMSE penaliza erros grandes; MAPE expressa
percentuais, mas é problemático com valores zero ou muito pequenos; WAPE e MASE
são alternativas.
A avaliação deve separar treino, validação
e teste respeitando a ordem temporal. Validação com janela deslizante simula
uso real melhor que divisão aleatória.
Erros de 10, −5, 20 e −15 têm MAE de 12,5.
O erro médio é 2,5 e poderia sugerir bom desempenho por cancelamento, mostrando
por que viés e magnitude devem ser examinados separadamente.
A escolha da métrica deve refletir custo.
Em estoque, subestimar pode ser mais caro que superestimar; pode-se usar perdas
assimétricas e nível de serviço.
Comparar modelos apenas por uma métrica
oculta estabilidade e interpretabilidade. O relatório deve incluir benchmark
ingênuo, desempenho por segmento e análise dos maiores erros.
MAE
= Σ|Yt − Ft| / n
RMSE
= √[Σ(Yt − Ft)² / n]
3.27 Números-índice e
deflacionamento
Números-índice sintetizam variações de
preços, quantidades ou valores. Índices de Laspeyres usam quantidades do
período-base; Paasche, quantidades correntes; Fisher combina ambos
geometricamente. A escolha afeta o resultado quando padrões de consumo mudam.
Deflacionar significa remover efeito de
preços para comparar valores reais. Valor real em preços de base pode ser
calculado dividindo o valor nominal por índice/100. A base e a fonte precisam
ser registradas.
Se receita nominal cresce de 1,0 para 1,10
milhão e o índice de preços passa de 100 para 108, a receita real no segundo
período é cerca de 1,0185 milhão em preços-base, crescimento real aproximado de
1,85%.
Confundir crescimento nominal e real pode
superestimar desempenho. A escolha do deflator deve representar a estrutura de
custos ou preços relevante.
Índices podem sofrer substituição, mudança
de qualidade e atualização de cesta. Comparações longas exigem encadeamento e
atenção metodológica.
Valor
real = Valor nominal / (Índice de preços / 100)
3.28 Controle estatístico de
processos
Gráficos de controle acompanham
estatísticas no tempo e utilizam linha central e limites calculados a partir da
variação do processo. Pontos além dos limites ou padrões não aleatórios sugerem
causas especiais. Limites de controle não são o mesmo que especificações do
cliente.
Para médias de subgrupos, usa-se gráfico X̄
em conjunto com R ou S. Para proporções defeituosas, gráfico p; para contagens,
c ou u. A escolha depende da variável e do tamanho da amostra.
Se a média histórica de uma proporção é 4%
e cada amostra tem 200 unidades, os limites aproximados de 3 sigma são p̄
±3√[p̄(1−p̄)/n], resultando limite superior perto de 8,16% e inferior truncado
em zero.
Um ponto dentro dos limites pode ainda
violar especificação; um ponto fora indica instabilidade, não necessariamente
produto fora de requisito. A resposta é investigar causa, não ajustar
indiscriminadamente o processo.
Limites devem ser estimados em período
estável. Incluir eventos especiais no cálculo amplia limites e esconde sinais.
Depois de tratar causas documentadas, a linha-base pode ser recalculada.
LSC
e LIC do gráfico p = p̄ ± 3√[p̄(1−p̄)/n]
3.29 Desenho de experimentos e
testes A/B
Um experimento compara intervenções com
alocação controlada, idealmente aleatória. A randomização equilibra fatores
observados e não observados em média. O desenho deve definir unidade,
tratamentos, métrica principal, duração, tamanho amostral e regra de parada.
Bloqueio pode aumentar precisão ao
randomizar dentro de segmentos, como região ou perfil. Experimentos fatoriais
testam mais de um fator e interações. Contaminação ocorre quando unidades de
grupos diferentes influenciam-se.
Um teste de página pode randomizar pessoas
usuárias entre versão A e B, medir conversão em sete dias e planejar amostra
para detectar aumento de 8% para 10%. A análise precisa considerar usuários
únicos, não sessões repetidas tratadas como independentes.
A decisão deve incluir efeito absoluto,
intervalo, custo e métricas de proteção, como reclamações ou cancelamentos.
Ganho de conversão que reduz confiança pode ser indesejável.
Encerrar o teste no primeiro resultado
significativo aumenta falsos positivos. Monitoramento sequencial exige métodos
próprios; caso contrário, a duração deve ser respeitada.
3.30 Poder, tamanho amostral e
diferença mínima relevante
O tamanho amostral depende de
variabilidade, nível de significância, poder e efeito mínimo de interesse.
Quanto menor o efeito a detectar, maior a amostra. Planejar após observar o
resultado não substitui o cálculo prévio.
A diferença mínima relevante deve ser
definida em unidades gerenciais. Em conversão, pode ser 1 ponto percentual; em
tempo, 3 minutos; em satisfação, 0,4 ponto. Essa definição conecta análise a
custo e benefício.
Um teste pode não ser significativo porque
o efeito é ausente ou porque a amostra é insuficiente. Intervalos largos ajudam
a reconhecer essa ambiguidade. Uma amostra enorme pode tornar significativa uma
diferença trivial.
O poder é calculado para cenários
específicos. Não existe “poder do estudo” sem efeito alternativo. Análises de
sensibilidade mostram quais efeitos seriam detectáveis com a amostra
disponível.
Em múltiplas métricas, o planejamento deve
priorizar uma variável principal. Dimensionar e interpretar todas como
confirmatórias aumenta complexidade e erro.
3.31 Dados ausentes, valores
extremos e transformações
Dados ausentes podem ser completamente
aleatórios, condicionais a variáveis observadas ou relacionados ao próprio
valor não observado. A estratégia de tratamento depende desse mecanismo.
Excluir linhas completas pode reduzir amostra e introduzir viés.
Imputação pela média reduz variância e
distorce relações. Métodos múltiplos são preferíveis em análises avançadas, mas
exigem modelo adequado. Em qualquer nível, deve-se relatar quantidade, padrão e
tratamento dos ausentes.
Valores extremos podem ser erros ou casos
reais. A análise inclui verificação de fonte, regras de negócio, gráficos e
influência. Transformações logarítmicas podem reduzir assimetria e tornar
relações multiplicativas mais lineares.
Resultados devem ser comparados em análises
de sensibilidade. Se a conclusão depende de excluir poucos casos, isso precisa
ser explícito.
Regras automáticas como remover tudo além
de três desvios podem eliminar eventos importantes. A decisão deve considerar
processo e objetivo, não apenas distância estatística.
3.32 Multiplicidade, seleção de
modelos e reprodutibilidade
Quando muitas hipóteses são testadas,
cresce a chance de falsos positivos. Correções como Bonferroni controlam erro
familiar; procedimentos de FDR controlam proporção esperada de descobertas
falsas. A melhor proteção é planejar hipóteses e separar exploração de
confirmação.
Seleção automática de variáveis baseada
apenas em valor-p pode produzir modelos instáveis e coeficientes otimistas.
Validação cruzada, amostra de teste e conhecimento teórico reduzem esse risco.
O modelo final deve registrar todas as decisões.
Se vinte segmentos são comparados a α=5%,
mesmo sem diferenças verdadeiras espera-se em média um resultado significativo.
Destacar esse único segmento como descoberta pode orientar investimento
equivocado.
Reprodutibilidade exige base identificada,
código ou fórmulas, versões, sementes aleatórias, dicionário de dados e
relatório de exclusões. Uma análise que só existe na memória de quem a fez não
é um ativo organizacional confiável.
Transparência não significa divulgar dados
pessoais. É possível documentar processo, proteger informações e permitir
auditoria por pessoas autorizadas.
4.
Principais Temas e Organização
A disciplina pode ser organizada em
dezesseis semanas, alternando conceitos, resolução manual, uso de ferramentas e
interpretação. O cronograma abaixo é uma referência. Instituições podem alterar
a sequência conforme pré-requisitos e carga horária, mas é recomendável
preservar a progressão da comparação simples para modelos e séries.
|
Semanas |
Módulo |
Conteúdos e produto esperado |
|
1–2 |
Revisão e
desenho |
inferência,
estimadores, erro-padrão, plano de análise e qualidade dos dados |
|
3–4 |
Duas
populações |
médias
independentes, pareadas, proporções, variâncias e efeito |
|
5 |
Dados
categóricos |
qui-quadrado,
resíduos e associação |
|
6–7 |
Múltiplos
grupos |
ANOVA,
pós-testes, interação e alternativas robustas |
|
8 |
Métodos
não paramétricos |
Mann-Whitney,
Wilcoxon, Kruskal-Wallis e Friedman |
|
9–10 |
Regressão |
correlação,
regressão simples, múltipla, indicadores e interações |
|
11 |
Diagnóstico |
resíduos,
heterocedasticidade, influência e multicolinearidade |
|
12 |
Resposta
binária |
introdução
à regressão logística e avaliação |
|
13–14 |
Séries
temporais |
componentes,
suavização, tendência e erros de previsão |
|
15 |
Processos
e experimentos |
gráficos
de controle, testes A/B e tamanho amostral |
|
16 |
Integração |
estudo de
caso, apresentação executiva e auditoria da análise |
Módulo 1 — Retomada dos
fundamentos
O início revisa população, amostra,
parâmetro, estatística, distribuições amostrais, intervalos e testes. A revisão
deve ser aplicada a uma base realista, pois o objetivo é verificar se a turma
consegue estruturar uma pergunta antes de avançar. Um diagnóstico inicial pode
incluir identificação de variáveis, cálculo de erro-padrão e interpretação de
um intervalo. Dificuldades em frações, porcentagens e álgebra precisam ser
tratadas cedo para não se acumularem.
Módulo 2 — Comparações entre duas
populações
Este bloco concentra testes para médias e
proporções, com distinção entre grupos independentes e pareados. As atividades
devem exigir escolha de método e justificativa, não apenas cálculo.
Recomenda-se comparar resultados paramétricos e não paramétricos em bases com
assimetria. Tamanho de efeito e intervalo devem aparecer em todas as
conclusões.
Módulo 3 — Tabelas de contingência
O conteúdo inclui frequências esperadas,
estatística qui-quadrado, resíduos e V de Cramér. Um exercício útil cruza canal
e desfecho, pedindo que a pessoa estudante identifique associação e proponha
variáveis que poderiam confundir a relação. A discussão deve enfatizar que
associação em tabela não é causalidade.
Módulo 4 — ANOVA e comparações
múltiplas
A turma aprende decomposição da
variabilidade e lógica da estatística F. Em seguida, trabalha pós-testes,
tamanhos de efeito, ANOVA de Welch e interação. A apresentação visual de médias
e intervalos é importante. Atividades devem mostrar por que executar muitos
testes t sem correção é problemático.
Módulo 5 — Métodos não
paramétricos
O módulo não deve ser apresentado como
coleção de substitutos automáticos para a normalidade. Ele parte da escala, do
desenho e da pergunta. A turma compara o significado de médias, medianas e
postos e aprende que resultados de testes de postos precisam ser comunicados
com cuidado.
Módulo 6 — Regressão e diagnóstico
A regressão deve ser construída a partir do
diagrama de dispersão e da ideia de resíduos. Começa-se com uma variável e
avança-se para múltiplas, indicadores e interações. O diagnóstico é parte do
modelo, não capítulo opcional. Planilhas podem ser usadas inicialmente;
software estatístico facilita resíduos, intervalos e múltiplos preditores.
Módulo 7 — Séries temporais e
previsão
O estudo começa com linha do tempo e
benchmark ingênuo. Depois são introduzidas médias móveis, suavização e
tendência. A turma deve treinar validação temporal e métricas de erro. O
trabalho final pode comparar dois modelos e recomendar uso operacional, explicando
quando não confiar na previsão.
Módulo 8 — Controle,
experimentação e governança
O fechamento combina gráficos de controle,
testes A/B, tamanho amostral e reprodutibilidade. A turma aprende que um
experimento precisa de plano e que um gráfico de controle exige linha-base
estável. O produto final deve conter uma recomendação executiva e um apêndice
técnico suficiente para auditoria.
Estratégias didáticas
·
usar bases pequenas para
cálculos manuais e bases maiores para ferramentas;
·
pedir sempre uma frase de
interpretação após cada resultado;
·
apresentar exemplos com
conclusão significativa, não significativa e inconclusiva;
·
incluir casos em que as
premissas falham e a técnica precisa ser modificada;
·
comparar decisão baseada apenas
no valor-p com decisão baseada em efeito, intervalo e custo;
·
exigir dicionário de dados e
registro das transformações;
·
promover revisão por pares de
gráficos e relatórios;
·
incluir exercícios de
identificação de afirmações exageradas em notícias e dashboards.
Ferramentas
Planilhas são adequadas para organização,
tabelas, gráficos, regressão simples e previsões básicas. Para ANOVA,
diagnóstico, testes não paramétricos e modelos mais amplos, R, Python, Jamovi,
JASP, PSPP ou outros programas podem oferecer maior transparência. A escolha
depende da infraestrutura. O princípio é invariável: a pessoa estudante precisa
conhecer entradas, saídas e interpretação. Copiar uma tabela automática sem
entender suas linhas não demonstra domínio.
Avaliação sugerida
|
Componente |
Peso ilustrativo |
Competência observada |
|
Listas
resolvidas |
20% |
cálculo,
escolha e interpretação |
|
Análise de
base |
20% |
limpeza,
exploração e documentação |
|
Prova
conceitual |
25% |
premissas,
inferência e leitura crítica |
|
Estudo de
caso |
25% |
integração
de métodos e decisão |
|
Apresentação |
10% |
comunicação
para público não técnico |
5.
Relação com outras matérias
Métodos Estatísticos I
O volume I fornece a linguagem dos dados,
probabilidade e inferência básica. O volume II reutiliza média, variância,
distribuição normal, t, qui-quadrado e erro-padrão para comparar e modelar.
Dificuldades anteriores reaparecem em regressão e ANOVA; por isso, a revisão
deve ser contínua. A relação é cumulativa, mas não redundante: o primeiro
volume pergunta como resumir e estimar; o segundo, como comparar, explicar,
prever e monitorar.
Pesquisa Operacional e Métodos
Determinísticos
Modelos de otimização precisam de
parâmetros como demanda, tempo e custo. Métodos estatísticos estimam esses
parâmetros e sua incerteza. Uma solução ótima baseada em uma previsão ruim pode
ser operacionalmente frágil. Por outro lado, a estatística identifica padrões,
mas não escolhe automaticamente a melhor alocação sob restrições. As
disciplinas se complementam na passagem de dados para decisão.
Matemática Financeira e Finanças
Finanças utiliza regressões para estimar
risco e retorno, séries temporais para projeções, testes para comparar
carteiras e cenários para orçamento. A estatística também apoia análise de
inadimplência, custo de capital e avaliação de desempenho. É importante
distinguir variabilidade histórica, erro de estimação e risco futuro. Um
coeficiente calculado com dados passados possui incerteza e pode mudar
estruturalmente.
Contabilidade e Controladoria
Análises de custos, desvios, indicadores e
auditoria dependem de comparação e amostragem. Regressão pode estimar
comportamento de custos; gráficos de controle monitoram processos; testes
avaliam diferenças entre unidades. A base contábil possui regras próprias e
pode apresentar mudanças de classificação, sazonalidade e lançamentos
extraordinários que precisam ser tratados antes da modelagem.
Marketing e Pesquisa de Mercado
Pesquisas utilizam amostragem, intervalos,
testes, segmentação e regressão. Experimentos avaliam campanhas, páginas e
ofertas. Modelos de resposta binária estimam conversão e abandono. A
estatística precisa ser combinada a desenho de questionário, teoria do
comportamento e ética. Uma regressão com respostas de conveniência não corrige
automaticamente o viés de quem respondeu.
Gestão de Pessoas
A disciplina apoia pesquisas de clima,
avaliação de treinamento, rotatividade, absenteísmo e equidade. ANOVA compara
unidades; regressão controla características; modelos logísticos estudam
eventos. Como os dados se referem a pessoas, privacidade, finalidade,
discriminação e possibilidade de contestação ganham destaque. Modelos não devem
transformar correlações em rótulos deterministas.
Operações, Logística e Qualidade
Previsão orienta estoque e capacidade;
testes comparam fornecedores; gráficos de controle distinguem causas; regressão
analisa produtividade. O conceito de independência precisa ser adaptado a
lotes, turnos e unidades agrupadas. Dados operacionais podem ser abundantes,
mas a qualidade de medição e a mudança de processo são desafios constantes.
Economia e Econometria
Econometria aprofunda regressão,
causalidade, séries e dados em painel. Métodos Estatísticos II oferece base
para interpretar coeficientes, erros e testes. Questões econômicas
frequentemente envolvem endogeneidade e dependência temporal, mostrando por que
associação controlada ainda não garante causalidade. A transição para
econometria exige maior atenção ao desenho e à teoria.
Sistemas de Informação e Ciência
de Dados
Bancos de dados, programação e visualização
operacionalizam a análise. A estatística fornece critérios para validação,
generalização e incerteza. Ciência de dados amplia modelos e escala, mas
continua dependente de amostragem, métricas, experimentação e governança. A
integração evita dashboards sem inferência e algoritmos sem avaliação
substantiva.
Metodologia Científica e TCC
Projetos acadêmicos usam hipóteses,
amostras, instrumentos e análise. O conteúdo ajuda a escolher testes e a evitar
conclusões além do desenho. A seção de método deve registrar critérios,
tratamento de ausentes, software e nível de significância; resultados devem
apresentar estimativas e limitações. A técnica deve responder ao problema, não
ser incluída apenas para sofisticar o trabalho.
6.
Aplicações Práticas e Profissionais
As aplicações a seguir mostram como a
disciplina aparece em rotinas reais. Cada caso parte de uma decisão, indica uma
técnica e destaca uma cautela. Em projetos profissionais, a análise normalmente
combina vários métodos e exige participação das áreas responsáveis pelo
processo.
6.1 Comparação de fornecedores
Uma empresa compara prazo médio,
variabilidade e taxa de avarias de três transportadoras. ANOVA ou Welch avalia
tempos; qui-quadrado ou modelos de proporção avaliam avarias; pós-testes
localizam diferenças. A decisão deve converter atraso e avaria em custo,
observar rotas atendidas e controlar perfil dos pedidos. Escolher apenas a
menor média pode aumentar risco se a variabilidade for alta.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.2 Avaliação de treinamento
Participantes são medidos antes e depois,
com grupo de comparação quando possível. O teste pareado avalia mudança
interna; um desenho com grupo permite comparar diferenças. Efeito, intervalo e
permanência devem ser reportados. Notas maiores logo após o curso não garantem
transferência para o trabalho.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.3 Teste A/B de comunicação
Duas versões de mensagem são randomizadas.
O teste de duas proporções compara conversão; regressão logística pode ajustar
bloqueios. Define-se métrica principal, amostra, duração e métricas de
proteção. Segmentos são exploratórios salvo planejamento. O resultado precisa
considerar ganho absoluto e custo.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.4 Previsão de demanda
Vendas semanais são decompostas em
tendência e sazonalidade. Benchmark ingênuo, média móvel e suavização são
comparados por validação temporal. Erros por produto orientam estoque de
segurança. Lançamentos e promoções devem ser tratados como intervenções, não
ruído comum.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.5 Rotatividade de pessoal
Um modelo logístico investiga associações
entre desligamento e tempo de casa, remuneração, liderança e jornada. A análise
deve excluir variáveis impróprias, verificar desempenho por grupo e evitar uso
punitivo. O objetivo é identificar condições organizacionais, não atribuir
destino individual.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.6 Pesquisa de satisfação
Intervalos estimam médias ou proporções;
ANOVA compara unidades; regressão controla perfil. Pesos podem corrigir desenho
amostral. Não resposta e modo de coleta devem ser discutidos. O indicador
global deve ser complementado por distribuição e temas qualitativos.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.7 Controle de defeitos
Gráfico p acompanha proporção de defeitos
por lote. Um sinal fora de controle gera investigação de material, máquina,
método e medição. Antes de recalcular limites, a equipe documenta causas. Meta
contratual permanece separada dos limites estatísticos.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.8 Análise de preços
Regressão estima relação entre preço e
quantidade, controlando sazonalidade e comunicação. Experimentos locais
fortalecem causalidade. Elasticidade e margem substituem interpretação limitada
do coeficiente. Concorrência e simultaneidade podem enviesar modelos
observacionais.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.9 Desempenho de unidades
ANOVA e modelos com indicadores comparam
lojas ou serviços. Ajustes por tamanho, localização e mix reduzem comparações
injustas. Rankings pontuais devem ser acompanhados por intervalos, pois
unidades pequenas oscilam mais. A análise deve apoiar aprendizagem e não apenas
punição.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.10 Tempo de atendimento
Distribuições assimétricas tornam mediana e
quantis importantes. Testes não paramétricos ou modelos transformados podem
comparar canais. Séries e controle identificam mudanças. A meta média não deve
ocultar caudas longas que afetam parte das pessoas usuárias.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.11 Inadimplência
Modelos logísticos estimam risco e ajudam a
planejar provisões. A base deve separar data de concessão e resultado futuro
para evitar vazamento. Avaliação inclui calibração, discriminação e impacto por
grupo. Decisões automatizadas precisam de governança e revisão.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.12 Auditoria por amostragem
A amostra estima taxa de não conformidade e
intervalo. Estratificação concentra esforço em valores ou riscos altos. A
conclusão respeita materialidade e desenho. Selecionar apenas itens suspeitos
ajuda investigação, mas não estima a taxa global sem ponderação.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.13 Avaliação de política pública
Grupos, períodos e indicadores são
comparados com atenção a seleção e contexto. Testes simples podem descrever
diferenças; desenhos quase experimentais são necessários para causalidade mais
forte. Resultados médios devem ser desagregados por território e população
afetada.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.14 Saúde e segurança
Taxas de incidentes precisam usar
exposição, como horas trabalhadas. Poisson ou regressões específicas podem ser
necessárias. Gráficos monitoram séries. Eventos raros exigem interpretação
cuidadosa: ausência em curto período não significa risco zero.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.15 Planejamento de caixa
Séries de recebimentos e pagamentos são
previstas e combinadas a cenários. Erros assimétricos importam porque falta de
caixa pode ser mais onerosa. Intervalos orientam reserva. Mudanças de política
de cobrança devem ser marcadas como intervenção.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.16 Gestão de estoques
Previsão por item, erro e nível de serviço
alimentam reposição. Itens intermitentes podem exigir métodos específicos. A
média sozinha não define estoque. Classificação ABC deve ser combinada a
criticidade e incerteza.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.17 Experiência digital
Funis são analisados por etapa, coorte e
dispositivo. Testes A/B avaliam mudanças; múltiplas métricas requerem
hierarquia. Usuários, e não eventos, frequentemente são unidades independentes.
Bots e duplicidades precisam ser filtrados.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.18 Equidade remuneratória
Regressão pode comparar remuneração
controlando função, experiência e jornada, mas a seleção de controles precisa
ser discutida: algumas variáveis podem refletir desigualdades anteriores.
Resultados devem ser acompanhados por distribuição, transparência e análise
jurídica.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.19 Capacidade e filas
Tempos de chegada e serviço são estimados
estatisticamente para alimentar modelos de filas. Sazonalidade e dependência
importam. A validação compara tempos previstos e observados. Reduzir média pode
não resolver percentis extremos.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
6.20 Indicadores ESG
Emissões, diversidade, acidentes e impactos
sociais exigem definições, denominadores e auditoria. Séries avaliam progresso;
testes comparam unidades; regressões exploram determinantes. Mudanças de
metodologia devem ser identificadas para preservar comparabilidade.
Uma entrega profissional adequada inclui
pergunta, base, método, estimativa, incerteza, visualização, recomendação e
limites. A área responsável pelo processo deve validar se os dados representam
a operação e se a mudança proposta é executável.
Roteiro de análise profissional
·
1. escrever a decisão que será
apoiada e quem a tomará;
·
2. definir população, unidade,
período, resposta e comparação;
·
3. auditar origem, cobertura,
ausentes, duplicidades e mudanças de regra;
·
4. explorar distribuições e
relações antes de testar;
·
5. justificar método e
registrar premissas;
·
6. apresentar estimativa,
intervalo, efeito e teste quando aplicável;
·
7. avaliar robustez, segmentos,
influência e sensibilidade;
·
8. converter resultado em
impacto operacional ou financeiro;
·
9. indicar riscos éticos,
legais e de privacidade;
·
10. definir monitoramento
posterior e condição de revisão.
Modelo de comunicação executiva
Uma nota executiva pode ser estruturada em
cinco blocos: decisão; evidência principal; magnitude e incerteza; riscos;
recomendação. O apêndice técnico registra base e método. Essa separação permite
leitura rápida sem ocultar detalhes. Frases devem evitar causalidade quando o
desenho é observacional e não devem apresentar “não significativo” como
equivalência. Gráficos devem ter escalas claras, unidades e fontes.
Caderno de aprofundamento e
atividades resolvidas
Os estudos seguintes aprofundam a aplicação
dos métodos em problemas frequentes da Administração. Eles foram construídos
para mostrar o encadeamento entre pergunta, escolha da técnica, cálculo,
interpretação e decisão. Em uma disciplina de segundo nível, a resolução não
deve terminar na estatística: é necessário discutir qualidade dos dados,
premissas, tamanho do efeito, custo dos erros e monitoramento posterior.
Os números são fictícios e arredondados. Em
planilhas ou softwares, recomenda-se manter precisão interna, salvar a base
original e gerar uma tabela de resultados por código ou fórmulas documentadas.
Cada estudo pode ser reproduzido com outras bases, transformado em atividade de
grupo ou ampliado para relatório executivo.
6.21 Estudo resolvido — Meta de
tempo médio
Situação. Uma central de suporte afirma que o tempo médio de resolução é no
máximo 30 horas. Uma amostra aleatória de 49 chamados apresenta média de 32,4
horas e desvio-padrão de 8,4. A gerência deseja verificar se a média ultrapassa
a meta e qual é a magnitude plausível do desvio.
Estrutura
da análise. A resposta é quantitativa e existe uma
amostra. Como o desvio populacional é desconhecido, usa-se teste t de uma
amostra. As hipóteses direcionais são H0: μ≤30 e H1: μ>30. Também se calcula
intervalo bilateral de 95% para permitir leitura mais ampla.
Resolução. O erro-padrão é 8,4/√49=1,2. A estatística é (32,4−30)/1,2=2,0, com
48 graus de liberdade. O valor-p unilateral é próximo de 0,026. Para o
intervalo bilateral, t crítico é aproximadamente 2,01: 32,4±2,01×1,2,
resultando de 29,99 a 34,81 horas.
Interpretação. O teste unilateral encontra evidência de que a média supera 30,
segundo o plano definido. O intervalo bilateral quase toca 30 e mostra que o
excesso médio plausível pode variar de praticamente zero a 4,8 horas. A
estatística não informa quantos chamados foram muito longos; percentis e
distribuição devem complementar.
Uso
gerencial. A direção pode priorizar diagnóstico de
causas e fixar diferença mínima operacional. Se uma hora adicional já afeta
contrato, a evidência é relevante; se a tolerância é cinco horas, a conclusão
gerencial muda. Recomenda-se acompanhar amostra maior e separar por
complexidade.
Cuidado. Um teste unilateral só é justificável quando a direção foi definida
antes. Se uma média abaixo de 30 também seria usada para uma alegação de
melhoria, o teste bilateral seria mais coerente. Chamados repetidos do mesmo
cliente também podem violar independência.
EP =
8,4/√49 = 1,2; t = (32,4−30)/1,2 = 2,0
6.22 Estudo resolvido — Processos
com variâncias diferentes
Situação. Duas linhas de separação de pedidos são comparadas. A linha A tem
n=60, média de 14,8 minutos e desvio 5,5; a linha B tem n=42, média 12,1 e
desvio 9,0. A segunda parece mais rápida, mas muito mais variável.
Estrutura
da análise. Como os grupos são independentes e as
dispersões diferem, usa-se t de Welch. Antes do teste, gráficos devem verificar
assimetria e valores extremos. A diferença de interesse é A−B; valor positivo
favorece B quando menor tempo é melhor.
Resolução. A diferença é 2,7 minutos. O erro-padrão é
√(5,5²/60+9²/42)=√(0,504+1,929)=1,560. t≈1,731. Com graus de liberdade
aproximados, o intervalo de 95% usa crítico perto de 1,99: 2,7±3,10, ou de
−0,40 a 5,80.
Interpretação. A amostra não permite afirmar diferença média com segurança a 5%,
embora a estimativa favoreça B. A grande variabilidade de B pode gerar atrasos
extremos, tornando inadequado escolher apenas pela média. A comparação de
quantis e nível de serviço é necessária.
Uso
gerencial. Um piloto adicional pode focar causas da
dispersão na linha B. Se a organização conseguir estabilizá-la sem perder a
vantagem média, a decisão pode mudar. Também se pode modelar tempo por tipo de
pedido e turno.
Cuidado. Usar o teste com variâncias agrupadas seria questionável. Além
disso, linha e turno podem estar confundidos. Se cada linha opera em períodos
distintos, o desenho não separa tecnologia de contexto.
EP
de Welch = √(5,5²/60 + 9²/42) ≈ 1,560; IC95% ≈ [−0,40; 5,80]
6.23 Estudo resolvido —
Produtividade antes e depois
Situação. Vinte e quatro pessoas são avaliadas antes e depois de uma mudança
de sistema. A diferença depois menos antes tem média 6,5 unidades e desvio 9,6.
A equipe quer saber se houve melhora e se o efeito é material.
Estrutura
da análise. O desenho é pareado, pois as mesmas
pessoas foram medidas. O teste deve usar as diferenças. H0: μd=0; H1: μd≠0. Um
gráfico das diferenças e a identificação de casos extremos antecedem o cálculo.
Resolução. O erro-padrão é 9,6/√24≈1,960. t=6,5/1,960≈3,316, com 23 graus de
liberdade. Com crítico de 2,069, o intervalo é 6,5±4,06, ou de 2,44 a 10,56
unidades. O d padronizado para diferenças é 6,5/9,6≈0,68.
Interpretação. A melhora média é compatível com efeito de magnitude moderada. O
intervalo exclui zero e mostra que a melhoria populacional plausível pode ser
de cerca de 2,4 a 10,6 unidades. A distribuição pode revelar que algumas
pessoas perderam produtividade.
Uso
gerencial. A organização pode manter a mudança e
oferecer apoio a quem apresentou queda. Uma medição posterior verifica
persistência, pois ganhos iniciais podem refletir esforço temporário ou mudança
na composição das tarefas.
Cuidado. Sem grupo de controle, a atribuição causal é limitada. Se o período
posterior coincidiu com menor demanda ou bônus, parte da mudança pode ter outra
origem.
t
pareado ≈ 3,316; IC95% da melhora ≈ [2,44; 10,56]; d≈0,68
6.24 Estudo resolvido — Taxa de
renovação
Situação. Um serviço testa uma abordagem de contato. No grupo novo, 315 de
900 contratos foram renovados; no controle, 270 de 900. A equipe precisa
estimar ganho e decidir se a abordagem justifica custo adicional de R$18 por
contato.
Estrutura
da análise. As proporções são independentes e os
grupos têm o mesmo tamanho. Calcula-se diferença absoluta, intervalo e teste. O
ganho econômico deve usar margem por renovação, não apenas número de contratos.
Resolução. As taxas são 35% e 30%; diferença de 5 pontos percentuais. A
proporção combinada é 585/1.800=32,5%. EP sob
H0=√[0,325×0,675×(2/900)]≈0,02207. z≈2,266, com valor-p bilateral próximo de
0,023. O EP do intervalo é √[0,35×0,65/900+0,30×0,70/900]≈0,02205; IC≈0,05±0,0432,
de 0,68 a 9,32 pontos.
Interpretação. A abordagem provavelmente aumenta a renovação, mas o ganho pode ser
inferior a 1 ponto ou próximo de 9 pontos. Em 900 contatos, foram 45 renovações
adicionais observadas.
Uso
gerencial. O custo adicional total é R$16.200. O
ponto de equilíbrio exige margem superior a R$360 por renovação adicional se o
efeito observado se repetir. Cenários com os limites do intervalo devem ser
apresentados.
Cuidado. Se a randomização ocorreu por vendedor e não por contrato, a
unidade independente é vendedor. Tratar 1.800 contratos como independentes
subestimaria incerteza.
Diferença
= 5 p.p.; z≈2,266; IC95%≈[0,68; 9,32] p.p.
6.25 Estudo resolvido — Associação
entre região e reclamação
Situação. Uma empresa registra reclamação ou ausência de reclamação em três
regiões. Norte: 60 e 240; Centro: 45 e 255; Sul: 90 e 210. A pergunta é se a
taxa se associa à região.
Estrutura
da análise. Usa-se qui-quadrado de independência em
tabela 3×2. O total de reclamações é 195 em 900, taxa global 21,67%. Como cada
região tem 300 registros, o esperado é 65 reclamações e 235 sem reclamação por
região.
Resolução. As contribuições para reclamações são (60−65)²/65=0,385;
(45−65)²/65=6,154; (90−65)²/65=9,615. Para não reclamação: 25/235=0,106;
400/235=1,702; 625/235=2,660. χ²≈20,62, com 2 graus de liberdade. V de
Cramér=√[20,62/(900×1)]≈0,151.
Interpretação. A associação é estatisticamente clara, mas de intensidade pequena a
moderada. O Sul tem taxa de 30%, Centro 15% e Norte 20%. Resíduos apontam
Centro abaixo e Sul acima do esperado.
Uso
gerencial. A gerência deve investigar mix de
produtos, canais e cobertura de assistência no Sul. Uma regressão logística
pode controlar esses fatores. A associação justifica investigação direcionada,
não conclusão de que a região em si causa reclamações.
Cuidado. Registros podem estar agrupados por loja. Se poucas lojas
concentram dados, a independência é limitada. Também é necessário verificar se
a política de registrar reclamações é igual nas regiões.
χ²≈20,62;
gl=2; V de Cramér≈0,151
6.26 Estudo resolvido — ANOVA e
pós-teste
Situação. Quatro métodos de treinamento são avaliados em 15 pessoas cada. As
médias são 70, 74, 76 e 84. A ANOVA fornece SQ entre=1.620 e SQ dentro=5.040. A
direção quer saber se há diferença e qual método merece teste ampliado.
Estrutura
da análise. Com k=4 e N=60, gl entre=3 e dentro=56.
Calculam-se quadrados médios e F. Depois, um pós-teste como Tukey compara
pares. O tamanho do efeito ajuda a evitar decisão baseada apenas na
significância.
Resolução. QM entre=540; QM dentro=90; F=6,0. SQ total=6.660 e
η²=1.620/6.660≈0,243. O teste global é significativo. A diferença do método D
em relação a A é 14 pontos, a B 10 e a C 8; comparações menores entre A, B e C
podem não ser detectadas após ajuste.
Interpretação. Cerca de 24% da variação das notas está associada ao método na
amostra, efeito relevante. O método D é candidato, mas notas não garantem
desempenho no trabalho. O pós-teste e os intervalos indicam quais diferenças
são sustentadas.
Uso
gerencial. A empresa pode realizar piloto do D com
métricas de aplicação, custo e retenção. A escolha final deve usar benefício
por pessoa, tempo e acessibilidade.
Cuidado. Se pessoas escolheram voluntariamente o método, diferenças iniciais
podem explicar o resultado. Randomização ou medida prévia fortalece a
comparação.
F=(1620/3)/(5040/56)=6,0;
η²≈0,243
6.27 Estudo resolvido — Interação
entre canal e faixa etária
Situação. Uma empresa compara duas interfaces em pessoas mais jovens e mais
velhas. A versão B reduz tempo entre jovens, mas aumenta entre pessoas mais
velhas. A média global das versões é quase igual.
Estrutura
da análise. Uma ANOVA de dois fatores ou regressão
com interação deve incluir versão, faixa e versão×faixa. A pergunta principal
passa a ser se o efeito da versão varia por faixa. Um gráfico de médias é
indispensável.
Resolução. As médias fictícias são: jovens A=12, B=9; mais velhas A=15, B=18.
O efeito de B entre jovens é −3; entre mais velhas é +3. O efeito médio de B é
zero, enquanto a diferença de efeitos, a interação, é 6 minutos.
Interpretação. Ignorar interação levaria à conclusão errada de que as versões são
equivalentes. O resultado sugere personalização ou revisão de acessibilidade da
B para o segundo grupo.
Uso
gerencial. A empresa deve investigar quais
componentes geram dificuldade, testar uma versão adaptada e evitar segmentação
que reforce exclusão. A análise quantitativa orienta pesquisa com pessoas
usuárias.
Cuidado. Faixa etária pode representar experiência digital, visão ou
dispositivo. Uma análise ética evita tratar idade como explicação essencialista
e busca fatores modificáveis.
Interação
= (B−A nos mais velhos) − (B−A nos jovens) = 3 − (−3) = 6 min
6.28 Estudo resolvido —
Mann-Whitney em escala ordinal
Situação. Dois formatos de oficina recebem avaliações de 1 a 5. O formato A
tem muitos valores 4 e 5; B concentra 3 e 4. As distribuições são assimétricas
e a escala é ordinal.
Estrutura
da análise. Usa-se Mann-Whitney para comparar
distribuição de postos entre grupos independentes. Devem ser relatadas
medianas, frequências por categoria e medida de efeito, além do valor-p.
Resolução. Com nA=25 e nB=27, o software fornece U=225 e z=−2,20 quando B−A é
a direção codificada. Uma medida r=|z|/√N=2,20/√52≈0,305. A mediana de A é 5 e
de B é 4.
Interpretação. A evidência indica avaliações tendencialmente maiores em A, com
efeito moderado. Como a escala tem poucos pontos, a tabela completa mostra se a
diferença decorre de menos avaliações baixas ou mais avaliações máximas.
Uso
gerencial. O formato A pode ser mantido, mas a
equipe deve examinar participação, aprendizagem e acessibilidade. Satisfação
sozinha pode favorecer atividades agradáveis sem maior resultado.
Cuidado. Mann-Whitney não prova diferença de medianas se as formas das
distribuições variam de modo complexo. A interpretação como diferença
estocástica de postos é mais segura.
r =
|z|/√N ≈ 2,20/√52 = 0,305
6.29 Estudo resolvido — Wilcoxon
com poucos pares
Situação. Doze lojas recebem uma intervenção e têm variação percentual de
vendas antes/depois. As diferenças são muito assimétricas porque uma loja teve
grande campanha local.
Estrutura
da análise. Com poucos pares e assimetria, Wilcoxon
signed-rank é alternativa ao t pareado. Diferenças zero são tratadas conforme
regra do método; as demais são ordenadas por magnitude e recebem sinais.
Resolução. O resultado fornece W=68 e valor-p bilateral 0,041. A mediana da
diferença é 4,2%, e o intervalo não paramétrico estimado para deslocamento vai
aproximadamente de 0,3% a 8,1%. Sem a loja extrema, o valor-p é 0,058, mas a
mediana permanece positiva.
Interpretação. A conclusão é sensível ao pequeno tamanho, embora a direção seja
favorável. A análise de sensibilidade deve ser apresentada, sem remover a loja
apenas porque altera a significância.
Uso
gerencial. A intervenção pode continuar em piloto,
com coleta de mais períodos. A empresa também deve controlar campanhas locais e
tamanho das lojas.
Cuidado. O teste supõe distribuição das diferenças aproximadamente simétrica
para certas interpretações. Caso contrário, o teste de sinais é alternativa
mais simples, porém menos potente.
6.30 Estudo resolvido —
Kruskal-Wallis entre canais
Situação. Tempos de espera de quatro canais são fortemente assimétricos. As
medianas são 4, 5, 7 e 11 minutos, com tamanhos entre 35 e 50.
Estrutura
da análise. Kruskal-Wallis testa se distribuições
de postos diferem. Após resultado global, comparações de Dunn com ajuste
identificam pares. Boxplots ou violinos mostram caudas e sobreposição.
Resolução. O teste fornece H=18,7 com 3 graus de liberdade e p<0,001.
Comparações ajustadas indicam canal D maior que A e B; diferença D−C é
inconclusiva após correção. O epsilon-quadrado aproximado é (H−k+1)/(N−k). Com
N=170 e k=4, resulta 15,7/166≈0,095.
Interpretação. Existe diferença global e efeito próximo de 9,5% nos postos. O
canal D merece investigação, mas C também possui mediana alta. A organização
deve avaliar tipo de demanda e horários.
Uso
gerencial. Redirecionar pessoas do D para A sem
verificar capacidade pode transferir o problema. A análise deve alimentar
simulação ou estudo de filas.
Cuidado. Distribuições com formas diferentes dificultam resumir tudo como
mediana. A apresentação gráfica é necessária.
ε²≈(18,7−4+1)/(170−4)=15,7/166≈0,095
6.31 Estudo resolvido — Correlação
enganosa pelo tempo
Situação. Em 24 meses, seguidores e vendas apresentam correlação de Pearson
0,92. Ambas as séries cresceram ao longo do período. A direção conclui que
seguidores causam vendas.
Estrutura
da análise. A ordem temporal sugere tendência
comum. Deve-se observar gráficos, calcular variações mensais, controlar tempo
ou modelar séries. Correlação entre níveis pode ser espúria.
Resolução. Após remover tendência linear, a correlação entre resíduos cai para
0,28, com intervalo amplo. A correlação entre variações mensais é 0,19. O
resultado não elimina possível efeito, mas mostra que grande parte da
associação inicial vinha do crescimento conjunto.
Interpretação. O coeficiente 0,92 não sustenta causalidade. Seguidores podem
crescer porque vendas e marca aumentam, ou ambos responderem à campanha. Um
experimento ou variável temporal mais detalhada é necessário.
Uso
gerencial. A equipe deve usar métricas de exposição
e conversão, testar campanhas e evitar usar seguidores como única meta. A
correlação pode permanecer útil como indicador descritivo, não como retorno
marginal.
Cuidado. Diferenciar séries pode aumentar ruído. A solução não é aplicar
transformação mecanicamente, mas construir modelo compatível e validar
previsões.
6.32 Estudo resolvido — Regressão
simples e intervalo de previsão
Situação. Uma distribuidora relaciona quilômetros percorridos por rota ao
consumo de combustível. Em 40 rotas, a regressão estimada é
Consumo=18+0,085×Km, com erro residual de 7 litros. A equipe deseja prever uma
rota de 300 km.
Estrutura
da análise. A previsão pontual é obtida pela reta.
Para planejar abastecimento de uma rota individual, usa-se intervalo de
previsão, mais largo que o intervalo para a média, porque inclui variação do
caso e incerteza da reta.
Resolução. A previsão é 18+0,085×300=43,5 litros. Supondo erro-padrão de
previsão de 7,5 e crítico 2,02, o intervalo é 43,5±15,15, ou de 28,35 a 58,65
litros.
Interpretação. A faixa ampla mostra que distância não explica tudo. Carga,
tráfego, veículo e condução afetam consumo. Usar apenas 43,5 como quantidade
rígida pode gerar falta em parte das rotas.
Uso
gerencial. A empresa pode ampliar o modelo e usar
percentil superior para planejar, equilibrando sobra e risco. A previsão deve
ser recalibrada por tipo de veículo.
Cuidado. Se 300 km está fora da faixa observada, o intervalo calculado não
resolve o problema de extrapolação. É necessário verificar domínio dos dados.
Ŷ(300)=18+0,085×300=43,5
L; IP95%≈[28,35;58,65] L
6.33 Estudo resolvido — Regressão
múltipla de custos
Situação. Uma fábrica modela custo mensal em função de unidades produzidas,
horas extras e indicador de manutenção pesada. O modelo é
Custo=120.000+18×Unidades+55×HorasExtras+40.000×Manutenção.
Estrutura
da análise. Os coeficientes são interpretados
condicionalmente. A validação precisa verificar resíduos, sazonalidade e
multicolinearidade. O indicador de manutenção representa mudança no intercepto
nos meses em que ocorre.
Resolução. Para 8.000 unidades, 300 horas extras e manutenção pesada, o custo
previsto é 120.000+144.000+16.500+40.000=R$320.500. Sem manutenção, a previsão
seria R$280.500.
Interpretação. O modelo fornece estimativa para orçamento e separa um custo
episódico. O coeficiente de unidades não é necessariamente custo marginal
causal, pois produção pode responder à demanda e ao calendário.
Uso
gerencial. A controladoria pode usar o modelo como
benchmark flexível e investigar desvios, não como valor incontestável.
Intervalos e erros históricos devem acompanhar o orçamento.
Cuidado. Se horas extras crescem quando há manutenção, os coeficientes podem
ser instáveis. VIF e desenho da base precisam ser avaliados.
Custo
previsto = 120.000 + 18×8.000 + 55×300 + 40.000 = R$320.500
6.34 Estudo resolvido —
Indicadores e interação em regressão
Situação. Um modelo de produtividade inclui experiência, modalidade remota e
interação. A equação é Prod=50+1,2Exp−4Remota+0,5Exp×Remota, com experiência em
anos.
Estrutura
da análise. Para modalidade presencial, Remota=0 e
o efeito da experiência é 1,2 por ano. Para remota, o intercepto muda em −4 e a
inclinação passa a 1,7. A comparação depende da experiência.
Resolução. Com 2 anos, presencial prevê 52,4 e remota 49,4; diferença −3. Com
10 anos, presencial prevê 62 e remota 63; diferença +1. O ponto de cruzamento
resolve −4+0,5Exp=0, logo Exp=8 anos.
Interpretação. A modalidade remota associa-se a menor produtividade entre pessoas
menos experientes e vantagem pequena acima de oito anos, no modelo. Isso sugere
apoio inicial ou desenho híbrido.
Uso
gerencial. A gestão pode segmentar treinamento, mas
não deve usar previsão para excluir pessoas. Testes e intervalos dos efeitos
condicionais precisam ser apresentados.
Cuidado. Experiência pode estar associada a cargo e autonomia. Sem controles
adequados, a interação pode refletir composição diferente.
Diferença
Remota−Presencial = −4 + 0,5×Experiência; cruzamento em 8 anos
6.35 Estudo resolvido — Odds ratio
e probabilidade
Situação. Um modelo logístico de renovação estima coeficiente 0,405 para
contato consultivo e −0,06 por dia de atraso. A probabilidade de referência de
um contrato sem contato e sem atraso é 40%.
Estrutura
da análise. O odds ratio do contato é e^0,405≈1,50;
o de um dia de atraso é e^−0,06≈0,942. Para converter, transformam-se
probabilidades em chances e retornam-se a probabilidades.
Resolução. A chance de referência é 0,40/0,60=0,6667. Com contato, passa a
1,0, correspondendo a probabilidade 1/(1+1)=50%. Com contato e cinco dias de
atraso, multiplica-se por e^(−0,30)≈0,741: chance 0,741, probabilidade
0,741/1,741≈42,6%.
Interpretação. Um OR de 1,50 não significa aumento de 50 pontos nem de 50% na
probabilidade. O efeito depende da probabilidade inicial e dos demais fatores.
Uso
gerencial. A equipe pode priorizar contato precoce
e medir causalmente o efeito. A regressão observacional pode refletir seleção
de contratos com maior chance.
Cuidado. Limiar de classificação não deve ser escolhido apenas por 50%.
Custos de falso positivo e falso negativo orientam a regra.
p
com contato = (0,6667×1,50)/(1+0,6667×1,50)=50%
6.36 Estudo resolvido — Média
móvel e tendência
Situação. Uma loja registra demanda 420, 450, 470, 510, 530 e 570. A equipe
compara média móvel de três períodos com previsão ingênua.
Estrutura
da análise. Para prever o sétimo período, a média
móvel usa 510, 530 e 570. O ingênuo usa 570. A série apresenta tendência
ascendente, portanto ambos podem atrasar.
Resolução. A MM3 é 1.610/3=536,67; o ingênuo é 570. Se o valor real do sétimo
período for 600, os erros absolutos são 63,33 e 30. Uma tendência linear
simples nos seis pontos produz incremento médio próximo de 30 e previsão em
torno de 595.
Interpretação. Neste exemplo, o modelo com tendência é mais coerente. A escolha
não deve usar apenas o sétimo ponto; uma validação em várias origens compara
erros médios.
Uso
gerencial. O planejamento pode usar tendência como
base e cenário superior para estoque. Promoções futuras exigem ajuste externo.
Cuidado. Tendência passada não cresce indefinidamente. Limites de capacidade
e saturação podem alterar o padrão.
MM3=(510+530+570)/3=536,67;
ingênuo=570
6.37 Estudo resolvido — Suavização
exponencial e escolha de alfa
Situação. Uma empresa testa α=0,2 e α=0,7 em uma série volátil. A previsão
anterior é 100 e o observado é 130.
Estrutura
da análise. A atualização com α baixo reage
lentamente; com α alto, acompanha mais o último valor. A escolha depende da
estabilidade e é feita por erro de validação.
Resolução. Com α=0,2, nova previsão=0,2×130+0,8×100=106. Com α=0,7,
previsão=121. Se o aumento foi uma promoção isolada, 106 pode ser melhor; se
houve mudança de nível, 121 reage mais rápido.
Interpretação. Não existe alfa universal. O parâmetro representa compromisso entre
suavização e resposta. A equipe deve examinar erros após mudanças e em períodos
estáveis.
Uso
gerencial. Pode-se automatizar seleção por SSE em
treino, mas validar fora da amostra. Uma regra de intervenção para promoções
melhora o modelo.
Cuidado. A suavização simples não modela tendência e sazonalidade. Um alfa
ótimo não corrige especificação inadequada.
F(α=0,2)=106;
F(α=0,7)=121
6.38 Estudo resolvido — Métricas
de erro
Situação. Dois modelos produzem erros em quatro meses. Modelo A: 10, −10, 10,
−10. Modelo B: 0, 0, 0, 30. A empresa quer escolher pela média.
Estrutura
da análise. O erro médio de A é zero; de B é 7,5.
Porém devem ser calculados MAE e RMSE. A escolha depende do custo de grandes
erros.
Resolução. Para A, MAE=10 e RMSE=10. Para B, MAE=7,5 e RMSE=√(900/4)=15. B tem
menor erro absoluto médio, mas um erro grande. A é mais estável.
Interpretação. Se um erro de 30 causa ruptura grave, RMSE ou uma função de custo
favorece A. Se pequenos erros frequentes custam mais, B pode ser escolhido.
Nenhuma métrica resume todos os objetivos.
Uso
gerencial. O relatório deve apresentar mais de uma
métrica e os maiores erros. Também deve comparar com benchmark simples.
Cuidado. Selecionar a métrica depois de ver qual modelo vence é uma forma de
viés. Critérios devem ser definidos antes ou apresentados transparentemente.
A:
MAE=10, RMSE=10; B: MAE=7,5, RMSE=15
6.39 Estudo resolvido — Gráfico p
com tamanho variável
Situação. Uma operação monitora defeitos semanais. A taxa histórica é 3%. Em
uma semana, 12 defeitos aparecem em 250 unidades; em outra, 12 em 500.
Estrutura
da análise. Com tamanho variável, os limites do
gráfico p mudam por semana. Usa-se p̄±3√[p̄(1−p̄)/ni].
Resolução. Para n=250, EP=√(0,03×0,97/250)≈0,01079; LSC≈6,24%. A taxa 4,8%
está dentro. Para n=500, EP≈0,00763; LSC≈5,29%; a taxa 2,4% também está dentro.
A mesma contagem possui interpretação diferente por denominador.
Interpretação. Nenhuma semana apresenta sinal de 3 sigma. Isso não prova que o
processo atende especificação. A equipe continua monitorando padrões e metas.
Uso
gerencial. O painel deve exibir proporção e limites
específicos, evitando gráfico de contagem sem exposição. Mudanças no tamanho
não devem ser tratadas como mudança de qualidade.
Cuidado. Se as unidades variam muito em complexidade, a taxa simples pode
precisar estratificação ou modelo de risco.
LSC250≈6,24%;
LSC500≈5,29%
6.40 Estudo resolvido — Gráficos
X̄ e R
Situação. Uma fábrica coleta subgrupos de cinco medidas de peso por hora. A
média geral das médias é 500 g e a média das amplitudes é 12 g. Para n=5,
A2≈0,577, D3=0 e D4≈2,114.
Estrutura
da análise. Calculam-se limites do gráfico de
médias e de amplitude. O gráfico R deve ser avaliado antes, pois instabilidade
da dispersão compromete leitura do gráfico X̄.
Resolução. Para X̄: LSC=500+0,577×12=506,924; LIC=493,076. Para R:
LSC=2,114×12=25,368; LIC=0. Uma média horária de 508 está fora; uma amplitude
de 18 permanece dentro.
Interpretação. O sinal sugere deslocamento do nível sem aumento detectável de
dispersão. A equipe investiga calibração, lote de matéria-prima e ajuste de
máquina naquele horário.
Uso
gerencial. Após identificar causa e corrigir, o
ponto não é simplesmente apagado. O histórico documenta a causa e uma nova
linha-base pode ser construída com período estável.
Cuidado. Limites estimados com poucos subgrupos são incertos. Além disso,
amostras devem representar sequência racional; juntar itens de horas diferentes
pode mascarar variação.
LSC
X̄=506,924; LIC X̄=493,076; LSC R=25,368
6.41 Estudo resolvido —
Planejamento de teste A/B
Situação. Uma plataforma possui conversão de 12% e considera relevante elevar
para 14%. Deseja teste bilateral com α=5% e poder de 80%.
Estrutura
da análise. O cálculo exato pode ser feito por
software. Uma aproximação usa proporção média e valores z=1,96 e 0,84. O
resultado por grupo fica em torno de alguns milhares de usuários. O
planejamento deve considerar perdas e usuários únicos.
Resolução. Usando a fórmula aproximada para duas proporções, n por grupo
≈{1,96√[2×0,13×0,87]+0,84√[0,12×0,88+0,14×0,86]}²/(0,02)². O primeiro termo é
1,96×0,4756=0,932; o segundo 0,84×0,4754=0,399. Soma 1,331; quadrado 1,772;
dividido por 0,0004≈4.430 por grupo.
Interpretação. O experimento precisa de aproximadamente 8.860 pessoas antes de
acréscimos por exclusão. O número parece grande porque detectar 2 pontos exige
precisão. Se o efeito mínimo for menor, a amostra cresce rapidamente.
Uso
gerencial. A equipe deve avaliar se o ganho de 2
pontos paga o experimento e a mudança. Métrica de proteção e duração mínima por
ciclo semanal devem ser definidas.
Cuidado. Calcular em sessões e analisar usuários gera inconsistência.
Monitorar diariamente e parar ao alcançar p<0,05 também invalida a taxa de
erro sem método sequencial.
n
aproximado por grupo ≈ 4.430 pessoas
6.42 Estudo resolvido — Dados
ausentes em pesquisa
Situação. Uma pesquisa de clima tem 70% de resposta. A taxa é 85% em áreas
administrativas e 45% em operações. A média global respondente é 4,1 em escala
de 1 a 5.
Estrutura
da análise. Ausência está relacionada à área
observada, portanto a média simples pode super-representar administração. Devem
ser comparadas composições da população e da amostra; ponderação por área pode
corrigir parte do desequilíbrio se a não resposta for ignorável dentro de área.
Resolução. A população é 40% administrativa e 60% operacional. Entre
respondentes, é 56% e 44%. Médias por área são 4,3 e 3,7. Média simples
aproximada=0,56×4,3+0,44×3,7=4,036. Média ponderada pela
população=0,40×4,3+0,60×3,7=3,94.
Interpretação. A correção reduz a estimativa em cerca de 0,10. Ainda assim, quem
não respondeu em operações pode estar mais insatisfeito, viés não resolvido
pela ponderação. A diferença deve ser comunicada.
Uso
gerencial. A organização pode ampliar canais,
horário e confiança da pesquisa, além de analisar padrões de não resposta.
Resultados devem ser apresentados por área com tamanhos e incerteza.
Cuidado. Ponderação extrema aumenta variância. Também não se deve imputar
satisfação pela média sem análise do mecanismo.
Média
ponderada pela população = 0,40×4,3 + 0,60×3,7 = 3,94
6.43 Estudo resolvido —
Multiplicidade em painel de indicadores
Situação. Uma diretoria testa 30 indicadores para verificar mudanças mensais
e encontra dois valores-p abaixo de 0,05. Nenhuma hipótese principal havia sido
definida.
Estrutura
da análise. Sob nulidade global, o número esperado
de falsos positivos é 30×0,05=1,5. A probabilidade de pelo menos um falso
positivo é 1−0,95³⁰≈78,5%. Correções ou confirmação são necessárias.
Resolução. Bonferroni usaria α*=0,05/30≈0,00167, e nenhum dos dois resultados,
p=0,018 e 0,041, permaneceria. Um procedimento FDR pode ser menos rigoroso, mas
ainda exigiria ordenar valores e aplicar regra. Como a análise foi
exploratória, os achados devem gerar hipóteses para o próximo período.
Interpretação. Os dois sinais não são prova de mudança. A organização pode
examinar magnitude, coerência operacional e repetir a medição. Um gráfico de
controle talvez seja mais adequado que testes mensais independentes.
Uso
gerencial. A diretoria deve definir poucos
indicadores principais, limites e regras de investigação, mantendo o restante
como monitoramento exploratório.
Cuidado. Correção não substitui qualidade. Se existe evento operacional
conhecido, a análise contextual é importante; se os indicadores são altamente
correlacionados, Bonferroni pode ser conservador, mas destacar sem ajuste
continua inadequado.
P(≥1
falso positivo em 30 testes)=1−0,95³⁰≈78,5%
6.44 Estudo resolvido — Auditoria
de modelo de rotatividade
Situação. Um modelo logístico de rotatividade apresenta AUC 0,82 e acurácia
88%. A taxa de desligamento é 10%. A direção propõe usá-lo para classificar
pessoas.
Estrutura
da análise. A avaliação precisa comparar com
baseline de prever permanência para todas, que já teria 90% de acurácia. Devem
ser examinados sensibilidade, especificidade, precisão, calibração, desempenho
por grupo e finalidade.
Resolução. No limiar escolhido, a matriz é: 60 verdadeiros positivos, 140
falsos positivos, 40 falsos negativos e 760 verdadeiros negativos em 1.000
casos. Sensibilidade=60%; especificidade=84,44%; precisão=30%; acurácia=82%.
Cada alerta correto vem acompanhado por mais de dois falsos alertas.
Interpretação. A AUC indica capacidade de ordenação, mas o uso operacional depende
do limiar e do custo. Se a intervenção for apoio voluntário e benéfico, mais
falsos positivos podem ser toleráveis. Se houver consequência negativa, o uso é
inadequado.
Uso
gerencial. A recomendação é usar o modelo para
identificar condições de trabalho em grupos e oferecer recursos, não punir
indivíduos. A calibração e o desempenho por gênero, raça, deficiência, unidade
e contrato devem ser auditados conforme finalidade e legislação.
Cuidado. Variáveis podem funcionar como proxies de características
protegidas. Rotatividade futura também pode mudar após políticas, reduzindo
validade. Monitoramento e possibilidade de contestação são indispensáveis.
Sensibilidade=60/100=60%;
precisão=60/200=30%; especificidade=760/900≈84,44%
Laboratório de ferramentas:
planilha, R, Python e interfaces gráficas
A ferramenta deve ser escolhida pela
complexidade e pela possibilidade de reprodução. Planilhas permitem demonstrar
fórmulas, ordenar dados, criar tabelas e ajustar regressões simples. Elas são
acessíveis, mas fórmulas podem ser sobrescritas e etapas ficam dispersas.
Recomenda-se separar abas de dados brutos, preparação, análise e apresentação,
proteger células de fórmulas e registrar a data de atualização.
Em R ou Python, a análise pode ser
representada por um roteiro executável. O arquivo deve importar dados,
verificar tipos, tratar ausentes, criar variáveis, produzir tabelas e ajustar
modelos. Comentários explicam decisões substantivas. A vantagem não é apenas
velocidade: executar novamente o roteiro reduz inconsistências quando a base
muda. O código não dispensa revisão; uma função aceita argumentos incorretos e
ainda pode retornar uma tabela aparentemente plausível.
Jamovi, JASP e interfaces semelhantes
reduzem a barreira de programação. A pessoa estudante seleciona variáveis e
opções e visualiza resultados. É necessário salvar o projeto, registrar filtros
e compreender cada saída. Interfaces podem alterar padrões entre versões; a
documentação e a versão utilizada devem constar no trabalho.
Fluxo mínimo em qualquer
ferramenta
·
importar uma cópia da base sem
modificar o original;
·
verificar número de linhas,
identificadores e duplicidades;
·
conferir tipos, unidades,
categorias e códigos de ausência;
·
produzir estatísticas e
gráficos antes do modelo;
·
executar a técnica e salvar
estimativas, intervalos e diagnósticos;
·
comparar com cálculo manual
simples ou resultado esperado;
·
exportar tabelas sem copiar
mensagens ou números irrelevantes;
·
guardar arquivo, código,
dicionário e relatório na mesma versão.
Exemplo de organização em planilha
|
Aba |
Conteúdo |
Regra de controle |
|
01_brutos |
dados
recebidos, sem edição |
somente
leitura |
|
02_dicionario |
nome,
definição, tipo e unidade |
atualizar
com a base |
|
03_preparo |
filtros e
variáveis derivadas |
fórmulas
documentadas |
|
04_exploracao |
tabelas e
gráficos |
sem
conclusões confirmatórias |
|
05_modelos |
entradas e
saídas principais |
registrar
especificação |
|
06_relatorio |
quadros
finais |
referenciar
resultados, não redigitar |
Uma prática útil é incluir uma célula de
controle com contagem total e soma de uma variável-chave. Se esses valores
mudam inesperadamente após filtros, a pessoa analista identifica o problema. Em
código, testes equivalentes verificam unicidade, faixas e totais. Essa
disciplina operacional é parte da qualidade estatística.
Oficina de leitura crítica de
resultados
A seguir, algumas frases frequentes e
formas mais responsáveis de reescrevê-las. O objetivo é treinar comunicação,
pois muitos erros ocorrem depois do cálculo.
|
Afirmação problemática |
Reescrita recomendada |
|
“Não houve
diferença entre os grupos.” |
“A
diferença estimada foi X, com intervalo Y; os dados não permitiram excluir
efeitos dentro dessa faixa.” |
|
“A
campanha causou aumento porque p<0,05.” |
“No
experimento randomizado, a campanha elevou a taxa estimada em X p.p., IC Y.” |
|
“O modelo
explica 80% das vendas.” |
“Na
amostra, o modelo explicou 80% da variação; o desempenho fora da amostra foi
Z.” |
|
“O canal
tem pior atendimento.” |
“O canal
apresentou tempo maior, mas recebe demandas mais complexas; após ajuste, a
diferença foi X.” |
|
“A
previsão para dezembro é 10 mil.” |
“A
previsão pontual é 10 mil, com faixa e cenários; campanha e ruptura são
riscos.” |
|
“O
processo está dentro da meta porque está sob controle.” |
“O
processo está estatisticamente estável; sua capacidade frente à especificação
deve ser avaliada separadamente.” |
Um bom relatório também informa o
denominador, o período, a unidade e a fonte. “A inadimplência caiu 20%” é
ambíguo; pode significar redução relativa de 10% para 8%, isto é, 2 pontos
percentuais. A comunicação deve permitir que outra pessoa reconstrua a comparação.
Miniestudos setoriais adicionais
Varejo e promoções
Comparar vendas durante promoção com
período anterior ignora sazonalidade. Uma abordagem combina lojas de controle,
diferenças de mudança e modelo com calendário. A métrica principal pode ser
margem, não receita. Estoque e canibalização entram como efeitos de proteção.
A atividade sugerida é formular população,
unidade, resposta, comparação, método e principal risco de interpretação. Em
seguida, escrever uma conclusão de três frases: estimativa, incerteza e
decisão.
Universidade e evasão
Modelos podem identificar fatores
associados à evasão, mas notas e frequência são consequências e sinais, não
essência da pessoa estudante. O uso recomendado é oferecer apoio. Avaliação
deve considerar cursos, turnos e acesso, com proteção de dados.
A atividade sugerida é formular população,
unidade, resposta, comparação, método e principal risco de interpretação. Em
seguida, escrever uma conclusão de três frases: estimativa, incerteza e
decisão.
Hospital e tempo de permanência
A distribuição é assimétrica e depende de
diagnóstico. Medianas, quantis e modelos por caso são mais adequados que média
global. Reduzir permanência sem monitorar readmissão pode gerar incentivo
indesejável.
A atividade sugerida é formular população,
unidade, resposta, comparação, método e principal risco de interpretação. Em
seguida, escrever uma conclusão de três frases: estimativa, incerteza e
decisão.
Município e atendimento digital
Um teste pode avaliar lembrete de
documentos. A randomização por pessoa, taxa de conclusão e tempo são métricas.
Acessibilidade e exclusão digital precisam ser indicadores de proteção.
A atividade sugerida é formular população,
unidade, resposta, comparação, método e principal risco de interpretação. Em
seguida, escrever uma conclusão de três frases: estimativa, incerteza e
decisão.
Indústria e manutenção
Uma regressão pode relacionar falhas a
horas de uso, temperatura e lote. Séries e controle detectam mudança. A
substituição preventiva deve integrar custo de falha e disponibilidade, não
apenas probabilidade.
A atividade sugerida é formular população,
unidade, resposta, comparação, método e principal risco de interpretação. Em
seguida, escrever uma conclusão de três frases: estimativa, incerteza e
decisão.
Logística e promessa de prazo
Previsões de tempo devem ser calibradas por
rota e quantil. Prometer pela média gera atraso em grande parte. A avaliação
usa cobertura do intervalo e erro assimétrico.
A atividade sugerida é formular população,
unidade, resposta, comparação, método e principal risco de interpretação. Em
seguida, escrever uma conclusão de três frases: estimativa, incerteza e
decisão.
Finanças e cobrança
Experimentos de mensagens devem considerar
valor recuperado, reclamação e acordo sustentável. Aumentar pagamento imediato
com abordagem agressiva pode elevar risco jurídico e abandono.
A atividade sugerida é formular população,
unidade, resposta, comparação, método e principal risco de interpretação. Em
seguida, escrever uma conclusão de três frases: estimativa, incerteza e
decisão.
Cultura e participação
Pesquisas de público precisam alcançar
pessoas que não frequentam. Analisar apenas visitantes descreve experiência,
não barreiras de acesso. Amostragem territorial e métodos qualitativos
complementam.
A atividade sugerida é formular população,
unidade, resposta, comparação, método e principal risco de interpretação. Em
seguida, escrever uma conclusão de três frases: estimativa, incerteza e
decisão.
Aprofundamentos para interpretação
e governança
Os tópicos deste bloco ampliam a
compreensão das técnicas sem transformar a disciplina em um curso de
especialização. Eles são importantes porque problemas gerenciais raramente se
encaixam perfeitamente em um teste básico. O objetivo é reconhecer alternativas,
saber quando pedir apoio especializado e formular relatórios que não ocultem
incertezas.
Equivalência e não inferioridade
Testes tradicionais procuram evidência de
diferença. Quando a pergunta é demonstrar que um processo novo é
suficientemente semelhante ou não pior que o atual, a lógica precisa mudar. Em
equivalência, define-se uma faixa de diferenças aceitáveis, de −Δ a +Δ, e
verifica-se se o intervalo está inteiramente dentro dela. Em não inferioridade,
define-se uma margem unilateral de perda tolerável. A margem deve ser
substantiva e prévia, não escolhida para acomodar o resultado.
Suponha que um atendimento digital seja
mais barato e a empresa aceite perda máxima de 2 pontos percentuais na
resolução. A diferença digital menos presencial é −0,5 ponto, com intervalo de
95% de −2,8 a 1,8. Um teste comum não encontraria diferença e poderia ser
descrito erroneamente como equivalência. Contudo, o intervalo ultrapassa −2,
logo não demonstra não inferioridade. A amostra precisa ser ampliada ou o
serviço melhorado.
A aplicação gerencial exige justificar a
margem por custo, risco, contrato e impacto sobre pessoas. Margens muito largas
tornam o teste permissivo; margens muito estreitas exigem amostra enorme.
Também é necessário considerar adesão e análise por intenção de tratar em
experimentos. A ausência de significância nunca substitui um desenho de
equivalência.
Não
inferioridade: limite inferior do IC da diferença > −Δ
Bootstrap como ferramenta de
incerteza
Bootstrap utiliza reamostragens com
reposição da amostra observada para aproximar a distribuição de uma
estatística. É útil quando a fórmula do erro-padrão é complexa, para medianas,
razões e medidas de modelos. O procedimento sorteia muitas amostras do mesmo
tamanho, recalcula a estatística e usa a distribuição resultante para estimar
erro e intervalos.
Em uma base de 80 clientes, a mediana de
gasto é R$240. Dez mil reamostragens produzem percentis 2,5% e 97,5% de R$210 e
R$278. O intervalo bootstrap sugere incerteza da mediana. Diferente do
intervalo normal, ele não exige simetria da estatística. A interpretação ainda
depende de a amostra representar a população.
Bootstrap não corrige viés de seleção,
dependência ou base pequena sem informação. Se os dados são agrupados por loja,
deve-se reamostrar lojas ou usar bootstrap em blocos, não clientes
individualmente. Em séries, blocos preservam dependência. A pessoa estudante
deve entender que reamostrar registros não cria informação nova; apenas explora
a variabilidade sugerida pelos dados.
Intervalo da média prevista e
intervalo de previsão
Na regressão, a previsão para um valor de X
pode ter dois intervalos. O intervalo da resposta média estima a média de todas
as unidades com aquele X. O intervalo de previsão refere-se a uma nova unidade
e inclui variação individual, por isso é mais largo. Confundir os dois leva a
promessas excessivamente precisas.
Uma empresa prevê ticket médio de clientes
com determinado perfil em R$500. O intervalo de 95% para a média pode ser de
R$480 a R$520, enquanto o intervalo para um cliente individual vai de R$180 a
R$820. Para orçamento agregado, o primeiro pode ser útil; para limite
individual, a dispersão do segundo é relevante. O contexto determina qual
responder.
Os intervalos dependem das premissas do
modelo e são mais estreitos perto do centro dos preditores. Observações com
combinações raras têm maior incerteza. Ferramentas devem ser configuradas para
retornar o tipo correto e o relatório deve nomeá-lo. Nenhum intervalo protege
contra mudança estrutural futura.
Tamanhos de efeito padronizados e
não padronizados
Diferenças em unidades originais são
diretamente interpretáveis: minutos, reais, pontos percentuais. Medidas
padronizadas permitem comparar resultados em escalas diferentes, como Cohen d,
correlação e η². Elas dividem a diferença por uma medida de dispersão ou
expressam proporção de variância. O uso conjunto é preferível.
Um treinamento aumenta nota em 4 pontos com
desvio agrupado 8, d=0,50. Em outra prova, aumenta 10 pontos com desvio 30,
d=0,33. A primeira mudança é maior em desvios, embora a segunda seja maior em
pontos. Ainda assim, a relevância depende do que os pontos representam. Um d
pequeno pode ser importante quando aplicado a milhares de pessoas ou a desfecho
crítico.
Classificações rígidas de pequeno, médio e
grande são apenas referências históricas e podem ser inadequadas. O relatório
deve apresentar intervalo do efeito, comparação com diferença mínima relevante
e custo. Para proporções, risco relativo, diferença absoluta e número
necessário para tratar podem oferecer perspectivas complementares.
d de
Cohen = (x̄1 − x̄2) / s agrupado
ANCOVA e ajuste por medida inicial
Análise de covariância combina comparação
de grupos com regressão, ajustando uma variável quantitativa. Em estudos com
medida antes e depois, ajustar o valor inicial pode aumentar precisão e lidar
com pequenos desequilíbrios. O modelo pós = grupo + pré estima diferença
ajustada no pós.
Imagine dois grupos de treinamento. Antes,
o experimental tinha média 68 e o controle 72; depois, 80 e 78. Comparar apenas
pós sugere vantagem de 2; comparar mudanças sugere 6; ANCOVA estima o efeito
considerando relação entre pré e pós. Dependendo da correlação, a estimativa
ajustada pode ficar próxima de 5. O método evita parte da regressão à média e
usa informação inicial.
A covariável deve ser medida antes da
intervenção e não ser afetada por ela. Ajustar mediadores pode remover parte do
efeito. Também se verifica homogeneidade das inclinações: a relação entre pré e
pós deve ser semelhante entre grupos, salvo interação modelada. ANCOVA não
transforma estudo não randomizado em experimento causal.
Medidas repetidas e estrutura de
dependência
Quando a mesma unidade é observada em mais
de dois momentos, testes pareados separados ignoram correlação e
multiplicidade. ANOVA de medidas repetidas ou modelos mistos representam a
dependência. Modelos mistos permitem números diferentes de observações e
efeitos aleatórios para unidades, sendo comuns em dados longitudinais e
hierárquicos.
Uma rede mede satisfação mensal por loja
durante seis meses. Observações da mesma loja são mais parecidas. Uma regressão
comum com 600 linhas tratadas como independentes produz erros-padrão pequenos.
Um modelo com intercepto aleatório por loja separa variação entre e dentro de
lojas e estima tendência média.
A disciplina introdutória deve reconhecer o
problema e evitar pseudo-replicação. Se não houver ferramenta para modelo
misto, pode-se resumir por unidade, usar diferenças ou buscar apoio. Mais
registros dentro da mesma unidade não equivalem ao mesmo número de unidades
independentes. O relatório deve declarar nível de agrupamento.
Erros-padrão robustos e agrupados
Na regressão linear, erros-padrão clássicos
assumem variância constante. Erros robustos a heterocedasticidade ajustam a
inferência sem alterar os coeficientes. Quando observações são agrupadas, erros
agrupados permitem correlação dentro de grupos, desde que haja número
suficiente de grupos.
Um modelo de vendas por pedido possui
milhões de linhas, mas apenas 20 lojas. Se campanhas variam por loja, a
informação independente para esse efeito está mais próxima de 20 que de
milhões. Erro agrupado por loja pode aumentar muito a incerteza. Com poucos
grupos, aproximações usuais também são frágeis.
A escolha do nível de agrupamento segue o
desenho e o mecanismo de correlação, não o resultado desejado. Erros robustos
não corrigem variável omitida ou causalidade. O relatório deve registrar qual
matriz de variância foi usada. Em experimentos por conglomerados, o tamanho
amostral deve ser planejado considerando correlação intraclasse.
Validação cruzada e separação
treino-teste
Modelos ajustados e avaliados na mesma base
parecem melhores do que realmente são. Separar treino e teste oferece
estimativa mais honesta. Em bases pequenas, validação cruzada divide os dados
em partes, treina em algumas e avalia na restante, repetindo o processo. Todas
as etapas de preparação que aprendem com dados devem ocorrer dentro do treino
para evitar vazamento.
Uma regressão com 30 preditores apresenta
R² de 0,70 no treino, mas R² de 0,32 no teste. O modelo capturou padrões
específicos. Uma versão com oito preditores tem R² de 0,61 no treino e 0,48 no
teste, podendo generalizar melhor. A seleção depende do objetivo e da
estabilidade.
Dados temporais não devem ser embaralhados:
treina-se no passado e testa-se no futuro. Grupos relacionados precisam ficar
juntos na divisão. Validação é um desenho de avaliação, não um comando
automático. Repetir muitas escolhas no mesmo teste também o transforma em
treino; idealmente há conjunto final preservado.
Calibração, discriminação e
limiares
Em modelos binários, discriminação mede
capacidade de ordenar casos de maior e menor risco; calibração compara
probabilidades previstas às frequências observadas. Um modelo pode ter AUC alta
e prever 80% quando apenas 50% ocorrem, o que é ruim para planejamento.
Gráficos e medidas de calibração complementam ROC.
O limiar converte probabilidade em classe.
Baixá-lo aumenta sensibilidade e falsos positivos; elevá-lo faz o contrário. A
escolha deve refletir custo, capacidade de intervenção e direitos. Em triagem
de suporte, falso positivo pode gerar oferta adicional de ajuda; em negativa de
serviço, o custo social e jurídico é muito maior.
Avaliação por subgrupos é necessária. A
mesma AUC global pode esconder calibração distinta. Se um modelo passa a
orientar decisões, dados e comportamento mudam, gerando retroalimentação. O
monitoramento deve incluir distribuição de escores, resultados reais,
reclamações e revisão humana.
Decomposição sazonal e intervenção
Decomposição separa uma série em tendência,
sazonalidade e restante, de forma aditiva ou multiplicativa. No modelo aditivo,
variação sazonal tem magnitude semelhante; no multiplicativo, cresce com o
nível. A escolha pode ser apoiada por gráfico e transformação logarítmica.
Uma rede observa picos de 30% todo dezembro
e crescimento de longo prazo. Um modelo que ignora sazonalidade subestima
dezembro e superestima janeiro. Após uma mudança de sistema em julho, a série
sofre queda temporária; um indicador de intervenção evita que o modelo
interprete o evento como tendência permanente.
A decomposição descritiva não garante
previsão. Componentes podem mudar. Feriados móveis, promoções e dias úteis
precisam ser representados. Ao comunicar, deve-se separar crescimento
dessazonalizado de comparação bruta. Uma queda mensal pode coexistir com
crescimento contra o mesmo mês do ano anterior.
Análise de capacidade do processo
Controle estatístico avalia estabilidade;
capacidade compara processo estável às especificações. Índices Cp e Cpk usam
amplitude de especificação e desvio. Cp mede capacidade potencial se centrado;
Cpk considera deslocamento da média. Eles pressupõem distribuição e
estabilidade adequadas.
Com limites de 95 e 105, média 102 e σ=1,
Cp=(105−95)/(6×1)=1,667.
Cpk=min[(105−102)/(3×1),(102−95)/(3×1)]=min(1,0,2,333)=1,0. O processo tem
dispersão potencial boa, mas está deslocado para o limite superior.
A ação é recentrar, não necessariamente
reduzir variabilidade. Calcular Cpk em processo instável produz resumo sem
significado operacional. Em dados não normais, métodos por percentis podem ser
preferíveis. Especificações devem vir de necessidade de cliente, técnica ou
norma, não ser definidas para melhorar o índice.
Cp=(LSE−LIE)/(6σ);
Cpk=min[(LSE−μ)/(3σ),(μ−LIE)/(3σ)]
Pesos amostrais e efeito de
desenho
Pesquisas estratificadas ou com
probabilidades desiguais usam pesos inversos à probabilidade de seleção,
ajustados por não resposta e calibração. A média ponderada representa a
população-alvo, mas a variância precisa considerar desenho. Tratar pesos apenas
como repetição de linhas pode produzir erros incorretos.
Se pequenas unidades foram superamostradas
para permitir análise, a média sem pesos lhes dá influência excessiva. Os pesos
restauram composição global. Contudo, pesos muito variáveis aumentam erro; o
efeito de desenho quantifica perda de precisão em relação à amostra aleatória
simples.
Relatórios devem informar amostra não
ponderada, estimativa ponderada, método e base dos pesos. Para análise por
estrato, pesos podem ter outro papel. Em softwares, módulos de survey
representam estratos, conglomerados e pesos. Uma grande pesquisa não é automaticamente
precisa se o número de conglomerados é pequeno.
Princípios de análise reproduzível
Reprodutibilidade significa que outra
pessoa autorizada consegue executar o mesmo processo e obter os resultados,
usando base e instruções. Isso exige nomes claros, dicionário, código ou
fórmulas, ambiente, versões, critérios de exclusão, sementes e data de corte. A
documentação deve ser proporcional ao risco da decisão.
Uma pasta pode conter README, dados brutos
protegidos, dados preparados, código, saídas e relatório. O arquivo de saída
não deve ser editado manualmente para “corrigir” números; mudanças devem
ocorrer na fonte. Tabelas finais podem ser geradas automaticamente. Revisão por
pares verifica se a conclusão corresponde ao cálculo.
Reprodutibilidade não elimina
confidencialidade. Dados identificáveis permanecem sob acesso restrito, e
versões anonimizadas ou sintéticas podem apoiar ensino. Logs, controle de
versão e aprovação são importantes para modelos regulados. A cultura de documentação
também reduz dependência de uma única pessoa e facilita atualização.
Ética da inferência e distribuição
dos efeitos
Uma média positiva pode esconder prejuízo
em grupos. Toda análise com impacto sobre pessoas deve examinar heterogeneidade
e consequências. Isso não significa realizar centenas de testes sem plano;
significa definir grupos relevantes por direitos, acesso e teoria, proteger
privacidade e interpretar amostras pequenas com cautela.
Experimentos precisam de proporcionalidade
entre risco e benefício. Uma mensagem pode ser randomizada, mas negar serviço
essencial para teste pode ser eticamente inadequado. Consentimento,
transparência e supervisão dependem do contexto. Dados disponíveis tecnicamente
não são automaticamente legítimos para qualquer finalidade.
A conclusão estatística deve ser
contestável. Pessoas afetadas precisam de canais de revisão quando modelos
influenciam decisões. Indicadores não podem substituir julgamento responsável.
A disciplina forma administradoras(es) capazes de perguntar quem ganha, quem
perde, quem ficou fora da amostra e quais erros são tolerados.
Quadro de premissas e respostas
possíveis
|
Problema identificado |
Sinal |
Respostas possíveis |
|
dependência |
repetições
por pessoa, loja ou tempo |
pareamento,
agregação, modelo misto, erros agrupados |
|
heterocedasticidade |
resíduos
em funil |
erros
robustos, transformação, modelo da variância |
|
não
linearidade |
curva nos
resíduos |
termos
polinomiais, transformação, modelo não linear |
|
outlier
influente |
Cook alto
ou mudança de coeficiente |
verificar,
explicar, sensibilidade, modelo robusto |
|
multicolinearidade |
VIF e
coeficientes instáveis |
reformular
variáveis, teoria, regularização futura |
|
dados
ausentes |
padrões
por grupo ou variável |
melhorar
coleta, ponderar, imputar com cautela |
|
multiplicidade |
muitos
testes/segmentos |
hipótese
principal, ajuste, validação |
|
mudança
temporal |
erro
cresce após evento |
recalibrar,
intervenção, nova linha-base |
|
desbalanceamento |
evento
raro |
métricas
adequadas, pesos, amostragem e calibração |
|
viés de
seleção |
amostra de
conveniência |
redesenhar
coleta, ponderar quando defensável, limitar conclusão |
Atividade integradora de revisão
por pares
Cada grupo recebe uma análise curta de
outro grupo e aplica o checklist: pergunta, unidade, desenho, preparação,
método, premissas, resultados, linguagem causal, visual e decisão. O objetivo
não é apenas apontar erros, mas propor uma versão melhor. A devolutiva deve
separar problemas que alteram o resultado de melhorias de apresentação.
Uma rodada pode usar relatórios
intencionalmente problemáticos: teste independente em dados pareados; conclusão
de igualdade por p>0,05; regressão extrapolada; A/B encerrado cedo; previsão
avaliada no treino; gráfico de controle comparado a meta. A turma reescreve a
conclusão e indica dados adicionais. Essa prática desenvolve julgamento mais do
que repetir fórmulas.
Oficina adicional de interpretação
de saídas
Os dez exercícios seguintes simulam trechos
de relatórios ou saídas de software. A tarefa central é interpretar,
identificar o que falta e propor uma decisão proporcional à evidência. Eles
podem ser utilizados como estudo individual, discussão em grupo ou avaliação
formativa.
6.45 Saída de teste t com amostra
enorme
Uma base de 120 mil transações compara
ticket médio de dois canais. A diferença é R$0,42, IC95% de R$0,18 a R$0,66 e
p<0,001. A saída também mostra desvios de aproximadamente R$40. O resultado
é estatisticamente detectável porque a amostra é grande, mas a magnitude é
pequena em relação à dispersão. A análise deve converter R$0,42 em margem
total, considerar custo do canal e verificar composição. A conclusão
recomendada é que existe pequena diferença média, não que um canal é “muito
melhor”. Também se deve investigar dependência por cliente, porque transações
repetidas podem tornar o intervalo estreito demais.
Perguntas
de revisão: Qual é a estimativa principal? A
incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação
adicional mudaria a recomendação?
6.46 Saída de ANOVA não
significativa
Quatro unidades apresentam médias 7,2, 7,5,
7,8 e 8,4, com amostras de apenas oito casos e desvios elevados. A ANOVA produz
p=0,11 e η²=0,18. Não se deve concluir que as unidades são iguais. O efeito
estimado não é pequeno, mas a incerteza é alta. Intervalos, dados brutos e
poder devem ser examinados. A decisão pode ser ampliar amostra ou usar o
resultado como exploratório. Se 1,2 ponto entre extremos é material, a pesquisa
está inconclusiva. Um relatório responsável descreve a faixa e evita
transformar o limiar de 5% em fronteira entre existência e inexistência.
Perguntas
de revisão: Qual é a estimativa principal? A
incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação
adicional mudaria a recomendação?
6.47 Saída de regressão com R²
baixo
Um modelo de satisfação possui R²=0,12, mas
o coeficiente de tempo de espera é −0,08 ponto por minuto, IC de −0,11 a −0,05.
R² baixo não invalida o coeficiente: satisfação depende de muitos fatores e
possui variabilidade individual. O modelo pode estimar uma associação média
útil, embora não preveja bem pessoas. A direção pode avaliar impacto de reduzir
dez minutos, aproximadamente 0,8 ponto no modelo, e testar operacionalmente.
Deve-se verificar linearidade, confundidores e escala. Explicação e previsão são
objetivos distintos.
Perguntas
de revisão: Qual é a estimativa principal? A
incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação
adicional mudaria a recomendação?
6.48 Saída de regressão com R²
muito alto
Um modelo mensal de receita em função do
tempo apresenta R²=0,98. Isso pode refletir tendência e não mecanismo
econômico. Resíduos podem ser autocorrelacionados e uma regressão entre séries
crescentes produzir significância espúria. A análise deve verificar
estacionariedade, diferenças, sazonalidade e validação futura. Para previsão,
comparar com tendência ingênua. Para causalidade, tempo não explica a receita;
ele representa fatores que evoluíram. R² alto é convite ao diagnóstico, não
certificado de verdade.
Perguntas
de revisão: Qual é a estimativa principal? A
incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação
adicional mudaria a recomendação?
6.49 Coeficiente com sinal
inesperado
Em uma regressão de vendas, publicidade tem
coeficiente negativo depois de controlar região e produto, embora a correlação
simples seja positiva. Pode existir confundimento, multicolinearidade,
simultaneidade ou alocação de publicidade para produtos em dificuldade. A
equipe deve verificar especificação, VIF, cronologia e regras de investimento.
O sinal não prova que publicidade reduz vendas. Um experimento, variável
defasada ou desenho causal pode ser necessário. Remover controles até o sinal
ficar positivo seria inadequado.
Perguntas
de revisão: Qual é a estimativa principal? A
incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação
adicional mudaria a recomendação?
6.50 Valor-p diferente entre
softwares
Dois programas retornam p=0,048 e p=0,056
para a mesma comparação. As possíveis causas incluem teste de Welch versus
variâncias iguais, alternativa unilateral versus bilateral, tratamento de
ausentes, arredondamento ou teste exato. A pessoa analista deve comparar n,
estatística, graus de liberdade e opções. A decisão não deveria mudar
radicalmente entre “funciona” e “não funciona”, pois ambos indicam evidência
limítrofe. Estimativa e intervalo provavelmente são semelhantes. O relatório
registra o método escolhido antes de interpretar.
Perguntas
de revisão: Qual é a estimativa principal? A
incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação
adicional mudaria a recomendação?
6.51 Intervalo amplo em regressão
logística
Um odds ratio de 2,4 para determinado fator
possui IC95% de 0,8 a 7,3. A estimativa central é alta, mas a incerteza inclui
redução e grande aumento das chances. O resultado pode decorrer de poucos
eventos ou separação. Não se deve anunciar risco 2,4 vezes maior como conclusão
firme. A ação pode ser coletar mais dados, combinar categorias com
justificativa ou usar método penalizado em análise especializada. A frequência
dos eventos e probabilidades previstas devem acompanhar odds.
Perguntas
de revisão: Qual é a estimativa principal? A
incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação
adicional mudaria a recomendação?
6.52 Previsão com bom erro médio e
viés
Um modelo tem MAE baixo, mas erro médio de
−200 unidades, indicando que previsão menos realizado é negativa e o sistema
subestima consistentemente. A tendência de viés pode causar rupturas mesmo com
MAE competitivo. É necessário calibrar nível, verificar promoção e comparar
custo assimétrico. Um ajuste simples de +200 pode melhorar curto prazo, mas
deve-se investigar causa. Métricas agregadas por produto podem esconder viés em
itens de maior valor. A validação deve incluir erro percentual e cobertura de
intervalos.
Perguntas
de revisão: Qual é a estimativa principal? A
incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação
adicional mudaria a recomendação?
6.53 Gráfico de controle com
muitos ajustes
Uma equipe altera a máquina sempre que um
ponto fica acima ou abaixo da média, mesmo dentro dos limites. Essa
super-reação, chamada tampering, pode aumentar variabilidade. A linha central
não é meta para cada observação. A ação correta é investigar sinais definidos,
como ponto fora do limite ou sequência não aleatória, e melhorar o sistema para
reduzir causas comuns. Metas e especificações são analisadas separadamente. O
gráfico precisa ser acompanhado por plano de reação e registro de causas.
Perguntas
de revisão: Qual é a estimativa principal? A
incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação
adicional mudaria a recomendação?
6.54 Teste A/B com métrica
secundária favorável
Um experimento foi dimensionado para
conversão, que não mudou. Entre quinze métricas secundárias, tempo na página
teve p=0,03 e a equipe anuncia sucesso. A multiplicidade torna o achado
exploratório. Além disso, mais tempo pode significar interesse ou dificuldade.
A conclusão adequada é que a hipótese principal não foi confirmada; existe
sinal secundário a investigar em novo teste. Métricas de proteção e direção
desejada devem ser definidas antes. Selecionar a única saída favorável reduz
credibilidade e pode desperdiçar recursos.
Perguntas
de revisão: Qual é a estimativa principal? A
incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação
adicional mudaria a recomendação?
Exercício de construção de um
parecer estatístico
Escolha um dos casos e produza um parecer
de uma página com seis partes: contexto; método; resultado; relevância prática;
riscos; recomendação. O parecer não deve usar jargão sem explicação e precisa
incluir pelo menos uma medida em unidade original. A versão técnica anexa deve
registrar hipótese, nível de significância, tratamento de ausentes e
ferramenta. Uma pessoa colega revisa o texto e marca frases que pareçam mais
firmes que a evidência.
Como critério de qualidade, a recomendação
deve continuar defensável se o valor-p mudar ligeiramente ao redor de 0,05.
Isso força o uso de intervalo, magnitude e contexto. A análise também deve
informar se o resultado é confirmatório ou exploratório. Em decisões de alto
impacto, recomenda-se revisão independente antes da implementação.
Projeto aplicado: do problema ao
monitoramento
O projeto aplicado pode ser desenvolvido
individualmente ou em grupo e deve partir de uma decisão realista, não apenas
de uma base disponível. Exemplos incluem comparar modalidades de atendimento,
avaliar um treinamento, prever demanda ou monitorar qualidade. O produto final
possui uma nota executiva e um apêndice técnico. A nota apresenta o que deve
ser decidido; o apêndice permite reproduzir a análise.
Etapa 1 — Enquadrar a pergunta
Escreva a pergunta em uma frase com
população, resposta, comparação e período. “Analisar vendas” é amplo; “estimar
se a nova exposição elevou a conversão de visitantes únicos durante quatro
semanas, sem aumentar devolução” é operacional. Defina quem utilizará o
resultado e qual ação é possível. Uma análise sem decisão associada pode
produzir muitas tabelas e pouca utilidade.
Registre a diferença mínima relevante. Para
uma taxa, pode ser 1,5 ponto percentual; para tempo, dois minutos. Explique por
que esse limiar importa em termos de custo, contrato, capacidade ou
experiência. A escolha anterior aos resultados reduz a tendência de considerar
relevante qualquer diferença significativa.
Etapa 2 — Mapear o processo de
geração dos dados
Desenhe como cada registro nasce, quais
sistemas intervêm e onde podem ocorrer erros. Identifique a unidade
independente: pessoa, pedido, loja, equipe ou período. Marque repetições e
agrupamentos. Um banco com cem mil linhas pode representar apenas cem clientes
muito ativos. A estrutura de dependência determina erro-padrão e nível de
análise.
Verifique mudanças de definição, migração
de sistema, indisponibilidade, campanhas e regras de registro. Datas e fusos
precisam ser consistentes. Um dicionário informa nome, descrição, tipo, unidade
e códigos. Variáveis derivadas devem ter fórmula explícita. A auditoria inicial
evita que o modelo explique artefatos administrativos.
Etapa 3 — Criar plano de análise
O plano lista hipótese principal, métricas
secundárias, exclusões, tratamento de ausentes, método, nível de confiança e
diagnósticos. Em estudo exploratório, registre que hipóteses surgirão dos dados
e precisarão de confirmação. Em experimento, estabeleça duração e regra de
parada. O plano não precisa impedir aprendizagem; ele separa o que foi previsto
do que foi descoberto depois.
Inclua uma tabela ligando pergunta a
método. Uma média contra meta sugere t de uma amostra; grupos independentes,
Welch; quatro grupos, ANOVA; resposta binária com controles, logística; série,
validação temporal. Para cada método, indique premissas e alternativa se elas
falharem.
Etapa 4 — Explorar sem antecipar
conclusões
Produza contagens, ausentes, distribuição,
boxplots, dispersões e séries. Compare amostra com população quando houver
informação. Procure valores impossíveis e categorias raras. A exploração ajuda
a entender a base, mas não deve ser usada para testar dezenas de versões até
encontrar uma narrativa. Gráficos exploratórios podem ser mais numerosos que os
publicados.
Registre decisões: por que um valor foi
corrigido, por que uma categoria foi combinada e como um indicador foi
construído. Preserve uma variável original quando fizer transformação. Compare
resultados com e sem casos influentes, mas não escolha apenas a versão
favorável. Sensibilidade é evidência sobre estabilidade da conclusão.
Etapa 5 — Executar, diagnosticar e
validar
Calcule estimativas em unidades originais,
intervalos e tamanhos de efeito. O valor-p aparece como complemento. Em
regressão, examine resíduos, linearidade, influência e colinearidade. Em
previsão, use divisão temporal e benchmark. Em classificação, avalie
calibração, discriminação e limiar. Em gráficos de controle, estabeleça
linha-base antes de procurar sinais.
Faça pelo menos uma verificação
independente: cálculo manual de caso simples, segunda ferramenta, revisão por
colega ou reprodução em amostra separada. Resultados inesperados merecem
investigação, não correção automática. Se a técnica não é adequada, o relatório
pode concluir que os dados não sustentam a pergunta e recomendar novo desenho.
Etapa 6 — Converter evidência em
decisão
Transforme diferença estatística em
pessoas, tempo, receita, custo ou risco. Apresente cenários com limites do
intervalo. Uma campanha com ganho estimado de 3 pontos e intervalo de 1 a 5
pode ter retorno positivo em todo o intervalo ou apenas no centro. Essa análise
muda a segurança da recomendação.
A decisão deve incluir impactos colaterais,
capacidade e distribuição dos efeitos. Uma melhoria média pode piorar
acessibilidade. Uma previsão pode exigir reserva. Um modelo de risco pode gerar
muitos falsos alertas. Liste condições para implementação, responsáveis, prazo
e indicadores de proteção.
Etapa 7 — Comunicar para dois
públicos
A nota executiva utiliza título
informativo, três achados, recomendação e riscos. Evite despejar saída de
software. Gráficos devem ter escala, fonte, unidade e mensagem. O apêndice
técnico descreve base, método, fórmulas, software, premissas e diagnósticos. A
existência do apêndice permite simplificar a nota sem ocultar a análise.
Revise termos: “associação” em estudos
observacionais; “efeito” quando o desenho causal sustenta; “não foi detectada
diferença” em vez de “são iguais”; “previsão pontual e faixa” em vez de número
único. Indique arredondamento e denominador. Uma conclusão deve poder ser lida
sem acesso à conversa de quem analisou.
Etapa 8 — Monitorar e aprender
Depois da decisão, compare previsto e
realizado. Defina data de revisão, limite de desvio e responsável. Modelos
perdem validade quando processo, população ou incentivos mudam. Experimentos
podem ter efeito de curto prazo diferente do permanente. Acompanhamento
transforma análise em ciclo de aprendizagem.
Documente se a recomendação foi adotada,
quais adaptações ocorreram e por que o resultado divergiu. A pós-avaliação não
serve apenas para cobrar precisão; ela melhora dados e premissas. Uma
organização madura mantém memória das decisões, inclusive das análises que não
confirmaram a hipótese inicial.
Critérios de avaliação do projeto
·
clareza e relevância da
pergunta;
·
coerência entre desenho, dados
e método;
·
qualidade da preparação e
documentação;
·
correção dos cálculos e
diagnósticos;
·
uso conjunto de estimativa,
incerteza e relevância;
·
comunicação sem exagero causal;
·
consideração de ética,
privacidade e grupos afetados;
·
recomendação executável e plano
de monitoramento.
Matemática de apoio para
acompanhar os métodos
A disciplina utiliza álgebra, somatórios,
potências, raízes e logaritmos. Quando uma fórmula parecer extensa, identifique
primeiro o numerador, que normalmente representa sinal ou diferença, e o
denominador, que representa variabilidade ou escala. Estatísticas t e z seguem
essa estrutura. A interpretação pergunta quantos erros-padrão a estimativa está
distante da referência. Essa leitura reduz a dependência da memorização
literal.
Em regressão, o coeficiente é uma taxa de
variação. Unidades ajudam a conferir o cálculo: se Y está em minutos e X em
quilômetros, a inclinação está em minutos por quilômetro. Multiplicar pela
mudança de X produz minutos. Em regressão logística, o coeficiente está na
escala de log-chances e precisa ser exponenciado para odds ratio; converter
para probabilidade requer mais uma etapa. Anotar unidades ao lado dos
coeficientes previne interpretações incoerentes.
Graus de liberdade representam, de modo
simplificado, a quantidade de informação independente disponível após estimar
parâmetros. Na variância de uma amostra, usar a média calculada impõe uma
restrição e restam n−1 graus. Em ANOVA, os graus se dividem entre grupos e
dentro. Em regressão, a inclusão de muitos parâmetros consome informação e pode
ajustar ruído. Essa intuição explica por que modelos excessivos em amostras
pequenas são instáveis.
Logaritmos aparecem em modelos
multiplicativos, taxas e regressão logística. A diferença de logaritmos
aproxima variação relativa para mudanças pequenas. Transformar Y por log pode
reduzir assimetria e fazer efeitos serem interpretados em percentuais aproximados,
mas zeros e valores negativos exigem tratamento. Toda transformação precisa ser
justificada e revertida com cuidado na comunicação.
O arredondamento deve ocorrer no final.
Valores intermediários arredondados podem alterar estatísticas próximas ao
limiar. Em trabalhos, use três ou quatro casas nos cálculos e apresente duas ou
três conforme a unidade. Valores-p muito pequenos podem ser escritos como
p<0,001, não p=0. Intervalos devem usar o mesmo número de casas da
estimativa e manter coerência entre texto, tabela e gráfico.
Uma verificação dimensional e lógica é
recomendada: proporções devem ficar entre zero e um; variâncias não são
negativas; limite inferior de gráfico p pode ser truncado em zero; soma de
probabilidades deve ser um; previsão individual costuma ter intervalo mais
largo que a média; erro-padrão tende a diminuir com amostra maior. Se a saída
viola essas expectativas, revise fórmula, referência de célula, codificação e
unidade antes de interpretar.
7.
Exemplo Prático ou Estudo de Caso
Caso integrado: Rede Conecta
Serviços
A Rede Conecta Serviços opera centrais de
atendimento em quatro regiões e implantou um novo protocolo em duas delas. A
direção deseja saber se o protocolo reduziu o tempo de atendimento sem piorar
resolução ou satisfação, quais fatores explicam o tempo, como projetar demanda
e se o processo está estável. O estudo utiliza dados fictícios para fins
didáticos.
Perguntas gerenciais
·
o tempo médio caiu após o
protocolo nas unidades participantes?
·
a redução é diferente da
observada nas unidades que mantiveram o processo anterior?
·
as taxas de resolução diferem
entre protocolo e controle?
·
há diferença de satisfação
entre quatro regiões?
·
quais fatores estão associados
ao tempo de atendimento?
·
qual previsão de contatos para
os próximos meses?
·
o processo apresenta sinais de
causas especiais?
Estrutura da base
|
Variável |
Tipo |
Descrição |
|
tempo |
quantitativa
contínua |
minutos
por atendimento |
|
resolvido |
binária |
1 quando
resolvido no primeiro contato |
|
satisfação |
ordinal/quase
quantitativa |
escala de
1 a 5 |
|
protocolo |
binária |
novo ou
controle |
|
período |
binária |
antes ou
depois |
|
região |
categórica |
Norte,
Sul, Leste e Oeste |
|
complexidade |
quantitativa |
índice de
0 a 10 |
|
experiência |
quantitativa |
meses da
pessoa atendente |
|
mês |
temporal |
ordem
mensal |
|
contatos |
contagem |
volume
mensal |
Etapa 1 — Comparação pareada nas
unidades do protocolo
Uma amostra de 36 equipes possui média de
redução antes menos depois de 3,6 minutos, com desvio-padrão das diferenças de
6,0. O erro-padrão é 6/√36=1. A estatística t é 3,6/1=3,6, com 35 graus de
liberdade. O intervalo de 95% usa t crítico aproximado 2,03 e resulta 3,6±2,03,
ou 1,57 a 5,63 minutos.
t =
3,6 / (6 / √36) = 3,60
IC95%
da redução = 3,6 ± 2,03 × 1 = [1,57; 5,63] minutos
O resultado sugere redução média nas
unidades participantes. Contudo, um antes e depois isolado pode ser afetado por
sazonalidade. Por isso, a direção compara a mudança com unidades de controle.
Etapa 2 — Comparação das mudanças
Nas 36 equipes de protocolo, a mudança
média foi −3,6 minutos quando calculada depois menos antes. Em 34 equipes de
controle, a mudança foi −0,8, com desvios de 6,0 e 5,5. A diferença entre
mudanças é −2,8 minutos. O erro-padrão de Welch é √(36/36+30,25/34)=√1,8897≈1,375.
A estatística é −2,8/1,375≈−2,04.
Diferença
de mudanças = −3,6 − (−0,8) = −2,8 minutos
EP =
√(6²/36 + 5,5²/34) ≈ 1,375
t ≈
−2,8 / 1,375 = −2,04
O intervalo aproximado de 95% é
−2,8±1,995×1,375, resultando de cerca de −5,54 a −0,06. A evidência de efeito
adicional é limítrofe, mas a faixa favorece redução. A direção deve considerar
que a unidade de análise são equipes e que não houve randomização completa.
Etapa 3 — Taxa de resolução
No período posterior, o protocolo teve
1.020 resoluções em 1.200 contatos, taxa de 85%; o controle teve 792 em 960,
taxa de 82,5%. A diferença é 2,5 pontos percentuais. A proporção combinada é
1.812/2.160≈83,89%.
EP
sob H0 = √[0,8389×0,1611×(1/1200+1/960)] ≈ 0,0159
z =
0,025 / 0,0159 ≈ 1,57
O valor-p bilateral é aproximadamente
0,116. O intervalo não combinado para a diferença é aproximadamente 2,5±3,0
pontos, ou de −0,5 a 5,5. Não há evidência suficiente para afirmar mudança na
resolução, mas a faixa inclui pequena piora e melhora moderada. Como a
exigência era não piorar mais que 2 pontos, seria necessário um teste de não
inferioridade planejado, não apenas usar a ausência de significância.
Etapa 4 — Satisfação entre regiões
As médias de satisfação são Norte 4,05, Sul
4,18, Leste 3,92 e Oeste 4,25, com 80 respostas por região. A ANOVA produz SQ
entre=5,84 e SQ dentro=192,0. Com 3 e 316 graus de liberdade, QM entre=1,947,
QM dentro=0,608 e F≈3,20.
F =
(5,84/3) / (192/316) ≈ 3,20
η² =
5,84 / 197,84 ≈ 0,0295
O valor-p é próximo de 0,024, indicando
diferença global. Contudo, η² de 0,03 mostra efeito pequeno. Um pós-teste pode
apontar diferença entre Leste e Oeste, mas a magnitude de 0,33 ponto deve ser
analisada com custos, perfil e distribuição. A direção não deve criar ranking
rígido baseado apenas na significância.
Etapa 5 — Regressão do tempo
Um modelo múltiplo é ajustado com tempo
como resposta e complexidade, experiência, protocolo e turno noturno como
preditores. Os coeficientes fictícios são apresentados abaixo.
|
Termo |
Coeficiente |
EP |
Interpretação resumida |
|
Intercepto |
11,20 |
0,90 |
tempo
previsto na referência e em valores zero, com utilidade limitada |
|
Complexidade |
1,85 |
0,12 |
cada ponto
adicional associa-se a +1,85 min |
|
Experiência |
−0,045 |
0,012 |
cada mês
associa-se a −0,045 min |
|
Protocolo |
−2,40 |
0,55 |
protocolo
associa-se a −2,40 min, controladas as demais |
|
Noturno |
1,10 |
0,48 |
turno
noturno associa-se a +1,10 min |
Tempo
previsto = 11,20 + 1,85×Complexidade − 0,045×Experiência − 2,40×Protocolo +
1,10×Noturno
Para complexidade 6, experiência 24 meses,
protocolo novo e turno diurno, a previsão é 11,20+11,10−1,08−2,40=18,82
minutos. O R² ajustado é 0,46, indicando que o modelo explica parte importante,
mas não toda, da variação.
O diagnóstico mostra leve
heterocedasticidade; erros-padrão robustos são usados. Dois casos influentes
são revisados e correspondem a atendimentos reais de alta complexidade,
mantidos na base. O coeficiente de protocolo continua perto de −2,4. Como o desenho
é observacional, a expressão correta é associação ajustada, não efeito causal
definitivo.
Etapa 6 — Previsão de contatos
Os últimos seis meses registraram 18.000,
18.500, 19.400, 19.100, 20.300 e 21.000 contatos. A previsão ingênua para o
próximo mês é 21.000. A média móvel de três meses é
(19.100+20.300+21.000)/3=20.133. A suavização com α=0,4 e previsão anterior de
20.000 após observar 21.000 gera 20.400.
MM3
= (19.100 + 20.300 + 21.000) / 3 = 20.133
F
novo = 0,4×21.000 + 0,6×20.000 = 20.400
Em validação dos 12 meses anteriores, o
modelo com tendência obteve MAE 620, a média móvel 740 e o ingênuo 810. A
direção escolhe tendência como base, mas mantém faixa e cenários porque haverá
campanha nacional não presente no histórico. O impacto da campanha é tratado
separadamente.
Etapa 7 — Controle da taxa de
recontato
A taxa histórica estável de recontato é 6%,
com amostras semanais de 400 contatos. Os limites aproximados são
0,06±3√[0,06×0,94/400]. O erro-padrão é cerca de 0,01187, logo LSC≈9,56% e
LIC≈2,44%.
LSC
≈ 0,06 + 3×0,01187 = 9,56%
LIC
≈ 0,06 − 3×0,01187 = 2,44%
Uma semana registra 10,5%, acima do limite.
A equipe identifica indisponibilidade de sistema e não altera imediatamente
metas individuais. Após correção, monitora retorno ao padrão. Esse uso evita
atribuir uma causa especial a desempenho pessoal sem investigar o processo.
Síntese executiva do caso
|
Achado |
Leitura |
Decisão sugerida |
|
Tempo
pareado |
redução de
1,57 a 5,63 min |
manter
piloto e acompanhar |
|
Diferença
vs. controle |
efeito
adicional pequeno a moderado e limítrofe |
ampliar
com desenho mais controlado |
|
Resolução |
diferença
inconclusiva |
planejar
não inferioridade e aumentar amostra |
|
Satisfação
regional |
diferença
estatística pequena |
investigar
Leste sem ranking punitivo |
|
Regressão |
complexidade,
experiência e protocolo associados ao tempo |
usar para
dimensionar e segmentar |
|
Previsão |
modelo de
tendência supera benchmarks |
adotar com
cenário de campanha |
|
Controle |
sinal
especial ligado a sistema |
corrigir
causa e monitorar |
A recomendação é ampliar o protocolo de
forma gradual, com randomização por equipes quando possível, métrica principal
de tempo, margem explícita para resolução e acompanhamento de satisfação. O
caso mostra por que nenhum teste isolado responde a toda a decisão: comparação,
regressão, previsão e controle se complementam.
8. Questões para Estudo
Questão 1 — Duas médias
independentes
Uma empresa compara produtividade de duas
equipes. A equipe A tem n=50, média 118 e desvio 20; a B tem n=45, média 108 e
desvio 18. Calcule a diferença, o erro-padrão de Welch, a estatística t e
interprete um intervalo aproximado de 95% usando valor crítico 1,99.
Gabarito comentado
A diferença A−B é 10. O erro-padrão é
√(400/50+324/45)=√(8+7,2)=√15,2≈3,899. t≈10/3,899=2,565. A margem é
1,99×3,899≈7,76; o intervalo vai de 2,24 a 17,76. A evidência indica
produtividade média maior em A, mas a decisão deve considerar qualidade, composição
e custo. A conclusão deve informar magnitude e faixa, não apenas que o teste é
significativo.
EP =
√(20²/50 + 18²/45) ≈ 3,899; t ≈ 2,565; IC95% ≈ [2,24; 17,76]
Questão 2 — Qui-quadrado
Em 400 atendimentos, os resultados por
canal foram: telefone 120 resolvidos e 80 não resolvidos; chat 150 resolvidos e
50 não resolvidos. Calcule frequências esperadas e a estatística qui-quadrado.
Interprete sem afirmar causalidade.
Gabarito comentado
Totais: resolvidos 270, não 130; cada canal
possui 200. Esperados por canal: 135 resolvidos e 65 não. As quatro
contribuições são 225/135, 225/65, 225/135 e 225/65. A soma é aproximadamente
10,26. Com 1 grau de liberdade, o valor-p é inferior a 0,01. Há associação
entre canal e resolução na amostra. O chat apresenta taxa de 75%, o telefone
60%, mas diferenças de demanda ou perfil podem explicar parte do padrão.
χ² ≈
1,667 + 3,462 + 1,667 + 3,462 = 10,258
Questão 3 — ANOVA
Três unidades possuem dez observações cada.
A soma de quadrados entre grupos é 300 e dentro dos grupos é 600. Calcule graus
de liberdade, quadrados médios, F e η². O que cada medida informa?
Gabarito comentado
Com k=3 e N=30, gl entre=2 e gl dentro=27.
QM entre=150; QM dentro=22,222; F=6,75. SQ total=900 e η²=300/900=0,333. F
compara sinal entre grupos ao ruído interno e seria avaliado na distribuição F.
η² indica que 33,3% da variabilidade observada está associada ao fator no
conjunto, mas não identifica pares nem prova causalidade.
F =
(300/2) / (600/27) = 6,75; η² = 300/900 = 0,333
Questão 4 — Regressão
Um modelo de vendas estimou
Ŷ=250−8Preço+3Publicidade, com preço em reais e publicidade em milhares de
reais. Interprete os coeficientes, calcule previsão para preço 20 e publicidade
30 e discuta duas limitações.
Gabarito comentado
Mantida a publicidade, aumento de R$1 no
preço associa-se a redução média prevista de 8 unidades. Mantido o preço,
aumento de R$1 mil em publicidade associa-se a 3 unidades. A previsão é
250−160+90=180. Limitações possíveis: relação pode não ser causal; pode haver
variáveis omitidas e simultaneidade; extrapolação; forma linear inadequada;
autocorrelação; colinearidade. O intercepto pode não ter interpretação prática
se zero estiver fora da faixa.
Ŷ =
250 − 8×20 + 3×30 = 180
Questão 5 — Previsão e controle
Uma série possui valores 90, 100, 110 e
130. Calcule previsão por média móvel de três períodos para o quinto período.
Se a previsão anterior de suavização era 112, o valor atual 130 e α=0,25,
calcule a nova previsão. Explique como escolher entre modelos.
Gabarito comentado
A média móvel é (100+110+130)/3=113,33. A
suavização é 0,25×130+0,75×112=116,5. A escolha deve usar validação temporal,
comparação com benchmark, métrica alinhada ao custo, estabilidade e facilidade
de manutenção. Não se escolhe pelo valor mais próximo de um único mês. Se a
série tem tendência, ambos podem atrasar e um modelo de tendência deve ser
testado.
MM3
= 113,33; F novo = 116,50
9. Resumo e Glossário
Síntese do aprendizado
Métodos Estatísticos II amplia a inferência
para situações de comparação, modelagem, previsão e controle. A escolha do
método depende da pergunta, do desenho, do tipo de variável e da dependência
entre observações. Testes para médias, proporções e frequências ajudam a
avaliar diferenças; ANOVA organiza comparações com vários grupos; métodos não
paramétricos trabalham com escalas e distribuições específicas; regressão
estima relações condicionais; séries temporais projetam valores preservando
ordem; gráficos de controle acompanham processos; experimentos fortalecem a
aprendizagem causal.
O valor-p é apenas uma parte da evidência.
Estimativas, intervalos, tamanhos de efeito, poder e relevância devem aparecer
juntos. Premissas precisam ser avaliadas por desenho e diagnóstico, não apenas
por testes automáticos. Resultados observacionais não devem ser apresentados
como causas sem justificativa. Previsões precisam ser validadas fora da amostra
e monitoradas. Modelos que afetam pessoas exigem proteção, explicação e
avaliação de desigualdades.
A competência final é saber percorrer o
ciclo completo: estruturar pergunta, preparar dados, selecionar técnica,
executar, diagnosticar, interpretar, comunicar, implementar e revisar. A
estatística oferece uma linguagem para lidar com incerteza; a Administração
transforma essa linguagem em decisão responsável.
Mapa rápido de escolha
|
Pergunta |
Estrutura |
Método inicial |
|
uma média
difere da meta? |
quantitativa,
uma amostra |
t de uma
amostra |
|
duas
médias independentes diferem? |
quantitativa,
dois grupos |
t de Welch |
|
antes e
depois diferem? |
quantitativa,
pares |
t pareado
ou Wilcoxon |
|
duas taxas
diferem? |
binária,
dois grupos |
teste de
duas proporções |
|
duas
categorias se associam? |
tabela de
contingência |
qui-quadrado |
|
três ou
mais médias diferem? |
quantitativa,
vários grupos |
ANOVA ou
Welch |
|
grupos
ordinais/assimétricos diferem? |
postos ou
ordinal |
Mann-Whitney/Kruskal-Wallis |
|
variáveis
quantitativas se relacionam? |
duas
quantitativas |
correlação
e regressão |
|
resposta
binária depende de fatores? |
Y binário |
regressão
logística |
|
valores
futuros precisam ser projetados? |
série
ordenada |
métodos de
séries temporais |
|
processo
está estável? |
indicador
sequencial |
gráfico de
controle |
Glossário
|
Termo |
Definição |
|
ANOVA |
método que
compara variabilidade entre e dentro de grupos para testar igualdade de
médias |
|
Erro-padrão |
variabilidade
esperada de uma estimativa entre amostras |
|
Interação |
situação
em que o efeito de uma variável depende do nível de outra |
|
Multicolinearidade |
forte
relação entre preditores que dificulta separar coeficientes |
|
Odds ratio |
razão
entre chances, comum na regressão logística |
|
Poder
estatístico |
probabilidade
de detectar um efeito específico quando ele existe |
|
Resíduo |
diferença
entre valor observado e previsto pelo modelo |
|
Tamanho do
efeito |
medida da
magnitude de uma diferença ou associação |
|
Valor-p |
probabilidade,
sob H0 e o modelo, de resultado tão extremo quanto o observado ou mais |
|
Validação
temporal |
avaliação
de previsão respeitando a ordem do tempo |
Erros a evitar
·
concluir causalidade a partir
de associação observacional;
·
escolher teste depois de
procurar o resultado desejado;
·
usar não significância como
prova de igualdade;
·
ignorar dependência entre
observações;
·
comparar muitos grupos sem
controlar multiplicidade;
·
interpretar odds ratio como
aumento direto de probabilidade;
·
extrapolar regressões fora da
faixa;
·
avaliar previsão no mesmo
período usado para ajustar;
·
confundir limites de controle
com especificações;
·
ocultar exclusões,
transformações ou métricas alternativas.
10. Referências e Aprofundamento
Bibliografia básica sugerida
·
ANDERSON, David R.; SWEENEY,
Dennis J.; WILLIAMS, Thomas A.; CAMM, Jeffrey D.; COCHRAN, James J. Estatística
aplicada à administração e economia.
·
BUSSAB, Wilton de Oliveira;
MORETTIN, Pedro Alberto. Estatística básica.
·
DOWNING, Douglas; CLARK,
Jeffrey. Estatística aplicada.
·
LEVINE, David M.; STEPHAN,
David F.; SZABAT, Kathryn A. Estatística: teoria e aplicações.
·
MARTINS, Gilberto de Andrade;
DOMINGUES, Osmar. Estatística geral e aplicada.
·
MONTGOMERY, Douglas C.; RUNGER,
George C. Estatística aplicada e probabilidade para engenheiros.
·
TRIOLA, Mario F. Introdução à
estatística.
·
HAIR, Joseph F. et al. Análise
multivariada de dados, para aprofundamento posterior.
Bibliografia para regressão,
experimentação e previsão
·
WOOLDRIDGE, Jeffrey M.
Introdução à econometria: uma abordagem moderna.
·
GUJARATI, Damodar N.; PORTER,
Dawn C. Econometria básica.
·
MONTGOMERY, Douglas C. Design
and Analysis of Experiments.
·
HYNDMAN, Rob J.;
ATHANASOPOULOS, George. Forecasting: Principles and Practice.
·
BOX, George E. P.; JENKINS,
Gwilym M.; REINSEL, Gregory C.; LJUNG, Greta M. Time Series Analysis.
·
MONTGOMERY, Douglas C.
Introduction to Statistical Quality Control.
Fontes e documentação de
ferramentas
Para aplicar métodos em software, consulte
documentação oficial da ferramenta adotada. Em R, funções base e pacotes
oferecem testes, regressão e séries; em Python, bibliotecas como pandas, scipy,
statsmodels e scikit-learn atendem diferentes etapas. Jamovi e JASP oferecem
interfaces gráficas. A documentação deve ser verificada na versão instalada,
pois comandos e padrões podem mudar. O relatório acadêmico deve registrar
software, versão e procedimentos relevantes.
Tópicos para estudos futuros
·
modelos lineares generalizados
além da logística;
·
regressão com dados em painel e
efeitos mistos;
·
econometria causal e
experimentos naturais;
·
séries temporais ARIMA e
modelos sazonais;
·
métodos bayesianos;
·
análise de sobrevivência;
·
análise multivariada,
componentes principais e agrupamento;
·
aprendizado de máquina e
validação avançada;
·
amostragem complexa e
ponderação;
·
estatística espacial;
·
privacidade, justiça
algorítmica e auditoria de modelos.
Plano de aprofundamento em oito
semanas
|
Semana |
Foco |
Atividade |
|
1 |
comparações |
resolver
testes de médias e proporções com intervalos |
|
2 |
categorias
e ANOVA |
analisar
tabela e quatro grupos |
|
3 |
não
paramétricos |
comparar
métodos em base assimétrica |
|
4 |
regressão
simples |
construir
dispersão, reta e diagnóstico |
|
5 |
regressão
múltipla |
interpretar
indicadores, interações e VIF |
|
6 |
séries |
comparar
benchmark, média móvel e suavização |
|
7 |
experimento
e controle |
planejar
teste A/B e gráfico p |
|
8 |
projeto
integrado |
entregar
nota executiva e apêndice técnico |
Checklist final para trabalhos
·
a pergunta e a decisão estão
explícitas?
·
a população e a unidade foram
definidas?
·
a origem e a qualidade da base
foram documentadas?
·
o método corresponde ao desenho
e ao tipo de variável?
·
as premissas foram examinadas?
·
estimativa, intervalo e efeito
foram apresentados?
·
o valor-p foi interpretado
corretamente?
·
a linguagem respeita o alcance
causal?
·
a análise foi validada ou
submetida a sensibilidade?
·
gráficos e tabelas possuem
unidades, fontes e legendas?
·
riscos éticos, privacidade e
grupos afetados foram considerados?
·
os passos podem ser
reproduzidos por outra pessoa?
Encerramento
Métodos Estatísticos II não encerra a
formação quantitativa; ele consolida a passagem de dados para modelos
gerenciais. A pessoa administradora não precisa executar manualmente toda
análise complexa, mas precisa compreender o problema, questionar premissas,
interpretar saídas e responsabilizar-se pela decisão. A combinação de técnica,
contexto e transparência transforma números em evidência útil e evita que
sofisticação aparente substitua raciocínio.
A prática continuada fortalece a autonomia
para questionar modelos, reconhecer incertezas e comunicar decisões baseadas em
evidências com responsabilidade.
Nenhum comentário:
Postar um comentário