- Métodos Estatísticos II

 

ADMGUIA

MÉTODOS

ESTATÍSTICOS II

Guia completo para estudantes de Administração

━━━━━━━━━━━━━━━━━━━━━━━━━━━━

Testes • ANOVA • Regressão • Séries Temporais • Controle Estatístico

Portal Admguia  |  Atualização: julho de 2026


 

Sumário

1. Apresentação da Disciplina. 3

Competências esperadas. 3

Como estudar a disciplina. 4

2. Por que ela faz parte do curso. 5

Da observação à explicação. 5

Decisões comparativas. 5

Gestão de múltiplos grupos. 5

Explicação multivariada. 5

Previsão e planejamento. 5

Experimentação e aprendizagem organizacional 5

Controle e melhoria de processos. 6

Leitura crítica de pesquisas e modelos. 6

Articulação entre evidência e julgamento. 6

Empregabilidade e atuação profissional 6

Formação para a responsabilidade. 6

3. Conceitos Fundamentais. 7

3.1 Fluxo completo da inferência estatística. 7

3.2 Distribuições amostrais e erro-padrão. 7

3.3 Estimadores, viés, precisão e consistência. 8

3.4 Intervalos de confiança para uma média. 8

3.5 Intervalos para proporções e diferenças. 8

3.6 Lógica dos testes de hipótese. 9

3.7 Teste para uma média. 9

3.8 Comparação de duas médias independentes. 9

3.9 Amostras pareadas e medidas repetidas. 10

3.10 Comparação de duas proporções. 10

3.11 Testes para variâncias e dispersão. 11

3.12 Qui-quadrado de independência e aderência. 11

3.13 ANOVA de um fator 11

3.14 Comparações múltiplas e tamanhos de efeito. 12

3.15 ANOVA de dois fatores e interação. 12

3.16 Métodos não paramétricos. 12

3.17 Correlação de Pearson, Spearman e correlação parcial 13

3.18 Regressão linear simples. 13

3.19 Regressão linear múltipla. 13

3.20 Diagnóstico de regressão. 14

3.21 Multicolinearidade. 14

3.22 Variáveis indicadoras e interações em regressão. 15

3.23 Introdução à regressão logística. 15

3.24 Componentes de séries temporais. 15

3.25 Médias móveis e suavização exponencial 16

3.26 Avaliação de previsões. 16

3.27 Números-índice e deflacionamento. 16

3.28 Controle estatístico de processos. 17

3.29 Desenho de experimentos e testes A/B. 17

3.30 Poder, tamanho amostral e diferença mínima relevante. 17

3.31 Dados ausentes, valores extremos e transformações. 18

3.32 Multiplicidade, seleção de modelos e reprodutibilidade. 18

4. Principais Temas e Organização. 19

Módulo 1 — Retomada dos fundamentos. 19

Módulo 2 — Comparações entre duas populações. 19

Módulo 3 — Tabelas de contingência. 19

Módulo 4 — ANOVA e comparações múltiplas. 20

Módulo 5 — Métodos não paramétricos. 20

Módulo 6 — Regressão e diagnóstico. 20

Módulo 7 — Séries temporais e previsão. 20

Módulo 8 — Controle, experimentação e governança. 20

Estratégias didáticas. 20

Ferramentas. 20

Avaliação sugerida. 20

5. Relação com outras matérias. 22

Métodos Estatísticos I 22

Pesquisa Operacional e Métodos Determinísticos. 22

Matemática Financeira e Finanças. 22

Contabilidade e Controladoria. 22

Marketing e Pesquisa de Mercado. 22

Gestão de Pessoas. 22

Operações, Logística e Qualidade. 22

Economia e Econometria. 23

Sistemas de Informação e Ciência de Dados. 23

Metodologia Científica e TCC.. 23

6. Aplicações Práticas e Profissionais. 24

6.1 Comparação de fornecedores. 24

6.2 Avaliação de treinamento. 24

6.3 Teste A/B de comunicação. 24

6.4 Previsão de demanda. 24

6.5 Rotatividade de pessoal 24

6.6 Pesquisa de satisfação. 25

6.7 Controle de defeitos. 25

6.8 Análise de preços. 25

6.9 Desempenho de unidades. 25

6.10 Tempo de atendimento. 25

6.11 Inadimplência. 25

6.12 Auditoria por amostragem.. 26

6.13 Avaliação de política pública. 26

6.14 Saúde e segurança. 26

6.15 Planejamento de caixa. 26

6.16 Gestão de estoques. 26

6.17 Experiência digital 26

6.18 Equidade remuneratória. 27

6.19 Capacidade e filas. 27

6.20 Indicadores ESG.. 27

Roteiro de análise profissional 27

Modelo de comunicação executiva. 27

Caderno de aprofundamento e atividades resolvidas. 28

6.21 Estudo resolvido — Meta de tempo médio. 28

6.22 Estudo resolvido — Processos com variâncias diferentes. 28

6.23 Estudo resolvido — Produtividade antes e depois. 29

6.24 Estudo resolvido — Taxa de renovação. 29

6.25 Estudo resolvido — Associação entre região e reclamação. 30

6.26 Estudo resolvido — ANOVA e pós-teste. 30

6.27 Estudo resolvido — Interação entre canal e faixa etária. 30

6.28 Estudo resolvido — Mann-Whitney em escala ordinal 31

6.29 Estudo resolvido — Wilcoxon com poucos pares. 31

6.30 Estudo resolvido — Kruskal-Wallis entre canais. 32

6.31 Estudo resolvido — Correlação enganosa pelo tempo. 32

6.32 Estudo resolvido — Regressão simples e intervalo de previsão. 32

6.33 Estudo resolvido — Regressão múltipla de custos. 33

6.34 Estudo resolvido — Indicadores e interação em regressão. 33

6.35 Estudo resolvido — Odds ratio e probabilidade. 33

6.36 Estudo resolvido — Média móvel e tendência. 34

6.37 Estudo resolvido — Suavização exponencial e escolha de alfa. 34

6.38 Estudo resolvido — Métricas de erro. 35

6.39 Estudo resolvido — Gráfico p com tamanho variável 35

6.40 Estudo resolvido — Gráficos X̄ e R. 35

6.41 Estudo resolvido — Planejamento de teste A/B. 36

6.42 Estudo resolvido — Dados ausentes em pesquisa. 36

6.43 Estudo resolvido — Multiplicidade em painel de indicadores. 36

6.44 Estudo resolvido — Auditoria de modelo de rotatividade. 37

Laboratório de ferramentas: planilha, R, Python e interfaces gráficas. 37

Fluxo mínimo em qualquer ferramenta. 38

Exemplo de organização em planilha. 38

Oficina de leitura crítica de resultados. 38

Miniestudos setoriais adicionais. 39

Varejo e promoções. 39

Universidade e evasão. 39

Hospital e tempo de permanência. 39

Município e atendimento digital 39

Indústria e manutenção. 39

Logística e promessa de prazo. 39

Finanças e cobrança. 39

Cultura e participação. 40

Aprofundamentos para interpretação e governança. 40

Equivalência e não inferioridade. 40

Bootstrap como ferramenta de incerteza. 40

Intervalo da média prevista e intervalo de previsão. 40

Tamanhos de efeito padronizados e não padronizados. 41

ANCOVA e ajuste por medida inicial 41

Medidas repetidas e estrutura de dependência. 41

Erros-padrão robustos e agrupados. 42

Validação cruzada e separação treino-teste. 42

Calibração, discriminação e limiares. 42

Decomposição sazonal e intervenção. 42

Análise de capacidade do processo. 43

Pesos amostrais e efeito de desenho. 43

Princípios de análise reproduzível 43

Ética da inferência e distribuição dos efeitos. 43

Quadro de premissas e respostas possíveis. 44

Atividade integradora de revisão por pares. 44

Oficina adicional de interpretação de saídas. 44

6.45 Saída de teste t com amostra enorme. 44

6.46 Saída de ANOVA não significativa. 45

6.47 Saída de regressão com R² baixo. 45

6.48 Saída de regressão com R² muito alto. 45

6.49 Coeficiente com sinal inesperado. 45

6.50 Valor-p diferente entre softwares. 45

6.51 Intervalo amplo em regressão logística. 46

6.52 Previsão com bom erro médio e viés. 46

6.53 Gráfico de controle com muitos ajustes. 46

6.54 Teste A/B com métrica secundária favorável 46

Exercício de construção de um parecer estatístico. 46

Projeto aplicado: do problema ao monitoramento. 47

Etapa 1 — Enquadrar a pergunta. 47

Etapa 2 — Mapear o processo de geração dos dados. 47

Etapa 3 — Criar plano de análise. 47

Etapa 4 — Explorar sem antecipar conclusões. 47

Etapa 5 — Executar, diagnosticar e validar 47

Etapa 6 — Converter evidência em decisão. 48

Etapa 7 — Comunicar para dois públicos. 48

Etapa 8 — Monitorar e aprender 48

Critérios de avaliação do projeto. 48

Matemática de apoio para acompanhar os métodos. 48

7. Exemplo Prático ou Estudo de Caso. 50

Caso integrado: Rede Conecta Serviços. 50

Perguntas gerenciais. 50

Estrutura da base. 50

Etapa 1 — Comparação pareada nas unidades do protocolo. 50

Etapa 2 — Comparação das mudanças. 51

Etapa 3 — Taxa de resolução. 51

Etapa 4 — Satisfação entre regiões. 51

Etapa 5 — Regressão do tempo. 51

Etapa 6 — Previsão de contatos. 52

Etapa 7 — Controle da taxa de recontato. 52

Síntese executiva do caso. 52

8. Questões para Estudo. 53

Questão 1 — Duas médias independentes. 53

Gabarito comentado. 53

Questão 2 — Qui-quadrado. 53

Gabarito comentado. 53

Questão 3 — ANOVA. 53

Gabarito comentado. 53

Questão 4 — Regressão. 54

Gabarito comentado. 54

Questão 5 — Previsão e controle. 54

Gabarito comentado. 54

9. Resumo e Glossário. 54

Síntese do aprendizado. 54

Mapa rápido de escolha. 54

Glossário. 55

Erros a evitar 55

10. Referências e Aprofundamento. 56

Bibliografia básica sugerida. 56

Bibliografia para regressão, experimentação e previsão. 56

Fontes e documentação de ferramentas. 56

Tópicos para estudos futuros. 56

Plano de aprofundamento em oito semanas. 56

Checklist final para trabalhos. 57

Encerramento. 57

 


 

1. Apresentação da Disciplina

Métodos Estatísticos II aprofunda a análise de dados iniciada em Métodos Estatísticos I e desloca o foco da descrição para a comparação, explicação, previsão e avaliação de decisões. A disciplina trabalha com situações em que a Administração precisa verificar se grupos diferem, estimar o efeito de uma intervenção, compreender a relação entre várias variáveis, projetar resultados futuros e acompanhar processos ao longo do tempo. Em todos esses casos, o desafio não é apenas executar uma fórmula: é escolher um método compatível com a pergunta, as variáveis, o desenho da coleta e as limitações da base.

A definição central da disciplina pode ser apresentada da seguinte forma: Métodos Estatísticos II reúne técnicas inferenciais e modelagens que permitem comparar grupos, estimar relações, testar hipóteses, construir previsões e monitorar processos, sempre quantificando a incerteza das conclusões. O termo inferência indica que os dados observados são usados para aprender sobre uma população, um processo ou um mecanismo que não foi integralmente observado. O resultado nunca deve ser tratado como certeza absoluta; ele é uma conclusão condicionada ao modelo, à amostra e às premissas adotadas.

O volume II pressupõe familiaridade com variáveis, tabelas, gráficos, medidas de posição e dispersão, probabilidade, distribuições amostrais, intervalos de confiança e lógica básica dos testes de hipótese. Esses fundamentos serão retomados apenas quando necessários para compreender uma técnica mais avançada. O novo percurso inclui comparações entre duas ou mais populações, análise de variância, testes de independência, métodos não paramétricos, correlação avançada, regressão linear simples e múltipla, introdução à regressão logística, séries temporais, experimentação, controle estatístico e boas práticas de análise reproduzível.

Para estudantes de Administração, a disciplina funciona como uma oficina de investigação gerencial. Um resultado estatístico precisa ser convertido em decisão: a diferença entre duas campanhas é suficientemente grande para mudar o orçamento? A queda do tempo de atendimento ocorreu por efeito de um novo processo ou por variação aleatória? Quais fatores explicam a rotatividade? Uma previsão de vendas é confiável para dimensionar estoque? Um indicador está fora de controle? O curso ensina a responder essas perguntas com cálculos, diagnósticos e comunicação responsável.

O guia adota uma abordagem aplicada. Cada técnica será apresentada com a pergunta que resolve, as condições de uso, a fórmula central, um exemplo numérico, a interpretação e os erros mais comuns. Esse formato evita dois extremos: tratar estatística como conjunto abstrato de símbolos ou como sequência de comandos de software sem compreensão. A pessoa estudante deve ser capaz de explicar o raciocínio mesmo quando a conta é executada por planilha, calculadora ou programa estatístico.

Competências esperadas

·         formular hipóteses estatísticas a partir de problemas gerenciais claramente definidos;

·         selecionar testes para médias, proporções, variâncias, frequências e dados pareados;

·         interpretar valor-p, intervalo de confiança, tamanho do efeito e poder estatístico de forma integrada;

·         aplicar ANOVA e procedimentos de comparação múltipla sem confundir significância com relevância;

·         construir e interpretar modelos de regressão simples e múltipla;

·         avaliar resíduos, multicolinearidade, observações influentes e limites de extrapolação;

·         usar métodos não paramétricos quando as escalas ou premissas dos testes paramétricos não forem adequadas;

·         decompor séries temporais, produzir previsões e avaliar erros;

·         planejar experimentos e testes A/B com métricas, amostra e critérios de decisão definidos previamente;

·         monitorar processos com gráficos de controle e distinguir sinal especial de oscilação comum;

·         documentar análises de modo auditável, reproduzível, ético e compreensível para diferentes públicos.

Como estudar a disciplina

O estudo é mais produtivo quando segue quatro camadas. Primeiro, identifique a pergunta e o tipo de variável. Segundo, desenhe a estrutura dos dados e verifique como as observações foram produzidas. Terceiro, execute o método e confira suas premissas. Quarto, traduza o resultado para a decisão, incluindo magnitude, incerteza, riscos e próximos passos. Memorizar nomes de testes sem dominar essas camadas produz análises frágeis. O melhor sinal de aprendizagem é conseguir justificar por que um método foi escolhido e o que ele não permite afirmar.

Ao longo do guia, valores numéricos são arredondados para facilitar a leitura. Em aplicações profissionais, os cálculos devem ser feitos com maior precisão e o arredondamento deve ocorrer apenas na apresentação. Também se recomenda conservar a base original, registrar transformações, nomear versões dos arquivos e separar exploração de confirmação. A disciplina ensina técnicas, mas também forma hábitos de trabalho que reduzem erros e tornam as conclusões verificáveis.

2. Por que ela faz parte do curso

Da observação à explicação

Métodos Estatísticos I permite descrever o que ocorreu; o volume II ajuda a investigar por que ocorreu, se a diferença é consistente e quanto pode ser esperado no futuro. A Administração depende dessa passagem. Uma média de satisfação menor em determinada unidade é apenas um ponto de partida. É necessário avaliar tamanho da amostra, variabilidade, perfil das pessoas respondentes, diferença entre grupos e fatores associados. A inferência organiza esse caminho e reduz a chance de transformar uma oscilação casual em diagnóstico definitivo.

Decisões comparativas

Grande parte das escolhas gerenciais envolve alternativas: fornecedor A ou B, processo antigo ou novo, campanha de controle ou experimental, unidade presencial ou remota, turno diurno ou noturno. Testes para duas amostras, dados pareados e proporções oferecem estruturas para comparar alternativas. A análise correta evita decidir pela maior média observada sem considerar dispersão e incerteza. Também obriga a definir previamente qual diferença seria material para o negócio, pois uma diferença estatisticamente detectável pode ser pequena demais para justificar custo, risco ou mudança operacional.

Gestão de múltiplos grupos

Organizações raramente possuem apenas duas unidades ou dois segmentos. Redes com várias lojas, equipes, regiões, produtos ou níveis de serviço precisam comparar mais de dois grupos. A análise de variância permite testar uma hipótese global sem executar uma quantidade desordenada de testes isolados. Quando há diferença, procedimentos pós-teste ajudam a identificar onde ela se concentra. Essa lógica é relevante para remuneração, qualidade, produtividade, satisfação, desempenho de fornecedores e avaliação de programas.

Explicação multivariada

Resultados organizacionais costumam depender de vários fatores simultaneamente. Vendas podem variar com preço, investimento em comunicação, sazonalidade, localização e disponibilidade. Rotatividade pode estar associada a remuneração, tempo de casa, liderança, distância e jornada. A regressão múltipla permite estimar a associação de uma variável mantendo outras constantes no modelo. Embora não crie causalidade por si só, ela oferece uma estrutura mais realista que comparações bivariadas e ajuda a identificar confundimento, interações e heterogeneidade.

Previsão e planejamento

Orçamento, compras, estoque, capacidade e escala de pessoal dependem de previsões. Séries temporais ajudam a separar tendência, sazonalidade, ciclos e ruído. Métodos como médias móveis, suavização exponencial e regressão temporal produzem projeções e podem ser comparados por medidas de erro. A disciplina ensina que previsão não é adivinhação: é um procedimento documentado, avaliado fora da amostra e acompanhado por intervalos e cenários. Um modelo simples bem monitorado pode ser mais útil que uma solução complexa sem governança.

Experimentação e aprendizagem organizacional

Testes A/B, pilotos e experimentos controlados permitem aprender antes de ampliar uma intervenção. Em marketing, pode-se comparar mensagens; em operações, novos roteiros; em gestão de pessoas, formatos de treinamento; em serviços públicos, lembretes e simplificações. Métodos Estatísticos II mostra como definir unidade de randomização, métrica principal, tamanho de amostra, duração, hipótese e regra de decisão. Também alerta para contaminação, abandono, análise precoce e seleção oportunista de resultados.

Controle e melhoria de processos

Indicadores variam mesmo quando o processo não sofreu mudança relevante. Gráficos de controle ajudam a distinguir causas comuns, inerentes ao sistema, de causas especiais, associadas a eventos específicos. Essa distinção modifica a resposta gerencial. Reagir a toda oscilação pode aumentar a variabilidade; ignorar sinais especiais pode prolongar falhas. O pensamento estatístico de processos é útil em indústria, serviços, saúde, logística, atendimento, tecnologia e administração pública.

Leitura crítica de pesquisas e modelos

Gestoras(es) recebem relatórios com regressões, valores-p, rankings, previsões e segmentações. A formação precisa permitir perguntas como: a amostra representa a população? O modelo inclui variáveis relevantes? Os resíduos indicam problemas? Houve validação? O resultado foi ajustado para múltiplas comparações? A diferença é material? O algoritmo afeta grupos de maneira desigual? Sem essas perguntas, a organização pode aceitar uma conclusão apenas porque ela parece tecnicamente sofisticada.

Articulação entre evidência e julgamento

Nenhum método elimina o julgamento. É necessário escolher variáveis, horizonte, nível de confiança, custo de erros e critérios de decisão. A estatística torna o julgamento mais explícito e disciplinado. Em vez de esconder preferências, a análise registra premissas, mostra sensibilidades e permite revisão. A boa decisão integra evidência quantitativa, conhecimento operacional, aspectos jurídicos, impacto social e viabilidade de implementação.

Empregabilidade e atuação profissional

Campo de atuação

Contribuição de Métodos Estatísticos II

Controladoria e finanças

modelos de desempenho, previsão, cenários e testes de desvios

Marketing e produto

experimentos, conversão, retenção, regressão e segmentação

Operações e logística

controle de processos, previsão, comparação de fornecedores e capacidade

Gestão de pessoas

pesquisas, rotatividade, absenteísmo, equidade e avaliação de programas

Saúde e serviços

qualidade, tempos, eventos, filas, risco e resultados de intervenções

Setor público

avaliação de políticas, indicadores, desigualdades e monitoramento

Consultoria e auditoria

diagnóstico, amostragem, validação de evidências e comunicação executiva

Ciência de dados

fundamentos de modelagem, validação, interpretação e governança

 

Formação para a responsabilidade

Modelos estatísticos podem influenciar crédito, contratação, atendimento, benefícios e prioridades. Por isso, o curso não deve limitar-se à precisão média. É necessário observar privacidade, consentimento, representatividade, vieses, explicabilidade e impactos distribuídos. Uma regressão pode funcionar no conjunto total e falhar para um grupo pequeno. Um experimento pode elevar conversão e piorar a experiência de pessoas vulneráveis. A formação administrativa precisa combinar capacidade analítica e compromisso com decisões justificáveis.

3. Conceitos Fundamentais

3.1 Fluxo completo da inferência estatística

Uma análise inferencial começa antes do teste. O ponto inicial é uma pergunta substantiva, como verificar se um treinamento reduziu o tempo médio de atendimento ou se duas campanhas apresentam taxas de conversão diferentes. Em seguida, definem-se população, unidade de análise, variável de resposta, grupos, período e diferença mínima relevante.

O fluxo recomendado possui oito etapas: formular a questão; declarar hipóteses; verificar desenho e independência; explorar dados; escolher método; calcular estimativa, incerteza e teste; avaliar premissas; comunicar decisão e limitações. Essa ordem impede que o método seja escolhido apenas porque está disponível no software. Em pesquisas confirmatórias, plano e métrica principal devem ser registrados antes de observar o resultado.

Considere uma empresa que compara o prazo de entrega de dois centros. A pergunta não é apenas qual média foi menor. É necessário saber se pedidos são comparáveis, se clientes aparecem repetidamente, se houve sazonalidade, se a medida possui valores extremos e qual redução justificaria mudar a operação.

A conclusão deve apresentar estimativa da diferença, intervalo de confiança, valor-p quando pertinente e efeito sobre a decisão. “Houve diferença significativa” é incompleto. Uma redação melhor informa que o centro B apresentou redução média estimada de determinado número de horas, com faixa de incerteza e ressalvas sobre o período analisado.

Um erro frequente é formular hipóteses depois de observar gráficos e escolher apenas a comparação que produz resultado favorável. Exploração é legítima, mas deve ser identificada como exploratória e confirmada em nova base quando a decisão for importante.

3.2 Distribuições amostrais e erro-padrão

A distribuição amostral descreve como uma estatística varia entre amostras hipotéticas retiradas da mesma população. Ela fundamenta intervalos e testes. A média observada é um valor; a distribuição amostral mostra quanto esse valor poderia mudar apenas porque outras unidades foram selecionadas.

O erro-padrão mede a variabilidade da estatística. Para uma média com desvio-padrão populacional conhecido, EP = σ/√n; na prática, usa-se s/√n. Para uma proporção, EP = √[p(1-p)/n]. O aumento da amostra reduz o erro-padrão pela raiz quadrada: quadruplicar n reduz aproximadamente o erro pela metade.

Uma amostra de 100 pedidos tem tempo médio de 42 minutos e desvio-padrão de 15. O erro-padrão é 15/√100 = 1,5 minuto. Isso não significa que os pedidos variam apenas 1,5 minuto; esse é o grau de oscilação esperado da média entre amostras equivalentes.

A distinção entre desvio-padrão e erro-padrão é decisiva. O primeiro descreve heterogeneidade entre observações; o segundo, incerteza de uma estimativa. Relatórios devem nomear claramente cada medida e evitar barras de erro sem legenda.

A fórmula clássica pressupõe observações independentes. Amostras por conglomerados, medições repetidas ou séries temporais exigem ajustes. Tratar registros correlacionados como independentes costuma produzir erros-padrão artificialmente pequenos.

EP da média = s / √n

EP da proporção = √[p(1 − p) / n]

3.3 Estimadores, viés, precisão e consistência

Um estimador é uma regra usada para calcular uma aproximação de um parâmetro. A média amostral estima a média populacional; a proporção amostral estima a proporção populacional. Estimadores são avaliados por propriedades como ausência de viés, variância, erro quadrático médio e consistência.

Um estimador não viesado acerta o parâmetro em média ao longo de repetições. Precisão refere-se à pequena variabilidade. Pode existir estimador pouco viesado e muito impreciso, ou ligeiramente viesado e mais estável. O erro quadrático médio combina viés e variância e ajuda a comparar alternativas.

Suponha que uma pesquisa de satisfação seja enviada apenas por aplicativo. Mesmo com 20 mil respostas, pessoas que usam outros canais ficam excluídas. A estimativa pode ser muito precisa em termos matemáticos e ainda viesada em relação à população-alvo. Aumentar n não corrige falha de cobertura.

Em Administração, a qualidade da estimativa depende tanto do desenho quanto da fórmula. Uma amostra menor e probabilística pode oferecer inferência mais defensável que milhões de registros de conveniência. A precisão numérica nunca deve ser confundida com validade.

Também é necessário distinguir erro amostral de erros não amostrais, como não resposta, medição, duplicação, classificação incorreta e processamento. Intervalos de confiança tradicionais refletem principalmente o primeiro.

3.4 Intervalos de confiança para uma média

O intervalo de confiança combina estimativa pontual e margem de erro. Quando a variância populacional é desconhecida, usa-se a distribuição t de Student, especialmente em amostras pequenas. A forma geral é média ± valor crítico × erro-padrão.

Para n observações independentes, IC = x̄ ± tα/2,n−1 × s/√n. O nível de 95% descreve o desempenho do procedimento em repetições: se muitas amostras fossem coletadas e intervalos construídos da mesma forma, aproximadamente 95% conteriam o parâmetro.

Uma amostra de 25 atendimentos apresenta média de 48 minutos e desvio-padrão de 10. Com 24 graus de liberdade, t crítico de 95% é aproximadamente 2,064. O erro-padrão é 2 e o intervalo é 48 ± 4,128, ou de 43,87 a 52,13 minutos.

O intervalo mostra uma faixa de médias populacionais compatíveis com os dados e o modelo. Sua amplitude informa precisão e pode ser comparada à tolerância gerencial. Se a meta é 45 minutos, o intervalo atravessa a meta e a evidência não sustenta uma conclusão simples de cumprimento.

Não se deve afirmar que há 95% de probabilidade de o parâmetro fixo estar dentro do intervalo já calculado na interpretação frequentista. Em comunicação não técnica, pode-se dizer que o método produz uma faixa de valores plausíveis, evitando excesso de formalismo sem transformar a frase em certeza probabilística incorreta.

IC da média = x̄ ± t crítico × (s / √n)

3.5 Intervalos para proporções e diferenças

Proporções aparecem em conversão, inadimplência, aprovação, defeitos e retenção. O intervalo aproximado normal usa p̂ ± z√[p̂(1-p̂)/n], mas pode funcionar mal quando n é pequeno ou a proporção é muito próxima de zero ou um. Métodos como Wilson são preferíveis nesses casos.

Para comparar duas proporções independentes, calcula-se a diferença p̂1 − p̂2 e seu erro-padrão não combinado para o intervalo. A faixa indica tanto direção quanto magnitude plausível. Razão de riscos e odds ratio são alternativas úteis, desde que explicadas corretamente.

Em uma campanha, 121 de 1.100 pessoas converteram; no controle, 96 de 1.200. As taxas são 11% e 8%. A diferença estimada é 3 pontos percentuais. O intervalo aproximado de 95% para campanha menos controle vai de 0,6 a 5,4 pontos percentuais.

A interpretação executiva pode informar que a campanha provavelmente elevou a conversão, mas o ganho plausível varia. Para orçamento, é necessário transformar pontos percentuais em clientes, margem e custo incremental.

Percentual relativo e ponto percentual não são sinônimos. A passagem de 8% para 11% representa aumento de 3 pontos percentuais e de 37,5% em termos relativos. Relatórios devem escolher a métrica que melhor responde à decisão e, quando possível, apresentar ambas.

IC para diferença de proporções = (p̂1 − p̂2) ± z × √[p̂1(1−p̂1)/n1 + p̂2(1−p̂2)/n2]

3.6 Lógica dos testes de hipótese

Um teste de hipótese avalia quão compatíveis os dados são com uma hipótese nula. A hipótese nula costuma representar ausência de diferença ou um valor de referência; a alternativa representa o efeito de interesse. O procedimento calcula uma estatística e um valor-p sob condições definidas.

O valor-p é a probabilidade, assumindo a hipótese nula e o modelo, de obter resultado tão extremo quanto o observado ou mais. Ele não é a probabilidade de a hipótese nula ser verdadeira, não mede tamanho do efeito e não informa sozinho a importância prática.

Se um teste produz p = 0,03 com α = 0,05, rejeita-se H0 segundo a regra predefinida. Ainda assim, a conclusão precisa incluir estimativa e intervalo. A decisão estatística pode mudar com α, tamanho da amostra e desenho.

Erros tipo I e II correspondem, respectivamente, a rejeitar H0 quando ela é verdadeira e deixar de rejeitá-la quando a alternativa relevante é verdadeira. O poder é a probabilidade de detectar um efeito específico. Planejamento amostral deve considerar esses erros e a diferença mínima relevante.

Expressões como “aceitar a hipótese nula” devem ser evitadas. Ausência de evidência não é evidência de ausência. Para demonstrar equivalência ou não inferioridade são necessários desenhos e margens próprios.

Estatística de teste = (estimativa − valor de H0) / erro-padrão

3.7 Teste para uma média

O teste t de uma amostra compara a média populacional a um valor de referência quando o desvio-padrão populacional é desconhecido. A estatística é t = (x̄ − μ0)/(s/√n), com n−1 graus de liberdade.

As observações devem ser independentes e a distribuição da média deve ser aproximadamente normal. Em amostras pequenas, valores extremos e forte assimetria exigem atenção. Em amostras maiores, o Teorema Central do Limite oferece maior robustez, mas não corrige dependência nem medição inadequada.

Uma central declara meta de 50 segundos. Em 36 chamadas, a média foi 54 e o desvio-padrão 12. O erro-padrão é 2 e t = (54−50)/2 = 2. Com 35 graus de liberdade, o valor-p bilateral é próximo de 0,053; o intervalo de 95% é aproximadamente 49,94 a 58,06.

O resultado está no limite de 5% e não deve ser resumido como prova de cumprimento ou descumprimento. A estimativa sugere piora de 4 segundos, mas a faixa inclui diferença quase nula e aumento relevante. A decisão pode exigir mais dados ou uma margem operacional explícita.

Testar apenas porque a média parece diferente gera interpretações artificiais. O valor de referência e a direção do teste devem ser definidos antes, e testes unilaterais só são adequados quando efeitos na direção oposta não levariam à mesma alegação.

3.8 Comparação de duas médias independentes

O teste t para duas amostras independentes compara médias de grupos sem pareamento. A versão de Welch é recomendada como padrão porque não exige variâncias iguais. Ela usa erro-padrão √(s1²/n1 + s2²/n2) e graus de liberdade aproximados.

A independência entre grupos deve refletir o desenho. Se a mesma pessoa aparece nos dois grupos, se lojas pertencem a redes correlacionadas ou se pedidos são agrupados por cliente, o teste simples pode subestimar incerteza. A variável também deve ser quantitativa e o efeito deve ser analisado com intervalo.

Um processo A possui n=40, média 82 e desvio 12; o processo B possui n=35, média 75 e desvio 10. A diferença A−B é 7. O erro-padrão é aproximadamente 2,54; t≈2,75 e o intervalo de 95% para a diferença é cerca de 1,9 a 12,1 unidades.

A evidência indica média maior em A. A escolha do melhor processo depende do significado da variável: se for tempo, B é melhor; se for produção, A pode ser melhor. Estatística não substitui a definição do indicador.

Usar o teste clássico com variâncias agrupadas sem avaliar a suposição pode alterar o resultado, sobretudo com tamanhos desiguais. A versão de Welch reduz esse risco e deve ser preferida salvo justificativa específica.

t de Welch = (x̄1 − x̄2 − Δ0) / √(s1²/n1 + s2²/n2)

3.9 Amostras pareadas e medidas repetidas

Dados pareados surgem quando a mesma unidade é medida antes e depois ou quando unidades são combinadas por características. O teste trabalha com as diferenças dentro dos pares, reduzindo variabilidade entre unidades. A unidade de análise passa a ser a diferença.

O procedimento calcula d̄, sd e t = d̄/(sd/√n). É necessário verificar independência entre pares e distribuição das diferenças. Analisar os dois momentos como amostras independentes desperdiça a informação do pareamento e pode reduzir poder.

Em 25 pessoas, o tempo antes menos depois de um treinamento teve média de 5 minutos e desvio-padrão de 7. O erro-padrão é 1,4 e t≈3,57. O intervalo de 95% para a redução média vai de aproximadamente 2,1 a 7,9 minutos.

A conclusão deve relacionar a redução ao custo do treinamento, à manutenção do efeito e à qualidade do atendimento. Uma melhora média pode coexistir com piora em parte das pessoas, por isso a distribuição das diferenças também deve ser examinada.

Em estudos antes e depois sem grupo de comparação, mudanças podem decorrer de sazonalidade, maturação ou eventos externos. O teste pareado confirma alteração temporal, não necessariamente causalidade do programa.

t pareado = d̄ / (sd / √n)

3.10 Comparação de duas proporções

O teste para duas proporções verifica se taxas populacionais diferem. Sob H0 de igualdade, usa-se proporção combinada no erro-padrão do teste. Para o intervalo da diferença, usa-se erro-padrão não combinado.

As contagens esperadas precisam ser suficientemente grandes para a aproximação normal. Com eventos raros ou amostras pequenas, testes exatos podem ser mais apropriados. A unidade deve ser independente; múltiplas transações da mesma pessoa exigem outra estrutura.

No exemplo de conversão, controle 96/1.200 e campanha 121/1.100. A proporção combinada é 217/2.300≈9,43%. O erro-padrão sob H0 é cerca de 0,0122 e z≈2,46, produzindo valor-p bilateral próximo de 0,014.

A evidência estatística favorece diferença, mas a decisão exige custo por exposição, margem por conversão e possíveis efeitos de longo prazo. O intervalo de 0,6 a 5,4 pontos percentuais é mais informativo que o valor-p isolado.

Testes repetidos em muitos segmentos aumentam falsos positivos. Se a empresa examina dezenas de recortes, deve usar correções, hierarquia de métricas ou validação posterior.

z = (p̂1 − p̂2) / √[p̂c(1−p̂c)(1/n1 + 1/n2)]

3.11 Testes para variâncias e dispersão

A variabilidade pode ser tão importante quanto a média. Processos com a mesma média podem diferir em previsibilidade. O teste F clássico compara duas variâncias sob normalidade; o teste de Levene é mais robusto a desvios da normalidade e costuma ser preferido.

O teste F usa F = s1²/s2² e depende fortemente da forma da distribuição. Para vários grupos, Levene ou Brown-Forsythe avaliam homogeneidade. Contudo, o objetivo gerencial pode ser estimar a diferença de dispersão, não apenas testar igualdade.

Dois fornecedores entregam com médias semelhantes, mas desvios de 1,8 e 4,5 dias. A variância do segundo é 6,25 vezes a do primeiro. Mesmo que a média seja aceitável, a maior instabilidade pode exigir estoque de segurança e gerar custo.

A interpretação deve conectar dispersão à experiência e ao risco. Coeficiente de variação pode apoiar comparações quando escalas diferem e a média é positiva e significativa.

Não se deve usar a aceitação de homogeneidade como prova de igualdade. Testes de premissas com baixa potência podem não detectar problemas; gráficos e robustez devem complementar a análise.

3.12 Qui-quadrado de independência e aderência

O teste qui-quadrado trabalha com frequências categóricas. O teste de independência avalia associação entre duas variáveis; o de aderência compara uma distribuição observada a proporções esperadas. A estatística soma (O−E)²/E nas células.

As observações devem ser independentes e as frequências esperadas não podem ser excessivamente pequenas. O resultado indica associação, mas não sua intensidade nem causalidade. Medidas como V de Cramér ajudam a quantificar o efeito.

Uma empresa cruza canal de atendimento e resolução no primeiro contato. Se as frequências observadas diferem muito das esperadas sob independência, o teste pode rejeitar H0. Em seguida, resíduos padronizados mostram quais células contribuíram mais.

A análise gerencial deve evitar concluir que o canal causa resolução. Perfis de demanda podem variar entre canais. O achado orienta investigação e, quando possível, modelagem com variáveis de controle.

Agrupar categorias apenas para obter significância pode ocultar padrões. Categorias devem ser definidas por lógica substantiva, e células raras podem exigir combinação justificada ou teste exato.

χ² = Σ (O − E)² / E

V de Cramér = √[χ² / (n × min(r−1, c−1))]

3.13 ANOVA de um fator

A análise de variância de um fator compara médias de três ou mais grupos. Em vez de realizar muitos testes t, ela decompõe a variabilidade total em variação entre grupos e dentro dos grupos. A estatística F é a razão entre quadrados médios.

As condições incluem independência, resíduos aproximadamente normais e variâncias razoavelmente homogêneas. ANOVA é relativamente robusta em grupos balanceados. A versão de Welch pode ser usada quando variâncias diferem.

Considere três métodos com dez observações cada, médias 72, 78 e 84. Se a soma de quadrados entre grupos é 720 e dentro é 540, os quadrados médios são 360 e 20. Logo, F=18 com graus de liberdade 2 e 27, evidenciando diferença global.

A ANOVA informa que nem todas as médias são iguais, mas não identifica automaticamente os pares diferentes. O tamanho do efeito η²=720/(720+540)=0,571 indica que cerca de 57,1% da variação observada é associada ao fator no conjunto analisado.

ANOVA significativa não autoriza escolher o grupo de maior média sem considerar pós-testes, custos, dispersão e desenho. Também não transforma estudo observacional em experimento causal.

F = QM entre grupos / QM dentro dos grupos

η² = SQ entre / SQ total

3.14 Comparações múltiplas e tamanhos de efeito

Após ANOVA significativa, procedimentos pós-teste controlam o erro familiar. Tukey é apropriado para todas as comparações pareadas com variâncias homogêneas; Games-Howell é útil quando variâncias e tamanhos diferem. Contrastes planejados podem ser mais eficientes quando hipóteses foram definidas antes.

Além de valores-p ajustados, devem ser apresentadas diferenças, intervalos e medidas de efeito. Cohen d padroniza diferença entre duas médias; η² e ω² resumem o fator. Medidas não substituem unidades originais, que continuam necessárias para a decisão.

Se métodos A, B e C têm médias 72, 78 e 84, comparações podem mostrar C>A e C>B, enquanto B>A pode ou não ser detectável. A recomendação precisa considerar ganho incremental e custo de implementação.

Correções tornam critérios mais rigorosos porque muitos testes aumentam a chance de ao menos um falso positivo. A seleção de apenas comparações favoráveis sem ajuste é uma forma de multiplicidade oculta.

Tamanho de efeito deve ser contextualizado. Um d de 0,3 pode ser importante em grande escala ou irrelevante em processo caro. Limiares genéricos não substituem conhecimento do campo.

3.15 ANOVA de dois fatores e interação

A ANOVA de dois fatores avalia simultaneamente dois fatores categóricos e sua interação. A interação ocorre quando o efeito de um fator depende do nível do outro. Em Administração, isso permite investigar, por exemplo, método de treinamento e turno, campanha e segmento ou embalagem e região.

O modelo contém efeitos principais A e B e termo A×B. Quando a interação é relevante, efeitos principais médios podem ser enganosos. Gráficos de médias por grupo ajudam a visualizar linhas paralelas ou cruzamentos.

Suponha que um treinamento melhore produtividade no turno diurno, mas não no noturno. A média geral pode sugerir efeito moderado, enquanto a interação revela necessidade de adaptação por turno.

A interpretação deve começar pela interação. Se ela for pequena, efeitos principais podem ser discutidos. Se for grande, apresentam-se efeitos simples e comparações dentro de níveis.

Desenhos desbalanceados e dados ausentes exigem cuidado com tipos de soma de quadrados. A análise deve registrar codificação, referência e método empregado.

3.16 Métodos não paramétricos

Métodos não paramétricos são úteis para dados ordinais, distribuições muito assimétricas, amostras pequenas ou presença de valores extremos incompatíveis com testes paramétricos. Eles frequentemente trabalham com postos em vez de valores originais.

Mann-Whitney compara duas amostras independentes; Wilcoxon signed-rank, pares; Kruskal-Wallis, três ou mais grupos; Friedman, medidas repetidas. Esses testes não são simplesmente “testes de medianas” em todas as condições: a interpretação depende da forma das distribuições.

Uma pesquisa com escala de 1 a 5 pode comparar satisfação entre dois canais pelo Mann-Whitney. O resultado indica tendência de postos diferentes. Devem ser apresentados distribuição, medianas, intervalos ou medida de efeito compatível.

Escolher método não paramétrico não elimina necessidade de independência e desenho adequado. Também pode haver perda de poder quando o teste paramétrico é apropriado.

Não se deve decidir apenas por um teste de normalidade. Em amostras grandes, pequenas imperfeições geram rejeição; em pequenas, problemas sérios podem passar despercebidos. Gráficos, escala, outliers e robustez devem orientar a escolha.

3.17 Correlação de Pearson, Spearman e correlação parcial

Correlação mede associação, não causalidade. Pearson quantifica relação linear entre variáveis quantitativas; Spearman usa postos e capta associação monotônica, sendo mais robusto a extremos e adequado a dados ordinais. A correlação parcial examina a relação entre duas variáveis controlando linearmente outras.

O coeficiente varia de −1 a 1. Valor próximo de zero indica pouca associação do tipo medido, não ausência de qualquer relação. Um padrão curvo pode ter correlação linear baixa. O diagrama de dispersão deve preceder o coeficiente.

Vendas e publicidade podem apresentar r=0,85, mas ambas crescerem com o tempo. Ao controlar tendência ou sazonalidade, a correlação parcial pode cair. Essa mudança sugere confundimento temporal.

Intervalos de confiança e tamanho da amostra importam. Correlações elevadas em poucos casos podem ser instáveis. A interpretação deve considerar unidade, amplitude das variáveis e seleção da amostra.

Correlação entre indicadores construídos com denominadores comuns pode ser artificial. Também é perigoso calcular dezenas de correlações e destacar apenas as maiores sem ajuste ou validação.

r = Σ[(xi−x̄)(yi−ȳ)] / √[Σ(xi−x̄)² Σ(yi−ȳ)²]

3.18 Regressão linear simples

A regressão linear simples modela a média de Y como função linear de X: Ŷ = b0 + b1X. O intercepto representa o valor previsto quando X=0, se essa condição tiver sentido; a inclinação b1 representa a variação média prevista em Y para aumento de uma unidade em X.

Os coeficientes de mínimos quadrados minimizam a soma dos resíduos ao quadrado. R² representa a proporção da variação de Y explicada pelo modelo na amostra, mas não mede causalidade nem garante qualidade preditiva fora dela.

Com investimentos em publicidade de 10, 20, 30, 40 e 50 e vendas de 100, 120, 138, 165 e 185, a reta estimada é Ŷ=77,1+2,15X. Para X=35, a previsão pontual é 152,35. O R² da pequena amostra é aproximadamente 0,996.

A inclinação sugere aumento médio de 2,15 unidades de venda por unidade de publicidade no intervalo observado. O R² muito alto deve ser interpretado com cautela por haver apenas cinco pontos e possível tendência comum.

Extrapolar para X=100 seria arriscado. O relacionamento pode saturar, custos marginais podem aumentar e outras condições podem mudar. A faixa observada define o domínio mais defensável.

Ŷ = b0 + b1X

b1 = Σ[(xi−x̄)(yi−ȳ)] / Σ(xi−x̄)²

3.19 Regressão linear múltipla

A regressão múltipla relaciona Y a vários preditores: Ŷ = b0 + b1X1 + ... + bkXk. Cada coeficiente representa associação média com Y mantendo os demais preditores constantes, dentro do modelo e da faixa dos dados.

O método ajuda a controlar confundidores observados, estimar efeitos parciais e melhorar previsões. Ainda assim, omissão de variáveis, erros de medição, seleção e simultaneidade podem produzir coeficientes enviesados. A escolha de variáveis deve combinar teoria e diagnóstico, não apenas algoritmo automático.

Um modelo de vendas pode incluir preço, publicidade, número de pontos e sazonalidade. Se bpreço=−12, a interpretação é queda média prevista de 12 unidades para aumento de uma unidade monetária no preço, mantendo os demais fatores constantes.

O R² ajustado penaliza inclusão de variáveis sem contribuição suficiente. Erro de previsão em validação é mais relevante que R² de treinamento quando o objetivo é prever. Para explicação, coeficientes, intervalos e plausibilidade substantiva são centrais.

Coeficientes não devem ser comparados diretamente quando escalas diferem. Padronização pode apoiar comparação, mas a comunicação em unidades originais costuma ser mais útil para decisões.

Ŷ = b0 + b1X1 + b2X2 + ... + bkXk

3.20 Diagnóstico de regressão

Um modelo linear pressupõe relação adequada, independência dos erros, variância aproximadamente constante e resíduos com comportamento compatível para inferência. Diagnóstico inclui gráficos de resíduos versus ajustados, Q-Q plot, alavancagem, distância de Cook e análise temporal.

Heterocedasticidade ocorre quando a variância dos erros muda com o nível previsto. Pode afetar erros-padrão; soluções incluem transformação, modelagem da variância ou erros robustos. Autocorrelação é comum em séries e painéis e exige métodos próprios.

Um ponto com X muito distante pode ter alta alavancagem e alterar fortemente a reta. Ele não deve ser removido automaticamente. Primeiro verifica-se erro, depois contexto e sensibilidade do modelo com e sem o caso.

Influência é uma propriedade da combinação de posição e resíduo. Observações influentes podem revelar novos segmentos, falhas de processo ou limites do modelo. Documentar decisões sobre esses casos é parte da governança.

Um modelo pode apresentar resíduos visualmente adequados e ainda sofrer causalidade reversa ou viés de seleção. Diagnóstico estatístico não substitui análise do desenho.

3.21 Multicolinearidade

Multicolinearidade ocorre quando preditores são fortemente relacionados. Ela não necessariamente prejudica previsão conjunta, mas aumenta erros-padrão e torna coeficientes individuais instáveis. Pequenas mudanças na amostra podem alterar sinais e magnitudes.

O fator de inflação da variância, VIF, ajuda a detectar o problema. Valores elevados devem ser examinados no contexto. Possíveis respostas incluem combinar variáveis, escolher uma representação, coletar mais dados, usar conhecimento teórico ou técnicas de regularização em cursos avançados.

Preço de tabela, desconto e preço final podem ser quase determinísticos entre si. Incluir todos no mesmo modelo gera dificuldade interpretativa. A solução depende da pergunta: efeito do preço final, da política de desconto ou da posição de mercado.

Remover automaticamente a variável com maior VIF pode criar omissão relevante. A decisão precisa preservar a especificação substantiva.

Multicolinearidade perfeita impede estimação; alta colinearidade permite cálculo, mas reduz capacidade de separar efeitos. O relatório deve reconhecer essa limitação.

VIFj = 1 / (1 − Rj²)

3.22 Variáveis indicadoras e interações em regressão

Variáveis categóricas entram na regressão por indicadores binários, com uma categoria de referência. Para uma variável com g categorias, usam-se normalmente g−1 indicadores. O coeficiente representa diferença em relação à referência, controlando outros termos.

Interações permitem que o efeito de X varie por grupo ou por nível de Z. O modelo Y=b0+b1X+b2Z+b3XZ exige interpretar efeitos condicionais: efeito de X é b1+b3Z.

Um modelo de salário pode incluir experiência, indicador de modalidade e interação. Se a interação for negativa, o retorno da experiência difere entre modalidades. A interpretação deve apresentar previsões ou efeitos em valores concretos.

A categoria de referência muda a redação dos coeficientes, mas não as previsões gerais. Escolher referência substantivamente útil melhora comunicação.

Inserir muitas interações sem hipótese aumenta complexidade e multiplicidade. Interações devem ser motivadas e acompanhadas por gráficos.

3.23 Introdução à regressão logística

Quando a resposta é binária, como comprar ou não, inadimplir ou não, a regressão linear pode produzir probabilidades fora de 0 e 1 e variância inadequada. A regressão logística modela o logaritmo das chances como função linear dos preditores.

O modelo é log[p/(1−p)] = b0 + b1X1 + ... . A exponencial de um coeficiente produz odds ratio. Um OR de 1,20 indica multiplicação das chances por 1,20 para aumento de uma unidade, mantendo outras variáveis constantes.

Se a probabilidade inicial é 20%, as chances são 0,25. Multiplicar por 1,20 gera 0,30, correspondente a probabilidade de 23,1%, não 24%. Odds e probabilidade são diferentes, especialmente quando o evento é comum.

A avaliação deve incluir discriminação, calibração, limiar e custos de erros. Acurácia isolada pode ser enganosa em eventos raros.

Coeficientes logísticos não comprovam causalidade. Modelos de risco que afetam pessoas exigem validação por grupo, explicação, proteção de dados e revisão humana.

log[p/(1−p)] = b0 + b1X1 + ... + bkXk

Odds ratio de Xj = e^(bj)

3.24 Componentes de séries temporais

Uma série temporal é uma sequência ordenada no tempo. Seus componentes podem incluir nível, tendência, sazonalidade, ciclos, intervenções e ruído. A ordem importa: observações próximas costumam ser correlacionadas, o que impede usar métodos independentes sem ajuste.

A exploração inclui gráfico temporal, decomposição, taxas de crescimento, autocorrelação e identificação de mudanças estruturais. A frequência deve corresponder à decisão: diária para escala, semanal para reposição, mensal para orçamento.

Vendas mensais podem crescer 2% ao mês e aumentar em dezembro. Comparar dezembro a novembro confunde sazonalidade; comparar ao dezembro anterior ajuda a separar padrões.

Uma previsão deve informar horizonte, data de corte e intervalo. Quanto maior o horizonte, maior tende a ser a incerteza. Eventos externos podem invalidar padrões históricos.

Preencher datas ausentes com zero pode criar quedas artificiais. É necessário distinguir ausência de observação de valor realmente zero.

3.25 Médias móveis e suavização exponencial

A média móvel de k períodos suaviza variações e responde com atraso. A suavização exponencial simples atualiza a previsão por Ft+1=αYt+(1−α)Ft, dando maior peso ao recente conforme α aumenta.

Médias móveis são transparentes e úteis quando não há tendência forte. Suavização simples é apropriada para série com nível relativamente estável. Tendência e sazonalidade exigem extensões, como Holt e Holt-Winters.

Com previsão anterior 200, valor observado 230 e α=0,30, a nova previsão é 0,30×230+0,70×200=209. O ajuste é parcial, evitando seguir integralmente uma oscilação.

Parâmetros devem ser escolhidos por validação, não apenas por aparência. Comparar erro em dados usados para ajustar favorece modelos mais flexíveis.

Uma previsão operacional precisa ser atualizada e acompanhada. O melhor modelo no passado pode perder desempenho após mudança de preço, canal ou comportamento.

Ft+1 = αYt + (1 − α)Ft

3.26 Avaliação de previsões

Métricas de erro permitem comparar modelos. MAE é a média dos erros absolutos; RMSE penaliza erros grandes; MAPE expressa percentuais, mas é problemático com valores zero ou muito pequenos; WAPE e MASE são alternativas.

A avaliação deve separar treino, validação e teste respeitando a ordem temporal. Validação com janela deslizante simula uso real melhor que divisão aleatória.

Erros de 10, −5, 20 e −15 têm MAE de 12,5. O erro médio é 2,5 e poderia sugerir bom desempenho por cancelamento, mostrando por que viés e magnitude devem ser examinados separadamente.

A escolha da métrica deve refletir custo. Em estoque, subestimar pode ser mais caro que superestimar; pode-se usar perdas assimétricas e nível de serviço.

Comparar modelos apenas por uma métrica oculta estabilidade e interpretabilidade. O relatório deve incluir benchmark ingênuo, desempenho por segmento e análise dos maiores erros.

MAE = Σ|Yt − Ft| / n

RMSE = √[Σ(Yt − Ft)² / n]

3.27 Números-índice e deflacionamento

Números-índice sintetizam variações de preços, quantidades ou valores. Índices de Laspeyres usam quantidades do período-base; Paasche, quantidades correntes; Fisher combina ambos geometricamente. A escolha afeta o resultado quando padrões de consumo mudam.

Deflacionar significa remover efeito de preços para comparar valores reais. Valor real em preços de base pode ser calculado dividindo o valor nominal por índice/100. A base e a fonte precisam ser registradas.

Se receita nominal cresce de 1,0 para 1,10 milhão e o índice de preços passa de 100 para 108, a receita real no segundo período é cerca de 1,0185 milhão em preços-base, crescimento real aproximado de 1,85%.

Confundir crescimento nominal e real pode superestimar desempenho. A escolha do deflator deve representar a estrutura de custos ou preços relevante.

Índices podem sofrer substituição, mudança de qualidade e atualização de cesta. Comparações longas exigem encadeamento e atenção metodológica.

Valor real = Valor nominal / (Índice de preços / 100)

3.28 Controle estatístico de processos

Gráficos de controle acompanham estatísticas no tempo e utilizam linha central e limites calculados a partir da variação do processo. Pontos além dos limites ou padrões não aleatórios sugerem causas especiais. Limites de controle não são o mesmo que especificações do cliente.

Para médias de subgrupos, usa-se gráfico X̄ em conjunto com R ou S. Para proporções defeituosas, gráfico p; para contagens, c ou u. A escolha depende da variável e do tamanho da amostra.

Se a média histórica de uma proporção é 4% e cada amostra tem 200 unidades, os limites aproximados de 3 sigma são p̄ ±3√[p̄(1−p̄)/n], resultando limite superior perto de 8,16% e inferior truncado em zero.

Um ponto dentro dos limites pode ainda violar especificação; um ponto fora indica instabilidade, não necessariamente produto fora de requisito. A resposta é investigar causa, não ajustar indiscriminadamente o processo.

Limites devem ser estimados em período estável. Incluir eventos especiais no cálculo amplia limites e esconde sinais. Depois de tratar causas documentadas, a linha-base pode ser recalculada.

LSC e LIC do gráfico p = p̄ ± 3√[p̄(1−p̄)/n]

3.29 Desenho de experimentos e testes A/B

Um experimento compara intervenções com alocação controlada, idealmente aleatória. A randomização equilibra fatores observados e não observados em média. O desenho deve definir unidade, tratamentos, métrica principal, duração, tamanho amostral e regra de parada.

Bloqueio pode aumentar precisão ao randomizar dentro de segmentos, como região ou perfil. Experimentos fatoriais testam mais de um fator e interações. Contaminação ocorre quando unidades de grupos diferentes influenciam-se.

Um teste de página pode randomizar pessoas usuárias entre versão A e B, medir conversão em sete dias e planejar amostra para detectar aumento de 8% para 10%. A análise precisa considerar usuários únicos, não sessões repetidas tratadas como independentes.

A decisão deve incluir efeito absoluto, intervalo, custo e métricas de proteção, como reclamações ou cancelamentos. Ganho de conversão que reduz confiança pode ser indesejável.

Encerrar o teste no primeiro resultado significativo aumenta falsos positivos. Monitoramento sequencial exige métodos próprios; caso contrário, a duração deve ser respeitada.

3.30 Poder, tamanho amostral e diferença mínima relevante

O tamanho amostral depende de variabilidade, nível de significância, poder e efeito mínimo de interesse. Quanto menor o efeito a detectar, maior a amostra. Planejar após observar o resultado não substitui o cálculo prévio.

A diferença mínima relevante deve ser definida em unidades gerenciais. Em conversão, pode ser 1 ponto percentual; em tempo, 3 minutos; em satisfação, 0,4 ponto. Essa definição conecta análise a custo e benefício.

Um teste pode não ser significativo porque o efeito é ausente ou porque a amostra é insuficiente. Intervalos largos ajudam a reconhecer essa ambiguidade. Uma amostra enorme pode tornar significativa uma diferença trivial.

O poder é calculado para cenários específicos. Não existe “poder do estudo” sem efeito alternativo. Análises de sensibilidade mostram quais efeitos seriam detectáveis com a amostra disponível.

Em múltiplas métricas, o planejamento deve priorizar uma variável principal. Dimensionar e interpretar todas como confirmatórias aumenta complexidade e erro.

3.31 Dados ausentes, valores extremos e transformações

Dados ausentes podem ser completamente aleatórios, condicionais a variáveis observadas ou relacionados ao próprio valor não observado. A estratégia de tratamento depende desse mecanismo. Excluir linhas completas pode reduzir amostra e introduzir viés.

Imputação pela média reduz variância e distorce relações. Métodos múltiplos são preferíveis em análises avançadas, mas exigem modelo adequado. Em qualquer nível, deve-se relatar quantidade, padrão e tratamento dos ausentes.

Valores extremos podem ser erros ou casos reais. A análise inclui verificação de fonte, regras de negócio, gráficos e influência. Transformações logarítmicas podem reduzir assimetria e tornar relações multiplicativas mais lineares.

Resultados devem ser comparados em análises de sensibilidade. Se a conclusão depende de excluir poucos casos, isso precisa ser explícito.

Regras automáticas como remover tudo além de três desvios podem eliminar eventos importantes. A decisão deve considerar processo e objetivo, não apenas distância estatística.

3.32 Multiplicidade, seleção de modelos e reprodutibilidade

Quando muitas hipóteses são testadas, cresce a chance de falsos positivos. Correções como Bonferroni controlam erro familiar; procedimentos de FDR controlam proporção esperada de descobertas falsas. A melhor proteção é planejar hipóteses e separar exploração de confirmação.

Seleção automática de variáveis baseada apenas em valor-p pode produzir modelos instáveis e coeficientes otimistas. Validação cruzada, amostra de teste e conhecimento teórico reduzem esse risco. O modelo final deve registrar todas as decisões.

Se vinte segmentos são comparados a α=5%, mesmo sem diferenças verdadeiras espera-se em média um resultado significativo. Destacar esse único segmento como descoberta pode orientar investimento equivocado.

Reprodutibilidade exige base identificada, código ou fórmulas, versões, sementes aleatórias, dicionário de dados e relatório de exclusões. Uma análise que só existe na memória de quem a fez não é um ativo organizacional confiável.

Transparência não significa divulgar dados pessoais. É possível documentar processo, proteger informações e permitir auditoria por pessoas autorizadas.

4. Principais Temas e Organização

A disciplina pode ser organizada em dezesseis semanas, alternando conceitos, resolução manual, uso de ferramentas e interpretação. O cronograma abaixo é uma referência. Instituições podem alterar a sequência conforme pré-requisitos e carga horária, mas é recomendável preservar a progressão da comparação simples para modelos e séries.

Semanas

Módulo

Conteúdos e produto esperado

1–2

Revisão e desenho

inferência, estimadores, erro-padrão, plano de análise e qualidade dos dados

3–4

Duas populações

médias independentes, pareadas, proporções, variâncias e efeito

5

Dados categóricos

qui-quadrado, resíduos e associação

6–7

Múltiplos grupos

ANOVA, pós-testes, interação e alternativas robustas

8

Métodos não paramétricos

Mann-Whitney, Wilcoxon, Kruskal-Wallis e Friedman

9–10

Regressão

correlação, regressão simples, múltipla, indicadores e interações

11

Diagnóstico

resíduos, heterocedasticidade, influência e multicolinearidade

12

Resposta binária

introdução à regressão logística e avaliação

13–14

Séries temporais

componentes, suavização, tendência e erros de previsão

15

Processos e experimentos

gráficos de controle, testes A/B e tamanho amostral

16

Integração

estudo de caso, apresentação executiva e auditoria da análise

 

Módulo 1 — Retomada dos fundamentos

O início revisa população, amostra, parâmetro, estatística, distribuições amostrais, intervalos e testes. A revisão deve ser aplicada a uma base realista, pois o objetivo é verificar se a turma consegue estruturar uma pergunta antes de avançar. Um diagnóstico inicial pode incluir identificação de variáveis, cálculo de erro-padrão e interpretação de um intervalo. Dificuldades em frações, porcentagens e álgebra precisam ser tratadas cedo para não se acumularem.

Módulo 2 — Comparações entre duas populações

Este bloco concentra testes para médias e proporções, com distinção entre grupos independentes e pareados. As atividades devem exigir escolha de método e justificativa, não apenas cálculo. Recomenda-se comparar resultados paramétricos e não paramétricos em bases com assimetria. Tamanho de efeito e intervalo devem aparecer em todas as conclusões.

Módulo 3 — Tabelas de contingência

O conteúdo inclui frequências esperadas, estatística qui-quadrado, resíduos e V de Cramér. Um exercício útil cruza canal e desfecho, pedindo que a pessoa estudante identifique associação e proponha variáveis que poderiam confundir a relação. A discussão deve enfatizar que associação em tabela não é causalidade.

Módulo 4 — ANOVA e comparações múltiplas

A turma aprende decomposição da variabilidade e lógica da estatística F. Em seguida, trabalha pós-testes, tamanhos de efeito, ANOVA de Welch e interação. A apresentação visual de médias e intervalos é importante. Atividades devem mostrar por que executar muitos testes t sem correção é problemático.

Módulo 5 — Métodos não paramétricos

O módulo não deve ser apresentado como coleção de substitutos automáticos para a normalidade. Ele parte da escala, do desenho e da pergunta. A turma compara o significado de médias, medianas e postos e aprende que resultados de testes de postos precisam ser comunicados com cuidado.

Módulo 6 — Regressão e diagnóstico

A regressão deve ser construída a partir do diagrama de dispersão e da ideia de resíduos. Começa-se com uma variável e avança-se para múltiplas, indicadores e interações. O diagnóstico é parte do modelo, não capítulo opcional. Planilhas podem ser usadas inicialmente; software estatístico facilita resíduos, intervalos e múltiplos preditores.

Módulo 7 — Séries temporais e previsão

O estudo começa com linha do tempo e benchmark ingênuo. Depois são introduzidas médias móveis, suavização e tendência. A turma deve treinar validação temporal e métricas de erro. O trabalho final pode comparar dois modelos e recomendar uso operacional, explicando quando não confiar na previsão.

Módulo 8 — Controle, experimentação e governança

O fechamento combina gráficos de controle, testes A/B, tamanho amostral e reprodutibilidade. A turma aprende que um experimento precisa de plano e que um gráfico de controle exige linha-base estável. O produto final deve conter uma recomendação executiva e um apêndice técnico suficiente para auditoria.

Estratégias didáticas

·         usar bases pequenas para cálculos manuais e bases maiores para ferramentas;

·         pedir sempre uma frase de interpretação após cada resultado;

·         apresentar exemplos com conclusão significativa, não significativa e inconclusiva;

·         incluir casos em que as premissas falham e a técnica precisa ser modificada;

·         comparar decisão baseada apenas no valor-p com decisão baseada em efeito, intervalo e custo;

·         exigir dicionário de dados e registro das transformações;

·         promover revisão por pares de gráficos e relatórios;

·         incluir exercícios de identificação de afirmações exageradas em notícias e dashboards.

Ferramentas

Planilhas são adequadas para organização, tabelas, gráficos, regressão simples e previsões básicas. Para ANOVA, diagnóstico, testes não paramétricos e modelos mais amplos, R, Python, Jamovi, JASP, PSPP ou outros programas podem oferecer maior transparência. A escolha depende da infraestrutura. O princípio é invariável: a pessoa estudante precisa conhecer entradas, saídas e interpretação. Copiar uma tabela automática sem entender suas linhas não demonstra domínio.

Avaliação sugerida

Componente

Peso ilustrativo

Competência observada

Listas resolvidas

20%

cálculo, escolha e interpretação

Análise de base

20%

limpeza, exploração e documentação

Prova conceitual

25%

premissas, inferência e leitura crítica

Estudo de caso

25%

integração de métodos e decisão

Apresentação

10%

comunicação para público não técnico

 

5. Relação com outras matérias

Métodos Estatísticos I

O volume I fornece a linguagem dos dados, probabilidade e inferência básica. O volume II reutiliza média, variância, distribuição normal, t, qui-quadrado e erro-padrão para comparar e modelar. Dificuldades anteriores reaparecem em regressão e ANOVA; por isso, a revisão deve ser contínua. A relação é cumulativa, mas não redundante: o primeiro volume pergunta como resumir e estimar; o segundo, como comparar, explicar, prever e monitorar.

Pesquisa Operacional e Métodos Determinísticos

Modelos de otimização precisam de parâmetros como demanda, tempo e custo. Métodos estatísticos estimam esses parâmetros e sua incerteza. Uma solução ótima baseada em uma previsão ruim pode ser operacionalmente frágil. Por outro lado, a estatística identifica padrões, mas não escolhe automaticamente a melhor alocação sob restrições. As disciplinas se complementam na passagem de dados para decisão.

Matemática Financeira e Finanças

Finanças utiliza regressões para estimar risco e retorno, séries temporais para projeções, testes para comparar carteiras e cenários para orçamento. A estatística também apoia análise de inadimplência, custo de capital e avaliação de desempenho. É importante distinguir variabilidade histórica, erro de estimação e risco futuro. Um coeficiente calculado com dados passados possui incerteza e pode mudar estruturalmente.

Contabilidade e Controladoria

Análises de custos, desvios, indicadores e auditoria dependem de comparação e amostragem. Regressão pode estimar comportamento de custos; gráficos de controle monitoram processos; testes avaliam diferenças entre unidades. A base contábil possui regras próprias e pode apresentar mudanças de classificação, sazonalidade e lançamentos extraordinários que precisam ser tratados antes da modelagem.

Marketing e Pesquisa de Mercado

Pesquisas utilizam amostragem, intervalos, testes, segmentação e regressão. Experimentos avaliam campanhas, páginas e ofertas. Modelos de resposta binária estimam conversão e abandono. A estatística precisa ser combinada a desenho de questionário, teoria do comportamento e ética. Uma regressão com respostas de conveniência não corrige automaticamente o viés de quem respondeu.

Gestão de Pessoas

A disciplina apoia pesquisas de clima, avaliação de treinamento, rotatividade, absenteísmo e equidade. ANOVA compara unidades; regressão controla características; modelos logísticos estudam eventos. Como os dados se referem a pessoas, privacidade, finalidade, discriminação e possibilidade de contestação ganham destaque. Modelos não devem transformar correlações em rótulos deterministas.

Operações, Logística e Qualidade

Previsão orienta estoque e capacidade; testes comparam fornecedores; gráficos de controle distinguem causas; regressão analisa produtividade. O conceito de independência precisa ser adaptado a lotes, turnos e unidades agrupadas. Dados operacionais podem ser abundantes, mas a qualidade de medição e a mudança de processo são desafios constantes.

Economia e Econometria

Econometria aprofunda regressão, causalidade, séries e dados em painel. Métodos Estatísticos II oferece base para interpretar coeficientes, erros e testes. Questões econômicas frequentemente envolvem endogeneidade e dependência temporal, mostrando por que associação controlada ainda não garante causalidade. A transição para econometria exige maior atenção ao desenho e à teoria.

Sistemas de Informação e Ciência de Dados

Bancos de dados, programação e visualização operacionalizam a análise. A estatística fornece critérios para validação, generalização e incerteza. Ciência de dados amplia modelos e escala, mas continua dependente de amostragem, métricas, experimentação e governança. A integração evita dashboards sem inferência e algoritmos sem avaliação substantiva.

Metodologia Científica e TCC

Projetos acadêmicos usam hipóteses, amostras, instrumentos e análise. O conteúdo ajuda a escolher testes e a evitar conclusões além do desenho. A seção de método deve registrar critérios, tratamento de ausentes, software e nível de significância; resultados devem apresentar estimativas e limitações. A técnica deve responder ao problema, não ser incluída apenas para sofisticar o trabalho.

6. Aplicações Práticas e Profissionais

As aplicações a seguir mostram como a disciplina aparece em rotinas reais. Cada caso parte de uma decisão, indica uma técnica e destaca uma cautela. Em projetos profissionais, a análise normalmente combina vários métodos e exige participação das áreas responsáveis pelo processo.

6.1 Comparação de fornecedores

Uma empresa compara prazo médio, variabilidade e taxa de avarias de três transportadoras. ANOVA ou Welch avalia tempos; qui-quadrado ou modelos de proporção avaliam avarias; pós-testes localizam diferenças. A decisão deve converter atraso e avaria em custo, observar rotas atendidas e controlar perfil dos pedidos. Escolher apenas a menor média pode aumentar risco se a variabilidade for alta.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.2 Avaliação de treinamento

Participantes são medidos antes e depois, com grupo de comparação quando possível. O teste pareado avalia mudança interna; um desenho com grupo permite comparar diferenças. Efeito, intervalo e permanência devem ser reportados. Notas maiores logo após o curso não garantem transferência para o trabalho.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.3 Teste A/B de comunicação

Duas versões de mensagem são randomizadas. O teste de duas proporções compara conversão; regressão logística pode ajustar bloqueios. Define-se métrica principal, amostra, duração e métricas de proteção. Segmentos são exploratórios salvo planejamento. O resultado precisa considerar ganho absoluto e custo.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.4 Previsão de demanda

Vendas semanais são decompostas em tendência e sazonalidade. Benchmark ingênuo, média móvel e suavização são comparados por validação temporal. Erros por produto orientam estoque de segurança. Lançamentos e promoções devem ser tratados como intervenções, não ruído comum.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.5 Rotatividade de pessoal

Um modelo logístico investiga associações entre desligamento e tempo de casa, remuneração, liderança e jornada. A análise deve excluir variáveis impróprias, verificar desempenho por grupo e evitar uso punitivo. O objetivo é identificar condições organizacionais, não atribuir destino individual.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.6 Pesquisa de satisfação

Intervalos estimam médias ou proporções; ANOVA compara unidades; regressão controla perfil. Pesos podem corrigir desenho amostral. Não resposta e modo de coleta devem ser discutidos. O indicador global deve ser complementado por distribuição e temas qualitativos.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.7 Controle de defeitos

Gráfico p acompanha proporção de defeitos por lote. Um sinal fora de controle gera investigação de material, máquina, método e medição. Antes de recalcular limites, a equipe documenta causas. Meta contratual permanece separada dos limites estatísticos.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.8 Análise de preços

Regressão estima relação entre preço e quantidade, controlando sazonalidade e comunicação. Experimentos locais fortalecem causalidade. Elasticidade e margem substituem interpretação limitada do coeficiente. Concorrência e simultaneidade podem enviesar modelos observacionais.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.9 Desempenho de unidades

ANOVA e modelos com indicadores comparam lojas ou serviços. Ajustes por tamanho, localização e mix reduzem comparações injustas. Rankings pontuais devem ser acompanhados por intervalos, pois unidades pequenas oscilam mais. A análise deve apoiar aprendizagem e não apenas punição.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.10 Tempo de atendimento

Distribuições assimétricas tornam mediana e quantis importantes. Testes não paramétricos ou modelos transformados podem comparar canais. Séries e controle identificam mudanças. A meta média não deve ocultar caudas longas que afetam parte das pessoas usuárias.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.11 Inadimplência

Modelos logísticos estimam risco e ajudam a planejar provisões. A base deve separar data de concessão e resultado futuro para evitar vazamento. Avaliação inclui calibração, discriminação e impacto por grupo. Decisões automatizadas precisam de governança e revisão.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.12 Auditoria por amostragem

A amostra estima taxa de não conformidade e intervalo. Estratificação concentra esforço em valores ou riscos altos. A conclusão respeita materialidade e desenho. Selecionar apenas itens suspeitos ajuda investigação, mas não estima a taxa global sem ponderação.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.13 Avaliação de política pública

Grupos, períodos e indicadores são comparados com atenção a seleção e contexto. Testes simples podem descrever diferenças; desenhos quase experimentais são necessários para causalidade mais forte. Resultados médios devem ser desagregados por território e população afetada.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.14 Saúde e segurança

Taxas de incidentes precisam usar exposição, como horas trabalhadas. Poisson ou regressões específicas podem ser necessárias. Gráficos monitoram séries. Eventos raros exigem interpretação cuidadosa: ausência em curto período não significa risco zero.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.15 Planejamento de caixa

Séries de recebimentos e pagamentos são previstas e combinadas a cenários. Erros assimétricos importam porque falta de caixa pode ser mais onerosa. Intervalos orientam reserva. Mudanças de política de cobrança devem ser marcadas como intervenção.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.16 Gestão de estoques

Previsão por item, erro e nível de serviço alimentam reposição. Itens intermitentes podem exigir métodos específicos. A média sozinha não define estoque. Classificação ABC deve ser combinada a criticidade e incerteza.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.17 Experiência digital

Funis são analisados por etapa, coorte e dispositivo. Testes A/B avaliam mudanças; múltiplas métricas requerem hierarquia. Usuários, e não eventos, frequentemente são unidades independentes. Bots e duplicidades precisam ser filtrados.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.18 Equidade remuneratória

Regressão pode comparar remuneração controlando função, experiência e jornada, mas a seleção de controles precisa ser discutida: algumas variáveis podem refletir desigualdades anteriores. Resultados devem ser acompanhados por distribuição, transparência e análise jurídica.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.19 Capacidade e filas

Tempos de chegada e serviço são estimados estatisticamente para alimentar modelos de filas. Sazonalidade e dependência importam. A validação compara tempos previstos e observados. Reduzir média pode não resolver percentis extremos.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

6.20 Indicadores ESG

Emissões, diversidade, acidentes e impactos sociais exigem definições, denominadores e auditoria. Séries avaliam progresso; testes comparam unidades; regressões exploram determinantes. Mudanças de metodologia devem ser identificadas para preservar comparabilidade.

Uma entrega profissional adequada inclui pergunta, base, método, estimativa, incerteza, visualização, recomendação e limites. A área responsável pelo processo deve validar se os dados representam a operação e se a mudança proposta é executável.

Roteiro de análise profissional

·         1. escrever a decisão que será apoiada e quem a tomará;

·         2. definir população, unidade, período, resposta e comparação;

·         3. auditar origem, cobertura, ausentes, duplicidades e mudanças de regra;

·         4. explorar distribuições e relações antes de testar;

·         5. justificar método e registrar premissas;

·         6. apresentar estimativa, intervalo, efeito e teste quando aplicável;

·         7. avaliar robustez, segmentos, influência e sensibilidade;

·         8. converter resultado em impacto operacional ou financeiro;

·         9. indicar riscos éticos, legais e de privacidade;

·         10. definir monitoramento posterior e condição de revisão.

Modelo de comunicação executiva

Uma nota executiva pode ser estruturada em cinco blocos: decisão; evidência principal; magnitude e incerteza; riscos; recomendação. O apêndice técnico registra base e método. Essa separação permite leitura rápida sem ocultar detalhes. Frases devem evitar causalidade quando o desenho é observacional e não devem apresentar “não significativo” como equivalência. Gráficos devem ter escalas claras, unidades e fontes.

Caderno de aprofundamento e atividades resolvidas

Os estudos seguintes aprofundam a aplicação dos métodos em problemas frequentes da Administração. Eles foram construídos para mostrar o encadeamento entre pergunta, escolha da técnica, cálculo, interpretação e decisão. Em uma disciplina de segundo nível, a resolução não deve terminar na estatística: é necessário discutir qualidade dos dados, premissas, tamanho do efeito, custo dos erros e monitoramento posterior.

Os números são fictícios e arredondados. Em planilhas ou softwares, recomenda-se manter precisão interna, salvar a base original e gerar uma tabela de resultados por código ou fórmulas documentadas. Cada estudo pode ser reproduzido com outras bases, transformado em atividade de grupo ou ampliado para relatório executivo.

6.21 Estudo resolvido — Meta de tempo médio

Situação. Uma central de suporte afirma que o tempo médio de resolução é no máximo 30 horas. Uma amostra aleatória de 49 chamados apresenta média de 32,4 horas e desvio-padrão de 8,4. A gerência deseja verificar se a média ultrapassa a meta e qual é a magnitude plausível do desvio.

Estrutura da análise. A resposta é quantitativa e existe uma amostra. Como o desvio populacional é desconhecido, usa-se teste t de uma amostra. As hipóteses direcionais são H0: μ≤30 e H1: μ>30. Também se calcula intervalo bilateral de 95% para permitir leitura mais ampla.

Resolução. O erro-padrão é 8,4/√49=1,2. A estatística é (32,4−30)/1,2=2,0, com 48 graus de liberdade. O valor-p unilateral é próximo de 0,026. Para o intervalo bilateral, t crítico é aproximadamente 2,01: 32,4±2,01×1,2, resultando de 29,99 a 34,81 horas.

Interpretação. O teste unilateral encontra evidência de que a média supera 30, segundo o plano definido. O intervalo bilateral quase toca 30 e mostra que o excesso médio plausível pode variar de praticamente zero a 4,8 horas. A estatística não informa quantos chamados foram muito longos; percentis e distribuição devem complementar.

Uso gerencial. A direção pode priorizar diagnóstico de causas e fixar diferença mínima operacional. Se uma hora adicional já afeta contrato, a evidência é relevante; se a tolerância é cinco horas, a conclusão gerencial muda. Recomenda-se acompanhar amostra maior e separar por complexidade.

Cuidado. Um teste unilateral só é justificável quando a direção foi definida antes. Se uma média abaixo de 30 também seria usada para uma alegação de melhoria, o teste bilateral seria mais coerente. Chamados repetidos do mesmo cliente também podem violar independência.

EP = 8,4/√49 = 1,2; t = (32,4−30)/1,2 = 2,0

6.22 Estudo resolvido — Processos com variâncias diferentes

Situação. Duas linhas de separação de pedidos são comparadas. A linha A tem n=60, média de 14,8 minutos e desvio 5,5; a linha B tem n=42, média 12,1 e desvio 9,0. A segunda parece mais rápida, mas muito mais variável.

Estrutura da análise. Como os grupos são independentes e as dispersões diferem, usa-se t de Welch. Antes do teste, gráficos devem verificar assimetria e valores extremos. A diferença de interesse é A−B; valor positivo favorece B quando menor tempo é melhor.

Resolução. A diferença é 2,7 minutos. O erro-padrão é √(5,5²/60+9²/42)=√(0,504+1,929)=1,560. t≈1,731. Com graus de liberdade aproximados, o intervalo de 95% usa crítico perto de 1,99: 2,7±3,10, ou de −0,40 a 5,80.

Interpretação. A amostra não permite afirmar diferença média com segurança a 5%, embora a estimativa favoreça B. A grande variabilidade de B pode gerar atrasos extremos, tornando inadequado escolher apenas pela média. A comparação de quantis e nível de serviço é necessária.

Uso gerencial. Um piloto adicional pode focar causas da dispersão na linha B. Se a organização conseguir estabilizá-la sem perder a vantagem média, a decisão pode mudar. Também se pode modelar tempo por tipo de pedido e turno.

Cuidado. Usar o teste com variâncias agrupadas seria questionável. Além disso, linha e turno podem estar confundidos. Se cada linha opera em períodos distintos, o desenho não separa tecnologia de contexto.

EP de Welch = √(5,5²/60 + 9²/42) ≈ 1,560; IC95% ≈ [−0,40; 5,80]

6.23 Estudo resolvido — Produtividade antes e depois

Situação. Vinte e quatro pessoas são avaliadas antes e depois de uma mudança de sistema. A diferença depois menos antes tem média 6,5 unidades e desvio 9,6. A equipe quer saber se houve melhora e se o efeito é material.

Estrutura da análise. O desenho é pareado, pois as mesmas pessoas foram medidas. O teste deve usar as diferenças. H0: μd=0; H1: μd≠0. Um gráfico das diferenças e a identificação de casos extremos antecedem o cálculo.

Resolução. O erro-padrão é 9,6/√24≈1,960. t=6,5/1,960≈3,316, com 23 graus de liberdade. Com crítico de 2,069, o intervalo é 6,5±4,06, ou de 2,44 a 10,56 unidades. O d padronizado para diferenças é 6,5/9,6≈0,68.

Interpretação. A melhora média é compatível com efeito de magnitude moderada. O intervalo exclui zero e mostra que a melhoria populacional plausível pode ser de cerca de 2,4 a 10,6 unidades. A distribuição pode revelar que algumas pessoas perderam produtividade.

Uso gerencial. A organização pode manter a mudança e oferecer apoio a quem apresentou queda. Uma medição posterior verifica persistência, pois ganhos iniciais podem refletir esforço temporário ou mudança na composição das tarefas.

Cuidado. Sem grupo de controle, a atribuição causal é limitada. Se o período posterior coincidiu com menor demanda ou bônus, parte da mudança pode ter outra origem.

t pareado ≈ 3,316; IC95% da melhora ≈ [2,44; 10,56]; d≈0,68

6.24 Estudo resolvido — Taxa de renovação

Situação. Um serviço testa uma abordagem de contato. No grupo novo, 315 de 900 contratos foram renovados; no controle, 270 de 900. A equipe precisa estimar ganho e decidir se a abordagem justifica custo adicional de R$18 por contato.

Estrutura da análise. As proporções são independentes e os grupos têm o mesmo tamanho. Calcula-se diferença absoluta, intervalo e teste. O ganho econômico deve usar margem por renovação, não apenas número de contratos.

Resolução. As taxas são 35% e 30%; diferença de 5 pontos percentuais. A proporção combinada é 585/1.800=32,5%. EP sob H0=√[0,325×0,675×(2/900)]≈0,02207. z≈2,266, com valor-p bilateral próximo de 0,023. O EP do intervalo é √[0,35×0,65/900+0,30×0,70/900]≈0,02205; IC≈0,05±0,0432, de 0,68 a 9,32 pontos.

Interpretação. A abordagem provavelmente aumenta a renovação, mas o ganho pode ser inferior a 1 ponto ou próximo de 9 pontos. Em 900 contatos, foram 45 renovações adicionais observadas.

Uso gerencial. O custo adicional total é R$16.200. O ponto de equilíbrio exige margem superior a R$360 por renovação adicional se o efeito observado se repetir. Cenários com os limites do intervalo devem ser apresentados.

Cuidado. Se a randomização ocorreu por vendedor e não por contrato, a unidade independente é vendedor. Tratar 1.800 contratos como independentes subestimaria incerteza.

Diferença = 5 p.p.; z≈2,266; IC95%≈[0,68; 9,32] p.p.

6.25 Estudo resolvido — Associação entre região e reclamação

Situação. Uma empresa registra reclamação ou ausência de reclamação em três regiões. Norte: 60 e 240; Centro: 45 e 255; Sul: 90 e 210. A pergunta é se a taxa se associa à região.

Estrutura da análise. Usa-se qui-quadrado de independência em tabela 3×2. O total de reclamações é 195 em 900, taxa global 21,67%. Como cada região tem 300 registros, o esperado é 65 reclamações e 235 sem reclamação por região.

Resolução. As contribuições para reclamações são (60−65)²/65=0,385; (45−65)²/65=6,154; (90−65)²/65=9,615. Para não reclamação: 25/235=0,106; 400/235=1,702; 625/235=2,660. χ²≈20,62, com 2 graus de liberdade. V de Cramér=√[20,62/(900×1)]≈0,151.

Interpretação. A associação é estatisticamente clara, mas de intensidade pequena a moderada. O Sul tem taxa de 30%, Centro 15% e Norte 20%. Resíduos apontam Centro abaixo e Sul acima do esperado.

Uso gerencial. A gerência deve investigar mix de produtos, canais e cobertura de assistência no Sul. Uma regressão logística pode controlar esses fatores. A associação justifica investigação direcionada, não conclusão de que a região em si causa reclamações.

Cuidado. Registros podem estar agrupados por loja. Se poucas lojas concentram dados, a independência é limitada. Também é necessário verificar se a política de registrar reclamações é igual nas regiões.

χ²≈20,62; gl=2; V de Cramér≈0,151

6.26 Estudo resolvido — ANOVA e pós-teste

Situação. Quatro métodos de treinamento são avaliados em 15 pessoas cada. As médias são 70, 74, 76 e 84. A ANOVA fornece SQ entre=1.620 e SQ dentro=5.040. A direção quer saber se há diferença e qual método merece teste ampliado.

Estrutura da análise. Com k=4 e N=60, gl entre=3 e dentro=56. Calculam-se quadrados médios e F. Depois, um pós-teste como Tukey compara pares. O tamanho do efeito ajuda a evitar decisão baseada apenas na significância.

Resolução. QM entre=540; QM dentro=90; F=6,0. SQ total=6.660 e η²=1.620/6.660≈0,243. O teste global é significativo. A diferença do método D em relação a A é 14 pontos, a B 10 e a C 8; comparações menores entre A, B e C podem não ser detectadas após ajuste.

Interpretação. Cerca de 24% da variação das notas está associada ao método na amostra, efeito relevante. O método D é candidato, mas notas não garantem desempenho no trabalho. O pós-teste e os intervalos indicam quais diferenças são sustentadas.

Uso gerencial. A empresa pode realizar piloto do D com métricas de aplicação, custo e retenção. A escolha final deve usar benefício por pessoa, tempo e acessibilidade.

Cuidado. Se pessoas escolheram voluntariamente o método, diferenças iniciais podem explicar o resultado. Randomização ou medida prévia fortalece a comparação.

F=(1620/3)/(5040/56)=6,0; η²≈0,243

6.27 Estudo resolvido — Interação entre canal e faixa etária

Situação. Uma empresa compara duas interfaces em pessoas mais jovens e mais velhas. A versão B reduz tempo entre jovens, mas aumenta entre pessoas mais velhas. A média global das versões é quase igual.

Estrutura da análise. Uma ANOVA de dois fatores ou regressão com interação deve incluir versão, faixa e versão×faixa. A pergunta principal passa a ser se o efeito da versão varia por faixa. Um gráfico de médias é indispensável.

Resolução. As médias fictícias são: jovens A=12, B=9; mais velhas A=15, B=18. O efeito de B entre jovens é −3; entre mais velhas é +3. O efeito médio de B é zero, enquanto a diferença de efeitos, a interação, é 6 minutos.

Interpretação. Ignorar interação levaria à conclusão errada de que as versões são equivalentes. O resultado sugere personalização ou revisão de acessibilidade da B para o segundo grupo.

Uso gerencial. A empresa deve investigar quais componentes geram dificuldade, testar uma versão adaptada e evitar segmentação que reforce exclusão. A análise quantitativa orienta pesquisa com pessoas usuárias.

Cuidado. Faixa etária pode representar experiência digital, visão ou dispositivo. Uma análise ética evita tratar idade como explicação essencialista e busca fatores modificáveis.

Interação = (B−A nos mais velhos) − (B−A nos jovens) = 3 − (−3) = 6 min

6.28 Estudo resolvido — Mann-Whitney em escala ordinal

Situação. Dois formatos de oficina recebem avaliações de 1 a 5. O formato A tem muitos valores 4 e 5; B concentra 3 e 4. As distribuições são assimétricas e a escala é ordinal.

Estrutura da análise. Usa-se Mann-Whitney para comparar distribuição de postos entre grupos independentes. Devem ser relatadas medianas, frequências por categoria e medida de efeito, além do valor-p.

Resolução. Com nA=25 e nB=27, o software fornece U=225 e z=−2,20 quando B−A é a direção codificada. Uma medida r=|z|/√N=2,20/√52≈0,305. A mediana de A é 5 e de B é 4.

Interpretação. A evidência indica avaliações tendencialmente maiores em A, com efeito moderado. Como a escala tem poucos pontos, a tabela completa mostra se a diferença decorre de menos avaliações baixas ou mais avaliações máximas.

Uso gerencial. O formato A pode ser mantido, mas a equipe deve examinar participação, aprendizagem e acessibilidade. Satisfação sozinha pode favorecer atividades agradáveis sem maior resultado.

Cuidado. Mann-Whitney não prova diferença de medianas se as formas das distribuições variam de modo complexo. A interpretação como diferença estocástica de postos é mais segura.

r = |z|/√N ≈ 2,20/√52 = 0,305

6.29 Estudo resolvido — Wilcoxon com poucos pares

Situação. Doze lojas recebem uma intervenção e têm variação percentual de vendas antes/depois. As diferenças são muito assimétricas porque uma loja teve grande campanha local.

Estrutura da análise. Com poucos pares e assimetria, Wilcoxon signed-rank é alternativa ao t pareado. Diferenças zero são tratadas conforme regra do método; as demais são ordenadas por magnitude e recebem sinais.

Resolução. O resultado fornece W=68 e valor-p bilateral 0,041. A mediana da diferença é 4,2%, e o intervalo não paramétrico estimado para deslocamento vai aproximadamente de 0,3% a 8,1%. Sem a loja extrema, o valor-p é 0,058, mas a mediana permanece positiva.

Interpretação. A conclusão é sensível ao pequeno tamanho, embora a direção seja favorável. A análise de sensibilidade deve ser apresentada, sem remover a loja apenas porque altera a significância.

Uso gerencial. A intervenção pode continuar em piloto, com coleta de mais períodos. A empresa também deve controlar campanhas locais e tamanho das lojas.

Cuidado. O teste supõe distribuição das diferenças aproximadamente simétrica para certas interpretações. Caso contrário, o teste de sinais é alternativa mais simples, porém menos potente.

6.30 Estudo resolvido — Kruskal-Wallis entre canais

Situação. Tempos de espera de quatro canais são fortemente assimétricos. As medianas são 4, 5, 7 e 11 minutos, com tamanhos entre 35 e 50.

Estrutura da análise. Kruskal-Wallis testa se distribuições de postos diferem. Após resultado global, comparações de Dunn com ajuste identificam pares. Boxplots ou violinos mostram caudas e sobreposição.

Resolução. O teste fornece H=18,7 com 3 graus de liberdade e p<0,001. Comparações ajustadas indicam canal D maior que A e B; diferença D−C é inconclusiva após correção. O epsilon-quadrado aproximado é (H−k+1)/(N−k). Com N=170 e k=4, resulta 15,7/166≈0,095.

Interpretação. Existe diferença global e efeito próximo de 9,5% nos postos. O canal D merece investigação, mas C também possui mediana alta. A organização deve avaliar tipo de demanda e horários.

Uso gerencial. Redirecionar pessoas do D para A sem verificar capacidade pode transferir o problema. A análise deve alimentar simulação ou estudo de filas.

Cuidado. Distribuições com formas diferentes dificultam resumir tudo como mediana. A apresentação gráfica é necessária.

ε²≈(18,7−4+1)/(170−4)=15,7/166≈0,095

6.31 Estudo resolvido — Correlação enganosa pelo tempo

Situação. Em 24 meses, seguidores e vendas apresentam correlação de Pearson 0,92. Ambas as séries cresceram ao longo do período. A direção conclui que seguidores causam vendas.

Estrutura da análise. A ordem temporal sugere tendência comum. Deve-se observar gráficos, calcular variações mensais, controlar tempo ou modelar séries. Correlação entre níveis pode ser espúria.

Resolução. Após remover tendência linear, a correlação entre resíduos cai para 0,28, com intervalo amplo. A correlação entre variações mensais é 0,19. O resultado não elimina possível efeito, mas mostra que grande parte da associação inicial vinha do crescimento conjunto.

Interpretação. O coeficiente 0,92 não sustenta causalidade. Seguidores podem crescer porque vendas e marca aumentam, ou ambos responderem à campanha. Um experimento ou variável temporal mais detalhada é necessário.

Uso gerencial. A equipe deve usar métricas de exposição e conversão, testar campanhas e evitar usar seguidores como única meta. A correlação pode permanecer útil como indicador descritivo, não como retorno marginal.

Cuidado. Diferenciar séries pode aumentar ruído. A solução não é aplicar transformação mecanicamente, mas construir modelo compatível e validar previsões.

6.32 Estudo resolvido — Regressão simples e intervalo de previsão

Situação. Uma distribuidora relaciona quilômetros percorridos por rota ao consumo de combustível. Em 40 rotas, a regressão estimada é Consumo=18+0,085×Km, com erro residual de 7 litros. A equipe deseja prever uma rota de 300 km.

Estrutura da análise. A previsão pontual é obtida pela reta. Para planejar abastecimento de uma rota individual, usa-se intervalo de previsão, mais largo que o intervalo para a média, porque inclui variação do caso e incerteza da reta.

Resolução. A previsão é 18+0,085×300=43,5 litros. Supondo erro-padrão de previsão de 7,5 e crítico 2,02, o intervalo é 43,5±15,15, ou de 28,35 a 58,65 litros.

Interpretação. A faixa ampla mostra que distância não explica tudo. Carga, tráfego, veículo e condução afetam consumo. Usar apenas 43,5 como quantidade rígida pode gerar falta em parte das rotas.

Uso gerencial. A empresa pode ampliar o modelo e usar percentil superior para planejar, equilibrando sobra e risco. A previsão deve ser recalibrada por tipo de veículo.

Cuidado. Se 300 km está fora da faixa observada, o intervalo calculado não resolve o problema de extrapolação. É necessário verificar domínio dos dados.

Ŷ(300)=18+0,085×300=43,5 L; IP95%≈[28,35;58,65] L

6.33 Estudo resolvido — Regressão múltipla de custos

Situação. Uma fábrica modela custo mensal em função de unidades produzidas, horas extras e indicador de manutenção pesada. O modelo é Custo=120.000+18×Unidades+55×HorasExtras+40.000×Manutenção.

Estrutura da análise. Os coeficientes são interpretados condicionalmente. A validação precisa verificar resíduos, sazonalidade e multicolinearidade. O indicador de manutenção representa mudança no intercepto nos meses em que ocorre.

Resolução. Para 8.000 unidades, 300 horas extras e manutenção pesada, o custo previsto é 120.000+144.000+16.500+40.000=R$320.500. Sem manutenção, a previsão seria R$280.500.

Interpretação. O modelo fornece estimativa para orçamento e separa um custo episódico. O coeficiente de unidades não é necessariamente custo marginal causal, pois produção pode responder à demanda e ao calendário.

Uso gerencial. A controladoria pode usar o modelo como benchmark flexível e investigar desvios, não como valor incontestável. Intervalos e erros históricos devem acompanhar o orçamento.

Cuidado. Se horas extras crescem quando há manutenção, os coeficientes podem ser instáveis. VIF e desenho da base precisam ser avaliados.

Custo previsto = 120.000 + 18×8.000 + 55×300 + 40.000 = R$320.500

6.34 Estudo resolvido — Indicadores e interação em regressão

Situação. Um modelo de produtividade inclui experiência, modalidade remota e interação. A equação é Prod=50+1,2Exp−4Remota+0,5Exp×Remota, com experiência em anos.

Estrutura da análise. Para modalidade presencial, Remota=0 e o efeito da experiência é 1,2 por ano. Para remota, o intercepto muda em −4 e a inclinação passa a 1,7. A comparação depende da experiência.

Resolução. Com 2 anos, presencial prevê 52,4 e remota 49,4; diferença −3. Com 10 anos, presencial prevê 62 e remota 63; diferença +1. O ponto de cruzamento resolve −4+0,5Exp=0, logo Exp=8 anos.

Interpretação. A modalidade remota associa-se a menor produtividade entre pessoas menos experientes e vantagem pequena acima de oito anos, no modelo. Isso sugere apoio inicial ou desenho híbrido.

Uso gerencial. A gestão pode segmentar treinamento, mas não deve usar previsão para excluir pessoas. Testes e intervalos dos efeitos condicionais precisam ser apresentados.

Cuidado. Experiência pode estar associada a cargo e autonomia. Sem controles adequados, a interação pode refletir composição diferente.

Diferença Remota−Presencial = −4 + 0,5×Experiência; cruzamento em 8 anos

6.35 Estudo resolvido — Odds ratio e probabilidade

Situação. Um modelo logístico de renovação estima coeficiente 0,405 para contato consultivo e −0,06 por dia de atraso. A probabilidade de referência de um contrato sem contato e sem atraso é 40%.

Estrutura da análise. O odds ratio do contato é e^0,405≈1,50; o de um dia de atraso é e^−0,06≈0,942. Para converter, transformam-se probabilidades em chances e retornam-se a probabilidades.

Resolução. A chance de referência é 0,40/0,60=0,6667. Com contato, passa a 1,0, correspondendo a probabilidade 1/(1+1)=50%. Com contato e cinco dias de atraso, multiplica-se por e^(−0,30)≈0,741: chance 0,741, probabilidade 0,741/1,741≈42,6%.

Interpretação. Um OR de 1,50 não significa aumento de 50 pontos nem de 50% na probabilidade. O efeito depende da probabilidade inicial e dos demais fatores.

Uso gerencial. A equipe pode priorizar contato precoce e medir causalmente o efeito. A regressão observacional pode refletir seleção de contratos com maior chance.

Cuidado. Limiar de classificação não deve ser escolhido apenas por 50%. Custos de falso positivo e falso negativo orientam a regra.

p com contato = (0,6667×1,50)/(1+0,6667×1,50)=50%

6.36 Estudo resolvido — Média móvel e tendência

Situação. Uma loja registra demanda 420, 450, 470, 510, 530 e 570. A equipe compara média móvel de três períodos com previsão ingênua.

Estrutura da análise. Para prever o sétimo período, a média móvel usa 510, 530 e 570. O ingênuo usa 570. A série apresenta tendência ascendente, portanto ambos podem atrasar.

Resolução. A MM3 é 1.610/3=536,67; o ingênuo é 570. Se o valor real do sétimo período for 600, os erros absolutos são 63,33 e 30. Uma tendência linear simples nos seis pontos produz incremento médio próximo de 30 e previsão em torno de 595.

Interpretação. Neste exemplo, o modelo com tendência é mais coerente. A escolha não deve usar apenas o sétimo ponto; uma validação em várias origens compara erros médios.

Uso gerencial. O planejamento pode usar tendência como base e cenário superior para estoque. Promoções futuras exigem ajuste externo.

Cuidado. Tendência passada não cresce indefinidamente. Limites de capacidade e saturação podem alterar o padrão.

MM3=(510+530+570)/3=536,67; ingênuo=570

6.37 Estudo resolvido — Suavização exponencial e escolha de alfa

Situação. Uma empresa testa α=0,2 e α=0,7 em uma série volátil. A previsão anterior é 100 e o observado é 130.

Estrutura da análise. A atualização com α baixo reage lentamente; com α alto, acompanha mais o último valor. A escolha depende da estabilidade e é feita por erro de validação.

Resolução. Com α=0,2, nova previsão=0,2×130+0,8×100=106. Com α=0,7, previsão=121. Se o aumento foi uma promoção isolada, 106 pode ser melhor; se houve mudança de nível, 121 reage mais rápido.

Interpretação. Não existe alfa universal. O parâmetro representa compromisso entre suavização e resposta. A equipe deve examinar erros após mudanças e em períodos estáveis.

Uso gerencial. Pode-se automatizar seleção por SSE em treino, mas validar fora da amostra. Uma regra de intervenção para promoções melhora o modelo.

Cuidado. A suavização simples não modela tendência e sazonalidade. Um alfa ótimo não corrige especificação inadequada.

F(α=0,2)=106; F(α=0,7)=121

6.38 Estudo resolvido — Métricas de erro

Situação. Dois modelos produzem erros em quatro meses. Modelo A: 10, −10, 10, −10. Modelo B: 0, 0, 0, 30. A empresa quer escolher pela média.

Estrutura da análise. O erro médio de A é zero; de B é 7,5. Porém devem ser calculados MAE e RMSE. A escolha depende do custo de grandes erros.

Resolução. Para A, MAE=10 e RMSE=10. Para B, MAE=7,5 e RMSE=√(900/4)=15. B tem menor erro absoluto médio, mas um erro grande. A é mais estável.

Interpretação. Se um erro de 30 causa ruptura grave, RMSE ou uma função de custo favorece A. Se pequenos erros frequentes custam mais, B pode ser escolhido. Nenhuma métrica resume todos os objetivos.

Uso gerencial. O relatório deve apresentar mais de uma métrica e os maiores erros. Também deve comparar com benchmark simples.

Cuidado. Selecionar a métrica depois de ver qual modelo vence é uma forma de viés. Critérios devem ser definidos antes ou apresentados transparentemente.

A: MAE=10, RMSE=10; B: MAE=7,5, RMSE=15

6.39 Estudo resolvido — Gráfico p com tamanho variável

Situação. Uma operação monitora defeitos semanais. A taxa histórica é 3%. Em uma semana, 12 defeitos aparecem em 250 unidades; em outra, 12 em 500.

Estrutura da análise. Com tamanho variável, os limites do gráfico p mudam por semana. Usa-se p̄±3√[p̄(1−p̄)/ni].

Resolução. Para n=250, EP=√(0,03×0,97/250)≈0,01079; LSC≈6,24%. A taxa 4,8% está dentro. Para n=500, EP≈0,00763; LSC≈5,29%; a taxa 2,4% também está dentro. A mesma contagem possui interpretação diferente por denominador.

Interpretação. Nenhuma semana apresenta sinal de 3 sigma. Isso não prova que o processo atende especificação. A equipe continua monitorando padrões e metas.

Uso gerencial. O painel deve exibir proporção e limites específicos, evitando gráfico de contagem sem exposição. Mudanças no tamanho não devem ser tratadas como mudança de qualidade.

Cuidado. Se as unidades variam muito em complexidade, a taxa simples pode precisar estratificação ou modelo de risco.

LSC250≈6,24%; LSC500≈5,29%

6.40 Estudo resolvido — Gráficos X̄ e R

Situação. Uma fábrica coleta subgrupos de cinco medidas de peso por hora. A média geral das médias é 500 g e a média das amplitudes é 12 g. Para n=5, A2≈0,577, D3=0 e D4≈2,114.

Estrutura da análise. Calculam-se limites do gráfico de médias e de amplitude. O gráfico R deve ser avaliado antes, pois instabilidade da dispersão compromete leitura do gráfico X̄.

Resolução. Para X̄: LSC=500+0,577×12=506,924; LIC=493,076. Para R: LSC=2,114×12=25,368; LIC=0. Uma média horária de 508 está fora; uma amplitude de 18 permanece dentro.

Interpretação. O sinal sugere deslocamento do nível sem aumento detectável de dispersão. A equipe investiga calibração, lote de matéria-prima e ajuste de máquina naquele horário.

Uso gerencial. Após identificar causa e corrigir, o ponto não é simplesmente apagado. O histórico documenta a causa e uma nova linha-base pode ser construída com período estável.

Cuidado. Limites estimados com poucos subgrupos são incertos. Além disso, amostras devem representar sequência racional; juntar itens de horas diferentes pode mascarar variação.

LSC X̄=506,924; LIC X̄=493,076; LSC R=25,368

6.41 Estudo resolvido — Planejamento de teste A/B

Situação. Uma plataforma possui conversão de 12% e considera relevante elevar para 14%. Deseja teste bilateral com α=5% e poder de 80%.

Estrutura da análise. O cálculo exato pode ser feito por software. Uma aproximação usa proporção média e valores z=1,96 e 0,84. O resultado por grupo fica em torno de alguns milhares de usuários. O planejamento deve considerar perdas e usuários únicos.

Resolução. Usando a fórmula aproximada para duas proporções, n por grupo ≈{1,96√[2×0,13×0,87]+0,84√[0,12×0,88+0,14×0,86]}²/(0,02)². O primeiro termo é 1,96×0,4756=0,932; o segundo 0,84×0,4754=0,399. Soma 1,331; quadrado 1,772; dividido por 0,0004≈4.430 por grupo.

Interpretação. O experimento precisa de aproximadamente 8.860 pessoas antes de acréscimos por exclusão. O número parece grande porque detectar 2 pontos exige precisão. Se o efeito mínimo for menor, a amostra cresce rapidamente.

Uso gerencial. A equipe deve avaliar se o ganho de 2 pontos paga o experimento e a mudança. Métrica de proteção e duração mínima por ciclo semanal devem ser definidas.

Cuidado. Calcular em sessões e analisar usuários gera inconsistência. Monitorar diariamente e parar ao alcançar p<0,05 também invalida a taxa de erro sem método sequencial.

n aproximado por grupo ≈ 4.430 pessoas

6.42 Estudo resolvido — Dados ausentes em pesquisa

Situação. Uma pesquisa de clima tem 70% de resposta. A taxa é 85% em áreas administrativas e 45% em operações. A média global respondente é 4,1 em escala de 1 a 5.

Estrutura da análise. Ausência está relacionada à área observada, portanto a média simples pode super-representar administração. Devem ser comparadas composições da população e da amostra; ponderação por área pode corrigir parte do desequilíbrio se a não resposta for ignorável dentro de área.

Resolução. A população é 40% administrativa e 60% operacional. Entre respondentes, é 56% e 44%. Médias por área são 4,3 e 3,7. Média simples aproximada=0,56×4,3+0,44×3,7=4,036. Média ponderada pela população=0,40×4,3+0,60×3,7=3,94.

Interpretação. A correção reduz a estimativa em cerca de 0,10. Ainda assim, quem não respondeu em operações pode estar mais insatisfeito, viés não resolvido pela ponderação. A diferença deve ser comunicada.

Uso gerencial. A organização pode ampliar canais, horário e confiança da pesquisa, além de analisar padrões de não resposta. Resultados devem ser apresentados por área com tamanhos e incerteza.

Cuidado. Ponderação extrema aumenta variância. Também não se deve imputar satisfação pela média sem análise do mecanismo.

Média ponderada pela população = 0,40×4,3 + 0,60×3,7 = 3,94

6.43 Estudo resolvido — Multiplicidade em painel de indicadores

Situação. Uma diretoria testa 30 indicadores para verificar mudanças mensais e encontra dois valores-p abaixo de 0,05. Nenhuma hipótese principal havia sido definida.

Estrutura da análise. Sob nulidade global, o número esperado de falsos positivos é 30×0,05=1,5. A probabilidade de pelo menos um falso positivo é 1−0,95³⁰≈78,5%. Correções ou confirmação são necessárias.

Resolução. Bonferroni usaria α*=0,05/30≈0,00167, e nenhum dos dois resultados, p=0,018 e 0,041, permaneceria. Um procedimento FDR pode ser menos rigoroso, mas ainda exigiria ordenar valores e aplicar regra. Como a análise foi exploratória, os achados devem gerar hipóteses para o próximo período.

Interpretação. Os dois sinais não são prova de mudança. A organização pode examinar magnitude, coerência operacional e repetir a medição. Um gráfico de controle talvez seja mais adequado que testes mensais independentes.

Uso gerencial. A diretoria deve definir poucos indicadores principais, limites e regras de investigação, mantendo o restante como monitoramento exploratório.

Cuidado. Correção não substitui qualidade. Se existe evento operacional conhecido, a análise contextual é importante; se os indicadores são altamente correlacionados, Bonferroni pode ser conservador, mas destacar sem ajuste continua inadequado.

P(≥1 falso positivo em 30 testes)=1−0,95³⁰≈78,5%

6.44 Estudo resolvido — Auditoria de modelo de rotatividade

Situação. Um modelo logístico de rotatividade apresenta AUC 0,82 e acurácia 88%. A taxa de desligamento é 10%. A direção propõe usá-lo para classificar pessoas.

Estrutura da análise. A avaliação precisa comparar com baseline de prever permanência para todas, que já teria 90% de acurácia. Devem ser examinados sensibilidade, especificidade, precisão, calibração, desempenho por grupo e finalidade.

Resolução. No limiar escolhido, a matriz é: 60 verdadeiros positivos, 140 falsos positivos, 40 falsos negativos e 760 verdadeiros negativos em 1.000 casos. Sensibilidade=60%; especificidade=84,44%; precisão=30%; acurácia=82%. Cada alerta correto vem acompanhado por mais de dois falsos alertas.

Interpretação. A AUC indica capacidade de ordenação, mas o uso operacional depende do limiar e do custo. Se a intervenção for apoio voluntário e benéfico, mais falsos positivos podem ser toleráveis. Se houver consequência negativa, o uso é inadequado.

Uso gerencial. A recomendação é usar o modelo para identificar condições de trabalho em grupos e oferecer recursos, não punir indivíduos. A calibração e o desempenho por gênero, raça, deficiência, unidade e contrato devem ser auditados conforme finalidade e legislação.

Cuidado. Variáveis podem funcionar como proxies de características protegidas. Rotatividade futura também pode mudar após políticas, reduzindo validade. Monitoramento e possibilidade de contestação são indispensáveis.

Sensibilidade=60/100=60%; precisão=60/200=30%; especificidade=760/900≈84,44%

Laboratório de ferramentas: planilha, R, Python e interfaces gráficas

A ferramenta deve ser escolhida pela complexidade e pela possibilidade de reprodução. Planilhas permitem demonstrar fórmulas, ordenar dados, criar tabelas e ajustar regressões simples. Elas são acessíveis, mas fórmulas podem ser sobrescritas e etapas ficam dispersas. Recomenda-se separar abas de dados brutos, preparação, análise e apresentação, proteger células de fórmulas e registrar a data de atualização.

Em R ou Python, a análise pode ser representada por um roteiro executável. O arquivo deve importar dados, verificar tipos, tratar ausentes, criar variáveis, produzir tabelas e ajustar modelos. Comentários explicam decisões substantivas. A vantagem não é apenas velocidade: executar novamente o roteiro reduz inconsistências quando a base muda. O código não dispensa revisão; uma função aceita argumentos incorretos e ainda pode retornar uma tabela aparentemente plausível.

Jamovi, JASP e interfaces semelhantes reduzem a barreira de programação. A pessoa estudante seleciona variáveis e opções e visualiza resultados. É necessário salvar o projeto, registrar filtros e compreender cada saída. Interfaces podem alterar padrões entre versões; a documentação e a versão utilizada devem constar no trabalho.

Fluxo mínimo em qualquer ferramenta

·         importar uma cópia da base sem modificar o original;

·         verificar número de linhas, identificadores e duplicidades;

·         conferir tipos, unidades, categorias e códigos de ausência;

·         produzir estatísticas e gráficos antes do modelo;

·         executar a técnica e salvar estimativas, intervalos e diagnósticos;

·         comparar com cálculo manual simples ou resultado esperado;

·         exportar tabelas sem copiar mensagens ou números irrelevantes;

·         guardar arquivo, código, dicionário e relatório na mesma versão.

Exemplo de organização em planilha

Aba

Conteúdo

Regra de controle

01_brutos

dados recebidos, sem edição

somente leitura

02_dicionario

nome, definição, tipo e unidade

atualizar com a base

03_preparo

filtros e variáveis derivadas

fórmulas documentadas

04_exploracao

tabelas e gráficos

sem conclusões confirmatórias

05_modelos

entradas e saídas principais

registrar especificação

06_relatorio

quadros finais

referenciar resultados, não redigitar

 

Uma prática útil é incluir uma célula de controle com contagem total e soma de uma variável-chave. Se esses valores mudam inesperadamente após filtros, a pessoa analista identifica o problema. Em código, testes equivalentes verificam unicidade, faixas e totais. Essa disciplina operacional é parte da qualidade estatística.

Oficina de leitura crítica de resultados

A seguir, algumas frases frequentes e formas mais responsáveis de reescrevê-las. O objetivo é treinar comunicação, pois muitos erros ocorrem depois do cálculo.

Afirmação problemática

Reescrita recomendada

“Não houve diferença entre os grupos.”

“A diferença estimada foi X, com intervalo Y; os dados não permitiram excluir efeitos dentro dessa faixa.”

“A campanha causou aumento porque p<0,05.”

“No experimento randomizado, a campanha elevou a taxa estimada em X p.p., IC Y.”

“O modelo explica 80% das vendas.”

“Na amostra, o modelo explicou 80% da variação; o desempenho fora da amostra foi Z.”

“O canal tem pior atendimento.”

“O canal apresentou tempo maior, mas recebe demandas mais complexas; após ajuste, a diferença foi X.”

“A previsão para dezembro é 10 mil.”

“A previsão pontual é 10 mil, com faixa e cenários; campanha e ruptura são riscos.”

“O processo está dentro da meta porque está sob controle.”

“O processo está estatisticamente estável; sua capacidade frente à especificação deve ser avaliada separadamente.”

 

Um bom relatório também informa o denominador, o período, a unidade e a fonte. “A inadimplência caiu 20%” é ambíguo; pode significar redução relativa de 10% para 8%, isto é, 2 pontos percentuais. A comunicação deve permitir que outra pessoa reconstrua a comparação.

Miniestudos setoriais adicionais

Varejo e promoções

Comparar vendas durante promoção com período anterior ignora sazonalidade. Uma abordagem combina lojas de controle, diferenças de mudança e modelo com calendário. A métrica principal pode ser margem, não receita. Estoque e canibalização entram como efeitos de proteção.

A atividade sugerida é formular população, unidade, resposta, comparação, método e principal risco de interpretação. Em seguida, escrever uma conclusão de três frases: estimativa, incerteza e decisão.

Universidade e evasão

Modelos podem identificar fatores associados à evasão, mas notas e frequência são consequências e sinais, não essência da pessoa estudante. O uso recomendado é oferecer apoio. Avaliação deve considerar cursos, turnos e acesso, com proteção de dados.

A atividade sugerida é formular população, unidade, resposta, comparação, método e principal risco de interpretação. Em seguida, escrever uma conclusão de três frases: estimativa, incerteza e decisão.

Hospital e tempo de permanência

A distribuição é assimétrica e depende de diagnóstico. Medianas, quantis e modelos por caso são mais adequados que média global. Reduzir permanência sem monitorar readmissão pode gerar incentivo indesejável.

A atividade sugerida é formular população, unidade, resposta, comparação, método e principal risco de interpretação. Em seguida, escrever uma conclusão de três frases: estimativa, incerteza e decisão.

Município e atendimento digital

Um teste pode avaliar lembrete de documentos. A randomização por pessoa, taxa de conclusão e tempo são métricas. Acessibilidade e exclusão digital precisam ser indicadores de proteção.

A atividade sugerida é formular população, unidade, resposta, comparação, método e principal risco de interpretação. Em seguida, escrever uma conclusão de três frases: estimativa, incerteza e decisão.

Indústria e manutenção

Uma regressão pode relacionar falhas a horas de uso, temperatura e lote. Séries e controle detectam mudança. A substituição preventiva deve integrar custo de falha e disponibilidade, não apenas probabilidade.

A atividade sugerida é formular população, unidade, resposta, comparação, método e principal risco de interpretação. Em seguida, escrever uma conclusão de três frases: estimativa, incerteza e decisão.

Logística e promessa de prazo

Previsões de tempo devem ser calibradas por rota e quantil. Prometer pela média gera atraso em grande parte. A avaliação usa cobertura do intervalo e erro assimétrico.

A atividade sugerida é formular população, unidade, resposta, comparação, método e principal risco de interpretação. Em seguida, escrever uma conclusão de três frases: estimativa, incerteza e decisão.

Finanças e cobrança

Experimentos de mensagens devem considerar valor recuperado, reclamação e acordo sustentável. Aumentar pagamento imediato com abordagem agressiva pode elevar risco jurídico e abandono.

A atividade sugerida é formular população, unidade, resposta, comparação, método e principal risco de interpretação. Em seguida, escrever uma conclusão de três frases: estimativa, incerteza e decisão.

Cultura e participação

Pesquisas de público precisam alcançar pessoas que não frequentam. Analisar apenas visitantes descreve experiência, não barreiras de acesso. Amostragem territorial e métodos qualitativos complementam.

A atividade sugerida é formular população, unidade, resposta, comparação, método e principal risco de interpretação. Em seguida, escrever uma conclusão de três frases: estimativa, incerteza e decisão.

Aprofundamentos para interpretação e governança

Os tópicos deste bloco ampliam a compreensão das técnicas sem transformar a disciplina em um curso de especialização. Eles são importantes porque problemas gerenciais raramente se encaixam perfeitamente em um teste básico. O objetivo é reconhecer alternativas, saber quando pedir apoio especializado e formular relatórios que não ocultem incertezas.

Equivalência e não inferioridade

Testes tradicionais procuram evidência de diferença. Quando a pergunta é demonstrar que um processo novo é suficientemente semelhante ou não pior que o atual, a lógica precisa mudar. Em equivalência, define-se uma faixa de diferenças aceitáveis, de −Δ a +Δ, e verifica-se se o intervalo está inteiramente dentro dela. Em não inferioridade, define-se uma margem unilateral de perda tolerável. A margem deve ser substantiva e prévia, não escolhida para acomodar o resultado.

Suponha que um atendimento digital seja mais barato e a empresa aceite perda máxima de 2 pontos percentuais na resolução. A diferença digital menos presencial é −0,5 ponto, com intervalo de 95% de −2,8 a 1,8. Um teste comum não encontraria diferença e poderia ser descrito erroneamente como equivalência. Contudo, o intervalo ultrapassa −2, logo não demonstra não inferioridade. A amostra precisa ser ampliada ou o serviço melhorado.

A aplicação gerencial exige justificar a margem por custo, risco, contrato e impacto sobre pessoas. Margens muito largas tornam o teste permissivo; margens muito estreitas exigem amostra enorme. Também é necessário considerar adesão e análise por intenção de tratar em experimentos. A ausência de significância nunca substitui um desenho de equivalência.

Não inferioridade: limite inferior do IC da diferença > −Δ

Bootstrap como ferramenta de incerteza

Bootstrap utiliza reamostragens com reposição da amostra observada para aproximar a distribuição de uma estatística. É útil quando a fórmula do erro-padrão é complexa, para medianas, razões e medidas de modelos. O procedimento sorteia muitas amostras do mesmo tamanho, recalcula a estatística e usa a distribuição resultante para estimar erro e intervalos.

Em uma base de 80 clientes, a mediana de gasto é R$240. Dez mil reamostragens produzem percentis 2,5% e 97,5% de R$210 e R$278. O intervalo bootstrap sugere incerteza da mediana. Diferente do intervalo normal, ele não exige simetria da estatística. A interpretação ainda depende de a amostra representar a população.

Bootstrap não corrige viés de seleção, dependência ou base pequena sem informação. Se os dados são agrupados por loja, deve-se reamostrar lojas ou usar bootstrap em blocos, não clientes individualmente. Em séries, blocos preservam dependência. A pessoa estudante deve entender que reamostrar registros não cria informação nova; apenas explora a variabilidade sugerida pelos dados.

Intervalo da média prevista e intervalo de previsão

Na regressão, a previsão para um valor de X pode ter dois intervalos. O intervalo da resposta média estima a média de todas as unidades com aquele X. O intervalo de previsão refere-se a uma nova unidade e inclui variação individual, por isso é mais largo. Confundir os dois leva a promessas excessivamente precisas.

Uma empresa prevê ticket médio de clientes com determinado perfil em R$500. O intervalo de 95% para a média pode ser de R$480 a R$520, enquanto o intervalo para um cliente individual vai de R$180 a R$820. Para orçamento agregado, o primeiro pode ser útil; para limite individual, a dispersão do segundo é relevante. O contexto determina qual responder.

Os intervalos dependem das premissas do modelo e são mais estreitos perto do centro dos preditores. Observações com combinações raras têm maior incerteza. Ferramentas devem ser configuradas para retornar o tipo correto e o relatório deve nomeá-lo. Nenhum intervalo protege contra mudança estrutural futura.

Tamanhos de efeito padronizados e não padronizados

Diferenças em unidades originais são diretamente interpretáveis: minutos, reais, pontos percentuais. Medidas padronizadas permitem comparar resultados em escalas diferentes, como Cohen d, correlação e η². Elas dividem a diferença por uma medida de dispersão ou expressam proporção de variância. O uso conjunto é preferível.

Um treinamento aumenta nota em 4 pontos com desvio agrupado 8, d=0,50. Em outra prova, aumenta 10 pontos com desvio 30, d=0,33. A primeira mudança é maior em desvios, embora a segunda seja maior em pontos. Ainda assim, a relevância depende do que os pontos representam. Um d pequeno pode ser importante quando aplicado a milhares de pessoas ou a desfecho crítico.

Classificações rígidas de pequeno, médio e grande são apenas referências históricas e podem ser inadequadas. O relatório deve apresentar intervalo do efeito, comparação com diferença mínima relevante e custo. Para proporções, risco relativo, diferença absoluta e número necessário para tratar podem oferecer perspectivas complementares.

d de Cohen = (x̄1 − x̄2) / s agrupado

ANCOVA e ajuste por medida inicial

Análise de covariância combina comparação de grupos com regressão, ajustando uma variável quantitativa. Em estudos com medida antes e depois, ajustar o valor inicial pode aumentar precisão e lidar com pequenos desequilíbrios. O modelo pós = grupo + pré estima diferença ajustada no pós.

Imagine dois grupos de treinamento. Antes, o experimental tinha média 68 e o controle 72; depois, 80 e 78. Comparar apenas pós sugere vantagem de 2; comparar mudanças sugere 6; ANCOVA estima o efeito considerando relação entre pré e pós. Dependendo da correlação, a estimativa ajustada pode ficar próxima de 5. O método evita parte da regressão à média e usa informação inicial.

A covariável deve ser medida antes da intervenção e não ser afetada por ela. Ajustar mediadores pode remover parte do efeito. Também se verifica homogeneidade das inclinações: a relação entre pré e pós deve ser semelhante entre grupos, salvo interação modelada. ANCOVA não transforma estudo não randomizado em experimento causal.

Medidas repetidas e estrutura de dependência

Quando a mesma unidade é observada em mais de dois momentos, testes pareados separados ignoram correlação e multiplicidade. ANOVA de medidas repetidas ou modelos mistos representam a dependência. Modelos mistos permitem números diferentes de observações e efeitos aleatórios para unidades, sendo comuns em dados longitudinais e hierárquicos.

Uma rede mede satisfação mensal por loja durante seis meses. Observações da mesma loja são mais parecidas. Uma regressão comum com 600 linhas tratadas como independentes produz erros-padrão pequenos. Um modelo com intercepto aleatório por loja separa variação entre e dentro de lojas e estima tendência média.

A disciplina introdutória deve reconhecer o problema e evitar pseudo-replicação. Se não houver ferramenta para modelo misto, pode-se resumir por unidade, usar diferenças ou buscar apoio. Mais registros dentro da mesma unidade não equivalem ao mesmo número de unidades independentes. O relatório deve declarar nível de agrupamento.

Erros-padrão robustos e agrupados

Na regressão linear, erros-padrão clássicos assumem variância constante. Erros robustos a heterocedasticidade ajustam a inferência sem alterar os coeficientes. Quando observações são agrupadas, erros agrupados permitem correlação dentro de grupos, desde que haja número suficiente de grupos.

Um modelo de vendas por pedido possui milhões de linhas, mas apenas 20 lojas. Se campanhas variam por loja, a informação independente para esse efeito está mais próxima de 20 que de milhões. Erro agrupado por loja pode aumentar muito a incerteza. Com poucos grupos, aproximações usuais também são frágeis.

A escolha do nível de agrupamento segue o desenho e o mecanismo de correlação, não o resultado desejado. Erros robustos não corrigem variável omitida ou causalidade. O relatório deve registrar qual matriz de variância foi usada. Em experimentos por conglomerados, o tamanho amostral deve ser planejado considerando correlação intraclasse.

Validação cruzada e separação treino-teste

Modelos ajustados e avaliados na mesma base parecem melhores do que realmente são. Separar treino e teste oferece estimativa mais honesta. Em bases pequenas, validação cruzada divide os dados em partes, treina em algumas e avalia na restante, repetindo o processo. Todas as etapas de preparação que aprendem com dados devem ocorrer dentro do treino para evitar vazamento.

Uma regressão com 30 preditores apresenta R² de 0,70 no treino, mas R² de 0,32 no teste. O modelo capturou padrões específicos. Uma versão com oito preditores tem R² de 0,61 no treino e 0,48 no teste, podendo generalizar melhor. A seleção depende do objetivo e da estabilidade.

Dados temporais não devem ser embaralhados: treina-se no passado e testa-se no futuro. Grupos relacionados precisam ficar juntos na divisão. Validação é um desenho de avaliação, não um comando automático. Repetir muitas escolhas no mesmo teste também o transforma em treino; idealmente há conjunto final preservado.

Calibração, discriminação e limiares

Em modelos binários, discriminação mede capacidade de ordenar casos de maior e menor risco; calibração compara probabilidades previstas às frequências observadas. Um modelo pode ter AUC alta e prever 80% quando apenas 50% ocorrem, o que é ruim para planejamento. Gráficos e medidas de calibração complementam ROC.

O limiar converte probabilidade em classe. Baixá-lo aumenta sensibilidade e falsos positivos; elevá-lo faz o contrário. A escolha deve refletir custo, capacidade de intervenção e direitos. Em triagem de suporte, falso positivo pode gerar oferta adicional de ajuda; em negativa de serviço, o custo social e jurídico é muito maior.

Avaliação por subgrupos é necessária. A mesma AUC global pode esconder calibração distinta. Se um modelo passa a orientar decisões, dados e comportamento mudam, gerando retroalimentação. O monitoramento deve incluir distribuição de escores, resultados reais, reclamações e revisão humana.

Decomposição sazonal e intervenção

Decomposição separa uma série em tendência, sazonalidade e restante, de forma aditiva ou multiplicativa. No modelo aditivo, variação sazonal tem magnitude semelhante; no multiplicativo, cresce com o nível. A escolha pode ser apoiada por gráfico e transformação logarítmica.

Uma rede observa picos de 30% todo dezembro e crescimento de longo prazo. Um modelo que ignora sazonalidade subestima dezembro e superestima janeiro. Após uma mudança de sistema em julho, a série sofre queda temporária; um indicador de intervenção evita que o modelo interprete o evento como tendência permanente.

A decomposição descritiva não garante previsão. Componentes podem mudar. Feriados móveis, promoções e dias úteis precisam ser representados. Ao comunicar, deve-se separar crescimento dessazonalizado de comparação bruta. Uma queda mensal pode coexistir com crescimento contra o mesmo mês do ano anterior.

Análise de capacidade do processo

Controle estatístico avalia estabilidade; capacidade compara processo estável às especificações. Índices Cp e Cpk usam amplitude de especificação e desvio. Cp mede capacidade potencial se centrado; Cpk considera deslocamento da média. Eles pressupõem distribuição e estabilidade adequadas.

Com limites de 95 e 105, média 102 e σ=1, Cp=(105−95)/(6×1)=1,667. Cpk=min[(105−102)/(3×1),(102−95)/(3×1)]=min(1,0,2,333)=1,0. O processo tem dispersão potencial boa, mas está deslocado para o limite superior.

A ação é recentrar, não necessariamente reduzir variabilidade. Calcular Cpk em processo instável produz resumo sem significado operacional. Em dados não normais, métodos por percentis podem ser preferíveis. Especificações devem vir de necessidade de cliente, técnica ou norma, não ser definidas para melhorar o índice.

Cp=(LSE−LIE)/(6σ); Cpk=min[(LSE−μ)/(3σ),(μ−LIE)/(3σ)]

Pesos amostrais e efeito de desenho

Pesquisas estratificadas ou com probabilidades desiguais usam pesos inversos à probabilidade de seleção, ajustados por não resposta e calibração. A média ponderada representa a população-alvo, mas a variância precisa considerar desenho. Tratar pesos apenas como repetição de linhas pode produzir erros incorretos.

Se pequenas unidades foram superamostradas para permitir análise, a média sem pesos lhes dá influência excessiva. Os pesos restauram composição global. Contudo, pesos muito variáveis aumentam erro; o efeito de desenho quantifica perda de precisão em relação à amostra aleatória simples.

Relatórios devem informar amostra não ponderada, estimativa ponderada, método e base dos pesos. Para análise por estrato, pesos podem ter outro papel. Em softwares, módulos de survey representam estratos, conglomerados e pesos. Uma grande pesquisa não é automaticamente precisa se o número de conglomerados é pequeno.

Princípios de análise reproduzível

Reprodutibilidade significa que outra pessoa autorizada consegue executar o mesmo processo e obter os resultados, usando base e instruções. Isso exige nomes claros, dicionário, código ou fórmulas, ambiente, versões, critérios de exclusão, sementes e data de corte. A documentação deve ser proporcional ao risco da decisão.

Uma pasta pode conter README, dados brutos protegidos, dados preparados, código, saídas e relatório. O arquivo de saída não deve ser editado manualmente para “corrigir” números; mudanças devem ocorrer na fonte. Tabelas finais podem ser geradas automaticamente. Revisão por pares verifica se a conclusão corresponde ao cálculo.

Reprodutibilidade não elimina confidencialidade. Dados identificáveis permanecem sob acesso restrito, e versões anonimizadas ou sintéticas podem apoiar ensino. Logs, controle de versão e aprovação são importantes para modelos regulados. A cultura de documentação também reduz dependência de uma única pessoa e facilita atualização.

Ética da inferência e distribuição dos efeitos

Uma média positiva pode esconder prejuízo em grupos. Toda análise com impacto sobre pessoas deve examinar heterogeneidade e consequências. Isso não significa realizar centenas de testes sem plano; significa definir grupos relevantes por direitos, acesso e teoria, proteger privacidade e interpretar amostras pequenas com cautela.

Experimentos precisam de proporcionalidade entre risco e benefício. Uma mensagem pode ser randomizada, mas negar serviço essencial para teste pode ser eticamente inadequado. Consentimento, transparência e supervisão dependem do contexto. Dados disponíveis tecnicamente não são automaticamente legítimos para qualquer finalidade.

A conclusão estatística deve ser contestável. Pessoas afetadas precisam de canais de revisão quando modelos influenciam decisões. Indicadores não podem substituir julgamento responsável. A disciplina forma administradoras(es) capazes de perguntar quem ganha, quem perde, quem ficou fora da amostra e quais erros são tolerados.

Quadro de premissas e respostas possíveis

Problema identificado

Sinal

Respostas possíveis

dependência

repetições por pessoa, loja ou tempo

pareamento, agregação, modelo misto, erros agrupados

heterocedasticidade

resíduos em funil

erros robustos, transformação, modelo da variância

não linearidade

curva nos resíduos

termos polinomiais, transformação, modelo não linear

outlier influente

Cook alto ou mudança de coeficiente

verificar, explicar, sensibilidade, modelo robusto

multicolinearidade

VIF e coeficientes instáveis

reformular variáveis, teoria, regularização futura

dados ausentes

padrões por grupo ou variável

melhorar coleta, ponderar, imputar com cautela

multiplicidade

muitos testes/segmentos

hipótese principal, ajuste, validação

mudança temporal

erro cresce após evento

recalibrar, intervenção, nova linha-base

desbalanceamento

evento raro

métricas adequadas, pesos, amostragem e calibração

viés de seleção

amostra de conveniência

redesenhar coleta, ponderar quando defensável, limitar conclusão

 

Atividade integradora de revisão por pares

Cada grupo recebe uma análise curta de outro grupo e aplica o checklist: pergunta, unidade, desenho, preparação, método, premissas, resultados, linguagem causal, visual e decisão. O objetivo não é apenas apontar erros, mas propor uma versão melhor. A devolutiva deve separar problemas que alteram o resultado de melhorias de apresentação.

Uma rodada pode usar relatórios intencionalmente problemáticos: teste independente em dados pareados; conclusão de igualdade por p>0,05; regressão extrapolada; A/B encerrado cedo; previsão avaliada no treino; gráfico de controle comparado a meta. A turma reescreve a conclusão e indica dados adicionais. Essa prática desenvolve julgamento mais do que repetir fórmulas.

Oficina adicional de interpretação de saídas

Os dez exercícios seguintes simulam trechos de relatórios ou saídas de software. A tarefa central é interpretar, identificar o que falta e propor uma decisão proporcional à evidência. Eles podem ser utilizados como estudo individual, discussão em grupo ou avaliação formativa.

6.45 Saída de teste t com amostra enorme

Uma base de 120 mil transações compara ticket médio de dois canais. A diferença é R$0,42, IC95% de R$0,18 a R$0,66 e p<0,001. A saída também mostra desvios de aproximadamente R$40. O resultado é estatisticamente detectável porque a amostra é grande, mas a magnitude é pequena em relação à dispersão. A análise deve converter R$0,42 em margem total, considerar custo do canal e verificar composição. A conclusão recomendada é que existe pequena diferença média, não que um canal é “muito melhor”. Também se deve investigar dependência por cliente, porque transações repetidas podem tornar o intervalo estreito demais.

Perguntas de revisão: Qual é a estimativa principal? A incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação adicional mudaria a recomendação?

6.46 Saída de ANOVA não significativa

Quatro unidades apresentam médias 7,2, 7,5, 7,8 e 8,4, com amostras de apenas oito casos e desvios elevados. A ANOVA produz p=0,11 e η²=0,18. Não se deve concluir que as unidades são iguais. O efeito estimado não é pequeno, mas a incerteza é alta. Intervalos, dados brutos e poder devem ser examinados. A decisão pode ser ampliar amostra ou usar o resultado como exploratório. Se 1,2 ponto entre extremos é material, a pesquisa está inconclusiva. Um relatório responsável descreve a faixa e evita transformar o limiar de 5% em fronteira entre existência e inexistência.

Perguntas de revisão: Qual é a estimativa principal? A incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação adicional mudaria a recomendação?

6.47 Saída de regressão com R² baixo

Um modelo de satisfação possui R²=0,12, mas o coeficiente de tempo de espera é −0,08 ponto por minuto, IC de −0,11 a −0,05. R² baixo não invalida o coeficiente: satisfação depende de muitos fatores e possui variabilidade individual. O modelo pode estimar uma associação média útil, embora não preveja bem pessoas. A direção pode avaliar impacto de reduzir dez minutos, aproximadamente 0,8 ponto no modelo, e testar operacionalmente. Deve-se verificar linearidade, confundidores e escala. Explicação e previsão são objetivos distintos.

Perguntas de revisão: Qual é a estimativa principal? A incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação adicional mudaria a recomendação?

6.48 Saída de regressão com R² muito alto

Um modelo mensal de receita em função do tempo apresenta R²=0,98. Isso pode refletir tendência e não mecanismo econômico. Resíduos podem ser autocorrelacionados e uma regressão entre séries crescentes produzir significância espúria. A análise deve verificar estacionariedade, diferenças, sazonalidade e validação futura. Para previsão, comparar com tendência ingênua. Para causalidade, tempo não explica a receita; ele representa fatores que evoluíram. R² alto é convite ao diagnóstico, não certificado de verdade.

Perguntas de revisão: Qual é a estimativa principal? A incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação adicional mudaria a recomendação?

6.49 Coeficiente com sinal inesperado

Em uma regressão de vendas, publicidade tem coeficiente negativo depois de controlar região e produto, embora a correlação simples seja positiva. Pode existir confundimento, multicolinearidade, simultaneidade ou alocação de publicidade para produtos em dificuldade. A equipe deve verificar especificação, VIF, cronologia e regras de investimento. O sinal não prova que publicidade reduz vendas. Um experimento, variável defasada ou desenho causal pode ser necessário. Remover controles até o sinal ficar positivo seria inadequado.

Perguntas de revisão: Qual é a estimativa principal? A incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação adicional mudaria a recomendação?

6.50 Valor-p diferente entre softwares

Dois programas retornam p=0,048 e p=0,056 para a mesma comparação. As possíveis causas incluem teste de Welch versus variâncias iguais, alternativa unilateral versus bilateral, tratamento de ausentes, arredondamento ou teste exato. A pessoa analista deve comparar n, estatística, graus de liberdade e opções. A decisão não deveria mudar radicalmente entre “funciona” e “não funciona”, pois ambos indicam evidência limítrofe. Estimativa e intervalo provavelmente são semelhantes. O relatório registra o método escolhido antes de interpretar.

Perguntas de revisão: Qual é a estimativa principal? A incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação adicional mudaria a recomendação?

6.51 Intervalo amplo em regressão logística

Um odds ratio de 2,4 para determinado fator possui IC95% de 0,8 a 7,3. A estimativa central é alta, mas a incerteza inclui redução e grande aumento das chances. O resultado pode decorrer de poucos eventos ou separação. Não se deve anunciar risco 2,4 vezes maior como conclusão firme. A ação pode ser coletar mais dados, combinar categorias com justificativa ou usar método penalizado em análise especializada. A frequência dos eventos e probabilidades previstas devem acompanhar odds.

Perguntas de revisão: Qual é a estimativa principal? A incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação adicional mudaria a recomendação?

6.52 Previsão com bom erro médio e viés

Um modelo tem MAE baixo, mas erro médio de −200 unidades, indicando que previsão menos realizado é negativa e o sistema subestima consistentemente. A tendência de viés pode causar rupturas mesmo com MAE competitivo. É necessário calibrar nível, verificar promoção e comparar custo assimétrico. Um ajuste simples de +200 pode melhorar curto prazo, mas deve-se investigar causa. Métricas agregadas por produto podem esconder viés em itens de maior valor. A validação deve incluir erro percentual e cobertura de intervalos.

Perguntas de revisão: Qual é a estimativa principal? A incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação adicional mudaria a recomendação?

6.53 Gráfico de controle com muitos ajustes

Uma equipe altera a máquina sempre que um ponto fica acima ou abaixo da média, mesmo dentro dos limites. Essa super-reação, chamada tampering, pode aumentar variabilidade. A linha central não é meta para cada observação. A ação correta é investigar sinais definidos, como ponto fora do limite ou sequência não aleatória, e melhorar o sistema para reduzir causas comuns. Metas e especificações são analisadas separadamente. O gráfico precisa ser acompanhado por plano de reação e registro de causas.

Perguntas de revisão: Qual é a estimativa principal? A incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação adicional mudaria a recomendação?

6.54 Teste A/B com métrica secundária favorável

Um experimento foi dimensionado para conversão, que não mudou. Entre quinze métricas secundárias, tempo na página teve p=0,03 e a equipe anuncia sucesso. A multiplicidade torna o achado exploratório. Além disso, mais tempo pode significar interesse ou dificuldade. A conclusão adequada é que a hipótese principal não foi confirmada; existe sinal secundário a investigar em novo teste. Métricas de proteção e direção desejada devem ser definidas antes. Selecionar a única saída favorável reduz credibilidade e pode desperdiçar recursos.

Perguntas de revisão: Qual é a estimativa principal? A incerteza permite uma decisão? O desenho sustenta causalidade? Qual informação adicional mudaria a recomendação?

Exercício de construção de um parecer estatístico

Escolha um dos casos e produza um parecer de uma página com seis partes: contexto; método; resultado; relevância prática; riscos; recomendação. O parecer não deve usar jargão sem explicação e precisa incluir pelo menos uma medida em unidade original. A versão técnica anexa deve registrar hipótese, nível de significância, tratamento de ausentes e ferramenta. Uma pessoa colega revisa o texto e marca frases que pareçam mais firmes que a evidência.

Como critério de qualidade, a recomendação deve continuar defensável se o valor-p mudar ligeiramente ao redor de 0,05. Isso força o uso de intervalo, magnitude e contexto. A análise também deve informar se o resultado é confirmatório ou exploratório. Em decisões de alto impacto, recomenda-se revisão independente antes da implementação.

Projeto aplicado: do problema ao monitoramento

O projeto aplicado pode ser desenvolvido individualmente ou em grupo e deve partir de uma decisão realista, não apenas de uma base disponível. Exemplos incluem comparar modalidades de atendimento, avaliar um treinamento, prever demanda ou monitorar qualidade. O produto final possui uma nota executiva e um apêndice técnico. A nota apresenta o que deve ser decidido; o apêndice permite reproduzir a análise.

Etapa 1 — Enquadrar a pergunta

Escreva a pergunta em uma frase com população, resposta, comparação e período. “Analisar vendas” é amplo; “estimar se a nova exposição elevou a conversão de visitantes únicos durante quatro semanas, sem aumentar devolução” é operacional. Defina quem utilizará o resultado e qual ação é possível. Uma análise sem decisão associada pode produzir muitas tabelas e pouca utilidade.

Registre a diferença mínima relevante. Para uma taxa, pode ser 1,5 ponto percentual; para tempo, dois minutos. Explique por que esse limiar importa em termos de custo, contrato, capacidade ou experiência. A escolha anterior aos resultados reduz a tendência de considerar relevante qualquer diferença significativa.

Etapa 2 — Mapear o processo de geração dos dados

Desenhe como cada registro nasce, quais sistemas intervêm e onde podem ocorrer erros. Identifique a unidade independente: pessoa, pedido, loja, equipe ou período. Marque repetições e agrupamentos. Um banco com cem mil linhas pode representar apenas cem clientes muito ativos. A estrutura de dependência determina erro-padrão e nível de análise.

Verifique mudanças de definição, migração de sistema, indisponibilidade, campanhas e regras de registro. Datas e fusos precisam ser consistentes. Um dicionário informa nome, descrição, tipo, unidade e códigos. Variáveis derivadas devem ter fórmula explícita. A auditoria inicial evita que o modelo explique artefatos administrativos.

Etapa 3 — Criar plano de análise

O plano lista hipótese principal, métricas secundárias, exclusões, tratamento de ausentes, método, nível de confiança e diagnósticos. Em estudo exploratório, registre que hipóteses surgirão dos dados e precisarão de confirmação. Em experimento, estabeleça duração e regra de parada. O plano não precisa impedir aprendizagem; ele separa o que foi previsto do que foi descoberto depois.

Inclua uma tabela ligando pergunta a método. Uma média contra meta sugere t de uma amostra; grupos independentes, Welch; quatro grupos, ANOVA; resposta binária com controles, logística; série, validação temporal. Para cada método, indique premissas e alternativa se elas falharem.

Etapa 4 — Explorar sem antecipar conclusões

Produza contagens, ausentes, distribuição, boxplots, dispersões e séries. Compare amostra com população quando houver informação. Procure valores impossíveis e categorias raras. A exploração ajuda a entender a base, mas não deve ser usada para testar dezenas de versões até encontrar uma narrativa. Gráficos exploratórios podem ser mais numerosos que os publicados.

Registre decisões: por que um valor foi corrigido, por que uma categoria foi combinada e como um indicador foi construído. Preserve uma variável original quando fizer transformação. Compare resultados com e sem casos influentes, mas não escolha apenas a versão favorável. Sensibilidade é evidência sobre estabilidade da conclusão.

Etapa 5 — Executar, diagnosticar e validar

Calcule estimativas em unidades originais, intervalos e tamanhos de efeito. O valor-p aparece como complemento. Em regressão, examine resíduos, linearidade, influência e colinearidade. Em previsão, use divisão temporal e benchmark. Em classificação, avalie calibração, discriminação e limiar. Em gráficos de controle, estabeleça linha-base antes de procurar sinais.

Faça pelo menos uma verificação independente: cálculo manual de caso simples, segunda ferramenta, revisão por colega ou reprodução em amostra separada. Resultados inesperados merecem investigação, não correção automática. Se a técnica não é adequada, o relatório pode concluir que os dados não sustentam a pergunta e recomendar novo desenho.

Etapa 6 — Converter evidência em decisão

Transforme diferença estatística em pessoas, tempo, receita, custo ou risco. Apresente cenários com limites do intervalo. Uma campanha com ganho estimado de 3 pontos e intervalo de 1 a 5 pode ter retorno positivo em todo o intervalo ou apenas no centro. Essa análise muda a segurança da recomendação.

A decisão deve incluir impactos colaterais, capacidade e distribuição dos efeitos. Uma melhoria média pode piorar acessibilidade. Uma previsão pode exigir reserva. Um modelo de risco pode gerar muitos falsos alertas. Liste condições para implementação, responsáveis, prazo e indicadores de proteção.

Etapa 7 — Comunicar para dois públicos

A nota executiva utiliza título informativo, três achados, recomendação e riscos. Evite despejar saída de software. Gráficos devem ter escala, fonte, unidade e mensagem. O apêndice técnico descreve base, método, fórmulas, software, premissas e diagnósticos. A existência do apêndice permite simplificar a nota sem ocultar a análise.

Revise termos: “associação” em estudos observacionais; “efeito” quando o desenho causal sustenta; “não foi detectada diferença” em vez de “são iguais”; “previsão pontual e faixa” em vez de número único. Indique arredondamento e denominador. Uma conclusão deve poder ser lida sem acesso à conversa de quem analisou.

Etapa 8 — Monitorar e aprender

Depois da decisão, compare previsto e realizado. Defina data de revisão, limite de desvio e responsável. Modelos perdem validade quando processo, população ou incentivos mudam. Experimentos podem ter efeito de curto prazo diferente do permanente. Acompanhamento transforma análise em ciclo de aprendizagem.

Documente se a recomendação foi adotada, quais adaptações ocorreram e por que o resultado divergiu. A pós-avaliação não serve apenas para cobrar precisão; ela melhora dados e premissas. Uma organização madura mantém memória das decisões, inclusive das análises que não confirmaram a hipótese inicial.

Critérios de avaliação do projeto

·         clareza e relevância da pergunta;

·         coerência entre desenho, dados e método;

·         qualidade da preparação e documentação;

·         correção dos cálculos e diagnósticos;

·         uso conjunto de estimativa, incerteza e relevância;

·         comunicação sem exagero causal;

·         consideração de ética, privacidade e grupos afetados;

·         recomendação executável e plano de monitoramento.

Matemática de apoio para acompanhar os métodos

A disciplina utiliza álgebra, somatórios, potências, raízes e logaritmos. Quando uma fórmula parecer extensa, identifique primeiro o numerador, que normalmente representa sinal ou diferença, e o denominador, que representa variabilidade ou escala. Estatísticas t e z seguem essa estrutura. A interpretação pergunta quantos erros-padrão a estimativa está distante da referência. Essa leitura reduz a dependência da memorização literal.

Em regressão, o coeficiente é uma taxa de variação. Unidades ajudam a conferir o cálculo: se Y está em minutos e X em quilômetros, a inclinação está em minutos por quilômetro. Multiplicar pela mudança de X produz minutos. Em regressão logística, o coeficiente está na escala de log-chances e precisa ser exponenciado para odds ratio; converter para probabilidade requer mais uma etapa. Anotar unidades ao lado dos coeficientes previne interpretações incoerentes.

Graus de liberdade representam, de modo simplificado, a quantidade de informação independente disponível após estimar parâmetros. Na variância de uma amostra, usar a média calculada impõe uma restrição e restam n−1 graus. Em ANOVA, os graus se dividem entre grupos e dentro. Em regressão, a inclusão de muitos parâmetros consome informação e pode ajustar ruído. Essa intuição explica por que modelos excessivos em amostras pequenas são instáveis.

Logaritmos aparecem em modelos multiplicativos, taxas e regressão logística. A diferença de logaritmos aproxima variação relativa para mudanças pequenas. Transformar Y por log pode reduzir assimetria e fazer efeitos serem interpretados em percentuais aproximados, mas zeros e valores negativos exigem tratamento. Toda transformação precisa ser justificada e revertida com cuidado na comunicação.

O arredondamento deve ocorrer no final. Valores intermediários arredondados podem alterar estatísticas próximas ao limiar. Em trabalhos, use três ou quatro casas nos cálculos e apresente duas ou três conforme a unidade. Valores-p muito pequenos podem ser escritos como p<0,001, não p=0. Intervalos devem usar o mesmo número de casas da estimativa e manter coerência entre texto, tabela e gráfico.

Uma verificação dimensional e lógica é recomendada: proporções devem ficar entre zero e um; variâncias não são negativas; limite inferior de gráfico p pode ser truncado em zero; soma de probabilidades deve ser um; previsão individual costuma ter intervalo mais largo que a média; erro-padrão tende a diminuir com amostra maior. Se a saída viola essas expectativas, revise fórmula, referência de célula, codificação e unidade antes de interpretar.

7. Exemplo Prático ou Estudo de Caso

Caso integrado: Rede Conecta Serviços

A Rede Conecta Serviços opera centrais de atendimento em quatro regiões e implantou um novo protocolo em duas delas. A direção deseja saber se o protocolo reduziu o tempo de atendimento sem piorar resolução ou satisfação, quais fatores explicam o tempo, como projetar demanda e se o processo está estável. O estudo utiliza dados fictícios para fins didáticos.

Perguntas gerenciais

·         o tempo médio caiu após o protocolo nas unidades participantes?

·         a redução é diferente da observada nas unidades que mantiveram o processo anterior?

·         as taxas de resolução diferem entre protocolo e controle?

·         há diferença de satisfação entre quatro regiões?

·         quais fatores estão associados ao tempo de atendimento?

·         qual previsão de contatos para os próximos meses?

·         o processo apresenta sinais de causas especiais?

Estrutura da base

Variável

Tipo

Descrição

tempo

quantitativa contínua

minutos por atendimento

resolvido

binária

1 quando resolvido no primeiro contato

satisfação

ordinal/quase quantitativa

escala de 1 a 5

protocolo

binária

novo ou controle

período

binária

antes ou depois

região

categórica

Norte, Sul, Leste e Oeste

complexidade

quantitativa

índice de 0 a 10

experiência

quantitativa

meses da pessoa atendente

mês

temporal

ordem mensal

contatos

contagem

volume mensal

 

Etapa 1 — Comparação pareada nas unidades do protocolo

Uma amostra de 36 equipes possui média de redução antes menos depois de 3,6 minutos, com desvio-padrão das diferenças de 6,0. O erro-padrão é 6/√36=1. A estatística t é 3,6/1=3,6, com 35 graus de liberdade. O intervalo de 95% usa t crítico aproximado 2,03 e resulta 3,6±2,03, ou 1,57 a 5,63 minutos.

t = 3,6 / (6 / √36) = 3,60

IC95% da redução = 3,6 ± 2,03 × 1 = [1,57; 5,63] minutos

O resultado sugere redução média nas unidades participantes. Contudo, um antes e depois isolado pode ser afetado por sazonalidade. Por isso, a direção compara a mudança com unidades de controle.

Etapa 2 — Comparação das mudanças

Nas 36 equipes de protocolo, a mudança média foi −3,6 minutos quando calculada depois menos antes. Em 34 equipes de controle, a mudança foi −0,8, com desvios de 6,0 e 5,5. A diferença entre mudanças é −2,8 minutos. O erro-padrão de Welch é √(36/36+30,25/34)=√1,8897≈1,375. A estatística é −2,8/1,375≈−2,04.

Diferença de mudanças = −3,6 − (−0,8) = −2,8 minutos

EP = √(6²/36 + 5,5²/34) ≈ 1,375

t ≈ −2,8 / 1,375 = −2,04

O intervalo aproximado de 95% é −2,8±1,995×1,375, resultando de cerca de −5,54 a −0,06. A evidência de efeito adicional é limítrofe, mas a faixa favorece redução. A direção deve considerar que a unidade de análise são equipes e que não houve randomização completa.

Etapa 3 — Taxa de resolução

No período posterior, o protocolo teve 1.020 resoluções em 1.200 contatos, taxa de 85%; o controle teve 792 em 960, taxa de 82,5%. A diferença é 2,5 pontos percentuais. A proporção combinada é 1.812/2.160≈83,89%.

EP sob H0 = √[0,8389×0,1611×(1/1200+1/960)] ≈ 0,0159

z = 0,025 / 0,0159 ≈ 1,57

O valor-p bilateral é aproximadamente 0,116. O intervalo não combinado para a diferença é aproximadamente 2,5±3,0 pontos, ou de −0,5 a 5,5. Não há evidência suficiente para afirmar mudança na resolução, mas a faixa inclui pequena piora e melhora moderada. Como a exigência era não piorar mais que 2 pontos, seria necessário um teste de não inferioridade planejado, não apenas usar a ausência de significância.

Etapa 4 — Satisfação entre regiões

As médias de satisfação são Norte 4,05, Sul 4,18, Leste 3,92 e Oeste 4,25, com 80 respostas por região. A ANOVA produz SQ entre=5,84 e SQ dentro=192,0. Com 3 e 316 graus de liberdade, QM entre=1,947, QM dentro=0,608 e F≈3,20.

F = (5,84/3) / (192/316) ≈ 3,20

η² = 5,84 / 197,84 ≈ 0,0295

O valor-p é próximo de 0,024, indicando diferença global. Contudo, η² de 0,03 mostra efeito pequeno. Um pós-teste pode apontar diferença entre Leste e Oeste, mas a magnitude de 0,33 ponto deve ser analisada com custos, perfil e distribuição. A direção não deve criar ranking rígido baseado apenas na significância.

Etapa 5 — Regressão do tempo

Um modelo múltiplo é ajustado com tempo como resposta e complexidade, experiência, protocolo e turno noturno como preditores. Os coeficientes fictícios são apresentados abaixo.

Termo

Coeficiente

EP

Interpretação resumida

Intercepto

11,20

0,90

tempo previsto na referência e em valores zero, com utilidade limitada

Complexidade

1,85

0,12

cada ponto adicional associa-se a +1,85 min

Experiência

−0,045

0,012

cada mês associa-se a −0,045 min

Protocolo

−2,40

0,55

protocolo associa-se a −2,40 min, controladas as demais

Noturno

1,10

0,48

turno noturno associa-se a +1,10 min

 

Tempo previsto = 11,20 + 1,85×Complexidade − 0,045×Experiência − 2,40×Protocolo + 1,10×Noturno

Para complexidade 6, experiência 24 meses, protocolo novo e turno diurno, a previsão é 11,20+11,10−1,08−2,40=18,82 minutos. O R² ajustado é 0,46, indicando que o modelo explica parte importante, mas não toda, da variação.

O diagnóstico mostra leve heterocedasticidade; erros-padrão robustos são usados. Dois casos influentes são revisados e correspondem a atendimentos reais de alta complexidade, mantidos na base. O coeficiente de protocolo continua perto de −2,4. Como o desenho é observacional, a expressão correta é associação ajustada, não efeito causal definitivo.

Etapa 6 — Previsão de contatos

Os últimos seis meses registraram 18.000, 18.500, 19.400, 19.100, 20.300 e 21.000 contatos. A previsão ingênua para o próximo mês é 21.000. A média móvel de três meses é (19.100+20.300+21.000)/3=20.133. A suavização com α=0,4 e previsão anterior de 20.000 após observar 21.000 gera 20.400.

MM3 = (19.100 + 20.300 + 21.000) / 3 = 20.133

F novo = 0,4×21.000 + 0,6×20.000 = 20.400

Em validação dos 12 meses anteriores, o modelo com tendência obteve MAE 620, a média móvel 740 e o ingênuo 810. A direção escolhe tendência como base, mas mantém faixa e cenários porque haverá campanha nacional não presente no histórico. O impacto da campanha é tratado separadamente.

Etapa 7 — Controle da taxa de recontato

A taxa histórica estável de recontato é 6%, com amostras semanais de 400 contatos. Os limites aproximados são 0,06±3√[0,06×0,94/400]. O erro-padrão é cerca de 0,01187, logo LSC≈9,56% e LIC≈2,44%.

LSC ≈ 0,06 + 3×0,01187 = 9,56%

LIC ≈ 0,06 − 3×0,01187 = 2,44%

Uma semana registra 10,5%, acima do limite. A equipe identifica indisponibilidade de sistema e não altera imediatamente metas individuais. Após correção, monitora retorno ao padrão. Esse uso evita atribuir uma causa especial a desempenho pessoal sem investigar o processo.

Síntese executiva do caso

Achado

Leitura

Decisão sugerida

Tempo pareado

redução de 1,57 a 5,63 min

manter piloto e acompanhar

Diferença vs. controle

efeito adicional pequeno a moderado e limítrofe

ampliar com desenho mais controlado

Resolução

diferença inconclusiva

planejar não inferioridade e aumentar amostra

Satisfação regional

diferença estatística pequena

investigar Leste sem ranking punitivo

Regressão

complexidade, experiência e protocolo associados ao tempo

usar para dimensionar e segmentar

Previsão

modelo de tendência supera benchmarks

adotar com cenário de campanha

Controle

sinal especial ligado a sistema

corrigir causa e monitorar

 

A recomendação é ampliar o protocolo de forma gradual, com randomização por equipes quando possível, métrica principal de tempo, margem explícita para resolução e acompanhamento de satisfação. O caso mostra por que nenhum teste isolado responde a toda a decisão: comparação, regressão, previsão e controle se complementam.

8. Questões para Estudo

Questão 1 — Duas médias independentes

Uma empresa compara produtividade de duas equipes. A equipe A tem n=50, média 118 e desvio 20; a B tem n=45, média 108 e desvio 18. Calcule a diferença, o erro-padrão de Welch, a estatística t e interprete um intervalo aproximado de 95% usando valor crítico 1,99.

Gabarito comentado

A diferença A−B é 10. O erro-padrão é √(400/50+324/45)=√(8+7,2)=√15,2≈3,899. t≈10/3,899=2,565. A margem é 1,99×3,899≈7,76; o intervalo vai de 2,24 a 17,76. A evidência indica produtividade média maior em A, mas a decisão deve considerar qualidade, composição e custo. A conclusão deve informar magnitude e faixa, não apenas que o teste é significativo.

EP = √(20²/50 + 18²/45) ≈ 3,899; t ≈ 2,565; IC95% ≈ [2,24; 17,76]

Questão 2 — Qui-quadrado

Em 400 atendimentos, os resultados por canal foram: telefone 120 resolvidos e 80 não resolvidos; chat 150 resolvidos e 50 não resolvidos. Calcule frequências esperadas e a estatística qui-quadrado. Interprete sem afirmar causalidade.

Gabarito comentado

Totais: resolvidos 270, não 130; cada canal possui 200. Esperados por canal: 135 resolvidos e 65 não. As quatro contribuições são 225/135, 225/65, 225/135 e 225/65. A soma é aproximadamente 10,26. Com 1 grau de liberdade, o valor-p é inferior a 0,01. Há associação entre canal e resolução na amostra. O chat apresenta taxa de 75%, o telefone 60%, mas diferenças de demanda ou perfil podem explicar parte do padrão.

χ² ≈ 1,667 + 3,462 + 1,667 + 3,462 = 10,258

Questão 3 — ANOVA

Três unidades possuem dez observações cada. A soma de quadrados entre grupos é 300 e dentro dos grupos é 600. Calcule graus de liberdade, quadrados médios, F e η². O que cada medida informa?

Gabarito comentado

Com k=3 e N=30, gl entre=2 e gl dentro=27. QM entre=150; QM dentro=22,222; F=6,75. SQ total=900 e η²=300/900=0,333. F compara sinal entre grupos ao ruído interno e seria avaliado na distribuição F. η² indica que 33,3% da variabilidade observada está associada ao fator no conjunto, mas não identifica pares nem prova causalidade.

F = (300/2) / (600/27) = 6,75; η² = 300/900 = 0,333

Questão 4 — Regressão

Um modelo de vendas estimou Ŷ=250−8Preço+3Publicidade, com preço em reais e publicidade em milhares de reais. Interprete os coeficientes, calcule previsão para preço 20 e publicidade 30 e discuta duas limitações.

Gabarito comentado

Mantida a publicidade, aumento de R$1 no preço associa-se a redução média prevista de 8 unidades. Mantido o preço, aumento de R$1 mil em publicidade associa-se a 3 unidades. A previsão é 250−160+90=180. Limitações possíveis: relação pode não ser causal; pode haver variáveis omitidas e simultaneidade; extrapolação; forma linear inadequada; autocorrelação; colinearidade. O intercepto pode não ter interpretação prática se zero estiver fora da faixa.

Ŷ = 250 − 8×20 + 3×30 = 180

Questão 5 — Previsão e controle

Uma série possui valores 90, 100, 110 e 130. Calcule previsão por média móvel de três períodos para o quinto período. Se a previsão anterior de suavização era 112, o valor atual 130 e α=0,25, calcule a nova previsão. Explique como escolher entre modelos.

Gabarito comentado

A média móvel é (100+110+130)/3=113,33. A suavização é 0,25×130+0,75×112=116,5. A escolha deve usar validação temporal, comparação com benchmark, métrica alinhada ao custo, estabilidade e facilidade de manutenção. Não se escolhe pelo valor mais próximo de um único mês. Se a série tem tendência, ambos podem atrasar e um modelo de tendência deve ser testado.

MM3 = 113,33; F novo = 116,50

9. Resumo e Glossário

Síntese do aprendizado

Métodos Estatísticos II amplia a inferência para situações de comparação, modelagem, previsão e controle. A escolha do método depende da pergunta, do desenho, do tipo de variável e da dependência entre observações. Testes para médias, proporções e frequências ajudam a avaliar diferenças; ANOVA organiza comparações com vários grupos; métodos não paramétricos trabalham com escalas e distribuições específicas; regressão estima relações condicionais; séries temporais projetam valores preservando ordem; gráficos de controle acompanham processos; experimentos fortalecem a aprendizagem causal.

O valor-p é apenas uma parte da evidência. Estimativas, intervalos, tamanhos de efeito, poder e relevância devem aparecer juntos. Premissas precisam ser avaliadas por desenho e diagnóstico, não apenas por testes automáticos. Resultados observacionais não devem ser apresentados como causas sem justificativa. Previsões precisam ser validadas fora da amostra e monitoradas. Modelos que afetam pessoas exigem proteção, explicação e avaliação de desigualdades.

A competência final é saber percorrer o ciclo completo: estruturar pergunta, preparar dados, selecionar técnica, executar, diagnosticar, interpretar, comunicar, implementar e revisar. A estatística oferece uma linguagem para lidar com incerteza; a Administração transforma essa linguagem em decisão responsável.

Mapa rápido de escolha

Pergunta

Estrutura

Método inicial

uma média difere da meta?

quantitativa, uma amostra

t de uma amostra

duas médias independentes diferem?

quantitativa, dois grupos

t de Welch

antes e depois diferem?

quantitativa, pares

t pareado ou Wilcoxon

duas taxas diferem?

binária, dois grupos

teste de duas proporções

duas categorias se associam?

tabela de contingência

qui-quadrado

três ou mais médias diferem?

quantitativa, vários grupos

ANOVA ou Welch

grupos ordinais/assimétricos diferem?

postos ou ordinal

Mann-Whitney/Kruskal-Wallis

variáveis quantitativas se relacionam?

duas quantitativas

correlação e regressão

resposta binária depende de fatores?

Y binário

regressão logística

valores futuros precisam ser projetados?

série ordenada

métodos de séries temporais

processo está estável?

indicador sequencial

gráfico de controle

 

Glossário

Termo

Definição

ANOVA

método que compara variabilidade entre e dentro de grupos para testar igualdade de médias

Erro-padrão

variabilidade esperada de uma estimativa entre amostras

Interação

situação em que o efeito de uma variável depende do nível de outra

Multicolinearidade

forte relação entre preditores que dificulta separar coeficientes

Odds ratio

razão entre chances, comum na regressão logística

Poder estatístico

probabilidade de detectar um efeito específico quando ele existe

Resíduo

diferença entre valor observado e previsto pelo modelo

Tamanho do efeito

medida da magnitude de uma diferença ou associação

Valor-p

probabilidade, sob H0 e o modelo, de resultado tão extremo quanto o observado ou mais

Validação temporal

avaliação de previsão respeitando a ordem do tempo

 

Erros a evitar

·         concluir causalidade a partir de associação observacional;

·         escolher teste depois de procurar o resultado desejado;

·         usar não significância como prova de igualdade;

·         ignorar dependência entre observações;

·         comparar muitos grupos sem controlar multiplicidade;

·         interpretar odds ratio como aumento direto de probabilidade;

·         extrapolar regressões fora da faixa;

·         avaliar previsão no mesmo período usado para ajustar;

·         confundir limites de controle com especificações;

·         ocultar exclusões, transformações ou métricas alternativas.

10. Referências e Aprofundamento

Bibliografia básica sugerida

·         ANDERSON, David R.; SWEENEY, Dennis J.; WILLIAMS, Thomas A.; CAMM, Jeffrey D.; COCHRAN, James J. Estatística aplicada à administração e economia.

·         BUSSAB, Wilton de Oliveira; MORETTIN, Pedro Alberto. Estatística básica.

·         DOWNING, Douglas; CLARK, Jeffrey. Estatística aplicada.

·         LEVINE, David M.; STEPHAN, David F.; SZABAT, Kathryn A. Estatística: teoria e aplicações.

·         MARTINS, Gilberto de Andrade; DOMINGUES, Osmar. Estatística geral e aplicada.

·         MONTGOMERY, Douglas C.; RUNGER, George C. Estatística aplicada e probabilidade para engenheiros.

·         TRIOLA, Mario F. Introdução à estatística.

·         HAIR, Joseph F. et al. Análise multivariada de dados, para aprofundamento posterior.

Bibliografia para regressão, experimentação e previsão

·         WOOLDRIDGE, Jeffrey M. Introdução à econometria: uma abordagem moderna.

·         GUJARATI, Damodar N.; PORTER, Dawn C. Econometria básica.

·         MONTGOMERY, Douglas C. Design and Analysis of Experiments.

·         HYNDMAN, Rob J.; ATHANASOPOULOS, George. Forecasting: Principles and Practice.

·         BOX, George E. P.; JENKINS, Gwilym M.; REINSEL, Gregory C.; LJUNG, Greta M. Time Series Analysis.

·         MONTGOMERY, Douglas C. Introduction to Statistical Quality Control.

Fontes e documentação de ferramentas

Para aplicar métodos em software, consulte documentação oficial da ferramenta adotada. Em R, funções base e pacotes oferecem testes, regressão e séries; em Python, bibliotecas como pandas, scipy, statsmodels e scikit-learn atendem diferentes etapas. Jamovi e JASP oferecem interfaces gráficas. A documentação deve ser verificada na versão instalada, pois comandos e padrões podem mudar. O relatório acadêmico deve registrar software, versão e procedimentos relevantes.

Tópicos para estudos futuros

·         modelos lineares generalizados além da logística;

·         regressão com dados em painel e efeitos mistos;

·         econometria causal e experimentos naturais;

·         séries temporais ARIMA e modelos sazonais;

·         métodos bayesianos;

·         análise de sobrevivência;

·         análise multivariada, componentes principais e agrupamento;

·         aprendizado de máquina e validação avançada;

·         amostragem complexa e ponderação;

·         estatística espacial;

·         privacidade, justiça algorítmica e auditoria de modelos.

Plano de aprofundamento em oito semanas

Semana

Foco

Atividade

1

comparações

resolver testes de médias e proporções com intervalos

2

categorias e ANOVA

analisar tabela e quatro grupos

3

não paramétricos

comparar métodos em base assimétrica

4

regressão simples

construir dispersão, reta e diagnóstico

5

regressão múltipla

interpretar indicadores, interações e VIF

6

séries

comparar benchmark, média móvel e suavização

7

experimento e controle

planejar teste A/B e gráfico p

8

projeto integrado

entregar nota executiva e apêndice técnico

 

Checklist final para trabalhos

·         a pergunta e a decisão estão explícitas?

·         a população e a unidade foram definidas?

·         a origem e a qualidade da base foram documentadas?

·         o método corresponde ao desenho e ao tipo de variável?

·         as premissas foram examinadas?

·         estimativa, intervalo e efeito foram apresentados?

·         o valor-p foi interpretado corretamente?

·         a linguagem respeita o alcance causal?

·         a análise foi validada ou submetida a sensibilidade?

·         gráficos e tabelas possuem unidades, fontes e legendas?

·         riscos éticos, privacidade e grupos afetados foram considerados?

·         os passos podem ser reproduzidos por outra pessoa?

Encerramento

Métodos Estatísticos II não encerra a formação quantitativa; ele consolida a passagem de dados para modelos gerenciais. A pessoa administradora não precisa executar manualmente toda análise complexa, mas precisa compreender o problema, questionar premissas, interpretar saídas e responsabilizar-se pela decisão. A combinação de técnica, contexto e transparência transforma números em evidência útil e evita que sofisticação aparente substitua raciocínio.

A prática continuada fortalece a autonomia para questionar modelos, reconhecer incertezas e comunicar decisões baseadas em evidências com responsabilidade.

Nenhum comentário:

Postar um comentário

Gestão de pessoas: fundamentos e principais processos nas organizações

  Gestão de pessoas: fundamentos e principais processos nas organizações Palavras-chave para SEO: gestão de pessoas; recursos humanos;...