Clube da MatemáticaClube da Matemática
v1 · padrão canônico

Lição 106 — Regressão múltipla

Modelo com p preditores, solução matricial OLS, R² ajustado, multicolinearidade, seleção de variáveis e diagnóstico de pressupostos.

Usado em: Stochastik LK alemão (Klasse 12) · H2 Mathematics Singapura (§15) · econometria introdutória

β^=(XTX)−1XTy\hat{\boldsymbol\beta} = (X^TX)^{-1}X^T\mathbf{y}

Na regressão múltipla com pp preditores, o estimador OLS é a solução matricial das equações normais. Cada coeficiente β^j\hat\beta_j mede o efeito de XjX_j sobre YY mantendo os demais preditores fixos — o chamado efeito parcial.

Escolha sua porta

Notação rigorosa, derivação completa, hipóteses

Definição rigorosa

Modelo de regressão linear múltipla

"The multiple regression model is y=β0+β1x1+β2x2+⋯+βkxk+εy = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \cdots + \beta_k x_k + \varepsilon. The coefficient βi\beta_i measures the expected change in yy per unit change in xix_i when all other predictors are held constant." — OpenIntro Statistics, §8.1, p. 362

Métricas de ajuste

Inferência

Matriz de design X (n=4, p=2)1 X₁₁ X₁₂1 X₂₁ X₂₂1 X₃₁ X₃₂1 X₄₁ X₄₂n×(p+1)×β₀β₁β₂(p+1)×1=Ŷ₁Ŷ₂Ŷ₃Ŷ₄n×1+ε₁ε₂ε₃ε₄n×1

Representação matricial do modelo: Y=Xβ+ε\mathbf{Y} = X\boldsymbol\beta + \boldsymbol\varepsilon. A primeira coluna de 1s em XX gera o intercepto β0\beta_0.

Exemplos resolvidos

Lista de exercícios

42 exercícios · 10 com solução desenvolvida (25%)

Aplicação 23Compreensão 7Modelagem 6Desafio 5Demonstração 1
  1. Ex. 106.1Aplicação

    Um modelo de regressão múltipla prevê o peso médio de bebês ao nascer (em onças) usando como preditores: fumar (1 = fumante, 0 = não fumante) e paridade (número de filhos anteriores). Escreva a equação do modelo e interprete o coeficiente de fumar como efeito parcial.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Em regressão múltipla, cada coeficiente mede o efeito parcial — a mudança esperada em YY por unidade de mudança no preditor, mantendo os demais fixos. O coeficiente de fumar indica quantas onças de diferença há no peso do bebê entre mães fumantes e não-fumantes, controlando para paridade.
  2. Ex. 106.2AplicaçãoGabarito

    O estudo sobre peso de bebês incluiu um segundo preditor: paridade (0 = primeiro filho, 1 = segundo ou posterior). Interprete o coeficiente de paridade na regressão múltipla e explique por que o coeficiente de fumar pode mudar ao incluir paridade no modelo.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    O coeficiente de paridade mede o efeito parcial — a mudança esperada no peso do bebê por filho adicional anterior, controlando para o hábito de fumar da mãe. Se fumar e paridade são correlacionadas, os coeficientes na regressão múltipla diferirão dos modelos simples separados.
    Ver passo a passo (com o porquê)
    1. Modelo múltiplo: Y^=β^0+β^1⋅fumar+β^2⋅paridade\hat Y = \hat\beta_0 + \hat\beta_1 \cdot \text{fumar} + \hat\beta_2 \cdot \text{paridade}.
    2. O coeficiente β^2\hat\beta_2 é o efeito parcial de paridade, controlando para fumo.
    3. Compare o coeficiente de fumar no modelo simples (só fumar) com o da regressão múltipla — eles diferem por confundimento.
    4. Conclusão: na regressão múltipla, cada coeficiente isola o efeito de uma variável mantendo as demais constantes.
  3. Ex. 106.3Aplicação

    Considere três modelos: (1) peso ~ fumar; (2) peso ~ paridade; (3) peso ~ fumar + paridade. Os coeficientes de fumar nos modelos 1 e 3 devem ser iguais? Justifique e explique o papel do confundimento.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Quando duas variáveis são correlacionadas entre si (como fumar e paridade), os coeficientes na regressão múltipla diferem dos modelos simples. O modelo múltiplo isola o efeito parcial de cada preditor, eliminando o confundimento mútuo. O Rˉ2\bar R^2 permite comparar os modelos penalizando pela complexidade.
  4. Ex. 106.4AplicaçãoGabarito

    Pesquisadores modelaram o absentismo escolar (YY, dias de ausência) em função de falta de disciplina (X1X_1) e distância da escola (X2X_2, km): Y^=β^0+β^1X1+β^2X2\hat Y = \hat\beta_0 + \hat\beta_1 X_1 + \hat\beta_2 X_2. O que representa o intercepto β^0\hat\beta_0 nesse modelo?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Em qualquer regressão múltipla com intercepto, β^0\hat\beta_0 é o valor predito de YY quando todos os preditores são zero. Para o modelo de absentismo, é o número médio de dias ausentes esperado para um aluno com ausência de disciplina zero e distância zero da escola. Pode não ter interpretação prática útil se zero não está no intervalo amostrado.
  5. Ex. 106.5AplicaçãoGabarito

    Uma pesquisa com 55 alunos da Universidade Duke modelou o GPA em função de horas de estudo por noite, número de aulas perdidas e sexo. O que o coeficiente de horas de estudo representa no modelo múltiplo?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Na pesquisa com 55 alunos da Duke, o modelo múltiplo isola o efeito de cada hora adicional de estudo sobre o GPA, controlando para o número de aulas perdidas e o sexo do estudante. Cada coeficiente é um efeito parcial (ceteris paribus).
    Ver passo a passo (com o porquê)
    1. Modelo: GPA^=β^0+β^1⋅horas+β^2⋅aulas perdidas+β^3⋅sexo\hat{\text{GPA}} = \hat\beta_0 + \hat\beta_1 \cdot \text{horas} + \hat\beta_2 \cdot \text{aulas perdidas} + \hat\beta_3 \cdot \text{sexo}.
    2. O coeficiente β^1\hat\beta_1 é o efeito parcial: mantendo aulas perdidas e sexo constantes, cada hora adicional de estudo está associada a uma mudança de β^1\hat\beta_1 no GPA.
    3. Se β^1>0\hat\beta_1 > 0: estudar mais está associado a GPA maior, dado o mesmo nível de frequência e sexo.
  6. Ex. 106.6AplicaçãoGabarito

    Madeireiras estimam o volume de árvores (pés cúbicos) a partir do diâmetro (X1X_1, polegadas) e altura (X2X_2, pés). Um modelo inclui diâmetro, altura e a interação diâmetro×altura. Por que incluir o termo de interação melhora o ajuste nesse contexto?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    O volume de madeira tem uma relação geométrica com diâmetro e altura. Incluir o termo de interação X3=X1×X2X_3 = X_1 \times X_2 permite que o efeito do diâmetro sobre o volume varie com a altura — capturando a relação multiplicativa entre as dimensões. O Rˉ2\bar R^2 deve ser alto, refletindo a forte relação geométrica.
  7. Ex. 106.7Modelagem

    O modelo completo de peso de bebês inclui vários preditores. Usando o critério de eliminação backward (backward elimination), qual seria o primeiro preditor a ser removido e como essa decisão é tomada?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Na seleção backward, o primeiro passo é identificar e remover o preditor menos significativo dado os demais — aquele com o maior valor-p no teste tt parcial. Isso é o início do processo de eliminação regressiva para obter um modelo parcimonioso.
    Ver passo a passo (com o porquê)
    1. Verificar a tabela de coeficientes do modelo de peso de bebês com múltiplos preditores.
    2. Identificar o preditor com maior valor-p no teste tt parcial — esse preditor explica menos variância dado os demais.
    3. Remover esse preditor e reajustar o modelo reduzido.
    4. Verificar se o Rˉ2\bar R^2 sobe ou cai ao remover o preditor.
    5. Repetir o processo até que todos os preditores restantes sejam significativos (backward elimination).
  8. Ex. 106.8ModelagemGabarito

    O modelo completo de absentismo escolar inclui falta de disciplina, distância da escola, sexo, número de irmãos e renda familiar. Usando backward elimination, descreva o processo para chegar a um modelo parcimonioso.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Na seleção de modelos para absentismo, aplica-se backward elimination: começar com o modelo completo (falta de disciplina, distância, etc.) e remover o preditor menos significativo a cada passo, reajustando o modelo. Parar quando todos os preditores restantes têm valor-p abaixo do limiar (tipicamente 0,05) ou quando o Rˉ2\bar R^2 deixa de melhorar.
  9. Ex. 106.9Modelagem

    Após backward elimination no modelo de peso de bebês, obteve-se um modelo reduzido. Como usar o Rˉ2\bar R^2 para decidir se o modelo reduzido é melhor que o completo?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Após eliminar preditores pouco significativos do modelo de peso de bebês, o modelo reduzido é preferível se tiver Rˉ2\bar R^2 igual ou superior ao completo. O Rˉ2\bar R^2 penaliza pela complexidade: se cai ao remover um preditor, esse preditor contribui informação real. Se sobe ou mantém, o preditor era redundante.
  10. Ex. 106.10Modelagem

    Após aplicar backward elimination ao modelo de absentismo, o modelo reduzido manteve apenas falta de disciplina e distância. O Rˉ2\bar R^2 do modelo reduzido é 0,56 e o do completo é 0,54. Qual modelo é preferível e por quê?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    O critério de comparação adequado entre modelos com diferentes números de preditores é o Rˉ2\bar R^2 (ou o AIC). Um Rˉ2\bar R^2 maior indica melhor ajuste penalizado pela complexidade. Se o modelo reduzido de absentismo tem Rˉ2\bar R^2 maior ou igual ao completo, é preferível por ser mais parcimonioso.
  11. Ex. 106.11Compreensão

    Uma cientista social quer modelar a nota média de críticos para filmes em função de: orçamento, duração, gênero do filme e gênero do diretor. Que tipo de modelo de regressão é apropriado e como tratar as variáveis categóricas?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Quando a variável resposta é numérica e contínua (como nota do crítico), a regressão linear múltipla é o modelo adequado. Variáveis categóricas (gênero do diretor, gênero do filme) são incluídas como dummies. Se a resposta fosse binária (sucesso/fracasso), usaríamos regressão logística.
  12. Ex. 106.12Compreensão

    Uma empresa de streaming quer construir um modelo de regressão para prever a avaliação de usuários de filmes usando como preditores: gênero, duração, nota de críticos, orçamento e ano de lançamento. Como a seleção de variáveis melhora esse sistema?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Um sistema de recomendação pode usar regressão múltipla para prever a avaliação de um usuário com base em características do filme (gênero, duração, orçamento, nota de críticos). Backward elimination remove preditores irrelevantes, e o Rˉ2\bar R^2 ou AIC guia a seleção do modelo final.
  13. Ex. 106.13Compreensão

    Verifique se a seguinte afirmação é verdadeira ou falsa: "O R² ajustado pode diminuir ao adicionar um preditor ao modelo de regressão múltipla." Justifique.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    O R2R^2 não ajustado nunca diminui ao adicionar preditores — é uma propriedade matemática do OLS. O Rˉ2\bar R^2 ajustado penaliza pelo número de parâmetros e pode diminuir quando o preditor adicionado contribui pouco. Por isso, Rˉ2\bar R^2 é o critério correto para comparar modelos com diferentes números de preditores.
  14. Ex. 106.14Compreensão

    Verifique se a afirmação é verdadeira ou falsa: "A regressão logística é apropriada quando a variável resposta é contínua e simétrica." Explique a diferença entre regressão linear e logística quanto à natureza da variável resposta.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    A regressão logística é usada quando a variável resposta é binária (0 ou 1), como aprovação/reprovação, doente/saudável. O modelo prevê a probabilidade de Y=1 como uma função logística dos preditores: P(Y=1)=eη/(1+eη)P(Y=1) = e^{\eta}/(1+e^{\eta}), onde η=β0+β1X1+⋯\eta = \beta_0 + \beta_1 X_1 + \cdots. A regressão linear múltipla é para Y contínuo.
  15. Ex. 106.15Modelagem

    Filtros de spam são baseados em princípios similares à regressão logística. Que tipo de variável resposta tem um modelo de filtragem de spam? Por que se usa regressão logística em vez de linear?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Filtros de spam são classificadores binários: e-mail é spam (1) ou não (0). A regressão logística modela P(spam=1∣X1,…,Xp)P(\text{spam}=1 | X_1,\ldots,X_p) como função logística de preditores (frequência de palavras suspeitas, remetente desconhecido, etc.). Os coeficientes positivos aumentam a probabilidade de classificar como spam.
  16. Ex. 106.16Modelagem

    Um estudante analisou o retorno sobre investimento (ROI) de filmes usando regressão múltipla com gênero, orçamento e nota de críticos como preditores, obtendo R2=0,60R^2 = 0{,}60. Quais são as limitações de interpretar esse R2R^2 como medida definitiva de ajuste?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Um R2=0,60R^2 = 0{,}60 indica que o modelo explica 60% da variação no retorno de filmes — razoável, mas não extraordinário. Com muitos preditores em amostra pequena, o modelo pode overfit. Validação cruzada out-of-sample (k-fold) fornece estimativa mais honesta do poder preditivo. Além disso, alto R2R^2 não implica causalidade.
  17. Ex. 106.17Desafio

    Um pesquisador aplicou backward elimination ao modelo de filtragem de spam e obteve um modelo final. Esse procedimento garante que o modelo encontrado tem o menor AIC possível entre todos os subconjuntos de preditores? Justifique.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Backward elimination e forward selection são algoritmos gulosos — tomam a melhor decisão local a cada passo sem garantir ótimo global. Podem produzir modelos diferentes e nenhum garante encontrar o menor AIC entre todos os subconjuntos possíveis. A busca exaustiva (best subset) garante o ótimo, mas é computacionalmente inviável com muitos preditores (2p2^p modelos).
  18. Ex. 106.18Aplicação

    Em uma locadora de equipamentos, a taxa cobrada depende do número de horas de aluguel. Identifique a variável dependente e a variável independente nessa relação.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Em uma relação de aluguel de equipamento, a taxa total cobrada depende do número de horas de aluguel. Portanto: YY (dependente) = taxa total cobrada; XX (independente) = número de horas de aluguel. O modelo é Y^=β^0+β^1X\hat Y = \hat\beta_0 + \hat\beta_1 X, onde β^0\hat\beta_0 é a taxa base e β^1\hat\beta_1 é o custo por hora.
  19. Ex. 106.19Aplicação

    Uma locadora cobra uma taxa base de R$ 20 mais R$ 5 por hora de aluguel. Encontre a equação linear que expressa a taxa total YY em função do número de horas XX.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Com taxa base de R\$ 20 e custo adicional de R\$ 5 por hora: Y^=20+5X\hat Y = 20 + 5X, onde β^0=20\hat\beta_0 = 20 (taxa fixa de locação) e β^1=5\hat\beta_1 = 5 (custo por hora). Para 3 horas: Y^=20+5×3=35\hat Y = 20 + 5\times 3 = 35 reais. (Resp: Y^=20+5X\hat Y = 20 + 5X)
  20. Ex. 106.20Aplicação

    A equação Y=10+5x−3x2Y = 10 + 5x - 3x^2 é um modelo de regressão linear? Justifique.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Um modelo de regressão é linear se for linear nos parâmetros e se cada preditor aparece com expoente 1. A equação Y=10+5x−3x2Y = 10 + 5x - 3x^2 não é linear porque contém x2x^2 — o preditor xx aparece com expoente 2. É um modelo de regressão polinomial (grau 2), não linear.
  21. Ex. 106.21Aplicação

    Quais das seguintes equações são lineares? (a) y=6x+8y = 6x + 8; (b) y+7=3xy + 7 = 3x; (c) y−x=8x2y - x = 8x^2; (d) 4y=84y = 8.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    (a) y=6x+8y = 6x + 8: linear (xx com expoente 1). (b) y+7=3xy + 7 = 3x ⇒y=3x−7\Rightarrow y = 3x - 7: linear. (c) y−x=8x2y - x = 8x^2 ⇒y=x+8x2\Rightarrow y = x + 8x^2: não linear (tem x2x^2). (d) 4y=84y = 8 ⇒y=2\Rightarrow y = 2: linear (reta horizontal, inclinação zero). (Resp: a, b, d)
  22. Ex. 106.22AplicaçãoGabarito

    Em um banco de dados com colunas "Ano" e "Número de casos de gripe diagnosticados", por que o ano é a variável independente e o número de casos é a variável dependente?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    O ano é a variável independente (XX) pois o número de casos de gripe (YY) varia ao longo do tempo — o tempo não é causado pelo número de casos. Em modelos de séries temporais, o tempo é tipicamente o preditor. Isso não implica causalidade direta: outras variáveis (sazonalidade, vacinação) também afetam YY.
  23. Ex. 106.23Aplicação

    Interprete o intercepto e a inclinação de uma equação de regressão simples Y^=β^0+β^1X\hat Y = \hat\beta_0 + \hat\beta_1 X. Como essas interpretações se generalizam para a regressão múltipla?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Na equação de regressão Y^=β^0+β^1X\hat Y = \hat\beta_0 + \hat\beta_1 X: o intercepto β^0\hat\beta_0 é o valor predito quando X=0X = 0; a inclinação β^1\hat\beta_1 é a variação média esperada em YY por unidade de aumento em XX.
    Ver passo a passo (com o porquê)
    1. A equação de regressão simples é Y^=β^0+β^1X\hat Y = \hat\beta_0 + \hat\beta_1 X.
    2. O intercepto β^0\hat\beta_0: valor previsto de YY quando X=0X = 0.
    3. A inclinação β^1\hat\beta_1: mudança média em YY para cada unidade adicional de XX.
    4. Em regressão múltipla, cada coeficiente é interpretado como efeito parcial (mantendo os demais fixos).
  24. Ex. 106.24AplicaçãoGabarito

    Um modelo de regressão linear simples descreve a erosão de uma costa em toneladas de solo perdidas por ano. O que representam o intercepto e a inclinação nesse contexto?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Em um modelo de erosão costeira, se YY = toneladas de solo perdidas e XX = anos: a inclinação β^1\hat\beta_1 é a perda anual média de solo (toneladas/ano) e o intercepto β^0\hat\beta_0 é a perda estimada no ano zero (início do período de observação).
  25. Ex. 106.25Aplicação

    No modelo de regressão do preço de uma ação em função do tempo, o investidor preferiria uma inclinação positiva ou negativa? Por quê?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Em um modelo de regressão onde YY é o preço de uma ação e XX é o tempo, a inclinação positiva indica que o preço tende a aumentar com o tempo — desejável para quem detém a ação. Inclinação negativa indica tendência de queda; inclinação zero indica estagnação. Claro que o modelo linear é uma simplificação da dinâmica real dos mercados.
  26. Ex. 106.26Aplicação

    O que significa um valor de r=0r = 0 para o coeficiente de correlação de Pearson? Isso implica que as variáveis são completamente independentes?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    O coeficiente de correlação de Pearson r=0r = 0 indica ausência de relação linear entre as variáveis. Não significa que não há relação — pode existir uma relação não-linear (quadrática, exponencial, etc.) que rr não detecta. Em regressão múltipla, a correlação entre preditores (multicolinearidade) é distinta de rr entre preditor e resposta.
  27. Ex. 106.27Aplicação

    Quando n=2n = 2 e r=1r = 1, os dados são estatisticamente significativos? Explique.

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Com n=2n = 2, dois pontos sempre determinam uma reta perfeita, logo r=1r = 1 automaticamente — sem exceção. O teste de significância tem df=n−2=0df = n - 2 = 0 graus de liberdade, tornando o teste inválido. Com n=2n = 2, a estatística TT é indeterminada (divisão por zero). Portanto, r=1r = 1 com n=2n = 2 não é significativo no sentido estatístico.
  28. Ex. 106.28AplicaçãoGabarito

    Com n=100n = 100 e r=−0,89r = -0{,}89, há correlação significativa entre as variáveis? Justifique usando a estatística TT do teste de significância. (Resp: sim, correlação altamente significativa)

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Com n=100n = 100 e r=−0,89r = -0{,}89: T=r(n−2)/(1−r2)=−0,8998/(1−0,7921)=−0,8998/0,2079≈−0,89×21,7≈−19,3T = r\sqrt{(n-2)/(1-r^2)} = -0{,}89\sqrt{98/(1-0{,}7921)} = -0{,}89\sqrt{98/0{,}2079} \approx -0{,}89 \times 21{,}7 \approx -19{,}3. Com df=98df = 98, o valor crítico t98; 0,025≈1,984t_{98;\,0{,}025} \approx 1{,}984. Como ∣T∣=19,3≫1,984|T| = 19{,}3 \gg 1{,}984, a correlação é altamente significativa.
  29. Ex. 106.29Compreensão

    Ao testar a significância do coeficiente de correlação, qual é a hipótese nula H0H_0?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Ao testar a significância do coeficiente de correlação, a hipótese nula é H0:ρ=0H_0: \rho = 0, onde ρ\rho (rho) é o coeficiente de correlação populacional. Rejeitá-la significa que há evidência de correlação linear entre as variáveis na população. A estatística de teste é T=r(n−2)/(1−r2)∼tn−2T = r\sqrt{(n-2)/(1-r^2)} \sim t_{n-2} sob H0H_0.
  30. Ex. 106.30Compreensão

    Ao testar a significância do coeficiente de correlação, qual é a hipótese alternativa H1H_1 para um teste bilateral?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    A hipótese alternativa no teste do coeficiente de correlação é H1:ρ≠0H_1: \rho \neq 0 (bilateral) quando não se tem direção esperada. Se houver razão para esperar correlação positiva: H1:ρ>0H_1: \rho > 0; correlação negativa: H1:ρ<0H_1: \rho < 0. Em regressão múltipla, o teste tt parcial de cada coeficiente tem hipótese alternativa H1:βj≠0H_1: \beta_j \neq 0.
  31. Ex. 106.31AplicaçãoGabarito

    No teste de significância do coeficiente de correlação com nível de significância α=0,05\alpha = 0{,}05 e p-valor =0,04= 0{,}04, qual é a conclusão?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Com nível de significância α=0,05\alpha = 0{,}05 e p-valor =0,04= 0{,}04: como 0,04<0,050{,}04 < 0{,}05, rejeitamos H0:ρ=0H_0: \rho = 0. Há evidência estatística de correlação linear entre as variáveis ao nível 5%. (Nota: ao nível 1%, não rejeitaríamos pois 0,04>0,010{,}04 > 0{,}01.)
  32. Ex. 106.32Aplicação

    Um modelo de regressão das vendas diárias de um produto em função do dia de operação (XX) é Y^=200+2X\hat Y = 200 + 2X. Qual seria a previsão de vendas no dia 60?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Com o modelo Y^=200+2X\hat Y = 200 + 2X (intercepto 200, inclinação 2): no dia 60, Y^=200+2×60=200+120=320\hat Y = 200 + 2 \times 60 = 200 + 120 = 320 unidades. (Resp: Y^=320\hat Y = 320 unidades)
  33. Ex. 106.33AplicaçãoGabarito

    Usando o mesmo modelo Y^=200+2X\hat Y = 200 + 2X, qual é a previsão de vendas no dia 90?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Usando Y^=200+2X\hat Y = 200 + 2X: no dia 90, Y^=200+2×90=200+180=380\hat Y = 200 + 2 \times 90 = 200 + 180 = 380 unidades. Atenção: previsão fora do intervalo amostral é extrapolação e pode ter maior incerteza. (Resp: Y^=380\hat Y = 380 unidades)
  34. Ex. 106.34Aplicação

    O modelo da área restante a tosar (em acres) em função das horas de trabalho é Y^=100−2X\hat Y = 100 - 2X. Quantos acres restam após 20 horas de trabalho?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Com o modelo Y^=100−2X\hat Y = 100 - 2X (área restante em acres, horas trabalhadas como preditor): após 20 horas, Y^=100−2×20=100−40=60\hat Y = 100 - 2 \times 20 = 100 - 40 = 60 acres restantes. O intercepto (100 acres) é a área total inicial. (Resp: 60 acres restantes)
  35. Ex. 106.35Aplicação

    Usando Y^=100−2X\hat Y = 100 - 2X, quantos acres restam após 100 horas? O resultado faz sentido? O que esse resultado revela sobre os limites do modelo linear?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Aplicando Y^=100−2×100=−100\hat Y = 100 - 2 \times 100 = -100 acres — valor negativo sem sentido físico. Isso é extrapolação além do domínio válido. O modelo linear prediz que toda a área é tosada quando Y^=0\hat Y = 0: 0=100−2X⇒X=500 = 100 - 2X \Rightarrow X = 50 horas. Usar o modelo além de 50 horas é extrapolação inválida.
  36. Ex. 106.36Aplicação

    Usando Y^=100−2X\hat Y = 100 - 2X, em quantas horas toda a área é tosada (ou seja, quando Y^=0\hat Y = 0)?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Toda a área é tosada quando Y^=0\hat Y = 0: 0=100−2X⇒2X=100⇒X=500 = 100 - 2X \Rightarrow 2X = 100 \Rightarrow X = 50 horas. Portanto, o modelo prediz que toda a grama é tosada em 50 horas de trabalho. (Resp: X=50X = 50 horas)
  37. Ex. 106.37Compreensão

    O que o coeficiente de determinação R2R^2 mede em um modelo de regressão? Um R2R^2 alto implica que X causa Y?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    O R2R^2 mede a proporção da variação total de YY que é explicada pelo modelo. Em regressão simples, R2=r2R^2 = r^2. Um R2R^2 alto indica bom ajuste linear, mas não implica causalidade — correlação não é causalidade. Além disso, R2R^2 alto pode ser enganoso com overfitting (muitos preditores para poucos dados).
  38. Ex. 106.38Desafio

    Compare os coeficientes de fumar no modelo simples (só fumar como preditor) e no modelo múltiplo (fumar + paridade) para peso de bebês. Por que podem diferir? Qual efeito cada um mede?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Quando dois preditores são correlacionados, os coeficientes de regressão simples e múltipla diferem — o coeficiente simples captura o efeito total (direto + via confundidor), enquanto o múltiplo isola apenas o efeito parcial. Esse fenômeno é central em epidemiologia e ciências sociais.
    Ver passo a passo (com o porquê)
    1. Modelo simples: Y^=β^0(s)+β^1(s)⋅fumar\hat Y = \hat\beta_0^{(s)} + \hat\beta_1^{(s)} \cdot \text{fumar}.
    2. Modelo múltiplo: Y^=β^0(m)+β^1(m)⋅fumar+β^2(m)⋅paridade\hat Y = \hat\beta_0^{(m)} + \hat\beta_1^{(m)} \cdot \text{fumar} + \hat\beta_2^{(m)} \cdot \text{paridade}.
    3. Se fumar e paridade são correlacionados, β^1(s)≠β^1(m)\hat\beta_1^{(s)} \neq \hat\beta_1^{(m)}.
    4. O efeito de confundimento: no modelo simples, β^1(s)\hat\beta_1^{(s)} captura tanto o efeito de fumar quanto a correlação com paridade.
    5. O modelo múltiplo isola o efeito parcial de fumar, removendo o confundimento de paridade.
  39. Ex. 106.39Desafio

    Descreva a lógica e a fórmula do teste F global em regressão múltipla. Qual hipótese nula ele testa e qual distribuição usa para calcular o p-valor?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    O teste F global testa H0:β1=β2=⋯=βp=0H_0: \beta_1 = \beta_2 = \cdots = \beta_p = 0 (nenhum preditor é útil). A estatística F=(SSR/p)/(SSE/(n−p−1))F = (\mathrm{SSR}/p)/(\mathrm{SSE}/(n-p-1)) segue distribuição F com pp e n−p−1n-p-1 graus de liberdade sob H0H_0. Rejeitar H0H_0 indica que pelo menos um preditor explica variação em YY.
    Ver passo a passo (com o porquê)
    1. Decomposição: SST=SSR+SSE\mathrm{SST} = \mathrm{SSR} + \mathrm{SSE}.
    2. Médias quadráticas: MSR=SSR/p\mathrm{MSR} = \mathrm{SSR}/p, MSE=SSE/(n−p−1)\mathrm{MSE} = \mathrm{SSE}/(n-p-1).
    3. Estatística F: F=MSR/MSEF = \mathrm{MSR}/\mathrm{MSE}.
    4. Sob H0:β1=⋯=βp=0H_0: \beta_1 = \cdots = \beta_p = 0: F∼Fp, n−p−1F \sim F_{p,\,n-p-1}.
    5. Rejeitar H0H_0 se F>Fp, n−p−1; αF > F_{p,\,n-p-1;\,\alpha}.
  40. Ex. 106.40Demonstração

    A partir da decomposição SST=SSR+SSE\mathrm{SST} = \mathrm{SSR} + \mathrm{SSE}, derive a fórmula do R2R^2 e mostre que 0≤R2≤10 \leq R^2 \leq 1. O que R2R^2 mede geometricamente?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    A decomposição ANOVA é SST=SSR+SSE\mathrm{SST} = \mathrm{SSR} + \mathrm{SSE}. Dividindo ambos os lados por SST\mathrm{SST}: 1=SSR/SST+SSE/SST1 = \mathrm{SSR}/\mathrm{SST} + \mathrm{SSE}/\mathrm{SST}. Portanto R2=SSR/SST=1−SSE/SSTR^2 = \mathrm{SSR}/\mathrm{SST} = 1 - \mathrm{SSE}/\mathrm{SST}. Como SSR≥0\mathrm{SSR} \geq 0 e SSE≤SST\mathrm{SSE} \leq \mathrm{SST}, temos 0≤R2≤10 \leq R^2 \leq 1. R2R^2 mede a fração da variabilidade total de YY explicada pelos preditores.
  41. Ex. 106.41Desafio

    Um preditor em um modelo de regressão múltipla tem VIF=15\mathrm{VIF} = 15. O que esse valor indica e quais ações o analista pode tomar para remediar o problema?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    VIF>10\mathrm{VIF} > 10 indica que a variância do estimador β^j\hat\beta_j é mais de 10 vezes maior do que seria sem colinearidade. Ações: remover o preditor colinear, combinar preditores via ACP, ou aplicar ridge regression. A escolha depende do objetivo (previsão vs. interpretação).
    Ver passo a passo (com o porquê)
    1. Calcular VIFj=1/(1−Rj2)\mathrm{VIF}_j = 1/(1-R_j^2) para cada preditor, onde Rj2R_j^2 é o R2R^2 da regressão de XjX_j sobre os demais.
    2. Se VIFj>10\mathrm{VIF}_j > 10: XjX_j tem multicolinearidade severa com os demais preditores.
    3. Opções: (a) remover o preditor mais colinear; (b) combinar preditores correlacionados via PCA; (c) usar ridge regression (L2L_2) para estabilizar os estimadores.
    4. Recalcular VIFs após cada ação e verificar se melhorou.
  42. Ex. 106.42Desafio

    Por que a validação cruzada fornece uma estimativa mais honesta do poder preditivo de um modelo de regressão múltipla do que o R2R^2 calculado nos próprios dados de ajuste?

    Selecione a alternativa correta
    Selecione uma opção primeiro
    Ver solução
    Em modelos com muitos preditores relativos a nn, o R2R^2 in-sample superestima o ajuste por overfitting. A validação cruzada (k-fold ou leave-one-out) divide os dados em treino e teste, estimando o erro de previsão em dados não usados no ajuste. Um R2R^2 in-sample alto com RMSE de validação cruzada alto indica overfitting severo. O Rˉ2\bar R^2 e o AIC penalizam a complexidade, mas apenas a VC estima diretamente o erro preditivo.

Fontes

  • OpenIntro Statistics (4ª ed.) — Diez, Çetinkaya-Rundel, Barr · CC-BY-SA · Capítulo 8 (Multiple and logistic regression). Fonte primária para interpretação de coeficientes, Rˉ2\bar R^2, multicolinearidade e variáveis dummy.
  • Statistics — OpenStax — Illowsky, Dean · CC-BY · Capítulo 13 (Linear Regression and Correlation — Multiple). Fonte para tabelas ANOVA de regressão múltipla e teste F global.
  • Probabilidade e Estatística — Wikilivros — colaborativo · CC-BY-SA · Seção de regressão múltipla. Referência em PT-BR com notação matricial.

Atualizado em 2026-05-06 · Autor(es): Clube da Matemática

Achou um erro? Abra uma issue no GitHub ou submeta um PR — open source pra sempre.