Lição 106 — Regressão múltipla
Modelo com p preditores, solução matricial OLS, R² ajustado, multicolinearidade, seleção de variáveis e diagnóstico de pressupostos.
Usado em: Stochastik LK alemão (Klasse 12) · H2 Mathematics Singapura (§15) · econometria introdutória
Na regressão múltipla com preditores, o estimador OLS é a solução matricial das equações normais. Cada coeficiente mede o efeito de sobre mantendo os demais preditores fixos — o chamado efeito parcial.
Notação rigorosa, derivação completa, hipóteses
Definição rigorosa
Modelo de regressão linear múltipla
"The multiple regression model is . The coefficient measures the expected change in per unit change in when all other predictors are held constant." — OpenIntro Statistics, §8.1, p. 362
Métricas de ajuste
Inferência
Representação matricial do modelo: . A primeira coluna de 1s em gera o intercepto .
Exemplos resolvidos
Lista de exercícios
42 exercícios · 10 com solução desenvolvida (25%)
- Ex. 106.1Aplicação
Um modelo de regressão múltipla prevê o peso médio de bebês ao nascer (em onças) usando como preditores: fumar (1 = fumante, 0 = não fumante) e paridade (número de filhos anteriores). Escreva a equação do modelo e interprete o coeficiente de fumar como efeito parcial.
Ver solução
Em regressão múltipla, cada coeficiente mede o efeito parcial — a mudança esperada em por unidade de mudança no preditor, mantendo os demais fixos. O coeficiente de fumar indica quantas onças de diferença há no peso do bebê entre mães fumantes e não-fumantes, controlando para paridade. - Ex. 106.2AplicaçãoGabarito
O estudo sobre peso de bebês incluiu um segundo preditor: paridade (0 = primeiro filho, 1 = segundo ou posterior). Interprete o coeficiente de paridade na regressão múltipla e explique por que o coeficiente de fumar pode mudar ao incluir paridade no modelo.
Ver solução
O coeficiente de paridade mede o efeito parcial — a mudança esperada no peso do bebê por filho adicional anterior, controlando para o hábito de fumar da mãe. Se fumar e paridade são correlacionadas, os coeficientes na regressão múltipla diferirão dos modelos simples separados.Ver passo a passo (com o porquê)
- Modelo múltiplo: .
- O coeficiente é o efeito parcial de paridade, controlando para fumo.
- Compare o coeficiente de fumar no modelo simples (só fumar) com o da regressão múltipla — eles diferem por confundimento.
- Conclusão: na regressão múltipla, cada coeficiente isola o efeito de uma variável mantendo as demais constantes.
- Ex. 106.3Aplicação
Considere três modelos: (1) peso ~ fumar; (2) peso ~ paridade; (3) peso ~ fumar + paridade. Os coeficientes de fumar nos modelos 1 e 3 devem ser iguais? Justifique e explique o papel do confundimento.
Ver solução
Quando duas variáveis são correlacionadas entre si (como fumar e paridade), os coeficientes na regressão múltipla diferem dos modelos simples. O modelo múltiplo isola o efeito parcial de cada preditor, eliminando o confundimento mútuo. O permite comparar os modelos penalizando pela complexidade. - Ex. 106.4AplicaçãoGabarito
Pesquisadores modelaram o absentismo escolar (, dias de ausência) em função de falta de disciplina () e distância da escola (, km): . O que representa o intercepto nesse modelo?
Ver solução
Em qualquer regressão múltipla com intercepto, é o valor predito de quando todos os preditores são zero. Para o modelo de absentismo, é o número médio de dias ausentes esperado para um aluno com ausência de disciplina zero e distância zero da escola. Pode não ter interpretação prática útil se zero não está no intervalo amostrado. - Ex. 106.5AplicaçãoGabarito
Uma pesquisa com 55 alunos da Universidade Duke modelou o GPA em função de horas de estudo por noite, número de aulas perdidas e sexo. O que o coeficiente de horas de estudo representa no modelo múltiplo?
Ver solução
Na pesquisa com 55 alunos da Duke, o modelo múltiplo isola o efeito de cada hora adicional de estudo sobre o GPA, controlando para o número de aulas perdidas e o sexo do estudante. Cada coeficiente é um efeito parcial (ceteris paribus).Ver passo a passo (com o porquê)
- Modelo: .
- O coeficiente é o efeito parcial: mantendo aulas perdidas e sexo constantes, cada hora adicional de estudo está associada a uma mudança de no GPA.
- Se : estudar mais está associado a GPA maior, dado o mesmo nível de frequência e sexo.
- Ex. 106.6AplicaçãoGabarito
Madeireiras estimam o volume de árvores (pés cúbicos) a partir do diâmetro (, polegadas) e altura (, pés). Um modelo inclui diâmetro, altura e a interação diâmetro×altura. Por que incluir o termo de interação melhora o ajuste nesse contexto?
Ver solução
O volume de madeira tem uma relação geométrica com diâmetro e altura. Incluir o termo de interação permite que o efeito do diâmetro sobre o volume varie com a altura — capturando a relação multiplicativa entre as dimensões. O deve ser alto, refletindo a forte relação geométrica. - Ex. 106.7Modelagem
O modelo completo de peso de bebês inclui vários preditores. Usando o critério de eliminação backward (backward elimination), qual seria o primeiro preditor a ser removido e como essa decisão é tomada?
Ver solução
Na seleção backward, o primeiro passo é identificar e remover o preditor menos significativo dado os demais — aquele com o maior valor-p no teste parcial. Isso é o início do processo de eliminação regressiva para obter um modelo parcimonioso.Ver passo a passo (com o porquê)
- Verificar a tabela de coeficientes do modelo de peso de bebês com múltiplos preditores.
- Identificar o preditor com maior valor-p no teste parcial — esse preditor explica menos variância dado os demais.
- Remover esse preditor e reajustar o modelo reduzido.
- Verificar se o sobe ou cai ao remover o preditor.
- Repetir o processo até que todos os preditores restantes sejam significativos (backward elimination).
- Ex. 106.8ModelagemGabarito
O modelo completo de absentismo escolar inclui falta de disciplina, distância da escola, sexo, número de irmãos e renda familiar. Usando backward elimination, descreva o processo para chegar a um modelo parcimonioso.
Ver solução
Na seleção de modelos para absentismo, aplica-se backward elimination: começar com o modelo completo (falta de disciplina, distância, etc.) e remover o preditor menos significativo a cada passo, reajustando o modelo. Parar quando todos os preditores restantes têm valor-p abaixo do limiar (tipicamente 0,05) ou quando o deixa de melhorar. - Ex. 106.9Modelagem
Após backward elimination no modelo de peso de bebês, obteve-se um modelo reduzido. Como usar o para decidir se o modelo reduzido é melhor que o completo?
Ver solução
Após eliminar preditores pouco significativos do modelo de peso de bebês, o modelo reduzido é preferível se tiver igual ou superior ao completo. O penaliza pela complexidade: se cai ao remover um preditor, esse preditor contribui informação real. Se sobe ou mantém, o preditor era redundante. - Ex. 106.10Modelagem
Após aplicar backward elimination ao modelo de absentismo, o modelo reduzido manteve apenas falta de disciplina e distância. O do modelo reduzido é 0,56 e o do completo é 0,54. Qual modelo é preferível e por quê?
Ver solução
O critério de comparação adequado entre modelos com diferentes números de preditores é o (ou o AIC). Um maior indica melhor ajuste penalizado pela complexidade. Se o modelo reduzido de absentismo tem maior ou igual ao completo, é preferível por ser mais parcimonioso. - Ex. 106.11Compreensão
Uma cientista social quer modelar a nota média de críticos para filmes em função de: orçamento, duração, gênero do filme e gênero do diretor. Que tipo de modelo de regressão é apropriado e como tratar as variáveis categóricas?
Ver solução
Quando a variável resposta é numérica e contínua (como nota do crítico), a regressão linear múltipla é o modelo adequado. Variáveis categóricas (gênero do diretor, gênero do filme) são incluídas como dummies. Se a resposta fosse binária (sucesso/fracasso), usaríamos regressão logística. - Ex. 106.12Compreensão
Uma empresa de streaming quer construir um modelo de regressão para prever a avaliação de usuários de filmes usando como preditores: gênero, duração, nota de críticos, orçamento e ano de lançamento. Como a seleção de variáveis melhora esse sistema?
Ver solução
Um sistema de recomendação pode usar regressão múltipla para prever a avaliação de um usuário com base em características do filme (gênero, duração, orçamento, nota de críticos). Backward elimination remove preditores irrelevantes, e o ou AIC guia a seleção do modelo final. - Ex. 106.13Compreensão
Verifique se a seguinte afirmação é verdadeira ou falsa: "O R² ajustado pode diminuir ao adicionar um preditor ao modelo de regressão múltipla." Justifique.
Ver solução
O não ajustado nunca diminui ao adicionar preditores — é uma propriedade matemática do OLS. O ajustado penaliza pelo número de parâmetros e pode diminuir quando o preditor adicionado contribui pouco. Por isso, é o critério correto para comparar modelos com diferentes números de preditores. - Ex. 106.14Compreensão
Verifique se a afirmação é verdadeira ou falsa: "A regressão logística é apropriada quando a variável resposta é contínua e simétrica." Explique a diferença entre regressão linear e logística quanto à natureza da variável resposta.
Ver solução
A regressão logística é usada quando a variável resposta é binária (0 ou 1), como aprovação/reprovação, doente/saudável. O modelo prevê a probabilidade de Y=1 como uma função logística dos preditores: , onde . A regressão linear múltipla é para Y contínuo. - Ex. 106.15Modelagem
Filtros de spam são baseados em princípios similares à regressão logística. Que tipo de variável resposta tem um modelo de filtragem de spam? Por que se usa regressão logística em vez de linear?
Ver solução
Filtros de spam são classificadores binários: e-mail é spam (1) ou não (0). A regressão logística modela como função logística de preditores (frequência de palavras suspeitas, remetente desconhecido, etc.). Os coeficientes positivos aumentam a probabilidade de classificar como spam. - Ex. 106.16Modelagem
Um estudante analisou o retorno sobre investimento (ROI) de filmes usando regressão múltipla com gênero, orçamento e nota de críticos como preditores, obtendo . Quais são as limitações de interpretar esse como medida definitiva de ajuste?
Ver solução
Um indica que o modelo explica 60% da variação no retorno de filmes — razoável, mas não extraordinário. Com muitos preditores em amostra pequena, o modelo pode overfit. Validação cruzada out-of-sample (k-fold) fornece estimativa mais honesta do poder preditivo. Além disso, alto não implica causalidade. - Ex. 106.17Desafio
Um pesquisador aplicou backward elimination ao modelo de filtragem de spam e obteve um modelo final. Esse procedimento garante que o modelo encontrado tem o menor AIC possível entre todos os subconjuntos de preditores? Justifique.
Ver solução
Backward elimination e forward selection são algoritmos gulosos — tomam a melhor decisão local a cada passo sem garantir ótimo global. Podem produzir modelos diferentes e nenhum garante encontrar o menor AIC entre todos os subconjuntos possíveis. A busca exaustiva (best subset) garante o ótimo, mas é computacionalmente inviável com muitos preditores ( modelos). - Ex. 106.18Aplicação
Em uma locadora de equipamentos, a taxa cobrada depende do número de horas de aluguel. Identifique a variável dependente e a variável independente nessa relação.
Ver solução
Em uma relação de aluguel de equipamento, a taxa total cobrada depende do número de horas de aluguel. Portanto: (dependente) = taxa total cobrada; (independente) = número de horas de aluguel. O modelo é , onde é a taxa base e é o custo por hora. - Ex. 106.19Aplicação
Uma locadora cobra uma taxa base de R$ 20 mais R$ 5 por hora de aluguel. Encontre a equação linear que expressa a taxa total em função do número de horas .
Ver solução
Com taxa base de R\$ 20 e custo adicional de R\$ 5 por hora: , onde (taxa fixa de locação) e (custo por hora). Para 3 horas: reais. (Resp: ) - Ex. 106.20Aplicação
A equação é um modelo de regressão linear? Justifique.
Ver solução
Um modelo de regressão é linear se for linear nos parâmetros e se cada preditor aparece com expoente 1. A equação não é linear porque contém — o preditor aparece com expoente 2. É um modelo de regressão polinomial (grau 2), não linear. - Ex. 106.21Aplicação
Quais das seguintes equações são lineares? (a) ; (b) ; (c) ; (d) .
Ver solução
(a) : linear ( com expoente 1). (b) : linear. (c) : não linear (tem ). (d) : linear (reta horizontal, inclinação zero). (Resp: a, b, d) - Ex. 106.22AplicaçãoGabarito
Em um banco de dados com colunas "Ano" e "Número de casos de gripe diagnosticados", por que o ano é a variável independente e o número de casos é a variável dependente?
Ver solução
O ano é a variável independente () pois o número de casos de gripe () varia ao longo do tempo — o tempo não é causado pelo número de casos. Em modelos de séries temporais, o tempo é tipicamente o preditor. Isso não implica causalidade direta: outras variáveis (sazonalidade, vacinação) também afetam . - Ex. 106.23Aplicação
Interprete o intercepto e a inclinação de uma equação de regressão simples . Como essas interpretações se generalizam para a regressão múltipla?
Ver solução
Na equação de regressão : o intercepto é o valor predito quando ; a inclinação é a variação média esperada em por unidade de aumento em .Ver passo a passo (com o porquê)
- A equação de regressão simples é .
- O intercepto : valor previsto de quando .
- A inclinação : mudança média em para cada unidade adicional de .
- Em regressão múltipla, cada coeficiente é interpretado como efeito parcial (mantendo os demais fixos).
- Ex. 106.24AplicaçãoGabarito
Um modelo de regressão linear simples descreve a erosão de uma costa em toneladas de solo perdidas por ano. O que representam o intercepto e a inclinação nesse contexto?
Ver solução
Em um modelo de erosão costeira, se = toneladas de solo perdidas e = anos: a inclinação é a perda anual média de solo (toneladas/ano) e o intercepto é a perda estimada no ano zero (início do período de observação). - Ex. 106.25Aplicação
No modelo de regressão do preço de uma ação em função do tempo, o investidor preferiria uma inclinação positiva ou negativa? Por quê?
Ver solução
Em um modelo de regressão onde é o preço de uma ação e é o tempo, a inclinação positiva indica que o preço tende a aumentar com o tempo — desejável para quem detém a ação. Inclinação negativa indica tendência de queda; inclinação zero indica estagnação. Claro que o modelo linear é uma simplificação da dinâmica real dos mercados. - Ex. 106.26Aplicação
O que significa um valor de para o coeficiente de correlação de Pearson? Isso implica que as variáveis são completamente independentes?
Ver solução
O coeficiente de correlação de Pearson indica ausência de relação linear entre as variáveis. Não significa que não há relação — pode existir uma relação não-linear (quadrática, exponencial, etc.) que não detecta. Em regressão múltipla, a correlação entre preditores (multicolinearidade) é distinta de entre preditor e resposta. - Ex. 106.27Aplicação
Quando e , os dados são estatisticamente significativos? Explique.
Ver solução
Com , dois pontos sempre determinam uma reta perfeita, logo automaticamente — sem exceção. O teste de significância tem graus de liberdade, tornando o teste inválido. Com , a estatística é indeterminada (divisão por zero). Portanto, com não é significativo no sentido estatístico. - Ex. 106.28AplicaçãoGabarito
Com e , há correlação significativa entre as variáveis? Justifique usando a estatística do teste de significância. (Resp: sim, correlação altamente significativa)
Ver solução
Com e : . Com , o valor crítico . Como , a correlação é altamente significativa. - Ex. 106.29Compreensão
Ao testar a significância do coeficiente de correlação, qual é a hipótese nula ?
Ver solução
Ao testar a significância do coeficiente de correlação, a hipótese nula é , onde (rho) é o coeficiente de correlação populacional. Rejeitá-la significa que há evidência de correlação linear entre as variáveis na população. A estatística de teste é sob . - Ex. 106.30Compreensão
Ao testar a significância do coeficiente de correlação, qual é a hipótese alternativa para um teste bilateral?
Ver solução
A hipótese alternativa no teste do coeficiente de correlação é (bilateral) quando não se tem direção esperada. Se houver razão para esperar correlação positiva: ; correlação negativa: . Em regressão múltipla, o teste parcial de cada coeficiente tem hipótese alternativa . - Ex. 106.31AplicaçãoGabarito
No teste de significância do coeficiente de correlação com nível de significância e p-valor , qual é a conclusão?
Ver solução
Com nível de significância e p-valor : como , rejeitamos . Há evidência estatística de correlação linear entre as variáveis ao nível 5%. (Nota: ao nível 1%, não rejeitaríamos pois .) - Ex. 106.32Aplicação
Um modelo de regressão das vendas diárias de um produto em função do dia de operação () é . Qual seria a previsão de vendas no dia 60?
Ver solução
Com o modelo (intercepto 200, inclinação 2): no dia 60, unidades. (Resp: unidades) - Ex. 106.33AplicaçãoGabarito
Usando o mesmo modelo , qual é a previsão de vendas no dia 90?
Ver solução
Usando : no dia 90, unidades. Atenção: previsão fora do intervalo amostral é extrapolação e pode ter maior incerteza. (Resp: unidades) - Ex. 106.34Aplicação
O modelo da área restante a tosar (em acres) em função das horas de trabalho é . Quantos acres restam após 20 horas de trabalho?
Ver solução
Com o modelo (área restante em acres, horas trabalhadas como preditor): após 20 horas, acres restantes. O intercepto (100 acres) é a área total inicial. (Resp: 60 acres restantes) - Ex. 106.35Aplicação
Usando , quantos acres restam após 100 horas? O resultado faz sentido? O que esse resultado revela sobre os limites do modelo linear?
Ver solução
Aplicando acres — valor negativo sem sentido físico. Isso é extrapolação além do domínio válido. O modelo linear prediz que toda a área é tosada quando : horas. Usar o modelo além de 50 horas é extrapolação inválida. - Ex. 106.36Aplicação
Usando , em quantas horas toda a área é tosada (ou seja, quando )?
Ver solução
Toda a área é tosada quando : horas. Portanto, o modelo prediz que toda a grama é tosada em 50 horas de trabalho. (Resp: horas) - Ex. 106.37Compreensão
O que o coeficiente de determinação mede em um modelo de regressão? Um alto implica que X causa Y?
Ver solução
O mede a proporção da variação total de que é explicada pelo modelo. Em regressão simples, . Um alto indica bom ajuste linear, mas não implica causalidade — correlação não é causalidade. Além disso, alto pode ser enganoso com overfitting (muitos preditores para poucos dados). - Ex. 106.38Desafio
Compare os coeficientes de fumar no modelo simples (só fumar como preditor) e no modelo múltiplo (fumar + paridade) para peso de bebês. Por que podem diferir? Qual efeito cada um mede?
Ver solução
Quando dois preditores são correlacionados, os coeficientes de regressão simples e múltipla diferem — o coeficiente simples captura o efeito total (direto + via confundidor), enquanto o múltiplo isola apenas o efeito parcial. Esse fenômeno é central em epidemiologia e ciências sociais.Ver passo a passo (com o porquê)
- Modelo simples: .
- Modelo múltiplo: .
- Se fumar e paridade são correlacionados, .
- O efeito de confundimento: no modelo simples, captura tanto o efeito de fumar quanto a correlação com paridade.
- O modelo múltiplo isola o efeito parcial de fumar, removendo o confundimento de paridade.
- Ex. 106.39Desafio
Descreva a lógica e a fórmula do teste F global em regressão múltipla. Qual hipótese nula ele testa e qual distribuição usa para calcular o p-valor?
Ver solução
O teste F global testa (nenhum preditor é útil). A estatística segue distribuição F com e graus de liberdade sob . Rejeitar indica que pelo menos um preditor explica variação em .Ver passo a passo (com o porquê)
- Decomposição: .
- Médias quadráticas: , .
- Estatística F: .
- Sob : .
- Rejeitar se .
- Ex. 106.40Demonstração
A partir da decomposição , derive a fórmula do e mostre que . O que mede geometricamente?
Ver solução
A decomposição ANOVA é . Dividindo ambos os lados por : . Portanto . Como e , temos . mede a fração da variabilidade total de explicada pelos preditores. - Ex. 106.41Desafio
Um preditor em um modelo de regressão múltipla tem . O que esse valor indica e quais ações o analista pode tomar para remediar o problema?
Ver solução
indica que a variância do estimador é mais de 10 vezes maior do que seria sem colinearidade. Ações: remover o preditor colinear, combinar preditores via ACP, ou aplicar ridge regression. A escolha depende do objetivo (previsão vs. interpretação).Ver passo a passo (com o porquê)
- Calcular para cada preditor, onde é o da regressão de sobre os demais.
- Se : tem multicolinearidade severa com os demais preditores.
- Opções: (a) remover o preditor mais colinear; (b) combinar preditores correlacionados via PCA; (c) usar ridge regression () para estabilizar os estimadores.
- Recalcular VIFs após cada ação e verificar se melhorou.
- Ex. 106.42Desafio
Por que a validação cruzada fornece uma estimativa mais honesta do poder preditivo de um modelo de regressão múltipla do que o calculado nos próprios dados de ajuste?
Ver solução
Em modelos com muitos preditores relativos a , o in-sample superestima o ajuste por overfitting. A validação cruzada (k-fold ou leave-one-out) divide os dados em treino e teste, estimando o erro de previsão em dados não usados no ajuste. Um in-sample alto com RMSE de validação cruzada alto indica overfitting severo. O e o AIC penalizam a complexidade, mas apenas a VC estima diretamente o erro preditivo.
Fontes
- OpenIntro Statistics (4ª ed.) — Diez, Çetinkaya-Rundel, Barr · CC-BY-SA · Capítulo 8 (Multiple and logistic regression). Fonte primária para interpretação de coeficientes, , multicolinearidade e variáveis dummy.
- Statistics — OpenStax — Illowsky, Dean · CC-BY · Capítulo 13 (Linear Regression and Correlation — Multiple). Fonte para tabelas ANOVA de regressão múltipla e teste F global.
- Probabilidade e Estatística — Wikilivros — colaborativo · CC-BY-SA · Seção de regressão múltipla. Referência em PT-BR com notação matricial.