Regressão Linear
Este capítulo corresponde ao capítulo 3 de James et al. (2023).
📓 Abrir o notebook deste capítulo no Colab ↗ — só o código, pronto para rodar.
De todos os princípios que se pode propor para esse fim, penso que não há nenhum mais geral, mais exato, nem de aplicação mais fácil do que aquele de que nos servimos nas pesquisas anteriores, e que consiste em tornar mínima a soma dos quadrados dos erros.
— Adrien-Marie Legendre
O capítulo anterior fechou perguntando como julgar se uma estimativa de f é boa, sem prescrever nenhuma forma para ela. Este capítulo assume o compromisso paramétrico mais simples que existe — uma reta — e usa o mesmo dado, Advertising, para respondê-lo até o fim: o quanto os duzentos mercados que gastaram em TV, rádio e jornal ajudam a prever quanto venderam. A seção 8.1 ajusta essa reta por mínimos quadrados, à mão e com LinearRegression, e confere que o critério RSS tem um único mínimo; a 8.2 decompõe a variância da resposta em RSE e R² para dizer, com dois números, se aquela reta presta.
As seções seguintes soltam, uma de cada vez, as suposições que uma reta única esconde. A 8.3 junta as três mídias de propaganda numa equação só e usa a correlação entre elas para explicar por que o coeficiente de jornal, positivo quando ajustado sozinho, encolhe a quase zero na companhia de rádio — o mesmo dado muda de resposta conforme o que entra na equação. A 8.4 troca Advertising por Credit para tratar do preditor que não é número: a variável indicadora, a categoria-base e a leitura do intercepto como média de grupo. A 8.5 volta às duas suposições que sustentam tudo até ali — que os preditores agem em paralelo e que cada um age em linha reta — e as testa: um termo de interação entre tv e radio, e entre renda e estudante em Credit; um termo polinomial entre potencia e milhas_por_galao em Auto. Nenhuma das duas extensões deixa de ser regressão linear — a soma continua linear nos coeficientes, só a coluna que cada um multiplica fica mais rica.
As duas últimas seções trocam de pergunta: não mais qual forma ajustar, mas o quanto confiar no ajuste. A 8.6 volta a Auto e a Credit para mostrar que R² sozinho não denuncia um resíduo com padrão, um outlier, uma observação de alavancagem alta ou dois preditores colineares — cada problema pede o gráfico certo para aparecer. A 8.7 fecha o capítulo comparando a reta com o k-NN da seção 7.3 numa simulação onde a verdade é conhecida: a reta vence quando a verdade é dela mesma, perde conforme a curvatura cresce, e volta a vencer assim que sobra um preditor sem relação com a resposta — a maldição da dimensionalidade. Nenhum dos dois métodos vence sempre, e escolher entre eles sem saber a forma verdadeira de f é a pergunta que a validação cruzada, no capítulo 10, ensina a responder.
Ao final deste capítulo, você será capaz de:
- Ajustar uma reta por mínimos quadrados — à mão, a partir de duas médias, e com
LinearRegression— e verificar, pelas curvas de nível de RSS, que o ajuste tem um único mínimo - Avaliar um ajuste de mínimos quadrados pelo RSE e pelo R², decompondo a variância da resposta na parcela que o modelo explica e na que sobra como resíduo
- Ajustar um modelo com vários preditores ao mesmo tempo e explicar, pela correlação entre eles, por que o coeficiente de um muda de sinal ou de tamanho quando os demais entram na equação
- Codificar um preditor qualitativo em variáveis indicadoras, escolher a categoria-base e ler intercepto e coeficientes como médias de grupo
- Relaxar a suposição de aditividade com um termo de interação e a de linearidade com um termo polinomial, reconhecendo as duas extensões como regressão linear nos coeficientes
- Diagnosticar outlier, alavancagem e colinearidade com o instrumento apropriado a cada um — resíduo contra previsto, resíduo padronizado contra alavancagem, e o VIF, que é um número e não um gráfico — em vez de confiar só no R²
- Comparar o erro de teste da regressão linear com o do k-NN e reconhecer que a vantagem de um sobre o outro depende da forma verdadeira de f e do número de preditores
Seções
| Seção | Tópico |
|---|---|
| 8.1 | Regressão Linear Simples |
| 8.2 | Avaliando o Ajuste: R² e Erro |
| 8.3 | Regressão Múltipla |
| 8.4 | Preditores Qualitativos |
| 8.5 | Interação e Termos Não Lineares |
| 8.6 | Outliers, Alavancagem e Colinearidade |
| 8.7 | Regressão Linear contra k-Vizinhos |
Leituras adicionais
- O site oficial de James et al. (2023), com o PDF gratuito do livro, os dados usados neste capítulo e os laboratórios em Python.
LinearRegression, na documentação do scikit-learn, a referência oficial do estimador usado do início ao fim deste capítulo.PolynomialFeatures, na documentação do scikit-learn, a transformação que a seção 8.5 usa para ajustar um termo não linear sem sair da regressão linear.