Regressão Linear

Autor

Douglas Braga

Nota

Este capítulo corresponde ao capítulo 3 de James et al. (2023).

📓 Abrir o notebook deste capítulo no Colab ↗ — só o código, pronto para rodar.

De todos os princípios que se pode propor para esse fim, penso que não há nenhum mais geral, mais exato, nem de aplicação mais fácil do que aquele de que nos servimos nas pesquisas anteriores, e que consiste em tornar mínima a soma dos quadrados dos erros.

— Adrien-Marie Legendre

O capítulo anterior fechou perguntando como julgar se uma estimativa de f é boa, sem prescrever nenhuma forma para ela. Este capítulo assume o compromisso paramétrico mais simples que existe — uma reta — e usa o mesmo dado, Advertising, para respondê-lo até o fim: o quanto os duzentos mercados que gastaram em TV, rádio e jornal ajudam a prever quanto venderam. A seção 8.1 ajusta essa reta por mínimos quadrados, à mão e com LinearRegression, e confere que o critério RSS tem um único mínimo; a 8.2 decompõe a variância da resposta em RSE e R² para dizer, com dois números, se aquela reta presta.

As seções seguintes soltam, uma de cada vez, as suposições que uma reta única esconde. A 8.3 junta as três mídias de propaganda numa equação só e usa a correlação entre elas para explicar por que o coeficiente de jornal, positivo quando ajustado sozinho, encolhe a quase zero na companhia de rádio — o mesmo dado muda de resposta conforme o que entra na equação. A 8.4 troca Advertising por Credit para tratar do preditor que não é número: a variável indicadora, a categoria-base e a leitura do intercepto como média de grupo. A 8.5 volta às duas suposições que sustentam tudo até ali — que os preditores agem em paralelo e que cada um age em linha reta — e as testa: um termo de interação entre tv e radio, e entre renda e estudante em Credit; um termo polinomial entre potencia e milhas_por_galao em Auto. Nenhuma das duas extensões deixa de ser regressão linear — a soma continua linear nos coeficientes, só a coluna que cada um multiplica fica mais rica.

As duas últimas seções trocam de pergunta: não mais qual forma ajustar, mas o quanto confiar no ajuste. A 8.6 volta a Auto e a Credit para mostrar que R² sozinho não denuncia um resíduo com padrão, um outlier, uma observação de alavancagem alta ou dois preditores colineares — cada problema pede o gráfico certo para aparecer. A 8.7 fecha o capítulo comparando a reta com o k-NN da seção 7.3 numa simulação onde a verdade é conhecida: a reta vence quando a verdade é dela mesma, perde conforme a curvatura cresce, e volta a vencer assim que sobra um preditor sem relação com a resposta — a maldição da dimensionalidade. Nenhum dos dois métodos vence sempre, e escolher entre eles sem saber a forma verdadeira de f é a pergunta que a validação cruzada, no capítulo 10, ensina a responder.

Ao final deste capítulo, você será capaz de:

Seções

Seção Tópico
8.1 Regressão Linear Simples
8.2 Avaliando o Ajuste: R² e Erro
8.3 Regressão Múltipla
8.4 Preditores Qualitativos
8.5 Interação e Termos Não Lineares
8.6 Outliers, Alavancagem e Colinearidade
8.7 Regressão Linear contra k-Vizinhos

Leituras adicionais

James, Gareth, Daniela Witten, Trevor Hastie, Robert Tibshirani, e Jonathan Taylor. 2023. An Introduction to Statistical Learning with Applications in Python. Springer.