O quanto o modelo explica da variação de y — e por que adicionar qualquer variável, útil ou não, sempre aumenta o R². É exatamente para corrigir essa ilusão que existe o R² ajustado.
Depois de estimar y = β₀ + β₁x₁ + ... + βₖxₖ + ε por OLS, uma pergunta natural é: o quanto desse modelo realmente ajuda a explicar y? O R² responde isso decompondo a variação total de y entre a parte que o modelo capta e a parte que sobra como erro.
SST = Σ(yᵢ − ȳ)² — o quanto y varia em torno da própria média, sem olhar para nenhum modelo.
SSR = Σ(ŷᵢ − ȳ)² é a parte que o modelo explica; SSE = Σ(yᵢ − ŷᵢ)² é o que sobra como erro. Sempre SST = SSR + SSE.
R² = SSR/SST varia de 0 (modelo não explica nada) a 1 (modelo explica toda a variação de y).
Ao comparar modelos com números diferentes de regressores, o R² ajustado penaliza a complexidade extra.
O OLS escolhe os coeficientes para minimizar SSE. Adicionar uma variável nunca pode piorar esse mínimo — no pior caso, seu coeficiente vai para ~0 e SSE não muda. Ou seja: R² nunca diminui ao adicionar regressores, mesmo quando eles não têm nenhuma relação real com y. O R² ajustado contrapõe isso com uma penalidade por cada regressor adicional.
Para o ponto destacado, a linha cinza mostra o desvio total (yᵢ − ȳ), a verde mostra o desvio explicado (ŷᵢ − ȳ) e a vermelha mostra o resíduo (yᵢ − ŷᵢ). A soma dos quadrados de cada tipo de desvio, somada sobre todos os pontos, dá SST, SSR e SSE.
Aumente o ruído (σ) e veja o segmento vermelho (resíduo) crescer em relação ao verde (explicado) — o R² cai. Aumente β₁ e veja o oposto: a reta capta mais da variação, o segmento verde domina, e o R² sobe.
A amostra tem uma única variável com efeito real sobre y (x₁). A cada clique, adicionamos uma nova variável puramente aleatória — sem nenhuma relação com y — e reestimamos o modelo com todas as variáveis acumuladas até agora.
Clique em "Adicionar variável irrelevante" várias vezes. O R² (magenta) só sobe ou fica estável — nunca cai. O R² ajustado (azul) tende a cair conforme cada nova variável não compensa a penalidade pela complexidade extra.
Se o R² ajustado cai ao adicionar uma variável, isso é evidência de que ela não contribui o suficiente para justificar sua presença no modelo — mesmo que o R² "bruto" tenha subido.
Clique em cada cenário para ver se a afirmação está correta ou não.