Regresión lineal
Nube de puntos, recta de regresión y coeficiente de correlación. Toca el gráfico para añadir puntos.
Toca el gráfico para añadir un punto, o toca un punto para quitarlo. ○ es el centro de gravedad (x̄, ȳ): las dos rectas pasan por él.
Un punto por línea o separados por punto y coma; x e y separadas por un espacio. Decimales con coma o punto.
y = 2,732 + 0,726·x
x = −3,457 + 1,326·y
Correlación positiva (si x crece, y crece) muy fuerte: los puntos están casi en línea recta y las predicciones son fiables.
ŷ = 2,732 + 0,726 · 9 = 9,268
x está fuera del rango de los datos (extrapolación): nada garantiza que la tendencia siga igual, tómalo con cuidado.
- 1
Medias
x̄ = Σx / n = 36 / 8 = 4,5; ȳ = Σy / n = 48 / 8 = 6
- 2
Varianzas
σₓ² = Σx²/n − x̄² = 204/8 − 4,5² = 5,25; σᵧ² = 311/8 − 6² = 2,875
- 3
Covarianza
σₓᵧ = Σxy/n − x̄·ȳ = 246,5/8 − 4,5·6 = 3,8125
- 4
Coeficiente de correlación
r = σₓᵧ / (σₓ·σᵧ) = 3,8125 / (2,2913·1,6956) = 0,9813
- 5
Recta de y sobre x
y − ȳ = (σₓᵧ/σₓ²)(x − x̄) → y − 6 = 0,7262(x − 4,5) → y = 2,732 + 0,726x
- 6
Recta de x sobre y
x − x̄ = (σₓᵧ/σᵧ²)(y − ȳ) → x = −3,457 + 1,326y
| xᵢ | yᵢ | xᵢ² | yᵢ² | xᵢ·yᵢ | ŷᵢ | residuo yᵢ − ŷᵢ |
|---|---|---|---|---|---|---|
| 1 | 3,5 | 1 | 12,25 | 3,5 | 3,458 | 0,042 |
| 2 | 4 | 4 | 16 | 8 | 4,185 | −0,185 |
| 3 | 5,5 | 9 | 30,25 | 16,5 | 4,911 | 0,589 |
| 4 | 5 | 16 | 25 | 20 | 5,637 | −0,637 |
| 5 | 6,5 | 25 | 42,25 | 32,5 | 6,363 | 0,137 |
| 6 | 7 | 36 | 49 | 42 | 7,089 | −0,089 |
| 7 | 8 | 49 | 64 | 56 | 7,815 | 0,185 |
| 8 | 8,5 | 64 | 72,25 | 68 | 8,542 | −0,042 |
| Σ = 36 | Σ = 48 | Σ = 204 | Σ = 311 | Σ = 246,5 | Σ² = 0,851 |
Cuando se miden dos variables en los mismos individuos (horas de estudio y nota, temperatura y ventas…), la nube de puntos muestra si hay relación entre ellas. La covarianza, σₓᵧ = Σxy/n − x̄·ȳ, indica si crecen a la vez (positiva) o una crece cuando la otra decrece (negativa).
El coeficiente de correlación de Pearson, r = σₓᵧ / (σₓ·σᵧ), está entre −1 y 1 y mide lo cerca que están los puntos de una recta. La recta de regresión de y sobre x, y − ȳ = (σₓᵧ/σₓ²)(x − x̄), es la que minimiza la suma de los cuadrados de los residuos y sirve para predecir y a partir de x.
Escribe los puntos o tócalos en el gráfico. Verás las dos rectas de regresión, que se cortan en (x̄, ȳ), la tabla con todas las sumas y cuánto te puedes fiar de una predicción.
Con los datos (1, 2), (2, 3), (3, 5), (4, 6), calcula r y la recta de regresión de y sobre x.
- x̄ = 10/4 = 2,5 e ȳ = 16/4 = 4.
- σₓ² = 30/4 − 2,5² = 1,25 y σᵧ² = 74/4 − 4² = 2,5.
- σₓᵧ = 47/4 − 2,5 · 4 = 1,75.
- r = 1,75 / (√1,25 · √2,5) ≈ 0,99.
- b = 1,75 / 1,25 = 1,4, así que y − 4 = 1,4(x − 2,5).
r ≈ 0,99 e y = 0,5 + 1,4x
Preguntas frecuentes
¿Qué significa que r sea 0?
Que no hay relación lineal entre las variables. Puede haber otra relación (por ejemplo, una parábola), pero una recta no la describe.
¿Por qué hay dos rectas de regresión?
La de y sobre x minimiza los errores verticales y sirve para predecir y; la de x sobre y minimiza los horizontales y sirve para predecir x. Solo coinciden si |r| = 1. Las dos pasan por (x̄, ȳ).
¿Se puede predecir fuera del rango de los datos?
Se puede calcular, pero es extrapolar: nada garantiza que la tendencia siga igual fuera de los datos observados. Las predicciones son más fiables dentro del rango y con |r| cercano a 1.
¿Correlación implica causalidad?
No. Dos variables pueden estar muy correlacionadas porque ambas dependen de una tercera (las ventas de helados y los ahogamientos suben en verano) o por casualidad.