Simulab
← Herramientas
Matemáticas · Estadística

Regresión lineal

Nube de puntos, recta de regresión y coeficiente de correlación. Toca el gráfico para añadir puntos.

Nube de puntosy sobre x
024683456789xy

Toca el gráfico para añadir un punto, o toca un punto para quitarlo. ○ es el centro de gravedad (x̄, ȳ): las dos rectas pasan por él.

Datos (x y)

Un punto por línea o separados por punto y coma; x e y separadas por un espacio. Decimales con coma o punto.

Rectas de regresión

y = 2,732 + 0,726·x

x = −3,457 + 1,326·y

r · correlación0,9813
r² · determinación96,3 %
σₓᵧ · covarianza3,8125
Pendiente b0,7262
x̄ · σₓ4,5 · 2,291
ȳ · σᵧ6 · 1,696

Correlación positiva (si x crece, y crece) muy fuerte: los puntos están casi en línea recta y las predicciones son fiables.

Predicción

ŷ = 2,732 + 0,726 · 9 = 9,268

x está fuera del rango de los datos (extrapolación): nada garantiza que la tendencia siga igual, tómalo con cuidado.

Paso a paso
  1. 1

    Medias

    x̄ = Σx / n = 36 / 8 = 4,5; ȳ = Σy / n = 48 / 8 = 6

  2. 2

    Varianzas

    σₓ² = Σx²/n − x̄² = 204/8 − 4,5² = 5,25; σᵧ² = 311/8 − 6² = 2,875

  3. 3

    Covarianza

    σₓᵧ = Σxy/n − x̄·ȳ = 246,5/8 − 4,5·6 = 3,8125

  4. 4

    Coeficiente de correlación

    r = σₓᵧ / (σₓ·σᵧ) = 3,8125 / (2,2913·1,6956) = 0,9813

  5. 5

    Recta de y sobre x

    y − ȳ = (σₓᵧ/σₓ²)(x − x̄) → y − 6 = 0,7262(x − 4,5) → y = 2,732 + 0,726x

  6. 6

    Recta de x sobre y

    x − x̄ = (σₓᵧ/σᵧ²)(y − ȳ) → x = −3,457 + 1,326y

Tabla de cálculo
xᵢyᵢxᵢ²yᵢ²xᵢ·yᵢŷᵢresiduo yᵢ − ŷᵢ
13,5112,253,53,4580,042
2441684,185−0,185
35,5930,2516,54,9110,589
451625205,637−0,637
56,52542,2532,56,3630,137
673649427,089−0,089
784964567,8150,185
88,56472,25688,542−0,042
Σ = 36Σ = 48Σ = 204Σ = 311Σ = 246,5Σ² = 0,851
Qué es y cómo se usa

Cuando se miden dos variables en los mismos individuos (horas de estudio y nota, temperatura y ventas…), la nube de puntos muestra si hay relación entre ellas. La covarianza, σₓᵧ = Σxy/n − x̄·ȳ, indica si crecen a la vez (positiva) o una crece cuando la otra decrece (negativa).

El coeficiente de correlación de Pearson, r = σₓᵧ / (σₓ·σᵧ), está entre −1 y 1 y mide lo cerca que están los puntos de una recta. La recta de regresión de y sobre x, y − ȳ = (σₓᵧ/σₓ²)(x − x̄), es la que minimiza la suma de los cuadrados de los residuos y sirve para predecir y a partir de x.

Escribe los puntos o tócalos en el gráfico. Verás las dos rectas de regresión, que se cortan en (x̄, ȳ), la tabla con todas las sumas y cuánto te puedes fiar de una predicción.

Ejemplo resuelto

Con los datos (1, 2), (2, 3), (3, 5), (4, 6), calcula r y la recta de regresión de y sobre x.

  1. x̄ = 10/4 = 2,5 e ȳ = 16/4 = 4.
  2. σₓ² = 30/4 − 2,5² = 1,25 y σᵧ² = 74/4 − 4² = 2,5.
  3. σₓᵧ = 47/4 − 2,5 · 4 = 1,75.
  4. r = 1,75 / (√1,25 · √2,5) ≈ 0,99.
  5. b = 1,75 / 1,25 = 1,4, así que y − 4 = 1,4(x − 2,5).

r ≈ 0,99 e y = 0,5 + 1,4x

Preguntas frecuentes

¿Qué significa que r sea 0?

Que no hay relación lineal entre las variables. Puede haber otra relación (por ejemplo, una parábola), pero una recta no la describe.

¿Por qué hay dos rectas de regresión?

La de y sobre x minimiza los errores verticales y sirve para predecir y; la de x sobre y minimiza los horizontales y sirve para predecir x. Solo coinciden si |r| = 1. Las dos pasan por (x̄, ȳ).

¿Se puede predecir fuera del rango de los datos?

Se puede calcular, pero es extrapolar: nada garantiza que la tendencia siga igual fuera de los datos observados. Las predicciones son más fiables dentro del rango y con |r| cercano a 1.

¿Correlación implica causalidad?

No. Dos variables pueden estar muy correlacionadas porque ambas dependen de una tercera (las ventas de helados y los ahogamientos suben en verano) o por casualidad.