Saltar al contenido
Aprendizaje Automático Supervisado

Modelos lineales de regresión

Introducción

Los modelos lineales de regresión son una técnica de aprendizaje automático supervisado utilizada para predecir valores continuos. Esta técnica se basa en una función lineal que relaciona una variable de entrada con una variable de salida. En otras palabras, se busca encontrar una línea o plano que mejor se ajuste a los datos de entrenamiento, de forma que se pueda predecir el valor de la variable de salida para un conjunto de entradas desconocidas.

Existen varios tipos de modelos lineales de regresión, siendo los más comunes la regresión lineal simple y la regresión lineal múltiple. En la regresión lineal simple se utiliza una sola variable de entrada para predecir una variable de salida. Por otro lado, en la regresión lineal múltiple se utilizan varias variables de entrada para predecir una variable de salida.

Los modelos lineales de regresión se utilizan en diversos campos, como la economía, la física, la biología, la ingeniería y la ciencia de datos. Su simplicidad y facilidad de interpretación los convierten en una herramienta popular en el análisis de datos y en la toma de decisiones.

Resumen

Los modelos lineales de regresión son una herramienta de aprendizaje supervisado que se utilizan para predecir valores numéricos continuos en función de una o más variables predictoras. La idea principal detrás de estos modelos es encontrar la relación lineal entre la(s) variable(s) predictoras y la variable de respuesta.

El modelo más simple es la regresión lineal simple, que se define como:

𝑌=𝑎+𝑏𝑋Y=a+bX

Donde:

  • 𝑌Y es la variable de respuesta o variable dependiente.
  • 𝑋X es la variable predictora o variable independiente.
  • 𝑎a es el término de intercepción o punto donde la recta cruza el eje Y.
  • 𝑏b es la pendiente de la recta.

El objetivo de la regresión lineal es encontrar los valores de 𝑎a y 𝑏b que minimizan la suma de los errores cuadrados de la predicción. Los errores se calculan como la diferencia entre los valores de respuesta reales y los valores predichos por el modelo.

También existen los modelos de regresión lineal múltiple, donde hay más de una variable predictora. El modelo se define como:

𝑌=𝑎+𝑏1𝑋1+𝑏2𝑋2+...+𝑏𝑛𝑋𝑛Y=a+b1​X1​+b2​X2​+...+bn​Xn​

Donde:

  • 𝑌Y es la variable de respuesta o variable dependiente.
  • 𝑋1,𝑋2,...,𝑋𝑛X1​,X2​,...,Xn​ son las variables predictoras o variables independientes.
  • 𝑎a es el término de intercepción o punto donde la recta cruza el eje Y.
  • 𝑏1,𝑏2,...,𝑏𝑛b1​,b2​,...,bn​ son las pendientes de cada una de las variables predictoras.

Al igual que en la regresión lineal simple, el objetivo es encontrar los valores de 𝑎,𝑏1,𝑏2,...,𝑏𝑛a,b1​,b2​,...,bn​ que minimizan la suma de los cuadrados de los errores de predicción.

Estos modelos de regresión lineal son muy útiles en una amplia variedad de aplicaciones, desde la predicción de precios de bienes inmuebles hasta la estimación de la producción de cosechas.

Aplicación teórica

Un ejemplo práctico de modelos lineales de regresión es el siguiente: Supongamos que eres el gerente de una tienda de ropa y deseas predecir cuántas ventas realizarás en el siguiente mes según la cantidad de publicidad que realices. Has recopilado datos históricos de los últimos 12 meses y has registrado la cantidad de ventas en dólares y la cantidad de dinero que gastaste en publicidad en cada uno de esos meses.

A partir de estos datos, puedes crear un modelo de regresión lineal para predecir las ventas en función del gasto en publicidad. El modelo lineal de regresión puede ser expresado como:

𝑉𝑒𝑛𝑡𝑎𝑠=𝑎+𝑏×𝐺𝑎𝑠𝑡𝑜  𝑒𝑛  𝑝𝑢𝑏𝑙𝑖𝑐𝑖𝑑𝑎𝑑Ventas=a+b×Gastoenpublicidad

Donde:

  • "Ventas" es la variable dependiente que deseas predecir.
  • "Gasto en publicidad" es la variable independiente que utilizas para hacer la predicción.
  • "a" es la intersección en el eje y.
  • "b" es la pendiente.

Para crear el modelo, debes ajustar los parámetros "a" y "b" para minimizar el error cuadrático medio entre los valores predichos y los reales. Una vez que hayas encontrado los valores óptimos de "a" y "b", puedes utilizar el modelo para hacer predicciones sobre las ventas futuras en función del gasto en publicidad que realices.

Aplicación práctica

Un ejemplo práctico en Python de cómo implementar un modelo lineal de regresión usando scikit-learn.

Primero, importamos los módulos necesarios:


import pandas as pd
from sklearn.linear_model import LinearRegression
from sklearn.model_selection import train_test_split
    

Luego, cargamos un conjunto de datos y separamos las variables predictoras (X) de la variable objetivo (y):


# Leer el archivo CSV
data = pd.read_csv('data.csv')

# Separar las variables predictoras (X) de la variable objetivo (y)
X = data.drop(columns=['Target'])
y = data['Target']
    

A continuación, dividimos los datos en conjuntos de entrenamiento y prueba:


# Dividir los datos en conjuntos de entrenamiento y prueba
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=0)
    

Instanciamos un objeto LinearRegression y lo ajustamos a los datos de entrenamiento:


# Instanciar un objeto LinearRegression y ajustarlo a los datos de entrenamiento
regressor = LinearRegression()
regressor.fit(X_train, y_train)
    

Finalmente, podemos usar el modelo entrenado para hacer predicciones sobre los datos de prueba:


# Hacer predicciones sobre los datos de prueba
y_pred = regressor.predict(X_test)
    

# Evaluar el modelo

# Aquí puedes agregar código para evaluar el rendimiento del modelo, por ejemplo, calculando el error cuadrático medio o el coeficiente de determinación.