Saltar al contenido
Métodos de Econometría Aplicada con Python

Análisis de regresión lineal simple y múltiple con Python.

Introducción

El análisis de regresión lineal es una técnica estadística fundamental utilizada para modelar y analizar la relación entre una variable dependiente y una o más variables independientes. En Python, puedes realizar tanto regresiones lineales simples (una variable independiente) como múltiples (varias variables independientes) utilizando bibliotecas como Pandas, NumPy y scikit-learn.

Introducción al Análisis de Regresión Lineal

1. Regresión Lineal Simple En la regresión lineal simple, intentamos ajustar una línea recta a un conjunto de puntos de datos. Esto se hace de tal manera que la suma de los cuadrados de las distancias verticales de los puntos a la línea sea mínima.

- Modelo \( y = \beta_0 + \beta_1 x + \epsilon \)

- \( y \): Variable dependiente

- \( x \): Variable independiente

- \( \beta_0 \): Intercepto

- \( \beta_1 \): Pendiente

- \( \epsilon \): Término de error

2. Regresión Lineal Múltiple En la regresión lineal múltiple, extendemos este concepto a más de una variable independiente.

- Modelo  \( y = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \cdots + \beta_n x_n + \epsilon \)

- Cada \( x_i \) representa una variable independiente diferente.

Ejemplo en Python Para ilustrar estos conceptos, veamos cómo podríamos aplicarlos en Python. Usaremos scikit-learn, una biblioteca poderosa para el aprendizaje automático y el análisis estadístico.

Paso 1: Instalación de Bibliotecas Primero, asegúrate de tener las bibliotecas necesarias. Puedes instalarlas con: ```bash pip install numpy pandas scikit-learn matplotlib ```

Paso 2: Preparación de los Datos Supongamos que tenemos un conjunto de datos que incluye ventas y gastos de publicidad (para regresión simple) y también gastos en redes sociales y mercado (para regresión múltiple).


import pandas as pd 
import numpy as np 
from sklearn.model_selection import train_test_split 
from sklearn.linear_model import LinearRegression 
import matplotlib.pyplot as plt 
# Ejemplo de datos 
data = { 'Publicidad': [23, 45, 12, 34, 25], 'RedesSociales': [34, 44, 23, 24, 27], 'Mercado': [12, 34, 24, 21, 27], 'Ventas': [200, 300, 180, 270, 250] } 
df = pd.DataFrame(data)

Paso 3: Regresión Lineal Simple


# Preparando los datos para regresión simple (Publicidad vs. Ventas) 
X_simple = df[['Publicidad']] 
# Variable independiente 
y = df['Ventas'] 
# Variable dependiente 
# Dividir los datos en conjunto de entrenamiento y prueba 
X_train, X_test, y_train, y_test = train_test_split(X_simple, y, test_size=0.2, random_state=0) 
# Crear y entrenar el modelo 
modelo_simple = LinearRegression() 
modelo_simple.fit(X_train, y_train) 
# Realizar predicciones 
predicciones_simple = modelo_simple.predict(X_test) 
# Visualizar 
plt.scatter(X_test, y_test, color='black') 
plt.plot(X_test, predicciones_simple, color='blue', linewidth=3) plt.xlabel('Publicidad') 
plt.ylabel('Ventas') 
plt.show() 

Paso 4: Regresión Lineal Múltiple


# Preparando los datos para regresión múltiple 
X_multiple = df[['Publicidad', 'RedesSociales', 'Mercado']] 
# Varias variables independientes 
# Dividir los datos (usando el mismo y) 
X_train, X_test, y_train, y_test = train_test_split(X_multiple, y, test_size=0.2, random_state=0) 
# Crear y entrenar el modelo 
modelo_multiple = LinearRegression() 
modelo_multiple.fit(X_train, y_train) 
# Realizar predicciones 
predicciones_multiple = modelo_multiple.predict(X_test) 
Resumen

La regresión lineal es una herramienta estadística fundamental que juega un papel crucial en la econometría. La relación entre la regresión lineal y la econometría se puede entender a través de varios aspectos clave:

1. Modelado de Relaciones Económicas

- Fundamento Teórico: La econometría se centra en cuantificar y probar teorías económicas. La regresión lineal permite modelar relaciones entre variables económicas, como la relación entre el PIB y el consumo, o entre los salarios y la educación.

- Herramienta de Análisis: La regresión lineal es una herramienta analítica que los economistas utilizan para investigar y validar teorías económicas, utilizando datos reales.

2. Estimación de Parámetros

- Estimaciones Económicas: En la econometría, se utiliza la regresión lineal para estimar los coeficientes que representan la magnitud y dirección de las relaciones entre variables económicas.

- Inferencia Estadística: La regresión lineal no solo estima valores, sino que también permite realizar pruebas de hipótesis y construir intervalos de confianza, que son esenciales para inferir cómo las relaciones modeladas se aplican a la población general.

3. Análisis Causal

- Determinación de Causalidad: Una de las metas principales de la econometría es establecer relaciones causales, no solo correlaciones. A través de la regresión lineal, los economistas intentan controlar factores de confusión y aislar los efectos de una variable sobre otra.

4. Uso de Datos Observacionales

- Datos del Mundo Real: A diferencia de muchas otras ramas de la estadística, la econometría frecuentemente trabaja con datos observacionales en lugar de datos experimentales. La regresión lineal es particularmente útil para analizar estos tipos de datos, aunque requiere cuidado para evitar sesgos y errores en la interpretación.

5. Modelos Econométricos Avanzados

- Fundamento para Modelos Más Complejos: La regresión lineal es a menudo un punto de partida para técnicas econométricas más avanzadas, como la regresión logística, modelos de series temporales, y modelos de datos de panel. La comprensión de la regresión lineal es esencial para avanzar hacia estos modelos más complejos.

6. Evaluación de Políticas Económicas

- Política Económica y Pronósticos: La regresión lineal se utiliza para evaluar los efectos de las políticas económicas y hacer pronósticos. Por ejemplo, puede ayudar a predecir el impacto de un cambio en las tasas de interés sobre la inflación o el empleo.

Aplicación teórica

Regresión Lineal

La regresión lineal es una técnica estadística utilizada para modelar la relación entre una variable dependiente y una o más variables independientes mediante una ecuación lineal. Este método es fundamental en econometría y análisis de datos, ya que permite predecir valores y entender relaciones entre variables.

Ecuación General de la Regresión Lineal

Para una variable dependiente \( Y \) y una variable independiente \( X \), la ecuación de regresión lineal simple se expresa como:

\[ Y = \beta_0 + \beta_1 X + \varepsilon \]

Donde:

- \( Y \) es la variable dependiente (o respuesta).
- \( X \) es la variable independiente (o predictor).
- \( \beta_0 \) es el intercepto (o constante) de la recta de regresión.
- \( \beta_1 \) es la pendiente de la recta de regresión.
- \( \varepsilon \) es el término de error (o perturbación) que representa la diferencia entre el valor observado y el valor predicho.

Estimación de Parámetros

Los parámetros \( \beta_0 \) y \( \beta_1 \) se estiman mediante el método de mínimos cuadrados ordinarios (MCO). El objetivo es minimizar la suma de los cuadrados de los errores de predicción, que se define como:

\[ \text{Suma de Cuadrados de Errores (SSE)} = \sum_{i=1}^n (Y_i - (\beta_0 + \beta_1 X_i))^2 \]

Donde \( Y_i \) y \( X_i \) son los valores observados de las variables dependiente e independiente, respectivamente.

Los estimadores de \( \beta_0 \) y \( \beta_1 \) se obtienen resolviendo las ecuaciones normales derivadas de la minimización del SSE:

\[ \beta_1 = \frac{n \sum_{i=1}^n X_i Y_i - \sum_{i=1}^n X_i \sum_{i=1}^n Y_i}{n \sum_{i=1}^n X_i^2 - (\sum_{i=1}^n X_i)^2} \]

\[ \beta_0 = \bar{Y} - \beta_1 \bar{X} \]

Donde \( \bar{X} \) y \( \bar{Y} \) son las medias de las variables independientes y dependientes, respectivamente.

Evaluación del Modelo

Una vez que se han estimado los parámetros, es importante evaluar el modelo de regresión para verificar su adecuación. Algunos de los principales criterios incluyen:

-Coeficiente de Determinación (\( R^2 \)): Mide la proporción de la variabilidad en la variable dependiente que se puede explicar por el modelo. Se calcula como:

  \[ R^2 = 1 - \frac{\text{Suma de Cuadrados de Errores (SSE)}}{\text{Suma Total de Cuadrados (SST)}} \]

  Donde SST es la suma de los cuadrados de las diferencias entre los valores observados y la media de \( Y \).

- Pruebas de Significancia: Se realizan pruebas t para determinar si los coeficientes \( \beta_0 \) y \( \beta_1 \) son significativamente diferentes de cero. Esto se hace comparando los valores p obtenidos con un nivel de significancia preestablecido.

La regresión lineal, al proporcionar una forma matemática de modelar y analizar la relación entre variables, es una herramienta poderosa en econometría y estadísticas para hacer inferencias y predicciones basadas en datos.

 

Supuestos del Modelo de Regresión Lineal

En el contexto matemático del modelo de regresión lineal, los supuestos juegan un papel crucial en la validez de los resultados y en la precisión de las estimaciones. A continuación se detallan estos supuestos desde una perspectiva matemática:

Linealidad

El supuesto de linealidad establece que la relación entre la variable dependiente \( Y \) y la variable independiente \( X \) puede ser descrita mediante una función lineal. Matemáticamente, esto se expresa como:

\[ Y = \beta_0 + \beta_1 X + \varepsilon \]

Aquí, \( \beta_0 \) y \( \beta_1 \) son los coeficientes que representan el intercepto y la pendiente de la recta de regresión, respectivamente. El término \( \varepsilon \) es el error aleatorio. La linealidad implica que los cambios en \( Y \) son proporcionales a los cambios en \( X \), y la relación puede ser representada mediante una combinación lineal de los parámetros y las variables.

Independencia de los Errores

El supuesto de independencia de los errores se refiere a la condición matemática de que los términos de error \( \varepsilon_i \) sean independientes entre sí. Esto se puede expresar formalmente como:

\[ \text{Cov}(\varepsilon_i, \varepsilon_j) = 0 \text{ para } i \neq j \]

Es decir, la covarianza entre los errores de diferentes observaciones debe ser cero. La independencia de los errores es fundamental para que las estimaciones de los parámetros sean eficientes y para que las pruebas de hipótesis basadas en el modelo sean válidas.

Homoscedasticidad

El supuesto de homoscedasticidad establece que la varianza de los errores es constante a lo largo de todos los niveles de la variable independiente \( X \). Matemáticamente, esto se puede expresar como:

\[ \text{Var}(\varepsilon_i) = \sigma^2 \text{ para todo } i \]

Donde \( \sigma^2 \) es una constante que representa la varianza de los errores. La homoscedasticidad implica que la dispersión de los errores es la misma sin importar el valor de \( X \). La presencia de heteroscedasticidad (variación no constante de los errores) puede llevar a estimaciones ineficientes de los parámetros y a errores en la inferencia estadística.

Normalidad de los Errores

El supuesto de normalidad de los errores establece que los errores \( \varepsilon_i \) siguen una distribución normal. Matemáticamente, esto se puede expresar como:

\[ \varepsilon_i \sim \mathcal{N}(0, \sigma^2) \]

Esto significa que los errores tienen una distribución normal con media cero y varianza \( \sigma^2 \). La normalidad de los errores es importante para la validez de las pruebas de hipótesis y la construcción de intervalos de confianza para los parámetros del modelo. Aunque la normalidad es menos crítica con grandes muestras debido al Teorema Central del Límite, es esencial para la precisión de las inferencias en muestras pequeñas.

Evaluación Matemática de los Supuestos

Para evaluar estos supuestos matemáticamente, se pueden utilizar las siguientes herramientas:

- Linealidad: Se verifica mediante el análisis gráfico de los residuos contra los valores ajustados o el uso de pruebas de especificación del modelo.
- Independencia de los Errores: Se examina mediante la prueba de autocorrelación de Durbin-Watson y otras pruebas estadísticas para detectar patrones en los errores.
- Homoscedasticidad: Se evalúa mediante gráficos de residuos versus valores ajustados o utilizando pruebas específicas como el test de Breusch-Pagan.
- Normalidad de los Errores: Se verifica mediante gráficos Q-Q y pruebas de normalidad como el test de Shapiro-Wilk.

Cada uno de estos supuestos es fundamental para garantizar la validez matemática y la eficiencia del modelo de regresión lineal, permitiendo así realizar inferencias precisas y confiables basadas en los datos.

 

Definición de Estimadores

En estadística y econometría, un estimador es una función matemática utilizada para inferir o aproximar el valor de un parámetro desconocido de una población, a partir de una muestra de datos observados. Los estimadores son fundamentales para realizar inferencias sobre la población sin necesidad de observar todos los elementos de la misma. Matemáticamente, un estimador se define como una función que asocia cada muestra posible con un valor del parámetro estimado.

Notación y Definición Formal

Supongamos que tenemos una muestra aleatoria \( X_1, X_2, \ldots, X_n \) de una población con una distribución desconocida. Sea \( \theta \) el parámetro de interés que deseamos estimar (por ejemplo, la media \( \mu \) o la varianza \( \sigma^2 \)). Un estimador para \( \theta \), denotado por \( \hat{\theta} \), es una función de la muestra:

\[ \hat{\theta} = g(X_1, X_2, \ldots, X_n) \]

Donde \( g \) es una función conocida que depende de la muestra observada. El valor que toma el estimador para una muestra específica se denomina estimación.

Tipos Comunes de Estimadores

Un tipo común es el estimador de la media muestral (\( \hat{\mu} \)). La media muestral se utiliza como un estimador de la media poblacional \( \mu \) y se define como:

\[
\hat{\mu} = \frac{1}{n} \sum_{i=1}^n X_i
\]

Aquí, \( n \) es el tamaño de la muestra, y \( X_i \) son los valores observados.

Otro tipo común es el estimador de la **varianza muestral** (\( \hat{\sigma}^2 \)). La varianza muestral es un estimador de la varianza poblacional \( \sigma^2 \) y se define como:

\[
\hat{\sigma}^2 = \frac{1}{n-1} \sum_{i=1}^n (X_i - \hat{\mu})^2
\]

Donde \( \hat{\mu} \) es la media muestral. El denominador \( n-1 \) se utiliza en lugar de \( n \) para corregir el sesgo en la estimación de la varianza.

Propiedades de los Estimadores

Para que un estimador sea útil en la práctica, debe cumplir ciertas propiedades matemáticas que aseguran su fiabilidad.

Una de estas propiedades es la insesgadez. Un estimador \( \hat{\theta} \) es insesgado si su valor esperado es igual al verdadero valor del parámetro \( \theta \). Matemáticamente:

\[
\mathbb{E}[\hat{\theta}] = \theta
\]

Esto significa que, en promedio, el estimador no sobreestima ni subestima el parámetro.

Otra propiedad es la consistencia. Un estimador es consistente si, a medida que el tamaño de la muestra \( n \) aumenta, el estimador converge en probabilidad al verdadero valor del parámetro. Formalmente:

\[
\lim_{n \to \infty} \hat{\theta}_n = \theta
\]

La consistencia asegura que con una muestra suficientemente grande, el estimador proporcionará un valor cercano al parámetro verdadero.

La eficiencia es otra propiedad importante. Entre dos estimadores insesgados, el más eficiente es el que tiene menor varianza. Si \( \hat{\theta}_1 \) y \( \hat{\theta}_2 \) son dos estimadores insesgados de \( \theta \), y \( \text{Var}(\hat{\theta}_1) < \text{Var}(\hat{\theta}_2) \), entonces \( \hat{\theta}_1 \) es más eficiente.

Por último, la suficiencia es una propiedad que indica que un estimador es suficiente si utiliza toda la información contenida en la muestra sobre el parámetro. Esto se formaliza mediante el teorema de factorización de Neyman-Fisher, que indica que un estimador es suficiente si la función de verosimilitud se puede factorizar en un producto de dos funciones, una de las cuales depende solo del estimador.

Ejemplo Matemático de Estimación

Consideremos una muestra \( X_1, X_2, \ldots, X_n \) extraída de una distribución normal \( \mathcal{N}(\mu, \sigma^2) \). Queremos estimar \( \mu \). El estimador insesgado y consistente para \( \mu \) es la media muestral \( \hat{\mu} \), dado por:

\[
\hat{\mu} = \frac{1}{n} \sum_{i=1}^n X_i
\]

Este estimador cumple con las propiedades de insesgadez, consistencia y eficiencia bajo ciertas condiciones (como en el caso de la varianza conocida). Además, es un estimador suficiente para \( \mu \) dado que la media muestral contiene toda la información necesaria sobre \( \mu \) en la muestra.

Conclusión

En resumen, los estimadores son herramientas matemáticas cruciales en estadística y econometría, ya que nos permiten inferir parámetros poblacionales a partir de datos muestrales. Las propiedades matemáticas como la insesgadez, consistencia, eficiencia y suficiencia son esenciales para evaluar la calidad de un estimador y garantizar que las inferencias realizadas sean precisas y confiables.

 

 

Aplicación práctica

Análisis de Regresión Lineal Simple Primero, importamos las bibliotecas necesarias(seaborn, sklearn, pandas, numpy, matplotlib.pyplot) y luego leemos nuestro archivo de datos(csv) y lo almacenamos en un dataframe de pandas.


import seaborn as sns 
import pandas as pd 
import numpy as np 
from sklearn.linear_model import LinearRegression 
import matplotlib.pyplot as plt 
data = pd.read_csv('datos.csv') 

A continuación, seleccionamos nuestras variables X e Y, que son la variable independiente y la variable dependiente respectivamente. Calculamos la correlación entre las dos variables usando el método .corr() de pandas y graficamos la relación entre las dos variables usando un diagrama de dispersión de seaborn.


X = data['Variable independiente'].values.reshape(-1,1) 
Y = data['Variable dependiente'].values.reshape(-1,1) 
correlation = data['Variable independiente'].corr(data['Variable dependiente']) 
sns.scatterplot(x="Variable independiente", y="Variable dependiente", data=data)

Luego ajustamos un Modelo de Regresion Lineal al conjunto de datos, utilizando la libreria sklearn.


lr = LinearRegression() 
lr.fit(X,Y) 

Finalmente, graficamos la recta de regresión lineal sobre nuestros datos de dispersión.


sns.regplot(x="Variable independiente", y="Variable dependiente", data=data)

Análisis de Regresión Lineal Múltiple En el análisis de regresión lineal múltiple, incluimos más de una variable independiente para predecir la variable dependiente. Primero, importamos las bibliotecas necesarias(seaborn, sklearn, pandas, numpy, matplotlib.pyplot) y luego leemos nuestro archivo de datos(csv) y lo almacenamos en un dataframe de pandas.


import seaborn as sns 
import pandas as pd 
import numpy as np 
from sklearn.linear_model import LinearRegression 
import matplotlib.pyplot as plt 
data = pd.read_csv('datos.csv') 

A continuación, seleccionamos nuestras variables X (variables independientes) y Y (variable dependiente) y calculamos la matriz de correlación utilizando la función .corr() de pandas.


X = data[['Variable independiente 1', 'Variable independiente 2']] 
Y = data['Variable dependiente'] 
correlation = X.corr()

Luego ajustamos un modelo de regresión lineal múltiple al conjunto de datos.


lr = LinearRegression() 
lr.fit(X,Y) 

Finalmente, podemos predecir valores para la variable dependiente basándonos en valores específicos de las variables independientes.


predictions = lr.predict(X)