Saltar al contenido
Métodos de Econometría Aplicada con Python

Estadística descriptiva y exploración de datos en Python.

Introducción

Estadística Descriptiva

La Estadística Descriptiva se centra en describir y resumir conjuntos de datos. Se utiliza para presentar las características básicas de los datos de manera sencilla y comprensible. Esto incluye medidas como la media, mediana, moda, rango, varianza, desviación estándar, y más.

Exploración de Datos

La exploración de datos es el proceso de analizar conjuntos de datos para resumir sus características principales, a menudo con métodos visuales. Una exploración de datos cuidadosa puede revelar patrones, anomalías, tendencias y relaciones entre los datos.

Herramientas en Python para Estadística Descriptiva y Exploración de Datos

Python, siendo uno de los lenguajes de programación más populares para el análisis de datos, ofrece varias librerías para la estadística descriptiva y exploración de datos:

1. Pandas: Una biblioteca que proporciona estructuras de datos fáciles de usar y herramientas de análisis de datos. Ideal para manipulación y limpieza de datos.

2. NumPy: Útil para operaciones matemáticas y lógicas en arrays.

3. Matplotlib: Una biblioteca para la creación de gráficos estáticos, animados e interactivos en Python.

4. Seaborn: Basada en Matplotlib, Seaborn facilita la creación de gráficos estadísticos informativos.

Ejemplo Práctico en Python Imaginemos que queremos analizar un conjunto de datos de ventas de una tienda. Podemos utilizar Python de la siguiente manera:

1. Carga de Datos: Usar Pandas para cargar los datos desde un archivo CSV.


python import pandas as pd 
data = pd.read_csv('ventas.csv')

2. Visualización General: Obtener una vista rápida de los datos.


data.head()

3. Estadísticas Descriptivas Básicas:


data.describe()

4. Visualización de Datos: - Histograma de ventas: Para entender la distribución.


import matplotlib.pyplot as plt 
data['ventas'].hist(bins=50) 
plt.show()

- Gráfico de caja (Boxplot): Para ver la dispersión y detectar valores atípicos.


data.boxplot(column=['ventas'])
plt.show()

5. Correlación entre Variables: Explorar si hay alguna relación entre diferentes variables, como ventas y gastos en publicidad.


data.corr()
Resumen

La estadística descriptiva es una parte crucial de la estadística que se ocupa de describir, mostrar y resumir datos de una manera informativa. Su objetivo principal es proporcionar una visión clara de las características principales de un conjunto de datos, sin hacer inferencias o predicciones más allá de los datos en sí. Esto incluye la utilización de gráficos, tablas y medidas numéricas. Aquí te explico sus componentes clave:

1. Medidas de Tendencia Central

Estas medidas ofrecen una idea de los valores "típicos" en un conjunto de datos.

- Media (Promedio): Suma de todos los valores dividida por el número total de valores. Sensible a valores extremos (outliers).

- Mediana: El valor medio que divide el conjunto de datos en dos mitades iguales. Menos sensible a outliers que la media.

- Moda: El valor que aparece con mayor frecuencia en el conjunto de datos. Puede haber más de una moda o ninguna.

2. Medidas de Dispersión

Estas medidas indican cuán "esparcidos" están los datos alrededor de una medida de tendencia central.

- Rango: Diferencia entre el valor más alto y el más bajo en el conjunto de datos.

- Varianza: Promedio de las diferencias al cuadrado entre cada valor y la media. Muestra cuán lejos tienden a estar los valores de la media.

- Desviación Estándar: Raíz cuadrada de la varianza. Proporciona una medida de dispersión en las mismas unidades que los datos.

- Coeficiente de Variación: Proporciona una medida estandarizada de la dispersión relativa de los datos, útil para comparar la variabilidad entre diferentes conjuntos de datos.

3. Medidas de Forma

Estas medidas describen la forma de la distribución de los datos.

- Asimetría (Skewness): Mide la falta de simetría en la distribución de datos. Una distribución puede ser simétrica, asimétrica a la derecha (cola más larga hacia la derecha) o asimétrica a la izquierda (cola más larga hacia la izquierda).

- Curtosis: Mide el grado de "picudez" de una distribución. Una alta curtosis indica una distribución con colas pesadas y un pico pronunciado, mientras que una baja curtosis indica una distribución más plana.

4. Gráficos y Tablas

- Histogramas: Muestran la distribución de un conjunto de datos numéricos.

- Diagramas de Caja (Boxplots): Resumen la distribución de los datos indicando la mediana, cuartiles y valores extremos.

- Diagramas de Barras y Tortas (Pie Charts): Útiles para visualizar datos categóricos.

Aplicación

La estadística descriptiva se aplica en casi todas las disciplinas, desde las ciencias sociales hasta la biología y la física. Es especialmente importante en la investigación inicial de datos, ya que proporciona una primera visión de lo que los datos representan y cómo están distribuidos, antes de realizar análisis estadísticos más complejos.

Aplicación teórica

Medidas de Tendencia Central en Estadística Descriptiva y su Aplicación en Econometría

Las medidas de tendencia central son herramientas fundamentales en estadística descriptiva que permiten resumir y describir un conjunto de datos con un solo valor representativo. En el contexto de la econometría, estas medidas son cruciales para el análisis y la interpretación de datos económicos. A continuación, se presentan las principales medidas de tendencia central y sus aplicaciones en econometría.

Media Aritmética

La media aritmética es el promedio de un conjunto de datos. Se calcula sumando todos los valores y dividiéndolos por el número de observaciones. Matemáticamente, para un conjunto de datos \( X = \{ x_1, x_2, \ldots, x_n \} \), la media aritmética \(\bar{x}\) se define como:

\[
\bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i
\]

En econometría, la media aritmética se utiliza para calcular el promedio de variables económicas como el ingreso, el consumo o la producción. Proporciona una medida de la tendencia central de una serie temporal o de corte transversal, ayudando a identificar patrones generales en los datos.

Mediana

La mediana es el valor que divide el conjunto de datos en dos partes iguales y es menos sensible a los valores extremos que la media aritmética. Para un conjunto de datos ordenado \( X = \{ x_1, x_2, \ldots, x_n \} \):

- Si \( n \) es impar, la mediana es el valor en la posición \( \frac{n+1}{2} \).
- Si \( n \) es par, la mediana es el promedio de los dos valores centrales.

En econometría, la mediana se usa para analizar la distribución de ingresos, proporcionando una medida más robusta en presencia de valores extremos, como altos ingresos muy distantes del resto de la distribución.

Moda

La moda es el valor que aparece con mayor frecuencia en un conjunto de datos. Para un conjunto de datos \( X \), la moda es el valor \( x_i \) que maximiza la función de frecuencia.

En econometría, la moda es útil para identificar el valor más común de una variable categórica, como el tipo de contrato de trabajo o el sector económico predominante en una muestra.

Media Ponderada

La media ponderada es una extensión de la media aritmética donde cada valor tiene un peso asociado que refleja su importancia relativa. Para un conjunto de datos \( X = \{ x_1, x_2, \ldots, x_n \} \) con pesos \( W = \{ w_1, w_2, \ldots, w_n \} \), la media ponderada \(\bar{x}_w\) se define como:

\[
\bar{x}_w = \frac{\sum_{i=1}^{n} w_i x_i}{\sum_{i=1}^{n} w_i}
\]

En econometría, la media ponderada se utiliza cuando los datos tienen diferentes niveles de importancia, como en el cálculo de índices económicos donde ciertos sectores pueden tener mayor relevancia.

Media Geométrica

La media geométrica es útil para conjuntos de datos positivos y es especialmente relevante en el cálculo de tasas de crecimiento. Para un conjunto de datos \( X = \{ x_1, x_2, \ldots, x_n \} \), la media geométrica \(\bar{x}_g\) se define como:

\[
\bar{x}_g = \left( \prod_{i=1}^{n} x_i \right)^{\frac{1}{n}}
\]

En econometría, la media geométrica se aplica para calcular el crecimiento promedio de variables económicas como el PIB o los ingresos, proporcionando una medida adecuada cuando se trata de tasas de crecimiento.

Media Armónica

La media armónica es útil para calcular la media de tasas o ratios. Para un conjunto de datos \( X = \{ x_1, x_2, \ldots, x_n \} \), la media armónica \(\bar{x}_h\) se define como:

\[
\bar{x}_h = \frac{n}{\sum_{i=1}^{n} \frac{1}{x_i}}
\]

En econometría, la media armónica se utiliza en el análisis de tasas, como la velocidad media en un recorrido o el promedio de rendimientos financieros.

Media Cuadrática

La media cuadrática o raíz cuadrática media se utiliza para datos que incluyen valores negativos y positivos. Se define como:

\[
\bar{x}_q = \sqrt{\frac{1}{n} \sum_{i=1}^{n} x_i^2}
\]

Aunque menos común en econometría, puede aplicarse en el análisis de variabilidad y dispersiones en datos económicos.

Ejemplo Matemático Adicional

Supongamos que tenemos los ingresos mensuales de una muestra de hogares: \( \{2, 3, 5, 7, 8, 10, 10, 12, 15\} \). Podemos calcular la media ponderada considerando diferentes pesos (por ejemplo, la importancia de cada hogar en la muestra).

Ingresos: \( X = \{2, 3, 5, 7, 8, 10, 10, 12, 15\} \) y pesos: \( W = \{1, 2, 1, 1, 1, 1, 2, 1, 1\} \).

Media Ponderada:

\[
\bar{x}_w = \frac{1 \cdot 2 + 2 \cdot 3 + 1 \cdot 5 + 1 \cdot 7 + 1 \cdot 8 + 1 \cdot 10 + 2 \cdot 10 + 1 \cdot 12 + 1 \cdot 15}{1 + 2 + 1 + 1 + 1 + 1 + 2 + 1 + 1} = \frac{86}{11} \approx 7.82
\]

Conclusión

Las medidas de tendencia central proporcionan una forma sencilla pero poderosa de resumir datos en econometría. Comprender cómo calcular y aplicar cada una de estas medidas es crucial para interpretar correctamente los datos económicos y tomar decisiones informadas basadas en el análisis estadístico.



 

Medidas de Dispersión en Estadística Descriptiva y su Aplicación en Econometría

Las medidas de dispersión son esenciales en estadística descriptiva porque proporcionan información sobre la variabilidad o dispersión de los datos en un conjunto. Estas medidas complementan las medidas de tendencia central al describir cuán dispersos o concentrados están los datos alrededor de un valor central. En el contexto de la econometría, las medidas de dispersión son fundamentales para evaluar la consistencia y confiabilidad de las estimaciones económicas. A continuación, se presentan las principales medidas de dispersión y sus aplicaciones en econometría.

Rango

El rango es la diferencia entre el valor máximo y el valor mínimo en un conjunto de datos. Es una medida simple de la dispersión que indica la amplitud de los datos.

Para un conjunto de datos \( X = \{x_1, x_2, \ldots, x_n\} \):
\[
\text{Rango} = x_{\text{max}} - x_{\text{min}}
\]

En econometría, el rango puede ser útil para tener una idea rápida de la variabilidad de variables económicas como los precios de los bienes o los salarios.

Varianza

La varianza mide la dispersión de los datos respecto a la media aritmética. Cuanto mayor sea la varianza, mayor será la dispersión de los datos.

Para un conjunto de datos \( X = \{x_1, x_2, \ldots, x_n\} \) con media \( \bar{x} \), la varianza \( \sigma^2 \) se define como:
\[
\sigma^2 = \frac{1}{n} \sum_{i=1}^{n} (x_i - \bar{x})^2
\]

En econometría, la varianza se utiliza para analizar la volatilidad de variables económicas, como las tasas de interés o los retornos de inversión.

Desviación Estándar

La desviación estándar es la raíz cuadrada de la varianza. Es una medida más intuitiva de la dispersión porque está en las mismas unidades que los datos originales.

\[
\sigma = \sqrt{\frac{1}{n} \sum_{i=1}^{n} (x_i - \bar{x})^2}
\]

En econometría, la desviación estándar se emplea para evaluar la volatilidad y el riesgo de variables económicas. Por ejemplo, en finanzas, es común analizar la desviación estándar de los rendimientos de activos para entender su riesgo asociado.

Rango Intercuartílico

El rango intercuartílico (IQR) es la diferencia entre el tercer cuartil (Q3) y el primer cuartil (Q1). Este rango mide la dispersión del 50% central de los datos y es menos sensible a los valores extremos que el rango total.

Para un conjunto de datos \( X \):
\[
IQR = Q3 - Q1
\]

En econometría, el IQR es útil para describir la dispersión de variables como los ingresos, especialmente en distribuciones con valores extremos que pueden distorsionar otras medidas de dispersión.

Coeficiente de Variación

El coeficiente de variación (CV) es la relación entre la desviación estándar y la media aritmética, expresado como un porcentaje. Proporciona una medida relativa de la dispersión.

\[
CV = \frac{\sigma}{\bar{x}} \times 100
\]

En econometría, el CV se utiliza para comparar la dispersión de variables con diferentes unidades o escalas. Por ejemplo, puede comparar la variabilidad de los ingresos en diferentes países.

Ejemplo Matemático en Econometría

Supongamos que analizamos los ingresos mensuales (en miles de unidades monetarias) de una muestra de hogares: \( \{2, 3, 5, 7, 8, 10, 10, 12, 15\} \).

Rango:
\[
\text{Rango} = 15 - 2 = 13
\]

Varianza:
\[
\bar{x} = \frac{2 + 3 + 5 + 7 + 8 + 10 + 10 + 12 + 15}{9} = 8
\]
\[
\sigma^2 = \frac{(2-8)^2 + (3-8)^2 + (5-8)^2 + (7-8)^2 + (8-8)^2 + (10-8)^2 + (10-8)^2 + (12-8)^2 + (15-8)^2}{9} = \frac{180}{9} = 20
\]

Desviación Estándar:
\[
\sigma = \sqrt{20} \approx 4.47
\]

Rango Intercuartílico:
Ordenando los datos: \( \{2, 3, 5, 7, 8, 10, 10, 12, 15\} \)
Q1 (primer cuartil) = 5 y Q3 (tercer cuartil) = 10.
\[
IQR = 10 - 5 = 5
\]

Coeficiente de Variación:
\[
CV = \frac{4.47}{8} \times 100 \approx 55.88\%
\]

Conclusión

Las medidas de dispersión son herramientas esenciales para comprender la variabilidad en los datos económicos. Cada medida proporciona una perspectiva diferente sobre la dispersión, desde el rango simple hasta la complejidad del coeficiente de variación. Comprender y aplicar estas medidas en el análisis econométrico es crucial para evaluar la consistencia y la confiabilidad de las estimaciones económicas, así como para interpretar correctamente la variabilidad y el riesgo asociado con las variables económicas.

 

Medidas de Forma en Estadística Descriptiva y su Aplicación en Econometría

Las medidas de forma proporcionan información sobre la distribución de los datos más allá de las medidas de tendencia central y dispersión. Estas medidas ayudan a entender la forma de la distribución de los datos, identificando características como la simetría y la concentración. En econometría, estas medidas son útiles para evaluar si los datos se ajustan a las suposiciones de los modelos econométricos y para interpretar las distribuciones de variables económicas. A continuación, se describen las principales medidas de forma.

Asimetría (Skewness)

La asimetría o skewness mide el grado de simetría de la distribución de los datos. Una distribución puede ser simétrica, sesgada a la derecha o sesgada a la izquierda.

Matemáticamente, la asimetría se define como:
\[
\text{Asimetría} = \frac{\frac{1}{n} \sum_{i=1}^{n} (x_i - \bar{x})^3}{\left( \frac{1}{n} \sum_{i=1}^{n} (x_i - \bar{x})^2 \right)^{3/2}}
\]

Donde \( \bar{x} \) es la media y \( n \) es el número de observaciones. 

-Asimetría positiva: La distribución tiene una cola más larga en el lado derecho. Los datos están concentrados en el extremo izquierdo.
- Asimetría negativa: La distribución tiene una cola más larga en el lado izquierdo. Los datos están concentrados en el extremo derecho.
- Asimetría cero: La distribución es simétrica.

En econometría, la asimetría es importante para verificar la normalidad de los datos, lo cual es una suposición clave en muchos modelos econométricos.

Curtosis

La curtosis mide la "altitud" y "ancho" de la distribución de los datos. Refleja la presencia de colas y picos en la distribución comparado con una distribución normal.

Matemáticamente, la curtosis se define como:
\[
\text{Curtosis} = \frac{\frac{1}{n} \sum_{i=1}^{n} (x_i - \bar{x})^4}{\left( \frac{1}{n} \sum_{i=1}^{n} (x_i - \bar{x})^2 \right)^2} - 3
\]

Donde:
- Curtosis positiva: La distribución tiene colas más pesadas y un pico más alto que una distribución normal (leptocúrtica).
- Curtosis negativa: La distribución tiene colas más ligeras y un pico más bajo (platicúrtica).
- Curtosis cero: La distribución tiene una forma similar a la distribución normal (mesocúrtica).

En econometría, la curtosis ayuda a identificar la presencia de valores extremos o anomalías en los datos, que pueden afectar los resultados del análisis económico.

Ejemplo Matemático en Econometría

Consideremos un conjunto de datos de ingresos mensuales (en miles de unidades monetarias) de una muestra de hogares: \( \{2, 3, 5, 7, 8, 10, 10, 12, 15\} \).

Cálculo de la Asimetría:
   Primero, calculamos la media y la desviación estándar:
   \[
   \bar{x} = \frac{2 + 3 + 5 + 7 + 8 + 10 + 10 + 12 + 15}{9} = 8
   \]
   \[
   \sigma = \sqrt{\frac{1}{9} \sum_{i=1}^{9} (x_i - 8)^2} \approx 4.47
   \]

   Luego calculamos la asimetría:
   \[
   \text{Asimetría} = \frac{\frac{1}{9} \sum_{i=1}^{9} (x_i - 8)^3}{4.47^3} \approx 0.58
   \]

   Una asimetría positiva sugiere que la distribución está sesgada hacia la derecha.

Cálculo de la Curtosis:
   La curtosis se calcula usando:
   \[
   \text{Curtosis} = \frac{\frac{1}{9} \sum_{i=1}^{9} (x_i - 8)^4}{4.47^4} - 3 \approx -0.37
   \]

   Una curtosis negativa sugiere que la distribución tiene colas más ligeras y es menos pronunciada en el centro.

Conclusión

Las medidas de forma, como la asimetría y la curtosis, proporcionan información crucial sobre la distribución de los datos que va más allá de la simple tendencia central y dispersión. Estas medidas son esenciales en econometría para validar supuestos de normalidad en los modelos, detectar valores atípicos y comprender la naturaleza de las variables económicas. Comprender la forma de la distribución permite realizar un análisis más profundo y tomar decisiones más informadas en el contexto económico.


 

Aplicación práctica

Para este ejemplo detallado, usaremos NumPy para realizar un análisis estadístico descriptivo. Imaginemos que tenemos un conjunto de datos que representa las calificaciones de los estudiantes en un examen final. Estos datos están en una escala de 0 a 100. Primero, vamos a generar un conjunto de datos ficticio de calificaciones y luego aplicaremos diferentes medidas estadísticas descriptivas usando NumPy.

Paso 1: Instalación y Importación de NumPy Asegúrate de tener NumPy instalado. Puedes instalarlo con `pip install numpy` si aún no lo tienes.


import numpy as np 

Paso 2: Creación del Conjunto de Datos


np.random.seed(0) 
# Para obtener resultados reproducibles 
calificaciones = np.random.randint(50, 100, size=30) 
# Calificaciones de 30 estudiantes

Este código crea un arreglo de NumPy con 30 calificaciones aleatorias entre 50 y 100.

Paso 3: Estadísticas Descriptivas Ahora, aplicaremos varias medidas estadísticas descriptivas a este conjunto de datos.

Medidas de Tendencia Central


# Media 
media = np.mean(calificaciones) 
print(f"Media: {media}") 
# Mediana 
mediana = np.median(calificaciones) 
print(f"Mediana: {mediana}") 
# Moda (NumPy no tiene una función directa para la moda, así que usaremos SciPy) from scipy import stats 
moda = stats.mode(calificaciones) 
print(f"Moda: {moda.mode[0]} (Aparece {moda.count[0]} veces)")

Medidas de Dispersión


# Varianza 
varianza = np.var(calificaciones) 
print(f"Varianza: {varianza}") 
# Desviación Estándar 
desviacion_std = np.std(calificaciones) 
print(f"Desviación Estándar: {desviacion_std}") 
# Rango 
rango = np.ptp(calificaciones) 
# Peak to peak (max - min) 
print(f"Rango: {rango}")

Medidas de Forma


# Asimetría 
asimetria = stats.skew(calificaciones) 
print(f"Asimetría: {asimetria}") 
# Curtosis 
curtosis = stats.kurtosis(calificaciones) 
print(f"Curtosis: {curtosis}")

Paso 4: Análisis Adicional (Percentiles) Los percentiles son útiles para entender la distribución de los datos. Por ejemplo, el percentil 50 es la mediana.


percentil_25 = np.percentile(calificaciones, 25) 
percentil_75 = np.percentile(calificaciones, 75) 
print(f"Percentil 25: {percentil_25}, Percentil 75: {percentil_75}")

Este conjunto de análisis estadístico proporciona una comprensión profunda de las calificaciones del examen, incluyendo dónde se concentran las calificaciones, cómo se dispersan y cómo es su distribución en términos de asimetría y curtosis. Estas medidas son fundamentales en estadística descriptiva y son especialmente útiles en la exploración inicial de los datos.