Saltar al contenido
Inferencia Causal con Python y Causal ML

Introducción a la causalidad: Conceptos básicos y fundamentos teóricos.

Introducción

La inferencia causal

La inferencia causal es un campo de estudio que busca entender cómo los eventos causan unos a otros y cómo podemos utilizar esa información para tomar decisiones informadas. Esto se logra a través de la identificación de relaciones causales entre variables en un sistema complejo.

Un concepto importante en la inferencia causal es la diferencia entre correlación y causalidad. Mientras que la correlación indica una alta relación entre dos variables, la causalidad implica una relación causal entre ellas. Sin embargo, establecer la causalidad es un desafío en sí mismo, ya que muchas variables pueden estar relacionadas en una red compleja de causas y efectos.

En ese sentido, la inferencia causal se basa en el uso de modelos causales, los cuales permiten identificar relaciones de causalidad entre variables de manera más precisa y rigurosa. En el campo de la informática y la estadística, se utilizan diversas técnicas y herramientas para realizar la inferencia causal, por ejemplo, mediante el uso de modelos gráficos causales y el aprendizaje automático para descubrir patrones que sugieran una relación causal.

Estas técnicas se pueden aplicar en áreas como la salud pública, la economía, la ingeniería, entre otras, para identificar intervenciones o políticas que puedan tener un impacto positivo en un sistema complejo.

Resumen

La causalidad en la ciencia

La causalidad es un concepto fundamental para entender cómo funciona el mundo. En ciencia, la causalidad se refiere a cualquier fenómeno que hace que otro fenómeno ocurra. Es decir, si un evento A causa que un evento B suceda, podemos decir que hay una relación causal entre A y B.

Existen dos tipos principales de relaciones causales: las deterministas y las probabilísticas.

  1. Relaciones causales deterministas:

    • Significan que si A sucede, B siempre sucederá.
    • Ejemplo: Si caemos desde un edificio alto, podemos decir con certeza que experimentaremos una caída dolorosa.
  2. Relaciones causales probabilísticas:

    • Significan que hay una cierta probabilidad de que B suceda si A sucede.
    • Ejemplo: Si fumamos, aumentamos la probabilidad de desarrollar cáncer de pulmón, pero no es una certeza.

Para medir la causalidad, existen diferentes enfoques y herramientas estadísticas, como los experimentos aleatorios o los modelos de regresión. Sin embargo, es importante tener en cuenta que no todas las relaciones entre dos eventos implican causalidad. A veces, dos eventos pueden estar correlacionados pero no tener una relación causal directa.

Por ejemplo, el crimen puede aumentar en una ciudad al mismo tiempo que aumenta el número de helados vendidos, pero esto no significa que los helados causen el crimen.

Aplicación teórica

Conceptos Básicos de Causalidad

La causalidad es un concepto fundamental en la estadística, la teoría de sistemas y las ciencias sociales. Se refiere a la relación entre variables donde un cambio en una variable (la causa) produce un cambio en otra variable (el efecto). Aquí se exploran los conceptos básicos de causalidad desde una perspectiva matemática, centrándose en modelos y técnicas que permiten inferir relaciones de causa y efecto entre variables.

Modelos de Regresión

Los modelos de regresión se utilizan para analizar la relación entre una variable dependiente \( Y \) y una o más variables independientes \( X \). En su forma más básica, la regresión lineal simple se define como:

\[ Y = \beta_0 + \beta_1 X + \epsilon \]

donde:

- \( \beta_0 \) es el intercepto,
- \( \beta_1 \) es el coeficiente que mide el efecto de \( X \) sobre \( Y \),
- \( \epsilon \) es el término de error que captura la variabilidad en \( Y \) no explicada por \( X \).

En modelos de regresión múltiple, donde se incluyen múltiples variables independientes, la fórmula general es:

\[ Y = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_p X_p + \epsilon \]

La interpretación de los coeficientes \( \beta_i \) en términos de causalidad requiere asumir que todas las variables relevantes están incluidas en el modelo y que no existen variables omitidas que puedan sesgar los resultados.

Modelos de Ecuaciones Estructurales (SEM)

Los modelos de ecuaciones estructurales permiten analizar relaciones causales entre múltiples variables a través de un conjunto de ecuaciones. Un modelo SEM se puede representar como:

\[ Y_1 = \beta_{10} + \beta_{11} X_1 + \beta_{12} X_2 + \epsilon_1 \]
\[ Y_2 = \beta_{20} + \beta_{21} X_1 + \beta_{22} Y_1 + \epsilon_2 \]

donde:

- \( Y_1 \) y \( Y_2 \) son variables dependientes,
- \( X_1 \) y \( X_2 \) son variables independientes,
- \( \beta_{ij} \) son coeficientes que representan efectos causales,
- \( \epsilon_i \) son términos de error.

Diagramas de Causalidad y Redes Bayesianas

Los diagramas de causalidad y las redes bayesianas representan las relaciones causales entre variables utilizando gráficos dirigidos. Un diagrama causal incluye nodos que representan variables y flechas que indican relaciones causales. La probabilidad condicional entre variables se puede modelar utilizando redes bayesianas, que están basadas en el teorema de Bayes:

\[ P(X | Y) = \frac{P(Y | X) P(X)}{P(Y)} \]

donde:

- \( P(X | Y) \) es la probabilidad condicional de \( X \) dado \( Y \),
- \( P(Y | X) \) es la probabilidad condicional de \( Y \) dado \( X \),
- \( P(X) \) y \( P(Y) \) son las probabilidades marginales de \( X \) y \( Y \), respectivamente.

Criterios de Causalidad

Existen varios criterios matemáticos para evaluar la causalidad, entre ellos:

1. Granger Causality: En series temporales, se utiliza la prueba de causalidad de Granger para determinar si una variable \( X \) proporciona información útil para predecir \( Y \) más allá de lo que se puede predecir usando la información pasada de \( Y \) solamente. Matemáticamente, esto se evalúa comparando modelos autorregresivos con y sin la variable \( X \):

   \[ Y_t = \alpha + \beta_1 Y_{t-1} + \beta_2 Y_{t-2} + \cdots + \epsilon_t \]
   \[ Y_t = \alpha + \beta_1 Y_{t-1} + \beta_2 Y_{t-2} + \gamma X_{t-1} + \delta X_{t-2} + \epsilon_t \]

2. Variables Instrumentales: Para abordar la endogeneidad en modelos de regresión, se utilizan variables instrumentales que están correlacionadas con la variable explicativa pero no con el término de error. La estimación mediante variables instrumentales busca obtener un estimador consistente de los coeficientes de regresión.

   \[ Y = \beta_0 + \beta_1 X + \epsilon \]
   \[ X = \pi_0 + \pi_1 Z + \eta \]

   donde \( Z \) es el instrumento y debe cumplir con la condición de relevancia y exogeneidad.

En resumen, la causalidad en matemáticas se explora a través de modelos estadísticos y probabilísticos que buscan establecer relaciones de causa y efecto entre variables. La regresión, los modelos de ecuaciones estructurales, los diagramas causales y las redes bayesianas son herramientas fundamentales para analizar estas relaciones. Además, criterios como la causalidad de Granger y el uso de variables instrumentales permiten abordar cuestiones específicas en la inferencia causal.

Fundamentos Teóricos de la Causalidad

Los fundamentos teóricos de la causalidad se basan en una combinación de conceptos matemáticos y estadísticos que permiten entender cómo se pueden inferir relaciones de causa y efecto entre variables. A continuación, se presentan los conceptos clave y las teorías fundamentales que sustentan el estudio de la causalidad.

Teoría de Grafos

La teoría de grafos proporciona una base para modelar relaciones causales mediante diagramas dirigidos. Un grafo dirigido es un conjunto de nodos conectados por aristas dirigidas, donde las aristas indican la dirección de la relación causal. Los conceptos clave incluyen:

- Nodos y Aristas: Los nodos representan variables o eventos, mientras que las aristas dirigidas indican relaciones causales.
- Caminos y Ciclos: Un camino es una secuencia de nodos conectados por aristas dirigidas, y un ciclo es un camino que comienza y termina en el mismo nodo.

**Modelos de Causalidad**

Los modelos de causalidad buscan representar y analizar relaciones causales a través de ecuaciones matemáticas. Los principales modelos incluyen:

- Modelos de Regresión: La regresión lineal y múltiple se utilizan para estimar el impacto de una o más variables independientes sobre una variable dependiente. En su forma general, un modelo de regresión se representa como:

  \[ Y = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_p X_p + \epsilon \]

  donde \( \beta_i \) son los coeficientes que miden el efecto de cada variable \( X_i \) sobre \( Y \).

- Modelos de Ecuaciones Estructurales (SEM): Estos modelos permiten representar relaciones causales complejas entre múltiples variables a través de un sistema de ecuaciones. Los SEM pueden describirse como:

  \[ Y_1 = \beta_{10} + \beta_{11} X_1 + \beta_{12} X_2 + \epsilon_1 \]
  \[ Y_2 = \beta_{20} + \beta_{21} X_1 + \beta_{22} Y_1 + \epsilon_2 \]

  donde \( \beta_{ij} \) representan los efectos causales y \( \epsilon_i \) son los términos de error.

Diagramas de Causalidad y Redes Bayesianas

Estos diagramas representan relaciones causales mediante grafos dirigidos, donde:

- Diagramas de Causalidad: Utilizan nodos para representar variables y flechas para indicar la dirección de las relaciones causales.
- Redes Bayesianas: Modelan la probabilidad condicional entre variables utilizando el teorema de Bayes. Para una red bayesiana, la probabilidad condicional se expresa como:

  \[ P(X | Y) = \frac{P(Y | X) P(X)}{P(Y)} \]

  donde \( P(X | Y) \) es la probabilidad de \( X \) dado \( Y \), y \( P(Y | X) \) es la probabilidad de \( Y \) dado \( X \).

Criterios de Causalidad

Los criterios matemáticos y estadísticos permiten evaluar y validar la causalidad:

- Causalidad de Granger: Se basa en el análisis de series temporales para determinar si una variable \( X \) ayuda a predecir otra variable \( Y \) más allá de la información contenida en \( Y \) mismo. Se compara el ajuste de modelos autorregresivos con y sin la variable \( X \).

  \[ Y_t = \alpha + \beta_1 Y_{t-1} + \beta_2 Y_{t-2} + \cdots + \epsilon_t \]
  \[ Y_t = \alpha + \beta_1 Y_{t-1} + \beta_2 Y_{t-2} + \gamma X_{t-1} + \delta X_{t-2} + \epsilon_t \]

- Variables Instrumentales: Utilizadas para manejar la endogeneidad en modelos de regresión. Se introducen variables instrumentales \( Z \) que están correlacionadas con la variable independiente \( X \) pero no con el término de error \( \epsilon \). La estimación se basa en:

  \[ Y = \beta_0 + \beta_1 X + \epsilon \]
  \[ X = \pi_0 + \pi_1 Z + \eta \]

Conclusión

Los fundamentos teóricos de la causalidad incluyen el uso de modelos matemáticos y gráficos para representar y analizar relaciones causales entre variables. La teoría de grafos, los modelos de regresión y ecuaciones estructurales, los diagramas de causalidad y redes bayesianas, y los criterios de causalidad son herramientas esenciales para entender cómo se puede establecer y validar la causalidad en diversos contextos.

Métodos para Establecer Causalidad

Establecer causalidad es fundamental en la investigación científica y en el análisis de datos para determinar cómo una variable afecta a otra. Existen varios métodos y enfoques para inferir relaciones causales, cada uno con sus propias técnicas y requisitos matemáticos. A continuación se describen algunos de los principales métodos utilizados para establecer causalidad.

Experimentos Controlados

Los experimentos controlados son considerados el estándar para establecer causalidad. En un experimento controlado, los investigadores manipulan una variable independiente (la causa) y observan el efecto en una variable dependiente (el efecto), mientras controlan otras variables.

- Diseño Experimental Aleatorizado: Los participantes se asignan aleatoriamente a grupos de tratamiento y control para asegurar que cualquier diferencia en los resultados se debe a la variable de interés. Matemáticamente, la asignación aleatoria asegura que las variables confusas se distribuyen uniformemente entre los grupos.

Regresión y Modelos de Ecuaciones Estructurales

Los modelos de regresión y ecuaciones estructurales se utilizan para modelar relaciones causales en datos observacionales. Estos modelos permiten estimar el efecto de una variable sobre otra, controlando otras variables que podrían influir en la relación.

- Regresión Lineal Múltiple: Estima el efecto de múltiples variables independientes sobre una variable dependiente. El modelo se expresa como:

  \[ Y = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_p X_p + \epsilon \]

  donde \( \beta_i \) son los coeficientes que miden el efecto de cada variable \( X_i \) sobre \( Y \), y \( \epsilon \) es el término de error.

- Modelos de Ecuaciones Estructurales (SEM): Representan relaciones causales complejas entre variables a través de un conjunto de ecuaciones. Los SEM incluyen:

  \[ Y_1 = \beta_{10} + \beta_{11} X_1 + \beta_{12} X_2 + \epsilon_1 \]
  \[ Y_2 = \beta_{20} + \beta_{21} X_1 + \beta_{22} Y_1 + \epsilon_2 \]

  donde los coeficientes \( \beta_{ij} \) representan efectos causales directos e indirectos entre variables.

Variables Instrumentales

Las variables instrumentales se utilizan para abordar la endogeneidad en modelos de regresión, donde una variable independiente puede estar correlacionada con el término de error. Se busca un instrumento que esté correlacionado con la variable explicativa pero no con el término de error.

- Estimación por Variables Instrumentales: Consiste en utilizar un instrumento \( Z \) para identificar el efecto causal de \( X \) sobre \( Y \). El modelo se expresa como:

  \[ Y = \beta_0 + \beta_1 X + \epsilon \]
  \[ X = \pi_0 + \pi_1 Z + \eta \]

Causalidad de Granger

En series temporales, la causalidad de Granger se utiliza para determinar si una variable \( X \) puede predecir una variable \( Y \) en el futuro. Se basa en la comparación entre modelos de series temporales que incluyen y excluyen la variable \( X \).

- Prueba de Causalidad de Granger: Se evalúa si la inclusión de \( X \) mejora la predicción de \( Y \). Los modelos se comparan mediante:

  \[ Y_t = \alpha + \beta_1 Y_{t-1} + \beta_2 Y_{t-2} + \cdots + \epsilon_t \]
  \[ Y_t = \alpha + \beta_1 Y_{t-1} + \beta_2 Y_{t-2} + \gamma X_{t-1} + \delta X_{t-2} + \epsilon_t \]

Métodos de Variables Ocultas

Cuando no se pueden medir todas las variables relevantes, los métodos de variables ocultas intentan identificar y ajustar por la influencia de estas variables no observadas. Estos métodos pueden ser parte de los modelos de ecuaciones estructurales o de modelos de factores.

- Modelos de Factores: Utilizan variables latentes para capturar la influencia de variables no observadas en las variables observables. Un modelo de factores se representa como:

  \[ X_i = \lambda_i F + \epsilon_i \]

  donde \( F \) es la variable latente, \( \lambda_i \) es el peso de \( F \) en \( X_i \), y \( \epsilon_i \) es el error.

Métodos de Diseño Cuasi-Experimental

Cuando no es posible realizar un experimento controlado, los métodos cuasi-experimentales intentan imitar las condiciones de un experimento controlado mediante el uso de datos observacionales y técnicas de control.

- Diseño de Diferencias en Diferencias (DiD): Compara los cambios en los resultados antes y después del tratamiento en grupos tratados y no tratados para estimar el efecto causal del tratamiento.

  \[ \text{Efecto} = (\text{Resultado}_{\text{Tratamiento}} - \text{Resultado}_{\text{Pre-Tratamiento}}) - (\text{Resultado}_{\text{Control}} - \text{Resultado}_{\text{Pre-Control}}) \]

Conclusión

Establecer causalidad requiere el uso de diversos métodos y técnicas, cada uno con sus propias fortalezas y limitaciones. Los experimentos controlados, los modelos de regresión, las variables instrumentales, la causalidad de Granger, los métodos de variables ocultas y los métodos cuasi-experimentales proporcionan diferentes enfoques para inferir y validar relaciones causales entre variables. La elección del método depende del contexto, la disponibilidad de datos y los supuestos teóricos y prácticos involucrados.

 

Aplicación práctica

Un ejemplo práctico de la introducción a la causalidad en Python mediante el uso de la biblioteca causalgraphicalmodels

 

Primero, necesitamos importar la biblioteca y definir nuestro modelo causal utilizando un grafo causal. Aquí hay un ejemplo básico de un modelo causal que muestra la relación entre la edad, el sueño y el rendimiento en una prueba:

        
from causalgraphicalmodels import CausalGraphicalModel

model = CausalGraphicalModel(
    nodes=["edad", "sueño", "rendimiento"],
    edges=[("edad", "sueño"), ("sueño", "rendimiento")]
)
print(model.draw())
        
    

Esto creará un grafo causal con tres nodos (edad, sueño, y rendimiento) y dos bordes, indicando que la edad influye en el sueño y que el sueño influye en el rendimiento en la prueba.

Grafo Causal

Usaremos este modelo para responder a preguntas causales como "¿Cómo afecta la edad al rendimiento en la prueba?" Para hacer esto, necesitamos definir la variable de intervenir. En este caso, intervendremos en la variable edad y veremos cómo afecta al rendimiento en la prueba:

        
from causalinference import CausalModel

# Creamos un dataframe que representa nuestro modelo causal
data = model.sample(5000)

# Inicializar el modelo causal
causal = CausalModel(data=data, treatment='edad', outcome='rendimiento', graph=model)

# Realizar la estimación del efecto causal
print(causal.est_via_ols(adj=1))
        
    

Esto devuelve el efecto causal de la edad en el rendimiento, que en este ejemplo es 0.8. Este es un ejemplo simple, pero muestra cómo podemos utilizar la biblioteca Python causalgraphicalmodels para definir y visualizar modelos causales y la biblioteca causalinference para estimar los efectos causales en los modelos.