← Introducción a la Inferencia Estadística para el Analista de Datos
Conceptos Clave de Probabilidad
Preview gratis Sección 1 · Fundamentos de Probabilidad
Conceptos Clave de Probabilidad
La inferencia estadística no es magia: es probabilidad aplicada con disciplina. Antes de hablar de estimadores, intervalos de confianza o pruebas de hipótesis, necesitas un marco formal que diga qué significa “la probabilidad de un evento” y cómo actualizarla cuando llega evidencia nueva. Ese marco lo fijó Kolmogorov en 1933 y sigue siendo la base de todo lo que vas a usar como analista de datos en Python, desde una simple prueba t hasta un modelo bayesiano.
Los axiomas de Kolmogorov
Una medida de probabilidad es una función $P$ definida sobre eventos — subconjuntos de un espacio muestral $\Omega$ que reúne todos los resultados posibles del experimento. Para cualquier evento $A$, $P(A)$ debe cumplir tres axiomas:
- No-negatividad: $P(A) \geq 0$ para todo evento $A$.
- Normalización: $P(\Omega) = 1$. Algo del espacio muestral pasa siempre.
- Aditividad numerable: si $A_1, A_2, \ldots$ son eventos mutuamente excluyentes, entonces $P\left(\bigcup_i A_i\right) = \sum_i P(A_i)$.
De estos tres axiomas se derivan todas las reglas que conoces: $P(\emptyset) = 0$, $P(A^c) = 1 - P(A)$, la regla de la suma para eventos no excluyentes, y la cota $0 \leq P(A) \leq 1$. La minimalidad importa: cualquier modelo probabilístico que uses (binomial, normal, posterior bayesiano) hereda estas propiedades.
Probabilidad condicional y regla de Bayes
La probabilidad condicional de $A$ dado que ocurrió $B$ se define, cuando $P(B) > 0$, como:
$$P(A \mid B) = \frac{P(A \cap B)}{P(B)}$$Es el corazón de la inferencia: dice cómo cambia tu creencia sobre $A$ al observar $B$. De la simetría $P(A \cap B) = P(A \mid B)\,P(B) = P(B \mid A)\,P(A)$ sale la regla de Bayes:
$$P(A \mid B) = \frac{P(B \mid A)\,P(A)}{P(B)}$$Léela así: la probabilidad posterior de $A$ dado $B$ es proporcional al producto del likelihood $P(B \mid A)$ y el prior $P(A)$. La constante de normalización $P(B)$ se obtiene marginalizando sobre todas las hipótesis: $P(B) = \sum_i P(B \mid A_i)\,P(A_i)$. Cuando hagas inferencia bayesiana, este es literalmente el motor del algoritmo.
Independencia
Dos eventos son independientes cuando $P(A \cap B) = P(A)\,P(B)$, equivalentemente $P(A \mid B) = P(A)$: saber que $B$ pasó no cambia la probabilidad de $A$. La independencia es una propiedad fuerte y poco común en datos reales; asumirla sin verificarla rompe los supuestos de muchas pruebas estadísticas (independencia de observaciones en una muestra, por ejemplo).
Más sutil: dos eventos pueden ser dependientes en general pero independientes condicional a una tercera variable, o al revés. Esa diferencia es la raíz de la paradoja de Simpson y de buena parte de los errores causales.
Aplicación concreta con scipy y numpy
Un test médico ilustra por qué la intuición sobre probabilidades inversas suele fallar. Supón una enfermedad con prevalencia del 5%, un test con sensibilidad del 95% (verdadero positivo) y especificidad del 95% (verdadero negativo). Si una persona elegida al azar da positivo, ¿cuál es la probabilidad real de que esté enferma?
import numpy as np
rng = np.random.default_rng(42)
N = 100_000
prevalencia, sensibilidad, especificidad = 0.05, 0.95, 0.95
enfermo = rng.random(N) < prevalencia
positivo = np.where(
enfermo,
rng.random(N) < sensibilidad, # P(+ | enfermo)
rng.random(N) < 1 - especificidad, # P(+ | sano)
)
vpp = enfermo[positivo].mean()
print(f"P(enfermo | +) = {vpp:.3f}") # ~ 0.50
Por Bayes, $P(\text{enfermo} \mid +) = (0.95 \cdot 0.05) / (0.95 \cdot 0.05 + 0.05 \cdot 0.95) = 0.5$. La intuición dice “95% es seguro”; la probabilidad real dice “moneda al aire”. La causa: el prior bajo (la enfermedad es rara) compite con el likelihood alto, y los falsos positivos dominan el numerador.
Trampas comunes
- Confundir $P(A \mid B)$ con $P(B \mid A)$: la “falacia del fiscal”. La probabilidad de la evidencia dada la hipótesis no es la probabilidad de la hipótesis dada la evidencia, salvo casos triviales.
- Ignorar el prior: sin información base sobre la prevalencia, el likelihood solo no permite concluir nada. El ejemplo del test médico lo deja explícito.
- Asumir independencia sin verificar: en datos de series de tiempo, paneles o muestreos por conglomerados, las observaciones rara vez son independientes. Las pruebas estadísticas estándar pierden validez.
- Tratar “probabilidad 0” como “imposible”: en espacios continuos, eventos de medida cero ocurren (por ejemplo, $P(X = c) = 0$ para una variable continua, pero $X$ toma algún valor).
- Confundir independencia con independencia condicional: dos variables pueden ser dependientes en la marginal y volverse independientes al condicionar (o viceversa). Es lo que está detrás de la paradoja de Simpson.
Cierre
Cada vez que hagas inferencia, vas a estar calculando o asumiendo probabilidades condicionales: el p-valor de una prueba de hipótesis es $P(\text{datos} \mid H_0)$, un intervalo de confianza frecuentista vive en la frecuencia de cobertura sobre repeticiones del experimento, y una distribución posterior es literalmente Bayes aplicado. Antes de aplicar cualquier técnica, pregúntate explícitamente: ¿qué espacio muestral estoy usando, qué eventos estoy condicionando, y qué supuestos de independencia entran en juego?