Decision Intelligence Causal: Modelos Causales Estructurales para Sistemas de IA en Producción
El fallo silencioso del ML correlacional en decisiones críticas
Los sistemas de machine learning predictivos son optimizadores de distribuciones condicionales. Dado un conjunto de datos , entrenamos un modelo que aproxima bajo la distribución empírica del conjunto de entrenamiento. Este objetivo es apropiado cuando la tarea es predecir dentro de la distribución — estimar la probabilidad de lluvia mañana, clasificar imágenes de rayos X, transcribir audio. Es fundamentalmente incorrecto cuando la tarea es tomar una acción que cambia el estado del mundo.
La distinción es precisa y tiene consecuencias operativas graves. Considérese un modelo que aprende que la baja utilización de una flota de camiones en minería correlaciona con fallas inminentes del motor. El modelo aprende P(falla | utilización_baja) y genera alertas cuando observa baja utilización. Un sistema de decisión que actúa sobre esta correlación podría, por ejemplo, reducir la carga de trabajo de los camiones con baja utilización. Pero si la baja utilización es causada por una política de mantenimiento preventivo — no por degradación del motor — la intervención es contraproducente. El modelo aprendió una correlación real en los datos observacionales. No aprendió la estructura causal subyacente.
Modelos Causales Estructurales: el formalismo de Pearl
Judea Pearl formalizó la teoría de la causalidad para sistemas computacionales a través del do-calculus (Causality, 2000; The Book of Why, 2018). Un Modelo Causal Estructural (SCM) se define como una cuádrupla , donde son las variables endógenas observables, son las variables exógenas (ruido), son las funciones estructurales que determinan cada variable como función de sus causas directas y el ruido exógeno, y es la distribución conjunta del ruido. El SCM induce un grafo acíclico dirigido (DAG) G donde una arista indica que es una causa directa de .
El operador es la contribución técnica central. denota la distribución de Y cuando intervenimos quirúrgicamente en el sistema para fijar X=x, eliminando la influencia de todas las causas de X. Esta distribución es fundamentalmente diferente de — la distribución condicional observacional. La diferencia entre ambas cuantifica el efecto causal de X sobre Y, libre de confundidores.
La Escalera de Causalidad de Pearl: tres niveles de razonamiento
Pearl articula tres niveles jerárquicos de razonamiento causal, cada uno estrictamente más expresivo que el anterior. El primero, la Asociación, opera sobre distribuciones observacionales : permite predecir, correlacionar y clasificar, pero no puede responder preguntas sobre intervenciones. El segundo, la Intervención, opera sobre distribuciones intervenidas : permite evaluar el efecto de acciones, diseñar políticas y simular experimentos. Requiere identificabilidad causal — que sea computable a partir de datos observacionales dada la estructura del DAG. El tercero, el Contrafáctico, opera sobre distribuciones de mundos posibles : permite preguntar "¿qué habría pasado si hubiera actuado diferente?". Es el nivel de la responsabilidad, la atribución y el análisis post-incidente.
Descubrimiento causal en producción: de datos observacionales a DAGs
En la mayoría de los contextos de producción, el DAG causal es desconocido y debe ser estimado a partir de datos observacionales mediante algoritmos de descubrimiento causal. Existen tres familias algorítmicas principales. Los algoritmos basados en restricciones — PC algorithm, FCI — utilizan tests de independencia condicional para identificar separating sets y construir el skeleton del DAG, orientando las aristas mediante v-structures. Los algoritmos basados en score — GES (Greedy Equivalence Search), NOTEARS — search en el espacio de DAGs maximizando un score que mide el ajuste del modelo a los datos. Los modelos causales funcionales — LiNGAM, ANM (Additive Noise Models) — asumen formas funcionales específicas para las ecuaciones estructurales y explotan asimétrías estadísticas para orientar aristas.
Estimación causal con AIPW y bandas conformales
Una vez identificado el efecto causal, el estimador Augmented Inverse Propensity Weighting (AIPW) es doblemente robusto: consistente si al menos uno de los modelos nuisance — el propensity score o el outcome model — está correctamente especificado. La estimación puntual del Average Treatment Effect (ATE):
La predicción conformal (Vovk et al., 2005) extiende la estimación puntual con garantías de cobertura distribution-free. A diferencia de los intervalos de confianza paramétricos, la predicción conformal garantiza que el conjunto de predicción contiene el verdadero valor Y con probabilidad al menos , bajo la única suposición de intercambiabilidad de los datos:
En xStryk, la comunicación pública de causalidad debe mantenerse en el nivel de assurance: comparar alternativas, explicitar supuestos, mostrar límites de confianza y bloquear recomendaciones cuando la evidencia deja de sostener la intervención.
La capa causal de xStryk: de correlación a decisión defendible
xStryk comunica la causalidad como una capacidad de Decision Assurance: no basta con mostrar una correlación, la plataforma debe ayudar a separar evidencia, supuesto, escenario, riesgo e intervención. Los mecanismos técnicos concretos permanecen protegidos; el comprador ve una decisión defendible con límites y outcome esperado.
Conclusiones clave
- Los sistemas de ML predictivos optimizan : la distribución observacional. Los sistemas de decisión accionables requieren : la distribución intervenida. Confundirlas genera políticas causalmente incorrectas.
- Un SCM y su DAG inducido G formalizan las relaciones causales entre variables, permitiendo aplicar el do-calculus para computar efectos causales a partir de datos observacionales.
- NOTEARS reformula el descubrimiento de DAGs como un problema de optimización continua, haciendo el descubrimiento causal compatible con pipelines de ML estándar sobre GPU.
- El estimador AIPW es doblemente robusto: consistente si al menos uno de los dos modelos nuisance está correctamente especificado, combinado con predicción conformal para cobertura distribution-free.
- En xStryk, la causalidad se comunica como assurance: separar correlación de intervención, comparar escenarios y registrar límites antes de recomendar una acción.
