H-Neurons: el circuito disperso detrás de las alucinaciones en LLMs
Un equipo de investigadores del Instituto de Inteligencia Artificial de Tsinghua publicó en diciembre de 2025 un hallazgo que reencuadra cómo entendemos las alucinaciones en los grandes modelos de lenguaje. El paper demuestra que existe un subconjunto excepcionalmente disperso de neuronas que predice de forma confiable cuándo un LLM va a alucinar. Menos del 0.1% del total de neuronas. En Mistral-7B, el rango es de 0.01‰ a 0.35‰. La implicación es inmediata: las alucinaciones no son ruido estadístico distribuido uniformemente — son un fenómeno localizable e intervenible.
"Un subconjunto sorprendentemente disperso de neuronas — menos del 0.1% del total — puede predecir de forma confiable la ocurrencia de alucinaciones con sólida generalización cross-scenario." Las H-Neurons no son un artefacto de Mistral ni de Llama: aparecen en todas las familias de transformers evaluadas, de 4B a 70B parámetros.
Qué son las H-Neurons y cómo se identifican
El paper define H-Neurons como neuronas en las redes feedforward (FFN) de los transformers cuya activación predice sistemáticamente la ocurrencia de alucinaciones. La identificación combina tres etapas: construcción de un dataset determinista, una métrica de contribución normalizada (CETT) y clasificación dispersa por regresión logística L1.
Las H-Neurons se concentran en las capas intermedias-altas del modelo — precisamente donde investigaciones previas de mechanistic interpretability identifican los circuitos de "knowledge retrieval" y "fact composition".
Las H-Neurons exhiben distribuciones CETT estadísticamente diferentes entre respuestas correctas e incorrectas. Esta separabilidad es la base de su poder predictivo. Las neuronas regulares muestran distribuciones superpuestas — no pueden distinguir alucinaciones.
Resultados: generalización universal entre familias y escalas
| Modelo | Parámetros | H-Neurons (% total) | Precisión TriviaQA | vs. baseline aleatorio |
|---|---|---|---|---|
| Mistral-7B-v0.3 | 7B | 0.01‰ – 0.35‰ | 78.4% | +16.7pp |
| Mistral-Small-3.1 | 24B | <0.1% | Alto | ~+10pp |
| Gemma-3-4B | 4B | <0.1% | Consistente | ~+10pp |
| Gemma-3-27B | 27B | <0.1% | Consistente | ~+10pp |
| Llama-3.1-8B | 8B | <0.1% | Consistente | ~+10pp |
| Llama-3.3-70B | 70B | <0.1% | Consistente | ~+10pp |
La consistencia entre Mistral, Gemma y Llama — y entre escalas de 4B a 70B — es el resultado más robusto del paper. Las H-Neurons no son un artefacto de una familia de modelos específica: son una propiedad emergente universal de los transformers feedforward. El paper también demuestra generalización cross-scenario: H-Neurons identificadas en TriviaQA predicen alucinaciones en dominios completamente distintos — lo que confirma que capturan un mecanismo general de sobre-cumplimiento, no una señal de dominio factual.
Generalización cross-scenario: AUROC detallado
El hallazgo más provocativo del paper es que H-Neurons identificadas en un escenario (TriviaQA — alucinación factual) predicen comportamientos problemáticos en escenarios semánticamente disjuntos. La siguiente tabla muestra los scores AUROC de transferencia cross-scenario para Mistral-7B-v0.3:
| Origen → Destino | AUROC (H-Neurons) | AUROC (Random) | Δ | Significancia |
|---|---|---|---|---|
| TriviaQA → TriviaQA | 0.784 | 0.617 | +0.167 | p < 0.001 |
| TriviaQA → FalseQA | 0.721 | 0.523 | +0.198 | p < 0.001 |
| TriviaQA → FaithEval | 0.693 | 0.510 | +0.183 | p < 0.001 |
| TriviaQA → Sycophancy | 0.667 | 0.498 | +0.169 | p < 0.001 |
| TriviaQA → Jailbreak | 0.651 | 0.505 | +0.146 | p < 0.01 |
La generalización cross-scenario es evidencia de que las H-Neurons codifican un mecanismo general de "sobre-cumplimiento" (over-compliance) — no una señal específica de dominio factual. Esto conecta hallucination, sycophancy y jailbreak compliance como manifestaciones del mismo circuito subyacente. Es la primera evidencia a nivel de neurona individual de que estos fenómenos comparten sustrato computacional.
Cuatro dimensiones de sobre-cumplimiento inducido por α-scaling
El experimento central del paper es la intervención directa: escalar las activaciones de las H-Neurons por un factor α ∈ [0, 3]. El resultado es inequívoco: amplificar H-Neurons (α > 1) aumenta sistemáticamente las tasas de comportamiento problemático en cuatro dimensiones independientes.
supresión
baseline
amplificación
máxima
Premisas inválidas
Al amplificar H-Neurons, el modelo acepta con mayor frecuencia afirmaciones factualmente incorrectas presentes en el prompt. La activación de H-Neurons predice cuándo el modelo ignorará su propio conocimiento para cumplir con la premisa de la pregunta.
Contexto engañoso
Ante contexto que contradice el conocimiento del modelo, la amplificación aumenta la tasa de adopción del contexto engañoso. H-Neurons altas = mayor probabilidad de que el modelo "creer" el contexto sobre su entrenamiento.
Tendencia aduladora
Con α > 1, el modelo tiende a validar las preferencias expresadas por el usuario incluso cuando son incorrectas. La correlación con H-Neurons sugiere que sycophancy y alucinación factual comparten mecanismo subyacente.
Instrucciones dañinas
La amplificación incrementa la tasa de cumplimiento ante intentos de jailbreak. Las H-Neurons parecen ser el mecanismo de "sobre-cumplimiento" general — del que las alucinaciones factuales son una manifestación específica.
Los modelos más pequeños exhiben pendientes más pronunciadas: son más sensibles a la amplificación de H-Neurons. La relación es aproximadamente lineal con R² > 0.94 en todos los modelos. La zona de supresión (α < 1) reduce consistentemente las tasas de sobre-cumplimiento sin degradar capacidades generales del modelo.
Origen en pre-entrenamiento: RLHF no elimina el mecanismo
El análisis de transferibilidad AUROC es la pieza de evidencia más importante: los autores toman H-Neurons identificadas en modelos instruction-tuned y verifican su poder predictivo en los modelos base correspondientes (antes del RLHF). Los scores AUROC superan consistentemente los baselines aleatorios — lo que prueba que las H-Neurons no son creadas por el fine-tuning: estaban ahí antes. El análisis de parámetros confirma: las H-Neurons se concentran en la región de "high-normalized-rank", indicando que sus valores cambian mínimamente durante RLHF y SFT. RLHF y Constitutional AI pueden suprimir la expresión de alucinaciones — pero dejan el mecanismo intacto.
Tres vectores de intervención en producción
Detección en tiempo real
Monitorear activaciones de H-Neurons durante la inferencia. Cuando superan el umbral, emitir un score de confianza bajo o bloquear la respuesta. Implementable hoy con acceso a estados intermedios del modelo — sin re-entrenamiento.
Supresión α-scaling
Aplicar α < 1 a las activaciones de H-Neurons identificadas durante el forward pass. Reduce la tasa de sobre-cumplimiento sin re-entrenar. Preserva capacidad general del modelo — solo atenúa el circuito de alucinación.
Regularización localizada
Fine-tuning con regularización específica sobre H-Neurons: penalizar activaciones altas en contextos de sobre-cumplimiento. Más eficiente que RLHF completo — trabaja en el mecanismo, no solo en la expresión conductual.
Stack de gobernanza LLM
Los tres vectores son ortogonales: pueden combinarse. Detección en tiempo real para alertas, α-scaling para supresión inmediata, fine-tuning dirigido para reducción permanente. Arquitectura de defensa en profundidad contra alucinaciones.
Las H-Neurons se concentran en la región de bajo rango normalizado: sus pesos casi no cambian durante el RLHF. Esto demuestra que el mecanismo de alucinación se fija durante el pre-entrenamiento y es resiliente al alignment posterior.
Implementación en producción: pseudo-código y arquitectura
Para ingenieros que quieran implementar detección y supresión de H-Neurons en producción, el pipeline se compone de tres fases: identificación offline, monitoreo en inferencia, y supresión activa. El siguiente pseudo-código muestra la implementación en PyTorch con hooks de forward pass:
import torch
from sklearn.linear_model import LogisticRegression
import numpy as np
# ── Phase 1: Offline H-Neuron Identification ──
def compute_cett(model, dataloader, layer_indices):
"""Compute CETT scores for all FFN neurons."""
cett_all = [] # shape: (N_samples, N_layers, N_neurons)
labels = []
for batch in dataloader:
activations = {}
hooks = []
# Register hooks on FFN intermediate layers
for l_idx in layer_indices:
ffn = model.layers[l_idx].mlp
def hook_fn(module, input, output, l=l_idx):
activations[l] = output # (batch, seq, d_ff)
hooks.append(ffn.register_forward_hook(hook_fn))
with torch.no_grad():
logits = model(**batch['input'])
# Compute CETT per neuron per layer
for l_idx in layer_indices:
h = activations[l_idx][:, -1, :] # last token
W_out = model.layers[l_idx].mlp.down_proj.weight
projected = h.unsqueeze(-1) * W_out.T # (batch, d_ff, d)
norms = projected.norm(dim=-1) # (batch, d_ff)
cett = norms / norms.sum(dim=-1, keepdim=True)
cett_all.append(cett.cpu().numpy())
for h in hooks: h.remove()
return np.concatenate(cett_all), np.array(labels)
# L1 logistic regression → H-Neuron indices
def identify_h_neurons(cett_matrix, labels, C=0.01):
clf = LogisticRegression(
penalty='l1', C=C, solver='saga', max_iter=5000
)
clf.fit(cett_matrix, labels)
h_indices = np.where(clf.coef_[0] > 0)[0]
return h_indices # typically <0.1% of total neurons
# ── Phase 2: Runtime Monitoring ──
class HNeuronMonitor:
def __init__(self, model, h_indices, layer_idx, alpha=1.0):
self.h_indices = h_indices
self.alpha = alpha
self.scores = []
ffn = model.layers[layer_idx].mlp
ffn.register_forward_hook(self._hook)
def _hook(self, module, input, output):
h_act = output[:, -1, self.h_indices]
score = h_act.abs().mean().item()
self.scores.append(score)
# Phase 3: α-scaling suppression
if self.alpha != 1.0:
output[:, :, self.h_indices] *= self.alpha
return output
def confidence(self, threshold=0.5):
"""Anti-hallucination confidence: 1.0 = safe."""
return 1.0 - min(self.scores[-1] / threshold, 1.0)Comparación con enfoques previos de detección de alucinaciones
H-Neurons no es el primer intento de detectar o mitigar alucinaciones en LLMs. Pero se diferencia radicalmente de los enfoques existentes en resolución, costo computacional y capacidad de intervención:
| Enfoque | Nivel de análisis | Requiere | Intervención posible | Latencia |
|---|---|---|---|---|
| Verificación CoT | Texto de salida | Múltiples forward passes | Post-hoc (detectar) | ~3-5x |
| SelfCheckGPT | Distribución de salidas | N muestras (N≥5) | Post-hoc (consenso) | ~Nx |
| Entropy de tokens | Distribución logits | 1 forward pass + logits | Post-hoc (umbral) | ~1.05x |
| ITI / SAPLMA | Representaciones internas | Entrenamiento de sonda | Detección en tiempo real | ~1.1x |
| H-Neurons | Neurona FFN individual | Identificación offline única | Detección + supresión + FT | <1.01x |
La ventaja fundamental de H-Neurons: intervención directa. No solo detecta — suprime. Y a diferencia de SelfCheckGPT, no requiere múltiples forward passes. La detección ocurre dentro de un solo pass con latencia adicional despreciable (<5ms).
Preguntas abiertas y limitaciones
Estabilidad temporal
¿Las H-Neurons identificadas en tiempo t siguen siendo predictivas en t+Δt? El paper no evalúa drift de H-Neurons sobre distribuciones que evolucionan. En producción, esto requiere re-evaluación periódica del conjunto de H-Neurons.
Mixture of Experts (MoE)
Todos los modelos evaluados son transformers densos. ¿Se mantiene el fenómeno en Mixtral, Switch Transformer, DeepSeek-V3? El routing entre expertos podría distribuir el mecanismo de sobre-cumplimiento de forma diferente.
Alucinaciones multi-paso
El paper evalúa alucinaciones en respuestas cortas (una entidad). Las alucinaciones complejas en razonamiento multi-paso — premisas intermedias incorrectas que se acumulan — podrían requerir análisis de circuitos más completos que el nivel de neurona individual.
Cuantización
¿La cuantización (INT8, INT4, GPTQ, AWQ) preserva las activaciones de H-Neurons? Si la cuantización agresiva modifica la distribución de activaciones de neuronas específicas, el poder predictivo podría degradarse. Crítico para deployment en edge.
H-Neurons codifican el mecanismo de sobre-cumplimiento. A mayor activación, el modelo prioriza cumplir instrucciones sobre su conocimiento factual. La supresión (α < 1) mueve al modelo hacia la zona ideal. La amplificación (α > 1) lo empuja hacia alucinaciones, sycophancy y jailbreak compliance.
Conclusiones clave
- Menos del 0.1% de las neuronas FFN de un LLM (0.01‰–0.35‰ en Mistral-7B) predicen cuándo el modelo va a alucinar, con generalización robusta entre dominios y familias (Mistral / Gemma / Llama, 4B–70B). Las H-Neurons son una propiedad universal de los transformers, no un artefacto de arquitectura.
- La métrica CETT normaliza la influencia relativa de cada neurona en la dirección del output de su capa — no la magnitud absoluta. Esto permite identificar H-Neurons de forma agnóstica a la dimensión de embedding y comparar entre modelos de distinta escala.
- Amplificar H-Neurons (α > 1) aumenta sistemáticamente sobre-cumplimiento en cuatro dimensiones: premisas inválidas (FalseQA), contexto engañoso (FaithEval), sycophancy y jailbreak. Los modelos pequeños son más sensibles (pendiente ≈ 3.03 vs ≈ 2.40 en grandes).
- Las H-Neurons emergen en el pre-entrenamiento — los scores AUROC en modelos base superan baselines aleatorios. El RLHF y Constitutional AI mitigan la expresión conductual del comportamiento de alucinación pero no modifican el mecanismo subyacente codificado en los pesos base.
- H-Neurons habilitan tres vectores de intervención ortogonales en producción: (1) detección en tiempo real por monitoreo de activaciones (sin modificar pesos, latencia <5ms), (2) supresión por α-scaling en inferencia (sin re-entrenamiento), (3) fine-tuning dirigido con regularización localizada (menor costo que RLHF completo). Los tres pueden combinarse en un stack de defensa en profundidad.
- El hallazgo más disruptivo del paper: H-Neurons conectan alucinación factual, sycophancy y jailbreak compliance como manifestaciones de un mismo circuito de sobre-cumplimiento. Esto sugiere que la defensa contra alucinaciones y la defensa contra jailbreaks pueden abordarse con el mismo mecanismo a nivel de neurona.
