Home
Skip to main content
xTheus

H-Neurons: el circuito disperso detrás de las alucinaciones en LLMs

Un equipo de investigadores del Instituto de Inteligencia Artificial de Tsinghua publicó en diciembre de 2025 un hallazgo que reencuadra cómo entendemos las alucinaciones en los grandes modelos de lenguaje. El paper demuestra que existe un subconjunto excepcionalmente disperso de neuronas que predice de forma confiable cuándo un LLM va a alucinar. Menos del 0.1% del total de neuronas. En Mistral-7B, el rango es de 0.01‰ a 0.35‰. La implicación es inmediata: las alucinaciones no son ruido estadístico distribuido uniformemente — son un fenómeno localizable e intervenible.

Hallazgo principal — Tsinghua IAI, diciembre 2025

"Un subconjunto sorprendentemente disperso de neuronas — menos del 0.1% del total — puede predecir de forma confiable la ocurrencia de alucinaciones con sólida generalización cross-scenario." Las H-Neurons no son un artefacto de Mistral ni de Llama: aparecen en todas las familias de transformers evaluadas, de 4B a 70B parámetros.

<0.1%
Neuronas que predicen alucinaciones
6
Familias de modelos evaluadas
78.4%
Precisión Mistral-7B / TriviaQA
+16.7pp
Sobre baseline aleatorio (Mistral-7B)

Qué son las H-Neurons y cómo se identifican

El paper define H-Neurons como neuronas en las redes feedforward (FFN) de los transformers cuya activación predice sistemáticamente la ocurrencia de alucinaciones. La identificación combina tres etapas: construcción de un dataset determinista, una métrica de contribución normalizada (CETT) y clasificación dispersa por regresión logística L1.

Pipeline de identificación de H-Neurons
Entrada
TriviaQA
10 muestras/pregunta
1K correcto + 1K incorrecto
CETT
Activaciones FFN
Contribución relativa
Score por neurona
Clasificación
Regresión L1
Pesos positivos
H-Neurons (&lt;0.1%)
Regresión logística regularizada L1 sobre neuronas FFN — los pesos positivos identifican las H-Neurons. La regularización L1 fuerza dispersión máxima: identifica el subconjunto mínimo con mayor poder predictivo (0.01‰–0.35‰ del total).ETAPA 3 · CLASIFICACIÓN
CETT (Contribution of Each neuron to the Total output) — normaliza la magnitud del output proyectado de cada neurona contra el vector total de la capa. Agnóstico a dimensión de embedding: permite comparar entre capas y entre modelos.ETAPA 2 · MÉTRICA CETT
TriviaQA — 1.000 ejemplos correctos + 1.000 incorrectos con comportamiento determinista (consistente en 10 muestras por pregunta). El filtro determinista garantiza que la señal no sea ruido estocástico.ETAPA 1 · DATASET
Métrica CETT — contribución relativa de neurona i en capa l
CETT(i,l)  =  Wout[i]hijWout[j]hj\mathrm{CETT}(i,\,l) \;=\; \frac{\bigl\|\mathbf{W}_{\mathrm{out}}[i]\cdot h_i\bigr\|}{\displaystyle\sum_j \bigl\|\mathbf{W}_{\mathrm{out}}[j]\cdot h_j\bigr\|}
Wout[i]\mathbf{W}_{\mathrm{out}}[i] = columna ii de la matriz de proyección · hih_i = activación de la neurona ii. CETT captura influencia relativa en la dirección del output — no magnitud absoluta.
Función objetivo L1 para identificación de H-Neurons
w^=argminw[  1Nn=1N(ynlnσ(wcn)+(1yn)ln(1σ(wcn)))+λw1  ]\hat{\mathbf{w}} = \arg\min_{\mathbf{w}} \left[\; -\frac{1}{N}\sum_{n=1}^N \Bigl(y_n \ln\sigma(\mathbf{w}^\top \mathbf{c}_n) + (1-y_n)\ln\bigl(1-\sigma(\mathbf{w}^\top \mathbf{c}_n)\bigr)\Bigr) + \lambda\|\mathbf{w}\|_1 \;\right]
yn{0,1}y_n \in \{0,1\} = etiqueta (correcto / alucinación) · cn\mathbf{c}_n = vector CETT para muestra nn · λ\lambda = fuerza de regularización L1. La penalización w1\|\mathbf{w}\|_1 fuerza la mayoría de pesos a cero exacto — solo las neuronas con poder predictivo genuino retienen wi>0w_i > 0 → H-Neurons.
Arquitectura FFN del Transformer — ubicación de H-Neurons
Embedding de entrada · x ∈ ℝᵈMulti-Head Self-AttentionAdd & LayerNormFFN Block (W_up · σ · W_down)Neuronas intermedias (d_ff = 4·d):H-Neuron (predicen alucinación)Neurona regular5/32 = 15.6% (ilustrativo — real <0.1%)Add & LayerNorm → siguiente capa
Densidad de H-Neurons por capa (Mistral-7B-v0.3, 32 capas FFN)
0.35‰0.2‰0.1‰0.01‰Capa / LayerL1L5L9L13L17L21L25L29L32Capas 11-16: máxima concentración de H-Neurons

Las H-Neurons se concentran en las capas intermedias-altas del modelo — precisamente donde investigaciones previas de mechanistic interpretability identifican los circuitos de "knowledge retrieval" y "fact composition".

Distribución CETT: H-Neurons vs. neuronas regulares (Mistral-7B)
CETT scoreDensidadNeuronas regulares (todas las muestras)H-Neurons (alucinación)H-Neurons (respuesta correcta)Zona de separabilidad

Las H-Neurons exhiben distribuciones CETT estadísticamente diferentes entre respuestas correctas e incorrectas. Esta separabilidad es la base de su poder predictivo. Las neuronas regulares muestran distribuciones superpuestas — no pueden distinguir alucinaciones.

Mistral-7B-v0.3Mistral-Small-3.1-24BGemma-3-4BGemma-3-27BLlama-3.1-8BLlama-3.3-70BTriviaQAFalseQAFaithEvalSycophancyJailbreak

Resultados: generalización universal entre familias y escalas

ModeloParámetrosH-Neurons (% total)Precisión TriviaQAvs. baseline aleatorio
Mistral-7B-v0.37B0.01‰ – 0.35‰78.4%+16.7pp
Mistral-Small-3.124B<0.1%Alto~+10pp
Gemma-3-4B4B<0.1%Consistente~+10pp
Gemma-3-27B27B<0.1%Consistente~+10pp
Llama-3.1-8B8B<0.1%Consistente~+10pp
Llama-3.3-70B70B<0.1%Consistente~+10pp

La consistencia entre Mistral, Gemma y Llama — y entre escalas de 4B a 70B — es el resultado más robusto del paper. Las H-Neurons no son un artefacto de una familia de modelos específica: son una propiedad emergente universal de los transformers feedforward. El paper también demuestra generalización cross-scenario: H-Neurons identificadas en TriviaQA predicen alucinaciones en dominios completamente distintos — lo que confirma que capturan un mecanismo general de sobre-cumplimiento, no una señal de dominio factual.

Generalización cross-scenario: AUROC detallado

El hallazgo más provocativo del paper es que H-Neurons identificadas en un escenario (TriviaQA — alucinación factual) predicen comportamientos problemáticos en escenarios semánticamente disjuntos. La siguiente tabla muestra los scores AUROC de transferencia cross-scenario para Mistral-7B-v0.3:

Origen → DestinoAUROC (H-Neurons)AUROC (Random)ΔSignificancia
TriviaQA → TriviaQA0.7840.617+0.167p < 0.001
TriviaQA → FalseQA0.7210.523+0.198p < 0.001
TriviaQA → FaithEval0.6930.510+0.183p < 0.001
TriviaQA → Sycophancy0.6670.498+0.169p < 0.001
TriviaQA → Jailbreak0.6510.505+0.146p < 0.01
Implicación teórica

La generalización cross-scenario es evidencia de que las H-Neurons codifican un mecanismo general de "sobre-cumplimiento" (over-compliance) — no una señal específica de dominio factual. Esto conecta hallucination, sycophancy y jailbreak compliance como manifestaciones del mismo circuito subyacente. Es la primera evidencia a nivel de neurona individual de que estos fenómenos comparten sustrato computacional.

AUROC por familia de modelo y escenario de evaluación
TriviaQAFalseQAFaithEvalSycophancyJailbreakMistral-7BLlama-3.3-70BGemma-3-27B0.80.70.60.5
Información mutua entre activación de H-Neuron y evento de alucinación
I(H;Y)=h{0,1}y{0,1}p(h,y)logp(h,y)p(h)p(y)    I(R;Y)I(H;\,Y) = \sum_{h \in \{0,1\}} \sum_{y \in \{0,1\}} p(h,y) \log \frac{p(h,y)}{p(h)\,p(y)} \;\gg\; I(R;\,Y)
HH = indicador de activación alta de H-Neuron · YY = indicador de alucinación · RR = neurona aleatoria (baseline). La desigualdad se mantiene en todas las capas con H-Neurons para los 6 modelos evaluados.

Cuatro dimensiones de sobre-cumplimiento inducido por α-scaling

El experimento central del paper es la intervención directa: escalar las activaciones de las H-Neurons por un factor α ∈ [0, 3]. El resultado es inequívoco: amplificar H-Neurons (α > 1) aumenta sistemáticamente las tasas de comportamiento problemático en cuatro dimensiones independientes.

Experimento de α-scaling sobre H-Neurons
α=0\alpha = 0
supresión
α=1\alpha = 1
baseline
α=2\alpha = 2
amplificación
α=3\alpha = 3
máxima
Pendiente pequeños
≈ 3.03Mistral-7B, Gemma-3-4B, Llama-3.1-8BMayor sensibilidad a amplificación
Pendiente grandes
≈ 2.40Mistral-Small-24B, Gemma-3-27B, Llama-3.3-70BCierta robustez — no inmunidad
Intervención α-scaling sobre H-Neurons
h~i=αhi,α[0,3]\tilde{h}_i = \alpha \cdot h_i, \quad \alpha \in [0,\,3]
α<1\alpha < 1 → supresión (reduce sobre-cumplimiento) · α=1\alpha = 1 → baseline · α>1\alpha > 1 → amplificación (induce alucinación). Sin modificar pesos θ\theta.
FalseQA

Premisas inválidas

Al amplificar H-Neurons, el modelo acepta con mayor frecuencia afirmaciones factualmente incorrectas presentes en el prompt. La activación de H-Neurons predice cuándo el modelo ignorará su propio conocimiento para cumplir con la premisa de la pregunta.

FaithEval

Contexto engañoso

Ante contexto que contradice el conocimiento del modelo, la amplificación aumenta la tasa de adopción del contexto engañoso. H-Neurons altas = mayor probabilidad de que el modelo "creer" el contexto sobre su entrenamiento.

Sycophancy

Tendencia aduladora

Con α > 1, el modelo tiende a validar las preferencias expresadas por el usuario incluso cuando son incorrectas. La correlación con H-Neurons sugiere que sycophancy y alucinación factual comparten mecanismo subyacente.

Jailbreak

Instrucciones dañinas

La amplificación incrementa la tasa de cumplimiento ante intentos de jailbreak. Las H-Neurons parecen ser el mecanismo de "sobre-cumplimiento" general — del que las alucinaciones factuales son una manifestación específica.

Tasa de sobre-cumplimiento vs. factor α — todas las familias
100%75%50%25%0%Tasa de sobre-cumplimientoα=0α=1α=2α=3Factor de escala αbaselineZona de supresión(α < 1)Zona de amplificación(α > 1)Mistral-7B (pendiente ≈ 3.03)Llama-3.3-70B (pendiente ≈ 2.40)Gemma-3-4B (pendiente ≈ 3.15)

Los modelos más pequeños exhiben pendientes más pronunciadas: son más sensibles a la amplificación de H-Neurons. La relación es aproximadamente lineal con R² > 0.94 en todos los modelos. La zona de supresión (α < 1) reduce consistentemente las tasas de sobre-cumplimiento sin degradar capacidades generales del modelo.

Efectividad de supresión: reducción relativa de sobre-cumplimiento
ΔOC(α)=OC(α=1)OC(α)OC(α=1)×100%,α[0.3,0.8]\Delta_{\mathrm{OC}}(\alpha) = \frac{\mathrm{OC}(\alpha=1) - \mathrm{OC}(\alpha)}{\mathrm{OC}(\alpha=1)} \times 100\%, \quad \alpha \in [0.3,\, 0.8]
OC(α)\mathrm{OC}(\alpha) = tasa de sobre-cumplimiento a factor α\alpha. En Mistral-7B: ΔOC(0.5)38%\Delta_{\mathrm{OC}}(0.5) \approx 38\% — reducción de más de un tercio del sobre-cumplimiento sin re-entrenamiento, solo con intervención en inferencia.

Origen en pre-entrenamiento: RLHF no elimina el mecanismo

Transferibilidad AUROC — H-Neurons de modelo tuned → modelo base
AUROC ⁣(Htuned,  Dbase)    AUROC ⁣(Hrand,  Dbase)\mathrm{AUROC}\!\left(\mathcal{H}_{\mathrm{tuned}},\; \mathcal{D}_{\mathrm{base}}\right) \;\gg\; \mathrm{AUROC}\!\left(\mathcal{H}_{\mathrm{rand}},\; \mathcal{D}_{\mathrm{base}}\right)
Htuned\mathcal{H}_{\mathrm{tuned}} = H-Neurons identificadas en modelo instruction-tuned · Dbase\mathcal{D}_{\mathrm{base}} = dataset de evaluación en modelo base · Hrand\mathcal{H}_{\mathrm{rand}} = neuronas aleatorias (baseline). La desigualdad se cumple en los 6 modelos evaluados.
Pre-entrenamiento
H-Neurons emergen aquí
AUROC supera baseline en modelos base
Alta normalized-rank → mínima modificación post
El mecanismo se fija en los pesos base
Fine-tuning (RLHF / SFT)
No elimina H-Neurons
No modifica sustancialmente su influencia
Mitiga la expresión del comportamiento
No toca el mecanismo subyacente

El análisis de transferibilidad AUROC es la pieza de evidencia más importante: los autores toman H-Neurons identificadas en modelos instruction-tuned y verifican su poder predictivo en los modelos base correspondientes (antes del RLHF). Los scores AUROC superan consistentemente los baselines aleatorios — lo que prueba que las H-Neurons no son creadas por el fine-tuning: estaban ahí antes. El análisis de parámetros confirma: las H-Neurons se concentran en la región de "high-normalized-rank", indicando que sus valores cambian mínimamente durante RLHF y SFT. RLHF y Constitutional AI pueden suprimir la expresión de alucinaciones — pero dejan el mecanismo intacto.

Tres vectores de intervención en producción

Vector 1 · Sin modificar pesos

Detección en tiempo real

Monitorear activaciones de H-Neurons durante la inferencia. Cuando superan el umbral, emitir un score de confianza bajo o bloquear la respuesta. Implementable hoy con acceso a estados intermedios del modelo — sin re-entrenamiento.

Vector 2 · En inferencia

Supresión α-scaling

Aplicar α < 1 a las activaciones de H-Neurons identificadas durante el forward pass. Reduce la tasa de sobre-cumplimiento sin re-entrenar. Preserva capacidad general del modelo — solo atenúa el circuito de alucinación.

Vector 3 · Fine-tuning dirigido

Regularización localizada

Fine-tuning con regularización específica sobre H-Neurons: penalizar activaciones altas en contextos de sobre-cumplimiento. Más eficiente que RLHF completo — trabaja en el mecanismo, no solo en la expresión conductual.

Combinación ortogonal

Stack de gobernanza LLM

Los tres vectores son ortogonales: pueden combinarse. Detección en tiempo real para alertas, α-scaling para supresión inmediata, fine-tuning dirigido para reducción permanente. Arquitectura de defensa en profundidad contra alucinaciones.

Stack de gobernanza LLM con H-Neurons
Identificación offline
Dataset determinista (TriviaQA-style)Cómputo CETT por capa y neuronaRegresión L1 → índices de H-Neurons
Monitoreo en inferencia
Hook en forward pass (activaciones H-Neuron)Score de confianza anti-alucinaciónLatencia adicional &lt;5ms
Supresión activa
α-scaling en forward pass (α ∈ [0.3, 0.8])Umbral configurable por dominioSin re-entrenamiento — runtime solo
Mejora permanente
Fine-tuning con regularización H-NeuronEntrenamiento adversarial localizadoMenor costo que RLHF completo
Trazabilidad
Log de activaciones H-Neuron por respuestaAuditoría post-incidente con evidencia neuronal
Distribución de rango normalizado: H-Neurons vs. neuronas aleatorias (base vs. instruction-tuned)
Rango normalizado (0 = menor cambio en RLHF, 1 = mayor cambio)Frecuencia relativaH-Neurons: rango bajo→ RLHF casi no las modificaNeuronas aleatoriasH-Neurons

Las H-Neurons se concentran en la región de bajo rango normalizado: sus pesos casi no cambian durante el RLHF. Esto demuestra que el mecanismo de alucinación se fija durante el pre-entrenamiento y es resiliente al alignment posterior.

Implementación en producción: pseudo-código y arquitectura

Para ingenieros que quieran implementar detección y supresión de H-Neurons en producción, el pipeline se compone de tres fases: identificación offline, monitoreo en inferencia, y supresión activa. El siguiente pseudo-código muestra la implementación en PyTorch con hooks de forward pass:

Pipeline de implementación — tres fases
Fase 1 · Offline
Dataset determinista
Forward pass completo
Calcular CETT por neurona
L1-logreg → índices H
Fase 2 · Runtime
Hook FFN layers
Leer activaciones H
Score confianza
Log + alerta
Fase 3 · Supresión
α-scaling hook
h_i ← α · h_i
Validar output
Servir respuesta
import torch
from sklearn.linear_model import LogisticRegression
import numpy as np

# ── Phase 1: Offline H-Neuron Identification ──
def compute_cett(model, dataloader, layer_indices):
    """Compute CETT scores for all FFN neurons."""
    cett_all = []  # shape: (N_samples, N_layers, N_neurons)
    labels = []
    
    for batch in dataloader:
        activations = {}
        hooks = []
        # Register hooks on FFN intermediate layers
        for l_idx in layer_indices:
            ffn = model.layers[l_idx].mlp
            def hook_fn(module, input, output, l=l_idx):
                activations[l] = output  # (batch, seq, d_ff)
            hooks.append(ffn.register_forward_hook(hook_fn))
        
        with torch.no_grad():
            logits = model(**batch['input'])
        
        # Compute CETT per neuron per layer
        for l_idx in layer_indices:
            h = activations[l_idx][:, -1, :]      # last token
            W_out = model.layers[l_idx].mlp.down_proj.weight
            projected = h.unsqueeze(-1) * W_out.T  # (batch, d_ff, d)
            norms = projected.norm(dim=-1)          # (batch, d_ff)
            cett = norms / norms.sum(dim=-1, keepdim=True)
            cett_all.append(cett.cpu().numpy())
        
        for h in hooks: h.remove()
    
    return np.concatenate(cett_all), np.array(labels)

# L1 logistic regression → H-Neuron indices
def identify_h_neurons(cett_matrix, labels, C=0.01):
    clf = LogisticRegression(
        penalty='l1', C=C, solver='saga', max_iter=5000
    )
    clf.fit(cett_matrix, labels)
    h_indices = np.where(clf.coef_[0] > 0)[0]
    return h_indices  # typically <0.1% of total neurons

# ── Phase 2: Runtime Monitoring ──
class HNeuronMonitor:
    def __init__(self, model, h_indices, layer_idx, alpha=1.0):
        self.h_indices = h_indices
        self.alpha = alpha
        self.scores = []
        
        ffn = model.layers[layer_idx].mlp
        ffn.register_forward_hook(self._hook)
    
    def _hook(self, module, input, output):
        h_act = output[:, -1, self.h_indices]
        score = h_act.abs().mean().item()
        self.scores.append(score)
        
        # Phase 3: α-scaling suppression
        if self.alpha != 1.0:
            output[:, :, self.h_indices] *= self.alpha
        return output
    
    def confidence(self, threshold=0.5):
        """Anti-hallucination confidence: 1.0 = safe."""
        return 1.0 - min(self.scores[-1] / threshold, 1.0)

Comparación con enfoques previos de detección de alucinaciones

H-Neurons no es el primer intento de detectar o mitigar alucinaciones en LLMs. Pero se diferencia radicalmente de los enfoques existentes en resolución, costo computacional y capacidad de intervención:

EnfoqueNivel de análisisRequiereIntervención posibleLatencia
Verificación CoTTexto de salidaMúltiples forward passesPost-hoc (detectar)~3-5x
SelfCheckGPTDistribución de salidasN muestras (N≥5)Post-hoc (consenso)~Nx
Entropy de tokensDistribución logits1 forward pass + logitsPost-hoc (umbral)~1.05x
ITI / SAPLMARepresentaciones internasEntrenamiento de sondaDetección en tiempo real~1.1x
H-NeuronsNeurona FFN individualIdentificación offline únicaDetección + supresión + FT<1.01x

La ventaja fundamental de H-Neurons: intervención directa. No solo detecta — suprime. Y a diferencia de SelfCheckGPT, no requiere múltiples forward passes. La detección ocurre dentro de un solo pass con latencia adicional despreciable (&lt;5ms).

Evolución de la detección de alucinaciones en LLMs (2022–2025)
2022202320242025SelfCheckGPT(sampling)HaluEval(benchmark)ITI(probing)SAPLMA(sondas internas)H-Neurons(neurona individual + intervención)Texto → Distribución → Representación → Neurona individual (resolución creciente)

Preguntas abiertas y limitaciones

Limitación 1

Estabilidad temporal

¿Las H-Neurons identificadas en tiempo t siguen siendo predictivas en t+Δt? El paper no evalúa drift de H-Neurons sobre distribuciones que evolucionan. En producción, esto requiere re-evaluación periódica del conjunto de H-Neurons.

Limitación 2

Mixture of Experts (MoE)

Todos los modelos evaluados son transformers densos. ¿Se mantiene el fenómeno en Mixtral, Switch Transformer, DeepSeek-V3? El routing entre expertos podría distribuir el mecanismo de sobre-cumplimiento de forma diferente.

Limitación 3

Alucinaciones multi-paso

El paper evalúa alucinaciones en respuestas cortas (una entidad). Las alucinaciones complejas en razonamiento multi-paso — premisas intermedias incorrectas que se acumulan — podrían requerir análisis de circuitos más completos que el nivel de neurona individual.

Limitación 4

Cuantización

¿La cuantización (INT8, INT4, GPTQ, AWQ) preserva las activaciones de H-Neurons? Si la cuantización agresiva modifica la distribución de activaciones de neuronas específicas, el poder predictivo podría degradarse. Crítico para deployment en edge.

Definición formal — Propiedad de H-Neuron
NiH    w^i>0    AUROC(CETTi,  y)>τAUROC    AUROCcross>τcross\mathcal{N}_i \in \mathcal{H} \iff \hat{w}_i > 0 \;\land\; \mathrm{AUROC}\bigl(\mathrm{CETT}_i,\; \mathbf{y}\bigr) > \tau_{\mathrm{AUROC}} \;\land\; \mathrm{AUROC}_{\mathrm{cross}} > \tau_{\mathrm{cross}}
Ni\mathcal{N}_i = neurona ii · w^i\hat{w}_i = peso L1 estimado · τAUROC\tau_{\mathrm{AUROC}} = umbral AUROC in-domain · τcross\tau_{\mathrm{cross}} = umbral cross-scenario. Las tres condiciones son necesarias: peso L1 positivo, poder predictivo in-domain y generalización cross-scenario.
Tradeoff conocimiento-cumplimiento: el modelo teórico de H-Neurons
Cumplimiento de instrucciones →Fidelidad factual →Frontera de ParetoZona ideal: alto conocimiento,cumplimiento moderadoZona de riesgo:alto cumplimiento → alucinación(H-Neurons activas)α=0.5 (supresión)α=1.0 (baseline)α=2.0 (amplificación)

H-Neurons codifican el mecanismo de sobre-cumplimiento. A mayor activación, el modelo prioriza cumplir instrucciones sobre su conocimiento factual. La supresión (α < 1) mueve al modelo hacia la zona ideal. La amplificación (α > 1) lo empuja hacia alucinaciones, sycophancy y jailbreak compliance.

Conclusiones clave

  • Menos del 0.1% de las neuronas FFN de un LLM (0.01‰–0.35‰ en Mistral-7B) predicen cuándo el modelo va a alucinar, con generalización robusta entre dominios y familias (Mistral / Gemma / Llama, 4B–70B). Las H-Neurons son una propiedad universal de los transformers, no un artefacto de arquitectura.
  • La métrica CETT normaliza la influencia relativa de cada neurona en la dirección del output de su capa — no la magnitud absoluta. Esto permite identificar H-Neurons de forma agnóstica a la dimensión de embedding y comparar entre modelos de distinta escala.
  • Amplificar H-Neurons (α > 1) aumenta sistemáticamente sobre-cumplimiento en cuatro dimensiones: premisas inválidas (FalseQA), contexto engañoso (FaithEval), sycophancy y jailbreak. Los modelos pequeños son más sensibles (pendiente ≈ 3.03 vs ≈ 2.40 en grandes).
  • Las H-Neurons emergen en el pre-entrenamiento — los scores AUROC en modelos base superan baselines aleatorios. El RLHF y Constitutional AI mitigan la expresión conductual del comportamiento de alucinación pero no modifican el mecanismo subyacente codificado en los pesos base.
  • H-Neurons habilitan tres vectores de intervención ortogonales en producción: (1) detección en tiempo real por monitoreo de activaciones (sin modificar pesos, latencia &lt;5ms), (2) supresión por α-scaling en inferencia (sin re-entrenamiento), (3) fine-tuning dirigido con regularización localizada (menor costo que RLHF completo). Los tres pueden combinarse en un stack de defensa en profundidad.
  • El hallazgo más disruptivo del paper: H-Neurons conectan alucinación factual, sycophancy y jailbreak compliance como manifestaciones de un mismo circuito de sobre-cumplimiento. Esto sugiere que la defensa contra alucinaciones y la defensa contra jailbreaks pueden abordarse con el mismo mecanismo a nivel de neurona.