Home
Skip to main content
xTheus

AMI Labs y JEPA: la apuesta de LeCun por World Models frente a los LLMs

El 19 de diciembre de 2025, Yann LeCun confirmó lo que el sector llevaba meses especulando: lanzó una nueva empresa dedicada al desarrollo de world models. La startup, identificada como AMI Labs, busca una valoración superior a los $5 mil millones. LeCun no ocupará el cargo de CEO. Lo que sí llevará es la tesis técnica que ha defendido públicamente desde 2022: los LLMs no pueden razonar, y el futuro de la inteligencia artificial pasa por arquitecturas que aprendan modelos del mundo físico.

$5B+
Valoración buscada
3+
Años de investigación JEPA en Meta FAIR
2-6×
Eficiencia de muestra vs. difusión (V-JEPA 2)
I·V·W
Generaciones JEPA (Image → Video → World)
Tesis fundacional — 2022

"Los LLMs generan texto estadísticamente plausible. No entienden el mundo. No pueden planificar. No pueden aprender como aprenden los animales — a partir de la observación del mundo físico. Una máquina que solo predice el siguiente token nunca alcanzará inteligencia de nivel humano." — Yann LeCun, A Path Towards Autonomous Machine Intelligence (2022)

Las tres limitaciones estructurales de los LLMs

La posición de LeCun no es nueva. Desde su paper de 2022 argumenta que los LLMs presentan tres limitaciones que ningún escalado puede resolver. No son limitaciones de datos, ni de parámetros, ni de cómputo — son limitaciones de paradigma.

Limitación 01

Sin modelo del mundo

Un LLM predice el siguiente token en una secuencia. No mantiene ningún estado interno del mundo. No "sabe" que los objetos caen, que las puertas se abren o que el fuego quema — solo ha visto esas frases juntas muchas veces.

Limitación 02

Sin planificación continua

Los LLMs operan en espacios discretos de tokens. Los entornos físicos y de decisión son continuos: (s, a) ∈ S × A. La cadena de pensamiento simula planificación pero no puede navegar espacios de estado continuos ni optimizar trayectorias con restricciones dinámicas.

Limitación 03

Correlación ≠ causalidad

El pretraining por predicción de tokens maximiza coherencia estadística, no comprensión causal. Un modelo puede responder correctamente "si suelto la pelota cae" sin haber aprendido ningún mecanismo causal — solo co-ocurrencia de texto en billones de documentos.

La apuesta

JEPA → W-JEPA

Joint Embedding Predictive Architecture no genera en el espacio de observación. Aprende representaciones abstractas y predice estados futuros en ese espacio — lo que habilita planificación multi-paso, razonamiento causal y comprensión física sin necesidad de producir píxeles ni tokens.

Arquitectura JEPA: la matemática del paradigma

La intuición central de JEPA es minimizar distancias en espacio de representaciones, no reconstruir señales. El encoder aprende a comprimir x en s_x — eliminando detalles perceptuales irrelevantes. El predictor aprende a predecir s_y a partir de s_x. La clave: nunca se reconstruye y en el espacio de píxeles o tokens.

JEPA: Forward Pass (entrenamiento)
Contexto xx
Encoder E()E(\cdot)
sx=E(x)s_x = E(x)
Predictor P()P(\cdot)
s^y=P(sx)\hat{s}_y = P(s_x)
Loss
s^ysy2\|\hat{s}_y - s_y\|^2
Target
Target y (región enmascarada)s_y = E(y)Stop-gradient (EMA)
Clave
No se reconstruye ySin decoder generativoSemántica, no píxeles
Objetivo de entrenamiento JEPA
minθ,ϕ  (x,y)D ⁣(Pθ ⁣(Eϕ(x)),  sg ⁣[Eϕ(y)])\min_{\theta,\phi}\; \sum_{(x,y)} D\!\left( P_\theta\!\left(E_\phi(x)\right),\; \mathrm{sg}\!\left[E_\phi(y)\right] \right)
θ\theta = parámetros del predictor · ϕ\phi = parámetros del encoder · sg[]\mathrm{sg}[\cdot] = stop-gradient · DD = distancia en embedding space
Diferencia con LLMs (autoregresivo)
LLM:maxθ  tlogPθ ⁣(xtx<t)\text{LLM:}\quad \max_{\theta}\;\sum_t \log P_\theta\!\left(x_t \mid x_{<t}\right)
El LLM maximiza probabilidad de secuencias de tokens — espacio discreto, sin modelo del mundo, sin planificación

Inferencia: LLM vs. W-JEPA en planificación

Cómo planifica cada paradigma
LLM CoT
Prompt
Token 1
Token 2…n
Respuesta
W-JEPA
Estado s₀
Predictor multi-paso
Trayectoria latente
Acción óptima

La diferencia operativa es crítica. Un LLM genera tokens uno a uno: cada token condiciona al siguiente pero no puede "retroceder" a modificar una decisión anterior. W-JEPA opera en un espacio de estados continuos donde el predictor puede optimizar una trayectoria completa antes de ejecutar la primera acción — el equivalente a planificar mentalmente el recorrido antes de empezar a caminar. V-JEPA 2 ya demostró razonamiento físico emergente (predicción de péndulos, caídas, colisiones) sin supervisión explícita de física — solo como consecuencia de predecir en espacio latente.

La familia JEPA: de imagen a mundo físico

W-JEPA — estados continuos, física integrada, planificación multi-paso. Objetivo de AMI Labs para robótica y sistemas de decisión autónomos.W-JEPA · EN DESARROLLO
V-JEPA 2 — predicción temporal en espacio latente de video. Razonamiento físico emergente (péndulos, caídas, colisiones). Eficiencia 2-6× vs. difusión.V-JEPA 2 · 2024
V-JEPA 1 — predicción con máscaras espacio-temporales. Primera demostración de representaciones semánticas de video sin reconstrucción. Meta FAIR, 2024.V-JEPA 1 · 2024
I-JEPA — representaciones semánticas de imágenes sin augmentaciones supervisadas. Supera MAE y BEiT en benchmarks lineales. Meta FAIR, 2023.I-JEPA · 2023

JEPA vs LLMs vs Modelos de Difusión: análisis comparativo

DimensiónJEPA / W-JEPALLM (GPT / Claude)Difusión (Sora / DALL·E)
Objetivo de entrenamientoPredecir representaciones (embedding space)Predecir token siguiente (max log-likelihood)Reconstruir señal completa (denoising)
Espacio de operaciónContinuo (latente)Discreto (vocabulario)Continuo (píxeles)
Razonamiento causalEstructural — en la arquitecturaEmergente — frágil, falsa-causalidadAusente
Planificación multi-pasoNativa en espacio latente (trayectorias)Chain of thought — sin estado continuoNo aplica
Eficiencia de muestraAlta — 2-6× vs. difusión (V-JEPA 2)Baja — escala (trillones de tokens) compensaMedia
Física integradaObjetivo central de W-JEPANo — correlación lingüística de físicaParcial (apariencia, no mecánica)
Aplicaciones naturalesRobótica, simulación, control autónomoNLP, código, razonamiento simbólicoGeneración de contenido

AMI Labs: estructura y contexto del spinout

Rol de LeCun

No será CEO

El patrón clásico de spinout científico: el fundador técnico lidera la visión, un operador externo gestiona la empresa. LeCun aporta la tesis; otro ejecutivo la convierte en negocio.

Origen de la investigación

Meta FAIR

I-JEPA y V-JEPA fueron desarrollados en Meta FAIR. Las aplicaciones de W-JEPA (robótica, hardware-in-the-loop) no encajan en el modelo de negocio publicitario de Meta — de ahí el spinout.

Valoración objetivo

$5B+

Una ronda de este tamaño implica respaldo de fondos tier-1. La apuesta: que W-JEPA puede entrenarse con eficiencia comparable a LLMs actuales en dominios donde los LLMs tienen límites estructurales.

Confirmación pública

19 dic. 2025

Descrito por la prensa como "el secreto peor guardado del mundo tech." La especulación del sector anticipó el anuncio por meses — lo que confirma que el interés de capital fue anterior a la confirmación pública.

robótica industrialsimulación físicaplanificación autónomacontrol dexterousrazonamiento causalworld modelinghardware-in-the-loopinferencia en edge

Stack de producción para W-JEPA: arquitectura de referencia

W-JEPA · Stack de producción (referencia)
Datos de mundo
Video real (cámaras RGB-D)Simulaciones físicas (Isaac Lab)Datos de sensores (IMU, LIDAR)
Pretraining JEPA
Encoder E(·) — ViT espaciotemporalPredictor P(·) — transformerClúster DGX — GPU masiva
Planificador W-JEPA
Optimización de trayectorias (latente)Razonamiento causal multi-pasoSimulación de consecuencias
Gobernanza
Trazabilidad de decisionesGuardrails físicos certificadosAuditoría post-acción
Edge / Actuador
Inferencia &lt;50ms (Jetson / FPGA)Acción motora / decisión

Cronología: de JEPA a AMI Labs

2022
"A Path Towards Autonomous Machine Intelligence"
LeCun publica el paper fundacional describiendo JEPA y las tres limitaciones estructurales de los LLMs. El documento circula extensamente en la comunidad de investigación.
2023
I-JEPA (Meta FAIR)
Primera implementación pública. Image JEPA supera a MAE y BEiT en benchmarks lineales con menor costo computacional. Sin augmentaciones supervisadas — representaciones semánticas emergentes.
2024
V-JEPA 1 y V-JEPA 2
V-JEPA 2 demuestra eficiencia 2-6× superior y capacidades emergentes de razonamiento físico (péndulos, caídas, colisiones) sin supervisión de física. Validación del paradigma en dominios temporales.
dic. 2025
AMI Labs — confirmación pública
LeCun confirma la startup el 19 de diciembre. Valoración buscada: $5B+. Estructura: LeCun como chief scientist, CEO externo. Foco: W-JEPA para entornos físicos y decisión autónoma.
2026+
W-JEPA
Objetivo declarado: modelo del mundo físico con planificación nativa en espacio de estados continuos. Aplicaciones: robótica industrial, simulación física, sistemas de decisión autónomos con física integrada.

Conclusiones clave

  • JEPA no genera: predice distancias en espacio de representaciones abstractas. Elimina la reconstrucción de detalles perceptuales irrelevantes y logra eficiencia de muestra 2-6× superior a modelos de difusión equivalentes (V-JEPA 2).
  • Las tres limitaciones estructurales de los LLMs son de paradigma, no de escala: sin modelo del mundo, sin planificación en espacios continuos, correlación estadística en lugar de causalidad. Ningún escalado en parámetros o tokens las resuelve.
  • V-JEPA 2 demostró razonamiento físico emergente (péndulos, caídas, colisiones) sin supervisión explícita de física — validando que predecir en espacio latente es suficiente para aprender mecánica.
  • AMI Labs busca $5B+ con LeCun como chief scientist (no CEO). El spinout de Meta FAIR es natural: W-JEPA para robótica y hardware-in-the-loop es incompatible con el modelo de negocio publicitario de Meta.
  • Para sistemas de decisión en producción, W-JEPA habilita lo que los LLMs no pueden: trayectorias latentes multi-paso, simulación de consecuencias y razonamiento contrafáctico en espacios de estado continuos.