The Annotated JEPA, obra de Elon Litman, es un recorrido técnico, anotado y desde cero por las Joint Embedding Predictive Architectures (JEPA), siguiendo el espíritu de The Annotated Transformer. Su propósito es construir el modelo completo, explicar cada componente y cerrar con un bucle de entrenamiento funcional.
La JEPA es la propuesta de Yann LeCun ante una cuestión central del aprendizaje autosupervisado: cómo entrenar un modelo para entender el mundo sin etiquetas, sin colapsar en soluciones triviales y sin desperdiciar capacidad en detalles irrelevantes. La respuesta es predecir en el espacio de representaciones, no en el espacio de píxeles ni en el de tokens.
El texto toma como hilo conductor la I-JEPA, instancia para imágenes que aprende representaciones semánticas prediciendo las zonas enmascaradas a partir del contexto visible, un enfoque no generativo y sin aumentaciones manuales. A partir de ahí se extiende a vídeo con V-JEPA y V-JEPA 2, y se examina LeJEPA, intento reciente de sustituir las heurísticas de ingeniería por un regularizador distribucional.
El artículo expone la plantilla JEPA: dos codificadores para las observaciones x e y, un predictor que estima la representación del objetivo y una función de distancia que mide el error en el espacio latente. Frente a la reconstrucción píxel a píxel, predecir en representación obliga a los codificadores a capturar estructura semántica y a descartar ruido de alta frecuencia. Un apartado clave aborda el colapso, la trampa en la que todas las salidas se vuelven idénticas y la pérdida cae a cero sin utilidad, y cómo la I-JEPA lo evita con una asimetría entre los codificadores de contexto y de objetivo.
La implementación prescinde de optimizaciones de producción (FlashAttention, punto flotante mixto, batching a gran escala) para mantener el foco en la matemática. El resultado es un manual pedagógico que combina derivación teórica, código funcional y discusión crítica de las limitaciones del método.
