Netflix ha presentado GenRec, un ranker de recomendaciones respaldado por un modelo de lenguaje grande (LLM) entrenado a medida con datos y objetivos específicos de su plataforma. El sistema sustituye buena parte de las miles de features artesanales del stack actual por verbalización del historial de usuario, los metadatos de los títulos y el contexto de la sesión, que se introducen en el modelo como texto en lenguaje natural.
El entrenamiento se divide en dos fases: una primera de adaptación de un LLM de código abierto sobre corpus propietarios de Netflix para que aprenda a entender su catálogo y el comportamiento de los miembros, y una segunda de post-entrenamiento orientada a ranking, con pérdidas ponderadas por recompensa que alinean al modelo con objetivos de negocio y valor a largo plazo. Durante el aprendizaje, los eventos de interacción —visualizaciones, reproducciones, valoraciones, abandonos— se convierten en conversaciones usuario–recomendador, lo que permite combinar objetivos de modelado de lenguaje y de ranking.
Un punto clave es la ingeniería de contexto: para mantener el presupuesto de tokens, GenRec conserva los eventos de alta señal, descarta los de bajo valor y resume o comprime los comportamientos repetitivos. En inferencia opera en modo prefill-only sobre la infraestructura de servicio de LLM de Netflix, lo que abarata costes. En un test A/B a gran escala frente al ranker de producción, GenRec logró mejoras estadísticamente significativas en métricas online de corto y largo plazo usando solo una pequeña fracción de los datos etiquetados y de las señales de entrada de la fase 2, según describe el equipo en el blog técnico de la compañía.
