Data Projects: cómo Netflix gestiona millones de tablas y flujos con identidades duraderas

Fuentes: Data Projects: Managing Data Assets at Netflix Scale

El equipo de plataforma de datos de Netflix ha presentado Data Projects, una abstracción diseñada para resolver dos problemas persistentes en la gestión de sus activos de datos a gran escala: los permisos de acceso, hasta ahora ligados a cada tabla individual, y la identidad bajo la que se ejecutan los flujos programados, históricamente asociada al ingeniero que los creó.

La plataforma de datos de Netflix gestiona millones de tablas en su almacén y decenas de miles de cargas programadas en sistemas de orquestación como Maestro. Cuando una persona cambia de equipo o deja la empresa, los flujos que creó heredan esos cambios y dejan de funcionar; el patrón habitual era reemplazarlos por la identidad de un colega, con permisos distintos, lo que generaba un ciclo de averías sucesivas. Además, la gestión de permisos tabla por tabla hacía que, ante cada reorganización, los equipos de soporte recibieran un volumen elevado de solicitudes y que, en la práctica, los accesos se abrieran a toda la compañía.

Data Projects agrupa tablas, flujos y otros activos bajo un contenedor lógico común y le asigna una identidad sintética, duradera y asumible, independiente del ciclo de vida de cualquier persona. Cada proyecto concede roles —como Contributor o Viewer— a usuarios, grupos, aplicaciones o trabajos de integración continua, y opcionalmente se asocia a un rol de AWS IAM intercambiable de forma segura con la identidad del proyecto en Netflix. Los activos creados por flujos que corren bajo esa identidad se adscriben automáticamente al proyecto, un comportamiento que la compañía denomina "gravedad". De este modo se unifica el control de acceso, se desacoplan los flujos de los ingenieros que los escribieron y se reduce la carga operativa de soporte.