La tesis doctoral de Daniel Kang, defendida en diciembre de 2022 en el Departamento de Ciencias de la Computación de la Universidad de Stanford bajo la dirección de Matei Zaharia y Tatsunori Hashimoto, aborda uno de los retos centrales del análisis moderno de datos: cómo extraer información útil de volúmenes crecientes de datos no estructurados como vídeo, audio y texto, que se generan a razón de exabytes diarios y resultan imposibles de procesar manualmente.
El trabajo parte de dos observaciones clave: muchas aplicaciones toleran respuestas aproximadas siempre que existan garantías estadísticas de precisión, y los métodos existentes para responder consultas sobre datos no estructurados varían en coste hasta en diez órdenes de magnitud. A partir de ahí, Kang diseña sistemas y algoritmos que producen respuestas aproximadas mediante aproximaciones baratas a modelos de aprendizaje automático costosos. Estos sistemas ofrecen respuestas estadísticamente válidas para tipos de consulta como selección, agregación y consultas con límite, con reducciones de coste de varios órdenes de magnitud frente a los métodos estándar.
La segunda mitad de la tesis se centra en el despliegue de aprendizaje automático en entornos críticos, como los vehículos autónomos, donde los modelos suelen operar sin monitorización y los datos de entrenamiento sin verificación. Para ello, el autor propone dos abstracciones: las aserciones de modelo y las aserciones de observación aprendidas, que permiten a expertos de dominio especificar errores tanto en tiempo de despliegue como sobre los datos de entrenamiento. Las evaluaciones muestran que estas aserciones detectan errores con una exhaustividad del 75 % y una precisión del 100 % en conjuntos de datos de vehículos autónomos, analítica de vídeo y medicina.
Los sistemas y abstraciones desarrollados se han desplegado en escenarios reales como la conducción autónoma y el análisis ecológico, lo que demuestra la viabilidad práctica de las contribuciones.
