derivadas.dev

Pablo Díaz Viñambres

MSc Informatics @ TUM

UniversityHack

Data AnalysisPythonHackathones


Para esta competición de análisis de datos, mis compañeros Pablo Landrove Pérez-Gorgoroso, Xiana Carrera y yo desarrollamos una pipeline end-to-end para predecir el rendimiento de producción en la fabricación de antígenos en biorreactores. El reto consistía en tomar conjuntos de datos grandes y desestructurados, desde logs generales de lotes hasta lecturas de sensores de alta frecuencia, y transformarlos a un formato unificado para entender qué factores impulsan realmente un cultivo exitoso.

Pipeline architecture.

Primero limpiamos los datos a través de varias fases de fabricación (pre-inoculación, inoculación y cultivo final) y seleccionamos las variables más relevantes para explicar la producción. Después entrenamos un modelo de machine learning predictivo para estimar los rendimientos y aplicamos herramientas de interpretabilidad para explicar los resultados. Vimos que factores como los niveles mínimos de glucosa, cambios en la turbidez del fluido e incluso la humedad ambiental de la sala de cultivo estaban entre los predictores más fuertes del éxito del proceso.

Important variables for production yields.

Nuestro equipo consiguió el primer puesto en la fase local de la USC y se clasificó para la fase nacional. A nivel personal, este proyecto me ayudó a profundizar mucho en modelos clásicos de Machine Learning y en workflows de análisis de datos complejos.