Blog | Empresa | | 3 minutos de lectura

Steffen Kläbe gana el premio a la mejor comunicación en la Conferencia EDBT/ICDT 2023

Steffen gana el premio al mejor artículo de la conferencia

Resumen

  • Steffen Kläbe, ingeniero de investigación de Actian, recibió el premio al mejor artículo en la conferencia conjunta EDBT/ICDT de 2023 celebrada en Grecia.
  • Su investigación, galardonada, sobre la partición multiclave por parches traslada la partición de datos a un problema de grafos para lograr un rendimiento robusto en las consultas.
  • La metodología de partición propuesta evita la compleja replicación de datos, al tiempo que mejora significativamente la coherencia en las tablas de grandes bases de datos analíticas.
  • En una segunda ponencia se evaluaron las técnicas de «ModelJoin» para integrar de forma fluida las cargas de trabajo de inferencia de aprendizaje automático directamente en los motores de bases de datos.

Nos gustaría rendir homenaje a Steffen Kläbe, ingeniero de investigación de Actian en Ilmenau (Turingia, Alemania). Asistió a la conferencia conjunta EDBT/ICDT de 2023 celebrada en Grecia, una de las conferencias más importantes del mundo sobre bases de datos, donde presentó dos artículos de investigación. Por su investigación sobre «Particionamiento multiclave parcheado para un rendimiento robusto de las consultas» recibió el premio al mejor artículo. En la comunidad investigadora, este premio supone un gran éxito.

Ver el resumen: 

«La partición de datos es la clave para el procesamiento paralelo de consultas en los sistemas modernos de bases de datos analíticas. Elegir la clave de partición adecuada para un conjunto de datos determinado es una tarea difícil y crucial para el rendimiento de las consultas. Los almacenes de datos del mundo real contienen un gran número de tablas conectadas mediante esquemas complejos, lo que da lugar a una cantidad abrumadora de posibles claves de partición. En este artículo, presentamos el enfoque de la partición multiclave con parches, que permite definir varias claves de partición simultáneamente sin necesidad de replicar los datos. La idea principal consiste en mapear el problema de partición de tablas relacionales a un problema de partición de grafos, con el fin de utilizar algoritmos existentes de partición de grafos para encontrar componentes de conectividad en los datos y gestionar por separado las excepciones (parches) a la partición. Demostramos que la partición multiclave con parches ofrece oportunidades para lograr un rendimiento robusto de las consultas, es decir, alcanzar un rendimiento razonablemente bueno para muchas consultas en lugar de un rendimiento óptimo solo para unas pocas.» 

Documento adicionalde Kläbe Exploración de enfoques para ML en bases de datos aborda el papel cada vez más importante que desempeña la integración de modelos de ML con marcos especializados de clasificación o predicción.

Ver el resumen:

«Los sistemas de bases de datos ya no se utilizan únicamente para el almacenamiento de datos estructurados simples y análisis básicos. La integración de modelos de aprendizaje automático (ML), como las redes neuronales, con marcos especializados, y su uso para la clasificación o la predicción, desempeña un papel cada vez más importante. Sin embargo, el uso de dichos modelos con datos almacenados en un sistema de bases de datos podría requerir la descarga de los datos y la realización de los cálculos fuera del sistema. En este artículo, evaluamos enfoques para integrar la etapa de inferencia de aprendizaje automático como un operador de consulta especial: el ModelJoin. Exploramos varias opciones para esta integración en diferentes niveles de abstracción: la representación relacional de los modelos, así como consultas SQL para la inferencia; el uso de funciones definidas por el usuario (UDF); el uso de API para entornos de ejecución de aprendizaje automático existentes; y una implementación nativa del ModelJoin como operador de consulta que admite la ejecución tanto en CPU como en GPU. Los resultados de nuestra evaluación muestran que la integración de entornos de ejecución de aprendizaje automático a través de API ofrece un rendimiento similar al de un operador nativo, al tiempo que es genérica para admitir tipos de modelos arbitrarios. La solución basada en la representación relacional y las consultas SQL es la más portátil y funciona bien con entradas más pequeñas sin que sea necesario realizar cambios en el motor de la base de datos.»

¡Enhorabuena, Steffan! Esperamos ver más victorias e investigaciones tuyas en el futuro.