Steffen Kläbe remporte le prix du meilleur article à la conférence EDBT/ICDT 2023
Résumé
- Steffen Kläbe, ingénieur de recherche chez Actian, a reçu le prix du meilleur article lors de la conférence conjointe EDBT/ICDT 2023 qui s'est tenue en Grèce.
- Ses travaux de recherche primés sur le partitionnement multi-clés par patches transposent le partitionnement des données en un problème de graphe afin d'obtenir requête robustes.
- La méthodologie de partitionnement proposée évite les réplications complexes de données tout en améliorant considérablement cohérence les tables de grandes bases de données analytiques.
- Une deuxième communication présentait une évaluation des techniques « ModelJoin » visant à Embarquer en toute fluidité des charges de travail d'inférence d'apprentissage Embarquer directement au sein des moteurs de base de données.
Nous tenons à rendre hommage à Steffen Kläbe, ingénieur de recherche chez Actian à Ilmenau (Thuringe, Allemagne). Il a participé à la conférence conjointe EDBT/ICDT 2023 en Grèce, l’une des plus prestigieuses conférences mondiales consacrées aux bases de données, où il a présenté deux articles de recherche. Pour ses travaux de recherche sur « Patched Multi-Key Partitioning for Robust requête » , il a reçu le prix du meilleur article. Dans le milieu de la recherche, ce prix constitue une véritable réussite.
Voir le résumé :
« Le partitionnement des données est essentiel au requête parallèle requête dans les systèmes de bases de données analytiques modernes. Le choix d’une clé de partitionnement adaptée à un jeu de données donné jeu de données une tâche difficile tâche cruciale pour requête . données réelles contiennent un grand nombre de tables reliées selon des schémas complexes, ce qui se traduit par un nombre considérable de clés de partitionnement candidates. Dans cet article, nous présentons l’approche du partitionnement multi-clés avec correctifs, qui permet de définir simultanément plusieurs clés de partitionnement sans réplication des données. L’idée principale consiste à transposer le problème de partitionnement des tables relationnelles en un problème de partitionnement de graphes afin d’utiliser les algorithmes de partitionnement de graphes existants pour identifier les composants de connectivité dans les données et gérer séparément les exceptions (patches) au partitionnement. Nous montrons que le partitionnement multi-clés avec patches offre la possibilité d’obtenir requête robustes, c’est-à-dire d’atteindre des performances raisonnablement bonnes pour un grand nombre de requêtes plutôt que des performances optimales pour seulement quelques-unes. »
Article complémentaire deKläbe Exploration des approches pour la ML dans les bases de données couvre le rôle croissant de l'intégration des modèles de ML dans des frameworks spécialisés pour la classification ou la prédiction.
Voir le résumé :
« Les systèmes de bases de données ne servent plus uniquement au stockage de données structurées brutes et à la réalisation d’analyses élémentaires. L’intégration de modèles d’apprentissage automatique (ML), tels que les réseaux neuronaux, à l’aide de frameworks spécialisés, ainsi que leur utilisation à des fins de classification ou de prédiction, jouent un rôle de plus en plus important. Cependant, l’utilisation de tels modèles sur des données stockées dans un système de base de données peut nécessiter de télécharger ces données et d’effectuer les calculs en externe. Dans cet article, nous évaluons des approches visant à intégrer l’étape d’inférence d’apprentissage automatique sous la forme d’ requête spécial : le ModelJoin. Nous explorons plusieurs options pour cette intégration à différents niveaux d’abstraction : la représentation relationnelle des modèles ainsi que les requêtes SQL pour l’inférence, l’utilisation de FDU, l’utilisation d’API vers des environnements d’exécution d’apprentissage automatique existants et une implémentation native du ModelJoin en tant requête prenant en charge à la fois l’exécution processeur sur GPU. Nos résultats d’évaluation montrent que l’intégration des environnements d’exécution d’apprentissage automatique via des API offre des performances similaires à celles d’un opérateur natif, tout en restant générique pour support des types de modèles support . La solution basée sur la représentation relationnelle et les requêtes SQL est la plus portable et fonctionne bien pour des entrées de petite taille, sans nécessiter de modifications du moteur de base de données. »
Félicitations, Steffan ! Nous attendons avec impatience de voir d'autres de tes victoires et de tes recherches à l'avenir.