Apache Hudi est une plateforme data lakehouse ouverte qui ajoute des fonctions de base de données aux data lakes tout en conservant les données dans des formats de fichiers ouverts. Elle prend en charge les tables, les transactions, les upserts et suppressions, les index, le clustering et la compaction, ainsi que le traitement incrémental pour le streaming et le batch. C'est une bibliothèque logicielle, non un service hébergé : vous l'exécutez dans votre propre plateforme de données.
Hudi a été développé chez Uber, publié en open source en 2017 et constitue depuis 2020 un projet de premier niveau de l'Apache Software Foundation, organisation américaine à but non lucratif. Sa licence est Apache 2.0. Hudi n'offrant pas d'hébergement propre, vous décidez où résident données et métadonnées : dans votre datacenter ou chez un fournisseur européen de stockage et de cloud. Le code source ouvert et un format de table ouvert limitent l'enfermement propriétaire, donc la dépendance à un fournisseur ou à une juridiction.