Pandera est une bibliothèque Python open source dédiée à la validation de dataframes. Les data scientists et les ingénieurs de données y définissent des schémas et des contrôles, puis valident les données à l'entrée et à la sortie d'un pipeline. Pandera peut aussi déduire des schémas à partir de données propres et générer des données de test synthétiques. La bibliothèque prend en charge notamment pandas, Polars et PySpark, est publiée sous licence MIT et s'installe comme un paquet Python depuis PyPI ou conda-forge. Elle s'exécute donc dans votre propre environnement et non comme un service hébergé.
Pandera est né comme projet communautaire et est maintenu depuis 2022 par Union.ai, une société américaine. Le code source étant ouvert, vous pouvez l'examiner, le dupliquer et figer une version précise, ce que la licence MIT autorise même si la direction du projet change. Pour une organisation européenne, la dépendance tient donc surtout à l'évolution future d'un projet open source piloté par une société américaine, et non à l'hébergement des données, puisque la validation s'effectue localement dans votre code et votre infrastructure.