Google Cloud Dataflow est un service entièrement géré pour le traitement de données par lots et en flux. Les pipelines s'écrivent avec les SDK open source d'Apache Beam (Java, Python, Go) et s'exécutent sur Dataflow, qui alloue des VM, ajuste leur nombre automatiquement et les supprime ensuite. Il sert au déplacement de données, à l'alimentation d'entrepôts comme BigQuery et à l'analyse en temps réel. On construit les pipelines avec du code Beam, des modèles prêts à l'emploi ou des notebooks JupyterLab.
Dataflow est exploité par Google, société américaine, et n'existe que comme service de Google Cloud, sans auto-hébergement. Le code Beam reste portable vers Apache Flink ou Spark. Vous choisissez une région au lancement d'une tâche ; les emplacements incluent l'Europe (dont la Belgique et Francfort), les Amériques et l'Asie-Pacifique. Une région de l'UE détermine où s'exécutent les workers, mais en tant que fournisseur américain, Google reste soumis au droit américain, y compris le CLOUD Act. Les organisations européennes doivent en tenir compte.