Google Cloud Dataflow ist ein vollständig verwalteter Dienst für die Batch- und Streamingverarbeitung von Daten. Pipelines werden mit den Open-Source-SDKs von Apache Beam für Java, Python und Go geschrieben und laufen auf Dataflow, das Worker-VMs zuweist, automatisch skaliert und die VMs danach wieder entfernt. Organisationen nutzen es für Datenbewegung, ETL in Warehouses wie BigQuery, Echtzeitanalysen und die Verarbeitung von Log- oder Sensordaten. Pipelines entstehen mit Beam-Code, fertigen Vorlagen oder JupyterLab-Notebooks und werden in der Google-Cloud-Konsole überwacht. Streaming bietet standardmäßig Exactly-once-Verarbeitung.
Dataflow wird von Google betrieben, einem US-amerikanischen Unternehmen, und existiert nur als Dienst innerhalb von Google Cloud, nicht zum Selbsthosting. Beam-Code lässt sich auf andere Runner wie Apache Flink oder Spark übertragen. Beim Start eines Jobs wählen Sie eine Region; verfügbar sind unter anderem Standorte in Europa (darunter Belgien und Frankfurt), Amerika und Asien-Pazifik. Eine EU-Region legt fest, wo die Worker laufen, doch als US-Anbieter unterliegt Google weiterhin US-Recht, einschließlich des CLOUD Act. Europäische Organisationen sollten das berücksichtigen.