Apache Spark ist eine mehrsprachige Engine für Data Engineering, Data Science und maschinelles Lernen. Sie läuft auf einem einzelnen Rechner oder auf Clustern, auch auf Kubernetes, und verarbeitet Daten über dieselbe API im Batch und in Echtzeit. Sie nutzen Spark mit Python, SQL, Scala, Java oder R. Enthalten sind Bibliotheken für SQL und DataFrames, Spark Connect, Streaming, pandas on Spark und maschinelles Lernen (MLlib). Spark ist Software, die Sie selbst installieren, etwa per pip oder als Docker-Container; es ist kein gehosteter Dienst.
Spark ist ein Projekt der Apache Software Foundation, einer US-amerikanischen gemeinnützigen Organisation, und steht unter der Apache License 2.0. Da Sie Spark selbst betreiben, bestimmen Sie, wo Rechenleistung und Daten liegen: im eigenen Rechenzentrum oder bei einem europäischen Cloud-Anbieter. Kommerzielle Spark-Dienste Dritter unterliegen der Rechtsordnung der jeweiligen Anbieter, doch der offene Quellcode hält den Wechsel in den Eigenbetrieb möglich.