llama.cpp ist eine quelloffene Inferenz-Engine in C/C++, mit der sich große Sprachmodelle und Vision-Sprachmodelle mit minimalem Einrichtungsaufwand ausführen lassen. Sie läuft auf vielfältiger Hardware: CPUs, Apple Silicon und GPUs unter anderem von NVIDIA und AMD über Backends wie CUDA, Vulkan und Metal. Quantisierung ermöglicht es, Modelle in begrenztem Speicher zu betreiben. Mit llama-server stellt sie eine OpenAI-kompatible API und eine integrierte Weboberfläche bereit. llama.cpp ist eine Softwarebibliothek mit zugehörigen Werkzeugen, die Sie selbst betreiben, kein gehosteter Dienst.
Das Projekt wurde von Georgi Gerganov gestartet und steht unter der MIT-Lizenz. 2026 ist das dahinterstehende ggml-Team zu Hugging Face gewechselt; Hugging Face erklärt, llama.cpp bleibe vollständig Open Source und von der Community getragen, die technische Leitung verbleibe beim Team. Da die Inferenz vollständig auf Ihrer eigenen Hardware stattfindet, müssen Prompts und Dokumente Ihre Infrastruktur nicht verlassen, und ein Konto bei einem Anbieter ist nicht nötig. Für eine europäische Organisation ist es damit ein Baustein für selbst gehostete KI. Lizenzbedingungen und Herkunft der gewählten Modellgewichte bleiben ein eigener Prüfpunkt.