llama.cpp is een open-source inferentie-engine, geschreven in C/C++, om grote taalmodellen en visie-taalmodellen met minimale installatie uit te voeren. Het draait op uiteenlopende hardware: processors, Apple silicon en GPU's van onder meer NVIDIA en AMD via backends als CUDA, Vulkan en Metal. Kwantisatie zorgt dat modellen in beperkt geheugen passen. Met llama-server biedt het een OpenAI-compatibele API en een ingebouwde webinterface. llama.cpp is een softwarebibliotheek met bijbehorende tools die u zelf uitvoert, geen gehoste dienst.
Het project is gestart door Georgi Gerganov en wordt uitgebracht onder de MIT-licentie. In 2026 is het ggml-team erachter onderdeel geworden van Hugging Face, dat aangeeft dat llama.cpp volledig open source en door de community gedreven blijft, met behoud van de technische leiding bij het team. Omdat de inferentie volledig op uw eigen hardware plaatsvindt, hoeven prompts en documenten uw infrastructuur niet te verlaten en is geen account bij een aanbieder nodig. Voor een Europese organisatie is het daarmee een bouwsteen voor zelf gehoste AI. De licentievoorwaarden en herkomst van de modelgewichten die u kiest, blijven een afzonderlijk aandachtspunt.