llama.cpp est un moteur d'inférence open source, écrit en C/C++, pour exécuter de grands modèles de langage et des modèles vision-langage avec une installation minimale. Il fonctionne sur des matériels variés : processeurs, Apple silicon et GPU de NVIDIA, AMD et d'autres, via des backends comme CUDA, Vulkan et Metal. Avec llama-server, il fournit une API compatible OpenAI et une interface web intégrée. C'est une bibliothèque et des outils que vous exécutez vous-même, pas un service hébergé.
Le projet a été lancé par Georgi Gerganov et est publié sous licence MIT. En 2026, l'équipe ggml qui le porte a rejoint Hugging Face, qui indique que llama.cpp reste entièrement open source et communautaire, la direction technique restant à l'équipe. L'inférence s'effectuant sur votre propre matériel, prompts et documents n'ont pas à quitter votre infrastructure et aucun compte chez un fournisseur n'est requis. Pour une organisation européenne, c'est une brique d'IA auto-hébergée. La licence et l'origine des poids de modèle que vous choisissez restent à examiner à part.